ASR Benchmark多场景评测报告

数据研究 · 第 8 版

ASR 模型多场景
评测报告

离线转录、时间位置、发言人区分与实时出字:普通会议、真实多人会议、中英混杂、四川话朗读、官网案例与火山原生流式初测已有结果;长播客仍是初步结论。不同能力分开比较,不使用综合分。

4主线参评方案
3AISHELL-4 会议样本
3具身智能播客节目
11实际测试的播客片段
4:28:02三期播客源音频总长
已完成最终听审

结论速览

先看结论是否经过人工参考验证;“处理完整”只表示产出齐全,不代表内容准确。

会议 · 文字准确率

普通会议文字

MOSS 第 1(证据充分)

3 条 AISHELL-4 会议已有四套系统结果;三个样本等权 CER 排序为 MOSS 22.38% → 火山 23.18% → Qwen 1.7B 23.69% → Qwen 0.6B 25.36%。

播客 · 文字准确率

长播客文字

当前火山错字最少

只比较了张翼节目开头约 10 分钟;临时参照文本部分来自火山结果,正式人工复核前只作暂定判断。

播客 · 发言人区分

长播客发言人

当前 MOSS 发言人归属错误最少

只比较了一段约 10 分钟的相同内容;Qwen 本身不能区分不同发言人。

播客 · 长音频处理

带时间位置的完整转录

Qwen 1.7B + 时间对齐第 1

11 个测试片段全部产出文字和时间位置;这只说明处理完整,不是准确率排名。

中英混杂技术讲解 · 单次试运行

极客湾 MacBook Air M5 的 7 分钟上传字幕参考样本(经审计)已完成四套系统比较,当前顺序为 MOSS → 火山 → Qwen 1.7B → Qwen 0.6B。另有两段 echo-frame 技术讲解已完成 Qwen 候选参考检查;候选参考存在来源偏置,只用于缩小复核范围和补充趋势。只有一个样本,不能当作正式排名。

查看试运行证据 →
最终两项听审已裁定

用户确认:张翼片段中“就难以置信”后紧接“有点难以置信”,不适用原先 A/B 单句二选一;世博开场较早开口者为主持人 Koji,另一位是嘉宾世博。结论已写入暂定参考,不需要再听审或重新运行模型。

查看裁定记录 →
长播客还没有经过完整人工确认的准确率冠军;文字、时间戳和发言人也不能合并成一个总冠军。
01

评测对象与样本边界

先看每套系统能直接提供什么,再区分完整节目、切出的测试片段,以及三套系统都测过的同一片段。

本章用途:避免把“不支持”误记为 0 分,把外接模型生成的时间戳误认为模型自带能力,或把同一期节目切出的 11 段当成 11 个独立样本。

01.1 · 场景覆盖总览

先分清哪些已经有结论,哪些只是试运行或准备完成

只有使用相同音频和相同评分方法完成比较的场景,才会给出结论。样本已下载、已准备或模型只跑了一部分,都不会提前写成排名。

场景本项目样本当前进度现在有没有结论
普通中文会议 3 条 AISHELL-4 人工标注会议 已有结论 有:只限文字准确率,MOSS 在四套系统中当前第 1;统计证明仍只覆盖 MOSS 与 Qwen 1.7B 的原始配对比较
具身智能长播客 3 期节目,冻结 11 个约 10 分钟片段 暂定结论 有当前暂定顺序;高置信参考与最终两项听审均已冻结,仍不是独立人工金标,因此不宣布正式赢家
中英混杂技术讲解 极客湾 MacBook Air M5,7:05 单次试运行完成 MacBook 上传字幕参考样本(经审计)有试运行顺序:MOSS → 火山 → Qwen 1.7B → Qwen 0.6B;新增两段只有 Qwen 候选参考检查,参考存在来源偏置,暂不合成正式排名
中文真实会议:高重叠 / 低重叠 高重叠 10:01 · 低重叠 9:57 四套系统已评分 有文字排名:两条 10 分钟样本均为 MOSS 第 1、Qwen 1.7B 第 2;火山高重叠第 3、低重叠第 4。MOSS 与火山支持匿名发言人;Qwen 不支持。时间位置产物来源不同,不合成单一赢家
MOSI / MOSS 官网补充案例 5 个多语种影视与高情绪对话样本 15/15 本地任务 + 火山标准版 5/5 完成 四套系统均完成 5 个案例,并输出文字和时间位置。Qwen 两个型号不区分发言人;MOSS 与火山会输出匿名发言人标签。395 句高置信暂定参考已冻结,低/中置信句不进入正式准确率比较;因为没有独立人工正确稿,本组仍不比较谁更准确。查看四套原始结果
四川话朗读 WSC-Eval Easy,9:28 四套系统已评分 有单样本试运行顺序:Qwen 1.7B 5.92% → MOSS 6.69% → Qwen 0.6B 7.01% → 火山 7.20%。这是 Easy 语料机械拼接朗读,不能外推为四川话自然会话排名
实时语音输入法 60 秒中英混杂讲解 · 火山原生流式 3 次独立会话 火山原生流式初测完成 中位首次出字 550 毫秒;三次最终 MER 为 23.18%、22.85%、23.84%。仅火山完成这一原生增量协议,暂不做跨模型实时排名
实时会议字幕 60 秒多人会议 · 火山原生流式 3 次独立会话 火山原生流式初测完成 说话开始后中位首次出字 1.042 秒;三次最终 CER 均为 16.14%。MOSS 和 Qwen 尚无同协议原生增量适配,不复用离线排名
01.2 · 系统能力对照

长播客主线评测的三套系统能力并不相同

“支持”只表示系统能输出这类结果;哪套更准确,还要在相同音频和相同参照下单独比较。

能力维度 MOSS 0.9B Qwen3-ASR 1.7B 火山录音文件识别 2.0
部署形态 本地开源:自有 GPU 推理,音频不出本机;实测峰值显存约 2.4–8.4GB(详见 04.2) 本地开源:自有 GPU 推理,音频不出本机 商业云端 API:联网调用、按量计费,音频需上传厂商云端
文字转录 原生支持 原生支持 商业 API 支持
时间戳 模型直接给出每段文字的时间 需额外使用时间对齐模型 原生字/词时间戳,句段精确到毫秒
区分不同发言人 原生支持 不支持 原生支持
本轮长播客范围 1 段完整;官方说明单次最长约 90 分钟 11/11 个测试片段完成 完成两期中的 8/11 个测试片段
01.3 · 会议样本范围

普通中文会议目前只有文字准确率有明确结果

3 条 AISHELL-4 会议都有人工逐字稿;四套系统使用相同音频与评分方法完成文字比较。

3独立会议样本
1:54:26合计音频时长
4同协议参评系统
01.4 · 播客样本范围

三期完整节目、11 个测试片段,以及一段三系统共同内容必须分开看

  • 世博 · 陪伴机器人52:21 完整节目3 段
  • 张翼 · 家庭机器人47:41 完整节目3 段
  • 贾鹏 · 至简动力2:47:59 完整节目5 段
4:28:02三期源音频
1:49:5811 段测试音频
≈10 min三系统共同测试内容
34 / 522较可靠的小段 / 字符
02

普通中文会议:文字转录

在 3 条采用相同评测方法的 AISHELL-4 会议中,四套系统都已完成文字评分;结论只覆盖普通会议的文字转录。

本章结论:在已有人工标准稿的普通会议文字评测中,当前排序为 MOSS → 火山 → Qwen 1.7B → Qwen 0.6B;“证据充分”仍特指原先 MOSS 与 Qwen 1.7B 的配对差异。

02.1 · 文字转录准确率(CER)

MOSS 当前第 1,火山第 2

CER 越低,表示转录越准确;这里让三个会议样本权重相同。

22.23%MOSS 合并全部字符后的 CER
23.03%火山合并全部字符后的 CER
3 / 3配对会议样本
23.53%Qwen 1.7B 合并全部字符后的 CER
02.2 · 差异是否稳定(95% 置信区间)

原始配对比较仍支持 MOSS 优于 Qwen 1.7B

图中比较 MOSS 与 Qwen 1.7B 的文字错误率差值;整段区间都在持平线左侧。火山与 Qwen 0.6B 是后来补测,本图不把它们纳入同一个置信区间。

MOSS 与 Qwen 会议 CER 配对差置信区间 95% 置信区间从负 2.18 到负 0.37 个百分点,完全低于零。 [-2.18, -0.37] 个百分点 -3 -2 -1 0 +1 持平线
已确认的结论 · 只适用于 MOSS 与 Qwen 1.7B 的普通中文会议文字比较 · 不能据此判断时间戳、发言人或播客表现
03

长播客:按维度选择

三套系统都处理过的相同内容只有张翼节目开头约 10 分钟;下面分别看文字、时间戳、发言人和长音频处理完整度。

为什么还是暂定:这段播客还没有完整的人工逐字稿和发言人标注。目前用三套系统多次识别后相互一致的内容作为临时参照,人工确认后排名可能改变。

03.1 · 文字转录准确率(CER)

在当前约 10 分钟片段中,火山的文字错误最少

CER 越低越好。本次只使用 34 个较可靠的小段、共 522 个字符,并以多套系统反复识别后相互一致的内容作为临时参照。

暂定结果:临时参照文本有一部分来自火山识别,可能让火山的错误率显得更低;MOSS 与 Qwen 的差异目前也不足以确认。
03.2 · 时间戳边界准确率

在较可靠的片段中,火山的句子起止时间最接近参照

看每句话的开始和结束时间是否都与参照相差不超过 1 秒,比例越高越好;百分比后的秒数是开始、结束时间的平均误差,越低越好。

目前不能确认谁最好:把边界位置不够确定的句子也算进来后,三套系统的先后顺序会改变。
03.3 · 发言人区分

在当前约 10 分钟片段中,MOSS 把文字分给正确发言人的错误更少

这个指标同时检查“文字是否正确”和“是否分给正确的人”;越低越好。Qwen 不支持发言人区分,因此不参与排名。

暂定结果:发言人参照也是由机器结果整理而成,并非人工标注;只测试了一段约 10 分钟内容,重叠说话部分也没有单独人工确认。
03.4 · 长音频处理完整度

Qwen 是唯一完成全部 11 个测试片段的系统

看每套系统最终产出了多少段带时间位置的文字;完成片段越多越好。这个指标只看“有没有完整产出”,不评价文字或时间戳是否准确。

0.2984Qwen RTF
11 / 11Qwen 均有时间位置
8 / 11火山含发言人标签
1 + 1 部分MOSS 完整产出情况
这里只记录实际产出:程序没有报错,不代表输出一定完整可用。
04

场景化选型结论

这份评测最终要回答一个问题:你的场景适合商业云 API 还是本地开源小模型、具体是哪一家。不存在跨场景总冠军;不少场景两者准确率同档,真正的分野在部署方式、数据去向与运维成本。

使用方式:先看 04.1 确定路线、04.2 核对本地部署的机器与长音频边界,再在 04.3 按场景核对证据;把下表作为下一轮验证优先级,而不是采购或上线的自动决策。

04.1 · 两类方案的本质差异

先选路线,再选模型:商业云 API 与本地开源小模型不是同一种选择

准确率之外,两类方案在部署、数据去向和成本结构上根本不同;04.3 的场景建议默认你已经看过这一层。

维度 商业云 API:火山录音文件识别 / Seed-ASR 本地开源小模型:MOSS 0.9B · Qwen3-ASR 0.6B / 1.7B
部署与运行环境 云端服务,联网调用,无本地算力要求;本轮 10 分钟音频端到端约 61–69 秒返回 自有 GPU 本地推理,可完全离线或内网运行;MOSS 实测峰值显存约 2.4GB(7 分钟短音频)至 8.4GB(47.7 分钟整期),无独显的 30GB 级 APU 即可运行,详见 04.2
数据去向与合规 音频需上传到厂商云端(本轮经短期预签名 URL 传输,任务结束后对象已删除);不适合禁止数据出域的场景 音频不出本机或内网,适合隐私与合规敏感场景
成本结构 按调用量计费、零运维;具体单价以厂商页面为准,本报告未核实价格 模型免费,成本是自有 GPU 与运维;调用量越大越划算,但稳定性要自己保障
速度(本轮实测) 10 分钟音频约 1 分钟返回;另有原生流式协议,首次出字约 0.55–1.04 秒 Qwen 1.7B 处理耗时约为音频时长的 0.22–0.30 倍;MOSS 约为 1.8–2.0 倍(1 小时音频约需 2 小时)
能力边界(本轮实测) 长音频交付较完整(8/11 片段)、原生时间戳与匿名发言人、唯一完成实时流式协议 MOSS 会议文字第 1,但小时级长音频输出不完整、官方单次上限约 90 分钟;Qwen 完整交付 11/11 且最快,但不支持发言人、时间戳需外接对齐模型
怎么选:数据不能出域、需要离线或已有 GPU → 本地开源;要发言人区分、长音频省心交付、实时字幕或零运维 → 商业云 API。准确率同档的场景(普通会议文字、方言朗读),按这层差异决定即可。
04.2 · 本地开源要什么样的机器,长音频能不能跑

运行配置与长音频支持:全部为本轮实测,给部署方一个体感

两套开源模型都跑在同一台无独立显卡的 AMD 迷你主机上。左表是实测硬件与资源占用,右表是长音频的真实边界——包括一处“官方标称”与“实测”不一致的地方。

运行配置(本轮实测环境) 长音频支持(本轮实测边界)
实测机器:AMD Ryzen AI 9 HX 470(12 核 24 线程)+ Radeon 890M 集显,共享内存架构、PyTorch 可见约 30.2GB;无 NVIDIA GPU。推理在 ROCm 7.2.1 容器(Ubuntu 24.04 / PyTorch 2.9.1)内运行,权重只读挂载、全程离线 MOSS 0.9B:原生单次整段解码、无需分块,官方标称最长约 90 分钟。但实测 47.7 分钟播客整期在音频 21.4 分钟处输出结构性截断(恰好 16,384 个生成 token,原因未定论)——标称的 90 分钟目前不可直接采信,超过约 20 分钟的节目建议先按静音点自行分段
MOSS 0.9B:权重单文件 1.69GB(HuggingFace,BF16)。4.5–7 分钟音频峰值显存约 2.4GB、处理耗时约为音频时长的 0.5–0.6 倍;47.7 分钟整期峰值显存 8.4GB、耗时约为音频时长的 1.9 倍 Qwen 1.7B:任意时长自动按 30 秒在低能量点分块、逐块识别后拼接,时长本身不设限,本轮完整交付全部 11 个播客片段;但时间戳依赖外接 ForcedAligner-0.6B,已发现 3–6 秒系统性漂移,本轮时间戳评测 0% 通过
Qwen 1.7B + ForcedAligner 0.6B:处理耗时约为音频时长的 0.23–0.34 倍(约 3–4 倍实时速度),是两套开源模型里最快的;峰值显存本轮未采集到可信数字,不展示推测值。注意:0.6B 与 1.7B 在这台 APU 上共享内存,不能同时推理 火山(云服务对照):文件转写支持 5 小时以内、512MB 以内的音频,另有原生流式 API。长音频的省心交付目前仍是云服务的强项

来源:MOSS 后端诊断(硬件、截断分析) · MOSS 短音频运行记录 · MOSS 47.7 分钟整期运行总结 · Qwen 30 秒分块管线合同 · 火山系统合同(5 小时 / 512MB 限制)

体感结论:一张 30GB 级共享内存的 APU(无独显)就能跑 0.9B–1.7B 这个尺寸,短音频比实时还快;批量隔夜处理小时级节目可行,但 MOSS 长音频耗时约为音频 2 倍且有截断风险,两套开源模型都不支持流式出字——实时字幕只能选云服务。

04.3 · 分场景建议:标注“同档”的场景表示当前准确率差距未证实或很小,按 04.1 的路线差异决定即可。

实际需求 当前首选验证 直接证据 不能忽略的限制
普通中文会议文字(AISHELL-4) MOSS 0.9B 3 条 AISHELL-4 等权 CER:MOSS 22.38% → 火山 23.18% → Qwen 1.7B 23.69% → Qwen 0.6B 25.36% 与火山的差距只有 0.8 个百分点,未做配对统计检验(置信区间只覆盖 MOSS 与 Qwen 1.7B),准确率基本同档,按部署路线决定即可;不代表高重叠会议、时间戳或发言人区分也最好
真实多人会议文字(AliMeeting) MOSS 0.9B 高重叠 10 分钟:MOSS 18.95% → Qwen 1.7B 27.82% → 火山 28.86% → Qwen 0.6B 29.21%;低重叠 10 分钟:MOSS 12.55% → Qwen 1.7B 14.35% → Qwen 0.6B 15.50% → 火山 17.30% 只有两条样本,未做统计检验,建议继续验证。Qwen 时间位置来自外接 ForcedAligner;MOSS 与火山是原生时间位置。Qwen 不支持发言人区分,因此发言人只比较 MOSS 与火山
长播客文字 + 时间轴完整交付 准确率优先:火山(暂定)
完整覆盖优先:Qwen3-ASR 1.7B + 外接时间对齐
共同片段暂定 CER:火山 1.92% → MOSS 4.21% → Qwen 8.43%;Qwen 1.7B 完成全部 11 个测试片段并产出时间位置,RTF 为 0.2984 暂定参照部分来自火山结果,可能对火山有利;Qwen 文字错误率目前三者最高且不能区分发言人;处理完整不代表内容准确
长播客自动区分发言人 继续并行验证 MOSS 与火山 当前约 10 分钟片段中,发言人归属文字错误率 MOSS 5.42%、火山 10.74%;但 MOSS 只有 1 个测试片段完整产出,火山已完成两期共 8 个片段 MOSS 准确但处理小时级节目时输出不完整,火山覆盖更广但错误率接近 MOSS 两倍;临时参照部分来自火山结果,可能对火山有利
长播客时间戳准确率 暂不能确认最好系统 在边界位置较可靠的句子中,火山的起止时间误差最小 把边界位置不够确定的句子也计入后,三套系统的排序会改变
中英混杂技术讲解 MOSS 0.9B(单样本试运行) MacBook Air M5 7 分钟:MER MOSS 13.64% → 火山 21.44% → Qwen 1.7B 24.16% → Qwen 0.6B 27.46% 只有 1 条样本、每套系统只运行 1 次;参考为上传字幕经审计,不是人工逐字稿
方言朗读(四川话) Qwen3-ASR 1.7B(单样本试运行) WSC-Eval Easy 9:28:CER Qwen 1.7B 5.92% → MOSS 6.69% → Qwen 0.6B 7.01% → 火山 7.20% 四套系统差距在 1.3 个百分点以内,基本同档;Easy 语料机械拼接朗读,不能外推为四川话自然会话或其他方言排名
实时转录(流式出字) 目前只有火山可测 原生流式各 3 次独立会话:语音输入中位首次出字 550 毫秒,会议字幕 1.042 秒 MOSS 与 Qwen 尚无同协议原生增量适配,不构成跨模型实时排名
05

逐个样本查看证据

每个结论都能点回实际音频、参考、原始输出、评分明细与有效运行记录。

阅读方法:先展开一个样本,再沿证据链复核。未知或无效的资源数字不展示,也不参与速度比较。

01 · 样本场景、时长与实际音频
02 · 参考人工逐字稿,或尚待人工确认的参考稿
03 · 原始结果模型或服务未经修改的返回
04 · 评分用结果评分时实际读取的文字与时间位置
05 · 明细逐句替换、漏字、多字、时间点或说话人错误
06 · 汇总样本指标、区间与场景排名
07 · 运行可信的处理耗时、相对音频时长和设备占用

不仅给出总分,还能逐句查看分数从哪里来

会议文字已生成 6 份逐句对照表:每行包含时间、说话人、人工原文、模型结果,以及替换、漏字和多字数量;逐行相加与整场得分完全一致,无需重新运行模型。

05.1 · 参考稿的三级证据等级

不是所有“参考”都一样:每个分数都标明它站在哪一级证据上

长音频不可能全程人工逐字听写,所以不同样本的参考来源不同,能支撑的结论强度也不同。

证据等级样本参考怎么来能支撑什么
一级 · 独立人工稿AISHELL-4、AliMeeting、四川话数据集人工逐字标注,与任何参评系统无关正式结论(仍受样本量限制)
二级 · 上传字幕经审计MacBook Air M5UP 主上传的中文字幕,经下载来源审计(排除自动生成字幕);另两段 echo-frame 仍是机器候选参考,不入级试运行结论
三级 · 共识冻结 + 争议人工听审长播客、MOSI 官网案例多套系统多次识别取共识;机器无法确认的 53 个争议点单列,47 项按跨系统一致性自动裁决,最终 2 项由人耳听审裁定暂定结论,不作为正式排名

为什么播客停在第三级:三期节目共 4 小时 28 分,全程人工听写不可行,只有机器无法确认的部分进入人工复审。张翼片段 410.5 秒处一句含“ChatGPT 3.0 / 3.5”的内容至今未确认,不计入评分;人工确认前,播客参考仍是暂定稿,不是独立人工金标。

已人工核对的会议文字 · 3 条 AISHELL-4

使用同一份人工逐字稿、按同一规则评分;文字错误率越低越好

L_R003S01C0239:22.945 · 512 个参考片段 MOSS 24.90% · 替换 764 · 漏字 885 · 多字 646Qwen 26.45% · 替换 720 · 漏字 1353 · 多字 365

实际评测输入与人工答案

物理麦克风单通道冻结音频;评分答案来自 AISHELL-4 人工逐段标注。

人工逐字稿

展开后加载文字内容…

带时间与说话人的参考片段 · 评分程序使用的结构化记录,一般无需阅读技术证据文件

评分从哪一句来

先对整场文字逐字比对,再汇总到每个参考片段;逐句的替换、漏字和多字相加后,与整场文字错误率完全一致。

Qwen 逐段错误

展开后加载文字内容…

MOSS 逐段错误

展开后加载文字内容…

对齐规则与最差片段

展开后加载文字内容…

这段音频谁强谁弱,为什么

系统文字错误率替换漏字多字
MOSS 0.9B24.90%764885646
火山26.01%6331228536
Qwen 1.7B26.45%7201353365
Qwen 0.6B29.02%7961499380

四家的主要错误都是漏字,但次要错误不同:MOSS 会多写(幻觉插入),Qwen 两家听不清就整句丢弃。MOSS 总分领先靠漏字最少,代价是多字最多。

实例 1(MOSS 幻觉插入):参考「你可能诶。租出去两三辆车都可以随随便便进咱们小区是吧」;MOSS 在前面凭空插入「咱对咱在这个问题上好好地谈论谈论对」;Qwen 此段只有 1 个错误。

实例 2(Qwen 整句漏识):参考「就是还有那投诉呢宠物的。宠物大随地大小便,然后也是乱跑,也有咬人的」;Qwen 只输出「就是还有那个投诉那宠物的」,后半整句丢失;MOSS 此段仅 4 个错误。

火山与 Qwen 0.6B 为后续补测,只有整场指标,暂无逐段对照。

Qwen3-ASR 1.7B

原始响应 · 评分程序使用的结构化记录,一般无需阅读技术证据文件
评分使用的整理后输出 · 评分程序使用的结构化记录,一般无需阅读技术证据文件
文字错误统计 · 评分程序使用的结构化记录,一般无需阅读技术证据文件

本次记录:推理 512.867 秒 · RTF 0.217。未采集可信峰值资源;不单独据此发布速度赢家。

MOSS 0.9B

原始转录

展开后加载文字内容…

评分使用的整理后分段 · 评分程序使用的结构化记录,一般无需阅读技术证据文件
完整评分记录 · 评分程序使用的结构化记录,一般无需阅读技术证据文件
运行记录 · 评分程序使用的结构化记录,一般无需阅读技术证据文件

有效运行:推理 4,779.36 秒 · RTF 2.0226 · 显存实际占用峰值 7.56GB / 预留峰值 13.83GB。

火山与 Qwen 0.6B 本样本证据(后续补测,未生成逐段对照表):火山 评分明细 · 原始响应;Qwen 0.6B 评分明细 · 原始响应

M_R003S01C0138:02.210 · 641 个参考片段 MOSS 25.69% · 替换 670 · 漏字 1680 · 多字 179Qwen 28.04% · 替换 667 · 漏字 2039 · 多字 55

实际评测输入与人工答案

人工逐字稿

展开后加载文字内容…

带时间与说话人的参考片段 · 评分程序使用的结构化记录,一般无需阅读技术证据文件

评分从哪一句来

Qwen 逐段错误

展开后加载文字内容…

MOSS 逐段错误

展开后加载文字内容…

对齐规则

展开后加载文字内容…

这段音频谁强谁弱,为什么

系统文字错误率替换漏字多字
MOSS 0.9B25.69%6701680179
火山26.24%5031962119
Qwen 1.7B28.04%667203955
Qwen 0.6B29.07%793199871

Qwen 两家漏字都接近或超过 2000,甚至出现整句无输出;火山替换最少(503)但漏字同样偏高。MOSS 总分领先仍靠漏字最少。

实例 1(Qwen 整句为空):参考「呃大人就少磕一点儿还喊疼嘞这不像夏天」;Qwen 整句未输出,相邻句「冬天都比较哪儿都比较僵硬」同样为空;MOSS 有输出但有 9 个错误。

实例 2(MOSS 局部幻觉):参考「呃做一些就是呃用一些这个呃废弃的一些」;MOSS 在中间插入「多做一些手工做手工课儿对嗯」,这是 MOSS 全场最差的一个片段(22 个错误)。

火山与 Qwen 0.6B 为后续补测,只有整场指标,暂无逐段对照。

Qwen3-ASR 1.7B

原始响应 · 评分程序使用的结构化记录,一般无需阅读技术证据文件
评分使用的整理后输出 · 评分程序使用的结构化记录,一般无需阅读技术证据文件
文字错误统计 · 评分程序使用的结构化记录,一般无需阅读技术证据文件

这次计时条件不可靠,因此不展示耗时,也不用于速度比较。

MOSS 0.9B

原始转录

展开后加载文字内容…

评分使用的整理后分段 · 评分程序使用的结构化记录,一般无需阅读技术证据文件
完整评分记录 · 评分程序使用的结构化记录,一般无需阅读技术证据文件
耗时剔除原因 · 评分程序使用的结构化记录,一般无需阅读技术证据文件

准确率结果可用,但本次运行受到其他任务干扰,因此耗时和资源占用不作比较。

火山与 Qwen 0.6B 本样本证据(后续补测,未生成逐段对照表):火山 评分明细 · 原始响应;Qwen 0.6B 评分明细 · 原始响应

S_R003S01C0137:00.529 · 716 个参考片段 MOSS 16.54% · 替换 469 · 漏字 955 · 多字 278Qwen 16.58% · 替换 395 · 漏字 1208 · 多字 103

实际评测输入与人工答案

人工逐字稿

展开后加载文字内容…

带时间与说话人的参考片段 · 评分程序使用的结构化记录,一般无需阅读技术证据文件

评分从哪一句来

Qwen 逐段错误

展开后加载文字内容…

MOSS 逐段错误

展开后加载文字内容…

对齐规则

展开后加载文字内容…

这段音频谁强谁弱,为什么

系统文字错误率替换漏字多字
MOSS 0.9B16.54%469955278
Qwen 1.7B16.58%3951208103
火山17.30%3551253172
Qwen 0.6B17.99%4661278107

MOSS 与 Qwen 1.7B 总错误几乎相同(1702 对 1706),但结构相反:Qwen 多漏 253 字,MOSS 多插 175 字——「少漏字」和「多幻觉」两种风险恰好抵消,这条样本上两者打平。对下游摘要、检索场景,静默漏字更隐蔽,幻觉插入更显性,选哪种风险由用途决定。

实例(Qwen 整句为空):参考「这个你们反应一下吧,是吧,因为」;Qwen 整句未输出。

实例(MOSS 幻觉插入):参考「这个的话,嗯咱分两批」;MOSS 在前面插入「协调得得上面也得得合理的安排啊」。

火山与 Qwen 0.6B 为后续补测,只有整场指标,暂无逐段对照。

Qwen3-ASR 1.7B

原始响应 · 评分程序使用的结构化记录,一般无需阅读技术证据文件
评分使用的整理后输出 · 评分程序使用的结构化记录,一般无需阅读技术证据文件
文字错误统计 · 评分程序使用的结构化记录,一般无需阅读技术证据文件

这次计时条件不可靠,因此不展示耗时,也不用于速度比较。

MOSS 0.9B

原始转录

展开后加载文字内容…

评分使用的整理后分段 · 评分程序使用的结构化记录,一般无需阅读技术证据文件
完整评分记录 · 评分程序使用的结构化记录,一般无需阅读技术证据文件
运行记录 · 评分程序使用的结构化记录,一般无需阅读技术证据文件

有效运行:推理 4,050.10 秒 · RTF 1.8239 · 显存实际占用峰值 7.14GB / 预留峰值 10.99GB。

火山与 Qwen 0.6B 本样本证据(后续补测,未生成逐段对照表):火山 评分明细 · 原始响应;Qwen 0.6B 评分明细 · 原始响应

中文真实多人会议 · 2 条 AliMeeting 10 分钟样本

四套系统使用相同音频、相同人工逐字稿;文字 CER 越低越好

高重叠会议 R800210:01 · AliMeeting 人工逐字稿与发言人标注 文字 CER:MOSS 18.95% → Qwen 1.7B 27.82% → 火山 28.86% → Qwen 0.6B 29.21%

实际音频与人工答案

多人讨论、说话重叠较多;直接播放本轮实际送入四套系统的同一份冻结音频。

人工逐字稿

展开后加载文字内容…

排名、时间位置与发言人怎么解释

文字使用同一人工稿计算 CER。MOSS 与火山输出原生时间位置和匿名发言人标签;Qwen 使用外接 ForcedAligner,且不支持发言人区分。时间位置因产物来源不同,不合成一个赢家。

完整比较与指标分母

展开后加载文字内容…

这段音频谁强谁弱,为什么

系统文字错误率替换漏字多字
MOSS 0.9B18.95%236312108
Qwen 1.7B27.82%17774442
火山28.86%15476976
Qwen 0.6B29.21%19879419

MOSS 领先靠的不是替换(它替换反而最多),而是漏字只有 312——重叠说话段其他三家漏 744–794 字,只有 MOSS 把重叠的话捞了回来。

发言人的差距更大:按发言人归组后,MOSS 文字错误率 14.94%(DER 9.31%),火山 37.85%(DER 35.06%)——火山多切出 2 个不存在的人,还把整段话归错人。

实例:Qwen 0.6B 把「这个地方很重要」同音误成「订班很重要」。

MOSS 0.9B

转录文字

展开后加载文字内容…

带时间位置的字幕

展开后加载文字内容…

运行与评分说明

展开后加载文字内容…

Qwen3-ASR 1.7B + ForcedAligner

转录文字

展开后加载文字内容…

带时间位置的字幕

展开后加载文字内容…

运行与评分说明

展开后加载文字内容…

Qwen3-ASR 0.6B + ForcedAligner

转录文字

展开后加载文字内容…

带时间位置的字幕

展开后加载文字内容…

运行记录

展开后加载文字内容…

火山录音文件识别 2.0 标准版

本轮结果:CER 28.86%;端到端耗时 69.354 秒;输出匿名发言人 6 人。

转录文字

展开后加载文字内容…

带时间位置和匿名发言人的字幕

展开后加载文字内容…

运行与评分依据

展开后加载文字内容…

逐项评分明细

展开后加载文字内容…

火山已补齐:使用录音文件识别 2.0 标准版,音频经短期 R2 预签名 URL 读取;任务结束后 R2 对象已删除,未使用极速版。厂商侧资源占用未返回,不展示推测数字。

低重叠会议 R80089:57 · AliMeeting 人工逐字稿与发言人标注 文字 CER:MOSS 12.55% → Qwen 1.7B 14.35% → Qwen 0.6B 15.50% → 火山 17.30%

实际音频与人工答案

多人讨论、说话重叠较少;直接播放本轮实际送入四套系统的同一份冻结音频。

人工逐字稿

展开后加载文字内容…

排名、时间位置与发言人怎么解释

文字使用同一人工稿计算 CER。MOSS 与火山输出原生时间位置和匿名发言人标签;Qwen 使用外接 ForcedAligner,且不支持发言人区分。时间位置因产物来源不同,不合成一个赢家。

完整比较与指标分母

展开后加载文字内容…

这段音频谁强谁弱,为什么

系统文字错误率替换漏字多字
MOSS 0.9B12.55%13316155
Qwen 1.7B14.35%11026029
Qwen 0.6B15.50%12727430
火山17.30%10532452

火山替换最少(105),却被漏字拖到末位(324,含约 40 字的整段缺失)。发言人上 MOSS 切出 3 人与参考一致(归组错误率 9.93%,DER 5.09%);火山切出 5 人(归组错误率 30.04%,DER 23.39%)。

实例:参考「请然后一起抓抓一下他们对吧?」;MOSS 几乎全对,Qwen 1.7B 丢了「他们」。

MOSS 0.9B

转录文字

展开后加载文字内容…

带时间位置的字幕

展开后加载文字内容…

运行与评分说明

展开后加载文字内容…

Qwen3-ASR 1.7B + ForcedAligner

转录文字

展开后加载文字内容…

带时间位置的字幕

展开后加载文字内容…

运行与评分说明

展开后加载文字内容…

Qwen3-ASR 0.6B + ForcedAligner

转录文字

展开后加载文字内容…

带时间位置的字幕

展开后加载文字内容…

运行记录

展开后加载文字内容…

火山录音文件识别 2.0 标准版

本轮结果:CER 17.30%;端到端耗时 61.073 秒;输出匿名发言人 5 人。

转录文字

展开后加载文字内容…

带时间位置和匿名发言人的字幕

展开后加载文字内容…

运行与评分依据

展开后加载文字内容…

逐项评分明细

展开后加载文字内容…

火山已补齐:使用录音文件识别 2.0 标准版,音频经短期 R2 预签名 URL 读取;任务结束后 R2 对象已删除,未使用极速版。厂商侧资源占用未返回,不展示推测数字。

长播客共同测试片段 · 张翼节目开头

09:55.410 · 参考稿尚待人工确认 · 仅作为初步结果

家庭机器人:0–595.41s34 个初步确认片段 · 522 个字符进入文字评分 火山 1.92%MOSS 4.21%Qwen 8.43%

共同测试音频与参考答案

三套方案识别的是同一段内容,但音频文件的编码并不完全相同。

逐段参考文字 · 评分程序使用的结构化记录,一般无需阅读技术证据文件
尚待人工确认的说话人标注 · 评分程序使用的结构化记录,一般无需阅读技术证据文件

评分明细与待人工确认片段

文字评分明细 · 评分程序使用的结构化记录,一般无需阅读技术证据文件
时间戳评分 · 评分程序使用的结构化记录,一般无需阅读技术证据文件
时间戳争议句 · 评分程序使用的结构化记录,一般无需阅读技术证据文件
发言人评分 · 评分程序使用的结构化记录,一般无需阅读技术证据文件
发言人争议试听队列 · 评分程序使用的结构化记录,一般无需阅读技术证据文件

这段音频谁强谁弱,为什么

系统文字错误率替换漏字多字
火山1.92%325
MOSS 0.9B4.21%1264
Qwen 1.7B8.43%15254

Qwen 的错误约 57% 是漏字——丢虚词和短成分(「方便讲吗」识别成「方便讲」、「对吧」识别成「对」),外加专名和数字写法错误;火山的 10 个错误里 5 个是把口语重复多写了出来,实体(100、F2)基本全对。

实例:参考「谢谢,你好,Koji。」→ 火山「高迪」、MOSS「好 Cody」、Qwen「高丽」且与邻句粘连;参考「大概 100 人左右」→ 火山全对,MOSS 与 Qwen 都写成「一百」。

时间戳:只计边界可靠的句子时 Qwen 通过 91.57%;但计入全部计分段后,外接对齐器存在 3–6 秒的系统性偏移,0% 通过(平均起点误差 4.78 秒)——这就是 03.2 节“排序会改变”的具体原因。

发言人:MOSS 的 5.42% 错误全部是漏检、没有归属混淆;火山文字本身只错 1.11%,但有 6 个整句被归错人(如连续三个主持人提问全被标成嘉宾),归属错误率 10.74%。

诚实提醒:参考部分来自火山结果,火山的 1.92% 偏乐观;泄漏更少的 MOSS–Qwen 对比(4.21% 对 8.43%)95% 区间为 [-5.4, +0.3] 个百分点、跨过零,差异同样尚未确认。

Qwen · 直接处理这段 595.41 秒音频

原始响应 · 评分程序使用的结构化记录,一般无需阅读技术证据文件
评分使用的整理后输出 · 评分程序使用的结构化记录,一般无需阅读技术证据文件
运行与 11 窗索引 · 评分程序使用的结构化记录,一般无需阅读技术证据文件

有效记录:推理 169.151 秒 · 总耗时 169.30 秒 · RTF 0.2841 · 分成 22 段处理。未采集峰值资源。

MOSS / 火山 · 从整期结果中截取节目开头

MOSS 实际整期输入

火山历史整期输入

MOSS 原始转录

展开后加载文字内容…

MOSS 规范化输出 · 评分程序使用的结构化记录,一般无需阅读技术证据文件
火山原始响应 · 评分程序使用的结构化记录,一般无需阅读技术证据文件
火山规范化输出 · 评分程序使用的结构化记录,一般无需阅读技术证据文件

MOSS 未完整处理的本次记录:整期推理 5,576.416 秒 · RTF 1.9488 · 显存实际占用峰值 8.36GB / 预留峰值 13.53GB;只覆盖 44.90%,不能算完整成功。火山没有可比较推理耗时,故不展示数字。

为什么这里只算初步结果:三套方案识别的是同一段内容,但所用音频文件的编码并不完全相同;而且部分参考文字来自火山结果,可能对火山更有利。因此这里不作为正式排名。

11 个实际测试的播客片段

每段实际音频及其文件校验码,都记录在已固定的运行清单中

参评方案覆盖原始结果在哪里有效耗时 / 资源如何解释
Qwen3-ASR 1.7B + 外接时间对齐 11 / 11 个片段 11 个音频、模型原始结果和评分用结果清单 总音频 6,597.734 秒;推理 1,968.846 秒;处理时长为音频时长的 29.84% 11 个片段均完整产出;这不是准确率排名
火山录音文件识别 8 / 11 个片段有结果 历史输入、模型原始结果和评分用结果清单 未形成可比较推理耗时,不展示 这是此前商业服务留下的结果;参考文字可能偏向火山,音频编码也并非完全相同
MOSS 0.9B 1 个片段完整,另有 1 次整期中途截断 原始结果与中途截断说明 未完整运行 5,576.416 秒;处理时长为音频时长的 194.88%;仅描述中途截断结果 程序显示完成,但实际只处理了部分音频,不能算整期成功

中英混杂技术讲解 · MacBook Air M5

7:05 · 1 条单人技术视频 pilot · 四套系统使用同一音频与参考稿

极客湾 MacBook Air M5中文讲解夹杂英文型号与测试术语 · 内部评测样本MER:MOSS 13.64% → 火山 21.44% → Qwen 1.7B 24.16% → Qwen 0.6B 27.46%

实际音频与参考答案

播放本轮实际送入四套系统的冻结音频。参考来自原始上传/人工中文字幕,共 161 句;模型推理时没有使用参考稿或术语表。

参考文字

展开后加载文字内容…

逐句参考字幕

展开后加载文字内容…

28 项冻结术语表

展开后加载文字内容…

分数从哪里来

主指标 MER 把连续英文或数字串视为一个词、中文按字计算;CER 与 28 项严格术语召回作为补充。每套系统都可展开查看转录、字幕、逐项错误和运行记录。

四系统比较、指标定义与限制

展开后加载文字内容…

这段音频谁强谁弱,为什么

系统MER替换漏字多字术语命中(28 项)
MOSS 0.9B13.64%462121816
火山21.44%767529713
Qwen 1.7B24.16%1192136513
Qwen 0.6B27.46%1531940211

多字普遍偏高是评分把数字和英文串按词计算所致;真正拉开差距的是替换——主要差在英文术语保真。28 项冻结术语里 MOSS 命中 16 项,其中 Cinebench、Xcode Benchmark、Panther Lake 三项为独有命中。

实例:Qwen 1.7B 把 Cinebench 听成「三零奔驰」、Panther Lake 听成「PensLake」;火山听成「cindy 奔驰」;MOSS 三项全部原样写对。

四家全错的还有 12 项(M2、M3、Cyberpunk 2077、Elden Ring 等),说明这条样本对所有系统都仍有难度。

MOSS 0.9B

转录文字

展开后加载文字内容…

带时间位置的字幕

展开后加载文字内容…

运行与评分依据

展开后加载文字内容…

逐项评分明细

展开后加载文字内容…

火山录音文件识别 2.0 标准版

转录文字

展开后加载文字内容…

带时间位置的字幕

展开后加载文字内容…

运行与评分依据

展开后加载文字内容…

逐项评分明细

展开后加载文字内容…

Qwen3-ASR 1.7B + ForcedAligner

转录文字

展开后加载文字内容…

带时间位置的字幕

展开后加载文字内容…

运行与评分依据

展开后加载文字内容…

逐项评分明细

展开后加载文字内容…

Qwen3-ASR 0.6B + ForcedAligner

转录文字

展开后加载文字内容…

带时间位置的字幕

展开后加载文字内容…

运行与评分依据

展开后加载文字内容…

逐项评分明细

展开后加载文字内容…

结论边界:只有一个视频、每套系统只运行一次。这里是当前 pilot 顺序,不是正式中英混杂模型排名,也不用于时间位置或发言人比较。

Echo-frame 技术讲解补充样本两段各 4:30 · Qwen 候选参考 · 待人工抽听确认两段存在 Qwen 参考来源偏置只用于缩小复核范围

人工智能第一性原理

参考稿由 Qwen 1.7B 输出加术语修正生成,并复制了 Cloudflare Whisper baseline 作额外核验;它还不是外部人工逐字听审稿。

自动校准评分与待复核项

展开后加载文字内容…

Generative AI's Act Two

参考稿同样由 Qwen 1.7B 输出加术语修正生成,可用于复核排队;它还不是外部人工逐字听审稿。

自动校准评分与待复核项

展开后加载文字内容…

为什么不合并排名:MacBook 使用上传/人工参考,新增两段使用 Qwen 候选参考,且参考与 Qwen 1.7B 高度相似。若后续人工抽听修订参考,只重跑评分脚本,不重跑 ASR。

四川话朗读 · WSC-Eval Easy

9:28 · 独立人工参考稿 · 四套系统同协议整段 CER

WSC-Eval 四川话 Easy 拼接朗读同一批人工标注短句机械拼接为连续音频CER:Qwen 1.7B 5.92% → MOSS 6.69% → Qwen 0.6B 7.01% → 火山 7.20%

实际音频与人工答案

播放本轮实际输入。独立人工参考稿只在模型运行结束后用于评分,没有进入模型请求。

人工参考文字

展开后加载文字内容…

逐句参考字幕

展开后加载文字内容…

评分依据和不能比较的项目

四套系统只按整段 CER 比较,越低越好。拼接后输出没有可靠句子 ID,不强行切句制造逐句分数;句间时间边界是人工拼接产生,时间位置与发言人都不排名。火山标准版已补齐,和本地模型共用同一份人工参考稿。

Qwen 1.7B 评分口径示例

展开后加载文字内容…

MOSS 完整性与资源记录

展开后加载文字内容…

这段音频谁强谁弱,为什么

系统文字错误率替换漏字多字
Qwen 1.7B5.92%9102
MOSS 0.9B6.69%10302
Qwen 0.6B7.01%10802
火山7.20%100211

四家 97% 以上的错误都是替换,几乎没有人漏字——差距纯粹在同音词和方言词的替换质量上,基本同档。

实例:参考「马克吐温败坏了好的来报的人下」→ Qwen 1.7B「拜会了好德莱伯」、MOSS「马克吐文…好得来报」、火山直接把中文专名爆成英文「Market to win」。

Qwen3-ASR 1.7B

转录文字

展开后加载文字内容…

带时间位置的字幕

展开后加载文字内容…

运行与评分依据

展开后加载文字内容…

MOSS 0.9B

转录文字

展开后加载文字内容…

带时间位置的字幕

展开后加载文字内容…

运行与评分依据

展开后加载文字内容…

逐项评分明细

展开后加载文字内容…

Qwen3-ASR 0.6B

转录文字

展开后加载文字内容…

带时间位置的字幕

展开后加载文字内容…

运行与评分依据

展开后加载文字内容…

火山录音文件识别 2.0 标准版

本轮结果:CER 7.20%;端到端耗时 62.487 秒;厂商侧资源占用未知。

转录文字

展开后加载文字内容…

带时间位置的字幕

展开后加载文字内容…

运行与评分依据

展开后加载文字内容…

逐项评分明细

展开后加载文字内容…

结论边界:这只是一个 Easy 拼接朗读 pilot,不代表四川话自然会话或其他方言总排名。火山标准版已完成,供应商侧资源占用未知,不与本地推理耗时横向比较。

实时转录 · 火山原生流式初测

两条 60 秒轨道 × 每条 3 次独立会话;只报告本服务在统一实时协议下的观察

实时语音输入法:中英混杂技术讲解60 秒 · 真实 1× 回放 · 20 毫秒音频块、200 毫秒服务包、3 次独立会话最终 MER:23.18% / 22.85% / 23.84%中位首次出字 550 毫秒;最终结果收齐 61.436 秒

实际音频与参考答案

单人语音输入场景,参考只取 60 秒内开始的字幕句。这是实时协议中的 60 秒冻结输入,不把离线结果混入评分。

上传/人工字幕参考

展开后加载文字内容…

如何读这些数

“首次出字”从服务收到第一段非空文字开始计时;最终文字在音频结束后陆续收齐。三个独立会话分别评分并保留,当前只证明火山原生流式在本协议下的表现,不构成跨模型实时排名。

逐次事件、最终文字与评分 · 用于复核,普通阅读无需打开技术证据文件

火山 Seed-ASR 原生流式 2.0

本轮观察:中位首次出字 550 毫秒;最终结果收齐 61.436 秒;最终 MER:23.18% / 22.85% / 23.84%。每次都有原生 partial 事件,未测 MOSS/Qwen 的同协议原生增量服务。

第 1 次最终转录
三月苹果更新了 Mac 产品线之后啊,我发现一个有点奇怪的事情,几乎没有什么博主做这个 M五 MacBook Air 的测评啊。讲道理啊,MacBook Air 绝对是 MacBook 里面的中流砥柱。我们去年测试过主动散热的 M五 MacBook Pro 今年我们就来看看在 M五 装进了被动散热的 MacBook Air 之后,性能表现如何。为了让你直观 了解它的性能水平,我们这次直接凑齐了 M一到 M五的十三寸 MacBook Air 来看看到底哪一代 SOC 在被动散热下提升最大。那新款 MacBook Air 呢,除了处理器以外啊,一切都是熟悉的配方,这次甚至连新配色都没有,所以外观没啥能聊的,直接来看性能表现吧。先来看 CPU 性能,这代 M五和前代的 m 四用的是相同的四加六核规格的 cpu 架构换成了新一代啊,频率呢也有所提升。那在被动散热的十三寸 MacBook Air 里,历代 Sandy Bridge 的多核成绩都有百分之十到二十的提升,单核提升幅度呢在百分之十五左右。多核成绩比主动散热的 MacBook Pro M五低一点。那历代里呢, cpu 提升幅度最大的还得是 m四。
第 2 次最终转录
三月苹果更新了 Mac 产品线之后啊,我发现一件有点奇怪的事情,几乎没有什么博主做这个 M五 MacBook Air 的测评啊。讲道理啊,MacBook Air 绝对是 MacBook 里面的中流砥柱。我们去年测试过主动散热的 M五 MacBook Pro 今年我们就来看看在 M五 装进了被动散热的 MacBook Air 之后,性能表现如何。为了让你直观 了解它的性能水平,我们这次直接凑齐了 M一到 M五的十三寸 MacBook Air 来看看到底哪一代 SOC 在被动散热下提升最大。那新款 MacBook Air 呢,除了处理器以外啊,一切都是熟悉的配方,这次甚至连新配色都没有,所以外观没啥能聊的,直接来看性能表现吧。先来看 CPU 性能,这代 M五和前代的 m 四用的是相同的四加六核规格的 cpu 架构换成了新一代啊,频率呢也有所提升。那在被动散热的十三寸 MacBook Air 里,历代 Sandy Bridge 的多核成绩都有百分之十到二十的提升,单核提升幅度呢在百分之十五左右。多核成绩比主动散热的 MacBook Pro M五低一点。那历代里呢, cpu 提升幅度最大的还得是 m四。
第 3 次最终转录
三月苹果更新了 Mac 产品线之后啊,我发现一个有点奇怪的事情,几乎没有什么博主做这个 M五 MacBook Air 的测评啊。讲道理啊,MacBook Air 绝对是 MacBook 里面的中流砥柱。我们去年测试过主动散热的 M五 MacBook Pro 今年我们就来看看在 M五 装进了被动散热的 MacBook Air 之后,性能表现如何。为了让你直观 了解它的性能水平,我们这次直接凑齐了 M一到 M五的十三寸 MacBook Air 来看看到底哪一代 SOC 在被动散热下提升最大。那新款 MacBook Air 呢,除了处理器以外啊,一切都是熟悉的配方,这次甚至连新配色都没有,所以外观没啥能聊的,直接来看性能表现吧。先来看 CPU 性能,这代 M五和前代的 m 四用的是相同的四加六核规格的 cpu 架构换成了新一代啊,频率呢也有所提升。那在被动散热的十三寸 MacBook Air 里,历代森林奔驰的多核成绩都有百分之十到二十的提升,单核提升幅度呢在百分之十五左右。多核成绩比主动散热的 MacBook Pro M五低一点。那历代里呢, cpu 提升幅度最大的还得是 m四。

结论边界:这不是“谁实时最好”的排名。只有火山完成了这一原生增量协议;MOSS 不在本轮实时适配范围,Qwen 当前服务也不是原生增量输出。

实时会议字幕:多人会议片段60 秒 · 真实 1× 回放 · 20 毫秒音频块、200 毫秒服务包、3 次独立会话最终 CER:三次均为 16.14%说话开始后中位首次出字 1.042 秒;最终结果收齐 60.172 秒

实际音频与参考答案

多人会议片段,只取完整落在前 60 秒内的人工标注语段。这是实时协议中的 60 秒冻结输入,不把离线结果混入评分。

人工会议参考文字

展开后加载文字内容…

如何读这些数

“首次出字”从服务收到第一段非空文字开始计时;最终文字在音频结束后陆续收齐。三个独立会话分别评分并保留,当前只证明火山原生流式在本协议下的表现,不构成跨模型实时排名。

逐次事件、最终文字与评分 · 用于复核,普通阅读无需打开技术证据文件

火山 Seed-ASR 原生流式 2.0

本轮观察:说话开始后中位首次出字 1.042 秒;最终结果收齐 60.172 秒;最终 CER:三次均为 16.14%。每次都有原生 partial 事件,未测 MOSS/Qwen 的同协议原生增量服务。

第 1 次最终转录
嗯。嗯,先不管这些人在哪边多一点,反正这种人的话,就在人流量比较多的地方的话,这种人,嗯,有可能不光是在单车这方面造成破坏,也有可能在其他方面造成破坏,我们可以联合其他部门或者,嗯,对对对。这种东西,我们应该嗯查查一下他们到底是哪个地方的,然后严惩一下他们,不然的话,嗯 这边治安这方面应该也不会太好。是的,也会说说说句不好听的,也会影响到我们当地的治治安。然然后是呃下面这些现状倒是都可以了,然后是现在我们分析一下产生这些现状的原因吧,然后是到底是怎么样弄成我们现在我们市里的共享单车出现了这么多的这么多的问题。嗯,那我这边讲一下那个乱停放问题吧。
第 2 次最终转录
嗯。嗯,先不管这些人在哪边多一点,反正这种人的话,就在人流量比较多的地方的话,这种人,嗯,有可能不光是在单车这方面造成破坏,也有可能在其他方面造成破坏,我们可以联合其他部门或者,嗯,对对对。这种东西我们应该嗯查查一下他们到底是哪个地方的,然后严惩一下他们,不然的话嗯 这边治安这方面应该也不会太好。是的,也会说说说句不好听的,也会影响到我们当地的治治安。然然后是呃下面这些现状倒是都可以了,然后是现在我们分析一下产生这些现状的原因吧,然后是到底是怎么样弄成我们现在我们市里的共享单车出现了这么多的这么多的问题。嗯,那我这边讲一下那个乱停放问题吧。
第 3 次最终转录
嗯。嗯,先不管这些人在哪边多一点,反正这种人的话,就在人流量比较多的地方的话,这种人,嗯,有可能不光是在单车这方面造成破坏,也有可能在其他方面造成破坏,我们可以联合其他部门或者,嗯,对对对。这种东西,我们应该嗯查查一下他们到底是哪个地方的,然后严惩一下他们,不然的话,嗯 这边治安这方面应该也不会太好。是的,也会说说说句不好听的,也会影响到我们当地的治治安。然然后是呃下面这些现状倒是都可以了,然后是现在我们分析一下产生这些现状的原因吧,然后是到底是怎么样弄成我们现在我们市里的共享单车出现了这么多的这么多的问题。嗯,那我这边讲一下那个乱停放问题吧。

结论边界:这不是“谁实时最好”的排名。只有火山完成了这一原生增量协议;MOSS 不在本轮实时适配范围,Qwen 当前服务也不是原生增量输出。

MOSI 官网补充案例 · 5 个样本 × 4 套系统

可直接播放原始音频;每套模型的文字、字幕和运行记录默认折叠,展开后可滚动查看

名场面:华强买瓜四套系统均已完成 · 无独立人工正确稿 只比较完整产出

原始测试音频

Qwen3-ASR 0.6B

原始转录

展开后加载文字内容…

带时间位置的字幕

展开后加载文字内容…

运行记录

展开后加载文字内容…

Qwen3-ASR 1.7B

原始转录

展开后加载文字内容…

带时间位置的字幕

展开后加载文字内容…

运行记录

展开后加载文字内容…

MOSS 0.9B

原始转录

展开后加载文字内容…

带时间位置的字幕

展开后加载文字内容…

运行记录

展开后加载文字内容…

火山录音文件识别 2.0 标准版

原始转录

展开后加载文字内容…

带时间位置的字幕

展开后加载文字内容…

运行记录

展开后加载文字内容…

结论边界:这里没有独立人工正确稿,因此不能计算准确率或宣布赢家。

BanG Dream! It's MyGO!!!!!四套系统均已完成 · 无独立人工正确稿 只比较完整产出

原始测试音频

Qwen3-ASR 0.6B

原始转录

展开后加载文字内容…

带时间位置的字幕

展开后加载文字内容…

运行记录

展开后加载文字内容…

Qwen3-ASR 1.7B

原始转录

展开后加载文字内容…

带时间位置的字幕

展开后加载文字内容…

运行记录

展开后加载文字内容…

MOSS 0.9B

原始转录

展开后加载文字内容…

带时间位置的字幕

展开后加载文字内容…

运行记录

展开后加载文字内容…

火山录音文件识别 2.0 标准版

原始转录

展开后加载文字内容…

带时间位置的字幕

展开后加载文字内容…

运行记录

展开后加载文字内容…

结论边界:这里没有独立人工正确稿,因此不能计算准确率或宣布赢家。

小时代:多人争吵四套系统均已完成 · 无独立人工正确稿 只比较完整产出

原始测试音频

Qwen3-ASR 0.6B

原始转录

展开后加载文字内容…

带时间位置的字幕

展开后加载文字内容…

运行记录

展开后加载文字内容…

Qwen3-ASR 1.7B

原始转录

展开后加载文字内容…

带时间位置的字幕

展开后加载文字内容…

运行记录

展开后加载文字内容…

MOSS 0.9B

原始转录

展开后加载文字内容…

带时间位置的字幕

展开后加载文字内容…

运行记录

展开后加载文字内容…

火山录音文件识别 2.0 标准版

原始转录

展开后加载文字内容…

带时间位置的字幕

展开后加载文字内容…

运行记录

展开后加载文字内容…

结论边界:这里没有独立人工正确稿,因此不能计算准确率或宣布赢家。

名场面:二仙桥四套系统均已完成 · 无独立人工正确稿 只比较完整产出

原始测试音频

Qwen3-ASR 0.6B

原始转录

展开后加载文字内容…

带时间位置的字幕

展开后加载文字内容…

运行记录

展开后加载文字内容…

Qwen3-ASR 1.7B

原始转录

展开后加载文字内容…

带时间位置的字幕

展开后加载文字内容…

运行记录

展开后加载文字内容…

MOSS 0.9B

原始转录

展开后加载文字内容…

带时间位置的字幕

展开后加载文字内容…

运行记录

展开后加载文字内容…

火山录音文件识别 2.0 标准版

原始转录

展开后加载文字内容…

带时间位置的字幕

展开后加载文字内容…

运行记录

展开后加载文字内容…

结论边界:这里没有独立人工正确稿,因此不能计算准确率或宣布赢家。

疯狂动物城:树懒闪电四套系统均已完成 · 无独立人工正确稿 只比较完整产出

原始测试音频

Qwen3-ASR 0.6B

原始转录

展开后加载文字内容…

带时间位置的字幕

展开后加载文字内容…

运行记录

展开后加载文字内容…

Qwen3-ASR 1.7B

原始转录

展开后加载文字内容…

带时间位置的字幕

展开后加载文字内容…

运行记录

展开后加载文字内容…

MOSS 0.9B

原始转录

展开后加载文字内容…

带时间位置的字幕

展开后加载文字内容…

运行记录

展开后加载文字内容…

火山录音文件识别 2.0 标准版

原始转录

展开后加载文字内容…

带时间位置的字幕

展开后加载文字内容…

运行记录

展开后加载文字内容…

结论边界:这里没有独立人工正确稿,因此不能计算准确率或宣布赢家。

06

证据边界与下一步

结论等级由参考独立性、比较范围、支持能力和稳定性共同决定。

01

普通会议文字结论仅来自 3 条 AISHELL-4;四套系统已评分,统计证明仍只覆盖 MOSS 与 Qwen 1.7B 的原始配对。

02

11 个窗口来自 3 期节目,不是 11 个独立样本;三套方案共同参与准确率比较的只有张翼节目开头约 10 分钟。

03

多轮校验已裁定 47/53 个争议点,并冻结高置信暂定参考;用户已完成最终两项听审。它们只修正长播客局部时间位置与发言人对应,不把暂定参考升级为独立人工正确稿。

04

Qwen 的时间点由额外的对齐模型生成;Qwen 不能区分说话人,因此不参加该项排名。

05

火山标准版已完成公开 MOSI、AISHELL-4、AliMeeting、四川话与两条中英技术样本;R2 对象已清理,未使用极速版。

06

文字、时间戳、发言人与完整性回答不同问题,项目不设置综合分

复用已裁定参考,并继续补齐可比系统

最终两项听审已写入暂定参考;后续只用已经保存的模型结果重新评分,不重新跑模型。下一步是补齐更多独立人工正确稿和实时同协议适配,才允许发布更强的跨模型排序。

查看最终听审裁定 →

证据入口