ASR Benchmark多场景评测报告

数据研究 · 第 8 版

ASR 模型多场景
评测报告

离线转录、时间位置、发言人区分与实时出字:普通会议、真实多人会议、中英混杂、四川话朗读、官网案例与火山原生流式初测已有结果;长播客仍是初步结论。不同能力分开比较,不使用综合分。

4主线参评方案
3AISHELL-4 会议样本
3具身智能播客节目
11实际测试的播客片段
4:28:02三期播客源音频总长
已完成最终听审

结论速览

先看结论是否经过人工参考验证;“处理完整”只表示产出齐全,不代表内容准确。

会议 · 文字准确率

普通会议文字

MOSS 第 1(证据充分)

3 条 AISHELL-4 会议已有四套系统结果;三个样本等权 CER 排序为 MOSS 22.38% → 火山 23.18% → Qwen 1.7B 23.69% → Qwen 0.6B 25.36%。

播客 · 文字准确率

长播客文字

当前火山错字最少

只比较了张翼节目开头约 10 分钟;临时参照文本部分来自火山结果,正式人工复核前只作暂定判断。

播客 · 发言人区分

长播客发言人

当前 MOSS 发言人归属错误最少

只比较了一段约 10 分钟的相同内容;Qwen 本身不能区分不同发言人。

播客 · 长音频处理

带时间位置的完整转录

Qwen 1.7B + 时间对齐第 1

11 个测试片段全部产出文字和时间位置;这只说明处理完整,不是准确率排名。

中英混杂技术讲解 · 单次试运行

极客湾 MacBook Air M5 的 7 分钟上传字幕参考样本(经审计)已完成四套系统比较,当前顺序为 MOSS → 火山 → Qwen 1.7B → Qwen 0.6B。另有两段 echo-frame 技术讲解已完成 Qwen 候选参考检查;候选参考存在来源偏置,只用于缩小复核范围和补充趋势。只有一个样本,不能当作正式排名。

查看试运行证据 →
最终两项听审已裁定

用户确认:张翼片段中“就难以置信”后紧接“有点难以置信”,不适用原先 A/B 单句二选一;世博开场较早开口者为主持人 Koji,另一位是嘉宾世博。结论已写入暂定参考,不需要再听审或重新运行模型。

查看裁定记录 →
长播客还没有经过完整人工确认的准确率冠军;文字、时间戳和发言人也不能合并成一个总冠军。
01

评测对象与样本边界

先看每套系统能直接提供什么,再区分完整节目、切出的测试片段,以及三套系统都测过的同一片段。

本章用途:避免把“不支持”误记为 0 分,把外接模型生成的时间戳误认为模型自带能力,或把同一期节目切出的 11 段当成 11 个独立样本。

01.1 · 场景覆盖总览

先分清哪些已经有结论,哪些只是试运行或准备完成

只有使用相同音频和相同评分方法完成比较的场景,才会给出结论。样本已下载、已准备或模型只跑了一部分,都不会提前写成排名。

场景本项目样本当前进度现在有没有结论
普通中文会议 3 条 AISHELL-4 人工标注会议 已有结论 有:只限文字准确率,MOSS 在四套系统中当前第 1;统计证明仍只覆盖 MOSS 与 Qwen 1.7B 的原始配对比较
具身智能长播客 3 期节目,冻结 11 个约 10 分钟片段 暂定结论 有当前暂定顺序;高置信参考与最终两项听审均已冻结,仍不是独立人工金标,因此不宣布正式赢家
中英混杂技术讲解 极客湾 MacBook Air M5,7:05 单次试运行完成 MacBook 上传字幕参考样本(经审计)有试运行顺序:MOSS → 火山 → Qwen 1.7B → Qwen 0.6B;新增两段只有 Qwen 候选参考检查,参考存在来源偏置,暂不合成正式排名
中文真实会议:高重叠 / 低重叠 高重叠 10:01 · 低重叠 9:57 四套系统已评分 有文字排名:两条 10 分钟样本均为 MOSS 第 1、Qwen 1.7B 第 2;火山高重叠第 3、低重叠第 4。MOSS 与火山支持匿名发言人;Qwen 不支持。时间位置产物来源不同,不合成单一赢家
MOSI / MOSS 官网补充案例 5 个多语种影视与高情绪对话样本 15/15 本地任务 + 火山标准版 5/5 完成 四套系统均完成 5 个案例,并输出文字和时间位置。Qwen 两个型号不区分发言人;MOSS 与火山会输出匿名发言人标签。395 句高置信暂定参考已冻结,低/中置信句不进入正式准确率比较;因为没有独立人工正确稿,本组仍不比较谁更准确。查看四套原始结果
四川话朗读 WSC-Eval Easy,9:28 四套系统已评分 有单样本试运行顺序:Qwen 1.7B 5.92% → MOSS 6.69% → Qwen 0.6B 7.01% → 火山 7.20%。这是 Easy 语料机械拼接朗读,不能外推为四川话自然会话排名
实时语音输入法 60 秒中英混杂讲解 · 火山原生流式 3 次独立会话 火山原生流式初测完成 中位首次出字 550 毫秒;三次最终 MER 为 23.18%、22.85%、23.84%。仅火山完成这一原生增量协议,暂不做跨模型实时排名
实时会议字幕 60 秒多人会议 · 火山原生流式 3 次独立会话 火山原生流式初测完成 说话开始后中位首次出字 1.042 秒;三次最终 CER 均为 16.14%。MOSS 和 Qwen 尚无同协议原生增量适配,不复用离线排名
01.2 · 系统能力对照

长播客主线评测的三套系统能力并不相同

“支持”只表示系统能输出这类结果;哪套更准确,还要在相同音频和相同参照下单独比较。

能力维度 MOSS 0.9B Qwen3-ASR 1.7B 火山录音文件识别 2.0
文字转录 原生支持 原生支持 商业 API 支持
时间戳 模型直接给出每段文字的时间 需额外使用时间对齐模型 原生字/词时间戳,句段精确到毫秒
区分不同发言人 原生支持 不支持 原生支持
本轮长播客范围 1 段完整;官方说明单次最长约 90 分钟 11/11 个测试片段完成 完成两期中的 8/11 个测试片段
01.3 · 会议样本范围

普通中文会议目前只有文字准确率有明确结果

3 条 AISHELL-4 会议都有人工逐字稿;四套系统使用相同音频与评分方法完成文字比较。

3独立会议样本
1:54:26合计音频时长
4同协议参评系统
01.4 · 播客样本范围

三期完整节目、11 个测试片段,以及一段三系统共同内容必须分开看

  • 世博 · 陪伴机器人52:21 完整节目3 段
  • 张翼 · 家庭机器人47:41 完整节目3 段
  • 贾鹏 · 至简动力2:47:59 完整节目5 段
4:28:02三期源音频
1:49:5811 段测试音频
≈10 min三系统共同测试内容
34 / 522较可靠的小段 / 字符
02

普通中文会议:文字转录

在 3 条采用相同评测方法的 AISHELL-4 会议中,四套系统都已完成文字评分;结论只覆盖普通会议的文字转录。

本章结论:在已有人工标准稿的普通会议文字评测中,当前排序为 MOSS → 火山 → Qwen 1.7B → Qwen 0.6B;“证据充分”仍特指原先 MOSS 与 Qwen 1.7B 的配对差异。

02.1 · 文字转录准确率(CER)

MOSS 当前第 1,火山第 2

CER 越低,表示转录越准确;这里让三个会议样本权重相同。

22.23%MOSS 合并全部字符后的 CER
23.03%火山合并全部字符后的 CER
3 / 3配对会议样本
23.53%Qwen 1.7B 合并全部字符后的 CER
02.2 · 差异是否稳定(95% 置信区间)

原始配对比较仍支持 MOSS 优于 Qwen 1.7B

图中比较 MOSS 与 Qwen 1.7B 的文字错误率差值;整段区间都在持平线左侧。火山与 Qwen 0.6B 是后来补测,本图不把它们纳入同一个置信区间。

MOSS 与 Qwen 会议 CER 配对差置信区间 95% 置信区间从负 2.18 到负 0.37 个百分点,完全低于零。 [-2.18, -0.37] 个百分点 -3 -2 -1 0 +1 持平线
已确认的结论 · 只适用于 MOSS 与 Qwen 1.7B 的普通中文会议文字比较 · 不能据此判断时间戳、发言人或播客表现
03

长播客:按维度选择

三套系统都处理过的相同内容只有张翼节目开头约 10 分钟;下面分别看文字、时间戳、发言人和长音频处理完整度。

为什么还是暂定:这段播客还没有完整的人工逐字稿和发言人标注。目前用三套系统多次识别后相互一致的内容作为临时参照,人工确认后排名可能改变。

03.1 · 文字转录准确率(CER)

在当前约 10 分钟片段中,火山的文字错误最少

CER 越低越好。本次只使用 34 个较可靠的小段、共 522 个字符,并以多套系统反复识别后相互一致的内容作为临时参照。

暂定结果:临时参照文本有一部分来自火山识别,可能让火山的错误率显得更低;MOSS 与 Qwen 的差异目前也不足以确认。
03.2 · 时间戳边界准确率

在较可靠的片段中,火山的句子起止时间最接近参照

看每句话的开始和结束时间是否都与参照相差不超过 1 秒,比例越高越好;百分比后的秒数是开始、结束时间的平均误差,越低越好。

目前不能确认谁最好:把边界位置不够确定的句子也算进来后,三套系统的先后顺序会改变。
03.3 · 发言人区分

在当前约 10 分钟片段中,MOSS 把文字分给正确发言人的错误更少

这个指标同时检查“文字是否正确”和“是否分给正确的人”;越低越好。Qwen 不支持发言人区分,因此不参与排名。

暂定结果:发言人参照也是由机器结果整理而成,并非人工标注;只测试了一段约 10 分钟内容,重叠说话部分也没有单独人工确认。
03.4 · 长音频处理完整度

Qwen 是唯一完成全部 11 个测试片段的系统

看每套系统最终产出了多少段带时间位置的文字;完成片段越多越好。这个指标只看“有没有完整产出”,不评价文字或时间戳是否准确。

0.2984Qwen RTF
11 / 11Qwen 均有时间位置
8 / 11火山含发言人标签
1 + 1 部分MOSS 完整产出情况
这里只记录实际产出:程序没有报错,不代表输出一定完整可用。
04

场景化选型结论

不存在一个跨场景总冠军;先确定必须交付的能力,再选择当前证据最充分的候选。

使用方式:把下表作为下一轮验证优先级,而不是采购或上线的自动决策。

实际需求 当前首选验证 直接证据 不能忽略的限制
普通中文会议文字(AISHELL-4) MOSS 0.9B 3 条 AISHELL-4 等权 CER:MOSS 22.38% → 火山 23.18% → Qwen 1.7B 23.69% → Qwen 0.6B 25.36% 与火山的差距只有 0.8 个百分点,未做配对统计检验(置信区间只覆盖 MOSS 与 Qwen 1.7B);不代表高重叠会议、时间戳或发言人区分也最好
真实多人会议文字(AliMeeting) MOSS 0.9B 高重叠 10 分钟:MOSS 18.95% → Qwen 1.7B 27.82% → 火山 28.86% → Qwen 0.6B 29.21%;低重叠 10 分钟:MOSS 12.55% → Qwen 1.7B 14.35% → Qwen 0.6B 15.50% → 火山 17.30% 只有两条样本,未做统计检验,建议继续验证。Qwen 时间位置来自外接 ForcedAligner;MOSS 与火山是原生时间位置。Qwen 不支持发言人区分,因此发言人只比较 MOSS 与火山
长播客文字 + 时间轴完整交付 准确率优先:火山(暂定)
完整覆盖优先:Qwen3-ASR 1.7B + 外接时间对齐
共同片段暂定 CER:火山 1.92% → MOSS 4.21% → Qwen 8.43%;Qwen 1.7B 完成全部 11 个测试片段并产出时间位置,RTF 为 0.2984 暂定参照部分来自火山结果,可能对火山有利;Qwen 文字错误率目前三者最高且不能区分发言人;处理完整不代表内容准确
长播客自动区分发言人 继续并行验证 MOSS 与火山 当前约 10 分钟片段中,发言人归属文字错误率 MOSS 5.42%、火山 10.74%;但 MOSS 只有 1 个测试片段完整产出,火山已完成两期共 8 个片段 MOSS 准确但处理小时级节目时输出不完整,火山覆盖更广但错误率接近 MOSS 两倍;临时参照部分来自火山结果,可能对火山有利
长播客时间戳准确率 暂不能确认最好系统 在边界位置较可靠的句子中,火山的起止时间误差最小 把边界位置不够确定的句子也计入后,三套系统的排序会改变
中英混杂技术讲解 MOSS 0.9B(单样本试运行) MacBook Air M5 7 分钟:MER MOSS 13.64% → 火山 21.44% → Qwen 1.7B 24.16% → Qwen 0.6B 27.46% 只有 1 条样本、每套系统只运行 1 次;参考为上传字幕经审计,不是人工逐字稿
方言朗读(四川话) Qwen3-ASR 1.7B(单样本试运行) WSC-Eval Easy 9:28:CER Qwen 1.7B 5.92% → MOSS 6.69% → Qwen 0.6B 7.01% → 火山 7.20% Easy 语料机械拼接朗读,不能外推为四川话自然会话或其他方言排名
实时转录(流式出字) 目前只有火山可测 原生流式各 3 次独立会话:语音输入中位首次出字 550 毫秒,会议字幕 1.042 秒 MOSS 与 Qwen 尚无同协议原生增量适配,不构成跨模型实时排名
05

逐个样本查看证据

每个结论都能点回实际音频、参考、原始输出、评分明细与有效运行记录。

阅读方法:先展开一个样本,再沿证据链复核。未知或无效的资源数字不展示,也不参与速度比较。

01 · 样本场景、时长与实际音频
02 · 参考人工逐字稿,或尚待人工确认的参考稿
03 · 原始结果模型或服务未经修改的返回
04 · 评分用结果评分时实际读取的文字与时间位置
05 · 明细逐句替换、漏字、多字、时间点或说话人错误
06 · 汇总样本指标、区间与场景排名
07 · 运行可信的处理耗时、相对音频时长和设备占用

不仅给出总分,还能逐句查看分数从哪里来

会议文字已生成 6 份逐句对照表:每行包含时间、说话人、人工原文、模型结果,以及替换、漏字和多字数量;逐行相加与整场得分完全一致,无需重新运行模型。

已人工核对的会议文字 · 3 条 AISHELL-4

使用同一份人工逐字稿、按同一规则评分;文字错误率越低越好

L_R003S01C0239:22.945 · 512 个参考片段 MOSS 24.90% · 替换 764 · 漏字 885 · 多字 646Qwen 26.45% · 替换 720 · 漏字 1353 · 多字 365

实际评测输入与人工答案

物理麦克风单通道冻结音频;评分答案来自 AISHELL-4 人工逐段标注。

人工逐字稿

展开后加载文字内容…

带时间与说话人的参考片段 · 评分程序使用的结构化记录,一般无需阅读技术证据文件

评分从哪一句来

先对整场文字逐字比对,再汇总到每个参考片段;逐句的替换、漏字和多字相加后,与整场文字错误率完全一致。

Qwen 逐段错误

展开后加载文字内容…

MOSS 逐段错误

展开后加载文字内容…

对齐规则与最差片段

展开后加载文字内容…

Qwen3-ASR 1.7B

原始响应 · 评分程序使用的结构化记录,一般无需阅读技术证据文件
评分使用的整理后输出 · 评分程序使用的结构化记录,一般无需阅读技术证据文件
文字错误统计 · 评分程序使用的结构化记录,一般无需阅读技术证据文件

本次记录:推理 512.867 秒 · RTF 0.217。未采集可信峰值资源;不单独据此发布速度赢家。

MOSS 0.9B

原始转录

展开后加载文字内容…

评分使用的整理后分段 · 评分程序使用的结构化记录,一般无需阅读技术证据文件
完整评分记录 · 评分程序使用的结构化记录,一般无需阅读技术证据文件
运行记录 · 评分程序使用的结构化记录,一般无需阅读技术证据文件

有效运行:推理 4,779.36 秒 · RTF 2.0226 · 显存实际占用峰值 7.56GB / 预留峰值 13.83GB。

火山与 Qwen 0.6B 本样本证据(后续补测,未生成逐段对照表):火山 评分明细 · 原始响应;Qwen 0.6B 评分明细 · 原始响应

M_R003S01C0138:02.210 · 641 个参考片段 MOSS 25.69% · 替换 670 · 漏字 1680 · 多字 179Qwen 28.04% · 替换 667 · 漏字 2039 · 多字 55

实际评测输入与人工答案

人工逐字稿

展开后加载文字内容…

带时间与说话人的参考片段 · 评分程序使用的结构化记录,一般无需阅读技术证据文件

评分从哪一句来

Qwen 逐段错误

展开后加载文字内容…

MOSS 逐段错误

展开后加载文字内容…

对齐规则

展开后加载文字内容…

Qwen3-ASR 1.7B

原始响应 · 评分程序使用的结构化记录,一般无需阅读技术证据文件
评分使用的整理后输出 · 评分程序使用的结构化记录,一般无需阅读技术证据文件
文字错误统计 · 评分程序使用的结构化记录,一般无需阅读技术证据文件

这次计时条件不可靠,因此不展示耗时,也不用于速度比较。

MOSS 0.9B

原始转录

展开后加载文字内容…

评分使用的整理后分段 · 评分程序使用的结构化记录,一般无需阅读技术证据文件
完整评分记录 · 评分程序使用的结构化记录,一般无需阅读技术证据文件
耗时剔除原因 · 评分程序使用的结构化记录,一般无需阅读技术证据文件

准确率结果可用,但本次运行受到其他任务干扰,因此耗时和资源占用不作比较。

火山与 Qwen 0.6B 本样本证据(后续补测,未生成逐段对照表):火山 评分明细 · 原始响应;Qwen 0.6B 评分明细 · 原始响应

S_R003S01C0137:00.529 · 716 个参考片段 MOSS 16.54% · 替换 469 · 漏字 955 · 多字 278Qwen 16.58% · 替换 395 · 漏字 1208 · 多字 103

实际评测输入与人工答案

人工逐字稿

展开后加载文字内容…

带时间与说话人的参考片段 · 评分程序使用的结构化记录,一般无需阅读技术证据文件

评分从哪一句来

Qwen 逐段错误

展开后加载文字内容…

MOSS 逐段错误

展开后加载文字内容…

对齐规则

展开后加载文字内容…

Qwen3-ASR 1.7B

原始响应 · 评分程序使用的结构化记录,一般无需阅读技术证据文件
评分使用的整理后输出 · 评分程序使用的结构化记录,一般无需阅读技术证据文件
文字错误统计 · 评分程序使用的结构化记录,一般无需阅读技术证据文件

这次计时条件不可靠,因此不展示耗时,也不用于速度比较。

MOSS 0.9B

原始转录

展开后加载文字内容…

评分使用的整理后分段 · 评分程序使用的结构化记录,一般无需阅读技术证据文件
完整评分记录 · 评分程序使用的结构化记录,一般无需阅读技术证据文件
运行记录 · 评分程序使用的结构化记录,一般无需阅读技术证据文件

有效运行:推理 4,050.10 秒 · RTF 1.8239 · 显存实际占用峰值 7.14GB / 预留峰值 10.99GB。

火山与 Qwen 0.6B 本样本证据(后续补测,未生成逐段对照表):火山 评分明细 · 原始响应;Qwen 0.6B 评分明细 · 原始响应

中文真实多人会议 · 2 条 AliMeeting 10 分钟样本

四套系统使用相同音频、相同人工逐字稿;文字 CER 越低越好

高重叠会议 R800210:01 · AliMeeting 人工逐字稿与发言人标注 文字 CER:MOSS 18.95% → Qwen 1.7B 27.82% → 火山 28.86% → Qwen 0.6B 29.21%

实际音频与人工答案

多人讨论、说话重叠较多;直接播放本轮实际送入四套系统的同一份冻结音频。

人工逐字稿

展开后加载文字内容…

排名、时间位置与发言人怎么解释

文字使用同一人工稿计算 CER。MOSS 与火山输出原生时间位置和匿名发言人标签;Qwen 使用外接 ForcedAligner,且不支持发言人区分。时间位置因产物来源不同,不合成一个赢家。

完整比较与指标分母

展开后加载文字内容…

MOSS 0.9B

转录文字

展开后加载文字内容…

带时间位置的字幕

展开后加载文字内容…

运行与评分说明

展开后加载文字内容…

Qwen3-ASR 1.7B + ForcedAligner

转录文字

展开后加载文字内容…

带时间位置的字幕

展开后加载文字内容…

运行与评分说明

展开后加载文字内容…

Qwen3-ASR 0.6B + ForcedAligner

转录文字

展开后加载文字内容…

带时间位置的字幕

展开后加载文字内容…

运行记录

展开后加载文字内容…

火山录音文件识别 2.0 标准版

本轮结果:CER 28.86%;端到端耗时 69.354 秒;输出匿名发言人 6 人。

转录文字

展开后加载文字内容…

带时间位置和匿名发言人的字幕

展开后加载文字内容…

运行与评分依据

展开后加载文字内容…

逐项评分明细

展开后加载文字内容…

火山已补齐:使用录音文件识别 2.0 标准版,音频经短期 R2 预签名 URL 读取;任务结束后 R2 对象已删除,未使用极速版。厂商侧资源占用未返回,不展示推测数字。

低重叠会议 R80089:57 · AliMeeting 人工逐字稿与发言人标注 文字 CER:MOSS 12.55% → Qwen 1.7B 14.35% → Qwen 0.6B 15.50% → 火山 17.30%

实际音频与人工答案

多人讨论、说话重叠较少;直接播放本轮实际送入四套系统的同一份冻结音频。

人工逐字稿

展开后加载文字内容…

排名、时间位置与发言人怎么解释

文字使用同一人工稿计算 CER。MOSS 与火山输出原生时间位置和匿名发言人标签;Qwen 使用外接 ForcedAligner,且不支持发言人区分。时间位置因产物来源不同,不合成一个赢家。

完整比较与指标分母

展开后加载文字内容…

MOSS 0.9B

转录文字

展开后加载文字内容…

带时间位置的字幕

展开后加载文字内容…

运行与评分说明

展开后加载文字内容…

Qwen3-ASR 1.7B + ForcedAligner

转录文字

展开后加载文字内容…

带时间位置的字幕

展开后加载文字内容…

运行与评分说明

展开后加载文字内容…

Qwen3-ASR 0.6B + ForcedAligner

转录文字

展开后加载文字内容…

带时间位置的字幕

展开后加载文字内容…

运行记录

展开后加载文字内容…

火山录音文件识别 2.0 标准版

本轮结果:CER 17.30%;端到端耗时 61.073 秒;输出匿名发言人 5 人。

转录文字

展开后加载文字内容…

带时间位置和匿名发言人的字幕

展开后加载文字内容…

运行与评分依据

展开后加载文字内容…

逐项评分明细

展开后加载文字内容…

火山已补齐:使用录音文件识别 2.0 标准版,音频经短期 R2 预签名 URL 读取;任务结束后 R2 对象已删除,未使用极速版。厂商侧资源占用未返回,不展示推测数字。

长播客共同测试片段 · 张翼节目开头

09:55.410 · 参考稿尚待人工确认 · 仅作为初步结果

家庭机器人:0–595.41s34 个初步确认片段 · 522 个字符进入文字评分 火山 1.92%MOSS 4.21%Qwen 8.43%

共同测试音频与参考答案

三套方案识别的是同一段内容,但音频文件的编码并不完全相同。

逐段参考文字 · 评分程序使用的结构化记录,一般无需阅读技术证据文件
尚待人工确认的说话人标注 · 评分程序使用的结构化记录,一般无需阅读技术证据文件

评分明细与待人工确认片段

文字评分明细 · 评分程序使用的结构化记录,一般无需阅读技术证据文件
时间戳评分 · 评分程序使用的结构化记录,一般无需阅读技术证据文件
时间戳争议句 · 评分程序使用的结构化记录,一般无需阅读技术证据文件
发言人评分 · 评分程序使用的结构化记录,一般无需阅读技术证据文件
发言人争议试听队列 · 评分程序使用的结构化记录,一般无需阅读技术证据文件

Qwen · 直接处理这段 595.41 秒音频

原始响应 · 评分程序使用的结构化记录,一般无需阅读技术证据文件
评分使用的整理后输出 · 评分程序使用的结构化记录,一般无需阅读技术证据文件
运行与 11 窗索引 · 评分程序使用的结构化记录,一般无需阅读技术证据文件

有效记录:推理 169.151 秒 · 总耗时 169.30 秒 · RTF 0.2841 · 分成 22 段处理。未采集峰值资源。

MOSS / 火山 · 从整期结果中截取节目开头

MOSS 实际整期输入

火山历史整期输入

MOSS 原始转录

展开后加载文字内容…

MOSS 规范化输出 · 评分程序使用的结构化记录,一般无需阅读技术证据文件
火山原始响应 · 评分程序使用的结构化记录,一般无需阅读技术证据文件
火山规范化输出 · 评分程序使用的结构化记录,一般无需阅读技术证据文件

MOSS 未完整处理的本次记录:整期推理 5,576.416 秒 · RTF 1.9488 · 显存实际占用峰值 8.36GB / 预留峰值 13.53GB;只覆盖 44.90%,不能算完整成功。火山没有可比较推理耗时,故不展示数字。

为什么这里只算初步结果:三套方案识别的是同一段内容,但所用音频文件的编码并不完全相同;而且部分参考文字来自火山结果,可能对火山更有利。因此这里不作为正式排名。

11 个实际测试的播客片段

每段实际音频及其文件校验码,都记录在已固定的运行清单中

参评方案覆盖原始结果在哪里有效耗时 / 资源如何解释
Qwen3-ASR 1.7B + 外接时间对齐 11 / 11 个片段 11 个音频、模型原始结果和评分用结果清单 总音频 6,597.734 秒;推理 1,968.846 秒;处理时长为音频时长的 29.84% 11 个片段均完整产出;这不是准确率排名
火山录音文件识别 8 / 11 个片段有结果 历史输入、模型原始结果和评分用结果清单 未形成可比较推理耗时,不展示 这是此前商业服务留下的结果;参考文字可能偏向火山,音频编码也并非完全相同
MOSS 0.9B 1 个片段完整,另有 1 次整期中途截断 原始结果与中途截断说明 未完整运行 5,576.416 秒;处理时长为音频时长的 194.88%;仅描述中途截断结果 程序显示完成,但实际只处理了部分音频,不能算整期成功

中英混杂技术讲解 · MacBook Air M5

7:05 · 1 条单人技术视频 pilot · 四套系统使用同一音频与参考稿

极客湾 MacBook Air M5中文讲解夹杂英文型号与测试术语 · 内部评测样本MER:MOSS 13.64% → 火山 21.44% → Qwen 1.7B 24.16% → Qwen 0.6B 27.46%

实际音频与参考答案

播放本轮实际送入四套系统的冻结音频。参考来自原始上传/人工中文字幕,共 161 句;模型推理时没有使用参考稿或术语表。

参考文字

展开后加载文字内容…

逐句参考字幕

展开后加载文字内容…

28 项冻结术语表

展开后加载文字内容…

分数从哪里来

主指标 MER 把连续英文或数字串视为一个词、中文按字计算;CER 与 28 项严格术语召回作为补充。每套系统都可展开查看转录、字幕、逐项错误和运行记录。

四系统比较、指标定义与限制

展开后加载文字内容…

MOSS 0.9B

转录文字

展开后加载文字内容…

带时间位置的字幕

展开后加载文字内容…

运行与评分依据

展开后加载文字内容…

逐项评分明细

展开后加载文字内容…

火山录音文件识别 2.0 标准版

转录文字

展开后加载文字内容…

带时间位置的字幕

展开后加载文字内容…

运行与评分依据

展开后加载文字内容…

逐项评分明细

展开后加载文字内容…

Qwen3-ASR 1.7B + ForcedAligner

转录文字

展开后加载文字内容…

带时间位置的字幕

展开后加载文字内容…

运行与评分依据

展开后加载文字内容…

逐项评分明细

展开后加载文字内容…

Qwen3-ASR 0.6B + ForcedAligner

转录文字

展开后加载文字内容…

带时间位置的字幕

展开后加载文字内容…

运行与评分依据

展开后加载文字内容…

逐项评分明细

展开后加载文字内容…

结论边界:只有一个视频、每套系统只运行一次。这里是当前 pilot 顺序,不是正式中英混杂模型排名,也不用于时间位置或发言人比较。

Echo-frame 技术讲解补充样本两段各 4:30 · Qwen 候选参考 · 待人工抽听确认两段存在 Qwen 参考来源偏置只用于缩小复核范围

人工智能第一性原理

参考稿由 Qwen 1.7B 输出加术语修正生成,并复制了 Cloudflare Whisper baseline 作额外核验;它还不是外部人工逐字听审稿。

自动校准评分与待复核项

展开后加载文字内容…

Generative AI's Act Two

参考稿同样由 Qwen 1.7B 输出加术语修正生成,可用于复核排队;它还不是外部人工逐字听审稿。

自动校准评分与待复核项

展开后加载文字内容…

为什么不合并排名:MacBook 使用上传/人工参考,新增两段使用 Qwen 候选参考,且参考与 Qwen 1.7B 高度相似。若后续人工抽听修订参考,只重跑评分脚本,不重跑 ASR。

四川话朗读 · WSC-Eval Easy

9:28 · 独立人工参考稿 · 四套系统同协议整段 CER

WSC-Eval 四川话 Easy 拼接朗读同一批人工标注短句机械拼接为连续音频CER:Qwen 1.7B 5.92% → MOSS 6.69% → Qwen 0.6B 7.01% → 火山 7.20%

实际音频与人工答案

播放本轮实际输入。独立人工参考稿只在模型运行结束后用于评分,没有进入模型请求。

人工参考文字

展开后加载文字内容…

逐句参考字幕

展开后加载文字内容…

评分依据和不能比较的项目

四套系统只按整段 CER 比较,越低越好。拼接后输出没有可靠句子 ID,不强行切句制造逐句分数;句间时间边界是人工拼接产生,时间位置与发言人都不排名。火山标准版已补齐,和本地模型共用同一份人工参考稿。

Qwen 1.7B 评分口径示例

展开后加载文字内容…

MOSS 完整性与资源记录

展开后加载文字内容…

Qwen3-ASR 1.7B

转录文字

展开后加载文字内容…

带时间位置的字幕

展开后加载文字内容…

运行与评分依据

展开后加载文字内容…

MOSS 0.9B

转录文字

展开后加载文字内容…

带时间位置的字幕

展开后加载文字内容…

运行与评分依据

展开后加载文字内容…

逐项评分明细

展开后加载文字内容…

Qwen3-ASR 0.6B

转录文字

展开后加载文字内容…

带时间位置的字幕

展开后加载文字内容…

运行与评分依据

展开后加载文字内容…

火山录音文件识别 2.0 标准版

本轮结果:CER 7.20%;端到端耗时 62.487 秒;厂商侧资源占用未知。

转录文字

展开后加载文字内容…

带时间位置的字幕

展开后加载文字内容…

运行与评分依据

展开后加载文字内容…

逐项评分明细

展开后加载文字内容…

结论边界:这只是一个 Easy 拼接朗读 pilot,不代表四川话自然会话或其他方言总排名。火山标准版已完成,供应商侧资源占用未知,不与本地推理耗时横向比较。

实时转录 · 火山原生流式初测

两条 60 秒轨道 × 每条 3 次独立会话;只报告本服务在统一实时协议下的观察

实时语音输入法:中英混杂技术讲解60 秒 · 真实 1× 回放 · 20 毫秒音频块、200 毫秒服务包、3 次独立会话最终 MER:23.18% / 22.85% / 23.84%中位首次出字 550 毫秒;最终结果收齐 61.436 秒

实际音频与参考答案

单人语音输入场景,参考只取 60 秒内开始的字幕句。这是实时协议中的 60 秒冻结输入,不把离线结果混入评分。

上传/人工字幕参考

展开后加载文字内容…

如何读这些数

“首次出字”从服务收到第一段非空文字开始计时;最终文字在音频结束后陆续收齐。三个独立会话分别评分并保留,当前只证明火山原生流式在本协议下的表现,不构成跨模型实时排名。

逐次事件、最终文字与评分 · 用于复核,普通阅读无需打开技术证据文件

火山 Seed-ASR 原生流式 2.0

本轮观察:中位首次出字 550 毫秒;最终结果收齐 61.436 秒;最终 MER:23.18% / 22.85% / 23.84%。每次都有原生 partial 事件,未测 MOSS/Qwen 的同协议原生增量服务。

第 1 次最终转录
三月苹果更新了 Mac 产品线之后啊,我发现一个有点奇怪的事情,几乎没有什么博主做这个 M五 MacBook Air 的测评啊。讲道理啊,MacBook Air 绝对是 MacBook 里面的中流砥柱。我们去年测试过主动散热的 M五 MacBook Pro 今年我们就来看看在 M五 装进了被动散热的 MacBook Air 之后,性能表现如何。为了让你直观 了解它的性能水平,我们这次直接凑齐了 M一到 M五的十三寸 MacBook Air 来看看到底哪一代 SOC 在被动散热下提升最大。那新款 MacBook Air 呢,除了处理器以外啊,一切都是熟悉的配方,这次甚至连新配色都没有,所以外观没啥能聊的,直接来看性能表现吧。先来看 CPU 性能,这代 M五和前代的 m 四用的是相同的四加六核规格的 cpu 架构换成了新一代啊,频率呢也有所提升。那在被动散热的十三寸 MacBook Air 里,历代 Sandy Bridge 的多核成绩都有百分之十到二十的提升,单核提升幅度呢在百分之十五左右。多核成绩比主动散热的 MacBook Pro M五低一点。那历代里呢, cpu 提升幅度最大的还得是 m四。
第 2 次最终转录
三月苹果更新了 Mac 产品线之后啊,我发现一件有点奇怪的事情,几乎没有什么博主做这个 M五 MacBook Air 的测评啊。讲道理啊,MacBook Air 绝对是 MacBook 里面的中流砥柱。我们去年测试过主动散热的 M五 MacBook Pro 今年我们就来看看在 M五 装进了被动散热的 MacBook Air 之后,性能表现如何。为了让你直观 了解它的性能水平,我们这次直接凑齐了 M一到 M五的十三寸 MacBook Air 来看看到底哪一代 SOC 在被动散热下提升最大。那新款 MacBook Air 呢,除了处理器以外啊,一切都是熟悉的配方,这次甚至连新配色都没有,所以外观没啥能聊的,直接来看性能表现吧。先来看 CPU 性能,这代 M五和前代的 m 四用的是相同的四加六核规格的 cpu 架构换成了新一代啊,频率呢也有所提升。那在被动散热的十三寸 MacBook Air 里,历代 Sandy Bridge 的多核成绩都有百分之十到二十的提升,单核提升幅度呢在百分之十五左右。多核成绩比主动散热的 MacBook Pro M五低一点。那历代里呢, cpu 提升幅度最大的还得是 m四。
第 3 次最终转录
三月苹果更新了 Mac 产品线之后啊,我发现一个有点奇怪的事情,几乎没有什么博主做这个 M五 MacBook Air 的测评啊。讲道理啊,MacBook Air 绝对是 MacBook 里面的中流砥柱。我们去年测试过主动散热的 M五 MacBook Pro 今年我们就来看看在 M五 装进了被动散热的 MacBook Air 之后,性能表现如何。为了让你直观 了解它的性能水平,我们这次直接凑齐了 M一到 M五的十三寸 MacBook Air 来看看到底哪一代 SOC 在被动散热下提升最大。那新款 MacBook Air 呢,除了处理器以外啊,一切都是熟悉的配方,这次甚至连新配色都没有,所以外观没啥能聊的,直接来看性能表现吧。先来看 CPU 性能,这代 M五和前代的 m 四用的是相同的四加六核规格的 cpu 架构换成了新一代啊,频率呢也有所提升。那在被动散热的十三寸 MacBook Air 里,历代森林奔驰的多核成绩都有百分之十到二十的提升,单核提升幅度呢在百分之十五左右。多核成绩比主动散热的 MacBook Pro M五低一点。那历代里呢, cpu 提升幅度最大的还得是 m四。

结论边界:这不是“谁实时最好”的排名。只有火山完成了这一原生增量协议;MOSS 不在本轮实时适配范围,Qwen 当前服务也不是原生增量输出。

实时会议字幕:多人会议片段60 秒 · 真实 1× 回放 · 20 毫秒音频块、200 毫秒服务包、3 次独立会话最终 CER:三次均为 16.14%说话开始后中位首次出字 1.042 秒;最终结果收齐 60.172 秒

实际音频与参考答案

多人会议片段,只取完整落在前 60 秒内的人工标注语段。这是实时协议中的 60 秒冻结输入,不把离线结果混入评分。

人工会议参考文字

展开后加载文字内容…

如何读这些数

“首次出字”从服务收到第一段非空文字开始计时;最终文字在音频结束后陆续收齐。三个独立会话分别评分并保留,当前只证明火山原生流式在本协议下的表现,不构成跨模型实时排名。

逐次事件、最终文字与评分 · 用于复核,普通阅读无需打开技术证据文件

火山 Seed-ASR 原生流式 2.0

本轮观察:说话开始后中位首次出字 1.042 秒;最终结果收齐 60.172 秒;最终 CER:三次均为 16.14%。每次都有原生 partial 事件,未测 MOSS/Qwen 的同协议原生增量服务。

第 1 次最终转录
嗯。嗯,先不管这些人在哪边多一点,反正这种人的话,就在人流量比较多的地方的话,这种人,嗯,有可能不光是在单车这方面造成破坏,也有可能在其他方面造成破坏,我们可以联合其他部门或者,嗯,对对对。这种东西,我们应该嗯查查一下他们到底是哪个地方的,然后严惩一下他们,不然的话,嗯 这边治安这方面应该也不会太好。是的,也会说说说句不好听的,也会影响到我们当地的治治安。然然后是呃下面这些现状倒是都可以了,然后是现在我们分析一下产生这些现状的原因吧,然后是到底是怎么样弄成我们现在我们市里的共享单车出现了这么多的这么多的问题。嗯,那我这边讲一下那个乱停放问题吧。
第 2 次最终转录
嗯。嗯,先不管这些人在哪边多一点,反正这种人的话,就在人流量比较多的地方的话,这种人,嗯,有可能不光是在单车这方面造成破坏,也有可能在其他方面造成破坏,我们可以联合其他部门或者,嗯,对对对。这种东西我们应该嗯查查一下他们到底是哪个地方的,然后严惩一下他们,不然的话嗯 这边治安这方面应该也不会太好。是的,也会说说说句不好听的,也会影响到我们当地的治治安。然然后是呃下面这些现状倒是都可以了,然后是现在我们分析一下产生这些现状的原因吧,然后是到底是怎么样弄成我们现在我们市里的共享单车出现了这么多的这么多的问题。嗯,那我这边讲一下那个乱停放问题吧。
第 3 次最终转录
嗯。嗯,先不管这些人在哪边多一点,反正这种人的话,就在人流量比较多的地方的话,这种人,嗯,有可能不光是在单车这方面造成破坏,也有可能在其他方面造成破坏,我们可以联合其他部门或者,嗯,对对对。这种东西,我们应该嗯查查一下他们到底是哪个地方的,然后严惩一下他们,不然的话,嗯 这边治安这方面应该也不会太好。是的,也会说说说句不好听的,也会影响到我们当地的治治安。然然后是呃下面这些现状倒是都可以了,然后是现在我们分析一下产生这些现状的原因吧,然后是到底是怎么样弄成我们现在我们市里的共享单车出现了这么多的这么多的问题。嗯,那我这边讲一下那个乱停放问题吧。

结论边界:这不是“谁实时最好”的排名。只有火山完成了这一原生增量协议;MOSS 不在本轮实时适配范围,Qwen 当前服务也不是原生增量输出。

MOSI 官网补充案例 · 5 个样本 × 4 套系统

可直接播放原始音频;每套模型的文字、字幕和运行记录默认折叠,展开后可滚动查看

名场面:华强买瓜四套系统均已完成 · 无独立人工正确稿 只比较完整产出

原始测试音频

Qwen3-ASR 0.6B

原始转录

展开后加载文字内容…

带时间位置的字幕

展开后加载文字内容…

运行记录

展开后加载文字内容…

Qwen3-ASR 1.7B

原始转录

展开后加载文字内容…

带时间位置的字幕

展开后加载文字内容…

运行记录

展开后加载文字内容…

MOSS 0.9B

原始转录

展开后加载文字内容…

带时间位置的字幕

展开后加载文字内容…

运行记录

展开后加载文字内容…

火山录音文件识别 2.0 标准版

原始转录

展开后加载文字内容…

带时间位置的字幕

展开后加载文字内容…

运行记录

展开后加载文字内容…

结论边界:这里没有独立人工正确稿,因此不能计算准确率或宣布赢家。

BanG Dream! It's MyGO!!!!!四套系统均已完成 · 无独立人工正确稿 只比较完整产出

原始测试音频

Qwen3-ASR 0.6B

原始转录

展开后加载文字内容…

带时间位置的字幕

展开后加载文字内容…

运行记录

展开后加载文字内容…

Qwen3-ASR 1.7B

原始转录

展开后加载文字内容…

带时间位置的字幕

展开后加载文字内容…

运行记录

展开后加载文字内容…

MOSS 0.9B

原始转录

展开后加载文字内容…

带时间位置的字幕

展开后加载文字内容…

运行记录

展开后加载文字内容…

火山录音文件识别 2.0 标准版

原始转录

展开后加载文字内容…

带时间位置的字幕

展开后加载文字内容…

运行记录

展开后加载文字内容…

结论边界:这里没有独立人工正确稿,因此不能计算准确率或宣布赢家。

小时代:多人争吵四套系统均已完成 · 无独立人工正确稿 只比较完整产出

原始测试音频

Qwen3-ASR 0.6B

原始转录

展开后加载文字内容…

带时间位置的字幕

展开后加载文字内容…

运行记录

展开后加载文字内容…

Qwen3-ASR 1.7B

原始转录

展开后加载文字内容…

带时间位置的字幕

展开后加载文字内容…

运行记录

展开后加载文字内容…

MOSS 0.9B

原始转录

展开后加载文字内容…

带时间位置的字幕

展开后加载文字内容…

运行记录

展开后加载文字内容…

火山录音文件识别 2.0 标准版

原始转录

展开后加载文字内容…

带时间位置的字幕

展开后加载文字内容…

运行记录

展开后加载文字内容…

结论边界:这里没有独立人工正确稿,因此不能计算准确率或宣布赢家。

名场面:二仙桥四套系统均已完成 · 无独立人工正确稿 只比较完整产出

原始测试音频

Qwen3-ASR 0.6B

原始转录

展开后加载文字内容…

带时间位置的字幕

展开后加载文字内容…

运行记录

展开后加载文字内容…

Qwen3-ASR 1.7B

原始转录

展开后加载文字内容…

带时间位置的字幕

展开后加载文字内容…

运行记录

展开后加载文字内容…

MOSS 0.9B

原始转录

展开后加载文字内容…

带时间位置的字幕

展开后加载文字内容…

运行记录

展开后加载文字内容…

火山录音文件识别 2.0 标准版

原始转录

展开后加载文字内容…

带时间位置的字幕

展开后加载文字内容…

运行记录

展开后加载文字内容…

结论边界:这里没有独立人工正确稿,因此不能计算准确率或宣布赢家。

疯狂动物城:树懒闪电四套系统均已完成 · 无独立人工正确稿 只比较完整产出

原始测试音频

Qwen3-ASR 0.6B

原始转录

展开后加载文字内容…

带时间位置的字幕

展开后加载文字内容…

运行记录

展开后加载文字内容…

Qwen3-ASR 1.7B

原始转录

展开后加载文字内容…

带时间位置的字幕

展开后加载文字内容…

运行记录

展开后加载文字内容…

MOSS 0.9B

原始转录

展开后加载文字内容…

带时间位置的字幕

展开后加载文字内容…

运行记录

展开后加载文字内容…

火山录音文件识别 2.0 标准版

原始转录

展开后加载文字内容…

带时间位置的字幕

展开后加载文字内容…

运行记录

展开后加载文字内容…

结论边界:这里没有独立人工正确稿,因此不能计算准确率或宣布赢家。

06

证据边界与下一步

结论等级由参考独立性、比较范围、支持能力和稳定性共同决定。

01

普通会议文字结论仅来自 3 条 AISHELL-4;四套系统已评分,统计证明仍只覆盖 MOSS 与 Qwen 1.7B 的原始配对。

02

11 个窗口来自 3 期节目,不是 11 个独立样本;三套方案共同参与准确率比较的只有张翼节目开头约 10 分钟。

03

多轮校验已裁定 47/53 个争议点,并冻结高置信暂定参考;用户已完成最终两项听审。它们只修正长播客局部时间位置与发言人对应,不把暂定参考升级为独立人工正确稿。

04

Qwen 的时间点由额外的对齐模型生成;Qwen 不能区分说话人,因此不参加该项排名。

05

火山标准版已完成公开 MOSI、AISHELL-4、AliMeeting、四川话与两条中英技术样本;R2 对象已清理,未使用极速版。

06

文字、时间戳、发言人与完整性回答不同问题,项目不设置综合分

复用已裁定参考,并继续补齐可比系统

最终两项听审已写入暂定参考;后续只用已经保存的模型结果重新评分,不重新跑模型。下一步是补齐更多独立人工正确稿和实时同协议适配,才允许发布更强的跨模型排序。

查看最终听审裁定 →

证据入口