# ASR 多场景评估结论

这份文档给同事快速判断“哪套系统更适合什么场景”。详细证据看[网页报告](../report.html)，每个样本都有音频、转录、字幕、运行记录和评分明细入口；普通读者不需要打开 JSON。

## 1. 测了什么模型？

| 系统 | 类型 | 本轮能力 |
|---|---|---|
| MOSS-Transcribe-Diarize 0.9B | 开源一体模型 | 文字、原生时间位置、匿名发言人区分 |
| Qwen3-ASR 1.7B | 开源 ASR | 文字；时间位置由 ForcedAligner 外接生成；不支持发言人区分 |
| Qwen3-ASR 0.6B | 开源 ASR | 文字；时间位置由 ForcedAligner 外接生成；不支持发言人区分 |
| 火山录音文件识别 2.0 标准版 | 商业 API | 文字、原生字/词时间位置、匿名发言人区分 |

火山本轮使用标准版，不使用极速版；R2 短期预签名 URL 只用于让服务端读取冻结音频，任务结束后对象已删除。

## 2. 用了什么样本和场景？

| 场景 | 样本 | 现在能回答什么 |
|---|---|---|
| 普通中文会议 | AISHELL-4 3 条人工标注会议 | 四系统文字 CER 排名；MOSS vs Qwen 1.7B 有配对置信区间 |
| 真实多人会议 | AliMeeting 高重叠、低重叠各约 10 分钟 | 四系统文字 CER；MOSS 与火山的时间位置、发言人观察 |
| 长播客 | 3 期具身智能播客，冻结 11 个约 10 分钟窗口 | 长音频交付完整性；一个公共窗口的文字/时间/发言人暂定顺序 |
| 中英混杂技术讲解 | 极客湾 MacBook Air M5，7:05；另有两段 echo-frame 技术讲解各 4:30 | MacBook 有人工参考稿四系统 pilot；两段 echo-frame 有 Qwen 候选参考检查 |
| 四川话朗读 | WSC-Eval Easy 9:28，官方人工文字 | 四系统整段 CER 单样本 pilot |
| MOSI 官网案例 | 5 个官网样本 | 四系统结构、完整性、耗时观察；没有独立人工正确稿，不排准确率 |
| 实时语音输入法 / 会议字幕 | 两条 60 秒 1× replay，各 3 次火山原生流式会话 | 火山原生流式延迟与最终文本观察；不做跨模型实时排名 |

## 3. 指标怎么看？

| 指标 | 白话解释 | 方向 |
|---|---|---|
| CER | 中文字符错误率，替换、漏字、多字占参考字数比例 | 越低越好 |
| MER | 中英混杂错误率，中文按字、连续英文/数字按词组 | 越低越好 |
| cpCER | 同时看文字是否正确、是否分给正确匿名发言人 | 越低越好 |
| DER / JER | 判断“谁在什么时候说话”错了多少 | 越低越好 |
| 两端 ±1 秒内 | 句子开始和结束都接近人工边界的比例 | 越高越好 |
| RTF | 处理耗时 / 音频时长 | 越低越快 |

这些指标回答不同问题，不合成综合分。

## 4. 最终结论是什么？

### 普通中文会议文字

3 条 AISHELL-4 等权 CER：**MOSS 22.38% → 火山 23.18% → Qwen 1.7B 23.69% → Qwen 0.6B 25.36%**。MOSS vs Qwen 1.7B 的配对差 95% 区间为 `[-2.18, -0.37]` 个百分点，所以“证据充分”只覆盖这个窄范围。

### 真实多人会议文字

AliMeeting 两条样本均为 MOSS 第一、Qwen 1.7B 第二：

| 样本 | 排序 |
|---|---|
| 高重叠 10:01 | MOSS 18.95% → Qwen 1.7B 27.82% → 火山 28.86% → Qwen 0.6B 29.21% |
| 低重叠 9:57 | MOSS 12.55% → Qwen 1.7B 14.35% → Qwen 0.6B 15.50% → 火山 17.30% |

发言人区分只在 MOSS 和火山之间比较；Qwen 记为 N/A。证据见[高重叠](../benchmarks/phase2/samples/zh-real-meeting/R8002_M8003_MS803-canary-10m/COMPARISON.md)和[低重叠](../benchmarks/phase2/samples/zh-real-meeting/R8008_M8014_MS807-canary-10m/COMPARISON.md)。

### 长播客

同一约 10 分钟公共片段上，文字暂定为火山 → MOSS → Qwen，发言人暂定为 MOSS → 火山，Qwen 不支持发言人。11 个窗口的完整交付是 Qwen + 外接对齐 11/11、火山 8/11、MOSS 1 个完整加 1 个部分结果。这里没有独立人工正确稿，所以不宣布正式准确率赢家。

### 中英混杂技术讲解

极客湾 MacBook Air M5 单样本 MER：**MOSS 13.64% → 火山 21.44% → Qwen 1.7B 24.16% → Qwen 0.6B 27.46%**。另两段 echo-frame 技术讲解已完成 Qwen 候选参考检查；由于参考来自 Qwen 1.7B 输出加术语修正，存在来源偏置，只用于缩小人工复核范围，不外推成正式中英混杂排名。

### 四川话朗读

WSC-Eval Easy 单样本 CER：**Qwen 1.7B 5.92% → MOSS 6.69% → Qwen 0.6B 7.01% → 火山 7.20%**。这是安静朗读和机械拼接样本，不代表自然方言会话。

### MOSI 官网案例

四套系统都完成 5 个样本，但没有独立人工正确稿；报告只展示音频、转录、字幕、运行记录和结构，不比较准确率赢家。

### 实时转录

火山原生流式已完成两条 60 秒轨道各 3 次：语音输入法中位首次出字 550 ms，最终 MER 23.18% / 22.85% / 23.84%；会议字幕说话后中位首次出字 1.042 s，最终 CER 三次均为 16.14%。MOSS/Qwen 没有同协议原生增量结果，所以不做跨模型实时排名。

## 5. 发布前检查

- [网页报告](../report.html)：普通读者入口，默认折叠大段文本，可直接播放音频。
- [最终听审裁定](../USER_FINAL_REVIEW.md)：最后两项人工判断已完成。
- [Owner 状态](OWNER_STATUS.md)：剩余工程任务和发布验收标准。
- [评测方法](METHODOLOGY.md)：指标、公平规则和赢家门槛。
