# 模型比较

> 当前状态：四套系统已完成同一段 10 分钟样本的单次 canary。文字排名是本轮样本结果，不是跨场景总冠军。

## 先看结论

- **文字转录：MOSS-Transcribe-Diarize 0.9B 当前第 1。** CER 为 12.55%；CER 越低越好。
- **时间位置：只看交付形态和误差，不做单一冠军。** MOSS 与火山给出原生时间位置；两套 Qwen 使用外接 ForcedAligner，产物来源不同。
- **发言人区分：MOSS 与火山提供匿名说话人标签。** 两套 Qwen 为 N/A，不支持这一维。
- **火山引擎：已使用录音文件识别 2.0 标准版补齐。** 音频通过短期 R2 预签名 URL 提供，任务结束后 R2 对象已删除；未使用极速版。

## 1. 文字转录：CER 排名

CER 是逐字错误率，越低越好；括号内是错误字数 / 参考字数。

| 排名 | 模型 | CER | 证据 |
| ---: | --- | ---: | --- |
| 1 | MOSS-Transcribe-Diarize 0.9B | **12.55%** （349 / 2,780） | [转录](outputs/moss-transcribe-diarize-0.9b/transcript.txt) · [带时间位置](outputs/moss-transcribe-diarize-0.9b/transcript.srt) · [运行说明](outputs/moss-transcribe-diarize-0.9b/summary.md) |
| 2 | Qwen3-ASR 1.7B | **14.35%** （399 / 2,780） | [转录](outputs/qwen3-asr-1.7b/transcript.txt) · [带时间位置](outputs/qwen3-asr-1.7b/transcript.srt) · [运行说明](outputs/qwen3-asr-1.7b/summary.md) |
| 3 | Qwen3-ASR 0.6B | **15.50%** （431 / 2,780） | [转录](outputs/qwen3-asr-0.6b/transcript.txt) · [带时间位置](outputs/qwen3-asr-0.6b/transcript.srt) · [运行说明](outputs/qwen3-asr-0.6b/summary.md) |
| 4 | 火山引擎录音文件识别 2.0 标准版 | **17.30%** （481 / 2,780） | [转录](outputs/volcengine-current-asr/pilot-05-r2-20260723/transcript.txt) · [带时间位置](outputs/volcengine-current-asr/pilot-05-r2-20260723/transcript.srt) · [运行说明](outputs/volcengine-current-asr/pilot-05-r2-20260723/summary.md) |

## 2. 时间位置：交付管线观察

这里看一句话的开始和结束是否都落在人工边界 ±1 秒内（both@1s）。由于原生分段与外接对齐不是同一种产物，而且实际进入评分的语段数不同，下面不做正式跨模型排名。

| 模型 | 时间从哪里来 | 开始、结束都在 ±1 秒内 | 进入评分的分母 |
| --- | --- | ---: | ---: |
| MOSS-Transcribe-Diarize 0.9B | 模型原生分段时间 | **43.48%**（50 / 115） | 115 |
| Qwen3-ASR 1.7B | 30 秒外部分块 + ForcedAligner 外接对齐 | **90.91%**（20 / 22） | 22 |
| Qwen3-ASR 0.6B | 30 秒外部分块 + ForcedAligner 外接对齐 | **95.83%**（23 / 24） | 24 |
| 火山引擎录音文件识别 2.0 标准版 | 火山原生句段和词时间位置 | **22.50%**（27 / 120） | 120 |

## 3. 发言人区分：MOSS 与火山有匿名说话人结果

| 模型 | DER（边界容差 0 秒） | DER（边界容差 0.25 秒） | JER | cpCER | 人数 |
| --- | ---: | ---: | ---: | ---: | --- |
| MOSS-Transcribe-Diarize 0.9B | 8.19% | 5.09% | 11.18% | 9.93% | 参考 3 人 / 识别 3 人 |
| 火山引擎录音文件识别 2.0 标准版 | 27.22% | 23.39% | 34.34% | 30.04% | 参考 3 人 / 识别 5 人 |
| Qwen3-ASR 1.7B | N/A | N/A | N/A | N/A | 不支持发言人区分 |
| Qwen3-ASR 0.6B | N/A | N/A | N/A | N/A | 不支持发言人区分 |

DER/JER 越低越好，表示说话人时间区间越接近人工标注；cpCER 越低越好，表示把匿名说话人匹配后，各人名下的文字越准确。MOSS 与火山的发言人标签都是匿名标签，不能还原真实姓名。

## 数字从哪里来

日常阅读优先点击上表的转录、字幕和运行说明；只有复核计算时才需要打开下面的机器指标。

- 文字 CER：MOSS 与 Qwen 1.7B 来自 [`meeting-pilot-v1/transcription.json`](../../../metrics/meeting-pilot-v1/transcription.json)，Qwen 0.6B 来自 [`_machine/metrics/qwen3-asr-0.6b/transcription.json`](_machine/metrics/qwen3-asr-0.6b/transcription.json)。
- 时间位置：各模型的 [`_machine/metrics/<模型>/timestamps.json`](_machine/metrics/)。
- 发言人：MOSS 与火山各自的 [`diarization-collar-0.json`](_machine/metrics/)、[`diarization-collar-0.25.json`](_machine/metrics/) 与 [`speaker-text.json`](_machine/metrics/)。

> 本页由 `scripts/generate_phase2_meeting_comparison.py` 从上述 JSON 生成；不要手改数字。生成过程只更新人读 Markdown，不覆盖 `_machine/` 里的原始或评分证据。
