# MacBook Air M5 中英混杂 pilot：四系统对比

这份对比回答一个很窄的问题：同一段 7:05.472 的中文技术讲解，在不向模型提供人工答案或术语提示的条件下，四套现成系统谁的文字更接近上传/人工字幕，术语保留如何，是否完整走到结尾。

> 本轮每套系统只有一次 pilot。下面可以写“当前 pilot 顺序”，不能写成正式模型排名或跨场景赢家。

## 一眼结论

在这一个样本上，按主指标 MER 从低到高，当前顺序是：

1. **MOSS-Transcribe-Diarize 0.9B：13.64%**
2. **火山引擎录音文件识别（历史 raw）：21.44%**
3. **Qwen3-ASR 1.7B：24.16%**
4. **Qwen3-ASR 0.6B：27.46%**

MOSS 同时取得本样本最低 CER（10.29%）和最高严格术语召回（16/28，57.14%）。这证明的是一次中英混杂技术视频 pilot 的相对表现，不足以证明正式赢家；还需要冻结协议要求的重复运行和其他同类样本。

## 同一口径的文字指标

| 当前 pilot 顺序 | 系统 | MER（主，越低越好） | CER（补充） | 冻结术语召回 | 完整性 |
|---:|---|---:|---:|---:|---|
| 1 | MOSS-Transcribe-Diarize 0.9B | **13.64%** | **10.29%** | **16/28 · 57.14%** | reference 尾部门禁通过；near-audio-tail |
| 2 | 火山引擎录音文件识别 | 21.44% | 16.56% | 13/28 · 46.43% | reference 尾部门禁通过；near-audio-tail |
| 3 | Qwen3-ASR 1.7B | 24.16% | 18.15% | 13/28 · 46.43% | reference 尾部门禁通过；near-audio-tail |
| 4 | Qwen3-ASR 0.6B | 27.46% | 19.64% | 11/28 · 39.29% | reference 尾部门禁通过；near-audio-tail |

MER 把连续英文/数字串视为一个 token、中文按字，忽略标点和空白；因此适合中文主体、英文型号密集的样本。CER 对中英文字符逐字计算，只是补充。术语召回使用冻结的 28 项清单做 NFKC、大小写不敏感的精确短语包含，不把“含义大致正确”人工改成命中。

例如，`Cinebench` 被 Qwen 1.7B 识别成“三零奔驰”，所以严格术语项不命中；四套系统都没有完整命中 `3DMark Steel Nomad Light`。这类逐项结果可直接在各系统的 `SCORE_DETAILS.md` 和术语 TSV 复核。

## 转录是否完整

四套输出都包含人工 reference 最后一条“我们下期节目再见”，并在 1 秒容差内到达人工最后语音的 419.170 秒，所以都通过“可进行文字评分”的尾部门禁。

这不等于 425.472 秒音频获得了 100% 时间戳覆盖：

| 系统 | 最后时间戳 | 最后时间戳后的音频 | 如实标签 |
|---|---:|---:|---|
| Qwen3-ASR 0.6B | 424.173 秒 | 1.299 秒 | `near_audio_tail` |
| Qwen3-ASR 1.7B | 424.173 秒 | 1.299 秒 | `near_audio_tail` |
| MOSS 0.9B | 419.110 秒 | 6.362 秒 | `near_audio_tail` |
| 火山引擎 | 419.080 秒 | 6.392 秒 | `near_audio_tail` |

MOSS 的 419.110/425.472 不能美化成全音频覆盖；但它与人工最后语音只差 0.060 秒，并且最后一句存在，因此当前证据不支持“转录被截断”。更准确的结论是：**reference 语音范围完整，整段音频时间覆盖仅 near-tail**。

本 pilot 只检查 SRT 是否可解析、范围是否合法、start 是否单调和尾部是否完整。原生时间戳与 ForcedAligner 的边界准确率未在这里混排。

## 耗时与资源怎么读

| 系统 | 本次记录 | 资源证据 | 可比性提醒 |
|---|---|---|---|
| Qwen3-ASR 0.6B | 本地推理 77.235 秒，RTF 0.1815 | 未采集可信峰值资源 | `pilot-02-verified-model`；15 个外部 30 秒块 + ForcedAligner |
| Qwen3-ASR 1.7B | 本地推理 146.414 秒，RTF 0.3441 | 未采集可信峰值资源 | 15 个外部 30 秒块 + ForcedAligner |
| MOSS 0.9B | 本地推理 520.904 秒，RTF 1.2243；加载 2.610 秒 | GPU allocated 峰值 3.03 GiB，reserved 3.85 GiB | 一次完整音频自回归生成 |
| 火山引擎 | 提交到完成墙钟 76.166 秒 | 厂商计算资源未知 | 不是隔离推理耗时，不能与本地数值作模型速度排名 |

Qwen 0.6B 在这次有效运行里比 1.7B 快是实测事实，但单次运行、不同加载状态和当前 adapter 不能支撑“0.6B 普遍更快”的泛化结论。火山只保留了请求墙钟，故不进入本地推理速度顺序。

## 火山历史 raw 为什么可以复用

- 历史 R2 输入音频 SHA-256 与本目录 canonical WAV 完全相同：`bec45d9741f8e43bfeee10b45f9406402149bc7908286cc99f3550751bef2832`。
- 样本 ID 同为 `bili_bv1s4xcbmev7_uploaded_cc`，provider duration 为 425,472 ms，与冻结边界一致。
- 热词为 0、provider context 为 0 字符、没有使用 reference/人工正确稿。
- 本轮只从保留 raw 重新评分，没有再次调用付费接口。

这些条件让准确率结果可在本 pilot 复用；它仍保留“历史商业请求”的运行口径，不能假装成这次本地环境下的新运行。Qwen 0.6B 则只使用 `pilot-02-verified-model`：raw 与 normalized 都报告 `Qwen/Qwen3-ASR-0.6B`，身份门禁通过；旧的错标尝试不进入本表。

## 如何复核任意一个分数

1. 播放 [audio/audio_16k_mono.wav](audio/audio_16k_mono.wav)，确认实际评测输入。
2. 看 [reference/reference.zh.srt](reference/reference.zh.srt)，定位 161 条人工 cue 中的任意一句。
3. 打开对应系统的 `transcript.txt` / `transcript.srt` 和 `SCORE_DETAILS.md`。
4. 在 `_machine/score-pilot-v1/<system>/sentence-errors.tsv` 看这句被分配的 S/D/I 和同时间输出；再到 `edit-operations.tsv` 看每一个 token 替换、删除、插入及上下文。
5. 总计数和最终 MER/CER 在 [_machine/score-pilot-v1/metrics.json](_machine/score-pilot-v1/metrics.json)；所有冻结输入、输出和评分证据 SHA 在 [_machine/score-pilot-v1/EVIDENCE_SHA256SUMS.txt](_machine/score-pilot-v1/EVIDENCE_SHA256SUMS.txt)。

### 各系统人读入口

- [MOSS 评分明细](outputs/moss-transcribe-diarize-0.9b/SCORE_DETAILS.md) · [运行说明](outputs/moss-transcribe-diarize-0.9b/RUN.md)
- [火山评分明细](outputs/volcengine-current/SCORE_DETAILS.md) · [运行说明](outputs/volcengine-current/RUN.md)
- [Qwen 1.7B 评分明细](outputs/qwen3-asr-1.7b/SCORE_DETAILS.md) · [运行说明](outputs/qwen3-asr-1.7b/RUN.md)
- [Qwen 0.6B 评分明细](outputs/qwen3-asr-0.6b/SCORE_DETAILS.md) · [运行说明](outputs/qwen3-asr-0.6b/RUN.md)

## 还不能下什么结论

- 不能从一个 B 站技术视频宣布正式中英混杂赢家。
- 不能把这个单人样本用于发言人区分排名。
- 不能把时间戳结构通过解释成边界准确率最好。
- 不能跨越单请求 MOSS、外部分块 Qwen 与云服务火山的运行口径，制造统一速度榜。
- 不能把这一次 pilot 顺序写进正式 1/2/3 排名；正式排名要按冻结协议补足重复与样本覆盖。
