# R8002_M8003_MS803-canary-10m：中文真实会议 10 分钟 canary

> 状态：**四套系统已完成**。这是单次 canary，用于看本样本上的相对表现和交付完整性；不作为跨场景正式总榜。

## 一眼看懂

| 项目 | 内容 |
| --- | --- |
| 场景 | 中文多人会议·高重叠压力 |
| 源窗口 | 705.295000–1306.685000 秒 |
| 实际时长 | 601.390000 秒 |
| 发言人 | 4 人 |
| 人工标注语段 | 308 段 |
| 有效语音并集 | 560.920 秒 |
| 重叠语音 | 167.410 秒，占有效语音并集 29.85% |
| 当前文字第 1 | MOSS-Transcribe-Diarize 0.9B，CER 18.95% |
| 完成情况 | MOSS 0.9B、Qwen 1.7B、Qwen 0.6B、火山录音文件识别 2.0 标准版均已完成 |
| 许可 | [CC BY-SA 4.0](https://www.openslr.org/119/) |

## 先从哪里看

1. 看结论和 1/2/3 排名：[`COMPARISON.md`](COMPARISON.md)。
2. 听原音：[`audio/audio.wav`](audio/audio.wav)。
3. 读人工参考：[`reference/transcript.txt`](reference/transcript.txt)。
4. 对照模型原文和带时间位置的字幕：[`outputs/`](outputs/README.md)。

普通读者不需要打开 JSON。需要复核数字时，`COMPARISON.md` 末尾列出了对应机器证据。

## 为什么选这一段

窗口由 `central-silence-bounded-600s-v1` 自动冻结：只读取人工说话区间，寻找最接近完整标注中点、长度在 590–610 秒且两端位于静音间隙的窗口；再按接近 600 秒、起点更早依次破同分。没有试听挑选，也没有参考任何模型结果。因此它是可复现的中央截面，不是特意挑出的最干净片段。

## 本轮怎么理解

- 文字转录按 CER 排名，越低越好。
- 时间位置展示“开始和结束都在人工边界 ±1 秒内”的比例；MOSS 与火山是原生时间位置，两套 Qwen 是外接 ForcedAligner，不能直接据此宣布跨模型冠军。
- 发言人区分由 MOSS 与火山提供匿名 speaker 标签；Qwen 记为 N/A，不按 0 分处理。
- 火山标准版通过短期 R2 预签名 URL 完成服务端拉取；R2 对象已清理，且不使用极速版。

## 文件怎么读

- `audio/audio.wav`：实际 16 kHz 单声道 PCM 评测音频。
- `reference/transcript.txt`：按固定时间顺序排列的人工文字。
- `reference/speakers.txt`：重置到 0 的时间、匿名发言人和文字。
- `reference/speakers.rttm`：用于 DER/JER 的人工说话人活动。
- `reference/annotations.TextGrid`：同步裁剪并重置到 0 的原始层级表示。
- `COMPARISON.md`：人读结论、CER 排名和各维度证据入口。
- `outputs/`：四套系统的人读转录、SRT 和运行说明。
- `_machine/`：原始响应、冻结来源与机器评分证据，供复核脚本使用。

> 本页由 `scripts/generate_phase2_meeting_comparison.py` 从冻结 provenance 和评分 JSON 生成；生成过程不会覆盖 `_machine/` 证据。
