# MOSI 五个案例：多代理临时参考稿 v1

这批文件把五个案例的文字、时间位置和匿名发言人整理成可人工复核的版本。它能帮助缩小争议范围，但**还不是独立人工 gold，也不能直接用来宣布准确率赢家**。

## 为什么暂时不能叫正式 gold

- 官网展示稿是 MOSS 自己的展示输出，不是独立人工逐字稿。
- 三个身份已核验的系统结果参与了候选比对；用它反过来给同一批系统算分，会产生循环偏差。
- 原目录中标为 `qwen3-asr-0.6b` 的五份 pilot 输出，其 raw 元数据实际报告 `Qwen/Qwen3-ASR-1.7B`，身份无效，已完全排除。真正 0.6B 重跑完成前不纳入本版本。
- 代理无法像人工听审员一样对所有方言、重叠说话和截断音节作最终听觉确认。

因此，本轮只做三件事：把三个已核验系统一致、上下文明确的内容先裁定；给每句记录置信度和依据；把确实无法可靠判断的部分压缩到 [HUMAN_REVIEW.md](HUMAN_REVIEW.md)。

## 怎么看

每个样本目录包含：

- `provisional-reference.txt`：最适合直接阅读。
- `provisional-reference.srt`：带时间和匿名发言人，可配合音频播放。
- `provisional-reference.jsonl`：逐句置信度、来源和是否需要人工复核。

匿名发言人只表示“同一个声音”，不写真实姓名。时间戳以官网展示和带发言人系统的时间轴交叉整理，属于约百毫秒到数百毫秒量级的参考边界，不是人工逐帧边界。

## 置信度

- `high`：多系统一致，或错字能由上下文和专有名词稳定裁决。
- `medium`：主要内容明确，但语气、专名写法或词尾仍依赖上下文。
- `low`：方言、重叠、截断导致候选仍冲突，已进入人工队列。

## 成为正式 gold 的最短路径

1. 用户只听 [HUMAN_REVIEW.md](HUMAN_REVIEW.md) 列出的短片段并选择候选。
2. 另一名不看模型名称的人工复核员抽检每个样本至少 10% 的高置信句。
3. 把确认人、日期和修订记录写入新版本目录，保留本目录不覆盖。
4. 只有完成以上步骤的新版本，才允许用于 CER、时间边界和发言人准确率排名。

## 复现

运行 `uv run python scripts/build_mosi_provisional_gold.py` 会从冻结的官网展示稿和现有四系统结果重新生成本目录中的参考文件。然后运行 `uv run python scripts/validate_mosi_provisional_gold.py` 校验时间轴、编号、来源和人工队列。
