# 长播客无 Gold 多代理校准 v3

## 一句话结论

旧队列的 53 个争议标注中，已用跨系统一致性、上下文连续性、明确称呼/自我介绍和实体词表自动裁决 **47 项**；确实需要人耳的只剩 **6 个关联标注，合并为 4 个操作任务、5 段短音频**。

这显著缩小了人工工作，但仍不是独立真人 gold。当前产物可用于敏感性分析和下一轮重算，不能把 provisional 分数改写成正式准确率或产品 SLA。

## 分维度进度

| 维度 | 旧争议项 | 自动裁决 | 留给人工 | 可复用文件 |
|---|---:|---:|---:|---|
| 转录文字 | 11 | 8 | 3 | `asr-agent-gold-v3.jsonl` |
| 发言人 | 19 | 17 | 2 | `speaker-agent-gold-v3.jsonl` |
| 时间边界 | 23 | 22 | 1 | `timestamp-agent-gold-v3.jsonl` |
| **合计** | **53** | **47** | **6** | `adjudications.jsonl` |

人工 6 项并不是要做 6 次：世博 front 的文字与两个 speaker 映射合并在同一次 0–92 秒听审里，因此用户只需执行 4 个任务。详见 `HUMAN_REVIEW.md`。

## 自动裁决依据

1. **文字**：优先保留覆盖目标区间的完整句；短片段只作支持，不用片段覆盖完整句。中英术语只做可追溯的拼写归一，见 `entity-normalization.tsv`。
2. **发言人**：自我介绍和互相称呼作为最强锚点；同一节目映射固定后，结合前后命名话轮连续性裁决短应答。
3. **时间边界**：大多数项目要求多路局部边界在约 0.35 秒内收敛；3 个只有来源相关证据的极短应答降为 0.78 置信候选。跨入无关前后句的长段候选按全局对齐错误剔除，唯一 2 对 2 分歧保留真人听审。
4. 所有自动项保留逐项 `confidence` 与 `reason`，不把代理判断伪装为真人听审。

## 对现有排名的影响

- 这些标注足以减少先前 53 项争议对敏感性分析的阻塞。
- 仍不能宣布长播客文字、时间戳或发言人正式赢家：参考来源并不独立，且世博三窗尚缺可评分 timed gold。
- 完成 `HUMAN_REVIEW.md` 后，可把 4 个答案写回新版本并重新派生分数；不需要重跑任何 ASR 模型。

## 结论边界

- `agent-adjudicated gold candidate` 是可复用的机器裁决参考，不是 human gold。
- 火山与部分参考存在来源相关性；即便人工队列清零，也要重新检查 leave-one-system-out 后才能宣称公平排名。
- 短应答的 speaker 连续性判断尚未完成独立 overlap sweep，不能直接升级为正式 DER。
- 本轮模型重跑 0 次，付费 API 0 次；旧目录和旧证据均未改写。
