# 长播客 11 窗 speaker 多代理裁决参考集 v1

## 结论

本轮没有重跑模型，也没有调用付费接口。它复用了已有 Judge A、Judge B 和 Judge C 的裁决链、11 个已物化 WAV、历史系统输出及完整上下文，得到一份 **provisional-agent-gold**：

- 11 窗中，张翼与贾鹏 8 窗有可裁决的 timed speaker 候选；世博 3 窗没有可靠 timed speaker 来源。
- 1243 个候选段中，**656 段**满足严格高置信规则，累计 2292.46 秒，可用于暂定的单人话轮 DER/JER/cpCER 代理分数。
- 其余 587 段保留在全量审计队列；相邻问题已合并为 315 个 cluster，另有 8 个整窗 overlap sweep 和 3 个世博整窗任务，共 326 项。
- 为让用户真正可执行，又从中压缩出 **19 个最小决定性复核短片**：12 个可能影响当前唯一双系统 proxy 排序，7 个用于三期 episode-level speaker 映射校准。每项都有可直接播放的 16 kHz mono WAV、时间点、上下文和选择项。

这份参考集不是 human gold。A/B 是过程独立的 agent pass，但共用了机器转写或 provider 证据，且没有独立 overlap 标注。因此所有数值只能叫 **provisional proxy**，不得改写为正式准确率或长播客总冠军。

## 两张榜必须分开

### 1. 全场景结构部署能力

这张榜回答“现在接入后，能不能得到整期匿名 speaker 结构”，允许把缺结果和 unsupported 作为部署事实，但不是准确率榜。

| 排名 | 系统 | 依据 |
|---:|---|---|
| **1** | 火山 | 张翼、贾鹏两期有近整期时间轴及完整匿名 speaker 结构；世博缺结果 |
| **2** | MOSS | 原生支持 speaker；张翼只到 44.90%，世博未跑，贾鹏超过原生单次 90 分钟范围 |
| **3** | Qwen | 当前系统契约不支持 native speaker attribution |

### 2. 暂定准确率 proxy

只有“张翼 front”同时存在 MOSS、火山可用输出和高置信参考区间；Qwen 是 unsupported，记 N/A，不能按 0 分或第三名参与准确率均值。

| 暂定排名 | 系统 | cpCER | DER | JER | 状态 |
|---:|---|---:|---:|---:|---|
| **1** | MOSS | **5.42%** | **5.82%** | **4.20%** | 仅张翼 front、84 个高置信段 |
| **2** | 火山 | 10.74% | 6.20% | 13.26% | 同一高置信区间 |
| N/A | Qwen | N/A | N/A | N/A | speaker unsupported，不是 0 分 |

排序主键冻结为 `cpCER → DER → JER`。在“只用 84 个高置信段”“采用全部 Agent-C 标签”“低置信段极端有利于 MOSS”“低置信段极端有利于火山”四种 sensitivity 场景中，cpCER 主排序均保持 MOSS → 火山。不过：

- 完整候选场景中，DER 这一单项会改为火山更低；
- 参考文本和 speaker 候选来自机器来源，存在 source-family 偏置；
- MOSS 整期随后截断，不能把 front proxy 排名外推到张翼整期；
- 只有一个双系统窗口，没有统计不确定性，也没有 overlap gold。

因此这只是“优先复核方向”，**不是 formal winner**。

## 逐窗覆盖

| 播客 / 窗口 | 候选段 | provisional-agent-gold | 待复核段 | 可比较输出 |
|---|---:|---:|---:|---|
| 世博 front | 0 | 0 | 整窗 | 无；Qwen speaker 不支持 |
| 世博 middle | 0 | 0 | 整窗 | 无 |
| 世博 tail | 0 | 0 | 整窗 | 无 |
| 张翼 front | 138 | 84 | 54 | 火山 + MOSS；唯一双系统 proxy |
| 张翼 middle | 143 | 79 | 64 | 火山；MOSS 整期产物在本窗中途截断，不计 0 分 |
| 张翼 tail | 150 | 89 | 61 | 只有火山 |
| 贾鹏 front | 155 | 76 | 79 | 只有火山；MOSS 超原生单次范围 |
| 贾鹏 quarter | 176 | 93 | 83 | 只有火山 |
| 贾鹏 middle | 147 | 68 | 79 | 只有火山 |
| 贾鹏 three-quarter | 177 | 94 | 83 | 只有火山 |
| 贾鹏 tail | 157 | 73 | 84 | 只有火山 |

火山在 8 个有参考区间的窗口都有 proxy 数值，但其中 7 窗没有第二个 eligible 系统。文件中的 `rank=1` 只表示“唯一可用输出”，不表示战胜其它模型。

## 高置信接纳规则

一个段只有同时满足以下条件才进入 provisional-agent-gold：

1. Judge C speaker confidence 为 `0.9`；
2. Judge B 与 A/C 的 speaker 判断一致；
3. 跨来源文本相似度至少 `0.6`，确保比较的是同一段话；
4. Judge C 没有记录冲突。

每段保留：绝对/窗口内相对时间、匿名 `S01/S02`、speaker change、文本、三代理判断轨迹和置信度。若前一候选段没有通过门禁，`speaker_change_before=null`，不会跨低置信缺口猜测换人。

现有来源没有独立、完整地保存重叠语音。因此高置信段的 `overlap_status` 是 `not_indicated_but_not_independently_audited`，而不是“确认无重叠”。本轮 DER/JER 是 single-speaker-turn proxy；要升级必须完成 8 个整窗 overlap sweep。

## 最小决定性人工队列

[最小队列 JSON](minimal-decisive-review-queue.json) 有 19 项：

- 12 个 P0：张翼 front 中 MOSS 与火山匿名 speaker 提案不同的短区间，可能改变唯一双系统 proxy 的细项与置信程度；
- 1 个张翼 mapping 校准：包含“你好张翼 / 你好 Koji”的明确称呼；
- 4 个贾鹏跨 front/quarter/middle/tail 的长程 mapping/re-entry 校准；
- 2 个世博开场 mapping 校准，因为这期没有可靠 timed speaker 来源。

短片位于 [`review-clips/`](review-clips/)，均为 16 kHz mono PCM WAV，4.12–49.00 秒，并含目标前后约 2 秒上下文。每项要求从 `S01`、`S02`、`OVERLAP`、`OTHER`、`UNABLE` 中选择；如短片内发生换人，再填写 split time。无法判断时必须选 `UNABLE`，不得硬猜。

326 项 [全量 review queue](human-review-queue.jsonl) 继续保留作审计与后续完整标注，不再直接作为用户首轮任务。

## 产物怎么用

| 产物 | 用途 |
|---|---|
| [`provisional-agent-gold.jsonl`](provisional-agent-gold.jsonl) | 656 个高置信 speaker/text/time 候选段 |
| [`provisional-scores.json`](provisional-scores.json) | 9 个 system-window 的暂定 DER/JER/cpCER |
| [`provisional-rankings.json`](provisional-rankings.json) | 结构部署 1/2/3 与 accuracy proxy 分轨排名 |
| [`ranking-sensitivity.json`](ranking-sensitivity.json) | 张翼 front 的 best/worst 极端敏感性分析 |
| [`minimal-decisive-review-queue.json`](minimal-decisive-review-queue.json) | 用户首轮只需处理的 19 个短片 |
| [`human-review-queue.jsonl`](human-review-queue.jsonl) | 326 项完整审计队列 |
| [`summary.json`](summary.json) | 机器可读门禁、计数、系统状态和 artifact SHA |
| [`build.py`](build.py) | 可重复构建规则；只读输入、无模型/付费调用 |

## 证据边界

- Judge B 的 manifest 明确记录“未读取 Judge A 输出”，Judge C 再合并 A/B；这是多代理过程独立性。
- A/B 仍共享 Podwise 等机器来源，所以不是来源独立性，也不是两名真人复核。
- 张翼/贾鹏参考候选可能与火山或其它 provider family 存在相关性；proxy 分数不能作为产品 SLA 或准确率估计。
- 火山使用历史 derived-input MP3，MOSS 使用 canonical 音频的确定性解码；这里没有 exact-byte、同请求协议的完整横评。
- Qwen speaker unsupported、MOSS 缺失/截断、火山世博缺结果都作为状态单列，未写成 0 分。
- 没有重跑任何 ASR/diarization 模型；本轮只做已有 JSON 裁决、指标派生和本地 WAV 裁剪。
