# 长播客时间戳评估 v2

## 先看结论

本轮把时间戳拆成两个问题，结论不能混用：

1. **谁的时间戳管线覆盖最完整？** Qwen + 外接 ForcedAligner 第 1（11/11 窗），火山第 2（8/11），MOSS 第 3（1 窗完整、1 窗部分）。这是部署覆盖榜，不是准确率榜。
2. **谁的时间戳更准？** 仍然没有可证明的赢家。在张翼 front 的 84 个高置信机器参考段上，条件 proxy 顺序是火山 → Qwen 外接轨 → MOSS；但参考边界对火山存在明显同源泄漏，且加入低置信段后顺序翻转为 Qwen → MOSS → 火山。

**首要警告：火山的高分是 source-dependent proxy。** 张翼 front 中，火山有 79.52% 的 start 和 86.75% 的 end 与机器 reference 完全相同；Qwen 对应为 0% / 0%，MOSS 为 2.44% / 1.22%。因此本报告既不宣布 formal winner，也不宣布 directional winner。

本轮没有重新调用模型或付费接口，只复用已落盘的 11 个 Qwen `timestamps=true` 结果、火山/MOSS 历史 raw/normalized 产物和冻结的 656 段 provisional-agent reference。v1 保持不变，v2 是 append-only 新目录。

## 1. 时间戳结构/部署能力榜

这张榜回答“整套流程能不能稳定给出可定位时间轴”，不回答边界是否接近真人判断。

| 排名 | 系统/管线 | 11 窗覆盖 | 时间戳来源 | 结论 |
|---:|---|---:|---|---|
| **1** | Qwen3-ASR-1.7B + ForcedAligner | **11/11** | **外接** forced aligner token，不是 ASR 原生时间戳 | 11 窗均有非空、单调时间轴；尾部覆盖率 99.47%–99.99% |
| **2** | 火山 | **8/11** | 原生字/词级 | 张翼、贾鹏 8 窗完整；世博缺结果 |
| **3** | MOSS 0.9B | **1/11 完整 + 1 窗部分** | 原生 segment | 张翼 middle 中途截断；其它窗口未形成同协议完整产物 |

所以 Qwen 赢的是“当前落盘管线的覆盖能力”，不是“Qwen 模型原生 timestamp 能力”。外接 ForcedAligner 的额外模型、切块与拼接成本必须保留在系统身份中。

## 2. 张翼 front 三系统准确率 proxy

主条件榜比较各系统实际能提供的最细时间戳：Qwen 使用外接 token、火山使用原生 token、MOSS 使用原生 segment。它是 **部署栈比较**，时间戳粒度并不完全对等。

排序主键固定为：`Start 与 End 均≤1s 命中率（高） → 两端合并 MAE（低） → median Time IoU（高）`。

| 条件顺序 | 系统/管线 | 可评分 turn | Start MAE / median / P95 | End MAE / median / P95 | 两端均≤1s | Time IoU mean / median |
|---:|---|---:|---:|---:|---:|---:|
| **1** | 火山原生 token | 83/84 | 0.704 / 0.000 / 0.839s | 0.003 / 0.000 / 0.027s | **95.18%** | **0.961 / 1.000** |
| **2** | Qwen 外接 token | 83/84 | 0.863 / 0.068 / 2.014s | 0.378 / 0.208 / 0.348s | **91.57%** | 0.839 / 0.902 |
| **3** | MOSS 原生 segment | 82/84 | 1.083 / 0.100 / 5.194s | 0.268 / 0.080 / 0.180s | 89.02% | 0.856 / **0.942** |

两端合并 boundary MAE 分别为火山 0.353s、Qwen 0.621s、MOSS 0.675s。

### Qwen 与 MOSS 怎么理解

两者没有发现像火山那样的直接 reference-lineage 重合，因此这组比较比“火山 vs 其它系统”更值得观察：Qwen 的 `both≤1s` 和合并 MAE 略好，MOSS 的 median IoU 与 end MAE 更好。它们仍共享机器生成的参考边界，且一个是外接 token、一个是原生 segment，所以只能说“本窗口、当前部署栈的指标互有胜负”，不能宣布 Qwen 或 MOSS 的时间戳模型赢家。

### 为什么另有统一 envelope 诊断

若强制三者都用 segment/utterance envelope，顺序变为火山 → MOSS → Qwen；Qwen 的 `both≤1s` 为 0%。原因是 Qwen segment 反映约 30 秒切块后的句段组织，而真正的细粒度边界在外接 token 中。这个诊断证明“输出分段方式”会改变 2/3 名，不应把 segment 排名误写成 token timestamp 准确率。

## 3. Qwen 与火山的 8 窗配对

这 8 窗覆盖张翼三窗与贾鹏五窗，共 656 个冻结参考段。Qwen 外接轨按主键 2 窗领先，火山原生轨 6 窗领先。

| 节目 | 窗口 | Qwen `both≤1s` / MAE / median IoU | 火山 `both≤1s` / MAE / median IoU | 条件顺序第 1 |
|---|---|---:|---:|---|
| 贾鹏 | front | **80.00%** / 1.079s / 0.893 | 79.73% / **0.893s** / **0.970** | Qwen |
| 贾鹏 | quarter | **85.87%** / 0.552s / 0.882 | 83.70% / **0.498s** / **0.980** | Qwen |
| 贾鹏 | middle | 78.79% / 1.340s / 0.910 | **86.76%** / **0.905s** / **0.979** | 火山 |
| 贾鹏 | three_quarter | 80.00% / 1.072s / 0.887 | **82.80%** / **0.844s** / **0.966** | 火山 |
| 贾鹏 | tail | 81.94% / 1.149s / 0.908 | **83.33%** / **0.843s** / **0.980** | 火山 |
| 张翼 | front | 91.57% / 0.621s / 0.902 | **95.18%** / **0.353s** / **1.000** | 火山 |
| 张翼 | middle | 94.94% / 0.418s / 0.928 | **96.20%** / **0.251s** / **1.000** | 火山 |
| 张翼 | tail | 91.01% / 0.609s / 0.912 | 91.01% / **0.476s** / **1.000** | 火山 |
| **8 窗宏平均** | — | 85.51% / 0.855s / 0.903 | **87.34%** / **0.633s** / **0.984** | 火山 6 窗、Qwen 2 窗 |

这张表也不是赢家证据：Qwen 与火山的 timestamp 机制不同，reference 又明显偏向火山。它适合定位哪一窗需要听审，不适合证明模型本体谁更准。

## 4. Source leakage 与 sensitivity

### 边界完全相同率

| 系统/管线 | 可评分 turn | Start exact match | End exact match |
|---|---:|---:|---:|
| 火山 | 83 | **79.52%** | **86.75%** |
| Qwen 外接轨 | 83 | 0% | 0% |
| MOSS | 82 | 2.44% | 1.22% |

火山的 exact-match 规模足以证明参考与其来源相关，不能解释为真实语音边界恰好精确到完全一致。

### 加入低置信段后排序翻转

| Reference 选择 | Qwen `both≤1s` / MAE / median IoU | MOSS | 火山 | 主键顺序 |
|---|---:|---:|---:|---|
| 84 个冻结高置信段 | 91.57% / 0.621s / 0.902 | 89.02% / 0.675s / 0.942 | **95.18%** / **0.353s** / **1.000** | 火山 → Qwen → MOSS |
| 138 个候选段 | **99.25%** / 0.136s / 0.915 | 96.69% / 0.133s / 0.950 | 96.35% / **0.113s** / **1.000** | Qwen → MOSS → 火山 |

138 段来自 Judge-A 的 source-aligned polished/Tingwu 机器时间轴；新 Qwen 没有已知直接复用该来源。但加入 54 段会改变全局文字对齐路径，7 个原有高置信 turn 的 Qwen 重建边界随之改变，其中最大变化达 34.074s。这不是稳定优势，而是 reference selection 与对齐算法敏感性。

结论仍是：**没有 formal winner，也没有 directional winner。**

## 5. 人工复核队列

[最小决定性时间戳复核队列](minimal-decisive-timestamp-review-queue.json) 共 23 项：

- 复用 v1 的 16 个 MOSS/火山决定性片段，不重复切音频；
- 新增 7 个 Qwen 对齐路径敏感 turn，索引与前 16 项不重复；
- 每个新增短片同时列出机器 reference、Qwen 在两种对齐集合下的候选、MOSS、火山和 custom/overlap/unable 选项；
- 人工只听音频裁决词句实际起止，不把系统名称或机器 reference 当真值。

新增 WAV 位于 [`review-clips/`](review-clips/)。它们只用于解决排序敏感性，不需要重新跑任何模型。

## 6. 指标怎么读

- **Start/End MAE**：边界平均差多少秒；越低越好，但必须和 median/P95 一起看，避免少数大错被平均值隐藏。
- **两端均≤1s**：一个 turn 的开头和结尾都在 1 秒内才算命中；这是本榜主键。
- **Time IoU**：预测区间与参考区间的重合比例；越接近 1 越好，对过长或过短的段都敏感。
- **可评分 turn**：只有文字覆盖至少 50%，且首尾 20% 都有对齐锚点的 turn 才进入边界指标；N/A 不按 0 分处理。

## 产物

| 文件 | 内容 |
|---|---|
| [`provisional-timestamp-rankings.json`](provisional-timestamp-rankings.json) | 结构部署榜、张翼 front 实际管线主榜与共同 envelope 诊断 |
| [`qwen-vs-volc-eight-window-paired.json`](qwen-vs-volc-eight-window-paired.json) | 8 窗逐窗配对和宏平均 |
| [`provisional-timestamp-scores.json`](provisional-timestamp-scores.json) | 三种 timestamp track 的完整逐 turn 诊断 |
| [`timestamp-ranking-sensitivity.json`](timestamp-ranking-sensitivity.json) | 高/低置信排序翻转与 exact-match leakage 证据 |
| [`minimal-decisive-timestamp-review-queue.json`](minimal-decisive-timestamp-review-queue.json) | 16 个复用项 + 7 个新增 Qwen 项 |
| [`summary.json`](summary.json) | 11 个 Qwen 输入 SHA、尾部覆盖、reference/build lineage 和调用次数 |
| [`build.py`](build.py) | 只读派生构建器；不调用模型或付费接口 |

所有 Qwen 11 窗均通过 sample identity、非空 segments/timestamps 和时间轴不回退检查。v1 未修改。
