# Coverage Report v7

快照时间：`2026-07-21T22:35:00+08:00`。本页是 append-only 文档快照，继承
[Coverage v6](COVERAGE_REPORT-v6.md)，不改写 v6 或任何 frozen run。v7 新增 Qwen 11 个同窗结果、
ASR/时间戳/发言人三条 provisional 榜、部署完整性榜和统一人工复核入口；会议结论继承 v6。
同一快照的机器可读版本见 [`coverage.json`](../runs/phase1-coverage-20260721-v7/coverage.json)。

## 先看结论

长播客现在不再是“什么都不能回答”，而是有四个不同答案：

| 问题 | 当前结论 | 能否称正式赢家 |
|---|---|---|
| 同一张翼前窗的 ASR 文字 | 条件顺序：**火山 1 → MOSS 2 → Qwen 3** | 否；火山参考同源，MOSS–Qwen 区间跨 0 |
| 同一张翼前窗的时间戳部署栈 | 高置信 proxy：**火山 1 → Qwen+外接对齐 2 → MOSS 3** | 否；参考偏火山，加入低置信段后排序翻转 |
| 同一张翼前窗的发言人 | proxy：**MOSS 1 → 火山 2；Qwen N/A** | 否；Qwen 不支持，参考不是人工 gold |
| 11 窗 ASR/时间轴交付完整性 | **Qwen 1 → 火山 2 → MOSS 3** | 这是部署榜，不是准确率冠军 |

这里的 `rank` 表示当前冻结参考和协议下的 provisional 顺序；`formal winner` 还要求独立人工 gold、
来源独立、同协议、完整模型矩阵和足够的不确定性证据。两者不能互换。

## 1. ASR 文字轨

### 张翼 front：三系统条件质量

同一 34 个 A 级片段、522 个规范化参考字符：

| 条件排名 | 系统 | CER | 状态 |
|---:|---|---:|---|
| 1 | 火山 | **1.92%** | 有已知 reference-lineage 重合，只能作偏乐观 proxy |
| 2 | MOSS 0.9B | **4.21%** | 未发现直接参考同源 |
| 3 | Qwen3-ASR-1.7B | **8.43%** | 未发现直接参考同源 |

优先看的低直接泄漏比较是 MOSS 对 Qwen：60 秒块 `MOSS−Qwen` 平均差为 `-2.47pp`，95% bootstrap
区间 `[-5.43pp,+0.27pp]`，跨过 0。因此可以说“MOSS 方向领先”，不能说“已证明胜出”。

### 8 个有 A 级参考的窗口

Qwen pooled CER 为 **7.55%**（263/3484），火山按同样字符时间戳切片重算为 **1.98%**（69/3484）；
逐窗 `Qwen−火山` 差为 `+5.53pp`，95% 区间 `[+4.07pp,+7.04pp]`。但火山参考同源风险在张翼
middle 甚至表现为 CER=0，因此这组差距不能升级为正式公平赢家。

证据：[ASR v2 报告](../runs/podcast-agent-gold-asr-20260721-v2/REPORT.md)、
[`rankings.json`](../runs/podcast-agent-gold-asr-20260721-v2/rankings.json)、
[`provisional-asr-scores.json`](../runs/podcast-agent-gold-asr-20260721-v2/provisional-asr-scores.json)。

## 2. 时间戳轨

张翼 front 高置信 proxy 的主键是“两端都在 1 秒内的比例 → boundary MAE → median Time IoU”：

| 条件排名 | 系统/管线 | 两端≤1s | 合并 boundary MAE | 备注 |
|---:|---|---:|---:|---|
| 1 | 火山原生 token | **95.18%** | **0.353s** | start/end exact match 79.52%/86.75%，同源警报 |
| 2 | Qwen + 外接 ForcedAligner | 91.57% | 0.621s | 外接 token，不是 Qwen 原生时间戳 |
| 3 | MOSS 原生 segment | 89.02% | 0.675s | 粒度与 token 轨不同 |

加入 54 个低置信候选段后顺序翻转为 Qwen → MOSS → 火山，所以时间戳既没有 formal winner，也不发布
directional winner。Qwen 外接对齐、火山原生 token、MOSS 原生 segment 必须保留各自系统身份。

证据：[时间戳 v2 报告](../runs/podcast-timestamp-provisional-agent-gold-20260721-v2/REPORT.md)、
[`provisional-timestamp-rankings.json`](../runs/podcast-timestamp-provisional-agent-gold-20260721-v2/provisional-timestamp-rankings.json)、
[`timestamp-ranking-sensitivity.json`](../runs/podcast-timestamp-provisional-agent-gold-20260721-v2/timestamp-ranking-sensitivity.json)。

## 3. 发言人轨

只有张翼 front 同时有 MOSS 与火山可用输出；Qwen 不支持 native speaker attribution，必须标 `N/A`，
不能按 0 分或准确率第三名处理。

| 条件排名 | 系统 | cpCER | DER | JER | 状态 |
|---:|---|---:|---:|---:|---|
| 1 | MOSS 0.9B | **5.42%** | **5.82%** | **4.20%** | provisional、仅一窗 |
| 2 | 火山 | 10.74% | 6.20% | 13.26% | provisional、仅一窗 |
| N/A | Qwen | N/A | N/A | N/A | `unsupported` |

四种低置信极端分配下 cpCER 主顺序保持 MOSS → 火山，但参考文本和 speaker 候选仍来自机器来源、没有
独立 overlap gold，也没有统计不确定性；因此它是优先复核方向，不是正式赢家。

证据：[发言人报告](../runs/podcast-speaker-provisional-agent-gold-20260721-v1/REPORT.md)、
[`provisional-rankings.json`](../runs/podcast-speaker-provisional-agent-gold-20260721-v1/provisional-rankings.json)、
[`ranking-sensitivity.json`](../runs/podcast-speaker-provisional-agent-gold-20260721-v1/ranking-sensitivity.json)。

## 4. 部署完整性榜

部署榜回答“11 个约 10 分钟窗口能否交付所需结构”，不回答“谁更准”。缺失、部分输出和 unsupported
均按状态记录，不伪造成识别错误。

| 轨道 | 1 | 2 | 3 |
|---|---|---|---|
| ASR 可定位文本 | **Qwen 11/11** | 火山 8/11 | MOSS 1/11 完整 |
| 时间轴 | **Qwen+外接对齐 11/11** | 火山原生 8/11 | MOSS 原生 1 完整 + 1 部分 |
| 发言人结构 | **火山：两期 8 窗** | MOSS：1 完整 + 1 部分 | Qwen：`unsupported` |

ASR 正确字符覆盖另报：Qwen **92.45%**、火山 **98.02%**、MOSS **14.35%**。Qwen 仍在部署榜第一，
因为它完成 11/11；火山正确字符覆盖更高但只覆盖 8/11，而且该分数有参考同源风险。

Qwen 本轮 11 窗共 6597.73 秒音频，推理 1968.85 秒，加权 RTF **0.2984**。运行清单逐窗保存 job ID、
音频 SHA、请求参数、raw/normalized SHA：[`run.json`](../runs/qwen3-asr-1.7b-podcast-windows-provisional-v1-20260721/run.json)。

## 5. 用户只需处理的最小队列

当前统一入口是 [combined review queue v2](../runs/podcast-combined-human-review-queue-20260721-v2/queue.json)：

- 53 个上游 ASR/时间戳/发言人复核项合并为 **36 次播放**，去重 32.08%；
- **20 个 P0** 排在最前；31 次复用既有音频，只新增 5 段；
- 每次播放同时填写逐字文本、speaker 和 start/end，避免三条轨重复听同一段；
- [答案模板](../runs/podcast-combined-human-review-queue-20260721-v2/answer-template.jsonl) 与
  [复核指南 v2](PODCAST_HUMAN_REVIEW_GUIDE-v2.md) 已就绪。

完成这些项只会提升关键冲突和排序稳定性；要发布正式整套准确率赢家，仍需把代表性窗口升级为独立人工
gold，尤其是建立不含火山/polished 来源的张翼 front 逐字稿与边界。

## 6. 小模型怎么进入选型

[小参数 ASR 定位报告 v2](SMALL_ASR_MODEL_POSITIONING_REPORT-v2.md)的结论是：不要按参数量直接下注，先做
商业 API、小型专用管线和强开放模型三路 bake-off。长播客优先验“不漏段 → 文字 → 时间轴 → speaker”；
MOSS 的一体式 speaker/timestamp 是候选能力，但本次 44.90% 截断证明必须先做完整性 canary；Qwen 的
时间戳是外接管线；Paraformer/SenseVoice 等小模型通常还需 VAD、标点、对齐和 CAM++ 组合。

## 7. 会议结论继承 v6

普通中文会议的正式窄赢家不变：在 3 条相同 AISHELL-4 人工 gold 上，MOSS sample-macro CER
**22.38%**，Qwen **23.69%**；配对 95% CI `[-2.18pp,-0.37pp]`。该结论只覆盖普通会议整段转录，
不外推到长播客、时间戳、发言人、高重叠或总体冠军。

## 继承关系与固定证据

- parent：`docs/COVERAGE_REPORT-v6.md`，SHA `24d80a72df6b7613d3f503e741c6aba58d187fe0aaf228b18579a6a0e3cb5e52`
- ASR v2 rankings SHA：`9c4c0a20e977dc0ec2e4fff94440e69e9eca0a537f39b113de201e817f3d64da`
- timestamp v2 rankings SHA：`e0d55feb0d81a7fe2f2e69b5cf51848571d28339822afeb8d82ae00d48613ca9`
- speaker v1 rankings SHA：`94567c16ed4cb4e7e9194e4b48894a5964d7545081bb0db1509ae629e671a9bb`
- combined queue v2 SHA：`0a7ce368e69e72efe92bbef5659cb52d1af7c9740865d3252fae7ec8a18561b6`
- small-model positioning v2 SHA：`eec1d1357b197239edd4c5967a4a48665768473636974a0bff95ab8ebe062bae`
