# 长播客 ASR 文本轨 v2：加入 Qwen 同窗结果

## 结论

现在三个维度已经拆开：

1. **纯 ASR 条件质量**：张翼前窗是唯一三模型同窗。排名见下表，但火山有已知参考来源重合，只能作为方向性结果。
2. **8 窗稳定性**：Qwen 与火山均可在现有 A 级参考上比较；报告 pooled CER 与逐窗配对不确定性。
3. **整期交付完整性**：按 11 个目标窗是否产生可定位时间戳排序，不混入发言人指标。

## 张翼前窗：三系统同窗 ASR

| 排名 | 模型 | CER | 已知直接参考泄漏风险 |
|---:|---|---:|---|
| 1 | volcengine-current-asr | 1.92% | 是 |
| 2 | moss-transcribe-diarize-0.9b | 4.21% | 未发现 |
| 3 | qwen3-asr-1.7b | 8.43% | 未发现 |

优先看没有已知直接 reference lineage 重合的 MOSS–Qwen：MOSS=4.21%，Qwen=8.43%；60 秒块配对 bootstrap 见 `rankings.json`。这仍是机器候选参考下的 provisional 比较，不是正式 gold。

## 8 个现有参考窗：Qwen 与火山

| 模型 | pooled CER | macro-window CER | 参考字符 |
|---|---:|---:|---:|
| Qwen | 7.55% | 7.63% | 3484 |
| 火山 | 1.98% | 2.09% | 3484 |

逐窗配对 bootstrap 的 Qwen−火山 CER 差与 95% 区间在 `rankings.json`。因为火山参考泄漏会把火山分数向好方向拉，这不是一场完全公平的正式竞赛。

## 11 窗交付完整性

| 排名 | 模型 | 可定位完整窗 | A 级参考覆盖 | 正确字符覆盖 |
|---:|---|---:|---:|---:|
| 1 | qwen3-asr-1.7b | 11/11 | 100.00% | 92.45% |
| 2 | volcengine-current-asr | 8/11 | 100.00% | 98.02% |
| 3 | moss-transcribe-diarize-0.9b | 1/11 | 14.98% | 14.35% |

部署榜回答“长播客按窗口跑完后，能否交付可定位文本”；它不是纯 CER 榜，也不包含发言人正确率。

## 证据与复用

- v1 的 656 条裁决账本、221 条 A 级片段和音频 SHA 均未改写。
- v2 只追加 Qwen 同窗预测、重新聚合排名及不确定性。
- `coverage-status.json` 逐窗记录完成、缺失、失败或不可定位状态；缺输出不伪造成 CER=100%。
- `provisional-asr-scores.json` 保留三系统逐窗口分数及预测 SHA。
