# 用户结论逐项证据表（技术附录）

> 面向普通读者的完整结论以 [ASR 评估指南](EXECUTIVE_SUMMARY.md) 为准。本页只用于逐项审计结论来源。

本页把用户问题、答案、指标、证据强度和产物放在同一行。最新冻结解释以
[Coverage v7](COVERAGE_REPORT-v7.md)为准。

## 决策矩阵

| 用户问题 | 当前答案 | 主指标 | 证据等级 | 证据 |
|---|---|---|---|---|
| 普通中文会议 ASR 谁更好？ | **MOSS 正式窄胜。**3 条 AISHELL-4 上 MOSS/Qwen macro CER 22.38%/23.69%，CI95 [-2.18,-0.37]pp | CER、paired CI | 强：同人工 gold、同协议 | [winner report](../runs/business-meeting-winner-20260721-v1/REPORT.md) |
| 长播客 ASR 谁更好？ | 张翼 front provisional：**火山 1、MOSS 2、Qwen 3**；不宣布 formal winner | CER、block bootstrap | 中：同窗机器参考；火山同源 | [ASR v2](../runs/podcast-agent-gold-asr-20260721-v2/REPORT.md) |
| 不看火山同源风险，MOSS 和 Qwen 呢？ | MOSS 4.21%、Qwen 8.43%；MOSS−Qwen CI95 [-5.43,+0.27]pp，跨 0 | CER、paired CI | 中：无已知直接同源；仍非人工 gold | [rankings](../runs/podcast-agent-gold-asr-20260721-v2/rankings.json) |
| 8 个参考窗 Qwen 和火山呢？ | Qwen 7.55%、火山 1.98%；每窗火山更低，但火山 reference leakage 足以阻止赢家声明 | pooled/macro CER | 中偏弱：覆盖较广但 reference 偏置 | [scores](../runs/podcast-agent-gold-asr-20260721-v2/provisional-asr-scores.json) |
| 长播客谁最能完整交付 ASR？ | **Qwen ASR+外接对齐 11/11 → 火山 8/11 → MOSS 1/11 完整** | complete locatable windows、correct-char coverage | 强：结构/运行事实 | [coverage status](../runs/podcast-agent-gold-asr-20260721-v2/coverage-status.json) |
| 长播客时间戳谁更准？ | 高置信 proxy 火山→Qwen+外接对齐→MOSS；低置信后翻转，**无 directional/formal winner** | both≤1s、MAE、Time IoU | 中：机器边界、混合粒度、同源 | [timestamp v2](../runs/podcast-timestamp-provisional-agent-gold-20260721-v2/REPORT.md) |
| 谁的时间轴覆盖最完整？ | **Qwen+外接对齐 11/11 → 火山原生 8/11 → MOSS 原生 1 完整+1 部分** | window coverage、tail coverage | 强：部署结构事实 | [timestamp rankings](../runs/podcast-timestamp-provisional-agent-gold-20260721-v2/provisional-timestamp-rankings.json) |
| 长播客发言人谁更好？ | 张翼 front proxy：**MOSS 1 → 火山 2；Qwen N/A/unsupported** | cpCER→DER→JER | 中偏弱：单窗机器参考、无 overlap gold | [speaker report](../runs/podcast-speaker-provisional-agent-gold-20260721-v1/REPORT.md) |
| 谁能交付发言人结构？ | **火山 1 → MOSS 2 → Qwen 3/unsupported**；第 3 只是能力状态，不是准确率名次 | label/window coverage | 强：结构事实 | [speaker rankings](../runs/podcast-speaker-provisional-agent-gold-20260721-v1/provisional-rankings.json) |
| 长播客谁更快？ | 只对 Qwen 同窗管线报告 RTF 0.2984；MOSS 是截断任务，火山历史运行协议不同，不横排 | RTF、完成率 | 单系统有效；跨系统不可比 | [Qwen run](../runs/qwen3-asr-1.7b-podcast-windows-provisional-v1-20260721/run.json) |
| 高重叠会议谁更好？ | 只有 Qwen 一条 AliMeeting CER 29.33%，不能跨模型比较 | CER、overlap ratio | 单系统 gold | [Coverage v7](COVERAGE_REPORT-v7.md) |
| 总体哪个模型最好？ | **无答案，不发布总榜。** | 分场景主指标 + 完整矩阵 | 不满足 | [Coverage v7](COVERAGE_REPORT-v7.md) |

## 为什么 rank 不等于 formal winner

| 门槛 | 当前长播客状态 | 影响 |
|---|---|---|
| 独立人工 gold | 未完成；当前是多代理机器候选参考 | 只能发布 provisional proxy |
| Reference 与被测系统来源独立 | 火山在文字/边界上有高 exact-match 和产品同源 | 火山分数可能偏乐观 |
| 同协议/同粒度 | Qwen 外接 token、火山原生 token、MOSS 原生 segment | 时间戳模型本体不能直接混排 |
| 完整模型矩阵 | speaker Qwen unsupported；MOSS 多窗缺失/截断 | N/A 不能按 0 分或第三名 |
| 排序稳定性 | 时间戳加入低置信段后翻转；MOSS–Qwen ASR CI 跨 0 | 不发布 directional winner |
| 场景覆盖 | 三期播客、一个三系统公共准确率窗口 | 不能外推成所有播客或总体冠军 |

## 三张榜的数字

### ASR：张翼 front

| 排名 | 系统 | errors/reference chars | CER | 直接 reference leakage |
|---:|---|---:|---:|---|
| 1 | 火山 | 10/522 | 1.92% | 是 |
| 2 | MOSS | 22/522 | 4.21% | 未发现 |
| 3 | Qwen | 44/522 | 8.43% | 未发现 |

### 时间戳：张翼 front 部署栈

| 排名 | 系统 | both≤1s | boundary MAE | median IoU |
|---:|---|---:|---:|---:|
| 1 | 火山原生 token | 95.18% | 0.353s | 1.000 |
| 2 | Qwen+外接 token | 91.57% | 0.621s | 0.902 |
| 3 | MOSS 原生 segment | 89.02% | 0.675s | 0.942 |

### 发言人：张翼 front

| 排名 | 系统 | cpCER | DER | JER |
|---:|---|---:|---:|---:|
| 1 | MOSS | 5.42% | 5.82% | 4.20% |
| 2 | 火山 | 10.74% | 6.20% | 13.26% |
| N/A | Qwen | N/A | N/A | N/A |

## 最少人工动作

统一队列将 ASR、时间戳和发言人问题合并，用户一次听音频即可同时填三维答案。不要从三条上游队列
分别开始，也不要整段重听 10 分钟。先处理 P0；无法判断时填 `UNABLE`，不猜测。

入口：[复核指南 v2](PODCAST_HUMAN_REVIEW_GUIDE-v2.md)。冻结队列版本与统计见 Coverage v7。

## 选型补充

[小参数 ASR 定位报告 v2](SMALL_ASR_MODEL_POSITIONING_REPORT-v2.md)用于回答“为什么不直接选参数最小/最大”：
专用小模型、商业 API、强开放模型各有不同的隐私、成本、延迟和运维边界。真正验收必须把 CER、失败率、
尾部覆盖、时间戳、speaker、RTF 和总成本分开，不使用厂商 benchmark 拼总榜。
