# 普通中文会议：首轮双模型结论

在这 3 条同协议 AISHELL-4 普通中文会议上，`moss-transcribe-diarize-0.9b` 是可证明的转录赢家：三条配对 CER 的 95% 区间排除了零。

这个结论只回答**整段会议转录谁更准**，不代表播客、重叠会议、实时 ASR 或综合能力总冠军。

## 一眼看懂

| 模型 | 完成率 | 三条等权 CER | 合并字符 CER |
|---|---:|---:|---:|
| `qwen3-asr-1.7b` | 100.00% | 23.69% | 23.53% |
| `moss-transcribe-diarize-0.9b` | 100.00% | 22.38% | 22.23% |

CER 是字符错误率，越低越好；“三条等权”防止最长会议支配结果，“合并字符”反映总字符上的错误比例。

## 三条逐样本证据

| 样本 | Qwen CER | MOSS CER | MOSS − Qwen |
|---|---:|---:|---:|
| `aishell4_test_l_r003s01c02` | 26.45% | 24.90% | -1.55% |
| `aishell4_test_m_r003s01c01` | 28.04% | 25.69% | -2.36% |
| `aishell4_test_s_r003s01c01` | 16.58% | 16.54% | -0.04% |

## 为什么能／不能称为可证明赢家

配对差值定义为 `MOSS CER − Qwen CER`；均值为 `-0.013155`，精确配对 bootstrap 95% CI 为 `[-0.021818, -0.003666]`。区间完全大于零表示 Qwen 可证明更低，完全小于零表示 MOSS 可证明更低；跨过零则不作证明声明。

## 另外两个用户关心的维度

- 发言人：MOSS 原生支持并保留 cpCER/DER/JER；Qwen 本轮明确不支持，所以不能做双模型发言人赢家比较。
- 时间戳：Qwen 使用外接 forced aligner；MOSS 是原生 segment 时间戳。协议层级不同，本快照只列能力，不把两者混成一个准确率排名。

## 复用边界

推理原始产物没有改写。若以后调整 CER 归一化或置信区间规则，应从保留的证据生成新版本快照，不重跑模型、不覆盖本版。
