补「按句配对自举」与「95% CI」的解释注释
Browse files
README.md
CHANGED
|
@@ -37,6 +37,27 @@ tokenizer**,所以首遍文本可以直接喂给 decoder 或热词 RAG,中
|
|
| 37 |
对照那一列是同一批数据、同一套超参训出来的
|
| 38 |
[Qwen3-ASR 版](https://huggingface.co/JazerJu/qwen3-asr-ctc)。GLM 在五个集上
|
| 39 |
全面领先,按句配对自举 2000 次、八次对比全部 100.0%,没有一个置信区间沾到 0。
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
| 40 |
差距很可能来自编码器容量:GLM 的 audio tower 是 635.0 M 参数 / 有效宽度 1280,
|
| 41 |
Qwen3 是 317.5 M / 1024 —— Qwen3-ASR-1.7B 把容量放在 LLM 上,
|
| 42 |
对一个永远看不到 LLM 的 CTC 头恰好是反的。
|
|
|
|
| 37 |
对照那一列是同一批数据、同一套超参训出来的
|
| 38 |
[Qwen3-ASR 版](https://huggingface.co/JazerJu/qwen3-asr-ctc)。GLM 在五个集上
|
| 39 |
全面领先,按句配对自举 2000 次、八次对比全部 100.0%,没有一个置信区间沾到 0。
|
| 40 |
+
|
| 41 |
+
> **「按句配对自举」和「95% CI」是什么**
|
| 42 |
+
>
|
| 43 |
+
> 测试集就固定那几千句,万一恰好抽到的这批句子对某个模型友好呢?**自举**就是
|
| 44 |
+
> 模拟「换一批句子会怎样」:从原测试集里**有放回**地随机抽同样多的句子,组成一个
|
| 45 |
+
> 「平行世界的测试集」,算一遍错误率,重复 2000 次,看这 2000 个结果的散布。
|
| 46 |
+
>
|
| 47 |
+
> **按句**而不是按字 —— 错误在句子内部是聚集的(一句崩了往往连着错十几个字),
|
| 48 |
+
> 按字当独立样本会把有效样本量高估好几倍,置信区间算得过窄。
|
| 49 |
+
>
|
| 50 |
+
> **配对** —— 每次抽出的那批句子,**两个模型都在同一批上算**。这样「这批句子难不难」
|
| 51 |
+
> 对两边影响相同,做差时抵消掉,剩下的才是模型的真实差异。实测在 aishell1_test 上
|
| 52 |
+
> 配对能把 CI 宽度压到非配对的一半(0.263pp vs 0.529pp),同一个真实差值
|
| 53 |
+
> +0.208pp,配对能下结论、非配对跨 0 判不出方向。
|
| 54 |
+
>
|
| 55 |
+
> **95% CI**(置信区间)就是这 2000 个差值排序后中间 95% 的范围。**不含 0** 表示
|
| 56 |
+
> 换哪批句子结论都一样,差异是稳的;**跨 0** 表示有些平行世界甲更好、有些乙更好,
|
| 57 |
+
> 方向判不出来,只能当噪声。
|
| 58 |
+
>
|
| 59 |
+
> 实现见 [`scripts/bootstrap_compare.py`](https://github.com/JazerJu/glm-asr-ctc-train)。
|
| 60 |
+
|
| 61 |
差距很可能来自编码器容量:GLM 的 audio tower 是 635.0 M 参数 / 有效宽度 1280,
|
| 62 |
Qwen3 是 317.5 M / 1024 —— Qwen3-ASR-1.7B 把容量放在 LLM 上,
|
| 63 |
对一个永远看不到 LLM 的 CTC 头恰好是反的。
|