JazerJu commited on
Commit
cdaa94a
·
verified ·
1 Parent(s): 1e0dea5

补「按句配对自举」与「95% CI」的解释注释

Browse files
Files changed (1) hide show
  1. README.md +21 -0
README.md CHANGED
@@ -37,6 +37,27 @@ tokenizer**,所以首遍文本可以直接喂给 decoder 或热词 RAG,中
37
  对照那一列是同一批数据、同一套超参训出来的
38
  [Qwen3-ASR 版](https://huggingface.co/JazerJu/qwen3-asr-ctc)。GLM 在五个集上
39
  全面领先,按句配对自举 2000 次、八次对比全部 100.0%,没有一个置信区间沾到 0。
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
40
  差距很可能来自编码器容量:GLM 的 audio tower 是 635.0 M 参数 / 有效宽度 1280,
41
  Qwen3 是 317.5 M / 1024 —— Qwen3-ASR-1.7B 把容量放在 LLM 上,
42
  对一个永远看不到 LLM 的 CTC 头恰好是反的。
 
37
  对照那一列是同一批数据、同一套超参训出来的
38
  [Qwen3-ASR 版](https://huggingface.co/JazerJu/qwen3-asr-ctc)。GLM 在五个集上
39
  全面领先,按句配对自举 2000 次、八次对比全部 100.0%,没有一个置信区间沾到 0。
40
+
41
+ > **「按句配对自举」和「95% CI」是什么**
42
+ >
43
+ > 测试集就固定那几千句,万一恰好抽到的这批句子对某个模型友好呢?**自举**就是
44
+ > 模拟「换一批句子会怎样」:从原测试集里**有放回**地随机抽同样多的句子,组成一个
45
+ > 「平行世界的测试集」,算一遍错误率,重复 2000 次,看这 2000 个结果的散布。
46
+ >
47
+ > **按句**而不是按字 —— 错误在句子内部是聚集的(一句崩了往往连着错十几个字),
48
+ > 按字当独立样本会把有效样本量高估好几倍,置信区间算得过窄。
49
+ >
50
+ > **配对** —— 每次抽出的那批句子,**两个模型都在同一批上算**。这样「这批句子难不难」
51
+ > 对两边影响相同,做差时抵消掉,剩下的才是模型的真实差异。实测在 aishell1_test 上
52
+ > 配对能把 CI 宽度压到非配对的一半(0.263pp vs 0.529pp),同一个真实差值
53
+ > +0.208pp,配对能下结论、非配对跨 0 判不出方向。
54
+ >
55
+ > **95% CI**(置信区间)就是这 2000 个差值排序后中间 95% 的范围。**不含 0** 表示
56
+ > 换哪批句子结论都一样,差异是稳的;**跨 0** 表示有些平行世界甲更好、有些乙更好,
57
+ > 方向判不出来,只能当噪声。
58
+ >
59
+ > 实现见 [`scripts/bootstrap_compare.py`](https://github.com/JazerJu/glm-asr-ctc-train)。
60
+
61
  差距很可能来自编码器容量:GLM 的 audio tower 是 635.0 M 参数 / 有效宽度 1280,
62
  Qwen3 是 317.5 M / 1024 —— Qwen3-ASR-1.7B 把容量放在 LLM 上,
63
  对一个永远看不到 LLM 的 CTC 头恰好是反的。