zhipingYang's picture
mirror Qwen3-ForcedAligner-0.6B-GGUF from ModelScope(逐字节一致)+ 中英双语模型卡
78b715a verified
|
Raw
History Blame Contribute Delete
6.1 kB

Qwen3-ForcedAligner-0.6B · 全本地字级时间戳

License: Apache 2.0 Runs Local Platform

给一段音频和它的文字转写,本模型标出每个字 / 词是在第几秒说的(精确到 80 毫秒)——全部在你自己的电脑上完成,不上云、免费、私密

模型由阿里 Qwen 团队研发、以 Apache-2.0 开源(Qwen3-ForcedAligner,Qwen3-ASR 家族)。本仓不是新模型,而是我们把它转换成能在你电脑上离线运行的 GGUF 部署档。它是一个增强模型、本身不做转写:转写仍由 Qwen3-ASR 完成,本模型为其补上精确的字级时间。

一、它解决什么问题

语音转文字(ASR)能告诉你「说了什么」,却通常不告诉你「每个字是在第几秒说的」。而很多场景恰恰离不开这份时间信息:

  • 生成字幕:SRT / VTT 字幕需要每句话对齐到精确的起止时间;
  • 音视频剪辑与检索:按文字跳到音频对应位置、精准剪掉某一句;
  • 可访问性与学习:逐字高亮跟读、听读对照。

过去要拿到精确的字级时间,往往得依赖云端服务——把你的音频上传到别人的服务器,既有隐私顾虑,也可能产生费用。本模型让这一步完全在本地完成

二、它是怎么做到的

  • 输入「音频 + 转写文本」,输出每个字 / 词的起止时间(80 毫秒帧粒度)。
  • 自带音频编码器,因此不挑你用的是哪个 ASR——一次下载,即可搭配任意 Qwen3-ASR(0.6B / 1.7B 通用),不必为每个尺寸各存一份对齐权重。
  • 单次前向即可完成(非自回归),速度很快;跨 macOS / Windows / Linux 本地运行。

三、效果如何

在 Apple M3 Max 上,用一段中文多人会议音频(55 秒 / 约 150 词 / 300 个字级时间点),与参考实现(PyTorch 全精度)的逐字标准答案逐一对比:

指标 结果
时间点与参考完全一致 84.3%
落在参考 ±1 帧(80 毫秒)以内 98.7%
分词与参考完全对齐 100%
处理速度(RTF) 0.0063(55 秒音频约 300 毫秒算完)

其余差异来自本地半精度与参考全精度之间的数值差,而非对齐机制出错——84% 完全一致排除了系统性偏移,98.7% 落在一帧内排除了路径错误,100% 分词对齐排除了对错位置。

四、局限与下一步

  • 需要搭配转写模型:本模型只补时间戳、不做转写,请配合 Qwen3-ASR 使用。
  • 语言支持:中文、以及以空格分词的语言(英文等)已验证;日文 / 韩文需要专用分词器,目前会自动降级、不输出其字级时间戳(宁可暂不提供,也绝不给你错的),后续版本支持。
  • 下一步:扩展语言覆盖、并持续提升数值一致性。

五、怎么下载与使用

本模型专为 活水模型(42model) 打包,推荐通过它获取:

桌面版

  1. 在「模型库」里下载 Qwen3-ForcedAligner
  2. 在你所用的 Qwen3-ASR 转录模型的「参数设置」里,打开「字级时间戳」开关。

之后转录即输出每个字 / 词的起止时间。

文件与许可

文件 作用
aligner-backbone-f16.gguf 对齐主干
aligner-mmproj-f16.gguf 音频编码器
aligner-head.bin 字级分类头

各文件 sha256 见随包 manifest.json 与 ModelScope 文件页,可自行校验。

许可:模型本体为 Qwen3-ForcedAligner-0.6B,© 阿里 Qwen 团队,Apache-2.0(官方源:ModelScope · 技术报告)。本仓为其转换的 GGUF 部署档,同样遵循 Apache-2.0,使用即表示同意上游许可条款。

引用

模型本体请引用上游阿里 Qwen 团队(Qwen3-ASR 技术报告):

@article{Qwen3-ASR,
  title   = {Qwen3-ASR Technical Report},
  author  = {Xian Shi and Xiong Wang and Zhifang Guo and Yongqi Wang and Pei Zhang and Xinyu Zhang and Zishan Guo and Hongkun Hao and Yu Xi and Baosong Yang and Jin Xu and Jingren Zhou and Junyang Lin},
  journal = {arXiv preprint arXiv:2601.21337},
  year    = {2026}
}

本仓的 GGUF 量化部署档对你有帮助,可另附:

@misc{yang2026qwen3forcedalignergguf,
  title        = {Qwen3-ForcedAligner-0.6B-GGUF: A Local Build of Qwen's Qwen3-ForcedAligner},
  author       = {Yang, Zhiping},
  year         = {2026},
  howpublished = {\url{https://modelscope.cn/models/42ailab/Qwen3-ForcedAligner-0.6B-GGUF}},
  organization = {42ailab},
  note         = {GGUF 转换与本地部署封装;模型本体为阿里 Qwen 团队 Qwen3-ForcedAligner(Apache-2.0)。Contact: contact@42ailab.com}
}

联系我们:contact@42ailab.com

关于我们

活水 AI 实验室(42ailab) — 探索智能边界的 AI 创新实验室,以认知科学为基石,推动 AI 与人类智能的深度融合,真正理解并增强智能 —— 碳基的,也是硅基的。

活水模型(42model) — 由活水 AI 实验室出品的高性能本地 AI 大模型推理引擎,让翻译、转写、识别、对话、编程等 AI 能力在你的本机免费私密运行;并可借云端算力微调专属模型,回传本机运行。