whisper-large-v3-turbo-ja-personal-sft-v2 — ggml / whisper.cpp
openai/whisper-large-v3-turbo を日本語の音声入力(LLMへのプロンプト発話)へ LoRA SFT で適応させたモデルの、whisper.cpp 向け ggml 変換・量子化版です。transformers 版は Holy-fox/whisper-large-v3-turbo-ja-personal-sft-v2。
| ファイル | 形式 | サイズ |
|---|---|---|
ggml-whisper-large-v3-turbo-sft-v2-context-q5_0.bin |
Q5_0 | 574 MB |
ggml-whisper-large-v3-turbo-sft-v2-context-q4_0.bin |
Q4_0 | 474 MB |
ggml-whisper-large-v3-turbo-sft-v2-context-f16.bin |
F16 | 1,625 MB |
学習データ
1名の話者が Mac / iPhone / iPad で録音した、LLM への音声入力 約2.5時間を素材にしています。Silero VAD で 30 秒以内に分割して 16 kHz モノラルへ統一し、うち 272 セグメント(約66分)を学習に使いました。転記は人手ではなく、音声対応 LLM に同一音声から複数候補を作らせ、別の審査 LLM が音声を聴いて1つを選ぶ自動疑似ラベルです。汎用の日本語ASRではなく、口語のままの言い回しと、AI/LLM 系の用語・英字略語が混ざる話し方に合わせています。
表記規則
- 製品名は聞こえた発音のカタカナへ統一(
Claude→クロード、Whisper→ウィスパー、ChatGPT→チャットGPT)。文脈から製品名を推測して補うことはせず、その発音が実際に聞こえたときだけ適用します。 - 一文字ずつ読む略語(AI・LLM・GPT・GPU・API・SFT など)は大文字のまま。
- 日本語とラテン文字の境界にスペースを入れず、1.2秒以上の間があって文や話題が切れているところで改行、短い間は「、」、完結した文は「。」。
- フィラー・言い直し・繰り返しは消さずに残します。
精度
短音声 83 セグメントでの文字誤り率。content CER は表記ゆれ(Anthropic↔アンソロピック など)を正規化した後の内容CERです。
| モデル | exact CER | content CER |
|---|---|---|
openai/whisper-large-v3-turbo |
24.17% | 16.14% |
| F16 | 8.21% | 5.27% |
| Q5_0 | 7.66% | 5.04% |
| Q4_0 | 9.05% | 5.99% |
3 形式のうち Q5_0 が短音声・長時間ともに最良でした。Q4_0 は 5 分を超える音声で反復が出ることがあります。
特定話者・特定ドメインへの適応モデルです。他の話者や一般的な日本語音声では、ベースの Whisper のほうが良い結果になる場合があります。
使い方
huggingface-cli download Holy-fox/whisper-large-v3-turbo-ja-personal-sft-v2-ggml \
ggml-whisper-large-v3-turbo-sft-v2-context-q5_0.bin --local-dir ./models
ffmpeg -i input.m4a -ar 16000 -ac 1 -c:a pcm_s16le recording.wav
./build/bin/whisper-cli \
-m ./models/ggml-whisper-large-v3-turbo-sft-v2-context-q5_0.bin \
-f recording.wav -l ja
入力は 16 kHz モノラル WAV です。学習は 30 秒以内のセグメントで行っています。長い録音は VAD で 30 秒以内に分割し、チャンクごとに文脈をリセットして時刻順に連結するのが最も安定します。
ライセンス
ベースモデルの Apache-2.0 を継承します。
Model tree for Holy-fox/whisper-large-v3-turbo-ja-personal-sft-v2-ggml
Base model
openai/whisper-large-v3