630 GB
296 files
Updated 3 days ago
Name
Size
ACE-Step1.5-GGUF
AudioSR-GGUF
BS-RoFormer-ep368-GGUF
Breeze-TTS-2-GGUF
Chatterbox-GGUF
Citrinet-ASR-GGUF
Confucius4-TTS-GGUF
ControlFoley-GGUF
CosyVoice3-GGUF
DotTTS-Edit-GGUF
DotTTS-MF-GGUF
DotTTS-SOAR-GGUF
DramaBox-GGUF
FireRedAudio-GGUF
FireRedTTS3-Base-GGUF
FireRedTTS3-Instruct-GGUF
Fish-Audio-S2-Pro-GGUF
Fun-ASR-Nano-2512-GGUF
Granite-Speech-5.0-470M-TurboCTC-GGUF
HTDemucs-GGUF
HeartMuLa-GGUF
Higgs-Audio-v3-STT-GGUF
Higgs-Audio-v3-TTS-4B-GGUF
Hviske-v5.3-GGUF
IndexTTS2-GGUF
IndexTTS2.5-GGUF
Inflect-Micro-v2-GGUF
Irodori-TTS-500M-v3-GGUF
Irodori-TTS-600M-v3-VoiceDesign-GGUF
Irodori-TTS-v4-Small-GGUF
Kroko-ASR-GGUF
MMS-Forced-Aligner-GGUF
MOSS-TTS-Local-v1.5-GGUF
MOSS-TTS-Nano-100M-GGUF
MOSS-VoiceGenerator-GGUF
MagpieTTS-Multilingual-357M-GGUF
MeanVC2-GGUF
Mel-Band-RoFormer-GGUF
MiDashengLM-Gen-GGUF
MiniMax-H3-Q4-GGUF
MioCodec-25Hz-44.1kHz-v2-GGUF
MioTTS-1.7B-GGUF
MuScriptor-Small-GGUF
Nemotron-3.5-ASR-Streaming-0.6B-GGUF
NeuTTS-2E-GGUF
OmniVoice-GGUF
Parakeet-TDT-0.6B-v3-GGUF
PersonaPlex-GGUF
PocketTTS-GGUF
Qwen3-ASR-0.6B-GGUF
Qwen3-ASR-1.7B-GGUF
Qwen3-ForcedAligner-0.6B-GGUF
Qwen3-TTS-12Hz-0.6B-Base-GGUF
Qwen3-TTS-12Hz-1.7B-Base-GGUF
Qwen3-TTS-12Hz-1.7B-CustomVoice-GGUF
Qwen3-TTS-12Hz-1.7B-VoiceDesign-GGUF
RVC-GGUF
SeedVC-MLX-GGUF
Sortformer-Diar-4spk-v1-GGUF
Stable-Audio-3-Medium-GGUF
Stable-Audio-3-Small-Music-GGUF
Stable-Audio-3-Small-SFX-GGUF
Supertonic-3-GGUF
Vevo2-GGUF
VibeVoice-1.5B-GGUF
VibeVoice-ASR-GGUF
VoxCPM1-GGUF
VoxCPM2-GGUF
Voxtral-Mini-4B-Realtime-2602-GGUF
.gitattributes4.39 kB
xet
README.md8.17 kB
xet
README.md

audio.cpp GGUF Model Packages

This directory contains audio.cpp-native GGUF conversions of multiple speech models. These files are intended for use with audio.cpp.

If you enjoy the project, please star audio.cpp on GitHub and this Hugging Face repository.

For conversion details, supported layouts, direct-file loading, sidecar embedding, and the latest compatibility notes, see the audio.cpp GGUF guide:

!!! Converted and quantized packages are checked with automated metrics, but perceived quality can still differ for human listeners. Please validate the exact package, backend, and route to confirm the output is acceptable for your use case.

Files

The table lists the GGUF packages currently provided by this repository.

Directory audio.cpp family GGUF provided Original model license
ACE-Step1.5-GGUF ace_step BF16 + Q8 MIT
AudioSR-GGUF audiosr F32 MIT
BS-RoFormer-ep368-GGUF bs_roformer Q8 Apache-2.0
Chatterbox-GGUF chatterbox F16 + Q8 MIT
Citrinet-ASR-GGUF citrinet_asr Q8 CC-BY-4.0
Confucius4-TTS-GGUF confucius4_tts original Apache-2.0
ControlFoley-GGUF controlfoley F32 Apache-2.0
DotTTS-Edit-GGUF dots_tts BF16 + Q8 Apache-2.0
DotTTS-MF-GGUF dots_tts BF16 Apache-2.0
DotTTS-SOAR-GGUF dots_tts original + BF16 Apache-2.0
DramaBox-GGUF dramabox Q8 LTX-2 Community License
Fish-Audio-S2-Pro-GGUF fish_audio BF16 + Q8 Fish Audio Research License
Fun-ASR-Nano-2512-GGUF fun_asr_nano F16 + Q8 FunASR Model Open Source License Agreement v1.1
HeartMuLa-GGUF heartmula F16 + Q8 Apache-2.0
HTDemucs-GGUF htdemucs F16 + Q8 MIT
Higgs-Audio-v3-STT-GGUF higgs_audio_stt F16 + Q8 Apache-2.0
Higgs-Audio-v3-TTS-4B-GGUF higgs_audio_tts BF16 + Q8 Boson Higgs TTS 3 Research and Non-Commercial License
Hviske-v5.3-GGUF hviske_asr Q8 CC-BY-NC-4.0
IndexTTS2-GGUF index_tts2 original + F16 + Q8 bilibili Model Use License Agreement
IndexTTS2.5-GGUF index_tts2 original + F16 + Q8 bilibili Model Use License Agreement
Inflect-Micro-v2-GGUF inflect_v2 original Apache-2.0
Irodori-TTS-500M-v3-GGUF irodori_tts F16 + Q8 MIT
Irodori-TTS-600M-v3-VoiceDesign-GGUF irodori_tts F16 + Q8 MIT
Irodori-TTS-v4-Small-GGUF irodori_tts F16 + Q8 MIT
Kroko-ASR-GGUF kroko_asr Q8 CC-BY-SA community model license
MMS-Forced-Aligner-GGUF mms_forced_aligner F16 CC-BY-NC-4.0
MOSS-TTS-Local-v1.5-GGUF moss_tts_local BF16 + Q8 Apache-2.0
MOSS-TTS-Nano-100M-GGUF moss_tts_nano BF16 + Q8 Apache-2.0
MOSS-VoiceGenerator-GGUF moss_voicegen BF16 + F16 codec decode Apache-2.0
MagpieTTS-Multilingual-357M-GGUF magpie_tts original NVIDIA Open Model License
MeanVC2-GGUF meanvc2 F32 + Q4_K Apache-2.0
Mel-Band-RoFormer-GGUF mel_band_roformer F16 + Q8 MIT
MiniMax-H3-Q4-GGUF minimax_h3 Q4_K + INT8 DiT option MiniMax-H3 Community License
MioCodec-25Hz-44.1kHz-v2-GGUF miocodec original + F16 + Q8 MIT
MioTTS-1.7B-GGUF miotts original + BF16 + Q8 Apache-2.0
MuScriptor-Small-GGUF muscriptor F32 CC-BY-NC-4.0
Nemotron-3.5-ASR-Streaming-0.6B-GGUF nemotron_asr F16 + Q8 OpenMDW-1.1
NeuTTS-2E-GGUF neutts original Apache-2.0
OmniVoice-GGUF omnivoice BF16 + F16 + Q8 Apache-2.0
Parakeet-TDT-0.6B-v3-GGUF parakeet_tdt F16 + Q8 CC-BY-4.0
PersonaPlex-GGUF personaplex Q4_K + Q8 Apache-2.0
PocketTTS-GGUF pocket_tts BF16 + Q8 CC-BY-4.0
Qwen3-ASR-0.6B-GGUF qwen3_asr F16 + Q8 Apache-2.0
Qwen3-ASR-1.7B-GGUF qwen3_asr F16 + Q8 Apache-2.0
Qwen3-ForcedAligner-0.6B-GGUF qwen3_forced_aligner F16 + Q8 Apache-2.0
Qwen3-TTS-12Hz-0.6B-Base-GGUF qwen3_tts BF16 + Q8 Apache-2.0
Qwen3-TTS-12Hz-1.7B-Base-GGUF qwen3_tts original + BF16 + Q8 Apache-2.0
Qwen3-TTS-12Hz-1.7B-CustomVoice-GGUF qwen3_tts BF16 + Q8 Apache-2.0
Qwen3-TTS-12Hz-1.7B-VoiceDesign-GGUF qwen3_tts BF16 + Q8 Apache-2.0
RVC-GGUF rvc F16 MIT
SeedVC-MLX-GGUF seed_vc original + F16 + Q8 GPL-3.0
Sortformer-Diar-4spk-v1-GGUF sortformer_diar F16 + Q8 CC-BY-NC-4.0
Stable-Audio-3-Medium-GGUF stable_audio F16 + Q8 Stability AI Community License
Stable-Audio-3-Small-Music-GGUF stable_audio F16 + Q8 Stability AI Community License
Stable-Audio-3-Small-SFX-GGUF stable_audio F16 + Q8 Stability AI Community License
Supertonic-3-GGUF supertonic original + F16 + Q8 BigScience Open RAIL-M
Vevo2-GGUF vevo2 original + F16 + Q8 CC-BY-NC-ND-4.0
VibeVoice-1.5B-GGUF vibevoice BF16 + Q8 + Q4 MIT
VibeVoice-ASR-GGUF vibevoice_asr F16 + Q8 MIT
VoxCPM2-GGUF voxcpm2 original + BF16 + Q8 Apache-2.0
Voxtral-Mini-4B-Realtime-2602-GGUF voxtral_realtime BF16 + Q8 + Q4_K Apache-2.0

Usage

Pass a GGUF file directly as --model:

audiocpp_cli --task tts --family supertonic --model Supertonic-3-GGUF/supertonic-3-orig.gguf --backend cuda --language en --text "Hello." --voice-id M1 --out out.wav

For ASR:

audiocpp_cli --task asr --family qwen3_asr --model Qwen3-ASR-0.6B-GGUF/qwen3-asr-0.6b-f16.gguf --backend cuda --audio speech.wav --text "" --text-out transcript.txt

License

Each GGUF file is a converted form of its original model. Use and redistribution are governed by the corresponding original model license listed above. Please review the original model card and license terms before using or redistributing any converted weights.

Total size
630 GB
Files
296
Last updated
Sep 2
Pre-warmed CDN
US EU US EU

Contributors