Inference Providers
Active filters: cuda
prism-ml/Ternary-Bonsai-27B-gguf
Text Generation
• 27B • Updated • 784k
• • 1.17k
Text Generation
• 27B • Updated • 2.65M
• 746
prism-ml/Bonsai-27B-mlx-1bit
Text Generation
• 2B • Updated • 664k
• 205
prism-ml/Ternary-Bonsai-27B-mlx-2bit
Text Generation
• 3B • Updated • 663k
• 168
ussoewwin/Flash-Attention-2_for_Windows
Updated • 129
badtheorylabs/BTL-3-Compact
Text Generation
• 8B • Updated • 2.49k
• 40
Text Generation
• 8B • Updated • 70.8k
• 765
prism-ml/Bonsai-1.7B-gguf
Text Generation
• 2B • Updated • 51.6k
• 87
armanibadboy/WAL-Ternary-8B
Text Generation
• Updated • 3
EschaLabs/escha-runtime-qwen3moe
Hellohal2064/vllm-dgx-spark-gb10
Text Generation
• Updated • 8
Text Generation
• 4B • Updated • 18.6k
• 54
prism-ml/bonsai-image-binary-4B-gemlite-1bit
Text-to-Image
• Updated • 235
• 49
prism-ml/bonsai-image-ternary-4B-gemlite-2bit
Text-to-Image
• Updated • 4.26k
• 131
ESpeech/milfer_denoiser_v1.0
Audio-to-Audio
• Updated • 6
neroued/Qwen3.6-35B-A3B-NInfer
Image-Text-to-Text
• Updated • 5.94k
• 3
neroued/Qwen3.6-27B-nvfp4-NInfer
Image-Text-to-Text
• Updated • 294
• 3
Efficient-Large-Model/Sol-Attn-Kernel-Source
Updated • 1
Text Generation
• Updated • 15
• 23
CalderaAI/13B-Ouroboros-GPTQ4bit-128g-CUDA
Text Generation
• Updated • 6
marcorez8/llama-cpp-python-windows-blackwell-cuda
ValiantLabs/Qwen3-8B-ShiningValiant3
Text Generation
• 8B • Updated • 8
• 3
mradermacher/Qwen3-8B-ShiningValiant3-GGUF
8B • Updated • 592
• 2
mradermacher/Qwen3-8B-ShiningValiant3-i1-GGUF
8B • Updated • 365
• 2
ValiantLabs/Qwen3-1.7B-ShiningValiant3
Text Generation
• 2B • Updated • 14
• 5
mradermacher/Qwen3-1.7B-ShiningValiant3-GGUF
2B • Updated • 160
mradermacher/Qwen3-1.7B-ShiningValiant3-i1-GGUF
2B • Updated • 399
ValiantLabs/Qwen3-4B-ShiningValiant3
Text Generation
• 4B • Updated • 50
• 7
sequelbox/Qwen3-8B-PlumEsper
Text Generation
• 8B • Updated • 10