inference-optimization/DeepSeek-V4-Pro-0.5B-A0.37B Text Generation • 0.5B • Updated 10 days ago • 159
inference-optimization/temporary-3-layer-Qwen3-VL-1.0B-A0.4B-Instruct Image-Text-to-Text • 1B • Updated 11 days ago • 30
inference-optimization/Qwen3-8B-speculator.dflash.swa.dpace.fullvocab.adamw-qwen235b-instruct-bs16-v2-ckpt6 2B • Updated 11 days ago • 13
inference-optimization/Qwen3-8B-speculator.dflash.swa.dpace.fullvocab.muon-qwen235b-instruct-bs16-v2-ckpt0 2B • Updated 11 days ago • 12
inference-optimization/Qwen3-8B-speculator.dflash.swa.dpace.fullvocab.muon-qwen235b-instruct-bs16-v2-ckpt8 2B • Updated 11 days ago • 16
inference-optimization/Qwen3-8B-speculator.dflash.swa.dpace.fullvocab.adamw-qwen235b-instruct-bs16-v2-ckpt5 2B • Updated 11 days ago • 2
inference-optimization/Qwen3-8B-speculator.dflash.swa.dpace.fullvocab.adamw-qwen235b-instruct-bs16-v2-ckpt4 2B • Updated 11 days ago • 10
inference-optimization/Qwen3-8B-speculator.dflash.swa.dpace.fullvocab.adamw-qwen235b-instruct-bs16-v2-ckpt3 2B • Updated 11 days ago • 2
inference-optimization/Qwen3-8B-speculator.dflash.swa.dpace.fullvocab.adamw-qwen235b-instruct-bs16-v2-ckpt2 2B • Updated 11 days ago • 10
inference-optimization/Qwen3-8B-speculator.dflash.swa.dpace.fullvocab.adamw-qwen235b-instruct-bs16-v2-ckpt1 2B • Updated 11 days ago • 1
inference-optimization/Qwen3-8B-speculator.dflash.swa.dpace.fullvocab.adamw-qwen235b-instruct-bs16-v2-ckpt0 2B • Updated 12 days ago • 1
inference-optimization/Inkling-0.6B-A0.6B Image-Text-to-Text • 0.6B • Updated 12 days ago • 1.43k • 1
inference-optimization/Qwen3-8B-speculator.dflash.swa.dpace.fullvocab-qwen235b-instruct-bs16-ckpt7 2B • Updated 13 days ago • 16
inference-optimization/Qwen3-8B-speculator.dflash.swa.dpace.fullvocab-qwen235b-instruct-bs16-ckpt6 2B • Updated 13 days ago • 16
inference-optimization/Qwen3-8B-speculator.dflash.swa.dpace.fullvocab.muon-qwen235b-instruct-bs16-ckpt5 2B • Updated 13 days ago • 18
inference-optimization/Qwen3-8B-speculator.dflash.swa.dpace.fullvocab.muon-qwen235b-instruct-bs16-ckpt4 2B • Updated 13 days ago • 18
inference-optimization/Qwen3-8B-speculator.dflash.swa.dpace.fullvocab.muon-qwen235b-instruct-bs16-ckpt3 2B • Updated 13 days ago • 15
inference-optimization/Qwen3-8B-speculator.dflash.swa.dpace.fullvocab.muon-qwen235b-instruct-bs16-ckpt2 2B • Updated 13 days ago • 17
inference-optimization/Qwen3-8B-speculator.dflash.swa.dpace.fullvocab.muon-qwen235b-instruct-bs16-ckpt1 2B • Updated 13 days ago • 16
inference-optimization/Qwen3-8B-speculator.dflash.swa.dpace.fullvocab.muon-qwen235b-instruct-bs16-ckpt0 2B • Updated 13 days ago • 18
inference-optimization/Qwen3-8B-speculator.dflash.swa.dpace.fullvocab-qwen235b-instruct-bs16-ckpt5 2B • Updated 14 days ago • 15
inference-optimization/Qwen3-8B-speculator.dflash.swa.dpace.fullvocab-qwen235b-instruct-bs16-ckpt4 2B • Updated 14 days ago • 20
inference-optimization/Qwen3-8B-speculator.dflash.swa.dpace.fullvocab-qwen235b-instruct-bs16-ckpt3 2B • Updated 14 days ago • 20
inference-optimization/Qwen3-8B-speculator.dflash.swa.dpace.fullvocab-qwen235b-instruct-bs16-ckpt2 2B • Updated 14 days ago • 17
inference-optimization/Qwen3-8B-speculator.dflash.swa.dpace.fullvocab-qwen235b-instruct-bs16-ckpt1 2B • Updated 14 days ago • 15
inference-optimization/Qwen3-8B-speculator.dflash.swa.dpace.fullvocab-qwen235b-instruct-bs16-ckpt0 2B • Updated 14 days ago • 23 • 1
inference-optimization/Qwen3-VL-1.0B-A0.4B-Instruct Image-Text-to-Text • 1B • Updated 16 days ago • 283 • 1