--- license: apache-2.0 language: - pl base_model: - speakleash/Bielik-4.5B-v3.0-Instruct pipeline_tag: text-generation library_name: transformers tags: - bielik - polish - nvfp4 - fp4 - compressed-tensors - vllm - quantized --- # Bielik-4.5B-v3.0-Instruct — NVFP4 (W4A4) Kwantyzacja **NVFP4 (W4A4)** modelu [speakleash/Bielik-4.5B-v3.0-Instruct](https://huggingface.co/speakleash/Bielik-4.5B-v3.0-Instruct), w formacie `compressed-tensors` (`nvfp4-pack-quantized`) gotowym do **vLLM**. - **Wagi:** 4-bit (FP4 E2M1), grupy po 16, blokowe skale FP8 (E4M3) + globalna skala FP32 - **Aktywacje:** 4-bit FP4 (dynamiczne, per-grupa) - **Pominięte:** `lm_head` (pełna precyzja) - **Rozmiar:** ~8,9 GB (bf16) → **~2,7 GB** ## Kalibracja PTQ przez [`llm-compressor`](https://github.com/vllm-project/llm-compressor), 512 próbek polskiej Wikipedii, długość sekwencji 2048. Kalibracja na polskim tekście dla zachowania jakości w języku docelowym. ## Sprzęt NVFP4 jest akcelerowany sprzętowo na **Blackwellu (sm_100+)**. Na starszych GPU (np. Ada/RTX 4090) vLLM ładuje model przez kernel **Marlin (weight-only FP4)** — działa wszędzie, zysk to mniejszy VRAM. ## Użycie (vLLM) ```bash vllm serve /Bielik-4.5B-v3.0-Instruct-NVFP4 --max-model-len 8192 ``` ## Licencja i atrybucja Apache-2.0, dziedziczona z modelu bazowego (SpeakLeash & ACK Cyfronet AGH). Ten checkpoint to wyłącznie kwantyzacja oryginalnych wag.