GGUF
saor
sparse
opencl
ALIA-40b-saor / README.md
aitups's picture
Upload README.md with huggingface_hub
c45ca1a verified
|
Raw
History Blame Contribute Delete
2.44 kB
---
license: cc-by-sa-4.0
base_model: mradermacher/ALIA-40b-GGUF
tags:
- saor
- sparse
- gguf
- opencl
---
# ALIA-40b-saor
Modelo **ALIA-40b** con los bloques FFN podados según la **topología CPPN** del
loop evolutivo de SAOR (Vía B): un genoma CPPN de 466 floats con coordenada de
capa decodifica la adyacencia binaria de cada capa, y los pesos activos se
re-empaquetan en **Q4_K** (formato GGUF disperso **D16**). Modelo base: arquitectura
llama densa (48 bloques FFN `[8192 → 24576]`).
| Métrica | Valor |
|---|---|
| Divergencia KL (vs base, n_pos=4) | **0.723** |
| Compresión D_arch | **0.018** (modelo completo) |
| Capas esparsas | 48 |
| Método de poda | Topología CPPN binaria (Vía B) |
> **Nota sobre el método:** ALIA-40b es **~100× más sensible** a la poda del FFN
> que Qwen3.8-27B: la poda por magnitud uniforme "explota" (KL 2.15 a sp 0.2), y
> ni siquiera la topología CPPN supera KL 0.723 a compresiones mayores. Este
> modelo es el mejor resultado SAOR para ALIA-40b: **1.8 % de compresión
> arquitectónica con KL 0.723**. Para comparar métodos en los otros modelos del
> proyecto, ver Qwen3.8-27B-saor (magnitud + perfil CPPN) y Qwen3.5-4B-saor
> (magnitud + perfil CPPN).
## Ejecutar con [Hayai](https://github.com/hayai-org/hayai)
```bash
# 1. Compilar Hayai
cd hayai && cargo build --release
# 2. Dry-run del plan
cargo run --release -p hayai-cli -- plan --model ALIA-40b-saor.gguf
# 3. Generar texto (streaming por capas — 40b no cabe en VRAM pequeña)
cargo run --release -p hayai-cli -- generate \
--model ALIA-40b-saor.gguf \
--prompt "The capital of Spain is" \
--max-tokens 64 \
--device auto
```
### Evaluar la divergencia KL
```bash
cargo run --release --example kl_eval -- \
--orig ALIA-40b.Q4_K_M.gguf \
--sparse ALIA-40b-saor.gguf \
--prompts calib128.txt --n-positions 4 --device auto
```
## Archivos
- `ALIA-40b-saor.gguf` — el modelo disperso (~25 GB, Q4_K).
- Genoma CPPN (466 f32) disponible bajo demanda.
## Reproducibilidad
Topología CPPN global (Vía B) del loop evolutivo de SAOR (`via_b_evolve
--batch-eval`, 4 generaciones). La adyacencia se decodifica en GPU
(`embed_sparse --genome --gpu`). Genoma (466 f32) e histórico disponibles bajo
demanda.
**Atribución**: modelo base `mradermacher/ALIA-40b-GGUF` (BSC-LT) — consulte la
licencia del modelo base.