GGUF
saor
sparse
opencl
ALIA-40b-saor / README.md
aitups's picture
Upload README.md with huggingface_hub
c45ca1a verified
|
Raw
History Blame Contribute Delete
2.44 kB
metadata
license: cc-by-sa-4.0
base_model: mradermacher/ALIA-40b-GGUF
tags:
  - saor
  - sparse
  - gguf
  - opencl

ALIA-40b-saor

Modelo ALIA-40b con los bloques FFN podados según la topología CPPN del loop evolutivo de SAOR (Vía B): un genoma CPPN de 466 floats con coordenada de capa decodifica la adyacencia binaria de cada capa, y los pesos activos se re-empaquetan en Q4_K (formato GGUF disperso D16). Modelo base: arquitectura llama densa (48 bloques FFN [8192 → 24576]).

Métrica Valor
Divergencia KL (vs base, n_pos=4) 0.723
Compresión D_arch 0.018 (modelo completo)
Capas esparsas 48
Método de poda Topología CPPN binaria (Vía B)

Nota sobre el método: ALIA-40b es ~100× más sensible a la poda del FFN que Qwen3.8-27B: la poda por magnitud uniforme "explota" (KL 2.15 a sp 0.2), y ni siquiera la topología CPPN supera KL 0.723 a compresiones mayores. Este modelo es el mejor resultado SAOR para ALIA-40b: 1.8 % de compresión arquitectónica con KL 0.723. Para comparar métodos en los otros modelos del proyecto, ver Qwen3.8-27B-saor (magnitud + perfil CPPN) y Qwen3.5-4B-saor (magnitud + perfil CPPN).

Ejecutar con Hayai

# 1. Compilar Hayai
cd hayai && cargo build --release

# 2. Dry-run del plan
cargo run --release -p hayai-cli -- plan --model ALIA-40b-saor.gguf

# 3. Generar texto (streaming por capas — 40b no cabe en VRAM pequeña)
cargo run --release -p hayai-cli -- generate \
  --model ALIA-40b-saor.gguf \
  --prompt "The capital of Spain is" \
  --max-tokens 64 \
  --device auto

Evaluar la divergencia KL

cargo run --release --example kl_eval -- \
  --orig ALIA-40b.Q4_K_M.gguf \
  --sparse ALIA-40b-saor.gguf \
  --prompts calib128.txt --n-positions 4 --device auto

Archivos

  • ALIA-40b-saor.gguf — el modelo disperso (~25 GB, Q4_K).
  • Genoma CPPN (466 f32) disponible bajo demanda.

Reproducibilidad

Topología CPPN global (Vía B) del loop evolutivo de SAOR (via_b_evolve --batch-eval, 4 generaciones). La adyacencia se decodifica en GPU (embed_sparse --genome --gpu). Genoma (466 f32) e histórico disponibles bajo demanda.

Atribución: modelo base mradermacher/ALIA-40b-GGUF (BSC-LT) — consulte la licencia del modelo base.