Reinforcement Learning
PEFT
Safetensors
lora
negotiation
multi-agent
grpo
fairness
2026.RA.Fairness-GRPO-v2-Adapters / lam05_checkpoint-45
365 MB
siddharthmb's picture
v2 fairness-GRPO LoRA adapters: full lambda-frontier (lam1/lam05/lam0 ladders) + card
dbba5e5 verified