PEFT
Safetensors
fine-tuning
dpo
arena-dataset
lora
rlhf
gCao's picture
Add DPO model trained on Arena dataset
4cebb7d verified