PEFT
Safetensors
fine-tuning
dpo
arena-dataset
lora
rlhf

Commit History

Add model card
3d854b9
verified

gCao commited on

Add DPO model trained on Arena dataset
4cebb7d
verified

gCao commited on