PEFT
Safetensors
fine-tuning
dpo
arena-dataset
lora
rlhf

Commit History

Add model card
3d854b9
verified

gCao commited on

Add DPO model trained on Arena dataset
4cebb7d
verified

gCao commited on

initial commit
cae87e5
verified

gCao commited on