PEFT
Safetensors
fine-tuning
dpo
arena-dataset
lora
rlhf
mistral-7b-dpo-arena / tokenizer.model

Commit History

Add DPO model trained on Arena dataset
4cebb7d
verified

gCao commited on