PEFT
Safetensors
fine-tuning
dpo
arena-dataset
lora
rlhf
mistral-7b-dpo-arena / tokenizer_config.json

Commit History

Add DPO model trained on Arena dataset
4cebb7d
verified

gCao commited on