PEFT
Safetensors
fine-tuning
dpo
arena-dataset
lora
rlhf
mistral-7b-dpo-arena / special_tokens_map.json
gCao's picture
Add DPO model trained on Arena dataset
4cebb7d verified
Raw
History Blame Contribute Delete
449 Bytes
{
"bos_token": {
"content": "<s>",
"lstrip": false,
"normalized": false,
"rstrip": false,
"single_word": false
},
"eos_token": {
"content": "<|im_end|>",
"lstrip": false,
"normalized": false,
"rstrip": false,
"single_word": false
},
"pad_token": "<|im_end|>",
"unk_token": {
"content": "<unk>",
"lstrip": false,
"normalized": false,
"rstrip": false,
"single_word": false
}
}