cohere-transcribe-darija / adapter_meta.json
01Yassine's picture
Darija adapter (method): conv encoder + decoder LoRA, plus infer.py
76bab86 verified
Raw
History Blame Contribute Delete
4.58 kB
{
"base_model": "CohereLabs/cohere-transcribe-arabic-07-2026",
"recipe": "method",
"lora_scope": "decoder",
"conv_adapter": true,
"language": "ar",
"lora": {
"r": 32,
"lora_alpha": 64,
"lora_dropout": 0.05,
"bias": "none",
"target_kinds": [
"q_proj",
"k_proj",
"v_proj",
"o_proj"
]
},
"lora_targets": [
"model.decoder.layers.0.self_attn.q_proj",
"model.decoder.layers.0.self_attn.k_proj",
"model.decoder.layers.0.self_attn.v_proj",
"model.decoder.layers.0.self_attn.o_proj",
"model.decoder.layers.0.encoder_attn.q_proj",
"model.decoder.layers.0.encoder_attn.k_proj",
"model.decoder.layers.0.encoder_attn.v_proj",
"model.decoder.layers.0.encoder_attn.o_proj",
"model.decoder.layers.1.self_attn.q_proj",
"model.decoder.layers.1.self_attn.k_proj",
"model.decoder.layers.1.self_attn.v_proj",
"model.decoder.layers.1.self_attn.o_proj",
"model.decoder.layers.1.encoder_attn.q_proj",
"model.decoder.layers.1.encoder_attn.k_proj",
"model.decoder.layers.1.encoder_attn.v_proj",
"model.decoder.layers.1.encoder_attn.o_proj",
"model.decoder.layers.2.self_attn.q_proj",
"model.decoder.layers.2.self_attn.k_proj",
"model.decoder.layers.2.self_attn.v_proj",
"model.decoder.layers.2.self_attn.o_proj",
"model.decoder.layers.2.encoder_attn.q_proj",
"model.decoder.layers.2.encoder_attn.k_proj",
"model.decoder.layers.2.encoder_attn.v_proj",
"model.decoder.layers.2.encoder_attn.o_proj",
"model.decoder.layers.3.self_attn.q_proj",
"model.decoder.layers.3.self_attn.k_proj",
"model.decoder.layers.3.self_attn.v_proj",
"model.decoder.layers.3.self_attn.o_proj",
"model.decoder.layers.3.encoder_attn.q_proj",
"model.decoder.layers.3.encoder_attn.k_proj",
"model.decoder.layers.3.encoder_attn.v_proj",
"model.decoder.layers.3.encoder_attn.o_proj",
"model.decoder.layers.4.self_attn.q_proj",
"model.decoder.layers.4.self_attn.k_proj",
"model.decoder.layers.4.self_attn.v_proj",
"model.decoder.layers.4.self_attn.o_proj",
"model.decoder.layers.4.encoder_attn.q_proj",
"model.decoder.layers.4.encoder_attn.k_proj",
"model.decoder.layers.4.encoder_attn.v_proj",
"model.decoder.layers.4.encoder_attn.o_proj",
"model.decoder.layers.5.self_attn.q_proj",
"model.decoder.layers.5.self_attn.k_proj",
"model.decoder.layers.5.self_attn.v_proj",
"model.decoder.layers.5.self_attn.o_proj",
"model.decoder.layers.5.encoder_attn.q_proj",
"model.decoder.layers.5.encoder_attn.k_proj",
"model.decoder.layers.5.encoder_attn.v_proj",
"model.decoder.layers.5.encoder_attn.o_proj",
"model.decoder.layers.6.self_attn.q_proj",
"model.decoder.layers.6.self_attn.k_proj",
"model.decoder.layers.6.self_attn.v_proj",
"model.decoder.layers.6.self_attn.o_proj",
"model.decoder.layers.6.encoder_attn.q_proj",
"model.decoder.layers.6.encoder_attn.k_proj",
"model.decoder.layers.6.encoder_attn.v_proj",
"model.decoder.layers.6.encoder_attn.o_proj",
"model.decoder.layers.7.self_attn.q_proj",
"model.decoder.layers.7.self_attn.k_proj",
"model.decoder.layers.7.self_attn.v_proj",
"model.decoder.layers.7.self_attn.o_proj",
"model.decoder.layers.7.encoder_attn.q_proj",
"model.decoder.layers.7.encoder_attn.k_proj",
"model.decoder.layers.7.encoder_attn.v_proj",
"model.decoder.layers.7.encoder_attn.o_proj"
],
"skip_bottom_frac": 0.33,
"n_layers": 48,
"start_layer": 15,
"attached_layers": [
15,
16,
17,
18,
19,
20,
21,
22,
23,
24,
25,
26,
27,
28,
29,
30,
31,
32,
33,
34,
35,
36,
37,
38,
39,
40,
41,
42,
43,
44,
45,
46,
47
],
"d_model": 1280,
"bottleneck": 64,
"kernels": [
7,
15,
23,
31
],
"fusion": "concat_fusion",
"merge_kernel": 31,
"dropout": 0.1,
"trainable": {
"trainable": 21145216,
"total": 2086793088,
"pct": 1.013287619246705
},
"decoder_lr": 0.0005,
"encoder_adapter_lr": 0.0001,
"optimizer": "adamw",
"betas": [
0.9,
0.98
],
"scheduler": "cosine+warmup_ratio_0.1",
"precision": "bf16",
"seed": 42,
"epochs": 5,
"steps_per_epoch": 23,
"vram_budget_gb": 16.0,
"vram_peak_gb": 18.0323486328125,
"sampler": "length_bucket",
"sampler_mix": 4,
"pad_waste_duration_random": 0.4951037898430557,
"pad_waste_duration_bucket": 0.11339504348548876,
"pad_waste_mel_running": null
}