Sentence Similarity
sentence-transformers
Safetensors
Chinese
bert
structural-isomorphism
cross-domain
analogy
text-embeddings-inference
Instructions to use qinghuiwan/structural-isomorphism-v1 with libraries, inference providers, notebooks, and local apps. Follow these links to get started.
- Libraries
- sentence-transformers
How to use qinghuiwan/structural-isomorphism-v1 with sentence-transformers:
from sentence_transformers import SentenceTransformer model = SentenceTransformer("qinghuiwan/structural-isomorphism-v1") sentences = [ "那是 個快樂的人", "那是 條快樂的狗", "那是 個非常幸福的人", "今天是晴天" ] embeddings = model.encode(sentences) similarities = model.similarity(embeddings, embeddings) print(similarities.shape) # [4, 4] - Notebooks
- Google Colab
- Kaggle
| { | |
| "best_global_step": null, | |
| "best_metric": null, | |
| "best_model_checkpoint": null, | |
| "epoch": 10.0, | |
| "eval_steps": 500, | |
| "global_step": 4630, | |
| "is_hyper_param_search": false, | |
| "is_local_process_zero": true, | |
| "is_world_process_zero": true, | |
| "log_history": [ | |
| { | |
| "epoch": 0.1079913606911447, | |
| "grad_norm": 15.24159049987793, | |
| "learning_rate": 2.1166306695464366e-06, | |
| "loss": 1.9486, | |
| "step": 50 | |
| }, | |
| { | |
| "epoch": 0.2159827213822894, | |
| "grad_norm": 16.068605422973633, | |
| "learning_rate": 4.276457883369331e-06, | |
| "loss": 1.2593, | |
| "step": 100 | |
| }, | |
| { | |
| "epoch": 0.32397408207343414, | |
| "grad_norm": 15.524004936218262, | |
| "learning_rate": 6.436285097192225e-06, | |
| "loss": 0.7355, | |
| "step": 150 | |
| }, | |
| { | |
| "epoch": 0.4319654427645788, | |
| "grad_norm": 18.918603897094727, | |
| "learning_rate": 8.59611231101512e-06, | |
| "loss": 0.546, | |
| "step": 200 | |
| }, | |
| { | |
| "epoch": 0.5399568034557235, | |
| "grad_norm": 13.727082252502441, | |
| "learning_rate": 1.0755939524838012e-05, | |
| "loss": 0.4791, | |
| "step": 250 | |
| }, | |
| { | |
| "epoch": 0.6479481641468683, | |
| "grad_norm": 13.836669921875, | |
| "learning_rate": 1.2915766738660909e-05, | |
| "loss": 0.3971, | |
| "step": 300 | |
| }, | |
| { | |
| "epoch": 0.755939524838013, | |
| "grad_norm": 4.7911481857299805, | |
| "learning_rate": 1.5075593952483802e-05, | |
| "loss": 0.3148, | |
| "step": 350 | |
| }, | |
| { | |
| "epoch": 0.8639308855291576, | |
| "grad_norm": 6.807811737060547, | |
| "learning_rate": 1.7235421166306695e-05, | |
| "loss": 0.3241, | |
| "step": 400 | |
| }, | |
| { | |
| "epoch": 0.9719222462203023, | |
| "grad_norm": 0.5625627040863037, | |
| "learning_rate": 1.939524838012959e-05, | |
| "loss": 0.2552, | |
| "step": 450 | |
| }, | |
| { | |
| "epoch": 1.0, | |
| "eval_loss": 0.2700121998786926, | |
| "eval_runtime": 20.772, | |
| "eval_samples_per_second": 39.621, | |
| "eval_steps_per_second": 2.503, | |
| "step": 463 | |
| }, | |
| { | |
| "epoch": 1.079913606911447, | |
| "grad_norm": 8.922011375427246, | |
| "learning_rate": 1.982721382289417e-05, | |
| "loss": 0.2515, | |
| "step": 500 | |
| }, | |
| { | |
| "epoch": 1.187904967602592, | |
| "grad_norm": 3.4080042839050293, | |
| "learning_rate": 1.9587233021358293e-05, | |
| "loss": 0.2607, | |
| "step": 550 | |
| }, | |
| { | |
| "epoch": 1.2958963282937366, | |
| "grad_norm": 0.810586154460907, | |
| "learning_rate": 1.9347252219822416e-05, | |
| "loss": 0.2093, | |
| "step": 600 | |
| }, | |
| { | |
| "epoch": 1.4038876889848813, | |
| "grad_norm": 4.636417865753174, | |
| "learning_rate": 1.910727141828654e-05, | |
| "loss": 0.2755, | |
| "step": 650 | |
| }, | |
| { | |
| "epoch": 1.511879049676026, | |
| "grad_norm": 8.486068725585938, | |
| "learning_rate": 1.8867290616750663e-05, | |
| "loss": 0.1779, | |
| "step": 700 | |
| }, | |
| { | |
| "epoch": 1.6198704103671706, | |
| "grad_norm": 13.278620719909668, | |
| "learning_rate": 1.8627309815214783e-05, | |
| "loss": 0.1862, | |
| "step": 750 | |
| }, | |
| { | |
| "epoch": 1.7278617710583153, | |
| "grad_norm": 5.251581192016602, | |
| "learning_rate": 1.8387329013678906e-05, | |
| "loss": 0.1645, | |
| "step": 800 | |
| }, | |
| { | |
| "epoch": 1.83585313174946, | |
| "grad_norm": 5.251072883605957, | |
| "learning_rate": 1.814734821214303e-05, | |
| "loss": 0.1676, | |
| "step": 850 | |
| }, | |
| { | |
| "epoch": 1.9438444924406046, | |
| "grad_norm": 7.933957099914551, | |
| "learning_rate": 1.7907367410607153e-05, | |
| "loss": 0.2098, | |
| "step": 900 | |
| }, | |
| { | |
| "epoch": 2.0, | |
| "eval_loss": 0.19168274104595184, | |
| "eval_runtime": 21.6821, | |
| "eval_samples_per_second": 37.958, | |
| "eval_steps_per_second": 2.398, | |
| "step": 926 | |
| }, | |
| { | |
| "epoch": 2.0518358531317493, | |
| "grad_norm": 2.119457960128784, | |
| "learning_rate": 1.7667386609071277e-05, | |
| "loss": 0.2279, | |
| "step": 950 | |
| }, | |
| { | |
| "epoch": 2.159827213822894, | |
| "grad_norm": 4.489124774932861, | |
| "learning_rate": 1.7427405807535397e-05, | |
| "loss": 0.1753, | |
| "step": 1000 | |
| }, | |
| { | |
| "epoch": 2.267818574514039, | |
| "grad_norm": 5.081973075866699, | |
| "learning_rate": 1.718742500599952e-05, | |
| "loss": 0.181, | |
| "step": 1050 | |
| }, | |
| { | |
| "epoch": 2.375809935205184, | |
| "grad_norm": 13.309564590454102, | |
| "learning_rate": 1.6947444204463643e-05, | |
| "loss": 0.1755, | |
| "step": 1100 | |
| }, | |
| { | |
| "epoch": 2.4838012958963285, | |
| "grad_norm": 5.2334723472595215, | |
| "learning_rate": 1.6707463402927767e-05, | |
| "loss": 0.1633, | |
| "step": 1150 | |
| }, | |
| { | |
| "epoch": 2.591792656587473, | |
| "grad_norm": 4.591087818145752, | |
| "learning_rate": 1.646748260139189e-05, | |
| "loss": 0.13, | |
| "step": 1200 | |
| }, | |
| { | |
| "epoch": 2.699784017278618, | |
| "grad_norm": 0.08640618622303009, | |
| "learning_rate": 1.6227501799856014e-05, | |
| "loss": 0.1237, | |
| "step": 1250 | |
| }, | |
| { | |
| "epoch": 2.8077753779697625, | |
| "grad_norm": 3.6601691246032715, | |
| "learning_rate": 1.5987520998320137e-05, | |
| "loss": 0.1911, | |
| "step": 1300 | |
| }, | |
| { | |
| "epoch": 2.915766738660907, | |
| "grad_norm": 1.4245907068252563, | |
| "learning_rate": 1.574754019678426e-05, | |
| "loss": 0.1655, | |
| "step": 1350 | |
| }, | |
| { | |
| "epoch": 3.0, | |
| "eval_loss": 0.1828612983226776, | |
| "eval_runtime": 22.4072, | |
| "eval_samples_per_second": 36.729, | |
| "eval_steps_per_second": 2.321, | |
| "step": 1389 | |
| }, | |
| { | |
| "epoch": 3.023758099352052, | |
| "grad_norm": 3.9116933345794678, | |
| "learning_rate": 1.550755939524838e-05, | |
| "loss": 0.1548, | |
| "step": 1400 | |
| }, | |
| { | |
| "epoch": 3.1317494600431965, | |
| "grad_norm": 5.976468563079834, | |
| "learning_rate": 1.5267578593712504e-05, | |
| "loss": 0.1487, | |
| "step": 1450 | |
| }, | |
| { | |
| "epoch": 3.239740820734341, | |
| "grad_norm": 3.716071128845215, | |
| "learning_rate": 1.5027597792176627e-05, | |
| "loss": 0.1692, | |
| "step": 1500 | |
| }, | |
| { | |
| "epoch": 3.347732181425486, | |
| "grad_norm": 4.578957557678223, | |
| "learning_rate": 1.478761699064075e-05, | |
| "loss": 0.1719, | |
| "step": 1550 | |
| }, | |
| { | |
| "epoch": 3.4557235421166306, | |
| "grad_norm": 4.424953460693359, | |
| "learning_rate": 1.4547636189104872e-05, | |
| "loss": 0.1541, | |
| "step": 1600 | |
| }, | |
| { | |
| "epoch": 3.5637149028077753, | |
| "grad_norm": 5.738244533538818, | |
| "learning_rate": 1.4307655387568996e-05, | |
| "loss": 0.1664, | |
| "step": 1650 | |
| }, | |
| { | |
| "epoch": 3.67170626349892, | |
| "grad_norm": 0.7902525663375854, | |
| "learning_rate": 1.4067674586033117e-05, | |
| "loss": 0.1451, | |
| "step": 1700 | |
| }, | |
| { | |
| "epoch": 3.7796976241900646, | |
| "grad_norm": 10.984625816345215, | |
| "learning_rate": 1.382769378449724e-05, | |
| "loss": 0.163, | |
| "step": 1750 | |
| }, | |
| { | |
| "epoch": 3.8876889848812093, | |
| "grad_norm": 0.3437069058418274, | |
| "learning_rate": 1.3587712982961366e-05, | |
| "loss": 0.1615, | |
| "step": 1800 | |
| }, | |
| { | |
| "epoch": 3.995680345572354, | |
| "grad_norm": 6.087996006011963, | |
| "learning_rate": 1.3347732181425487e-05, | |
| "loss": 0.1445, | |
| "step": 1850 | |
| }, | |
| { | |
| "epoch": 4.0, | |
| "eval_loss": 0.18373550474643707, | |
| "eval_runtime": 19.1948, | |
| "eval_samples_per_second": 42.876, | |
| "eval_steps_per_second": 2.709, | |
| "step": 1852 | |
| }, | |
| { | |
| "epoch": 4.103671706263499, | |
| "grad_norm": 9.516853332519531, | |
| "learning_rate": 1.310775137988961e-05, | |
| "loss": 0.1527, | |
| "step": 1900 | |
| }, | |
| { | |
| "epoch": 4.211663066954643, | |
| "grad_norm": 3.8790721893310547, | |
| "learning_rate": 1.2867770578353732e-05, | |
| "loss": 0.1439, | |
| "step": 1950 | |
| }, | |
| { | |
| "epoch": 4.319654427645788, | |
| "grad_norm": 5.269755840301514, | |
| "learning_rate": 1.2627789776817856e-05, | |
| "loss": 0.1321, | |
| "step": 2000 | |
| }, | |
| { | |
| "epoch": 4.427645788336933, | |
| "grad_norm": 6.4369893074035645, | |
| "learning_rate": 1.238780897528198e-05, | |
| "loss": 0.1593, | |
| "step": 2050 | |
| }, | |
| { | |
| "epoch": 4.535637149028078, | |
| "grad_norm": 9.754737854003906, | |
| "learning_rate": 1.2147828173746101e-05, | |
| "loss": 0.1388, | |
| "step": 2100 | |
| }, | |
| { | |
| "epoch": 4.643628509719223, | |
| "grad_norm": 4.531418800354004, | |
| "learning_rate": 1.1907847372210224e-05, | |
| "loss": 0.1434, | |
| "step": 2150 | |
| }, | |
| { | |
| "epoch": 4.751619870410368, | |
| "grad_norm": 2.5565500259399414, | |
| "learning_rate": 1.1667866570674346e-05, | |
| "loss": 0.1456, | |
| "step": 2200 | |
| }, | |
| { | |
| "epoch": 4.859611231101512, | |
| "grad_norm": 3.0373988151550293, | |
| "learning_rate": 1.142788576913847e-05, | |
| "loss": 0.1568, | |
| "step": 2250 | |
| }, | |
| { | |
| "epoch": 4.967602591792657, | |
| "grad_norm": 7.106463432312012, | |
| "learning_rate": 1.1187904967602593e-05, | |
| "loss": 0.1549, | |
| "step": 2300 | |
| }, | |
| { | |
| "epoch": 5.0, | |
| "eval_loss": 0.16200467944145203, | |
| "eval_runtime": 19.8308, | |
| "eval_samples_per_second": 41.501, | |
| "eval_steps_per_second": 2.622, | |
| "step": 2315 | |
| }, | |
| { | |
| "epoch": 5.075593952483802, | |
| "grad_norm": 1.8910789489746094, | |
| "learning_rate": 1.0947924166066714e-05, | |
| "loss": 0.1736, | |
| "step": 2350 | |
| }, | |
| { | |
| "epoch": 5.183585313174946, | |
| "grad_norm": 1.3723983764648438, | |
| "learning_rate": 1.070794336453084e-05, | |
| "loss": 0.1337, | |
| "step": 2400 | |
| }, | |
| { | |
| "epoch": 5.291576673866091, | |
| "grad_norm": 2.3787972927093506, | |
| "learning_rate": 1.0467962562994963e-05, | |
| "loss": 0.1221, | |
| "step": 2450 | |
| }, | |
| { | |
| "epoch": 5.399568034557236, | |
| "grad_norm": 2.458906412124634, | |
| "learning_rate": 1.0227981761459085e-05, | |
| "loss": 0.1372, | |
| "step": 2500 | |
| }, | |
| { | |
| "epoch": 5.50755939524838, | |
| "grad_norm": 2.6780011653900146, | |
| "learning_rate": 9.988000959923208e-06, | |
| "loss": 0.1682, | |
| "step": 2550 | |
| }, | |
| { | |
| "epoch": 5.615550755939525, | |
| "grad_norm": 2.9658782482147217, | |
| "learning_rate": 9.74802015838733e-06, | |
| "loss": 0.1489, | |
| "step": 2600 | |
| }, | |
| { | |
| "epoch": 5.72354211663067, | |
| "grad_norm": 2.0444753170013428, | |
| "learning_rate": 9.508039356851453e-06, | |
| "loss": 0.138, | |
| "step": 2650 | |
| }, | |
| { | |
| "epoch": 5.831533477321814, | |
| "grad_norm": 2.001603603363037, | |
| "learning_rate": 9.268058555315575e-06, | |
| "loss": 0.1197, | |
| "step": 2700 | |
| }, | |
| { | |
| "epoch": 5.939524838012959, | |
| "grad_norm": 0.0714740976691246, | |
| "learning_rate": 9.028077753779698e-06, | |
| "loss": 0.139, | |
| "step": 2750 | |
| }, | |
| { | |
| "epoch": 6.0, | |
| "eval_loss": 0.16732291877269745, | |
| "eval_runtime": 24.8414, | |
| "eval_samples_per_second": 33.13, | |
| "eval_steps_per_second": 2.093, | |
| "step": 2778 | |
| }, | |
| { | |
| "epoch": 6.047516198704104, | |
| "grad_norm": 4.453672885894775, | |
| "learning_rate": 8.788096952243822e-06, | |
| "loss": 0.1503, | |
| "step": 2800 | |
| }, | |
| { | |
| "epoch": 6.155507559395248, | |
| "grad_norm": 2.792571544647217, | |
| "learning_rate": 8.548116150707943e-06, | |
| "loss": 0.1441, | |
| "step": 2850 | |
| }, | |
| { | |
| "epoch": 6.263498920086393, | |
| "grad_norm": 0.1777549535036087, | |
| "learning_rate": 8.308135349172067e-06, | |
| "loss": 0.1614, | |
| "step": 2900 | |
| }, | |
| { | |
| "epoch": 6.371490280777538, | |
| "grad_norm": 3.0961155891418457, | |
| "learning_rate": 8.06815454763619e-06, | |
| "loss": 0.1179, | |
| "step": 2950 | |
| }, | |
| { | |
| "epoch": 6.479481641468682, | |
| "grad_norm": 0.10719757527112961, | |
| "learning_rate": 7.828173746100313e-06, | |
| "loss": 0.1509, | |
| "step": 3000 | |
| }, | |
| { | |
| "epoch": 6.587473002159827, | |
| "grad_norm": 0.027445131912827492, | |
| "learning_rate": 7.588192944564435e-06, | |
| "loss": 0.1467, | |
| "step": 3050 | |
| }, | |
| { | |
| "epoch": 6.695464362850972, | |
| "grad_norm": 5.075443267822266, | |
| "learning_rate": 7.348212143028558e-06, | |
| "loss": 0.141, | |
| "step": 3100 | |
| }, | |
| { | |
| "epoch": 6.8034557235421165, | |
| "grad_norm": 0.1375100016593933, | |
| "learning_rate": 7.108231341492681e-06, | |
| "loss": 0.1358, | |
| "step": 3150 | |
| }, | |
| { | |
| "epoch": 6.911447084233261, | |
| "grad_norm": 2.0139362812042236, | |
| "learning_rate": 6.868250539956804e-06, | |
| "loss": 0.1639, | |
| "step": 3200 | |
| }, | |
| { | |
| "epoch": 7.0, | |
| "eval_loss": 0.15860523283481598, | |
| "eval_runtime": 26.2207, | |
| "eval_samples_per_second": 31.387, | |
| "eval_steps_per_second": 1.983, | |
| "step": 3241 | |
| }, | |
| { | |
| "epoch": 7.019438444924406, | |
| "grad_norm": 0.09312976896762848, | |
| "learning_rate": 6.628269738420927e-06, | |
| "loss": 0.1294, | |
| "step": 3250 | |
| }, | |
| { | |
| "epoch": 7.1274298056155505, | |
| "grad_norm": 3.9996461868286133, | |
| "learning_rate": 6.3882889368850495e-06, | |
| "loss": 0.1344, | |
| "step": 3300 | |
| }, | |
| { | |
| "epoch": 7.235421166306695, | |
| "grad_norm": 1.266003966331482, | |
| "learning_rate": 6.148308135349173e-06, | |
| "loss": 0.1138, | |
| "step": 3350 | |
| }, | |
| { | |
| "epoch": 7.34341252699784, | |
| "grad_norm": 0.8446139097213745, | |
| "learning_rate": 5.908327333813295e-06, | |
| "loss": 0.1409, | |
| "step": 3400 | |
| }, | |
| { | |
| "epoch": 7.4514038876889845, | |
| "grad_norm": 2.299039125442505, | |
| "learning_rate": 5.668346532277418e-06, | |
| "loss": 0.1293, | |
| "step": 3450 | |
| }, | |
| { | |
| "epoch": 7.559395248380129, | |
| "grad_norm": 1.5416117906570435, | |
| "learning_rate": 5.428365730741541e-06, | |
| "loss": 0.1088, | |
| "step": 3500 | |
| }, | |
| { | |
| "epoch": 7.667386609071274, | |
| "grad_norm": 3.3261375427246094, | |
| "learning_rate": 5.188384929205664e-06, | |
| "loss": 0.1399, | |
| "step": 3550 | |
| }, | |
| { | |
| "epoch": 7.775377969762419, | |
| "grad_norm": 3.3896985054016113, | |
| "learning_rate": 4.948404127669787e-06, | |
| "loss": 0.127, | |
| "step": 3600 | |
| }, | |
| { | |
| "epoch": 7.883369330453563, | |
| "grad_norm": 0.08087552338838577, | |
| "learning_rate": 4.70842332613391e-06, | |
| "loss": 0.1448, | |
| "step": 3650 | |
| }, | |
| { | |
| "epoch": 7.991360691144708, | |
| "grad_norm": 0.712371289730072, | |
| "learning_rate": 4.468442524598032e-06, | |
| "loss": 0.1376, | |
| "step": 3700 | |
| }, | |
| { | |
| "epoch": 8.0, | |
| "eval_loss": 0.1555214673280716, | |
| "eval_runtime": 26.2282, | |
| "eval_samples_per_second": 31.378, | |
| "eval_steps_per_second": 1.983, | |
| "step": 3704 | |
| }, | |
| { | |
| "epoch": 8.099352051835853, | |
| "grad_norm": 0.04458538815379143, | |
| "learning_rate": 4.228461723062156e-06, | |
| "loss": 0.1171, | |
| "step": 3750 | |
| }, | |
| { | |
| "epoch": 8.207343412526997, | |
| "grad_norm": 3.261307954788208, | |
| "learning_rate": 3.988480921526278e-06, | |
| "loss": 0.1221, | |
| "step": 3800 | |
| }, | |
| { | |
| "epoch": 8.315334773218142, | |
| "grad_norm": 0.07829932123422623, | |
| "learning_rate": 3.7485001199904008e-06, | |
| "loss": 0.1406, | |
| "step": 3850 | |
| }, | |
| { | |
| "epoch": 8.423326133909287, | |
| "grad_norm": 2.330026626586914, | |
| "learning_rate": 3.508519318454524e-06, | |
| "loss": 0.1299, | |
| "step": 3900 | |
| }, | |
| { | |
| "epoch": 8.531317494600431, | |
| "grad_norm": 0.7942795753479004, | |
| "learning_rate": 3.2685385169186467e-06, | |
| "loss": 0.1363, | |
| "step": 3950 | |
| }, | |
| { | |
| "epoch": 8.639308855291576, | |
| "grad_norm": 2.6522200107574463, | |
| "learning_rate": 3.0285577153827692e-06, | |
| "loss": 0.117, | |
| "step": 4000 | |
| }, | |
| { | |
| "epoch": 8.74730021598272, | |
| "grad_norm": 2.3869872093200684, | |
| "learning_rate": 2.7885769138468926e-06, | |
| "loss": 0.1572, | |
| "step": 4050 | |
| }, | |
| { | |
| "epoch": 8.855291576673865, | |
| "grad_norm": 1.1808924674987793, | |
| "learning_rate": 2.548596112311015e-06, | |
| "loss": 0.1213, | |
| "step": 4100 | |
| }, | |
| { | |
| "epoch": 8.96328293736501, | |
| "grad_norm": 3.1210787296295166, | |
| "learning_rate": 2.308615310775138e-06, | |
| "loss": 0.1218, | |
| "step": 4150 | |
| }, | |
| { | |
| "epoch": 9.0, | |
| "eval_loss": 0.15509691834449768, | |
| "eval_runtime": 26.4137, | |
| "eval_samples_per_second": 31.158, | |
| "eval_steps_per_second": 1.969, | |
| "step": 4167 | |
| }, | |
| { | |
| "epoch": 9.071274298056155, | |
| "grad_norm": 1.0357710123062134, | |
| "learning_rate": 2.068634509239261e-06, | |
| "loss": 0.1333, | |
| "step": 4200 | |
| }, | |
| { | |
| "epoch": 9.1792656587473, | |
| "grad_norm": 3.8207991123199463, | |
| "learning_rate": 1.8286537077033838e-06, | |
| "loss": 0.1339, | |
| "step": 4250 | |
| }, | |
| { | |
| "epoch": 9.287257019438446, | |
| "grad_norm": 3.1769232749938965, | |
| "learning_rate": 1.5886729061675068e-06, | |
| "loss": 0.1477, | |
| "step": 4300 | |
| }, | |
| { | |
| "epoch": 9.39524838012959, | |
| "grad_norm": 2.3620474338531494, | |
| "learning_rate": 1.3486921046316296e-06, | |
| "loss": 0.1013, | |
| "step": 4350 | |
| }, | |
| { | |
| "epoch": 9.503239740820735, | |
| "grad_norm": 0.047901928424835205, | |
| "learning_rate": 1.1087113030957525e-06, | |
| "loss": 0.1241, | |
| "step": 4400 | |
| }, | |
| { | |
| "epoch": 9.61123110151188, | |
| "grad_norm": 0.07165756076574326, | |
| "learning_rate": 8.687305015598753e-07, | |
| "loss": 0.1091, | |
| "step": 4450 | |
| }, | |
| { | |
| "epoch": 9.719222462203025, | |
| "grad_norm": 2.574002265930176, | |
| "learning_rate": 6.287497000239981e-07, | |
| "loss": 0.1077, | |
| "step": 4500 | |
| }, | |
| { | |
| "epoch": 9.82721382289417, | |
| "grad_norm": 1.7075910568237305, | |
| "learning_rate": 3.88768898488121e-07, | |
| "loss": 0.1261, | |
| "step": 4550 | |
| }, | |
| { | |
| "epoch": 9.935205183585314, | |
| "grad_norm": 2.4924235343933105, | |
| "learning_rate": 1.4878809695224384e-07, | |
| "loss": 0.1396, | |
| "step": 4600 | |
| }, | |
| { | |
| "epoch": 10.0, | |
| "eval_loss": 0.1544954627752304, | |
| "eval_runtime": 27.5689, | |
| "eval_samples_per_second": 29.852, | |
| "eval_steps_per_second": 1.886, | |
| "step": 4630 | |
| } | |
| ], | |
| "logging_steps": 50, | |
| "max_steps": 4630, | |
| "num_input_tokens_seen": 0, | |
| "num_train_epochs": 10, | |
| "save_steps": 500, | |
| "stateful_callbacks": { | |
| "TrainerControl": { | |
| "args": { | |
| "should_epoch_stop": false, | |
| "should_evaluate": false, | |
| "should_log": false, | |
| "should_save": true, | |
| "should_training_stop": true | |
| }, | |
| "attributes": {} | |
| } | |
| }, | |
| "total_flos": 0.0, | |
| "train_batch_size": 16, | |
| "trial_name": null, | |
| "trial_params": null | |
| } | |