somukandula commited on
Commit
2c60494
·
verified ·
1 Parent(s): fb25f35

Training in progress, step 1000, checkpoint

Browse files
last-checkpoint/model.safetensors CHANGED
@@ -1,3 +1,3 @@
1
  version https://git-lfs.github.com/spec/v1
2
- oid sha256:83da3cc8d0218d62a3164a7f716bade572679ed97e6acdc62c1a60da3e0b312d
3
  size 1976163472
 
1
  version https://git-lfs.github.com/spec/v1
2
+ oid sha256:d6e36b41feb21954e8f396a2d8342f35a3b4f0170ff153e8a1d351d55d23aee3
3
  size 1976163472
last-checkpoint/optimizer.pt CHANGED
@@ -1,3 +1,3 @@
1
  version https://git-lfs.github.com/spec/v1
2
- oid sha256:cb10ff4270335cfa294cb8498658921326a00498f3ac6ab8a415df9ba2cadef1
3
  size 3952497611
 
1
  version https://git-lfs.github.com/spec/v1
2
+ oid sha256:92e3465bef651dabb018fb28f710ca4e9921e22cb7ce494aa47f070b09f77e85
3
  size 3952497611
last-checkpoint/rng_state.pth CHANGED
@@ -1,3 +1,3 @@
1
  version https://git-lfs.github.com/spec/v1
2
- oid sha256:9a763ef6ed853db2b72ad6002c008f5c95fc932fde0276699fb1687f7a8bc945
3
  size 14455
 
1
  version https://git-lfs.github.com/spec/v1
2
+ oid sha256:a5c072297b22cc2262340128dcd1a46763a029e534c43cd59943bae67d4d6c32
3
  size 14455
last-checkpoint/scheduler.pt CHANGED
@@ -1,3 +1,3 @@
1
  version https://git-lfs.github.com/spec/v1
2
- oid sha256:809d84065af7746ce8e1dde90d00972c61a19282d6465b5b2c63be219520d047
3
  size 1465
 
1
  version https://git-lfs.github.com/spec/v1
2
+ oid sha256:7860e2aded14c970768e5cc51a1f317cd1d854d3438aee28e508e1c5ae782642
3
  size 1465
last-checkpoint/trainer_state.json CHANGED
@@ -2,9 +2,9 @@
2
  "best_global_step": null,
3
  "best_metric": null,
4
  "best_model_checkpoint": null,
5
- "epoch": 0.5,
6
  "eval_steps": 100,
7
- "global_step": 500,
8
  "is_hyper_param_search": false,
9
  "is_local_process_zero": true,
10
  "is_world_process_zero": true,
@@ -573,6 +573,561 @@
573
  "eval_samples_per_second": 1.475,
574
  "eval_steps_per_second": 1.475,
575
  "step": 500
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
576
  }
577
  ],
578
  "logging_steps": 10,
@@ -587,12 +1142,12 @@
587
  "should_evaluate": false,
588
  "should_log": false,
589
  "should_save": true,
590
- "should_training_stop": false
591
  },
592
  "attributes": {}
593
  }
594
  },
595
- "total_flos": 63485398699008.0,
596
  "train_batch_size": 1,
597
  "trial_name": null,
598
  "trial_params": null
 
2
  "best_global_step": null,
3
  "best_metric": null,
4
  "best_model_checkpoint": null,
5
+ "epoch": 1.0,
6
  "eval_steps": 100,
7
+ "global_step": 1000,
8
  "is_hyper_param_search": false,
9
  "is_local_process_zero": true,
10
  "is_world_process_zero": true,
 
573
  "eval_samples_per_second": 1.475,
574
  "eval_steps_per_second": 1.475,
575
  "step": 500
576
+ },
577
+ {
578
+ "entropy": 0.6581952810287476,
579
+ "epoch": 0.51,
580
+ "grad_norm": 0.2650947868824005,
581
+ "learning_rate": 1.473e-05,
582
+ "loss": 0.8746847152709961,
583
+ "mean_token_accuracy": 0.8366666734218597,
584
+ "num_tokens": 30180.0,
585
+ "step": 510
586
+ },
587
+ {
588
+ "entropy": 0.2867848143563606,
589
+ "epoch": 0.52,
590
+ "grad_norm": 0.0694449320435524,
591
+ "learning_rate": 1.4429999999999999e-05,
592
+ "loss": 0.8548201560974121,
593
+ "mean_token_accuracy": 0.9023809552192688,
594
+ "num_tokens": 30787.0,
595
+ "step": 520
596
+ },
597
+ {
598
+ "entropy": 0.6530944091908168,
599
+ "epoch": 0.53,
600
+ "grad_norm": 0.02836558222770691,
601
+ "learning_rate": 1.413e-05,
602
+ "loss": 1.4652270317077636,
603
+ "mean_token_accuracy": 0.794761911034584,
604
+ "num_tokens": 31402.0,
605
+ "step": 530
606
+ },
607
+ {
608
+ "entropy": 0.35715593958157116,
609
+ "epoch": 0.54,
610
+ "grad_norm": 0.015686016529798508,
611
+ "learning_rate": 1.3830000000000001e-05,
612
+ "loss": 1.026433563232422,
613
+ "mean_token_accuracy": 0.8828571438789368,
614
+ "num_tokens": 31952.0,
615
+ "step": 540
616
+ },
617
+ {
618
+ "entropy": 0.6746627187123522,
619
+ "epoch": 0.55,
620
+ "grad_norm": 0.47357332706451416,
621
+ "learning_rate": 1.3530000000000001e-05,
622
+ "loss": 2.541259765625,
623
+ "mean_token_accuracy": 0.7191666692495347,
624
+ "num_tokens": 32489.0,
625
+ "step": 550
626
+ },
627
+ {
628
+ "entropy": 0.8612912893295288,
629
+ "epoch": 0.56,
630
+ "grad_norm": 0.26455482840538025,
631
+ "learning_rate": 1.323e-05,
632
+ "loss": 1.4012706756591797,
633
+ "mean_token_accuracy": 0.8428571462631226,
634
+ "num_tokens": 33085.0,
635
+ "step": 560
636
+ },
637
+ {
638
+ "entropy": 0.5583918301854283,
639
+ "epoch": 0.57,
640
+ "grad_norm": 64.6652603149414,
641
+ "learning_rate": 1.293e-05,
642
+ "loss": 2.232314682006836,
643
+ "mean_token_accuracy": 0.6770238131284714,
644
+ "num_tokens": 33766.0,
645
+ "step": 570
646
+ },
647
+ {
648
+ "entropy": 0.22949749184772372,
649
+ "epoch": 0.58,
650
+ "grad_norm": 32.17295455932617,
651
+ "learning_rate": 1.263e-05,
652
+ "loss": 0.6436846256256104,
653
+ "mean_token_accuracy": 0.8900000005960464,
654
+ "num_tokens": 34339.0,
655
+ "step": 580
656
+ },
657
+ {
658
+ "entropy": 0.4105657983804122,
659
+ "epoch": 0.59,
660
+ "grad_norm": 0.35221877694129944,
661
+ "learning_rate": 1.2329999999999999e-05,
662
+ "loss": 1.1233172416687012,
663
+ "mean_token_accuracy": 0.8490476220846176,
664
+ "num_tokens": 34887.0,
665
+ "step": 590
666
+ },
667
+ {
668
+ "entropy": 0.46966382283717395,
669
+ "epoch": 0.6,
670
+ "grad_norm": 57.49447250366211,
671
+ "learning_rate": 1.2030000000000002e-05,
672
+ "loss": 1.294736671447754,
673
+ "mean_token_accuracy": 0.8233333379030228,
674
+ "num_tokens": 35518.0,
675
+ "step": 600
676
+ },
677
+ {
678
+ "epoch": 0.6,
679
+ "eval_entropy": 0.736768285461585,
680
+ "eval_loss": 1.3659862279891968,
681
+ "eval_mean_token_accuracy": 0.7910032506287098,
682
+ "eval_num_tokens": 35518.0,
683
+ "eval_runtime": 58.971,
684
+ "eval_samples_per_second": 1.696,
685
+ "eval_steps_per_second": 1.696,
686
+ "step": 600
687
+ },
688
+ {
689
+ "entropy": 0.3451525355922058,
690
+ "epoch": 0.61,
691
+ "grad_norm": 37.80137252807617,
692
+ "learning_rate": 1.1730000000000001e-05,
693
+ "loss": 0.9265684127807617,
694
+ "mean_token_accuracy": 0.8773809552192688,
695
+ "num_tokens": 36134.0,
696
+ "step": 610
697
+ },
698
+ {
699
+ "entropy": 0.9583770901896059,
700
+ "epoch": 0.62,
701
+ "grad_norm": 107.27765655517578,
702
+ "learning_rate": 1.143e-05,
703
+ "loss": 2.295991897583008,
704
+ "mean_token_accuracy": 0.7400000020861626,
705
+ "num_tokens": 36699.0,
706
+ "step": 620
707
+ },
708
+ {
709
+ "entropy": 1.026821926701814,
710
+ "epoch": 0.63,
711
+ "grad_norm": 93.11579132080078,
712
+ "learning_rate": 1.113e-05,
713
+ "loss": 1.9422128677368165,
714
+ "mean_token_accuracy": 0.7183333396911621,
715
+ "num_tokens": 37283.0,
716
+ "step": 630
717
+ },
718
+ {
719
+ "entropy": 0.7774730216711759,
720
+ "epoch": 0.64,
721
+ "grad_norm": 204.85580444335938,
722
+ "learning_rate": 1.083e-05,
723
+ "loss": 1.3309831619262695,
724
+ "mean_token_accuracy": 0.7738888919353485,
725
+ "num_tokens": 37968.0,
726
+ "step": 640
727
+ },
728
+ {
729
+ "entropy": 0.7349455378018319,
730
+ "epoch": 0.65,
731
+ "grad_norm": 1.482122778892517,
732
+ "learning_rate": 1.0529999999999999e-05,
733
+ "loss": 1.176546859741211,
734
+ "mean_token_accuracy": 0.7619047671556473,
735
+ "num_tokens": 38540.0,
736
+ "step": 650
737
+ },
738
+ {
739
+ "entropy": 0.27391568799503146,
740
+ "epoch": 0.66,
741
+ "grad_norm": 12.381733894348145,
742
+ "learning_rate": 1.023e-05,
743
+ "loss": 0.6918275833129883,
744
+ "mean_token_accuracy": 0.8930952399969101,
745
+ "num_tokens": 39094.0,
746
+ "step": 660
747
+ },
748
+ {
749
+ "entropy": 0.1004896673723124,
750
+ "epoch": 0.67,
751
+ "grad_norm": 0.03492867574095726,
752
+ "learning_rate": 9.930000000000001e-06,
753
+ "loss": 0.2918921232223511,
754
+ "mean_token_accuracy": 0.9523809552192688,
755
+ "num_tokens": 39661.0,
756
+ "step": 670
757
+ },
758
+ {
759
+ "entropy": 0.9908906043478055,
760
+ "epoch": 0.68,
761
+ "grad_norm": 0.06755176931619644,
762
+ "learning_rate": 9.630000000000001e-06,
763
+ "loss": 1.8555622100830078,
764
+ "mean_token_accuracy": 0.7571428656578064,
765
+ "num_tokens": 40324.0,
766
+ "step": 680
767
+ },
768
+ {
769
+ "entropy": 0.46606744623859414,
770
+ "epoch": 0.69,
771
+ "grad_norm": 0.020008454099297523,
772
+ "learning_rate": 9.33e-06,
773
+ "loss": 1.5950393676757812,
774
+ "mean_token_accuracy": 0.8166666716337204,
775
+ "num_tokens": 40979.0,
776
+ "step": 690
777
+ },
778
+ {
779
+ "entropy": 0.651082917675376,
780
+ "epoch": 0.7,
781
+ "grad_norm": 171.28536987304688,
782
+ "learning_rate": 9.03e-06,
783
+ "loss": 1.6578060150146485,
784
+ "mean_token_accuracy": 0.7446428596973419,
785
+ "num_tokens": 41569.0,
786
+ "step": 700
787
+ },
788
+ {
789
+ "epoch": 0.7,
790
+ "eval_entropy": 0.4609421466873027,
791
+ "eval_loss": 1.6514569520950317,
792
+ "eval_mean_token_accuracy": 0.783146109431982,
793
+ "eval_num_tokens": 41569.0,
794
+ "eval_runtime": 57.3197,
795
+ "eval_samples_per_second": 1.745,
796
+ "eval_steps_per_second": 1.745,
797
+ "step": 700
798
+ },
799
+ {
800
+ "entropy": 0.5237987950094976,
801
+ "epoch": 0.71,
802
+ "grad_norm": 57.0805549621582,
803
+ "learning_rate": 8.73e-06,
804
+ "loss": 1.5300618171691895,
805
+ "mean_token_accuracy": 0.8150000005960465,
806
+ "num_tokens": 42214.0,
807
+ "step": 710
808
+ },
809
+ {
810
+ "entropy": 0.9100498335435987,
811
+ "epoch": 0.72,
812
+ "grad_norm": 177.79803466796875,
813
+ "learning_rate": 8.43e-06,
814
+ "loss": 1.8969627380371095,
815
+ "mean_token_accuracy": 0.707857146859169,
816
+ "num_tokens": 42835.0,
817
+ "step": 720
818
+ },
819
+ {
820
+ "entropy": 0.6799977218732238,
821
+ "epoch": 0.73,
822
+ "grad_norm": 0.859414279460907,
823
+ "learning_rate": 8.13e-06,
824
+ "loss": 1.8602033615112306,
825
+ "mean_token_accuracy": 0.7766666740179062,
826
+ "num_tokens": 43464.0,
827
+ "step": 730
828
+ },
829
+ {
830
+ "entropy": 0.7358979027718305,
831
+ "epoch": 0.74,
832
+ "grad_norm": 59.640167236328125,
833
+ "learning_rate": 7.830000000000001e-06,
834
+ "loss": 1.2427146911621094,
835
+ "mean_token_accuracy": 0.8309523850679398,
836
+ "num_tokens": 44060.0,
837
+ "step": 740
838
+ },
839
+ {
840
+ "entropy": 0.31579577242955564,
841
+ "epoch": 0.75,
842
+ "grad_norm": 0.6564598679542542,
843
+ "learning_rate": 7.53e-06,
844
+ "loss": 1.7427587509155273,
845
+ "mean_token_accuracy": 0.7794047683477402,
846
+ "num_tokens": 44635.0,
847
+ "step": 750
848
+ },
849
+ {
850
+ "entropy": 0.3871447135694325,
851
+ "epoch": 0.76,
852
+ "grad_norm": 0.08916488289833069,
853
+ "learning_rate": 7.23e-06,
854
+ "loss": 0.5494258880615235,
855
+ "mean_token_accuracy": 0.8638888895511627,
856
+ "num_tokens": 45205.0,
857
+ "step": 760
858
+ },
859
+ {
860
+ "entropy": 0.31627349692862483,
861
+ "epoch": 0.77,
862
+ "grad_norm": 0.17271661758422852,
863
+ "learning_rate": 6.9300000000000006e-06,
864
+ "loss": 0.9221712112426758,
865
+ "mean_token_accuracy": 0.8933333337306977,
866
+ "num_tokens": 45745.0,
867
+ "step": 770
868
+ },
869
+ {
870
+ "entropy": 0.21427990994416177,
871
+ "epoch": 0.78,
872
+ "grad_norm": 93.88026428222656,
873
+ "learning_rate": 6.63e-06,
874
+ "loss": 1.2273402214050293,
875
+ "mean_token_accuracy": 0.8244444489479065,
876
+ "num_tokens": 46375.0,
877
+ "step": 780
878
+ },
879
+ {
880
+ "entropy": 0.6328038854058832,
881
+ "epoch": 0.79,
882
+ "grad_norm": 0.08321687579154968,
883
+ "learning_rate": 6.3299999999999995e-06,
884
+ "loss": 1.449633502960205,
885
+ "mean_token_accuracy": 0.8183982685208321,
886
+ "num_tokens": 46920.0,
887
+ "step": 790
888
+ },
889
+ {
890
+ "entropy": 0.8517522903392092,
891
+ "epoch": 0.8,
892
+ "grad_norm": 0.360664963722229,
893
+ "learning_rate": 6.030000000000001e-06,
894
+ "loss": 1.5935587882995605,
895
+ "mean_token_accuracy": 0.746666669845581,
896
+ "num_tokens": 47483.0,
897
+ "step": 800
898
+ },
899
+ {
900
+ "epoch": 0.8,
901
+ "eval_entropy": 0.5362537594168679,
902
+ "eval_loss": 1.291225790977478,
903
+ "eval_mean_token_accuracy": 0.809991346001625,
904
+ "eval_num_tokens": 47483.0,
905
+ "eval_runtime": 54.557,
906
+ "eval_samples_per_second": 1.833,
907
+ "eval_steps_per_second": 1.833,
908
+ "step": 800
909
+ },
910
+ {
911
+ "entropy": 0.5658039237372577,
912
+ "epoch": 0.81,
913
+ "grad_norm": 24.69063377380371,
914
+ "learning_rate": 5.73e-06,
915
+ "loss": 1.6795099258422852,
916
+ "mean_token_accuracy": 0.7500000089406967,
917
+ "num_tokens": 48112.0,
918
+ "step": 810
919
+ },
920
+ {
921
+ "entropy": 0.23472772459499538,
922
+ "epoch": 0.82,
923
+ "grad_norm": 0.13677963614463806,
924
+ "learning_rate": 5.43e-06,
925
+ "loss": 0.620347547531128,
926
+ "mean_token_accuracy": 0.9066666692495347,
927
+ "num_tokens": 48686.0,
928
+ "step": 820
929
+ },
930
+ {
931
+ "entropy": 0.17872974590864033,
932
+ "epoch": 0.83,
933
+ "grad_norm": 0.062276676297187805,
934
+ "learning_rate": 5.130000000000001e-06,
935
+ "loss": 0.3392207384109497,
936
+ "mean_token_accuracy": 0.9583333313465119,
937
+ "num_tokens": 49263.0,
938
+ "step": 830
939
+ },
940
+ {
941
+ "entropy": 0.7390760766458697,
942
+ "epoch": 0.84,
943
+ "grad_norm": 55.52785110473633,
944
+ "learning_rate": 4.83e-06,
945
+ "loss": 1.9530868530273438,
946
+ "mean_token_accuracy": 0.6723809599876404,
947
+ "num_tokens": 49957.0,
948
+ "step": 840
949
+ },
950
+ {
951
+ "entropy": 0.2889916429063305,
952
+ "epoch": 0.85,
953
+ "grad_norm": 0.03663825988769531,
954
+ "learning_rate": 4.53e-06,
955
+ "loss": 0.8394488334655762,
956
+ "mean_token_accuracy": 0.9300000011920929,
957
+ "num_tokens": 50557.0,
958
+ "step": 850
959
+ },
960
+ {
961
+ "entropy": 0.3451875123893842,
962
+ "epoch": 0.86,
963
+ "grad_norm": 256.18017578125,
964
+ "learning_rate": 4.229999999999999e-06,
965
+ "loss": 1.5904621124267577,
966
+ "mean_token_accuracy": 0.7757142901420593,
967
+ "num_tokens": 51137.0,
968
+ "step": 860
969
+ },
970
+ {
971
+ "entropy": 0.739490092662163,
972
+ "epoch": 0.87,
973
+ "grad_norm": 127.49256896972656,
974
+ "learning_rate": 3.9300000000000005e-06,
975
+ "loss": 2.1090816497802733,
976
+ "mean_token_accuracy": 0.7933333396911622,
977
+ "num_tokens": 51710.0,
978
+ "step": 870
979
+ },
980
+ {
981
+ "entropy": 0.36512562771094964,
982
+ "epoch": 0.88,
983
+ "grad_norm": 189.27102661132812,
984
+ "learning_rate": 3.63e-06,
985
+ "loss": 1.6141580581665038,
986
+ "mean_token_accuracy": 0.8483333349227905,
987
+ "num_tokens": 52235.0,
988
+ "step": 880
989
+ },
990
+ {
991
+ "entropy": 0.3579067521728575,
992
+ "epoch": 0.89,
993
+ "grad_norm": 40.83726119995117,
994
+ "learning_rate": 3.3300000000000003e-06,
995
+ "loss": 1.1513096809387207,
996
+ "mean_token_accuracy": 0.8666666716337204,
997
+ "num_tokens": 52865.0,
998
+ "step": 890
999
+ },
1000
+ {
1001
+ "entropy": 1.2824254330713303,
1002
+ "epoch": 0.9,
1003
+ "grad_norm": 58.594825744628906,
1004
+ "learning_rate": 3.0300000000000002e-06,
1005
+ "loss": 2.8049795150756838,
1006
+ "mean_token_accuracy": 0.5883333355188369,
1007
+ "num_tokens": 53435.0,
1008
+ "step": 900
1009
+ },
1010
+ {
1011
+ "epoch": 0.9,
1012
+ "eval_entropy": 0.5797992533538491,
1013
+ "eval_loss": 1.262194037437439,
1014
+ "eval_mean_token_accuracy": 0.8182532505691051,
1015
+ "eval_num_tokens": 53435.0,
1016
+ "eval_runtime": 58.521,
1017
+ "eval_samples_per_second": 1.709,
1018
+ "eval_steps_per_second": 1.709,
1019
+ "step": 900
1020
+ },
1021
+ {
1022
+ "entropy": 0.3366681849118322,
1023
+ "epoch": 0.91,
1024
+ "grad_norm": 32.87790298461914,
1025
+ "learning_rate": 2.73e-06,
1026
+ "loss": 0.47661585807800294,
1027
+ "mean_token_accuracy": 0.9041666686534882,
1028
+ "num_tokens": 54024.0,
1029
+ "step": 910
1030
+ },
1031
+ {
1032
+ "entropy": 0.6118204056750983,
1033
+ "epoch": 0.92,
1034
+ "grad_norm": 0.7896237969398499,
1035
+ "learning_rate": 2.43e-06,
1036
+ "loss": 1.956801414489746,
1037
+ "mean_token_accuracy": 0.7933333396911622,
1038
+ "num_tokens": 54605.0,
1039
+ "step": 920
1040
+ },
1041
+ {
1042
+ "entropy": 0.7288894818164409,
1043
+ "epoch": 0.93,
1044
+ "grad_norm": 0.16806739568710327,
1045
+ "learning_rate": 2.13e-06,
1046
+ "loss": 1.7675352096557617,
1047
+ "mean_token_accuracy": 0.7876190513372421,
1048
+ "num_tokens": 55295.0,
1049
+ "step": 930
1050
+ },
1051
+ {
1052
+ "entropy": 0.4382998514920473,
1053
+ "epoch": 0.94,
1054
+ "grad_norm": 0.584433376789093,
1055
+ "learning_rate": 1.83e-06,
1056
+ "loss": 1.6188522338867188,
1057
+ "mean_token_accuracy": 0.816666665673256,
1058
+ "num_tokens": 55887.0,
1059
+ "step": 940
1060
+ },
1061
+ {
1062
+ "entropy": 0.5724920945242047,
1063
+ "epoch": 0.95,
1064
+ "grad_norm": 10.927814483642578,
1065
+ "learning_rate": 1.53e-06,
1066
+ "loss": 1.0138172149658202,
1067
+ "mean_token_accuracy": 0.8507142901420593,
1068
+ "num_tokens": 56413.0,
1069
+ "step": 950
1070
+ },
1071
+ {
1072
+ "entropy": 0.6996954609872773,
1073
+ "epoch": 0.96,
1074
+ "grad_norm": 0.10312433540821075,
1075
+ "learning_rate": 1.23e-06,
1076
+ "loss": 1.4810507774353028,
1077
+ "mean_token_accuracy": 0.7691666692495346,
1078
+ "num_tokens": 57003.0,
1079
+ "step": 960
1080
+ },
1081
+ {
1082
+ "entropy": 0.49967088787816466,
1083
+ "epoch": 0.97,
1084
+ "grad_norm": 114.4696273803711,
1085
+ "learning_rate": 9.3e-07,
1086
+ "loss": 0.9684356689453125,
1087
+ "mean_token_accuracy": 0.850833335518837,
1088
+ "num_tokens": 57546.0,
1089
+ "step": 970
1090
+ },
1091
+ {
1092
+ "entropy": 0.46252561938017606,
1093
+ "epoch": 0.98,
1094
+ "grad_norm": 55.80523681640625,
1095
+ "learning_rate": 6.3e-07,
1096
+ "loss": 0.6090232372283936,
1097
+ "mean_token_accuracy": 0.8857142865657807,
1098
+ "num_tokens": 58180.0,
1099
+ "step": 980
1100
+ },
1101
+ {
1102
+ "entropy": 1.3375183925963938,
1103
+ "epoch": 0.99,
1104
+ "grad_norm": 170.6082305908203,
1105
+ "learning_rate": 3.2999999999999996e-07,
1106
+ "loss": 2.3160438537597656,
1107
+ "mean_token_accuracy": 0.6857142895460129,
1108
+ "num_tokens": 58793.0,
1109
+ "step": 990
1110
+ },
1111
+ {
1112
+ "entropy": 0.5723713244777173,
1113
+ "epoch": 1.0,
1114
+ "grad_norm": 0.11968730390071869,
1115
+ "learning_rate": 3.0000000000000004e-08,
1116
+ "loss": 0.8962030410766602,
1117
+ "mean_token_accuracy": 0.8595238149166107,
1118
+ "num_tokens": 59332.0,
1119
+ "step": 1000
1120
+ },
1121
+ {
1122
+ "epoch": 1.0,
1123
+ "eval_entropy": 0.5731571038276888,
1124
+ "eval_loss": 1.1951602697372437,
1125
+ "eval_mean_token_accuracy": 0.8162532506883144,
1126
+ "eval_num_tokens": 59332.0,
1127
+ "eval_runtime": 56.0202,
1128
+ "eval_samples_per_second": 1.785,
1129
+ "eval_steps_per_second": 1.785,
1130
+ "step": 1000
1131
  }
1132
  ],
1133
  "logging_steps": 10,
 
1142
  "should_evaluate": false,
1143
  "should_log": false,
1144
  "should_save": true,
1145
+ "should_training_stop": true
1146
  },
1147
  "attributes": {}
1148
  }
1149
  },
1150
+ "total_flos": 127408864687104.0,
1151
  "train_batch_size": 1,
1152
  "trial_name": null,
1153
  "trial_params": null