{ "best_metric": 69.58355297838693, "best_model_checkpoint": "./dir/checkpoint-1600", "epoch": 90.9090909090909, "eval_steps": 200, "global_step": 2000, "is_hyper_param_search": false, "is_local_process_zero": true, "is_world_process_zero": true, "log_history": [ { "epoch": 1.1363636363636362, "grad_norm": 7.941728115081787, "learning_rate": 1.25e-05, "loss": 0.0013, "step": 25 }, { "epoch": 2.2727272727272725, "grad_norm": 16.12127113342285, "learning_rate": 2.45e-05, "loss": 0.0118, "step": 50 }, { "epoch": 3.409090909090909, "grad_norm": 12.840298652648926, "learning_rate": 3.7e-05, "loss": 0.0343, "step": 75 }, { "epoch": 4.545454545454545, "grad_norm": 16.991994857788086, "learning_rate": 4.9500000000000004e-05, "loss": 0.0485, "step": 100 }, { "epoch": 5.681818181818182, "grad_norm": 13.358720779418945, "learning_rate": 4.9981923852113145e-05, "loss": 0.0577, "step": 125 }, { "epoch": 6.818181818181818, "grad_norm": 10.649383544921875, "learning_rate": 4.9921303204384104e-05, "loss": 0.0516, "step": 150 }, { "epoch": 7.954545454545455, "grad_norm": 8.825310707092285, "learning_rate": 4.981810492817532e-05, "loss": 0.0414, "step": 175 }, { "epoch": 9.090909090909092, "grad_norm": 6.63723611831665, "learning_rate": 4.967250533601059e-05, "loss": 0.0369, "step": 200 }, { "epoch": 9.090909090909092, "eval_loss": 0.626794695854187, "eval_runtime": 79.9636, "eval_samples_per_second": 2.564, "eval_steps_per_second": 0.163, "eval_wer": 77.59620453347391, "step": 200 }, { "epoch": 10.227272727272727, "grad_norm": 5.281564712524414, "learning_rate": 4.94930688078226e-05, "loss": 0.0311, "step": 225 }, { "epoch": 11.363636363636363, "grad_norm": 7.943972587585449, "learning_rate": 4.926515107833547e-05, "loss": 0.0259, "step": 250 }, { "epoch": 12.5, "grad_norm": 9.827160835266113, "learning_rate": 4.8995776745269254e-05, "loss": 0.0248, "step": 275 }, { "epoch": 13.636363636363637, "grad_norm": 7.034149169921875, "learning_rate": 4.868540603015335e-05, "loss": 0.0233, "step": 300 }, { "epoch": 14.772727272727273, "grad_norm": 5.143306255340576, "learning_rate": 4.83345691961482e-05, "loss": 0.0204, "step": 325 }, { "epoch": 15.909090909090908, "grad_norm": 8.267546653747559, "learning_rate": 4.794386564209953e-05, "loss": 0.0197, "step": 350 }, { "epoch": 17.045454545454547, "grad_norm": 3.309521436691284, "learning_rate": 4.751396287847556e-05, "loss": 0.0194, "step": 375 }, { "epoch": 18.181818181818183, "grad_norm": 4.044373989105225, "learning_rate": 4.704559538693647e-05, "loss": 0.0142, "step": 400 }, { "epoch": 18.181818181818183, "eval_loss": 0.6851987838745117, "eval_runtime": 80.0653, "eval_samples_per_second": 2.56, "eval_steps_per_second": 0.162, "eval_wer": 74.48603057459145, "step": 400 }, { "epoch": 19.318181818181817, "grad_norm": 10.888069152832031, "learning_rate": 4.65395633654849e-05, "loss": 0.0149, "step": 425 }, { "epoch": 20.454545454545453, "grad_norm": 4.297384262084961, "learning_rate": 4.5996731361340994e-05, "loss": 0.0134, "step": 450 }, { "epoch": 21.59090909090909, "grad_norm": 3.0219924449920654, "learning_rate": 4.541802679387806e-05, "loss": 0.0121, "step": 475 }, { "epoch": 22.727272727272727, "grad_norm": 5.045082092285156, "learning_rate": 4.480443837014205e-05, "loss": 0.0124, "step": 500 }, { "epoch": 23.863636363636363, "grad_norm": 9.892870903015137, "learning_rate": 4.415701439566223e-05, "loss": 0.0108, "step": 525 }, { "epoch": 25.0, "grad_norm": 5.96191930770874, "learning_rate": 4.3476860983438714e-05, "loss": 0.0105, "step": 550 }, { "epoch": 26.136363636363637, "grad_norm": 1.9904580116271973, "learning_rate": 4.2765140164166984e-05, "loss": 0.0104, "step": 575 }, { "epoch": 27.272727272727273, "grad_norm": 3.5047149658203125, "learning_rate": 4.202306790092792e-05, "loss": 0.0094, "step": 600 }, { "epoch": 27.272727272727273, "eval_loss": 0.8124232888221741, "eval_runtime": 78.5939, "eval_samples_per_second": 2.608, "eval_steps_per_second": 0.165, "eval_wer": 73.69530838165524, "step": 600 }, { "epoch": 28.40909090909091, "grad_norm": 5.023063659667969, "learning_rate": 4.1251912011735326e-05, "loss": 0.0095, "step": 625 }, { "epoch": 29.545454545454547, "grad_norm": 2.0389955043792725, "learning_rate": 4.0452990003490047e-05, "loss": 0.0081, "step": 650 }, { "epoch": 30.681818181818183, "grad_norm": 5.919183731079102, "learning_rate": 3.9627666821041545e-05, "loss": 0.0078, "step": 675 }, { "epoch": 31.818181818181817, "grad_norm": 2.930298328399658, "learning_rate": 3.877735251520258e-05, "loss": 0.0066, "step": 700 }, { "epoch": 32.95454545454545, "grad_norm": 3.1952452659606934, "learning_rate": 3.7903499833701006e-05, "loss": 0.0081, "step": 725 }, { "epoch": 34.09090909090909, "grad_norm": 2.5794553756713867, "learning_rate": 3.700760173918463e-05, "loss": 0.0057, "step": 750 }, { "epoch": 35.22727272727273, "grad_norm": 3.1983907222747803, "learning_rate": 3.6091188858519607e-05, "loss": 0.0051, "step": 775 }, { "epoch": 36.36363636363637, "grad_norm": 3.2582602500915527, "learning_rate": 3.515582686774007e-05, "loss": 0.0058, "step": 800 }, { "epoch": 36.36363636363637, "eval_loss": 0.7887496948242188, "eval_runtime": 79.7779, "eval_samples_per_second": 2.57, "eval_steps_per_second": 0.163, "eval_wer": 74.11702688455456, "step": 800 }, { "epoch": 37.5, "grad_norm": 3.7779734134674072, "learning_rate": 3.4203113817116957e-05, "loss": 0.0043, "step": 825 }, { "epoch": 38.63636363636363, "grad_norm": 3.264604091644287, "learning_rate": 3.3234677400915865e-05, "loss": 0.0056, "step": 850 }, { "epoch": 39.77272727272727, "grad_norm": 2.351633310317993, "learning_rate": 3.225217217650876e-05, "loss": 0.0034, "step": 875 }, { "epoch": 40.90909090909091, "grad_norm": 1.6577147245407104, "learning_rate": 3.1257276737590365e-05, "loss": 0.0031, "step": 900 }, { "epoch": 42.04545454545455, "grad_norm": 1.4678380489349365, "learning_rate": 3.025169084632915e-05, "loss": 0.0041, "step": 925 }, { "epoch": 43.18181818181818, "grad_norm": 2.831874370574951, "learning_rate": 2.9237132529351996e-05, "loss": 0.0034, "step": 950 }, { "epoch": 44.31818181818182, "grad_norm": 4.369483947753906, "learning_rate": 2.8215335142524657e-05, "loss": 0.0033, "step": 975 }, { "epoch": 45.45454545454545, "grad_norm": 1.6372367143630981, "learning_rate": 2.7188044409542278e-05, "loss": 0.0022, "step": 1000 }, { "epoch": 45.45454545454545, "eval_loss": 0.8436204195022583, "eval_runtime": 79.4622, "eval_samples_per_second": 2.58, "eval_steps_per_second": 0.164, "eval_wer": 74.22245651027939, "step": 1000 }, { "epoch": 46.59090909090909, "grad_norm": 1.6608319282531738, "learning_rate": 2.6157015439389774e-05, "loss": 0.0022, "step": 1025 }, { "epoch": 47.72727272727273, "grad_norm": 1.1972359418869019, "learning_rate": 2.512400972776755e-05, "loss": 0.0025, "step": 1050 }, { "epoch": 48.86363636363637, "grad_norm": 0.1433289498090744, "learning_rate": 2.4090792147605647e-05, "loss": 0.0023, "step": 1075 }, { "epoch": 50.0, "grad_norm": 1.2511216402053833, "learning_rate": 2.3059127933807954e-05, "loss": 0.0018, "step": 1100 }, { "epoch": 51.13636363636363, "grad_norm": 1.3607325553894043, "learning_rate": 2.2030779667377996e-05, "loss": 0.0019, "step": 1125 }, { "epoch": 52.27272727272727, "grad_norm": 1.5359007120132446, "learning_rate": 2.100750426407884e-05, "loss": 0.0013, "step": 1150 }, { "epoch": 53.40909090909091, "grad_norm": 1.4747318029403687, "learning_rate": 1.9991049972771972e-05, "loss": 0.0015, "step": 1175 }, { "epoch": 54.54545454545455, "grad_norm": 2.2901978492736816, "learning_rate": 1.8983153388563486e-05, "loss": 0.0008, "step": 1200 }, { "epoch": 54.54545454545455, "eval_loss": 0.8767306804656982, "eval_runtime": 80.2298, "eval_samples_per_second": 2.555, "eval_steps_per_second": 0.162, "eval_wer": 71.85028993147074, "step": 1200 }, { "epoch": 55.68181818181818, "grad_norm": 0.1295584738254547, "learning_rate": 1.798553648586042e-05, "loss": 0.0009, "step": 1225 }, { "epoch": 56.81818181818182, "grad_norm": 1.2995024919509888, "learning_rate": 1.699990367640643e-05, "loss": 0.0006, "step": 1250 }, { "epoch": 57.95454545454545, "grad_norm": 0.15971346199512482, "learning_rate": 1.602793889732288e-05, "loss": 0.0005, "step": 1275 }, { "epoch": 59.09090909090909, "grad_norm": 0.20202413201332092, "learning_rate": 1.5071302734130489e-05, "loss": 0.0004, "step": 1300 }, { "epoch": 60.22727272727273, "grad_norm": 0.4286993145942688, "learning_rate": 1.4131629583666888e-05, "loss": 0.0006, "step": 1325 }, { "epoch": 61.36363636363637, "grad_norm": 1.1410396099090576, "learning_rate": 1.3210524861747015e-05, "loss": 0.0002, "step": 1350 }, { "epoch": 62.5, "grad_norm": 0.011458423919975758, "learning_rate": 1.2309562260337073e-05, "loss": 0.0002, "step": 1375 }, { "epoch": 63.63636363636363, "grad_norm": 0.14888815581798553, "learning_rate": 1.1430281058928324e-05, "loss": 0.0002, "step": 1400 }, { "epoch": 63.63636363636363, "eval_loss": 0.9396534562110901, "eval_runtime": 79.5112, "eval_samples_per_second": 2.578, "eval_steps_per_second": 0.163, "eval_wer": 70.9541381128097, "step": 1400 }, { "epoch": 64.77272727272727, "grad_norm": 0.047700293362140656, "learning_rate": 1.0574183494703748e-05, "loss": 0.0003, "step": 1425 }, { "epoch": 65.9090909090909, "grad_norm": 0.0036408633459359407, "learning_rate": 9.742732195991142e-06, "loss": 0.0, "step": 1450 }, { "epoch": 67.04545454545455, "grad_norm": 0.009580373764038086, "learning_rate": 8.937347683387095e-06, "loss": 0.0, "step": 1475 }, { "epoch": 68.18181818181819, "grad_norm": 0.007072719745337963, "learning_rate": 8.159405942821375e-06, "loss": 0.0, "step": 1500 }, { "epoch": 69.31818181818181, "grad_norm": 0.0026191575452685356, "learning_rate": 7.410236074708077e-06, "loss": 0.0001, "step": 1525 }, { "epoch": 70.45454545454545, "grad_norm": 0.0020283255726099014, "learning_rate": 6.691118023199861e-06, "loss": 0.0, "step": 1550 }, { "epoch": 71.5909090909091, "grad_norm": 0.0018077497370541096, "learning_rate": 6.003280389424789e-06, "loss": 0.0, "step": 1575 }, { "epoch": 72.72727272727273, "grad_norm": 0.0013726140605285764, "learning_rate": 5.347898332441975e-06, "loss": 0.0, "step": 1600 }, { "epoch": 72.72727272727273, "eval_loss": 0.9584089517593384, "eval_runtime": 79.3982, "eval_samples_per_second": 2.582, "eval_steps_per_second": 0.164, "eval_wer": 69.58355297838693, "step": 1600 }, { "epoch": 73.86363636363636, "grad_norm": 0.0010475883027538657, "learning_rate": 4.726091561502e-06, "loss": 0.0, "step": 1625 }, { "epoch": 75.0, "grad_norm": 0.0010232036001980305, "learning_rate": 4.138922423042449e-06, "loss": 0.0, "step": 1650 }, { "epoch": 76.13636363636364, "grad_norm": 0.0008750821580179036, "learning_rate": 3.5873940856868656e-06, "loss": 0.0, "step": 1675 }, { "epoch": 77.27272727272727, "grad_norm": 0.0009788611205294728, "learning_rate": 3.072448826347932e-06, "loss": 0.0, "step": 1700 }, { "epoch": 78.4090909090909, "grad_norm": 0.0008014105842448771, "learning_rate": 2.5949664203632428e-06, "loss": 0.0, "step": 1725 }, { "epoch": 79.54545454545455, "grad_norm": 0.0007674263906665146, "learning_rate": 2.155762638413841e-06, "loss": 0.0, "step": 1750 }, { "epoch": 80.68181818181819, "grad_norm": 0.00074714922811836, "learning_rate": 1.7555878527937164e-06, "loss": 0.0, "step": 1775 }, { "epoch": 81.81818181818181, "grad_norm": 0.000759561953600496, "learning_rate": 1.3951257554113306e-06, "loss": 0.0, "step": 1800 }, { "epoch": 81.81818181818181, "eval_loss": 0.9801890850067139, "eval_runtime": 79.7021, "eval_samples_per_second": 2.572, "eval_steps_per_second": 0.163, "eval_wer": 69.95255666842382, "step": 1800 }, { "epoch": 82.95454545454545, "grad_norm": 0.0007248718175105751, "learning_rate": 1.074992189713453e-06, "loss": 0.0, "step": 1825 }, { "epoch": 84.0909090909091, "grad_norm": 0.0007800040184520185, "learning_rate": 7.957340985269596e-07, "loss": 0.0, "step": 1850 }, { "epoch": 85.22727272727273, "grad_norm": 0.0005734158912673593, "learning_rate": 5.578285896162106e-07, "loss": 0.0, "step": 1875 }, { "epoch": 86.36363636363636, "grad_norm": 0.0006857244297862053, "learning_rate": 3.616821205524007e-07, "loss": 0.0, "step": 1900 }, { "epoch": 87.5, "grad_norm": 0.0006822862196713686, "learning_rate": 2.0762980428765122e-07, "loss": 0.0, "step": 1925 }, { "epoch": 88.63636363636364, "grad_norm": 0.0006552569684572518, "learning_rate": 9.59348366201318e-08, "loss": 0.0, "step": 1950 }, { "epoch": 89.77272727272727, "grad_norm": 0.0004952407325617969, "learning_rate": 2.6788046528461453e-08, "loss": 0.0, "step": 1975 }, { "epoch": 90.9090909090909, "grad_norm": 0.0006054748664610088, "learning_rate": 3.0757014360671686e-10, "loss": 0.0, "step": 2000 }, { "epoch": 90.9090909090909, "eval_loss": 0.9858900308609009, "eval_runtime": 79.3105, "eval_samples_per_second": 2.585, "eval_steps_per_second": 0.164, "eval_wer": 69.68898260411176, "step": 2000 } ], "logging_steps": 25, "max_steps": 2000, "num_input_tokens_seen": 0, "num_train_epochs": 91, "save_steps": 200, "stateful_callbacks": { "TrainerControl": { "args": { "should_epoch_stop": false, "should_evaluate": false, "should_log": false, "should_save": true, "should_training_stop": true }, "attributes": {} } }, "total_flos": 1.83136295043072e+19, "train_batch_size": 8, "trial_name": null, "trial_params": null }