| { |
| "best_metric": 69.58355297838693, |
| "best_model_checkpoint": "./dir/checkpoint-1600", |
| "epoch": 90.9090909090909, |
| "eval_steps": 200, |
| "global_step": 2000, |
| "is_hyper_param_search": false, |
| "is_local_process_zero": true, |
| "is_world_process_zero": true, |
| "log_history": [ |
| { |
| "epoch": 1.1363636363636362, |
| "grad_norm": 7.941728115081787, |
| "learning_rate": 1.25e-05, |
| "loss": 0.0013, |
| "step": 25 |
| }, |
| { |
| "epoch": 2.2727272727272725, |
| "grad_norm": 16.12127113342285, |
| "learning_rate": 2.45e-05, |
| "loss": 0.0118, |
| "step": 50 |
| }, |
| { |
| "epoch": 3.409090909090909, |
| "grad_norm": 12.840298652648926, |
| "learning_rate": 3.7e-05, |
| "loss": 0.0343, |
| "step": 75 |
| }, |
| { |
| "epoch": 4.545454545454545, |
| "grad_norm": 16.991994857788086, |
| "learning_rate": 4.9500000000000004e-05, |
| "loss": 0.0485, |
| "step": 100 |
| }, |
| { |
| "epoch": 5.681818181818182, |
| "grad_norm": 13.358720779418945, |
| "learning_rate": 4.9981923852113145e-05, |
| "loss": 0.0577, |
| "step": 125 |
| }, |
| { |
| "epoch": 6.818181818181818, |
| "grad_norm": 10.649383544921875, |
| "learning_rate": 4.9921303204384104e-05, |
| "loss": 0.0516, |
| "step": 150 |
| }, |
| { |
| "epoch": 7.954545454545455, |
| "grad_norm": 8.825310707092285, |
| "learning_rate": 4.981810492817532e-05, |
| "loss": 0.0414, |
| "step": 175 |
| }, |
| { |
| "epoch": 9.090909090909092, |
| "grad_norm": 6.63723611831665, |
| "learning_rate": 4.967250533601059e-05, |
| "loss": 0.0369, |
| "step": 200 |
| }, |
| { |
| "epoch": 9.090909090909092, |
| "eval_loss": 0.626794695854187, |
| "eval_runtime": 79.9636, |
| "eval_samples_per_second": 2.564, |
| "eval_steps_per_second": 0.163, |
| "eval_wer": 77.59620453347391, |
| "step": 200 |
| }, |
| { |
| "epoch": 10.227272727272727, |
| "grad_norm": 5.281564712524414, |
| "learning_rate": 4.94930688078226e-05, |
| "loss": 0.0311, |
| "step": 225 |
| }, |
| { |
| "epoch": 11.363636363636363, |
| "grad_norm": 7.943972587585449, |
| "learning_rate": 4.926515107833547e-05, |
| "loss": 0.0259, |
| "step": 250 |
| }, |
| { |
| "epoch": 12.5, |
| "grad_norm": 9.827160835266113, |
| "learning_rate": 4.8995776745269254e-05, |
| "loss": 0.0248, |
| "step": 275 |
| }, |
| { |
| "epoch": 13.636363636363637, |
| "grad_norm": 7.034149169921875, |
| "learning_rate": 4.868540603015335e-05, |
| "loss": 0.0233, |
| "step": 300 |
| }, |
| { |
| "epoch": 14.772727272727273, |
| "grad_norm": 5.143306255340576, |
| "learning_rate": 4.83345691961482e-05, |
| "loss": 0.0204, |
| "step": 325 |
| }, |
| { |
| "epoch": 15.909090909090908, |
| "grad_norm": 8.267546653747559, |
| "learning_rate": 4.794386564209953e-05, |
| "loss": 0.0197, |
| "step": 350 |
| }, |
| { |
| "epoch": 17.045454545454547, |
| "grad_norm": 3.309521436691284, |
| "learning_rate": 4.751396287847556e-05, |
| "loss": 0.0194, |
| "step": 375 |
| }, |
| { |
| "epoch": 18.181818181818183, |
| "grad_norm": 4.044373989105225, |
| "learning_rate": 4.704559538693647e-05, |
| "loss": 0.0142, |
| "step": 400 |
| }, |
| { |
| "epoch": 18.181818181818183, |
| "eval_loss": 0.6851987838745117, |
| "eval_runtime": 80.0653, |
| "eval_samples_per_second": 2.56, |
| "eval_steps_per_second": 0.162, |
| "eval_wer": 74.48603057459145, |
| "step": 400 |
| }, |
| { |
| "epoch": 19.318181818181817, |
| "grad_norm": 10.888069152832031, |
| "learning_rate": 4.65395633654849e-05, |
| "loss": 0.0149, |
| "step": 425 |
| }, |
| { |
| "epoch": 20.454545454545453, |
| "grad_norm": 4.297384262084961, |
| "learning_rate": 4.5996731361340994e-05, |
| "loss": 0.0134, |
| "step": 450 |
| }, |
| { |
| "epoch": 21.59090909090909, |
| "grad_norm": 3.0219924449920654, |
| "learning_rate": 4.541802679387806e-05, |
| "loss": 0.0121, |
| "step": 475 |
| }, |
| { |
| "epoch": 22.727272727272727, |
| "grad_norm": 5.045082092285156, |
| "learning_rate": 4.480443837014205e-05, |
| "loss": 0.0124, |
| "step": 500 |
| }, |
| { |
| "epoch": 23.863636363636363, |
| "grad_norm": 9.892870903015137, |
| "learning_rate": 4.415701439566223e-05, |
| "loss": 0.0108, |
| "step": 525 |
| }, |
| { |
| "epoch": 25.0, |
| "grad_norm": 5.96191930770874, |
| "learning_rate": 4.3476860983438714e-05, |
| "loss": 0.0105, |
| "step": 550 |
| }, |
| { |
| "epoch": 26.136363636363637, |
| "grad_norm": 1.9904580116271973, |
| "learning_rate": 4.2765140164166984e-05, |
| "loss": 0.0104, |
| "step": 575 |
| }, |
| { |
| "epoch": 27.272727272727273, |
| "grad_norm": 3.5047149658203125, |
| "learning_rate": 4.202306790092792e-05, |
| "loss": 0.0094, |
| "step": 600 |
| }, |
| { |
| "epoch": 27.272727272727273, |
| "eval_loss": 0.8124232888221741, |
| "eval_runtime": 78.5939, |
| "eval_samples_per_second": 2.608, |
| "eval_steps_per_second": 0.165, |
| "eval_wer": 73.69530838165524, |
| "step": 600 |
| }, |
| { |
| "epoch": 28.40909090909091, |
| "grad_norm": 5.023063659667969, |
| "learning_rate": 4.1251912011735326e-05, |
| "loss": 0.0095, |
| "step": 625 |
| }, |
| { |
| "epoch": 29.545454545454547, |
| "grad_norm": 2.0389955043792725, |
| "learning_rate": 4.0452990003490047e-05, |
| "loss": 0.0081, |
| "step": 650 |
| }, |
| { |
| "epoch": 30.681818181818183, |
| "grad_norm": 5.919183731079102, |
| "learning_rate": 3.9627666821041545e-05, |
| "loss": 0.0078, |
| "step": 675 |
| }, |
| { |
| "epoch": 31.818181818181817, |
| "grad_norm": 2.930298328399658, |
| "learning_rate": 3.877735251520258e-05, |
| "loss": 0.0066, |
| "step": 700 |
| }, |
| { |
| "epoch": 32.95454545454545, |
| "grad_norm": 3.1952452659606934, |
| "learning_rate": 3.7903499833701006e-05, |
| "loss": 0.0081, |
| "step": 725 |
| }, |
| { |
| "epoch": 34.09090909090909, |
| "grad_norm": 2.5794553756713867, |
| "learning_rate": 3.700760173918463e-05, |
| "loss": 0.0057, |
| "step": 750 |
| }, |
| { |
| "epoch": 35.22727272727273, |
| "grad_norm": 3.1983907222747803, |
| "learning_rate": 3.6091188858519607e-05, |
| "loss": 0.0051, |
| "step": 775 |
| }, |
| { |
| "epoch": 36.36363636363637, |
| "grad_norm": 3.2582602500915527, |
| "learning_rate": 3.515582686774007e-05, |
| "loss": 0.0058, |
| "step": 800 |
| }, |
| { |
| "epoch": 36.36363636363637, |
| "eval_loss": 0.7887496948242188, |
| "eval_runtime": 79.7779, |
| "eval_samples_per_second": 2.57, |
| "eval_steps_per_second": 0.163, |
| "eval_wer": 74.11702688455456, |
| "step": 800 |
| }, |
| { |
| "epoch": 37.5, |
| "grad_norm": 3.7779734134674072, |
| "learning_rate": 3.4203113817116957e-05, |
| "loss": 0.0043, |
| "step": 825 |
| }, |
| { |
| "epoch": 38.63636363636363, |
| "grad_norm": 3.264604091644287, |
| "learning_rate": 3.3234677400915865e-05, |
| "loss": 0.0056, |
| "step": 850 |
| }, |
| { |
| "epoch": 39.77272727272727, |
| "grad_norm": 2.351633310317993, |
| "learning_rate": 3.225217217650876e-05, |
| "loss": 0.0034, |
| "step": 875 |
| }, |
| { |
| "epoch": 40.90909090909091, |
| "grad_norm": 1.6577147245407104, |
| "learning_rate": 3.1257276737590365e-05, |
| "loss": 0.0031, |
| "step": 900 |
| }, |
| { |
| "epoch": 42.04545454545455, |
| "grad_norm": 1.4678380489349365, |
| "learning_rate": 3.025169084632915e-05, |
| "loss": 0.0041, |
| "step": 925 |
| }, |
| { |
| "epoch": 43.18181818181818, |
| "grad_norm": 2.831874370574951, |
| "learning_rate": 2.9237132529351996e-05, |
| "loss": 0.0034, |
| "step": 950 |
| }, |
| { |
| "epoch": 44.31818181818182, |
| "grad_norm": 4.369483947753906, |
| "learning_rate": 2.8215335142524657e-05, |
| "loss": 0.0033, |
| "step": 975 |
| }, |
| { |
| "epoch": 45.45454545454545, |
| "grad_norm": 1.6372367143630981, |
| "learning_rate": 2.7188044409542278e-05, |
| "loss": 0.0022, |
| "step": 1000 |
| }, |
| { |
| "epoch": 45.45454545454545, |
| "eval_loss": 0.8436204195022583, |
| "eval_runtime": 79.4622, |
| "eval_samples_per_second": 2.58, |
| "eval_steps_per_second": 0.164, |
| "eval_wer": 74.22245651027939, |
| "step": 1000 |
| }, |
| { |
| "epoch": 46.59090909090909, |
| "grad_norm": 1.6608319282531738, |
| "learning_rate": 2.6157015439389774e-05, |
| "loss": 0.0022, |
| "step": 1025 |
| }, |
| { |
| "epoch": 47.72727272727273, |
| "grad_norm": 1.1972359418869019, |
| "learning_rate": 2.512400972776755e-05, |
| "loss": 0.0025, |
| "step": 1050 |
| }, |
| { |
| "epoch": 48.86363636363637, |
| "grad_norm": 0.1433289498090744, |
| "learning_rate": 2.4090792147605647e-05, |
| "loss": 0.0023, |
| "step": 1075 |
| }, |
| { |
| "epoch": 50.0, |
| "grad_norm": 1.2511216402053833, |
| "learning_rate": 2.3059127933807954e-05, |
| "loss": 0.0018, |
| "step": 1100 |
| }, |
| { |
| "epoch": 51.13636363636363, |
| "grad_norm": 1.3607325553894043, |
| "learning_rate": 2.2030779667377996e-05, |
| "loss": 0.0019, |
| "step": 1125 |
| }, |
| { |
| "epoch": 52.27272727272727, |
| "grad_norm": 1.5359007120132446, |
| "learning_rate": 2.100750426407884e-05, |
| "loss": 0.0013, |
| "step": 1150 |
| }, |
| { |
| "epoch": 53.40909090909091, |
| "grad_norm": 1.4747318029403687, |
| "learning_rate": 1.9991049972771972e-05, |
| "loss": 0.0015, |
| "step": 1175 |
| }, |
| { |
| "epoch": 54.54545454545455, |
| "grad_norm": 2.2901978492736816, |
| "learning_rate": 1.8983153388563486e-05, |
| "loss": 0.0008, |
| "step": 1200 |
| }, |
| { |
| "epoch": 54.54545454545455, |
| "eval_loss": 0.8767306804656982, |
| "eval_runtime": 80.2298, |
| "eval_samples_per_second": 2.555, |
| "eval_steps_per_second": 0.162, |
| "eval_wer": 71.85028993147074, |
| "step": 1200 |
| }, |
| { |
| "epoch": 55.68181818181818, |
| "grad_norm": 0.1295584738254547, |
| "learning_rate": 1.798553648586042e-05, |
| "loss": 0.0009, |
| "step": 1225 |
| }, |
| { |
| "epoch": 56.81818181818182, |
| "grad_norm": 1.2995024919509888, |
| "learning_rate": 1.699990367640643e-05, |
| "loss": 0.0006, |
| "step": 1250 |
| }, |
| { |
| "epoch": 57.95454545454545, |
| "grad_norm": 0.15971346199512482, |
| "learning_rate": 1.602793889732288e-05, |
| "loss": 0.0005, |
| "step": 1275 |
| }, |
| { |
| "epoch": 59.09090909090909, |
| "grad_norm": 0.20202413201332092, |
| "learning_rate": 1.5071302734130489e-05, |
| "loss": 0.0004, |
| "step": 1300 |
| }, |
| { |
| "epoch": 60.22727272727273, |
| "grad_norm": 0.4286993145942688, |
| "learning_rate": 1.4131629583666888e-05, |
| "loss": 0.0006, |
| "step": 1325 |
| }, |
| { |
| "epoch": 61.36363636363637, |
| "grad_norm": 1.1410396099090576, |
| "learning_rate": 1.3210524861747015e-05, |
| "loss": 0.0002, |
| "step": 1350 |
| }, |
| { |
| "epoch": 62.5, |
| "grad_norm": 0.011458423919975758, |
| "learning_rate": 1.2309562260337073e-05, |
| "loss": 0.0002, |
| "step": 1375 |
| }, |
| { |
| "epoch": 63.63636363636363, |
| "grad_norm": 0.14888815581798553, |
| "learning_rate": 1.1430281058928324e-05, |
| "loss": 0.0002, |
| "step": 1400 |
| }, |
| { |
| "epoch": 63.63636363636363, |
| "eval_loss": 0.9396534562110901, |
| "eval_runtime": 79.5112, |
| "eval_samples_per_second": 2.578, |
| "eval_steps_per_second": 0.163, |
| "eval_wer": 70.9541381128097, |
| "step": 1400 |
| }, |
| { |
| "epoch": 64.77272727272727, |
| "grad_norm": 0.047700293362140656, |
| "learning_rate": 1.0574183494703748e-05, |
| "loss": 0.0003, |
| "step": 1425 |
| }, |
| { |
| "epoch": 65.9090909090909, |
| "grad_norm": 0.0036408633459359407, |
| "learning_rate": 9.742732195991142e-06, |
| "loss": 0.0, |
| "step": 1450 |
| }, |
| { |
| "epoch": 67.04545454545455, |
| "grad_norm": 0.009580373764038086, |
| "learning_rate": 8.937347683387095e-06, |
| "loss": 0.0, |
| "step": 1475 |
| }, |
| { |
| "epoch": 68.18181818181819, |
| "grad_norm": 0.007072719745337963, |
| "learning_rate": 8.159405942821375e-06, |
| "loss": 0.0, |
| "step": 1500 |
| }, |
| { |
| "epoch": 69.31818181818181, |
| "grad_norm": 0.0026191575452685356, |
| "learning_rate": 7.410236074708077e-06, |
| "loss": 0.0001, |
| "step": 1525 |
| }, |
| { |
| "epoch": 70.45454545454545, |
| "grad_norm": 0.0020283255726099014, |
| "learning_rate": 6.691118023199861e-06, |
| "loss": 0.0, |
| "step": 1550 |
| }, |
| { |
| "epoch": 71.5909090909091, |
| "grad_norm": 0.0018077497370541096, |
| "learning_rate": 6.003280389424789e-06, |
| "loss": 0.0, |
| "step": 1575 |
| }, |
| { |
| "epoch": 72.72727272727273, |
| "grad_norm": 0.0013726140605285764, |
| "learning_rate": 5.347898332441975e-06, |
| "loss": 0.0, |
| "step": 1600 |
| }, |
| { |
| "epoch": 72.72727272727273, |
| "eval_loss": 0.9584089517593384, |
| "eval_runtime": 79.3982, |
| "eval_samples_per_second": 2.582, |
| "eval_steps_per_second": 0.164, |
| "eval_wer": 69.58355297838693, |
| "step": 1600 |
| }, |
| { |
| "epoch": 73.86363636363636, |
| "grad_norm": 0.0010475883027538657, |
| "learning_rate": 4.726091561502e-06, |
| "loss": 0.0, |
| "step": 1625 |
| }, |
| { |
| "epoch": 75.0, |
| "grad_norm": 0.0010232036001980305, |
| "learning_rate": 4.138922423042449e-06, |
| "loss": 0.0, |
| "step": 1650 |
| }, |
| { |
| "epoch": 76.13636363636364, |
| "grad_norm": 0.0008750821580179036, |
| "learning_rate": 3.5873940856868656e-06, |
| "loss": 0.0, |
| "step": 1675 |
| }, |
| { |
| "epoch": 77.27272727272727, |
| "grad_norm": 0.0009788611205294728, |
| "learning_rate": 3.072448826347932e-06, |
| "loss": 0.0, |
| "step": 1700 |
| }, |
| { |
| "epoch": 78.4090909090909, |
| "grad_norm": 0.0008014105842448771, |
| "learning_rate": 2.5949664203632428e-06, |
| "loss": 0.0, |
| "step": 1725 |
| }, |
| { |
| "epoch": 79.54545454545455, |
| "grad_norm": 0.0007674263906665146, |
| "learning_rate": 2.155762638413841e-06, |
| "loss": 0.0, |
| "step": 1750 |
| }, |
| { |
| "epoch": 80.68181818181819, |
| "grad_norm": 0.00074714922811836, |
| "learning_rate": 1.7555878527937164e-06, |
| "loss": 0.0, |
| "step": 1775 |
| }, |
| { |
| "epoch": 81.81818181818181, |
| "grad_norm": 0.000759561953600496, |
| "learning_rate": 1.3951257554113306e-06, |
| "loss": 0.0, |
| "step": 1800 |
| }, |
| { |
| "epoch": 81.81818181818181, |
| "eval_loss": 0.9801890850067139, |
| "eval_runtime": 79.7021, |
| "eval_samples_per_second": 2.572, |
| "eval_steps_per_second": 0.163, |
| "eval_wer": 69.95255666842382, |
| "step": 1800 |
| }, |
| { |
| "epoch": 82.95454545454545, |
| "grad_norm": 0.0007248718175105751, |
| "learning_rate": 1.074992189713453e-06, |
| "loss": 0.0, |
| "step": 1825 |
| }, |
| { |
| "epoch": 84.0909090909091, |
| "grad_norm": 0.0007800040184520185, |
| "learning_rate": 7.957340985269596e-07, |
| "loss": 0.0, |
| "step": 1850 |
| }, |
| { |
| "epoch": 85.22727272727273, |
| "grad_norm": 0.0005734158912673593, |
| "learning_rate": 5.578285896162106e-07, |
| "loss": 0.0, |
| "step": 1875 |
| }, |
| { |
| "epoch": 86.36363636363636, |
| "grad_norm": 0.0006857244297862053, |
| "learning_rate": 3.616821205524007e-07, |
| "loss": 0.0, |
| "step": 1900 |
| }, |
| { |
| "epoch": 87.5, |
| "grad_norm": 0.0006822862196713686, |
| "learning_rate": 2.0762980428765122e-07, |
| "loss": 0.0, |
| "step": 1925 |
| }, |
| { |
| "epoch": 88.63636363636364, |
| "grad_norm": 0.0006552569684572518, |
| "learning_rate": 9.59348366201318e-08, |
| "loss": 0.0, |
| "step": 1950 |
| }, |
| { |
| "epoch": 89.77272727272727, |
| "grad_norm": 0.0004952407325617969, |
| "learning_rate": 2.6788046528461453e-08, |
| "loss": 0.0, |
| "step": 1975 |
| }, |
| { |
| "epoch": 90.9090909090909, |
| "grad_norm": 0.0006054748664610088, |
| "learning_rate": 3.0757014360671686e-10, |
| "loss": 0.0, |
| "step": 2000 |
| }, |
| { |
| "epoch": 90.9090909090909, |
| "eval_loss": 0.9858900308609009, |
| "eval_runtime": 79.3105, |
| "eval_samples_per_second": 2.585, |
| "eval_steps_per_second": 0.164, |
| "eval_wer": 69.68898260411176, |
| "step": 2000 |
| } |
| ], |
| "logging_steps": 25, |
| "max_steps": 2000, |
| "num_input_tokens_seen": 0, |
| "num_train_epochs": 91, |
| "save_steps": 200, |
| "stateful_callbacks": { |
| "TrainerControl": { |
| "args": { |
| "should_epoch_stop": false, |
| "should_evaluate": false, |
| "should_log": false, |
| "should_save": true, |
| "should_training_stop": true |
| }, |
| "attributes": {} |
| } |
| }, |
| "total_flos": 1.83136295043072e+19, |
| "train_batch_size": 8, |
| "trial_name": null, |
| "trial_params": null |
| } |
|
|