whisper-amharic-small-v2 / trainer_state.json
chappM's picture
Upload folder using huggingface_hub
ccdfcdb verified
Raw
History Blame Contribute Delete
17 kB
{
"best_metric": 69.58355297838693,
"best_model_checkpoint": "./dir/checkpoint-1600",
"epoch": 90.9090909090909,
"eval_steps": 200,
"global_step": 2000,
"is_hyper_param_search": false,
"is_local_process_zero": true,
"is_world_process_zero": true,
"log_history": [
{
"epoch": 1.1363636363636362,
"grad_norm": 7.941728115081787,
"learning_rate": 1.25e-05,
"loss": 0.0013,
"step": 25
},
{
"epoch": 2.2727272727272725,
"grad_norm": 16.12127113342285,
"learning_rate": 2.45e-05,
"loss": 0.0118,
"step": 50
},
{
"epoch": 3.409090909090909,
"grad_norm": 12.840298652648926,
"learning_rate": 3.7e-05,
"loss": 0.0343,
"step": 75
},
{
"epoch": 4.545454545454545,
"grad_norm": 16.991994857788086,
"learning_rate": 4.9500000000000004e-05,
"loss": 0.0485,
"step": 100
},
{
"epoch": 5.681818181818182,
"grad_norm": 13.358720779418945,
"learning_rate": 4.9981923852113145e-05,
"loss": 0.0577,
"step": 125
},
{
"epoch": 6.818181818181818,
"grad_norm": 10.649383544921875,
"learning_rate": 4.9921303204384104e-05,
"loss": 0.0516,
"step": 150
},
{
"epoch": 7.954545454545455,
"grad_norm": 8.825310707092285,
"learning_rate": 4.981810492817532e-05,
"loss": 0.0414,
"step": 175
},
{
"epoch": 9.090909090909092,
"grad_norm": 6.63723611831665,
"learning_rate": 4.967250533601059e-05,
"loss": 0.0369,
"step": 200
},
{
"epoch": 9.090909090909092,
"eval_loss": 0.626794695854187,
"eval_runtime": 79.9636,
"eval_samples_per_second": 2.564,
"eval_steps_per_second": 0.163,
"eval_wer": 77.59620453347391,
"step": 200
},
{
"epoch": 10.227272727272727,
"grad_norm": 5.281564712524414,
"learning_rate": 4.94930688078226e-05,
"loss": 0.0311,
"step": 225
},
{
"epoch": 11.363636363636363,
"grad_norm": 7.943972587585449,
"learning_rate": 4.926515107833547e-05,
"loss": 0.0259,
"step": 250
},
{
"epoch": 12.5,
"grad_norm": 9.827160835266113,
"learning_rate": 4.8995776745269254e-05,
"loss": 0.0248,
"step": 275
},
{
"epoch": 13.636363636363637,
"grad_norm": 7.034149169921875,
"learning_rate": 4.868540603015335e-05,
"loss": 0.0233,
"step": 300
},
{
"epoch": 14.772727272727273,
"grad_norm": 5.143306255340576,
"learning_rate": 4.83345691961482e-05,
"loss": 0.0204,
"step": 325
},
{
"epoch": 15.909090909090908,
"grad_norm": 8.267546653747559,
"learning_rate": 4.794386564209953e-05,
"loss": 0.0197,
"step": 350
},
{
"epoch": 17.045454545454547,
"grad_norm": 3.309521436691284,
"learning_rate": 4.751396287847556e-05,
"loss": 0.0194,
"step": 375
},
{
"epoch": 18.181818181818183,
"grad_norm": 4.044373989105225,
"learning_rate": 4.704559538693647e-05,
"loss": 0.0142,
"step": 400
},
{
"epoch": 18.181818181818183,
"eval_loss": 0.6851987838745117,
"eval_runtime": 80.0653,
"eval_samples_per_second": 2.56,
"eval_steps_per_second": 0.162,
"eval_wer": 74.48603057459145,
"step": 400
},
{
"epoch": 19.318181818181817,
"grad_norm": 10.888069152832031,
"learning_rate": 4.65395633654849e-05,
"loss": 0.0149,
"step": 425
},
{
"epoch": 20.454545454545453,
"grad_norm": 4.297384262084961,
"learning_rate": 4.5996731361340994e-05,
"loss": 0.0134,
"step": 450
},
{
"epoch": 21.59090909090909,
"grad_norm": 3.0219924449920654,
"learning_rate": 4.541802679387806e-05,
"loss": 0.0121,
"step": 475
},
{
"epoch": 22.727272727272727,
"grad_norm": 5.045082092285156,
"learning_rate": 4.480443837014205e-05,
"loss": 0.0124,
"step": 500
},
{
"epoch": 23.863636363636363,
"grad_norm": 9.892870903015137,
"learning_rate": 4.415701439566223e-05,
"loss": 0.0108,
"step": 525
},
{
"epoch": 25.0,
"grad_norm": 5.96191930770874,
"learning_rate": 4.3476860983438714e-05,
"loss": 0.0105,
"step": 550
},
{
"epoch": 26.136363636363637,
"grad_norm": 1.9904580116271973,
"learning_rate": 4.2765140164166984e-05,
"loss": 0.0104,
"step": 575
},
{
"epoch": 27.272727272727273,
"grad_norm": 3.5047149658203125,
"learning_rate": 4.202306790092792e-05,
"loss": 0.0094,
"step": 600
},
{
"epoch": 27.272727272727273,
"eval_loss": 0.8124232888221741,
"eval_runtime": 78.5939,
"eval_samples_per_second": 2.608,
"eval_steps_per_second": 0.165,
"eval_wer": 73.69530838165524,
"step": 600
},
{
"epoch": 28.40909090909091,
"grad_norm": 5.023063659667969,
"learning_rate": 4.1251912011735326e-05,
"loss": 0.0095,
"step": 625
},
{
"epoch": 29.545454545454547,
"grad_norm": 2.0389955043792725,
"learning_rate": 4.0452990003490047e-05,
"loss": 0.0081,
"step": 650
},
{
"epoch": 30.681818181818183,
"grad_norm": 5.919183731079102,
"learning_rate": 3.9627666821041545e-05,
"loss": 0.0078,
"step": 675
},
{
"epoch": 31.818181818181817,
"grad_norm": 2.930298328399658,
"learning_rate": 3.877735251520258e-05,
"loss": 0.0066,
"step": 700
},
{
"epoch": 32.95454545454545,
"grad_norm": 3.1952452659606934,
"learning_rate": 3.7903499833701006e-05,
"loss": 0.0081,
"step": 725
},
{
"epoch": 34.09090909090909,
"grad_norm": 2.5794553756713867,
"learning_rate": 3.700760173918463e-05,
"loss": 0.0057,
"step": 750
},
{
"epoch": 35.22727272727273,
"grad_norm": 3.1983907222747803,
"learning_rate": 3.6091188858519607e-05,
"loss": 0.0051,
"step": 775
},
{
"epoch": 36.36363636363637,
"grad_norm": 3.2582602500915527,
"learning_rate": 3.515582686774007e-05,
"loss": 0.0058,
"step": 800
},
{
"epoch": 36.36363636363637,
"eval_loss": 0.7887496948242188,
"eval_runtime": 79.7779,
"eval_samples_per_second": 2.57,
"eval_steps_per_second": 0.163,
"eval_wer": 74.11702688455456,
"step": 800
},
{
"epoch": 37.5,
"grad_norm": 3.7779734134674072,
"learning_rate": 3.4203113817116957e-05,
"loss": 0.0043,
"step": 825
},
{
"epoch": 38.63636363636363,
"grad_norm": 3.264604091644287,
"learning_rate": 3.3234677400915865e-05,
"loss": 0.0056,
"step": 850
},
{
"epoch": 39.77272727272727,
"grad_norm": 2.351633310317993,
"learning_rate": 3.225217217650876e-05,
"loss": 0.0034,
"step": 875
},
{
"epoch": 40.90909090909091,
"grad_norm": 1.6577147245407104,
"learning_rate": 3.1257276737590365e-05,
"loss": 0.0031,
"step": 900
},
{
"epoch": 42.04545454545455,
"grad_norm": 1.4678380489349365,
"learning_rate": 3.025169084632915e-05,
"loss": 0.0041,
"step": 925
},
{
"epoch": 43.18181818181818,
"grad_norm": 2.831874370574951,
"learning_rate": 2.9237132529351996e-05,
"loss": 0.0034,
"step": 950
},
{
"epoch": 44.31818181818182,
"grad_norm": 4.369483947753906,
"learning_rate": 2.8215335142524657e-05,
"loss": 0.0033,
"step": 975
},
{
"epoch": 45.45454545454545,
"grad_norm": 1.6372367143630981,
"learning_rate": 2.7188044409542278e-05,
"loss": 0.0022,
"step": 1000
},
{
"epoch": 45.45454545454545,
"eval_loss": 0.8436204195022583,
"eval_runtime": 79.4622,
"eval_samples_per_second": 2.58,
"eval_steps_per_second": 0.164,
"eval_wer": 74.22245651027939,
"step": 1000
},
{
"epoch": 46.59090909090909,
"grad_norm": 1.6608319282531738,
"learning_rate": 2.6157015439389774e-05,
"loss": 0.0022,
"step": 1025
},
{
"epoch": 47.72727272727273,
"grad_norm": 1.1972359418869019,
"learning_rate": 2.512400972776755e-05,
"loss": 0.0025,
"step": 1050
},
{
"epoch": 48.86363636363637,
"grad_norm": 0.1433289498090744,
"learning_rate": 2.4090792147605647e-05,
"loss": 0.0023,
"step": 1075
},
{
"epoch": 50.0,
"grad_norm": 1.2511216402053833,
"learning_rate": 2.3059127933807954e-05,
"loss": 0.0018,
"step": 1100
},
{
"epoch": 51.13636363636363,
"grad_norm": 1.3607325553894043,
"learning_rate": 2.2030779667377996e-05,
"loss": 0.0019,
"step": 1125
},
{
"epoch": 52.27272727272727,
"grad_norm": 1.5359007120132446,
"learning_rate": 2.100750426407884e-05,
"loss": 0.0013,
"step": 1150
},
{
"epoch": 53.40909090909091,
"grad_norm": 1.4747318029403687,
"learning_rate": 1.9991049972771972e-05,
"loss": 0.0015,
"step": 1175
},
{
"epoch": 54.54545454545455,
"grad_norm": 2.2901978492736816,
"learning_rate": 1.8983153388563486e-05,
"loss": 0.0008,
"step": 1200
},
{
"epoch": 54.54545454545455,
"eval_loss": 0.8767306804656982,
"eval_runtime": 80.2298,
"eval_samples_per_second": 2.555,
"eval_steps_per_second": 0.162,
"eval_wer": 71.85028993147074,
"step": 1200
},
{
"epoch": 55.68181818181818,
"grad_norm": 0.1295584738254547,
"learning_rate": 1.798553648586042e-05,
"loss": 0.0009,
"step": 1225
},
{
"epoch": 56.81818181818182,
"grad_norm": 1.2995024919509888,
"learning_rate": 1.699990367640643e-05,
"loss": 0.0006,
"step": 1250
},
{
"epoch": 57.95454545454545,
"grad_norm": 0.15971346199512482,
"learning_rate": 1.602793889732288e-05,
"loss": 0.0005,
"step": 1275
},
{
"epoch": 59.09090909090909,
"grad_norm": 0.20202413201332092,
"learning_rate": 1.5071302734130489e-05,
"loss": 0.0004,
"step": 1300
},
{
"epoch": 60.22727272727273,
"grad_norm": 0.4286993145942688,
"learning_rate": 1.4131629583666888e-05,
"loss": 0.0006,
"step": 1325
},
{
"epoch": 61.36363636363637,
"grad_norm": 1.1410396099090576,
"learning_rate": 1.3210524861747015e-05,
"loss": 0.0002,
"step": 1350
},
{
"epoch": 62.5,
"grad_norm": 0.011458423919975758,
"learning_rate": 1.2309562260337073e-05,
"loss": 0.0002,
"step": 1375
},
{
"epoch": 63.63636363636363,
"grad_norm": 0.14888815581798553,
"learning_rate": 1.1430281058928324e-05,
"loss": 0.0002,
"step": 1400
},
{
"epoch": 63.63636363636363,
"eval_loss": 0.9396534562110901,
"eval_runtime": 79.5112,
"eval_samples_per_second": 2.578,
"eval_steps_per_second": 0.163,
"eval_wer": 70.9541381128097,
"step": 1400
},
{
"epoch": 64.77272727272727,
"grad_norm": 0.047700293362140656,
"learning_rate": 1.0574183494703748e-05,
"loss": 0.0003,
"step": 1425
},
{
"epoch": 65.9090909090909,
"grad_norm": 0.0036408633459359407,
"learning_rate": 9.742732195991142e-06,
"loss": 0.0,
"step": 1450
},
{
"epoch": 67.04545454545455,
"grad_norm": 0.009580373764038086,
"learning_rate": 8.937347683387095e-06,
"loss": 0.0,
"step": 1475
},
{
"epoch": 68.18181818181819,
"grad_norm": 0.007072719745337963,
"learning_rate": 8.159405942821375e-06,
"loss": 0.0,
"step": 1500
},
{
"epoch": 69.31818181818181,
"grad_norm": 0.0026191575452685356,
"learning_rate": 7.410236074708077e-06,
"loss": 0.0001,
"step": 1525
},
{
"epoch": 70.45454545454545,
"grad_norm": 0.0020283255726099014,
"learning_rate": 6.691118023199861e-06,
"loss": 0.0,
"step": 1550
},
{
"epoch": 71.5909090909091,
"grad_norm": 0.0018077497370541096,
"learning_rate": 6.003280389424789e-06,
"loss": 0.0,
"step": 1575
},
{
"epoch": 72.72727272727273,
"grad_norm": 0.0013726140605285764,
"learning_rate": 5.347898332441975e-06,
"loss": 0.0,
"step": 1600
},
{
"epoch": 72.72727272727273,
"eval_loss": 0.9584089517593384,
"eval_runtime": 79.3982,
"eval_samples_per_second": 2.582,
"eval_steps_per_second": 0.164,
"eval_wer": 69.58355297838693,
"step": 1600
},
{
"epoch": 73.86363636363636,
"grad_norm": 0.0010475883027538657,
"learning_rate": 4.726091561502e-06,
"loss": 0.0,
"step": 1625
},
{
"epoch": 75.0,
"grad_norm": 0.0010232036001980305,
"learning_rate": 4.138922423042449e-06,
"loss": 0.0,
"step": 1650
},
{
"epoch": 76.13636363636364,
"grad_norm": 0.0008750821580179036,
"learning_rate": 3.5873940856868656e-06,
"loss": 0.0,
"step": 1675
},
{
"epoch": 77.27272727272727,
"grad_norm": 0.0009788611205294728,
"learning_rate": 3.072448826347932e-06,
"loss": 0.0,
"step": 1700
},
{
"epoch": 78.4090909090909,
"grad_norm": 0.0008014105842448771,
"learning_rate": 2.5949664203632428e-06,
"loss": 0.0,
"step": 1725
},
{
"epoch": 79.54545454545455,
"grad_norm": 0.0007674263906665146,
"learning_rate": 2.155762638413841e-06,
"loss": 0.0,
"step": 1750
},
{
"epoch": 80.68181818181819,
"grad_norm": 0.00074714922811836,
"learning_rate": 1.7555878527937164e-06,
"loss": 0.0,
"step": 1775
},
{
"epoch": 81.81818181818181,
"grad_norm": 0.000759561953600496,
"learning_rate": 1.3951257554113306e-06,
"loss": 0.0,
"step": 1800
},
{
"epoch": 81.81818181818181,
"eval_loss": 0.9801890850067139,
"eval_runtime": 79.7021,
"eval_samples_per_second": 2.572,
"eval_steps_per_second": 0.163,
"eval_wer": 69.95255666842382,
"step": 1800
},
{
"epoch": 82.95454545454545,
"grad_norm": 0.0007248718175105751,
"learning_rate": 1.074992189713453e-06,
"loss": 0.0,
"step": 1825
},
{
"epoch": 84.0909090909091,
"grad_norm": 0.0007800040184520185,
"learning_rate": 7.957340985269596e-07,
"loss": 0.0,
"step": 1850
},
{
"epoch": 85.22727272727273,
"grad_norm": 0.0005734158912673593,
"learning_rate": 5.578285896162106e-07,
"loss": 0.0,
"step": 1875
},
{
"epoch": 86.36363636363636,
"grad_norm": 0.0006857244297862053,
"learning_rate": 3.616821205524007e-07,
"loss": 0.0,
"step": 1900
},
{
"epoch": 87.5,
"grad_norm": 0.0006822862196713686,
"learning_rate": 2.0762980428765122e-07,
"loss": 0.0,
"step": 1925
},
{
"epoch": 88.63636363636364,
"grad_norm": 0.0006552569684572518,
"learning_rate": 9.59348366201318e-08,
"loss": 0.0,
"step": 1950
},
{
"epoch": 89.77272727272727,
"grad_norm": 0.0004952407325617969,
"learning_rate": 2.6788046528461453e-08,
"loss": 0.0,
"step": 1975
},
{
"epoch": 90.9090909090909,
"grad_norm": 0.0006054748664610088,
"learning_rate": 3.0757014360671686e-10,
"loss": 0.0,
"step": 2000
},
{
"epoch": 90.9090909090909,
"eval_loss": 0.9858900308609009,
"eval_runtime": 79.3105,
"eval_samples_per_second": 2.585,
"eval_steps_per_second": 0.164,
"eval_wer": 69.68898260411176,
"step": 2000
}
],
"logging_steps": 25,
"max_steps": 2000,
"num_input_tokens_seen": 0,
"num_train_epochs": 91,
"save_steps": 200,
"stateful_callbacks": {
"TrainerControl": {
"args": {
"should_epoch_stop": false,
"should_evaluate": false,
"should_log": false,
"should_save": true,
"should_training_stop": true
},
"attributes": {}
}
},
"total_flos": 1.83136295043072e+19,
"train_batch_size": 8,
"trial_name": null,
"trial_params": null
}