CodeIsAbstract commited on
Commit
8456a6e
·
verified ·
1 Parent(s): 1e58df1

Training in progress, step 400, checkpoint

Browse files
last-checkpoint/model.safetensors CHANGED
@@ -1,3 +1,3 @@
1
  version https://git-lfs.github.com/spec/v1
2
- oid sha256:9ce65bbed9331f4da673d60d1dc63ba5675640ffcc17c86a99dd8472de8ef429
3
  size 253577648
 
1
  version https://git-lfs.github.com/spec/v1
2
+ oid sha256:432cd4b3f20b2d6b60bb6abf5d4699a91e48537ef0ed052bfe0d334aff3b31bf
3
  size 253577648
last-checkpoint/optimizer.pt CHANGED
@@ -1,3 +1,3 @@
1
  version https://git-lfs.github.com/spec/v1
2
- oid sha256:15cccd4cc3adad21271edce5de20158da491b15c14ccceddfd2093b1befc0139
3
  size 37798173
 
1
  version https://git-lfs.github.com/spec/v1
2
+ oid sha256:d47dfb8bdf14d7cfe7ba9207ba749f2873b045289c0d4506db957b0945ea255b
3
  size 37798173
last-checkpoint/rng_state.pth CHANGED
@@ -1,3 +1,3 @@
1
  version https://git-lfs.github.com/spec/v1
2
- oid sha256:8a9d93ac0e7384563f970848a6d911064afa1c50720cde8b4ec828d00b5723a5
3
  size 14645
 
1
  version https://git-lfs.github.com/spec/v1
2
+ oid sha256:a5efa17066b0a1d4b6e03d692b024a4c72e68b8316289796ae7ade09fa5d1efd
3
  size 14645
last-checkpoint/scheduler.pt CHANGED
@@ -1,3 +1,3 @@
1
  version https://git-lfs.github.com/spec/v1
2
- oid sha256:002599c9fd9c2e34b48da3b08b765f3b266ceba26e25343d6c7012afd5618305
3
  size 1465
 
1
  version https://git-lfs.github.com/spec/v1
2
+ oid sha256:f927da8d60437265b92417ce9964e2748b26b27fe8a5e4da654d140885fdf9c1
3
  size 1465
last-checkpoint/trainer_state.json CHANGED
@@ -2,9 +2,9 @@
2
  "best_global_step": null,
3
  "best_metric": null,
4
  "best_model_checkpoint": null,
5
- "epoch": 0.2,
6
  "eval_steps": 50,
7
- "global_step": 200,
8
  "is_hyper_param_search": false,
9
  "is_local_process_zero": true,
10
  "is_world_process_zero": true,
@@ -320,6 +320,318 @@
320
  "eval_samples_per_second": 1.482,
321
  "eval_steps_per_second": 0.298,
322
  "step": 200
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
323
  }
324
  ],
325
  "logging_steps": 5,
@@ -339,7 +651,7 @@
339
  "attributes": {}
340
  }
341
  },
342
- "total_flos": 952423258521600.0,
343
  "train_batch_size": 2,
344
  "trial_name": null,
345
  "trial_params": null
 
2
  "best_global_step": null,
3
  "best_metric": null,
4
  "best_model_checkpoint": null,
5
+ "epoch": 0.4,
6
  "eval_steps": 50,
7
+ "global_step": 400,
8
  "is_hyper_param_search": false,
9
  "is_local_process_zero": true,
10
  "is_world_process_zero": true,
 
320
  "eval_samples_per_second": 1.482,
321
  "eval_steps_per_second": 0.298,
322
  "step": 200
323
+ },
324
+ {
325
+ "epoch": 0.205,
326
+ "grad_norm": 5811.900390625,
327
+ "learning_rate": 0.00018382315692263323,
328
+ "loss": 3.4652740478515627,
329
+ "step": 205
330
+ },
331
+ {
332
+ "epoch": 0.21,
333
+ "grad_norm": 1784.0272216796875,
334
+ "learning_rate": 0.00018293377532205968,
335
+ "loss": 3.136703681945801,
336
+ "step": 210
337
+ },
338
+ {
339
+ "epoch": 0.215,
340
+ "grad_norm": 8352.1416015625,
341
+ "learning_rate": 0.0001820228682553533,
342
+ "loss": 3.3410572052001952,
343
+ "step": 215
344
+ },
345
+ {
346
+ "epoch": 0.22,
347
+ "grad_norm": 9626.669921875,
348
+ "learning_rate": 0.00018109067214849538,
349
+ "loss": 3.3538772583007814,
350
+ "step": 220
351
+ },
352
+ {
353
+ "epoch": 0.225,
354
+ "grad_norm": 5929.7529296875,
355
+ "learning_rate": 0.00018013742895303883,
356
+ "loss": 3.598949432373047,
357
+ "step": 225
358
+ },
359
+ {
360
+ "epoch": 0.23,
361
+ "grad_norm": 280.86492919921875,
362
+ "learning_rate": 0.0001791633860833096,
363
+ "loss": 3.4480300903320313,
364
+ "step": 230
365
+ },
366
+ {
367
+ "epoch": 0.235,
368
+ "grad_norm": 19.305431365966797,
369
+ "learning_rate": 0.00017816879635219028,
370
+ "loss": 3.521527099609375,
371
+ "step": 235
372
+ },
373
+ {
374
+ "epoch": 0.24,
375
+ "grad_norm": 11.262675285339355,
376
+ "learning_rate": 0.00017715391790550252,
377
+ "loss": 3.543391799926758,
378
+ "step": 240
379
+ },
380
+ {
381
+ "epoch": 0.245,
382
+ "grad_norm": 107.26178741455078,
383
+ "learning_rate": 0.00017611901415500535,
384
+ "loss": 3.380891799926758,
385
+ "step": 245
386
+ },
387
+ {
388
+ "epoch": 0.25,
389
+ "grad_norm": 0.6105318069458008,
390
+ "learning_rate": 0.00017506435371002633,
391
+ "loss": 3.2983978271484373,
392
+ "step": 250
393
+ },
394
+ {
395
+ "epoch": 0.25,
396
+ "eval_loss": 3.6096248626708984,
397
+ "eval_runtime": 200.7485,
398
+ "eval_samples_per_second": 1.484,
399
+ "eval_steps_per_second": 0.299,
400
+ "step": 250
401
+ },
402
+ {
403
+ "epoch": 0.255,
404
+ "grad_norm": 1.168889045715332,
405
+ "learning_rate": 0.00017399021030774442,
406
+ "loss": 3.5202346801757813,
407
+ "step": 255
408
+ },
409
+ {
410
+ "epoch": 0.26,
411
+ "grad_norm": 4.2245283126831055,
412
+ "learning_rate": 0.00017289686274214118,
413
+ "loss": 3.2942405700683595,
414
+ "step": 260
415
+ },
416
+ {
417
+ "epoch": 0.265,
418
+ "grad_norm": 0.3621503710746765,
419
+ "learning_rate": 0.00017178459479163976,
420
+ "loss": 3.4601863861083983,
421
+ "step": 265
422
+ },
423
+ {
424
+ "epoch": 0.27,
425
+ "grad_norm": 35.780120849609375,
426
+ "learning_rate": 0.00017065369514545053,
427
+ "loss": 3.2967288970947264,
428
+ "step": 270
429
+ },
430
+ {
431
+ "epoch": 0.275,
432
+ "grad_norm": 474.76861572265625,
433
+ "learning_rate": 0.00016950445732864127,
434
+ "loss": 3.4325428009033203,
435
+ "step": 275
436
+ },
437
+ {
438
+ "epoch": 0.28,
439
+ "grad_norm": 2.8445627689361572,
440
+ "learning_rate": 0.00016833717962595326,
441
+ "loss": 3.3004375457763673,
442
+ "step": 280
443
+ },
444
+ {
445
+ "epoch": 0.285,
446
+ "grad_norm": 19.516523361206055,
447
+ "learning_rate": 0.00016715216500438093,
448
+ "loss": 3.612904739379883,
449
+ "step": 285
450
+ },
451
+ {
452
+ "epoch": 0.29,
453
+ "grad_norm": 25.849435806274414,
454
+ "learning_rate": 0.00016594972103453726,
455
+ "loss": 3.567874526977539,
456
+ "step": 290
457
+ },
458
+ {
459
+ "epoch": 0.295,
460
+ "grad_norm": 58.06301498413086,
461
+ "learning_rate": 0.00016473015981082338,
462
+ "loss": 3.525835418701172,
463
+ "step": 295
464
+ },
465
+ {
466
+ "epoch": 0.3,
467
+ "grad_norm": 191.27548217773438,
468
+ "learning_rate": 0.00016349379787042477,
469
+ "loss": 3.3833484649658203,
470
+ "step": 300
471
+ },
472
+ {
473
+ "epoch": 0.3,
474
+ "eval_loss": 3.7416040897369385,
475
+ "eval_runtime": 200.7531,
476
+ "eval_samples_per_second": 1.484,
477
+ "eval_steps_per_second": 0.299,
478
+ "step": 300
479
+ },
480
+ {
481
+ "epoch": 0.305,
482
+ "grad_norm": 56.349708557128906,
483
+ "learning_rate": 0.00016224095611115384,
484
+ "loss": 3.6572975158691405,
485
+ "step": 305
486
+ },
487
+ {
488
+ "epoch": 0.31,
489
+ "grad_norm": 1745.9088134765625,
490
+ "learning_rate": 0.00016097195970816094,
491
+ "loss": 3.601942443847656,
492
+ "step": 310
493
+ },
494
+ {
495
+ "epoch": 0.315,
496
+ "grad_norm": 1165.1402587890625,
497
+ "learning_rate": 0.0001596871380295351,
498
+ "loss": 3.6535247802734374,
499
+ "step": 315
500
+ },
501
+ {
502
+ "epoch": 0.32,
503
+ "grad_norm": 46.510684967041016,
504
+ "learning_rate": 0.00015838682455081657,
505
+ "loss": 3.5322292327880858,
506
+ "step": 320
507
+ },
508
+ {
509
+ "epoch": 0.325,
510
+ "grad_norm": 147.2434539794922,
511
+ "learning_rate": 0.0001570713567684432,
512
+ "loss": 3.4837066650390627,
513
+ "step": 325
514
+ },
515
+ {
516
+ "epoch": 0.33,
517
+ "grad_norm": 7.8114013671875,
518
+ "learning_rate": 0.00015574107611215319,
519
+ "loss": 3.5842933654785156,
520
+ "step": 330
521
+ },
522
+ {
523
+ "epoch": 0.335,
524
+ "grad_norm": 40.32650375366211,
525
+ "learning_rate": 0.00015439632785636706,
526
+ "loss": 3.451204299926758,
527
+ "step": 335
528
+ },
529
+ {
530
+ "epoch": 0.34,
531
+ "grad_norm": 54.91672134399414,
532
+ "learning_rate": 0.00015303746103057162,
533
+ "loss": 3.6410243988037108,
534
+ "step": 340
535
+ },
536
+ {
537
+ "epoch": 0.345,
538
+ "grad_norm": 143.5968017578125,
539
+ "learning_rate": 0.00015166482832872923,
540
+ "loss": 3.567627716064453,
541
+ "step": 345
542
+ },
543
+ {
544
+ "epoch": 0.35,
545
+ "grad_norm": 66.56953430175781,
546
+ "learning_rate": 0.00015027878601773633,
547
+ "loss": 3.7443378448486326,
548
+ "step": 350
549
+ },
550
+ {
551
+ "epoch": 0.35,
552
+ "eval_loss": 3.8730692863464355,
553
+ "eval_runtime": 200.7554,
554
+ "eval_samples_per_second": 1.484,
555
+ "eval_steps_per_second": 0.299,
556
+ "step": 350
557
+ },
558
+ {
559
+ "epoch": 0.355,
560
+ "grad_norm": 109.56166076660156,
561
+ "learning_rate": 0.00014887969384495402,
562
+ "loss": 3.7462512969970705,
563
+ "step": 355
564
+ },
565
+ {
566
+ "epoch": 0.36,
567
+ "grad_norm": 403.760986328125,
568
+ "learning_rate": 0.00014746791494483583,
569
+ "loss": 3.4167720794677736,
570
+ "step": 360
571
+ },
572
+ {
573
+ "epoch": 0.365,
574
+ "grad_norm": 78.5467300415039,
575
+ "learning_rate": 0.00014604381574467615,
576
+ "loss": 3.653825378417969,
577
+ "step": 365
578
+ },
579
+ {
580
+ "epoch": 0.37,
581
+ "grad_norm": 7.657294273376465,
582
+ "learning_rate": 0.00014460776586950393,
583
+ "loss": 3.5837642669677736,
584
+ "step": 370
585
+ },
586
+ {
587
+ "epoch": 0.375,
588
+ "grad_norm": 232.22654724121094,
589
+ "learning_rate": 0.00014316013804614643,
590
+ "loss": 3.5867897033691407,
591
+ "step": 375
592
+ },
593
+ {
594
+ "epoch": 0.38,
595
+ "grad_norm": 34.94912338256836,
596
+ "learning_rate": 0.00014170130800648814,
597
+ "loss": 3.5861190795898437,
598
+ "step": 380
599
+ },
600
+ {
601
+ "epoch": 0.385,
602
+ "grad_norm": 91.70198059082031,
603
+ "learning_rate": 0.0001402316543899493,
604
+ "loss": 3.66529541015625,
605
+ "step": 385
606
+ },
607
+ {
608
+ "epoch": 0.39,
609
+ "grad_norm": 25.11287498474121,
610
+ "learning_rate": 0.0001387515586452103,
611
+ "loss": 3.6498741149902343,
612
+ "step": 390
613
+ },
614
+ {
615
+ "epoch": 0.395,
616
+ "grad_norm": 93.66793060302734,
617
+ "learning_rate": 0.0001372614049312064,
618
+ "loss": 3.352254867553711,
619
+ "step": 395
620
+ },
621
+ {
622
+ "epoch": 0.4,
623
+ "grad_norm": 4.588032245635986,
624
+ "learning_rate": 0.00013576158001741932,
625
+ "loss": 3.517344665527344,
626
+ "step": 400
627
+ },
628
+ {
629
+ "epoch": 0.4,
630
+ "eval_loss": 3.753708839416504,
631
+ "eval_runtime": 200.6183,
632
+ "eval_samples_per_second": 1.485,
633
+ "eval_steps_per_second": 0.299,
634
+ "step": 400
635
  }
636
  ],
637
  "logging_steps": 5,
 
651
  "attributes": {}
652
  }
653
  },
654
+ "total_flos": 1904846517043200.0,
655
  "train_batch_size": 2,
656
  "trial_name": null,
657
  "trial_params": null