vicuna-500 / trainer_state.json
jiyounglee0523's picture
Upload folder using huggingface_hub
62a7a4f verified
Raw
History Blame Contribute Delete
67 kB
{
"best_global_step": null,
"best_metric": null,
"best_model_checkpoint": null,
"epoch": 0.0015996826229676031,
"eval_steps": 500,
"global_step": 500,
"is_hyper_param_search": false,
"is_local_process_zero": true,
"is_world_process_zero": true,
"log_history": [
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.25,
"completions/max_length": 213.8,
"completions/max_terminated_length": 147.2,
"completions/mean_length": 115.175,
"completions/mean_terminated_length": 72.4022647857666,
"completions/min_length": 46.8,
"completions/min_terminated_length": 21.2,
"entropy": 0.4786868065595627,
"epoch": 3.1993652459352066e-05,
"frac_reward_zero_std": 0.5,
"grad_norm": 2.6119611263275146,
"learning_rate": 9.999712057127867e-06,
"loss": -0.1609,
"num_tokens": 61746.0,
"reward": 0.4312597796320915,
"reward_std": 0.10828691087663174,
"rewards/reward_func/mean": 0.4312597796320915,
"rewards/reward_func/std": 0.10828691087663174,
"sampling/importance_sampling_ratio/max": 1.3771747946739197,
"sampling/importance_sampling_ratio/mean": 0.9703039705753327,
"sampling/importance_sampling_ratio/min": 0.6949578016996384,
"sampling/sampling_logp_difference/max": 0.1786184310913086,
"sampling/sampling_logp_difference/mean": 0.009788535302504897,
"step": 10,
"step_time": 5.622241817000395
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.8375,
"completions/max_length": 256.0,
"completions/max_terminated_length": 126.1,
"completions/mean_length": 232.35,
"completions/mean_terminated_length": 114.25,
"completions/min_length": 158.1,
"completions/min_terminated_length": 106.9,
"entropy": 0.3626169502735138,
"epoch": 6.398730491870413e-05,
"frac_reward_zero_std": 0.3,
"grad_norm": 0.0,
"learning_rate": 9.999392120603273e-06,
"loss": -0.04,
"num_tokens": 128850.0,
"reward": 0.5504927486181259,
"reward_std": 0.19645964950323105,
"rewards/reward_func/mean": 0.5504927486181259,
"rewards/reward_func/std": 0.19645965695381165,
"sampling/importance_sampling_ratio/max": 1.4168030858039855,
"sampling/importance_sampling_ratio/mean": 0.9663502812385559,
"sampling/importance_sampling_ratio/min": 0.5392230927944184,
"sampling/sampling_logp_difference/max": 0.23053348064422607,
"sampling/sampling_logp_difference/mean": 0.007877917354926467,
"step": 20,
"step_time": 5.55996063089915
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.9875,
"completions/max_length": 256.0,
"completions/max_terminated_length": 19.0,
"completions/mean_length": 255.175,
"completions/mean_terminated_length": 19.0,
"completions/min_length": 249.4,
"completions/min_terminated_length": 19.0,
"entropy": 0.29454511404037476,
"epoch": 9.59809573780562e-05,
"frac_reward_zero_std": 0.35,
"grad_norm": 0.0,
"learning_rate": 9.99907218407868e-06,
"loss": -0.0185,
"num_tokens": 207336.0,
"reward": 0.5643827587366104,
"reward_std": 0.15548617392778397,
"rewards/reward_func/mean": 0.5643827587366104,
"rewards/reward_func/std": 0.15548617392778397,
"sampling/importance_sampling_ratio/max": 1.3922772645950316,
"sampling/importance_sampling_ratio/mean": 0.9528154253959655,
"sampling/importance_sampling_ratio/min": 0.5780708372592926,
"sampling/sampling_logp_difference/max": 0.24547218680381774,
"sampling/sampling_logp_difference/mean": 0.007050963398069143,
"step": 30,
"step_time": 5.868266978400788
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.9875,
"completions/max_length": 256.0,
"completions/max_terminated_length": 19.4,
"completions/mean_length": 255.225,
"completions/mean_terminated_length": 19.4,
"completions/min_length": 249.8,
"completions/min_terminated_length": 19.4,
"entropy": 0.2484108805656433,
"epoch": 0.00012797460983740827,
"frac_reward_zero_std": 0.5,
"grad_norm": 1.5433145761489868,
"learning_rate": 9.998752247554087e-06,
"loss": -0.0153,
"num_tokens": 282170.0,
"reward": 0.5426100015640258,
"reward_std": 0.1483269989490509,
"rewards/reward_func/mean": 0.5426100015640258,
"rewards/reward_func/std": 0.14832699857652187,
"sampling/importance_sampling_ratio/max": 1.4858020782470702,
"sampling/importance_sampling_ratio/mean": 0.9998360693454742,
"sampling/importance_sampling_ratio/min": 0.6810799956321716,
"sampling/sampling_logp_difference/max": 0.2127821445465088,
"sampling/sampling_logp_difference/mean": 0.006208276166580618,
"step": 40,
"step_time": 5.823335035099808
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.9875,
"completions/max_length": 256.0,
"completions/max_terminated_length": 13.9,
"completions/mean_length": 254.5375,
"completions/mean_terminated_length": 13.9,
"completions/min_length": 244.3,
"completions/min_terminated_length": 13.9,
"entropy": 0.3215895563364029,
"epoch": 0.00015996826229676032,
"frac_reward_zero_std": 0.4,
"grad_norm": 0.0,
"learning_rate": 9.998432311029492e-06,
"loss": 0.0418,
"num_tokens": 351413.0,
"reward": 0.5794098913669586,
"reward_std": 0.16170265898108482,
"rewards/reward_func/mean": 0.5794098913669586,
"rewards/reward_func/std": 0.1617026634514332,
"sampling/importance_sampling_ratio/max": 1.47185720205307,
"sampling/importance_sampling_ratio/mean": 1.0133295714855195,
"sampling/importance_sampling_ratio/min": 0.6691074788570404,
"sampling/sampling_logp_difference/max": 0.20463817119598388,
"sampling/sampling_logp_difference/mean": 0.00659145483514294,
"step": 50,
"step_time": 5.593381853300161
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.9625,
"completions/max_length": 256.0,
"completions/max_terminated_length": 24.6,
"completions/mean_length": 253.55,
"completions/mean_terminated_length": 19.06666717529297,
"completions/min_length": 242.9,
"completions/min_terminated_length": 12.5,
"entropy": 0.29620115645229816,
"epoch": 0.0001919619147561124,
"frac_reward_zero_std": 0.45,
"grad_norm": 3.978233814239502,
"learning_rate": 9.998112374504899e-06,
"loss": -0.014,
"num_tokens": 414597.0,
"reward": 0.5179664015769958,
"reward_std": 0.19976407699286938,
"rewards/reward_func/mean": 0.5179664015769958,
"rewards/reward_func/std": 0.19976408630609513,
"sampling/importance_sampling_ratio/max": 1.484041118621826,
"sampling/importance_sampling_ratio/mean": 1.022961837053299,
"sampling/importance_sampling_ratio/min": 0.6446415841579437,
"sampling/sampling_logp_difference/max": 0.1990389347076416,
"sampling/sampling_logp_difference/mean": 0.005983676365576685,
"step": 60,
"step_time": 5.404291736499363
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 1.0,
"completions/max_length": 256.0,
"completions/max_terminated_length": 0.0,
"completions/mean_length": 256.0,
"completions/mean_terminated_length": 0.0,
"completions/min_length": 256.0,
"completions/min_terminated_length": 0.0,
"entropy": 0.17363325618207454,
"epoch": 0.00022395556721546445,
"frac_reward_zero_std": 0.55,
"grad_norm": 2.7598984241485596,
"learning_rate": 9.997792437980306e-06,
"loss": -0.0027,
"num_tokens": 480129.0,
"reward": 0.5814546048641205,
"reward_std": 0.2727541446685791,
"rewards/reward_func/mean": 0.5814546048641205,
"rewards/reward_func/std": 0.2727541491389275,
"sampling/importance_sampling_ratio/max": 1.3518780946731568,
"sampling/importance_sampling_ratio/mean": 1.0044036984443665,
"sampling/importance_sampling_ratio/min": 0.7056601405143738,
"sampling/sampling_logp_difference/max": 0.18388597369194032,
"sampling/sampling_logp_difference/mean": 0.004156309820245951,
"step": 70,
"step_time": 5.455206840401297
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.8625,
"completions/max_length": 256.0,
"completions/max_terminated_length": 90.2,
"completions/mean_length": 238.375,
"completions/mean_terminated_length": 61.20000076293945,
"completions/min_length": 161.3,
"completions/min_terminated_length": 33.3,
"entropy": 0.36540624052286147,
"epoch": 0.00025594921967481653,
"frac_reward_zero_std": 0.35,
"grad_norm": 2.457448959350586,
"learning_rate": 9.997472501455711e-06,
"loss": -0.0748,
"num_tokens": 548531.0,
"reward": 0.5621683537960053,
"reward_std": 0.21145149692893028,
"rewards/reward_func/mean": 0.5621683537960053,
"rewards/reward_func/std": 0.21145151033997536,
"sampling/importance_sampling_ratio/max": 1.4461460351943969,
"sampling/importance_sampling_ratio/mean": 1.0051416873931884,
"sampling/importance_sampling_ratio/min": 0.7030990332365036,
"sampling/sampling_logp_difference/max": 0.20937676429748536,
"sampling/sampling_logp_difference/mean": 0.006805244646966457,
"step": 80,
"step_time": 5.632404646299255
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.8125,
"completions/max_length": 256.0,
"completions/max_terminated_length": 61.2,
"completions/mean_length": 224.2375,
"completions/mean_terminated_length": 36.83452453613281,
"completions/min_length": 173.3,
"completions/min_terminated_length": 19.7,
"entropy": 0.5844738900661468,
"epoch": 0.00028794287213416856,
"frac_reward_zero_std": 0.2,
"grad_norm": 1.992931842803955,
"learning_rate": 9.997152564931118e-06,
"loss": 0.0096,
"num_tokens": 610270.0,
"reward": 0.5034450203180313,
"reward_std": 0.13549208920449018,
"rewards/reward_func/mean": 0.5034450203180313,
"rewards/reward_func/std": 0.1354920944198966,
"sampling/importance_sampling_ratio/max": 1.4657144665718078,
"sampling/importance_sampling_ratio/mean": 0.9980016946792603,
"sampling/importance_sampling_ratio/min": 0.5777884721755981,
"sampling/sampling_logp_difference/max": 0.16048599481582643,
"sampling/sampling_logp_difference/mean": 0.00926766509655863,
"step": 90,
"step_time": 5.383288126800471
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.525,
"completions/max_length": 252.5,
"completions/max_terminated_length": 116.3,
"completions/mean_length": 179.65,
"completions/mean_terminated_length": 77.10000095367431,
"completions/min_length": 87.0,
"completions/min_terminated_length": 35.8,
"entropy": 0.8687089055776596,
"epoch": 0.00031993652459352064,
"frac_reward_zero_std": 0.25,
"grad_norm": 5.623146057128906,
"learning_rate": 9.996832628406525e-06,
"loss": -0.0832,
"num_tokens": 671718.0,
"reward": 0.4710801362991333,
"reward_std": 0.1657375056296587,
"rewards/reward_func/mean": 0.4710801362991333,
"rewards/reward_func/std": 0.1657375056296587,
"sampling/importance_sampling_ratio/max": 1.3921684265136718,
"sampling/importance_sampling_ratio/mean": 0.9789192140102386,
"sampling/importance_sampling_ratio/min": 0.579711401462555,
"sampling/sampling_logp_difference/max": 0.24069670140743255,
"sampling/sampling_logp_difference/mean": 0.012631397787481546,
"step": 100,
"step_time": 5.387485970201669
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.625,
"completions/max_length": 240.8,
"completions/max_terminated_length": 89.3,
"completions/mean_length": 192.85,
"completions/mean_terminated_length": 65.42381134033204,
"completions/min_length": 94.1,
"completions/min_terminated_length": 42.9,
"entropy": 0.43052335977554324,
"epoch": 0.0003519301770528727,
"frac_reward_zero_std": 0.45,
"grad_norm": 2.4985339641571045,
"learning_rate": 9.996512691881932e-06,
"loss": -0.0615,
"num_tokens": 740086.0,
"reward": 0.437653186917305,
"reward_std": 0.12863893285393715,
"rewards/reward_func/mean": 0.437653186917305,
"rewards/reward_func/std": 0.12863893881440164,
"sampling/importance_sampling_ratio/max": 1.4863561749458314,
"sampling/importance_sampling_ratio/mean": 1.0037799596786499,
"sampling/importance_sampling_ratio/min": 0.5982317864894867,
"sampling/sampling_logp_difference/max": 0.17598365545272826,
"sampling/sampling_logp_difference/mean": 0.007958207954652607,
"step": 110,
"step_time": 5.308089344799373
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.9875,
"completions/max_length": 256.0,
"completions/max_terminated_length": 7.5,
"completions/mean_length": 253.7375,
"completions/mean_terminated_length": 7.5,
"completions/min_length": 237.9,
"completions/min_terminated_length": 7.5,
"entropy": 0.2582511238753796,
"epoch": 0.0003839238295122248,
"frac_reward_zero_std": 0.35,
"grad_norm": 2.053544044494629,
"learning_rate": 9.996192755357337e-06,
"loss": 0.0053,
"num_tokens": 810633.0,
"reward": 0.25738574657589197,
"reward_std": 0.1840340968221426,
"rewards/reward_func/mean": 0.25738574657589197,
"rewards/reward_func/std": 0.18403410203754902,
"sampling/importance_sampling_ratio/max": 1.2579748988151551,
"sampling/importance_sampling_ratio/mean": 0.9866569399833679,
"sampling/importance_sampling_ratio/min": 0.766651064157486,
"sampling/sampling_logp_difference/max": 0.1475762128829956,
"sampling/sampling_logp_difference/mean": 0.0038984777755104007,
"step": 120,
"step_time": 5.620803888401861
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.9625,
"completions/max_length": 256.0,
"completions/max_terminated_length": 34.5,
"completions/mean_length": 250.7125,
"completions/mean_terminated_length": 34.5,
"completions/min_length": 213.7,
"completions/min_terminated_length": 34.5,
"entropy": 0.47940588295459746,
"epoch": 0.0004159174819715768,
"frac_reward_zero_std": 0.55,
"grad_norm": 3.1486337184906006,
"learning_rate": 9.995872818832744e-06,
"loss": 0.0107,
"num_tokens": 877890.0,
"reward": 0.526879546046257,
"reward_std": 0.16744473129510878,
"rewards/reward_func/mean": 0.526879546046257,
"rewards/reward_func/std": 0.16744473874568938,
"sampling/importance_sampling_ratio/max": 1.3929537773132323,
"sampling/importance_sampling_ratio/mean": 0.964176470041275,
"sampling/importance_sampling_ratio/min": 0.5460495926439762,
"sampling/sampling_logp_difference/max": 0.45359928011894224,
"sampling/sampling_logp_difference/mean": 0.007244944549165666,
"step": 130,
"step_time": 5.525064078100695
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.925,
"completions/max_length": 256.0,
"completions/max_terminated_length": 80.6,
"completions/mean_length": 248.8125,
"completions/mean_terminated_length": 77.1,
"completions/min_length": 201.6,
"completions/min_terminated_length": 73.6,
"entropy": 0.7605804890394211,
"epoch": 0.0004479111344309289,
"frac_reward_zero_std": 0.4,
"grad_norm": 4.323256969451904,
"learning_rate": 9.995552882308151e-06,
"loss": -0.0069,
"num_tokens": 947371.0,
"reward": 0.5220189839601517,
"reward_std": 0.1725775882601738,
"rewards/reward_func/mean": 0.5220189839601517,
"rewards/reward_func/std": 0.17257759273052214,
"sampling/importance_sampling_ratio/max": 1.3841626405715943,
"sampling/importance_sampling_ratio/mean": 0.9834085047245026,
"sampling/importance_sampling_ratio/min": 0.6015414744615555,
"sampling/sampling_logp_difference/max": 0.1806986689567566,
"sampling/sampling_logp_difference/mean": 0.010641565825790168,
"step": 140,
"step_time": 5.569494440500421
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.9875,
"completions/max_length": 256.0,
"completions/max_terminated_length": 10.9,
"completions/mean_length": 254.1625,
"completions/mean_terminated_length": 10.9,
"completions/min_length": 241.3,
"completions/min_terminated_length": 10.9,
"entropy": 1.031371247768402,
"epoch": 0.000479904786890281,
"frac_reward_zero_std": 0.5,
"grad_norm": 0.0,
"learning_rate": 9.995232945783558e-06,
"loss": 0.0098,
"num_tokens": 1018908.0,
"reward": 0.49765680730342865,
"reward_std": 0.11617601253092288,
"rewards/reward_func/mean": 0.49765680730342865,
"rewards/reward_func/std": 0.11617602296173572,
"sampling/importance_sampling_ratio/max": 1.4478043794631958,
"sampling/importance_sampling_ratio/mean": 0.9885349094867706,
"sampling/importance_sampling_ratio/min": 0.502427950501442,
"sampling/sampling_logp_difference/max": 0.32693520486354827,
"sampling/sampling_logp_difference/mean": 0.012870562355965376,
"step": 150,
"step_time": 5.713950043598743
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 1.0,
"completions/max_length": 256.0,
"completions/max_terminated_length": 0.0,
"completions/mean_length": 256.0,
"completions/mean_terminated_length": 0.0,
"completions/min_length": 256.0,
"completions/min_terminated_length": 0.0,
"entropy": 1.0644956052303314,
"epoch": 0.0005118984393496331,
"frac_reward_zero_std": 0.6,
"grad_norm": 5.655723571777344,
"learning_rate": 9.994913009258965e-06,
"loss": 0.0009,
"num_tokens": 1091120.0,
"reward": 0.5022399604320527,
"reward_std": 0.1322677180171013,
"rewards/reward_func/mean": 0.5022399604320527,
"rewards/reward_func/std": 0.1322677217423916,
"sampling/importance_sampling_ratio/max": 1.565798020362854,
"sampling/importance_sampling_ratio/mean": 0.9627444028854371,
"sampling/importance_sampling_ratio/min": 0.5701836764812469,
"sampling/sampling_logp_difference/max": 0.2968409895896912,
"sampling/sampling_logp_difference/mean": 0.014765473827719689,
"step": 160,
"step_time": 5.714645506398665
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 1.0,
"completions/max_length": 256.0,
"completions/max_terminated_length": 0.0,
"completions/mean_length": 256.0,
"completions/mean_terminated_length": 0.0,
"completions/min_length": 256.0,
"completions/min_terminated_length": 0.0,
"entropy": 1.1330764949321748,
"epoch": 0.0005438920918089851,
"frac_reward_zero_std": 0.4,
"grad_norm": 3.06475830078125,
"learning_rate": 9.99459307273437e-06,
"loss": -0.0131,
"num_tokens": 1160588.0,
"reward": 0.4231398433446884,
"reward_std": 0.10350660830736161,
"rewards/reward_func/mean": 0.4231398433446884,
"rewards/reward_func/std": 0.10350661091506481,
"sampling/importance_sampling_ratio/max": 1.7593751907348634,
"sampling/importance_sampling_ratio/mean": 0.9571119487285614,
"sampling/importance_sampling_ratio/min": 0.3742682170093758,
"sampling/sampling_logp_difference/max": 1.9030644834041595,
"sampling/sampling_logp_difference/mean": 0.015633477736264466,
"step": 170,
"step_time": 5.528405581899278
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.9875,
"completions/max_length": 256.0,
"completions/max_terminated_length": 18.9,
"completions/mean_length": 255.1625,
"completions/mean_terminated_length": 18.9,
"completions/min_length": 249.3,
"completions/min_terminated_length": 18.9,
"entropy": 0.8980084896087647,
"epoch": 0.0005758857442683371,
"frac_reward_zero_std": 0.5,
"grad_norm": 4.3491716384887695,
"learning_rate": 9.994273136209777e-06,
"loss": -0.0362,
"num_tokens": 1229921.0,
"reward": 0.513152438402176,
"reward_std": 0.11573685109615325,
"rewards/reward_func/mean": 0.513152438402176,
"rewards/reward_func/std": 0.1157368503510952,
"sampling/importance_sampling_ratio/max": 1.649842381477356,
"sampling/importance_sampling_ratio/mean": 1.0105858862400054,
"sampling/importance_sampling_ratio/min": 0.5301016598939896,
"sampling/sampling_logp_difference/max": 0.4382950246334076,
"sampling/sampling_logp_difference/mean": 0.013723865710198879,
"step": 180,
"step_time": 5.58106996090064
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.9875,
"completions/max_length": 256.0,
"completions/max_terminated_length": 23.5,
"completions/mean_length": 255.7375,
"completions/mean_terminated_length": 23.5,
"completions/min_length": 253.9,
"completions/min_terminated_length": 23.5,
"entropy": 0.6676588207483292,
"epoch": 0.0006078793967276892,
"frac_reward_zero_std": 0.65,
"grad_norm": 0.0,
"learning_rate": 9.993953199685184e-06,
"loss": -0.0132,
"num_tokens": 1301612.0,
"reward": 0.46829662322998045,
"reward_std": 0.09823110550642014,
"rewards/reward_func/mean": 0.46829662322998045,
"rewards/reward_func/std": 0.09823111034929752,
"sampling/importance_sampling_ratio/max": 1.6070812821388245,
"sampling/importance_sampling_ratio/mean": 0.9719215571880341,
"sampling/importance_sampling_ratio/min": 0.4822065860033035,
"sampling/sampling_logp_difference/max": 0.3739572048187256,
"sampling/sampling_logp_difference/mean": 0.011020558141171932,
"step": 190,
"step_time": 5.662645305100159
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.9375,
"completions/max_length": 256.0,
"completions/max_terminated_length": 55.1,
"completions/mean_length": 248.0875,
"completions/mean_terminated_length": 48.15,
"completions/min_length": 194.8,
"completions/min_terminated_length": 41.2,
"entropy": 0.5728133380413055,
"epoch": 0.0006398730491870413,
"frac_reward_zero_std": 0.6,
"grad_norm": 2.902703285217285,
"learning_rate": 9.99363326316059e-06,
"loss": 0.04,
"num_tokens": 1370639.0,
"reward": 0.5136901259422302,
"reward_std": 0.11567677184939384,
"rewards/reward_func/mean": 0.5136901259422302,
"rewards/reward_func/std": 0.11567677184939384,
"sampling/importance_sampling_ratio/max": 1.5911941289901734,
"sampling/importance_sampling_ratio/mean": 0.9673095345497131,
"sampling/importance_sampling_ratio/min": 0.5568610072135926,
"sampling/sampling_logp_difference/max": 0.20886776447296143,
"sampling/sampling_logp_difference/mean": 0.009916677000001073,
"step": 200,
"step_time": 5.727214452699991
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.9625,
"completions/max_length": 256.0,
"completions/max_terminated_length": 23.8,
"completions/mean_length": 249.375,
"completions/mean_terminated_length": 23.8,
"completions/min_length": 203.0,
"completions/min_terminated_length": 23.8,
"entropy": 0.7014953553676605,
"epoch": 0.0006718667016463934,
"frac_reward_zero_std": 0.6,
"grad_norm": 0.0,
"learning_rate": 9.993313326635996e-06,
"loss": -0.0173,
"num_tokens": 1440089.0,
"reward": 0.42509948313236234,
"reward_std": 0.09789986498653888,
"rewards/reward_func/mean": 0.42509948313236234,
"rewards/reward_func/std": 0.09789986498653888,
"sampling/importance_sampling_ratio/max": 1.6502047896385192,
"sampling/importance_sampling_ratio/mean": 0.9715989649295806,
"sampling/importance_sampling_ratio/min": 0.5182478070259094,
"sampling/sampling_logp_difference/max": 0.24867323338985442,
"sampling/sampling_logp_difference/mean": 0.01255566468462348,
"step": 210,
"step_time": 5.595404389499163
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.9625,
"completions/max_length": 256.0,
"completions/max_terminated_length": 15.5,
"completions/mean_length": 248.3375,
"completions/mean_terminated_length": 15.5,
"completions/min_length": 194.7,
"completions/min_terminated_length": 15.5,
"entropy": 0.7566814184188843,
"epoch": 0.0007038603541057454,
"frac_reward_zero_std": 0.35,
"grad_norm": 0.0,
"learning_rate": 9.992993390111403e-06,
"loss": -0.0316,
"num_tokens": 1510280.0,
"reward": 0.4379701763391495,
"reward_std": 0.15445991717278956,
"rewards/reward_func/mean": 0.4379701763391495,
"rewards/reward_func/std": 0.15445992574095727,
"sampling/importance_sampling_ratio/max": 1.6620585918426514,
"sampling/importance_sampling_ratio/mean": 1.0050045073032379,
"sampling/importance_sampling_ratio/min": 0.5981552571058273,
"sampling/sampling_logp_difference/max": 0.2270957887172699,
"sampling/sampling_logp_difference/mean": 0.013740905188024044,
"step": 220,
"step_time": 5.674174832900462
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.9875,
"completions/max_length": 256.0,
"completions/max_terminated_length": 15.8,
"completions/mean_length": 254.775,
"completions/mean_terminated_length": 15.8,
"completions/min_length": 246.2,
"completions/min_terminated_length": 15.8,
"entropy": 0.6086385309696197,
"epoch": 0.0007358540065650975,
"frac_reward_zero_std": 0.45,
"grad_norm": 2.3130009174346924,
"learning_rate": 9.99267345358681e-06,
"loss": -0.0006,
"num_tokens": 1578514.0,
"reward": 0.4830972790718079,
"reward_std": 0.1875777266919613,
"rewards/reward_func/mean": 0.4830972790718079,
"rewards/reward_func/std": 0.1875777341425419,
"sampling/importance_sampling_ratio/max": 1.6131272673606873,
"sampling/importance_sampling_ratio/mean": 1.0001753568649292,
"sampling/importance_sampling_ratio/min": 0.5552087921649218,
"sampling/sampling_logp_difference/max": 0.43015940189361573,
"sampling/sampling_logp_difference/mean": 0.011561960633844136,
"step": 230,
"step_time": 5.544450350801344
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 1.0,
"completions/max_length": 256.0,
"completions/max_terminated_length": 0.0,
"completions/mean_length": 256.0,
"completions/mean_terminated_length": 0.0,
"completions/min_length": 256.0,
"completions/min_terminated_length": 0.0,
"entropy": 0.3803480386734009,
"epoch": 0.0007678476590244496,
"frac_reward_zero_std": 0.55,
"grad_norm": 1.6584447622299194,
"learning_rate": 9.992353517062216e-06,
"loss": -0.0284,
"num_tokens": 1642058.0,
"reward": 0.37710185497999194,
"reward_std": 0.15426886081695557,
"rewards/reward_func/mean": 0.37710185497999194,
"rewards/reward_func/std": 0.1542688600718975,
"sampling/importance_sampling_ratio/max": 1.6463178157806397,
"sampling/importance_sampling_ratio/mean": 1.0489038527011871,
"sampling/importance_sampling_ratio/min": 0.5974440038204193,
"sampling/sampling_logp_difference/max": 0.25446571707725524,
"sampling/sampling_logp_difference/mean": 0.007619179924950004,
"step": 240,
"step_time": 5.355880505999084
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.975,
"completions/max_length": 256.0,
"completions/max_terminated_length": 40.4,
"completions/mean_length": 254.65,
"completions/mean_terminated_length": 40.4,
"completions/min_length": 245.2,
"completions/min_terminated_length": 40.4,
"entropy": 0.27831714749336245,
"epoch": 0.0007998413114838016,
"frac_reward_zero_std": 0.5,
"grad_norm": 0.0,
"learning_rate": 9.992033580537622e-06,
"loss": -0.0032,
"num_tokens": 1711846.0,
"reward": 0.42411058843135835,
"reward_std": 0.16632129922509192,
"rewards/reward_func/mean": 0.42411058843135835,
"rewards/reward_func/std": 0.16632130593061448,
"sampling/importance_sampling_ratio/max": 1.5203413009643554,
"sampling/importance_sampling_ratio/mean": 1.0328932225704193,
"sampling/importance_sampling_ratio/min": 0.6588745385408401,
"sampling/sampling_logp_difference/max": 0.18178346157073974,
"sampling/sampling_logp_difference/mean": 0.0056556087452918295,
"step": 250,
"step_time": 5.5352098594987185
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 1.0,
"completions/max_length": 256.0,
"completions/max_terminated_length": 0.0,
"completions/mean_length": 256.0,
"completions/mean_terminated_length": 0.0,
"completions/min_length": 256.0,
"completions/min_terminated_length": 0.0,
"entropy": 0.1278106041252613,
"epoch": 0.0008318349639431536,
"frac_reward_zero_std": 0.8,
"grad_norm": 0.0,
"learning_rate": 9.99171364401303e-06,
"loss": -0.0046,
"num_tokens": 1786514.0,
"reward": 0.2930680900812149,
"reward_std": 0.17092638909816743,
"rewards/reward_func/mean": 0.2930680900812149,
"rewards/reward_func/std": 0.1709263913333416,
"sampling/importance_sampling_ratio/max": 1.3693155288696288,
"sampling/importance_sampling_ratio/mean": 1.0101397514343262,
"sampling/importance_sampling_ratio/min": 0.706161481142044,
"sampling/sampling_logp_difference/max": 0.2914245367050171,
"sampling/sampling_logp_difference/mean": 0.003187426913063973,
"step": 260,
"step_time": 6.023757166299765
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.7875,
"completions/max_length": 256.0,
"completions/max_terminated_length": 75.3,
"completions/mean_length": 220.3625,
"completions/mean_terminated_length": 43.833333587646486,
"completions/min_length": 142.5,
"completions/min_terminated_length": 14.5,
"entropy": 0.1212063867598772,
"epoch": 0.0008638286164025057,
"frac_reward_zero_std": 0.85,
"grad_norm": 0.0,
"learning_rate": 9.991393707488435e-06,
"loss": -0.0154,
"num_tokens": 1858843.0,
"reward": 0.33083333671092985,
"reward_std": 0.16369171999394894,
"rewards/reward_func/mean": 0.33083333671092985,
"rewards/reward_func/std": 0.16369172520935535,
"sampling/importance_sampling_ratio/max": 1.2816577553749084,
"sampling/importance_sampling_ratio/mean": 0.9920831918716431,
"sampling/importance_sampling_ratio/min": 0.6905932784080505,
"sampling/sampling_logp_difference/max": 0.28521891832351687,
"sampling/sampling_logp_difference/mean": 0.0035509371664375067,
"step": 270,
"step_time": 5.597285097798886
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.9375,
"completions/max_length": 256.0,
"completions/max_terminated_length": 5.0,
"completions/mean_length": 240.9375,
"completions/mean_terminated_length": 4.75,
"completions/min_length": 183.7,
"completions/min_terminated_length": 4.5,
"entropy": 0.07088708113878965,
"epoch": 0.0008958222688618578,
"frac_reward_zero_std": 0.8,
"grad_norm": 0.0,
"learning_rate": 9.991073770963842e-06,
"loss": 0.0048,
"num_tokens": 1932334.0,
"reward": 0.3946428582072258,
"reward_std": 0.22504092752933502,
"rewards/reward_func/mean": 0.3946428582072258,
"rewards/reward_func/std": 0.22504092901945114,
"sampling/importance_sampling_ratio/max": 1.2599162340164185,
"sampling/importance_sampling_ratio/mean": 1.0197808623313904,
"sampling/importance_sampling_ratio/min": 0.7929178476333618,
"sampling/sampling_logp_difference/max": 0.1750430405139923,
"sampling/sampling_logp_difference/mean": 0.0020096191816264763,
"step": 280,
"step_time": 5.630174891401111
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.8,
"completions/max_length": 256.0,
"completions/max_terminated_length": 88.3,
"completions/mean_length": 228.1625,
"completions/mean_terminated_length": 70.35500030517578,
"completions/min_length": 156.3,
"completions/min_terminated_length": 53.9,
"entropy": 0.08419435755349695,
"epoch": 0.0009278159213212099,
"frac_reward_zero_std": 0.8,
"grad_norm": 0.0,
"learning_rate": 9.990753834439249e-06,
"loss": 0.0111,
"num_tokens": 2008323.0,
"reward": 0.26570436991751195,
"reward_std": 0.18353180214762688,
"rewards/reward_func/mean": 0.26570436991751195,
"rewards/reward_func/std": 0.1835318051278591,
"sampling/importance_sampling_ratio/max": 1.4831114292144776,
"sampling/importance_sampling_ratio/mean": 1.0381149470806121,
"sampling/importance_sampling_ratio/min": 0.769954988360405,
"sampling/sampling_logp_difference/max": 0.2556483805179596,
"sampling/sampling_logp_difference/mean": 0.002364744877559133,
"step": 290,
"step_time": 5.769126031998894
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.8125,
"completions/max_length": 256.0,
"completions/max_terminated_length": 62.9,
"completions/mean_length": 225.9875,
"completions/mean_terminated_length": 53.37333374023437,
"completions/min_length": 172.1,
"completions/min_terminated_length": 44.1,
"entropy": 0.07666442807785642,
"epoch": 0.000959809573780562,
"frac_reward_zero_std": 0.8,
"grad_norm": 4.1501336097717285,
"learning_rate": 9.990433897914654e-06,
"loss": 0.0336,
"num_tokens": 2082826.0,
"reward": 0.23347222283482552,
"reward_std": 0.16722211516462265,
"rewards/reward_func/mean": 0.23347222283482552,
"rewards/reward_func/std": 0.1672221203800291,
"sampling/importance_sampling_ratio/max": 1.4259886741638184,
"sampling/importance_sampling_ratio/mean": 1.0574868023395538,
"sampling/importance_sampling_ratio/min": 0.789874866604805,
"sampling/sampling_logp_difference/max": 0.23401358423907367,
"sampling/sampling_logp_difference/mean": 0.0024510751294855027,
"step": 300,
"step_time": 5.732418804300687
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.75,
"completions/max_length": 256.0,
"completions/max_terminated_length": 75.1,
"completions/mean_length": 211.2875,
"completions/mean_terminated_length": 41.28166732788086,
"completions/min_length": 120.0,
"completions/min_terminated_length": 17.6,
"entropy": 0.0686798977241864,
"epoch": 0.000991803226239914,
"frac_reward_zero_std": 0.8,
"grad_norm": 1.8366484642028809,
"learning_rate": 9.99011396139006e-06,
"loss": 0.0239,
"num_tokens": 2152257.0,
"reward": 0.12645833492279052,
"reward_std": 0.14587621986865998,
"rewards/reward_func/mean": 0.12645833492279052,
"rewards/reward_func/std": 0.14587622582912446,
"sampling/importance_sampling_ratio/max": 1.1935789823532104,
"sampling/importance_sampling_ratio/mean": 0.974252438545227,
"sampling/importance_sampling_ratio/min": 0.7667523324489594,
"sampling/sampling_logp_difference/max": 0.1506180524825588,
"sampling/sampling_logp_difference/mean": 0.002328540227609641,
"step": 310,
"step_time": 5.518856391799636
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.8375,
"completions/max_length": 256.0,
"completions/max_terminated_length": 64.5,
"completions/mean_length": 226.7375,
"completions/mean_terminated_length": 52.0,
"completions/min_length": 142.4,
"completions/min_terminated_length": 40.0,
"entropy": 0.09266874022340943,
"epoch": 0.0010237968786992661,
"frac_reward_zero_std": 0.75,
"grad_norm": 0.0,
"learning_rate": 9.989794024865468e-06,
"loss": -0.0364,
"num_tokens": 2214244.0,
"reward": 0.15312500447034835,
"reward_std": 0.1446988269686699,
"rewards/reward_func/mean": 0.15312500447034835,
"rewards/reward_func/std": 0.1446988321840763,
"sampling/importance_sampling_ratio/max": 1.241053009033203,
"sampling/importance_sampling_ratio/mean": 1.0196372747421265,
"sampling/importance_sampling_ratio/min": 0.8321290433406829,
"sampling/sampling_logp_difference/max": 0.15206519961356973,
"sampling/sampling_logp_difference/mean": 0.0024405727162957165,
"step": 320,
"step_time": 5.378200366300734
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.9125,
"completions/max_length": 256.0,
"completions/max_terminated_length": 66.0,
"completions/mean_length": 246.2,
"completions/mean_terminated_length": 63.2,
"completions/min_length": 188.3,
"completions/min_terminated_length": 60.3,
"entropy": 0.09167351502528617,
"epoch": 0.0010557905311586182,
"frac_reward_zero_std": 0.6,
"grad_norm": 0.0,
"learning_rate": 9.989474088340873e-06,
"loss": 0.0217,
"num_tokens": 2285904.0,
"reward": 0.3576704621315002,
"reward_std": 0.3019014626741409,
"rewards/reward_func/mean": 0.3576704621315002,
"rewards/reward_func/std": 0.3019014626741409,
"sampling/importance_sampling_ratio/max": 1.4326660275459289,
"sampling/importance_sampling_ratio/mean": 1.037734228372574,
"sampling/importance_sampling_ratio/min": 0.7440287649631501,
"sampling/sampling_logp_difference/max": 0.23049730334314517,
"sampling/sampling_logp_difference/mean": 0.002569542225171517,
"step": 330,
"step_time": 5.626144137700612
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.9875,
"completions/max_length": 256.0,
"completions/max_terminated_length": 20.7,
"completions/mean_length": 255.3875,
"completions/mean_terminated_length": 20.7,
"completions/min_length": 251.1,
"completions/min_terminated_length": 20.7,
"entropy": 0.04270339908171365,
"epoch": 0.0010877841836179703,
"frac_reward_zero_std": 0.9,
"grad_norm": 2.1360747814178467,
"learning_rate": 9.98915415181628e-06,
"loss": -0.0077,
"num_tokens": 2360267.0,
"reward": 0.4468750059604645,
"reward_std": 0.24749347418546677,
"rewards/reward_func/mean": 0.4468750059604645,
"rewards/reward_func/std": 0.24749347791075707,
"sampling/importance_sampling_ratio/max": 1.2458698153495789,
"sampling/importance_sampling_ratio/mean": 0.9976316630840302,
"sampling/importance_sampling_ratio/min": 0.7613322377204895,
"sampling/sampling_logp_difference/max": 0.23170500993728638,
"sampling/sampling_logp_difference/mean": 0.00149433299084194,
"step": 340,
"step_time": 5.726679722499102
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.9875,
"completions/max_length": 256.0,
"completions/max_terminated_length": 0.8,
"completions/mean_length": 252.9,
"completions/mean_terminated_length": 0.8,
"completions/min_length": 231.2,
"completions/min_terminated_length": 0.8,
"entropy": 0.04858234422281384,
"epoch": 0.0011197778360773224,
"frac_reward_zero_std": 0.7,
"grad_norm": 0.0,
"learning_rate": 9.988834215291687e-06,
"loss": 0.0049,
"num_tokens": 2425455.0,
"reward": 0.4354166708886623,
"reward_std": 0.21333095170557498,
"rewards/reward_func/mean": 0.4354166708886623,
"rewards/reward_func/std": 0.21333095692098142,
"sampling/importance_sampling_ratio/max": 1.4613646507263183,
"sampling/importance_sampling_ratio/mean": 1.050947654247284,
"sampling/importance_sampling_ratio/min": 0.814390116930008,
"sampling/sampling_logp_difference/max": 0.21158765852451325,
"sampling/sampling_logp_difference/mean": 0.0014789702137932182,
"step": 350,
"step_time": 5.466575936901063
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.925,
"completions/max_length": 256.0,
"completions/max_terminated_length": 61.9,
"completions/mean_length": 245.925,
"completions/mean_terminated_length": 55.55,
"completions/min_length": 177.2,
"completions/min_terminated_length": 49.2,
"entropy": 0.053529321749115864,
"epoch": 0.0011517714885366742,
"frac_reward_zero_std": 0.75,
"grad_norm": 0.0,
"learning_rate": 9.988514278767092e-06,
"loss": 0.0049,
"num_tokens": 2504269.0,
"reward": 0.3968750059604645,
"reward_std": 0.1802075080573559,
"rewards/reward_func/mean": 0.3968750059604645,
"rewards/reward_func/std": 0.18020751103758811,
"sampling/importance_sampling_ratio/max": 1.177919292449951,
"sampling/importance_sampling_ratio/mean": 0.9963529229164123,
"sampling/importance_sampling_ratio/min": 0.790158474445343,
"sampling/sampling_logp_difference/max": 0.1852503061294435,
"sampling/sampling_logp_difference/mean": 0.0018855397938748685,
"step": 360,
"step_time": 5.941310021798563
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.9,
"completions/max_length": 256.0,
"completions/max_terminated_length": 84.4,
"completions/mean_length": 242.7125,
"completions/mean_terminated_length": 64.95,
"completions/min_length": 180.3,
"completions/min_terminated_length": 52.3,
"entropy": 0.06859993665476623,
"epoch": 0.0011837651409960263,
"frac_reward_zero_std": 0.85,
"grad_norm": 0.0,
"learning_rate": 9.988194342242499e-06,
"loss": 0.0173,
"num_tokens": 2569206.0,
"reward": 0.28229166865348815,
"reward_std": 0.2816430002450943,
"rewards/reward_func/mean": 0.28229166865348815,
"rewards/reward_func/std": 0.28164300322532654,
"sampling/importance_sampling_ratio/max": 1.124396276473999,
"sampling/importance_sampling_ratio/mean": 0.9633953630924225,
"sampling/importance_sampling_ratio/min": 0.7915119707584382,
"sampling/sampling_logp_difference/max": 0.16286268234239287,
"sampling/sampling_logp_difference/mean": 0.0019630593538717987,
"step": 370,
"step_time": 5.463180380301492
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.875,
"completions/max_length": 256.0,
"completions/max_terminated_length": 50.0,
"completions/mean_length": 231.6,
"completions/mean_terminated_length": 31.625,
"completions/min_length": 176.7,
"completions/min_terminated_length": 23.1,
"entropy": 0.06270983926292502,
"epoch": 0.0012157587934553784,
"frac_reward_zero_std": 0.8,
"grad_norm": 2.672822952270508,
"learning_rate": 9.987874405717906e-06,
"loss": -0.055,
"num_tokens": 2629322.0,
"reward": 0.3541666716337204,
"reward_std": 0.20473803579807281,
"rewards/reward_func/mean": 0.3541666716337204,
"rewards/reward_func/std": 0.20473804622888564,
"sampling/importance_sampling_ratio/max": 1.2506105780601502,
"sampling/importance_sampling_ratio/mean": 1.0168899595737457,
"sampling/importance_sampling_ratio/min": 0.824669885635376,
"sampling/sampling_logp_difference/max": 0.20925886631014237,
"sampling/sampling_logp_difference/mean": 0.0017543567693905971,
"step": 380,
"step_time": 5.311027956598991
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 1.0,
"completions/max_length": 256.0,
"completions/max_terminated_length": 0.0,
"completions/mean_length": 256.0,
"completions/mean_terminated_length": 0.0,
"completions/min_length": 256.0,
"completions/min_terminated_length": 0.0,
"entropy": 0.03655383495010937,
"epoch": 0.0012477524459147305,
"frac_reward_zero_std": 0.85,
"grad_norm": 0.0,
"learning_rate": 9.987554469193313e-06,
"loss": -0.0051,
"num_tokens": 2703414.0,
"reward": 0.377202383056283,
"reward_std": 0.1339038535952568,
"rewards/reward_func/mean": 0.377202383056283,
"rewards/reward_func/std": 0.13390385918319225,
"sampling/importance_sampling_ratio/max": 1.1611881256103516,
"sampling/importance_sampling_ratio/mean": 0.9962027847766877,
"sampling/importance_sampling_ratio/min": 0.854848849773407,
"sampling/sampling_logp_difference/max": 0.16494819521891485,
"sampling/sampling_logp_difference/mean": 0.0010984212101902812,
"step": 390,
"step_time": 5.715437156000553
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.95,
"completions/max_length": 256.0,
"completions/max_terminated_length": 50.9,
"completions/mean_length": 249.5625,
"completions/mean_terminated_length": 50.9,
"completions/min_length": 204.5,
"completions/min_terminated_length": 50.9,
"entropy": 0.0142990311000176,
"epoch": 0.0012797460983740825,
"frac_reward_zero_std": 0.85,
"grad_norm": 0.9834340214729309,
"learning_rate": 9.98723453266872e-06,
"loss": -0.0033,
"num_tokens": 2774675.0,
"reward": 0.2778645843267441,
"reward_std": 0.19682962205260993,
"rewards/reward_func/mean": 0.2778645843267441,
"rewards/reward_func/std": 0.19682962205260993,
"sampling/importance_sampling_ratio/max": 1.1094371914863586,
"sampling/importance_sampling_ratio/mean": 0.9909844160079956,
"sampling/importance_sampling_ratio/min": 0.8944578170776367,
"sampling/sampling_logp_difference/max": 0.1037120074032714,
"sampling/sampling_logp_difference/mean": 0.00037660791385860646,
"step": 400,
"step_time": 5.656911766299163
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.8375,
"completions/max_length": 256.0,
"completions/max_terminated_length": 94.3,
"completions/mean_length": 229.3875,
"completions/mean_terminated_length": 78.7,
"completions/min_length": 114.1,
"completions/min_terminated_length": 62.9,
"entropy": 0.07908494919538497,
"epoch": 0.0013117397508334346,
"frac_reward_zero_std": 0.75,
"grad_norm": 0.0,
"learning_rate": 9.986914596144125e-06,
"loss": -0.0365,
"num_tokens": 2845326.0,
"reward": 0.3717905465513468,
"reward_std": 0.1484815463423729,
"rewards/reward_func/mean": 0.3717905465513468,
"rewards/reward_func/std": 0.14848154485225679,
"sampling/importance_sampling_ratio/max": 1.2370566368103026,
"sampling/importance_sampling_ratio/mean": 0.9945116937160492,
"sampling/importance_sampling_ratio/min": 0.7393935590982437,
"sampling/sampling_logp_difference/max": 0.23011792302131653,
"sampling/sampling_logp_difference/mean": 0.0021225204749498517,
"step": 410,
"step_time": 5.705939891400339
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.9875,
"completions/max_length": 256.0,
"completions/max_terminated_length": 23.2,
"completions/mean_length": 255.7,
"completions/mean_terminated_length": 23.2,
"completions/min_length": 253.6,
"completions/min_terminated_length": 23.2,
"entropy": 0.11622791923582554,
"epoch": 0.0013437334032927867,
"frac_reward_zero_std": 0.55,
"grad_norm": 1.0996203422546387,
"learning_rate": 9.986594659619532e-06,
"loss": 0.0185,
"num_tokens": 2920366.0,
"reward": 0.4640106737613678,
"reward_std": 0.18370848000049592,
"rewards/reward_func/mean": 0.4640106737613678,
"rewards/reward_func/std": 0.183708493411541,
"sampling/importance_sampling_ratio/max": 1.4171173453330994,
"sampling/importance_sampling_ratio/mean": 1.003091186285019,
"sampling/importance_sampling_ratio/min": 0.667611488699913,
"sampling/sampling_logp_difference/max": 0.2792933344841003,
"sampling/sampling_logp_difference/mean": 0.003231652465183288,
"step": 420,
"step_time": 5.756985362099658
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.95,
"completions/max_length": 256.0,
"completions/max_terminated_length": 24.9,
"completions/mean_length": 247.1875,
"completions/mean_terminated_length": 19.0,
"completions/min_length": 192.3,
"completions/min_terminated_length": 13.1,
"entropy": 0.14475581012666225,
"epoch": 0.0013757270557521388,
"frac_reward_zero_std": 0.55,
"grad_norm": 11.813094139099121,
"learning_rate": 9.98627472309494e-06,
"loss": -0.016,
"num_tokens": 2990521.0,
"reward": 0.5379598774015903,
"reward_std": 0.2365218322724104,
"rewards/reward_func/mean": 0.5379598774015903,
"rewards/reward_func/std": 0.23652183823287487,
"sampling/importance_sampling_ratio/max": 1.3119380474090576,
"sampling/importance_sampling_ratio/mean": 0.9913179278373718,
"sampling/importance_sampling_ratio/min": 0.6958961844444275,
"sampling/sampling_logp_difference/max": 0.2457788407802582,
"sampling/sampling_logp_difference/mean": 0.00400251317769289,
"step": 430,
"step_time": 5.510892314800003
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.8625,
"completions/max_length": 256.0,
"completions/max_terminated_length": 92.2,
"completions/mean_length": 242.7125,
"completions/mean_terminated_length": 81.75,
"completions/min_length": 194.9,
"completions/min_terminated_length": 66.9,
"entropy": 0.1159008003771305,
"epoch": 0.0014077207082114909,
"frac_reward_zero_std": 0.5,
"grad_norm": 1.4708253145217896,
"learning_rate": 9.985954786570346e-06,
"loss": -0.0072,
"num_tokens": 3058810.0,
"reward": 0.5677399009466171,
"reward_std": 0.2517916664481163,
"rewards/reward_func/mean": 0.5677399009466171,
"rewards/reward_func/std": 0.2517916738986969,
"sampling/importance_sampling_ratio/max": 1.3556796312332153,
"sampling/importance_sampling_ratio/mean": 0.9918678581714631,
"sampling/importance_sampling_ratio/min": 0.7032382875680924,
"sampling/sampling_logp_difference/max": 0.2598047614097595,
"sampling/sampling_logp_difference/mean": 0.0033211032161489127,
"step": 440,
"step_time": 5.6251649013007405
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.6625,
"completions/max_length": 256.0,
"completions/max_terminated_length": 166.1,
"completions/mean_length": 222.0,
"completions/mean_terminated_length": 129.63095703125,
"completions/min_length": 107.7,
"completions/min_terminated_length": 82.1,
"entropy": 0.1969615861773491,
"epoch": 0.001439714360670843,
"frac_reward_zero_std": 0.65,
"grad_norm": 0.0,
"learning_rate": 9.985634850045753e-06,
"loss": -0.0013,
"num_tokens": 3127434.0,
"reward": 0.5485919028520584,
"reward_std": 0.17314926013350487,
"rewards/reward_func/mean": 0.5485919028520584,
"rewards/reward_func/std": 0.17314926385879517,
"sampling/importance_sampling_ratio/max": 1.5697351694107056,
"sampling/importance_sampling_ratio/mean": 1.0374357163906098,
"sampling/importance_sampling_ratio/min": 0.6470421016216278,
"sampling/sampling_logp_difference/max": 0.2132512927055359,
"sampling/sampling_logp_difference/mean": 0.005053542635869235,
"step": 450,
"step_time": 5.532932810001512
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.525,
"completions/max_length": 256.0,
"completions/max_terminated_length": 176.8,
"completions/mean_length": 193.9625,
"completions/mean_terminated_length": 136.64166984558105,
"completions/min_length": 93.8,
"completions/min_terminated_length": 93.8,
"entropy": 0.3504923045635223,
"epoch": 0.001471708013130195,
"frac_reward_zero_std": 0.4,
"grad_norm": 0.0,
"learning_rate": 9.985314913521158e-06,
"loss": -0.1111,
"num_tokens": 3192059.0,
"reward": 0.4286737531423569,
"reward_std": 0.16954719498753548,
"rewards/reward_func/mean": 0.4286737531423569,
"rewards/reward_func/std": 0.1695472002029419,
"sampling/importance_sampling_ratio/max": 1.558855003118515,
"sampling/importance_sampling_ratio/mean": 0.959910637140274,
"sampling/importance_sampling_ratio/min": 0.4642279316438362,
"sampling/sampling_logp_difference/max": 1.0550345182418823,
"sampling/sampling_logp_difference/mean": 0.009053306374698877,
"step": 460,
"step_time": 5.39767370289992
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.8625,
"completions/max_length": 256.0,
"completions/max_terminated_length": 104.6,
"completions/mean_length": 239.975,
"completions/mean_terminated_length": 93.55,
"completions/min_length": 157.6,
"completions/min_terminated_length": 80.8,
"entropy": 0.5055756628513336,
"epoch": 0.001503701665589547,
"frac_reward_zero_std": 0.6,
"grad_norm": 3.5918967723846436,
"learning_rate": 9.984994976996565e-06,
"loss": -0.0296,
"num_tokens": 3260961.0,
"reward": 0.5198034137487412,
"reward_std": 0.20930832698941232,
"rewards/reward_func/mean": 0.5198034137487412,
"rewards/reward_func/std": 0.20930833518505096,
"sampling/importance_sampling_ratio/max": 1.7837756991386413,
"sampling/importance_sampling_ratio/mean": 1.0180927097797394,
"sampling/importance_sampling_ratio/min": 0.4891276627779007,
"sampling/sampling_logp_difference/max": 0.4487993657588959,
"sampling/sampling_logp_difference/mean": 0.010052280919626354,
"step": 470,
"step_time": 5.559607181699539
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.975,
"completions/max_length": 256.0,
"completions/max_terminated_length": 19.6,
"completions/mean_length": 252.05,
"completions/mean_terminated_length": 19.6,
"completions/min_length": 224.4,
"completions/min_terminated_length": 19.6,
"entropy": 0.20359312649816275,
"epoch": 0.0015356953180488992,
"frac_reward_zero_std": 0.55,
"grad_norm": 11.020283699035645,
"learning_rate": 9.984675040471972e-06,
"loss": -0.0173,
"num_tokens": 3328505.0,
"reward": 0.4618885099887848,
"reward_std": 0.2562588080763817,
"rewards/reward_func/mean": 0.4618885099887848,
"rewards/reward_func/std": 0.25625881403684614,
"sampling/importance_sampling_ratio/max": 1.4413376688957213,
"sampling/importance_sampling_ratio/mean": 1.0164444029331208,
"sampling/importance_sampling_ratio/min": 0.6880250811576843,
"sampling/sampling_logp_difference/max": 0.36722205877304076,
"sampling/sampling_logp_difference/mean": 0.003699347673682496,
"step": 480,
"step_time": 5.570423536199814
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.95,
"completions/max_length": 256.0,
"completions/max_terminated_length": 35.3,
"completions/mean_length": 247.6125,
"completions/mean_terminated_length": 35.3,
"completions/min_length": 188.9,
"completions/min_terminated_length": 35.3,
"entropy": 0.25075023621320724,
"epoch": 0.0015676889705082513,
"frac_reward_zero_std": 0.6,
"grad_norm": 3.4280946254730225,
"learning_rate": 9.984355103947377e-06,
"loss": 0.041,
"num_tokens": 3393326.0,
"reward": 0.4563781010918319,
"reward_std": 0.19282358512282372,
"rewards/reward_func/mean": 0.4563781010918319,
"rewards/reward_func/std": 0.1928235985338688,
"sampling/importance_sampling_ratio/max": 1.6902172982692718,
"sampling/importance_sampling_ratio/mean": 0.8757067143917083,
"sampling/importance_sampling_ratio/min": 0.30804501920938493,
"sampling/sampling_logp_difference/max": 1.0456432223320007,
"sampling/sampling_logp_difference/mean": 0.006558918510563672,
"step": 490,
"step_time": 5.501604846100963
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.9625,
"completions/max_length": 256.0,
"completions/max_terminated_length": 40.2,
"completions/mean_length": 251.5875,
"completions/mean_terminated_length": 28.7,
"completions/min_length": 222.0,
"completions/min_terminated_length": 17.2,
"entropy": 0.34359313249588014,
"epoch": 0.0015996826229676031,
"frac_reward_zero_std": 0.35,
"grad_norm": 6.27419376373291,
"learning_rate": 9.984035167422784e-06,
"loss": 0.0614,
"num_tokens": 3458237.0,
"reward": 0.435734324157238,
"reward_std": 0.1720918044447899,
"rewards/reward_func/mean": 0.435734324157238,
"rewards/reward_func/std": 0.17209180817008018,
"sampling/importance_sampling_ratio/max": 1.7418416380882262,
"sampling/importance_sampling_ratio/mean": 0.862521804869175,
"sampling/importance_sampling_ratio/min": 0.3627486750483513,
"sampling/sampling_logp_difference/max": 0.7209866166114807,
"sampling/sampling_logp_difference/mean": 0.009752574237063527,
"step": 500,
"step_time": 5.387810998200439
}
],
"logging_steps": 10,
"max_steps": 312562,
"num_input_tokens_seen": 3458237,
"num_train_epochs": 1,
"save_steps": 50,
"stateful_callbacks": {
"TrainerControl": {
"args": {
"should_epoch_stop": false,
"should_evaluate": false,
"should_log": false,
"should_save": true,
"should_training_stop": false
},
"attributes": {}
}
},
"total_flos": 0.0,
"train_batch_size": 8,
"trial_name": null,
"trial_params": null
}