| { | |
| "epoch": 3, | |
| "base_model": "Qwen/Qwen2.5-14B-Instruct", | |
| "metrics": { | |
| "sft/loss_mean": 0.5125790238380432, | |
| "sft/loss_final": 0.5577956438064575, | |
| "sft/loss_std": 0.04738047259057726, | |
| "sft/grad_norm_mean": 1.484967955187727, | |
| "sft/grad_norm_max": 1.703125, | |
| "sft/tokens_trained": 3828496, | |
| "sft/samples_trained": 79264, | |
| "sft/optimizer_steps": 2477, | |
| "sft/loss_per_token": 0.00033085525851376965, | |
| "global_step": 7431, | |
| "epoch": 3 | |
| } | |
| } |