| { | |
| "epoch": 1, | |
| "base_model": "Qwen/Qwen2.5-14B-Instruct", | |
| "metrics": { | |
| "sft/loss_mean": 0.7318060994148254, | |
| "sft/loss_final": 0.7072445154190063, | |
| "sft/loss_std": 0.3951688552930663, | |
| "sft/grad_norm_mean": 8.714482615058538, | |
| "sft/grad_norm_max": 1520.0, | |
| "sft/tokens_trained": 3828602, | |
| "sft/samples_trained": 79264, | |
| "sft/optimizer_steps": 2477, | |
| "sft/loss_per_token": 0.0004725922114807613, | |
| "global_step": 2477, | |
| "epoch": 1 | |
| } | |
| } |