Shasidharyadavr commited on
Commit
e7eac8c
·
verified ·
1 Parent(s): 8ad6b02

GRPO 3B v13 (temp=0.7, LR=2e-05, r=32, model=zephyr-7b-beta): 0.729->0.623 delta=-0.107

Browse files
Files changed (1) hide show
  1. training_results_grpo_3b_v13.json +94 -0
training_results_grpo_3b_v13.json ADDED
@@ -0,0 +1,94 @@
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
1
+ {
2
+ "env_url": "https://shasidharyadavr-netweaver-sre.hf.space",
3
+ "model_name": "HuggingFaceH4/zephyr-7b-beta",
4
+ "training_method": "GRPO v13: 4-bit + LoRA r=32 (q_proj+k_proj+v_proj+o_proj+gate_proj+up_proj+down_proj), LR=2e-05, temp_train=temp_eval=0.7",
5
+ "max_train_steps": 30,
6
+ "num_generations": 4,
7
+ "learning_rate": 2e-05,
8
+ "lora_rank": 32,
9
+ "lora_target_modules": [
10
+ "q_proj",
11
+ "k_proj",
12
+ "v_proj",
13
+ "o_proj",
14
+ "gate_proj",
15
+ "up_proj",
16
+ "down_proj"
17
+ ],
18
+ "training_temperature": 0.7,
19
+ "eval_temperature": 0.7,
20
+ "trainable_params": 83886080,
21
+ "total_params": 3835957248,
22
+ "training_rewards": [
23
+ 0.5,
24
+ 0.733,
25
+ 0.3,
26
+ 0.82,
27
+ 0.999,
28
+ 0.9,
29
+ 0.999,
30
+ 0.5,
31
+ 0.9,
32
+ 0.5,
33
+ 0.5,
34
+ 0.5,
35
+ 0.5,
36
+ 0.86,
37
+ 0.5,
38
+ 0.9,
39
+ 0.9,
40
+ 0.667,
41
+ 0.667,
42
+ 0.667,
43
+ 0.82,
44
+ 0.9,
45
+ 0.86,
46
+ 0.9,
47
+ 0.84,
48
+ 0.84,
49
+ 0.96,
50
+ 0.9,
51
+ 0.3,
52
+ 0.86
53
+ ],
54
+ "before_rewards": [
55
+ 0.9,
56
+ 0.6,
57
+ 0.733,
58
+ 0.86,
59
+ 0.7,
60
+ 0.9,
61
+ 0.9,
62
+ 0.5,
63
+ 0.3,
64
+ 0.9
65
+ ],
66
+ "after_rewards": [
67
+ 0.86,
68
+ 0.86,
69
+ 0.5,
70
+ 0.5,
71
+ 0.3,
72
+ 0.5,
73
+ 0.84,
74
+ 0.9,
75
+ 0.3,
76
+ 0.667
77
+ ],
78
+ "difficulty_breakdown": {
79
+ "before": {
80
+ "easy": 0.73,
81
+ "medium": 0.8165,
82
+ "hard": 0.7000000000000001
83
+ },
84
+ "after": {
85
+ "easy": 0.775,
86
+ "medium": 0.43333333333333335,
87
+ "hard": 0.609
88
+ }
89
+ },
90
+ "timestamp": "2026-04-26 07:29:15",
91
+ "source": "grpo_3b_real_run_v13",
92
+ "job_flavor": "a10g-large",
93
+ "notes": "GRPO v13 on HuggingFaceH4/zephyr-7b-beta (4-bit + LoRA r=32, targets=['q_proj', 'k_proj', 'v_proj', 'o_proj', 'gate_proj', 'up_proj', 'down_proj']) vs the live NetWeaver SRE env. Train temp = eval temp = 0.7, LR = 2e-05. Heuristic baseline preserved (separate filenames)."
94
+ }