Human-annotated intent dataset and intent-aware safety classifiers (SFT, DPO, distillation, GRPO) for robust LLM guardrails.
Jeremias Ferrao
Jazhyc
·
AI & ML interests
None yet
Recent Activity
updated a dataset 21 days ago
Jazhyc/aletheias-phoenix-v8-1-kimi-k3-distillation published a dataset 21 days ago
Jazhyc/aletheias-phoenix-v8-1-kimi-k3-distillation updated a model 23 days ago
Jazhyc/aletheias-phoenix-v8-1-kimi-k3-liars-full-r16-ep2Organizations
None yet