Human-annotated intent dataset and intent-aware safety classifiers (SFT, DPO, distillation, GRPO) for robust LLM guardrails.
Jeremias Ferrao
Jazhyc
·
AI & ML interests
None yet
Recent Activity
updated a dataset 10 days ago
Jazhyc/aletheias-phoenix-v8-1-kimi-k3-distillation published a dataset 10 days ago
Jazhyc/aletheias-phoenix-v8-1-kimi-k3-distillation updated a model 12 days ago
Jazhyc/aletheias-phoenix-v8-1-kimi-k3-liars-full-r16-ep2Organizations
None yet