pinned
Running
Agents
48
Multilingual Leaderboards ๐
๐
Generative Evaluation for Global South
Generative AI, Arabic NLP
Generative Evaluation for Global South
Generative Tasks Evaluation of Arabic LLMs
Generate heatmap visualizations of model evaluation metrics
Study the Extreme threats of Frontier Large Language Models