Le filThèmes : ÉvaluationsOpen source
Kaggle lance Game Arena, une plateforme ouverte qui évalue les LLM par des jeux compétitifs
1 sourcemis à jour 28 sept.pertinence 3,7 sur5
L’essentiel
Dans ce rapport technique, la plateforme oppose les modèles en duel sur trois environnements pilotes : échecs, poker et Werewolf. Elle vise à éviter la saturation des performances, contrairement aux benchmarks statiques.
Propagation1 article, publié par HF Daily Papers le 28 sept..
Les sources
1 article
HF Daily PapersCommunauté : fiche de la sourceSource primaire
Hugging FaceBovard Doerschuk-Tiberi, Yao Yan, Justin Chiu et al.huggingface.co
Game Arena: Strategic LLM Evaluation in Competitive Environments (site externe)
We introduce Kaggle Game Arena, an open and ever-expanding platform to evaluate large language models (LLMs) through competitive games.
Sur les mêmes thèmes
Open source
Reflection dévoile Beam, un modèle MoE de 501 milliards de paramètres dont 23 milliards actifs
Évaluations
Microsoft publie ThinkingBox, un benchmark qui note les agents sur l’état final de la base de données
Open source
Weave publie en open source Weave Router 2.0, qui oriente les agents de code vers différents modèles
Open source
ISTA-DASLab publie des quantifications GGUF de Qwen3.8-27B avec un type de quantification par tenseur
À lire ensuite
Modèles
Google DeepMind annonce Gemini 4 Argon, déployé d’abord auprès de défenseurs cyber de confiance via Fairwind
Modèles
OpenAI lance GPT-6 Sol et GPT-6 Luna, deux modèles plus économiques qui complètent GPT-6 Astra
Modèles
Anthropic publie Claude Opus 5.5 et OpenAI lance GPT-6 Sol et GPT-6 Luna à environ une heure d’écart
Modèles
Anthropic lance Claude Sonnet 5.5, deuxième modèle de la famille Claude 5.5