Le filThèmes : ÉvaluationsRechercheAgents
Des chercheurs mesurent les effondrements et les corrections dans les débats entre LLM homogènes
1 sourcemis à jour 29 sept.pertinence 3,1 sur5
L’essentiel
Sur 6 925 débats MMLU-Pro, leur protocole repère 253 effondrements. Un gel piloté par des sondes évite 29 effondrements mais fait perdre 108 corrections. Les schémas rejouables et les scripts de reconstruction sont publiés.
Propagation1 article, publié par HF Daily Papers le 29 sept..
Les sources
1 article
HF Daily PapersCommunauté : fiche de la sourceSource primaire
Hugging FaceXin Li, Mengbing Liu, Chau Yuenhuggingface.co
Measuring Collapse and Correction in Homogeneous-Panel LLM Debate (site externe)
Multi-agent large language model (LLM) debate is often evaluated by whether final answers improve, but movement is not necessarily improvement: the same discussion can rescue an initially wrong majority or destroy an initially correct one.
Sur les mêmes thèmes
Agents
SkillSeek montre que BM25 rivalise avec la recherche agentique de skills pour les agents
Agents
VeriHarness transforme le LLM d’un générateur en agent vérificateur pour les tâches longues
Agents
MILO fait évoluer des harnais d’agents et leur stratégie de recherche, et dépasse huit harnais de référence
Évaluations
Des chercheurs suggèrent que les modèles de langage tendent à présenter par défaut des récits de succès
À lire ensuite
Modèles
Google DeepMind annonce Gemini 4 Argon, déployé d’abord auprès de défenseurs cyber de confiance via Fairwind
Modèles
OpenAI lance GPT-6 Sol et GPT-6 Luna, deux modèles plus économiques qui complètent GPT-6 Astra
Modèles
Anthropic publie Claude Opus 5.5 et OpenAI lance GPT-6 Sol et GPT-6 Luna à environ une heure d’écart
Modèles
Anthropic lance Claude Sonnet 5.5, deuxième modèle de la famille Claude 5.5