Le filThèmes : AgentsÉvaluationsRecherche
Des chercheurs montrent que des agents d’IA jugent une source inutile mais continuent de l’interroger
1 sourcemis à jour il y a 12 hpertinence 3,7 sur5
L’essentiel
Là où leurs jugements sont enregistrés, les sept agents testés jugent inutiles 97-100 % des résultats d’une source défaillante. Une étape d’intégration imposée les force à répondre après cinq résultats consécutifs jugés inutiles.
Propagation1 article, publié par HF Daily Papers le 7 oct..
Les sources
1 article
HF Daily PapersCommunauté : fiche de la sourceSource primaire
Hugging FaceChubin Zhang, Zhenglin Wan, Xingrui Yu et al.huggingface.co
Judged Useless, Queried Anyway: Tool-Using Agents Rarely Turn Their Own Evidence Judgments into Stopping Decisions (site externe)
An agent whose tool keeps returning nothing useful should stop relying on it. In a retrieval environment with controlled source failures, we separate how agents judge results from what they do.
Sur les mêmes thèmes
Agents
SkillSeek montre que BM25 rivalise avec la recherche agentique de skills pour les agents
Agents
VeriHarness transforme le LLM d’un générateur en agent vérificateur pour les tâches longues
Agents
MILO fait évoluer des harnais d’agents et leur stratégie de recherche, et dépasse huit harnais de référence
Évaluations
Des chercheurs suggèrent que les modèles de langage tendent à présenter par défaut des récits de succès
À lire ensuite
Modèles
Google DeepMind annonce Gemini 4 Argon, déployé d’abord auprès de défenseurs cyber de confiance via Fairwind
Modèles
OpenAI lance GPT-6 Sol et GPT-6 Luna, deux modèles plus économiques qui complètent GPT-6 Astra
Modèles
Anthropic publie Claude Opus 5.5 et OpenAI lance GPT-6 Sol et GPT-6 Luna à environ une heure d’écart
Modèles
Anthropic lance Claude Sonnet 5.5, deuxième modèle de la famille Claude 5.5