Le filThèmes : ÉvaluationsAgentsRecherche
Des chercheurs lancent IntentFlux, un benchmark qui mesure la dérive d’intention des agents LLM
1 sourcemis à jour il y a 6 jpertinence 3,4 sur5
L’essentiel
Le score moyen passe de 0,476 à 0,384 dans une calibration de 627 cas. La méthode StateForge des chercheurs, qui maintient explicitement les exigences actives, fait passer le score de 0,367 à 0,467 sur General-Test.
Propagation1 article, publié par HF Daily Papers le 2 oct..
Les sources
1 article
HF Daily PapersCommunauté : fiche de la sourceSource primaire
Hugging FaceYanjie Zhang, Bowen Cao, Zixin Chen et al.huggingface.co
When Users Change Their Minds: Measuring and Repairing Intent Drift in LLM Agents (site externe)
We introduce IntentFlux, an executable benchmark that converts verifiable tasks into dialogues with controlled intent changes while preserving their original graders.
Sur les mêmes thèmes
Agents
SkillSeek montre que BM25 rivalise avec la recherche agentique de skills pour les agents
Agents
VeriHarness transforme le modèle générateur en vérificateur agentique pour les tâches de longue durée
Agents
MILO fait évoluer des harnais d’agents et leur stratégie de recherche, et dépasse huit harnais de référence
Évaluations
Des chercheurs suggèrent que les modèles de langage tendent à présenter par défaut des récits de succès
À lire ensuite
Modèles
Anthropic lance Claude Haiku 5.5, son nouveau modèle rapide et peu cher, au même prix que GPT-6 Luna
Modèles
Google DeepMind annonce Gemini 4 Argon, déployé d’abord auprès de défenseurs cyber de confiance via Fairwind
Modèles
OpenAI lance GPT-6 Sol et GPT-6 Luna, deux modèles plus économiques qui complètent GPT-6 Astra
Modèles
Anthropic publie Claude Opus 5.5 et OpenAI lance GPT-6 Sol et GPT-6 Luna à environ une heure d’écart