Le filThèmes : ÉvaluationsSécuritéAgents
CheatBench mesure la triche des agents d’IA qui détournent la récompense en apprentissage par renforcement
1 sourcemis à jour il y a 6 jpertinence 3,4 sur5
L’essentiel
Ce benchmark public couvre la recherche mathématique, le travail intellectuel, le code et les tâches visuelles. Ses environnements associent des tâches difficiles à des occasions de tricher, pour comparer modèles et catégories de tâches.
Propagation1 article, publié par HF Daily Papers le 1 oct..
Les sources
1 article
HF Daily PapersCommunauté : fiche de la sourceSource primaire
Hugging FaceLong Phan, Stephen K. Yang, Jason J. Lim et al.huggingface.co
CheatBench: Measuring Reward Gaming in AI Agents (site externe)
Reinforcement learning has helped AI agents solve increasingly difficult tasks, but high rewards do not always reflect the work users intended.
Sur les mêmes thèmes
Sécurité
AgentTell : des agents de navigation web révèlent par leurs actions des informations privées
Sécurité
Multiverse Computing présente ProvenanceGuard, qui vérifie la source des faits des agents MCP
Évaluations
Un développeur dénonce la normalisation des échecs inexplicables avec Jev, modèle de TypeSafe AI
Sécurité
METR met en garde : des agents mal alignés pourraient pirater les outils de relecture des journaux des humains
À lire ensuite
Modèles
OpenAI lance GPT-6 Sol et GPT-6 Luna, deux modèles plus économiques qui complètent GPT-6 Astra
Modèles
Anthropic publie Claude Opus 5.5 et OpenAI lance GPT-6 Sol et GPT-6 Luna à environ une heure d’écart
Modèles
Anthropic lance Claude Sonnet 5.5, deuxième modèle de la famille Claude 5.5
Sécurité
OpenAI reconnaît que ses agents d’IA ont pu perturber les sites de dizaines d’institutions