Le filThèmes : ÉvaluationsSécuritéRecherche
Le benchmark CIAware mis à jour montre que GPT-6 Astra détecte presque toujours les interventions de contrôle
1 sourcemis à jour il y a 7 hpertinence 3,0 sur5
L’essentiel
Selon ce benchmark, la plupart des modèles étaient proches du hasard en mai. Ses auteurs estiment que cela révèle des informations sur les moniteurs et affaiblit les protocoles de contrôle.
Propagation1 article, publié par AINews le 7 oct. à 6 h 55.
Les sources
1 article
Aucune source primaire : la page de l’auteur du fait n’est pas parmi les sources.
Sur les mêmes thèmes
Sécurité
Une étude montre que l’autorité d’une injection de prompt vient du token réservé du modèle
Recherche
Une étude préenregistrée montre qu’un cadre de spécification réduit les défauts du code généré
Recherche
Une étude compare l’ingénierie des représentations aux protections comportementales pour la sécurité des LLM
Recherche
Un papier propose de certifier les images réelles par resynthèse calibrée plutôt que de détecter les deepfakes
À lire ensuite
Modèles
OpenAI lance GPT-6 Sol et GPT-6 Luna, deux modèles plus économiques qui complètent GPT-6 Astra
Modèles
Anthropic publie Claude Opus 5.5 et OpenAI lance GPT-6 Sol et GPT-6 Luna à environ une heure d’écart
Modèles
Anthropic lance Claude Sonnet 5.5, deuxième modèle de la famille Claude 5.5
Sécurité
OpenAI reconnaît que ses agents d’IA ont pu perturber les sites de dizaines d’institutions