Le filThèmes : SécuritéModèlesÉvaluations
L’Anthropic Frontier Red Team constate que GLM-5.3 réalise des détournements de flux de contrôle complets
2 sourcesmis à jour 30 sept.pertinence 4,4 sur5
L’essentiel
Sur 100 tâches tirées au hasard du benchmark interne Binary Exploitation, GLM-5.3 y parvient dans 4 % des essais, contre 6 % pour Claude Mythos Preview. Claude Opus 4.6 et GLM-5.2 ne réussissent aucune tâche.
Couverture
- Sources
- 2
- Articles
- 2
- Par type (sources)
- Officiel 1Analyse 1
- Sites repérés sur
- Hacker News 1
- Par rôle (articles)
- Analyse 1Relais 1
- Apports
- Cite 1
Propagation2 articles en 4 h 49, d’anthropic.com à Simon Willison.
Les sources
1 article, puis 1 sous « Relayé par »
Aucune source primaire : la page de l’auteur du fait n’est pas parmi les sources.
anthropic.comOfficielAnalysePremier
repéré sur Hacker News
GLM-5.3 and the spread of advanced cyber capabilities (site externe)
Relayé par
Simon WillisonAnalyse : fiche de la sourceRelais+ 4 h 49
Simon Willison, développeur indépendant (créateur de Datasette, co-créateur de Django)simonwillison.net
Quoting Anthropic Frontier Red Team (site externe)
Cite Anthropic Frontier Red Team :
We evaluate several models on 100 tasks from the [internal Binary Exploitation benchmark] (selected at random), and find that GLM-5.3 develops full control flow hijacks in 4% of the trials; Claude Mythos Preview did so in 6%.
Sur les mêmes thèmes
Modèles
Google DeepMind annonce Gemini 4 Argon, déployé d’abord auprès de défenseurs cyber de confiance via Fairwind
Évaluations
Cline explique l’avance en cybersécurité surtout par un moindre nombre de refus
Modèles
Anthropic lance Claude Sonnet 5.5, deuxième modèle de la famille Claude 5.5
Modèles
Mistral AI présente Mistral Large 4, disponible en préversion via son API
À lire ensuite
Modèles
OpenAI lance GPT-6 Sol et GPT-6 Luna, deux modèles plus économiques qui complètent GPT-6 Astra
Modèles
Anthropic publie Claude Opus 5.5 et OpenAI lance GPT-6 Sol et GPT-6 Luna à environ une heure d’écart
Sécurité
OpenAI reconnaît que ses agents d’IA ont pu perturber les sites de dizaines d’institutions
Modèles
Simon Willison couvre en direct la keynote de l’OpenAI DevDay 2026 fort Mason, à San Francisco