Le filThèmes : RechercheÉvaluationsSécurité
Une étude préenregistrée montre qu’un cadre de spécification réduit les défauts du code généré
1 sourcemis à jour 29 sept.pertinence 3,7 sur5
L’essentiel
Testé sur 50 tâches de backend et cinq modèles, le cadre de 267 mots l’emporte 95 fois sur 100 quand les résultats diffèrent. Bandit relève 53 problèmes moyens ou graves sans le cadre, contre 11 avec.
Propagation1 article, publié par HF Daily Papers le 29 sept..
Les sources
1 article
HF Daily PapersCommunauté : fiche de la sourceSource primaire
Hugging FaceSandeep Dhurihuggingface.co
Specification Before Generation: A Pre-Registered, Five-Model Paired Evaluation of a Specification Frame for LLM-Generated Code in Money, Time, Idempotency, and Access Tasks (site externe)
Code generated by large language models passes security checks at a rate that has barely moved in four years. In regulated backends, the defect classes that matter most are money arithmetic, time handling, retry safety, and access control.
Sur les mêmes thèmes
Sécurité
Une étude montre que l’autorité d’une injection de prompt vient du token réservé du modèle
Recherche
Une étude compare l’ingénierie des représentations aux protections comportementales pour la sécurité des LLM
Évaluations
Le benchmark CIAware mis à jour montre que GPT-6 Astra détecte presque toujours les interventions de contrôle
Recherche
Un papier propose de certifier les images réelles par resynthèse calibrée plutôt que de détecter les deepfakes
À lire ensuite
Modèles
OpenAI lance GPT-6 Sol et GPT-6 Luna, deux modèles plus économiques qui complètent GPT-6 Astra
Modèles
Anthropic publie Claude Opus 5.5 et OpenAI lance GPT-6 Sol et GPT-6 Luna à environ une heure d’écart
Modèles
Anthropic lance Claude Sonnet 5.5, deuxième modèle de la famille Claude 5.5
Sécurité
OpenAI reconnaît que ses agents d’IA ont pu perturber les sites de dizaines d’institutions