Le filThèmes : SécuritéRechercheÉvaluations
Une étude montre que l’autorité d’une injection de prompt vient du token réservé du modèle
1 sourcemis à jour 30 sept.pertinence 3,8 sur5
L’essentiel
Encoder les marqueurs falsifiés en sous-mots réduit le succès de l’attaque sur InjecAgent de 39 à 66 points sur trois familles open-weights sur quatre. L’option de tokenizer standard laisse 33 configurations sur 67 exposées.
Propagation1 article, publié par HF Daily Papers le 30 sept..
Les sources
1 article
HF Daily PapersCommunauté : fiche de la sourceSource primaire
Hugging FaceYan Zhan, Yunze Song, Mengkai Hou et al.huggingface.co
Same Bytes, Different Authority: Reserved-Token Representations in Chat-Template Prompt Injection (site externe)
Prompt injection against LLM agents becomes much stronger when the injected instruction is wrapped in the model’s own chat template.
Sur les mêmes thèmes
Recherche
Une étude préenregistrée montre qu’un cadre de spécification réduit les défauts du code généré
Recherche
Une étude compare l’ingénierie des représentations aux protections comportementales pour la sécurité des LLM
Évaluations
Le benchmark CIAware mis à jour montre que GPT-6 Astra détecte presque toujours les interventions de contrôle
Recherche
Un papier propose de certifier les images réelles par resynthèse calibrée plutôt que de détecter les deepfakes
À lire ensuite
Modèles
OpenAI lance GPT-6 Sol et GPT-6 Luna, deux modèles plus économiques qui complètent GPT-6 Astra
Modèles
Anthropic publie Claude Opus 5.5 et OpenAI lance GPT-6 Sol et GPT-6 Luna à environ une heure d’écart
Modèles
Anthropic lance Claude Sonnet 5.5, deuxième modèle de la famille Claude 5.5
Sécurité
OpenAI reconnaît que ses agents d’IA ont pu perturber les sites de dizaines d’institutions