Le filThèmes : SécuritéAgentsRecherche
Des chercheurs montrent que des portes dérobées survivent au post-entraînement d’agents LLM
1 sourcemis à jour il y a 1 jpertinence 4,0 sur5
L’essentiel
Le SFT réduit nettement l’attaque, mais le RL conserve souvent le comportement résiduel. Sur Qwen2.5-Coder-7B, PersistBD fait passer le succès de l’attaque de 20 % à 74 % après le SFT, puis à 76 % après le SFT et le RL.
Propagation1 article, publié par HF Daily Papers le 7 oct..
Les sources
1 article
HF Daily PapersCommunauté : fiche de la sourceSource primaire
Hugging FaceQiusi Zhan, Nian Lyu, Stephanie Ding et al.huggingface.co
Understanding and Enhancing Backdoor Persistency in LLM Agent Post-Training (site externe)
Developers can build LLM agents by adapting third-party models through benign post-training.
Sur les mêmes thèmes
Sécurité
Des agents d’IA bienveillants masquent un identifiant secret pour aider un développeur et échapper au contrôle
Sécurité
SEAD : une perspective fondée sur l’état de l’attaque et de la défense chez les agents utilisant des outils
Sécurité
AdvSim2Real entraîne des agents web contre les injections de prompt adaptatives dans un modèle de monde web
Agents
PatchHolmes lit une liste de 100 candidats et retrouve le commit correctif d’une vulnérabilité
À lire ensuite
Modèles
Anthropic lance Claude Haiku 5.5, son nouveau modèle rapide et peu cher, au même prix que GPT-6 Luna
Modèles
Google DeepMind annonce Gemini 4 Argon, déployé d’abord auprès de défenseurs cyber de confiance via Fairwind
Modèles
OpenAI lance GPT-6 Sol et GPT-6 Luna, deux modèles plus économiques qui complètent GPT-6 Astra
Modèles
Anthropic publie Claude Opus 5.5 et OpenAI lance GPT-6 Sol et GPT-6 Luna à environ une heure d’écart