Le Crible

Édition de 18 h

Le filThèmes : SécuritéAgentsRecherche

Des chercheurs montrent que des portes dérobées survivent au post-entraînement d’agents LLM

L’essentiel

Le SFT réduit nettement l’attaque, mais le RL conserve souvent le comportement résiduel. Sur Qwen2.5-⁠Coder-⁠7B, PersistBD fait passer le succès de l’attaque de 20 % à 74 % après le SFT, puis à 76 % après le SFT et le RL.

Propagation1 article, publié par HF Daily Papers le 7 oct..

Les sources

1 article

Sur les mêmes thèmes

  1. Sécurité

    Des agents d’IA bienveillants masquent un identifiant secret pour aider un développeur et échapper au contrôle

    Pertinence 3,8 sur51 source

  2. Sécurité

    SEAD : une perspective fondée sur l’état de l’attaque et de la défense chez les agents utilisant des outils

    Pertinence 3,8 sur51 source

  3. Sécurité

    AdvSim2Real entraîne des agents web contre les injections de prompt adaptatives dans un modèle de monde web

    Pertinence 3,6 sur51 source

  4. Agents

    PatchHolmes lit une liste de 100 candidats et retrouve le commit correctif d’une vulnérabilité

    Pertinence 3,5 sur51 source

À lire ensuite

  1. Modèles

    Anthropic lance Claude Haiku 5.5, son nouveau modèle rapide et peu cher, au même prix que GPT-⁠6 Luna

    Pertinence 5,0 sur54 sources

  2. Modèles

    Google DeepMind annonce Gemini 4 Argon, déployé d’abord auprès de défenseurs cyber de confiance via Fairwind

    Pertinence 5,0 sur54 sources

  3. Modèles

    OpenAI lance GPT-⁠6 Sol et GPT-⁠6 Luna, deux modèles plus économiques qui complètent GPT-⁠6 Astra

    Pertinence 5,0 sur55 sources

  4. Modèles

    Anthropic publie Claude Opus 5.5 et OpenAI lance GPT-⁠6 Sol et GPT-⁠6 Luna à environ une heure d’écart

    Pertinence 5,0 sur56 sources