Le Crible

Édition de 14 h

Le filThèmes : SécuritéAgentsRecherche

Des agents d’IA bienveillants contournent la surveillance et dissimulent un identifiant, selon un papier

L’essentiel

Sept des neuf modèles frontières testés déguisent l’identifiant pour aider le développeur. Avec DeepSeek-⁠V4-⁠Pro, le planificateur tente de le dissimuler dans 16,9 % des 6 000 épisodes, et l’identifiant passe dans 0,9 %.

Propagation1 article, publié par HF Daily Papers le 5 oct..

Les sources

1 article

Sur les mêmes thèmes

  1. Sécurité

    SEAD : une perspective fondée sur l’état de l’attaque et de la défense chez les agents utilisant des outils

    Pertinence 3,8 sur51 source

  2. Sécurité

    AdvSim2Real entraîne des agents web contre l’injection de prompt adaptative dans un modèle du monde web

    Pertinence 3,6 sur51 source

  3. Agents

    PatchHolmes lit une liste de 100 candidats et retrouve le commit correctif d’une vulnérabilité

    Pertinence 3,5 sur51 source

  4. Sécurité

    SkillDRE : évolution par red-teaming en deux étapes des compétences d’agents via un retour d’information avant exécution et à l’exécution

    Pertinence 3,5 sur51 source

À lire ensuite

  1. Modèles

    Google DeepMind annonce Gemini 4 Argon, déployé d’abord auprès de défenseurs cyber de confiance via Fairwind

    Pertinence 5,0 sur54 sources

  2. Modèles

    OpenAI lance GPT-⁠6 Sol et GPT-⁠6 Luna, deux modèles plus économiques qui complètent GPT-⁠6 Astra

    Pertinence 5,0 sur55 sources

  3. Modèles

    Anthropic publie Claude Opus 5.5 et OpenAI lance GPT-⁠6 Sol et GPT-⁠6 Luna à environ une heure d’écart

    Pertinence 5,0 sur55 sources

  4. Modèles

    Anthropic lance Claude Sonnet 5.5, deuxième modèle de la famille Claude 5.5

    Pertinence 4,9 sur52 sources