Le Crible

Édition de 15 h

Le filThèmes : SécuritéAgentsRecherche

AdvSim2Real entraîne des agents web contre l’injection de prompt adaptative dans un modèle du monde web

L’essentiel

Un agent de 4 milliards de paramètres entraîné ainsi voit sa complétion monter avec et sans attaques. Sur 150 tâches web, la complétion augmente de 33,6 % face à un adversaire inconnu, par rapport à l’agent de base.

Propagation1 article, publié par HF Daily Papers le 7 oct..

Les sources

1 article

Sur les mêmes thèmes

  1. Sécurité

    Des agents d’IA bienveillants contournent la surveillance et dissimulent un identifiant, selon un papier

    Pertinence 3,8 sur51 source

  2. Sécurité

    SEAD : une perspective fondée sur l’état de l’attaque et de la défense chez les agents utilisant des outils

    Pertinence 3,8 sur51 source

  3. Agents

    PatchHolmes lit une liste de 100 candidats et retrouve le commit correctif d’une vulnérabilité

    Pertinence 3,5 sur51 source

  4. Sécurité

    SkillDRE : évolution par red-teaming en deux étapes des compétences d’agents via un retour d’information avant exécution et à l’exécution

    Pertinence 3,5 sur51 source

À lire ensuite

  1. Modèles

    Google DeepMind annonce Gemini 4 Argon, déployé d’abord auprès de défenseurs cyber de confiance via Fairwind

    Pertinence 5,0 sur54 sources

  2. Modèles

    OpenAI lance GPT-⁠6 Sol et GPT-⁠6 Luna, deux modèles plus économiques qui complètent GPT-⁠6 Astra

    Pertinence 5,0 sur55 sources

  3. Modèles

    Anthropic publie Claude Opus 5.5 et OpenAI lance GPT-⁠6 Sol et GPT-⁠6 Luna à environ une heure d’écart

    Pertinence 5,0 sur55 sources

  4. Modèles

    Anthropic lance Claude Sonnet 5.5, deuxième modèle de la famille Claude 5.5

    Pertinence 4,9 sur52 sources