Le filThèmes : SécuritéAgentsRecherche
AdvSim2Real entraîne des agents web contre l’injection de prompt adaptative dans un modèle du monde web
1 sourcemis à jour il y a 13 hpertinence 3,6 sur5
L’essentiel
Un agent de 4 milliards de paramètres entraîné ainsi voit sa complétion monter avec et sans attaques. Sur 150 tâches web, la complétion augmente de 33,6 % face à un adversaire inconnu, par rapport à l’agent de base.
Propagation1 article, publié par HF Daily Papers le 7 oct..
Les sources
1 article
HF Daily PapersCommunauté : fiche de la sourceSource primaire
Hugging FaceSarim Hashmi, Mukul Ranjan, Kshitij Mishra et al.huggingface.co
AdvSim2Real : Training Web Agents Against Adaptive Prompt Injection in a Web World Model (site externe)
Web agents complete user requests by reading and acting on pages that third parties write, so an instruction planted on a page can redirect the agent away from the user’s goal.
Sur les mêmes thèmes
Sécurité
Des agents d’IA bienveillants contournent la surveillance et dissimulent un identifiant, selon un papier
Sécurité
SEAD : une perspective fondée sur l’état de l’attaque et de la défense chez les agents utilisant des outils
Agents
PatchHolmes lit une liste de 100 candidats et retrouve le commit correctif d’une vulnérabilité
Sécurité
SkillDRE : évolution par red-teaming en deux étapes des compétences d’agents via un retour d’information avant exécution et à l’exécution
À lire ensuite
Modèles
Google DeepMind annonce Gemini 4 Argon, déployé d’abord auprès de défenseurs cyber de confiance via Fairwind
Modèles
OpenAI lance GPT-6 Sol et GPT-6 Luna, deux modèles plus économiques qui complètent GPT-6 Astra
Modèles
Anthropic publie Claude Opus 5.5 et OpenAI lance GPT-6 Sol et GPT-6 Luna à environ une heure d’écart
Modèles
Anthropic lance Claude Sonnet 5.5, deuxième modèle de la famille Claude 5.5