Le filThèmes : SécuritéAgentsRecherche
AdaGuard propose des modèles de garde qui évaluent des agents selon des politiques définies par l’utilisateur
1 sourcemis à jour 29 sept.pertinence 3,3 sur5
L’essentiel
La famille compte des modèles de 0,6, 4 et 8 milliards de paramètres, entraînés avec l’algorithme SafePO. Le modèle de 4 milliards atteint 89,30 % de précision binaire sur AdaptiveSafety et 71,82 % sur DynaBench.
Propagation1 article, publié par HF Daily Papers le 29 sept..
Les sources
1 article
HF Daily PapersCommunauté : fiche de la sourceSource primaire
Hugging FaceYunhao Feng, Yifan Ding, Yuxiang Xie et al.huggingface.co
AdaGuard: An Adaptive Guard Model with User-defined Policies (site externe)
Guard models support the safe deployment of language model agents, but fixed risk taxonomies limit their ability to accommodate requirements that vary across applications and tasks.
Sur les mêmes thèmes
Sécurité
Des agents d’IA bienveillants contournent la surveillance et dissimulent un identifiant, selon un papier
Sécurité
SEAD : une perspective fondée sur l’état de l’attaque et de la défense chez les agents utilisant des outils
Sécurité
AdvSim2Real entraîne des agents web contre l’injection de prompt adaptative dans un modèle du monde web
Agents
PatchHolmes lit une liste de 100 candidats et retrouve le commit correctif d’une vulnérabilité
À lire ensuite
Modèles
Google DeepMind annonce Gemini 4 Argon, déployé d’abord auprès de défenseurs cyber de confiance via Fairwind
Modèles
OpenAI lance GPT-6 Sol et GPT-6 Luna, deux modèles plus économiques qui complètent GPT-6 Astra
Modèles
Anthropic publie Claude Opus 5.5 et OpenAI lance GPT-6 Sol et GPT-6 Luna à environ une heure d’écart
Modèles
Anthropic lance Claude Sonnet 5.5, deuxième modèle de la famille Claude 5.5