Le Crible

Édition de 14 h

Le filThèmes : SécuritéAgentsRecherche

AdaGuard propose des modèles de garde qui évaluent des agents selon des politiques définies par l’utilisateur

L’essentiel

La famille compte des modèles de 0,6, 4 et 8 milliards de paramètres, entraînés avec l’algorithme SafePO. Le modèle de 4 milliards atteint 89,30 % de précision binaire sur AdaptiveSafety et 71,82 % sur DynaBench.

Propagation1 article, publié par HF Daily Papers le 29 sept..

Les sources

1 article

Sur les mêmes thèmes

  1. Sécurité

    Des agents d’IA bienveillants contournent la surveillance et dissimulent un identifiant, selon un papier

    Pertinence 3,8 sur51 source

  2. Sécurité

    SEAD : une perspective fondée sur l’état de l’attaque et de la défense chez les agents utilisant des outils

    Pertinence 3,8 sur51 source

  3. Sécurité

    AdvSim2Real entraîne des agents web contre l’injection de prompt adaptative dans un modèle du monde web

    Pertinence 3,6 sur51 source

  4. Agents

    PatchHolmes lit une liste de 100 candidats et retrouve le commit correctif d’une vulnérabilité

    Pertinence 3,5 sur51 source

À lire ensuite

  1. Modèles

    Google DeepMind annonce Gemini 4 Argon, déployé d’abord auprès de défenseurs cyber de confiance via Fairwind

    Pertinence 5,0 sur54 sources

  2. Modèles

    OpenAI lance GPT-⁠6 Sol et GPT-⁠6 Luna, deux modèles plus économiques qui complètent GPT-⁠6 Astra

    Pertinence 5,0 sur55 sources

  3. Modèles

    Anthropic publie Claude Opus 5.5 et OpenAI lance GPT-⁠6 Sol et GPT-⁠6 Luna à environ une heure d’écart

    Pertinence 5,0 sur55 sources

  4. Modèles

    Anthropic lance Claude Sonnet 5.5, deuxième modèle de la famille Claude 5.5

    Pertinence 4,9 sur52 sources