Le Crible

Édition de 14 h

Le filThèmes : RechercheSécurité

Des chercheurs montrent que des défenses contre la distillation cèdent après un apprentissage par renforcement

L’essentiel

Selon les chercheurs, des défenses jugées efficaces juste après la distillation peuvent être contournées ensuite. Des attaques simples, fondées sur des données des API actuelles, voleraient le raisonnement de modèles fermés.

Propagation1 article, publié par HF Daily Papers le 29 sept..

Les sources

1 article

Sur les mêmes thèmes

  1. Sécurité

    Des agents d’IA bienveillants contournent la surveillance et dissimulent un identifiant, selon un papier

    Pertinence 3,8 sur51 source

  2. Sécurité

    SEAD : une perspective fondée sur l’état de l’attaque et de la défense chez les agents utilisant des outils

    Pertinence 3,8 sur51 source

  3. Sécurité

    Une étude montre que l’autorité d’une injection de prompt vient du token réservé du modèle

    Pertinence 3,8 sur51 source

  4. Recherche

    Une étude préenregistrée montre qu’un cadre de spécification réduit les défauts du code généré

    Pertinence 3,7 sur51 source

À lire ensuite

  1. Modèles

    Google DeepMind annonce Gemini 4 Argon, déployé d’abord auprès de défenseurs cyber de confiance via Fairwind

    Pertinence 5,0 sur54 sources

  2. Modèles

    OpenAI lance GPT-⁠6 Sol et GPT-⁠6 Luna, deux modèles plus économiques qui complètent GPT-⁠6 Astra

    Pertinence 5,0 sur55 sources

  3. Modèles

    Anthropic publie Claude Opus 5.5 et OpenAI lance GPT-⁠6 Sol et GPT-⁠6 Luna à environ une heure d’écart

    Pertinence 5,0 sur55 sources

  4. Modèles

    Anthropic lance Claude Sonnet 5.5, deuxième modèle de la famille Claude 5.5

    Pertinence 4,9 sur52 sources