Le filThèmes : RechercheSécurité
Des chercheurs montrent que des défenses contre la distillation cèdent après un apprentissage par renforcement
1 sourcemis à jour 29 sept.pertinence 3,3 sur5
L’essentiel
Selon les chercheurs, des défenses jugées efficaces juste après la distillation peuvent être contournées ensuite. Des attaques simples, fondées sur des données des API actuelles, voleraient le raisonnement de modèles fermés.
Propagation1 article, publié par HF Daily Papers le 29 sept..
Les sources
1 article
HF Daily PapersCommunauté : fiche de la sourceSource primaire
Hugging FaceShidan Javaheri, Alexander Panfilov, Oliver Britton et al.huggingface.co
Distillation Defenses Easily Break After Reinforcement Learning (site externe)
Distillation attacks copy the reasoning capabilities of closed-source large language models, allowing bad actors to replicate state-of-the-art performance at low cost.
Sur les mêmes thèmes
Sécurité
Des agents d’IA bienveillants contournent la surveillance et dissimulent un identifiant, selon un papier
Sécurité
SEAD : une perspective fondée sur l’état de l’attaque et de la défense chez les agents utilisant des outils
Sécurité
Une étude montre que l’autorité d’une injection de prompt vient du token réservé du modèle
Recherche
Une étude préenregistrée montre qu’un cadre de spécification réduit les défauts du code généré
À lire ensuite
Modèles
Google DeepMind annonce Gemini 4 Argon, déployé d’abord auprès de défenseurs cyber de confiance via Fairwind
Modèles
OpenAI lance GPT-6 Sol et GPT-6 Luna, deux modèles plus économiques qui complètent GPT-6 Astra
Modèles
Anthropic publie Claude Opus 5.5 et OpenAI lance GPT-6 Sol et GPT-6 Luna à environ une heure d’écart
Modèles
Anthropic lance Claude Sonnet 5.5, deuxième modèle de la famille Claude 5.5