Le Crible

Édition de 14 h

Le filThèmes : RechercheSécurité

Des chercheurs proposent une parade dans l’espace des paramètres au désalignement émergent des LLM

L’essentiel

Leur framework retire des mises à jour des paramètres le sous-espace des gradients nuisibles. Sur Qwen2.5-⁠14B-⁠IT, il supprime jusqu’à 80,0 % du désalignement émergent en génération libre. Le code est disponible.

Propagation1 article, publié par HF Daily Papers le 1 oct..

Les sources

1 article

Sur les mêmes thèmes

  1. Sécurité

    Des agents d’IA bienveillants contournent la surveillance et dissimulent un identifiant, selon un papier

    Pertinence 3,8 sur51 source

  2. Sécurité

    SEAD : une perspective fondée sur l’état de l’attaque et de la défense chez les agents utilisant des outils

    Pertinence 3,8 sur51 source

  3. Sécurité

    Une étude montre que l’autorité d’une injection de prompt vient du token réservé du modèle

    Pertinence 3,8 sur51 source

  4. Recherche

    Une étude préenregistrée montre qu’un cadre de spécification réduit les défauts du code généré

    Pertinence 3,7 sur51 source

À lire ensuite

  1. Modèles

    Google DeepMind annonce Gemini 4 Argon, déployé d’abord auprès de défenseurs cyber de confiance via Fairwind

    Pertinence 5,0 sur54 sources

  2. Modèles

    OpenAI lance GPT-⁠6 Sol et GPT-⁠6 Luna, deux modèles plus économiques qui complètent GPT-⁠6 Astra

    Pertinence 5,0 sur55 sources

  3. Modèles

    Anthropic publie Claude Opus 5.5 et OpenAI lance GPT-⁠6 Sol et GPT-⁠6 Luna à environ une heure d’écart

    Pertinence 5,0 sur55 sources

  4. Modèles

    Anthropic lance Claude Sonnet 5.5, deuxième modèle de la famille Claude 5.5

    Pertinence 4,9 sur52 sources