Le Crible

Édition de 14 h

Le filThèmes : ÉvaluationsSécuritéOpen source

KaliBench évalue la traduction du langage naturel en commandes CLI de cybersécurité sur Kali Linux

L’essentiel

Ce benchmark compte 8 504 paires requête-commande. Aucun modèle open-weights testé ne dépasse 42 % de commandes exactes sans restriction. Un modèle de 8 milliards de paramètres entraîné avec lui rivalise avec un modèle de 685 milliards.

Propagation1 article, publié par HF Daily Papers le 2 oct..

Les sources

1 article

Sur les mêmes thèmes

  1. Évaluations

    Des chercheurs testent Jev, entraîné par RL, comme détecteur d’échecs d’alignement des modèles d’IA

    Pertinence 3,5 sur51 source

  2. Évaluations

    Google DeepMind annonce Gemini 4 Argon, déployé d’abord auprès de défenseurs cyber de confiance via Fairwind

    Pertinence 5,0 sur54 sources

  3. Sécurité

    L’Anthropic Frontier Red Team constate que GLM-⁠5.3 réalise des détournements de flux de contrôle complets

    Pertinence 4,4 sur52 sources

  4. Open source

    Reflection dévoile Beam, un modèle MoE de 501 milliards de paramètres dont 23 milliards actifs

    Pertinence 4,2 sur51 source

À lire ensuite

  1. Modèles

    OpenAI lance GPT-⁠6 Sol et GPT-⁠6 Luna, deux modèles plus économiques qui complètent GPT-⁠6 Astra

    Pertinence 5,0 sur55 sources

  2. Modèles

    Anthropic publie Claude Opus 5.5 et OpenAI lance GPT-⁠6 Sol et GPT-⁠6 Luna à environ une heure d’écart

    Pertinence 5,0 sur55 sources

  3. Modèles

    Anthropic lance Claude Sonnet 5.5, deuxième modèle de la famille Claude 5.5

    Pertinence 4,9 sur52 sources

  4. Sécurité

    OpenAI reconnaît que ses agents d’IA ont pu perturber les sites de dizaines d’institutions

    Pertinence 4,8 sur54 sources