Le filThèmes : ÉvaluationsSécuritéOpen source
KaliBench évalue la traduction du langage naturel en commandes CLI de cybersécurité sur Kali Linux
1 sourcemis à jour il y a 5 jpertinence 3,2 sur5
L’essentiel
Ce benchmark compte 8 504 paires requête-commande. Aucun modèle open-weights testé ne dépasse 42 % de commandes exactes sans restriction. Un modèle de 8 milliards de paramètres entraîné avec lui rivalise avec un modèle de 685 milliards.
Propagation1 article, publié par HF Daily Papers le 2 oct..
Les sources
1 article
HF Daily PapersCommunauté : fiche de la sourceSource primaire
Hugging FacePengfei Li, Naufal Suryanto, Sicheng Zhang et al.huggingface.co
KaliBench: A Fine-Grained Benchmark for Cybersecurity Tool Use on Kali Linux with Runtime-Free Verifiable Rewards (site externe)
LLMs are increasingly applied to cybersecurity workflows, where they are expected to translate analysts' intent into tool invocations.
Sur les mêmes thèmes
Évaluations
Des chercheurs testent Jev, entraîné par RL, comme détecteur d’échecs d’alignement des modèles d’IA
Évaluations
Google DeepMind annonce Gemini 4 Argon, déployé d’abord auprès de défenseurs cyber de confiance via Fairwind
Sécurité
L’Anthropic Frontier Red Team constate que GLM-5.3 réalise des détournements de flux de contrôle complets
Open source
Reflection dévoile Beam, un modèle MoE de 501 milliards de paramètres dont 23 milliards actifs
À lire ensuite
Modèles
OpenAI lance GPT-6 Sol et GPT-6 Luna, deux modèles plus économiques qui complètent GPT-6 Astra
Modèles
Anthropic publie Claude Opus 5.5 et OpenAI lance GPT-6 Sol et GPT-6 Luna à environ une heure d’écart
Modèles
Anthropic lance Claude Sonnet 5.5, deuxième modèle de la famille Claude 5.5
Sécurité
OpenAI reconnaît que ses agents d’IA ont pu perturber les sites de dizaines d’institutions