Le filThèmes : ÉvaluationsSécuritéOpen source
Des chercheurs testent Jev, entraîné par RL, comme détecteur d’échecs d’alignement des modèles d’IA
1 sourcemis à jour 25 sept.pertinence 3,5 sur5
L’essentiel
Sur RLCDAlignBench (44 benchmarks, cinq modèles cibles), une seule question générique atteint une AUROC médiane de 0,886 sans exemple. Jev coûte 63 fois moins cher que les évaluateurs de type LLM-judge.
Propagation1 article, publié par HF Daily Papers le 25 sept..
Les sources
1 article
HF Daily PapersCommunauté : fiche de la sourceSource primaire
Hugging FaceRuoqi Guo, Yi Liu, Gelei Deng et al.huggingface.co
Just Ask Jev: Reinforcement Learning for Calibrated Decisions as a Zero-Shot Detector of AI Alignment Failures (site externe)
Detectors of alignment failures screen deployed language models and score alignment benchmarks.
Sur les mêmes thèmes
Évaluations
KaliBench évalue la traduction du langage naturel en commandes CLI de cybersécurité sur Kali Linux
Évaluations
Google DeepMind annonce Gemini 4 Argon, déployé d’abord auprès de défenseurs cyber de confiance via Fairwind
Sécurité
L’Anthropic Frontier Red Team constate que GLM-5.3 réalise des détournements de flux de contrôle complets
Open source
Reflection dévoile Beam, un modèle MoE de 501 milliards de paramètres dont 23 milliards actifs
À lire ensuite
Modèles
OpenAI lance GPT-6 Sol et GPT-6 Luna, deux modèles plus économiques qui complètent GPT-6 Astra
Modèles
Anthropic publie Claude Opus 5.5 et OpenAI lance GPT-6 Sol et GPT-6 Luna à environ une heure d’écart
Modèles
Anthropic lance Claude Sonnet 5.5, deuxième modèle de la famille Claude 5.5
Sécurité
OpenAI reconnaît que ses agents d’IA ont pu perturber les sites de dizaines d’institutions