Le filThèmes : ÉvaluationsModèlesOpen source
Livenerf lance un benchmark quotidien pour vérifier si Claude Opus 5.5 se dégrade après sa sortie
1 sourcemis à jour 30 sept.pertinence 3,8 sur5
L’essentiel
Le projet indépendant, non affilié à Anthropic, exécute 90 échantillons par jour pendant 30 jours. Après 6 jours, la base de référence est en cours de collecte et aucune conclusion n’est rendue avant le 24 octobre environ.
Propagation1 article, publié par github.com le 30 sept. à 0 h 36.
Les sources
1 article
github.comCommunautéSource primaire
repéré sur Hacker News
Livenerf: Has Opus 5.5 been nerfed yet? (site externe)
Stories liées
Même modèle via Claude Opus 5.5
Simon Willison teste la composition de musique de jeu vidéo avec Claude Opus 5.5
Dans cette story : « I wanted to see if Claude Opus 5.5 could compose music »
Sur les mêmes thèmes
Modèles
Reflection annonce Beam, un modèle MoE américain de 501 milliards de paramètres au total
Modèles
Cloudflare publie Clef-Flash, un modèle multimodal de 9 milliards de paramètres qui produit des décisions
Modèles
Cloudflare publie Clef, un modèle multimodal de 27 milliards de paramètres qui produit des décisions
Modèles
FermionResearch publie Phonon-2, un modèle open source de reconnaissance vocale pour l’anglais
À lire ensuite
Modèles
Anthropic lance Claude Haiku 5.5, son nouveau modèle rapide et peu cher, au même prix que GPT-6 Luna
Modèles
Google DeepMind annonce Gemini 4 Argon, déployé d’abord auprès de défenseurs cyber de confiance via Fairwind
Modèles
OpenAI lance GPT-6 Sol et GPT-6 Luna, deux modèles plus économiques qui complètent GPT-6 Astra
Modèles
Anthropic publie Claude Opus 5.5 et OpenAI lance GPT-6 Sol et GPT-6 Luna à environ une heure d’écart