Le filThèmes : ÉvaluationsModèles
Une analyse de 43 261 appels à Fable 5 relève un budget de raisonnement très variable sous un même nom
1 sourcemis à jour il y a 2 jpertinence 3,0 sur5
L’essentiel
L’analyse, menée sur six semaines, constate que de nombreux appels n’ont aucune phase de réflexion. Elle avertit que les performances des benchmarks pourraient reposer sur plus de raisonnement séquentiel que celui reçu en production.
Propagation1 article, publié par TLDR Data le 5 oct. à 12 h 13.
Les sources
1 article
Aucune source primaire : la page de l’auteur du fait n’est pas parmi les sources.
TLDR DataRelais
x.com
The Inference Gap (site externe)
A six-week analysis of 43,261 Fable 5 calls found that the model name stayed the same while the delivered reasoning budget varied sharply, with many invocations showing no thinking at all.
Sur les mêmes thèmes
Modèles
Google DeepMind annonce Gemini 4 Argon, déployé d’abord auprès de défenseurs cyber de confiance via Fairwind
Modèles
Anthropic lance Claude Sonnet 5.5, deuxième modèle de la famille Claude 5.5
Modèles
Mistral AI présente Mistral Large 4, disponible en préversion via son API
Modèles
L’Anthropic Frontier Red Team constate que GLM-5.3 réalise des détournements de flux de contrôle complets
À lire ensuite
Modèles
OpenAI lance GPT-6 Sol et GPT-6 Luna, deux modèles plus économiques qui complètent GPT-6 Astra
Modèles
Anthropic publie Claude Opus 5.5 et OpenAI lance GPT-6 Sol et GPT-6 Luna à environ une heure d’écart
Sécurité
OpenAI reconnaît que ses agents d’IA ont pu perturber les sites de dizaines d’institutions
Modèles
Simon Willison couvre en direct la keynote de l’OpenAI DevDay 2026 fort Mason, à San Francisco