Le filThèmes : ÉvaluationsOpen sourceModèles
Simon Willison teste en local l’addition de grands nombres en toutes lettres avec Qwen3.8 27B
1 sourcemis à jour il y a 2 jpertinence 3,3 sur5
L’essentiel
Sans raisonnement, le modèle atteint 23,57 % de précision numérique sur 5 070 cas, et 6,44 % pour des opérandes de dix à treize chiffres. Avec raisonnement, il réussit 167 des 169 essais.
Propagation1 article, publié par Simon Willison le 5 oct. à 1 h 34.
Les sources
1 article
Aucune source primaire : la page de l’auteur du fait n’est pas parmi les sources.
Simon WillisonAnalyse : fiche de la source
Simon Willison, développeur indépendant (créateur de Datasette, co-créateur de Django)simonwillison.net
Qwen3.8 27B addition in words (site externe)
A benchmark tested whether the local Qwen3.8-27B-Q4_K_M.gguf model could add positive integers and express exact results solely in English words, using 5,070 reasoning-disabled cases and a paired 169-case comparison with medium reasoning.
Sur les mêmes thèmes
Modèles
Reflection dévoile Beam, un modèle MoE de 501 milliards de paramètres dont 23 milliards actifs
Évaluations
Livenerf lance un benchmark quotidien pour vérifier si Claude Opus 5.5 se dégrade après sa sortie
Modèles
Cloudflare publie Clef-Flash, un modèle multimodal de 9 milliards de paramètres sous licence Apache-2.0
Modèles
Cloudflare publie Clef, un modèle multimodal de 27 milliards de paramètres qui produit des décisions
À lire ensuite
Modèles
Google DeepMind annonce Gemini 4 Argon, déployé d’abord auprès de défenseurs cyber de confiance via Fairwind
Modèles
OpenAI lance GPT-6 Sol et GPT-6 Luna, deux modèles plus économiques qui complètent GPT-6 Astra
Modèles
Anthropic publie Claude Opus 5.5 et OpenAI lance GPT-6 Sol et GPT-6 Luna à environ une heure d’écart
Modèles
Anthropic lance Claude Sonnet 5.5, deuxième modèle de la famille Claude 5.5