Le filThèmes : ÉvaluationsAgents
Une couche sémantique solide améliore fortement la précision des analyses par LLM
1 sourcemis à jour il y a 6 jpertinence 3,0 sur5
L’essentiel
La meilleure couche construite par un modèle atteint 91 % de précision, contre 39 % sans couche. L’échec vient surtout de conventions métier cachées, comme les comptes comptés parmi les clients, plus que des calculs.
Propagation1 article, publié par TLDR Data le 1 oct. à 12 h 13.
Les sources
1 article
Aucune source primaire : la page de l’auteur du fait n’est pas parmi les sources.
TLDR DataRelais
lkranz.com
Can Your LLM Vibe Code Your Semantic Layer? (site externe)
Sur les mêmes thèmes
Agents
LangChain intègre un routeur de modèles à son agent open source Open SWE et réduit le coût médian
Évaluations
Microsoft publie ThinkingBox, un benchmark qui note les agents sur l’état final de la base de données
Agents
SkillSeek montre que BM25 rivalise avec la recherche agentique de skills pour les agents
Agents
Weave publie en open source Weave Router 2.0, qui oriente les agents de code vers différents modèles
À lire ensuite
Modèles
Google DeepMind annonce Gemini 4 Argon, déployé d’abord auprès de défenseurs cyber de confiance via Fairwind
Modèles
OpenAI lance GPT-6 Sol et GPT-6 Luna, deux modèles plus économiques qui complètent GPT-6 Astra
Modèles
Anthropic publie Claude Opus 5.5 et OpenAI lance GPT-6 Sol et GPT-6 Luna à environ une heure d’écart
Modèles
Anthropic lance Claude Sonnet 5.5, deuxième modèle de la famille Claude 5.5