Le filThèmes : ÉvaluationsRechercheOutils dev
AGO AI Quality Gate propose un cadre fondé sur les preuves pour décider des versions de systèmes RAG
1 sourcemis à jour il y a 12 hpertinence 3,2 sur5
L’essentiel
Sur RAGBench, gpt-4.1-nano détecte les réponses non conformes à peine au-dessus du hasard (AUROC 0,603), contre 0,783 pour gpt-4o. Sous régression, la promotion risquée tombe à 22,2-35,1 %, contre 29,3-41,8 % pour un filtre naïf.
Propagation1 article, publié par HF Daily Papers le 7 oct..
Les sources
1 article
HF Daily PapersCommunauté : fiche de la sourceSource primaire
Hugging FaceGiulio Zeloni, Enrico Lo Conte, Salvatore Rionero et al.huggingface.co
AGO AI Quality Gate: Evidence-First Release Decisions for Retrieval-Augmented Generation (site externe)
Enterprises adopting retrieval-augmented generation (RAG) face a recurring operational decision: promote, revise, or block a system version. The evidence is incomplete and the metrics come from fallible LLM judges.
Sur les mêmes thèmes
Évaluations
LangChain intègre un routeur de modèles à son agent open source Open SWE et réduit le coût médian
Évaluations
SkillSeek montre que BM25 rivalise avec la recherche agentique de skills pour les agents
Évaluations
WideSWE mesure la capacité des agents de code à coordonner des modifications entre dépôts
Évaluations
LangChain montre comment associer Jev, modèle de décision de TypeSafe AI, à LangGraph
À lire ensuite
Modèles
Google DeepMind annonce Gemini 4 Argon, déployé d’abord auprès de défenseurs cyber de confiance via Fairwind
Modèles
OpenAI lance GPT-6 Sol et GPT-6 Luna, deux modèles plus économiques qui complètent GPT-6 Astra
Modèles
Anthropic publie Claude Opus 5.5 et OpenAI lance GPT-6 Sol et GPT-6 Luna à environ une heure d’écart
Modèles
Anthropic lance Claude Sonnet 5.5, deuxième modèle de la famille Claude 5.5