Le filThèmes : ÉvaluationsRecherche
Un contexte visuel hors sujet déstabilise les modèles vision-langage utilisés comme juges
1 sourcemis à jour il y a 6 jpertinence 3,2 sur5
L’essentiel
Sur 13 juges testés avec le benchmark MIST, une image alignée change 20,5 % des labels et une image trompeuse 19,4 %. Seuls 37 % des labels qui diffèrent entre les deux images évoluent vers le sens montré.
Propagation1 article, publié par HF Daily Papers le 1 oct..
Les sources
1 article
HF Daily PapersCommunauté : fiche de la sourceSource primaire
Hugging FaceNagham Omar, Mahmoud Jabarin, Kinan Ibraheem et al.huggingface.co
It’s Not What the Image Shows: Irrelevant Context Destabilises VLM Judges Without Informing Them (site externe)
Vision-language models (VLMs) are increasingly used in place of human annotators, making it important that substitutability tests reflect the model rather than incidental evaluation conditions.
Sur les mêmes thèmes
Recherche
NVIDIA affine Nemotron 3 et atteint le niveau or à l’IOI 2026 et à l’IMO 2026
Évaluations
SkillSeek montre que BM25 rivalise avec la recherche agentique de skills pour les agents
Évaluations
VeriHarness transforme le LLM d’un générateur en agent vérificateur pour les tâches longues
Évaluations
Une étude montre que la date cachée dans les prompts système fait varier les évaluations de LLM
À lire ensuite
Modèles
Google DeepMind annonce Gemini 4 Argon, déployé d’abord auprès de défenseurs cyber de confiance via Fairwind
Modèles
OpenAI lance GPT-6 Sol et GPT-6 Luna, deux modèles plus économiques qui complètent GPT-6 Astra
Modèles
Anthropic publie Claude Opus 5.5 et OpenAI lance GPT-6 Sol et GPT-6 Luna à environ une heure d’écart
Modèles
Anthropic lance Claude Sonnet 5.5, deuxième modèle de la famille Claude 5.5