Le filThèmes : AgentsÉvaluationsOpen source
OmniEcho aide des agents incarnés à comprendre l’audio spatial, avec le benchmark OmniEchoBench
1 sourcemis à jour 25 sept.pertinence 3,5 sur5
L’essentiel
OmniEchoBench compte six tâches, 197 scènes audiovisuelles réelles, 2 972 paires question-réponse et 900 échantillons de navigation. OmniEcho, modèle omnimodal, revendique l’état de l’art en perception audiovisuelle spatiale.
Propagation1 article, publié par HF Daily Papers le 25 sept..
Les sources
1 article
HF Daily PapersCommunauté : fiche de la sourceSource primaire
Hugging FaceRuixun Liu, Yuxuan Wang, Jiacheng Xie et al.huggingface.co
OmniEcho: Spatial Audio Understanding for Embodied Agents (site externe)
Humans can effortlessly localize the direction of a sound source and integrate it with visual cues for reasoning, yet this remains challenging for embodied agents.
Sur les mêmes thèmes
Évaluations
Microsoft publie ThinkingBox, un benchmark qui note les agents sur l’état final de la base de données
Agents
Weave publie en open source Weave Router 2.0, qui oriente les agents de code vers différents modèles
Agents
GUI-HARVEST optimise automatiquement le harnais d’agents d’interface graphique sans modifier leur modèle
Agents
Raven, écosystème multi-agents open source, construit et fait évoluer des harnais modulaires
À lire ensuite
Modèles
Google DeepMind annonce Gemini 4 Argon, déployé d’abord auprès de défenseurs cyber de confiance via Fairwind
Modèles
OpenAI lance GPT-6 Sol et GPT-6 Luna, deux modèles plus économiques qui complètent GPT-6 Astra
Modèles
Anthropic publie Claude Opus 5.5 et OpenAI lance GPT-6 Sol et GPT-6 Luna à environ une heure d’écart
Modèles
Anthropic lance Claude Sonnet 5.5, deuxième modèle de la famille Claude 5.5