Le filThèmes : RechercheÉvaluationsModèles
OmniReasoning propose un benchmark et une méthode d’entraînement pour le raisonnement audiovisuel conjoint
1 sourcemis à jour il y a 1 jpertinence 3,0 sur5
L’essentiel
OmniReasoning-30B-A3B atteint 50,0 % sur OmniVideoBench et 42,5 % sur OmniReasoningBench, soit 12,8 et 9,3 points de plus que Qwen3-Omni-30B-A3B-Thinking. Le benchmark compte 1 150 questions.
Propagation1 article, publié par HF Daily Papers le 6 oct..
Les sources
1 article
HF Daily PapersCommunauté : fiche de la sourceSource primaire
Hugging FaceJunming Lin, Yuxuan Wang, Zhenxin Lei et al.huggingface.co
OmniReasoning: Pushing the Limits of Audio-Visual Joint Reasoning (site externe)
Recent advances have enabled unified omni-modal models in understanding audio, vision, and language.
Sur les mêmes thèmes
Évaluations
Des salariés de la tech à San Francisco font conduire une Toyota Corolla par des modèles d’IA sur un parking
Recherche
DN-MOPD normalise le retour de chaque domaine pour fusionner plusieurs spécialistes dans un seul modèle
Recherche
LoHi associe une vidéo dense basse résolution et des images fixes haute résolution pour les vidéos longues
Recherche
Google Research présente Diffusion Controller, un réseau léger pour guider la génération d’images
À lire ensuite
Modèles
Google DeepMind annonce Gemini 4 Argon, déployé d’abord auprès de défenseurs cyber de confiance via Fairwind
Modèles
OpenAI lance GPT-6 Sol et GPT-6 Luna, deux modèles plus économiques qui complètent GPT-6 Astra
Modèles
Anthropic publie Claude Opus 5.5 et OpenAI lance GPT-6 Sol et GPT-6 Luna à environ une heure d’écart
Modèles
Anthropic lance Claude Sonnet 5.5, deuxième modèle de la famille Claude 5.5