Le filThèmes : RechercheÉvaluationsModèles
LoHi associe une vidéo dense basse résolution et des images fixes haute résolution pour les vidéos longues
1 sourcemis à jour il y a 1 jpertinence 3,2 sur5
L’essentiel
Ce framework sans entraînement gagne 10,6 points de précision moyenne sur la base en résolution native, à budget de tokens égal. Il réduit la latence de décodage jusqu’à 7 fois sur des vidéos d’une heure.
Propagation1 article, publié par HF Daily Papers le 6 oct..
Les sources
1 article
HF Daily PapersCommunauté : fiche de la sourceSource primaire
Hugging FaceSixun Dong, Wei Li, Andong Deng et al.huggingface.co
Rethinking Long-Video Efficiency: A Joint Allocation Perspective on Frames, Pixels, and Front-End Latency (site externe)
Efficient long-video understanding with vision-language models (VLMs) is often framed as selecting informative frames or visual tokens at a fixed native resolution.
Sur les mêmes thèmes
Évaluations
Des salariés de la tech à San Francisco font conduire une Toyota Corolla par des modèles d’IA sur un parking
Recherche
DN-MOPD normalise le retour de chaque domaine pour fusionner plusieurs spécialistes dans un seul modèle
Recherche
Google Research présente Diffusion Controller, un réseau léger pour guider la génération d’images
Recherche
Une étude montre que les grands modèles de langage favorisent l’anglais américain comme norme par défaut
À lire ensuite
Modèles
Google DeepMind annonce Gemini 4 Argon, déployé d’abord auprès de défenseurs cyber de confiance via Fairwind
Modèles
OpenAI lance GPT-6 Sol et GPT-6 Luna, deux modèles plus économiques qui complètent GPT-6 Astra
Modèles
Anthropic publie Claude Opus 5.5 et OpenAI lance GPT-6 Sol et GPT-6 Luna à environ une heure d’écart
Modèles
Anthropic lance Claude Sonnet 5.5, deuxième modèle de la famille Claude 5.5