Un papier réduit le débruitage de modèles vision-langage-action de 10 à 2 étapes pour accélérer l’inférence
1 sourcemis à jour il y a 13 hpertinence 2,5 sur5
L’essentiel
Le temps d’inférence du modèle passe de 61,557 ms à 21,956 ms. Les auteurs évaluent six méthodes d’exécution en temps réel sur une tâche de pliage de vêtements, avec π0.5 comme référence.
Propagation1 article, publié par HF Daily Papers le 7 oct..
Les sources
1 article
HF Daily PapersCommunauté : fiche de la sourceSource primaire
Hugging FaceDi Wu, Rongtian Shen, Ping Liu et al.huggingface.co
Toward Real-Time VLAs: Stage-Aware Two-Step Flow Denoising and System-Level Evaluation (site externe)
Vision-language-action (VLA) models face a timing gap between low-rate inference and high-rate robot execution. We characterize this gap through end-to-end latency measurements of model inference and the robot execution chain.
Sur les mêmes thèmes
Infra
Ai2 publie Olmo-core 3, son framework d’entraînement ouvert pour de grands modèles à mélange d’experts
Infra
SlimWise élague les experts uniquement au décodage pour servir plus efficacement les modèles MoE
Recherche
RayOrch, un moteur distribué, préserve les liens parent-enfant dans la préparation de données d’IA
Infra
TRACE propose un entraînement FP4 par RL pour les modèles MoE, guidé par les rollouts
À lire ensuite
Modèles
Google DeepMind annonce Gemini 4 Argon, déployé d’abord auprès de défenseurs cyber de confiance via Fairwind
Modèles
OpenAI lance GPT-6 Sol et GPT-6 Luna, deux modèles plus économiques qui complètent GPT-6 Astra
Modèles
Anthropic publie Claude Opus 5.5 et OpenAI lance GPT-6 Sol et GPT-6 Luna à environ une heure d’écart
Modèles
Anthropic lance Claude Sonnet 5.5, deuxième modèle de la famille Claude 5.5