Le filThèmes : RechercheAgents
InterEvolve fait évoluer à l’inférence des programmes de récompense pour des humanoïdes
1 sourcemis à jour il y a 5 jpertinence 2,4 sur5
L’essentiel
Un agent LLM révise les programmes de récompense et un optimiseur numérique règle leurs constantes, sans réentraînement. Des compétences ainsi obtenues s’exécutent de façon autonome sur un Unitree G1 physique.
Propagation1 article, publié par HF Daily Papers le 2 oct..
Les sources
1 article
HF Daily PapersCommunauté : fiche de la sourceSource primaire
Hugging FaceZhuo Lin, Sirui Xu, Liuyu Bian et al.huggingface.co
InterEvolve: Test-Time Evolution of Reward Programs for Humanoid Loco-Manipulation (site externe)
We study test-time evolution for humanoid loco-manipulation: solving tasks that a controller was never trained for by repurposing its existing skills, improving from its own attempts, and retaining what it learns, without retraining.
Sur les mêmes thèmes
Agents
SkillSeek montre que BM25 rivalise avec la recherche agentique de skills pour les agents
Agents
PUBG Ally, un agent incarné vocal, joue comme coéquipier d’IA dans PUBG : BATTLEGROUNDS
Agents
DAEDALUS construit une mémoire d’agent à partir de tâches que des agents génèrent eux-mêmes
Agents
VeriHarness transforme le LLM d’un générateur en agent vérificateur pour les tâches longues
À lire ensuite
Modèles
Google DeepMind annonce Gemini 4 Argon, déployé d’abord auprès de défenseurs cyber de confiance via Fairwind
Modèles
OpenAI lance GPT-6 Sol et GPT-6 Luna, deux modèles plus économiques qui complètent GPT-6 Astra
Modèles
Anthropic publie Claude Opus 5.5 et OpenAI lance GPT-6 Sol et GPT-6 Luna à environ une heure d’écart
Modèles
Anthropic lance Claude Sonnet 5.5, deuxième modèle de la famille Claude 5.5