Respuestas
¿Qué es un modelo VLA (visión-lenguaje-acción)?
El cambio que trae es económico además de técnico. Con la robótica clásica, cada tarea nueva costaba meses de programación experta; con un VLA, la tarea nueva se enseña con demostraciones y datos, y el mismo modelo generaliza a objetos que nunca vio. Por eso la ventaja competitiva se ha desplazado del cuerpo al cerebro y a los datos de entrenamiento: quien tiene horas de trabajo real grabadas (fábricas, almacenes) entrena mejores modelos que quien solo tiene laboratorio. La cara y la cruz se vieron en 2026: la cara, robots clasificando paquetes casi 40 horas en directo; la cruz, que un modelo que aprende de datos también se degrada cuando los datos cambian, y eso en un robot físico se gestiona con más cuidado todavía.
El ejemplo más documentado en esta casa es Helix de Figure, y el mapa de quién usa qué cerebro está en qué IA usan los robots humanoides. Para distinguir cuándo un robot con VLA es de verdad autónomo y cuándo hay una persona detrás, nuestra guía de teleoperado vs. autónomo.
El contexto completo, en la historia completa.
Fuentes
- Helix: A Vision-Language-Action Model for Generalist Humanoid Control · Figure AI · 2025-02
- Boston Dynamics & Google DeepMind Form New AI Partnership to Bring Foundational Intelligence to Humanoid Robots · Boston Dynamics · 2026-01
- Nvidia and Hugging Face Bring New Models and Frameworks to LeRobot for Open Source Robotics · The AI Insider · 2026-07-07