Robótica con IA
Dyna-2 usa un millón de horas de vídeo humano para probar otra vía de escalado del aprendizaje robótico
Dyna Robotics afirma que su modelo de mundo y acción mejora la predicción y el posentrenamiento robóticos al crecer la preformación con vídeo humano de 1.000 a un millón de horas.
Dyna Robotics ha presentado Dyna-2, un modelo de mundo y acción preentrenado con más de un millón de horas de vídeo en primera persona de gente realizando tareas físicas cotidianas. La empresa informa de que aumentar el vídeo humano mejoró las predicciones tanto en ejemplos humanos reservados como en datos robóticos nunca vistos durante el preentrenamiento. Su afirmación central es una ley de escalado de transferencia humana a robots: más experiencia humana en el entrenamiento produjo resultados progresivamente mejores pese a la diferencia de cuerpos.
Los equipos de aprendizaje robótico suelen recopilar datos mediante teleoperación o equipos especializados. Proporcionan valiosas etiquetas de acción, pero cada hora debe grabarse deliberadamente con un robot o dispositivo controlado. La alternativa de Dyna comienza con vídeo egocéntrico de personas cocinando, ordenando, doblando y montando objetos. La empresa creó un proceso de limpieza y extracción de poses de manos que convierte el material apto en trayectorias de muñeca y señales de agarre, y conjuntos anidados de exactamente 1.000, 10.000, 100.000 y un millón de horas, de modo que cada ejecución mayor añadía datos sin sustituir la distribución anterior.
Dyna-2 modela conjuntamente vídeo y acciones futuros mediante una base de difusión de vídeo y una mezcla de transformers. Las entradas de vídeo y acción tienen capas distintas que intercambian información, mientras las instrucciones lingüísticas condicionan el flujo de vídeo. El objetivo de vídeo forma una representación compartida del cambio de escenas y objetos, aunque la política desplegada no necesita generar vídeo futuro antes de actuar. Dyna dice que capas de acción menos profundas conectadas pronto al vídeo mejoraron la latencia en tiempo real sin perder rendimiento en sus pruebas de arquitectura.
En datos humanos reservados, la empresa comunica una mejora monotónica de errores continuos y precisión con umbral al crecer el vídeo. Para estudiar la transferencia, evaluó los mismos puntos de control en 39 tareas de dos plataformas YAM estacionarias de dos brazos. Incluían manejo de telas, nudos, embalaje, limpieza, servicio de comida y montaje. Ningún punto se había entrenado con una trayectoria de esa evaluación robótica. Dyna afirma que todas las métricas se ordenaron monotónicamente con la escala de preentrenamiento humano, con una inflexión entre 10.000 y 100.000 horas.
Los investigadores posentrenaron después los cuatro puntos con los mismos datos robóticos y realizaron pruebas físicas ciegas en 14 tareas y tres cuerpos. El rendimiento medio normalizado pasó del 20% en la menor escala de vídeo al 28%, 45% y 53% al llegar a un millón de horas. El modelo mayor fue el mejor en nueve de 14 tareas. Según la empresa, girar la llave de una caja con cerradura siguió sin resolverse hasta las 100.000 horas, pero alcanzó un 90% de éxito con un millón.
El ejemplo de eficiencia que más claramente conecta vídeo humano y robótica utilizó dos manos de cinco dedos para abrir una tapa de botella. Dyna empleó unos 10 minutos de demostraciones robóticas para el posentrenamiento; el rendimiento subió del 10% con presupuestos pequeños al 40% y después al 50% al crecer el vídeo humano. La recuperación selectiva de bebidas también pasó del 58% al 83%. Son experimentos de la empresa y hará falta replicarlos en otros laboratorios, robots y fuentes antes de considerar universal la relación.
Las comparaciones controladas sugieren que predecir vídeo futuro hace más que añadir volumen. Un objetivo conjunto de vídeo y acción superó al entrenamiento solo de acciones en las 39 tareas sin conexión y en toda escala de datos de acción probada; añadir datos solo de vídeo produjo nuevas mejoras monotónicas en la generalización entre cuerpos. Esto respalda una vía práctica: abundante vídeo humano aportaría conocimiento físico amplio y menos datos específicos adaptarían el modelo a un cuerpo y tarea. Quedan cuestiones sobre derechos de datos, diversidad y calidad de las actividades, rendimiento fuera de las manipulaciones probadas y continuidad de la curva al cambiar modelos, computación y formas robóticas.