Robótica e IA física
Cómo los robots están aprendiendo a pedir ayuda
En el mundo en constante evolución de la robótica, una colaboración innovadora entre la Universidad de Princeton y Google (GOOGL ) destaca. Los ingenieros de estas prestigiosas instituciones han desarrollado un método innovador que enseña a los robots una habilidad crucial: reconocer cuándo necesitan ayuda y cómo pedirla. Este desarrollo marca un gran avance en la robótica, cerrando la brecha entre el funcionamiento autónomo y la interacción humano-robot.
El camino hacia robots más inteligentes y independientes siempre ha estado obstaculizado por un desafío significativo: la complejidad y ambigüedad del lenguaje humano. A diferencia de la claridad binaria de los códigos de computadora, el lenguaje humano está lleno de matices y sutilezas, convirtiéndolo en un laberinto para los robots. Por ejemplo, un comando tan simple como “recoger el tazón” puede convertirse en una tarea compleja cuando hay varios tazones presentes. Los robots, equipados para sentir su entorno y responder al lenguaje, a menudo se encuentran en una encrucijada cuando se enfrentan a tales incertidumbres lingüísticas.
Cuantificando la incertidumbre
Abordando este desafío, el equipo de Princeton y Google ha introducido un enfoque novedoso que cuantifica la “nebulosidad” del lenguaje humano. Esta técnica mide esencialmente el nivel de incertidumbre en los comandos del lenguaje y utiliza esta métrica para guiar las acciones del robot. En situaciones donde un comando podría llevar a múltiples interpretaciones, el robot ahora puede evaluar el nivel de incertidumbre y decidir cuándo buscar una aclaración adicional. Por ejemplo, en un entorno con varios tazones, un grado más alto de incertidumbre haría que el robot preguntara qué tazón recoger, evitando así posibles errores o ineficiencias.
Este enfoque no solo dota a los robots de una mejor comprensión del lenguaje, sino que también mejora su seguridad y eficiencia en la ejecución de tareas. Al integrar grandes modelos de lenguaje (LLM) como los que se encuentran detrás de ChatGPT, los investigadores han dado un paso significativo en la alineación de las acciones robóticas con las expectativas y necesidades humanas.
Papel de los grandes modelos de lenguaje
La integración de LLM juega un papel fundamental en este nuevo enfoque. Los LLM son instrumentales en el procesamiento y la interpretación del lenguaje humano. En este contexto, se utilizan para evaluar y medir la incertidumbre presente en los comandos del lenguaje dados a los robots.
Sin embargo, la dependencia de los LLM no está exenta de desafíos. Como señaló el equipo de investigación, las salidas de los LLM pueden ser a veces poco fiables.
Anirudha Majumdar, profesor asistente en Princeton, enfatiza la importancia de este equilibrio:
“Seguir ciegamente los planes generados por un LLM podría hacer que los robots actúen de manera insegura o poco fiable, y por lo tanto necesitamos que nuestros robots basados en LLM sepan cuándo no saben.”
Esto destaca la necesidad de un enfoque matizado, donde los LLM se utilicen como herramientas de orientación en lugar de tomadores de decisiones infalibles.
Aplicación práctica y pruebas
La practicidad de este método se ha probado en varios escenarios, ilustrando su versatilidad y eficacia. Una de estas pruebas involucró un brazo robótico, encargado de clasificar artículos de comida de juguete en diferentes categorías. Este simple escenario demostró la capacidad del robot para navegar tareas con opciones claras de manera efectiva.

Imagen: Universidad de Princeton
La complejidad aumentó significativamente en otro experimento que presentó un brazo robótico montado en una plataforma con ruedas en una cocina de oficina. Aquí, el robot se enfrentó a desafíos del mundo real, como identificar el artículo correcto para colocar en un microondas cuando se presentaban múltiples opciones.
A través de estas pruebas, los robots demostraron con éxito su capacidad para utilizar la incertidumbre cuantificada para tomar decisiones o buscar aclaraciones, validando así la utilidad práctica de este método.
Implicaciones futuras e investigación
Mirando hacia adelante, las implicaciones de esta investigación se extienden mucho más allá de las aplicaciones actuales. El equipo, liderado por Majumdar y el estudiante de posgrado Allen Ren, está explorando cómo este enfoque puede aplicarse a problemas más complejos en la percepción robótica y la inteligencia artificial. Esto incluye escenarios en los que los robots necesitan combinar información visual y lingüística para tomar decisiones, cerrando aún más la brecha entre la comprensión robótica y la interacción humana.
La investigación en curso apunta no solo a mejorar la capacidad de los robots para realizar tareas con mayor precisión, sino también a navegar el mundo con una comprensión similar a la cognición humana. Esta investigación podría allanar el camino para robots que no solo sean más eficientes y seguros, sino también más afinados con las demandas matizadas de los entornos humanos.
Puede encontrar la investigación publicada aquí.












