Los investigadores del MIT han desarrollado un enfoque basado en inteligencia artificial generativa para planificar tareas visuales de largo alcance, como la navegación de robots, que es aproximadamente dos veces más eficiente que algunas técnicas existentes. Los métodos utilizan un modelo de visión y lenguaje especializado para visualizar el escenario en una imagen y simular las acciones necesarias para lograr un objetivo. Luego, un segundo modelo traduce estas simulaciones a un lenguaje de programación estándar para problemas de planificación y perfecciona la solución. Al final, el sistema genera automáticamente un conjunto de archivos que se pueden introducir en un software de planificación clásico, que calcula un plan para lograr el objetivo. Este sistema de dos pasos produjo planes con una tasa de éxito promedio de alrededor del 70 por ciento, que superó a los mejores métodos básicos que solo podían lograr alrededor del 30 por ciento. Es importante destacar que el sistema puede resolver nuevos problemas que no había encontrado antes, lo que lo hace muy adecuado para entornos reales donde las condiciones pueden cambiar en cualquier momento. “Nuestro marco combina las ventajas de los modelos de visión y lenguaje, como su capacidad para comprender imágenes y sus sólidas capacidades de planificación en una solución formal”, afirma Yilun Hao, estudiante graduado en aeronáutica y astronáutica (AeroAstro) en el MIT y autor principal de un artículo de acceso abierto sobre esta técnica. “Puede tomar una sola imagen y pasarla a través de una simulación y luego convertirla en un plan confiable a largo plazo que podría ser útil en muchas aplicaciones de la vida real”. Los coautores del artículo son Yongchao Chen, un estudiante de posgrado en el Laboratorio de Sistemas de Información y Decisión (LIDS) del MIT; Chuchu Fan, profesor asociado de AeroAstro e investigador principal de LIDS; y Yang Zhang, científico investigador del Laboratorio de IA Watson del MIT-IBM. El artículo se presentará en la Conferencia Internacional sobre Representaciones del Aprendizaje. Abordar tareas visuales Durante los últimos años, Fan y sus colegas han estado estudiando el uso de modelos generativos de IA para realizar razonamientos y planificación complejos, a menudo utilizando modelos de lenguaje a gran escala (LLM) para procesar texto de entrada. Muchos problemas de planificación del mundo real, como el ensamblaje de robots y la conducción autónoma, tienen información visual que un LLM no puede manejar bien por sí solo. Los investigadores intentaron expandirse al ámbito visual mediante el uso de modelos de visión y lenguaje (VLM), potentes sistemas de inteligencia artificial que pueden procesar imágenes y texto. Pero los VLM tienen dificultades para comprender las relaciones espaciales entre los objetos de una escena y, a menudo, no logran razonar correctamente en varios pasos. Esto dificulta el uso de VLM para la planificación a largo plazo. Por otro lado, los científicos han desarrollado planificadores formales y sólidos que pueden generar planes eficaces a largo plazo para situaciones complejas. Sin embargo, estos sistemas de software no pueden procesar entradas visuales y requieren conocimientos expertos para codificar un problema en un lenguaje que el solucionador pueda entender. Fan y su equipo crearon un sistema de planificación automatizado que aprovecha lo mejor de ambos métodos. El sistema, llamado planificación formal guiada por VLM (VLMFP), utiliza dos VLM especializados que trabajan juntos para convertir problemas de planificación visual en archivos listos para usar para software de planificación formal. Los investigadores entrenaron cuidadosamente un pequeño modelo llamado SimVLM para especializarse en describir el escenario en una imagen usando lenguaje natural y simular una secuencia de acciones en ese escenario. Un modelo más grande, conocido como GenVLM, utiliza la descripción de SimVLM para generar un conjunto inicial de archivos en un lenguaje de planificación formal conocido como Lenguaje de definición de dominio de planificación (PDDL). Los archivos están listos para ingresarse en una solución PDDL clásica, que calcula un plan paso a paso para resolver la tarea. GenVLM compara el resultado del solucionador con el del simulador y refina los archivos PDDL. “El generador y el simulador trabajan juntos para lograr exactamente el mismo resultado, que es una simulación de acción que logra el objetivo”, dijo Hao. Debido a que GenVLM es un gran modelo de IA generativa, vio muchos ejemplos de PDDL durante el entrenamiento y aprendió cómo este lenguaje formal puede resolver una amplia gama de problemas. Este conocimiento existente permite que el modelo genere registros PDDL precisos. Un enfoque flexible VLMFP genera dos archivos PDDL separados. El primero es un archivo de dominio que define el entorno, las acciones válidas y las reglas de dominio. También produce un archivo de problema que define los estados iniciales y los objetivos de un problema particular en cuestión. “Una ventaja de PDDL es que el registro de dominio es el mismo para todas las circunstancias en este entorno. Esto hace que nuestro marco sea bueno para generalizar en casos invisibles bajo el mismo dominio”, explicó Hao. Para permitir que el sistema se generalizara de manera efectiva, los investigadores necesitaban diseñar cuidadosamente los datos de entrenamiento suficientes para SimVLM para que el modelo aprendiera a comprender el problema y el objetivo sin memorizar el modelo del escenario. Cuando se probó, SimVLM describió con éxito el escenario, simuló acciones y detectó si se alcanzó el objetivo en aproximadamente el 85 por ciento de los experimentos. En general, el marco VLMFP logró una tasa de éxito de aproximadamente el 60 por ciento en seis tareas de planificación 2D y más del 80 por ciento en dos tareas 3D, incluida la colaboración multirobot y el ensamblaje robótico. También produjo planes válidos para más del 50 por ciento de escenarios que no había visto antes, superando con creces los métodos básicos. “Nuestro marco se puede generalizar cuando las reglas cambian en diferentes situaciones. Esto le da a nuestro sistema la flexibilidad para resolver muchos tipos de problemas de planificación basados en imágenes”, añadió Fan. En el futuro, los investigadores quieren permitir que VLMFP maneje escenarios más complejos y explore métodos para identificar y mitigar las alucinaciones de los VLM. “A largo plazo, los modelos generativos de IA podrían actuar como agentes y utilizar las herramientas adecuadas para resolver problemas más complejos. Pero, ¿qué significa tener las herramientas adecuadas y cómo incorporamos estas herramientas? Hay un largo camino por recorrer, pero cuando incorporan la planificación basada en imágenes, este trabajo es una pieza importante del rompecabezas”, dijo Fan. Este trabajo fue financiado, en parte, por el MIT-IBM Watson AI Lab. Source link Post navigation 25 FREE Kid-Friendly Things to do in Los Angeles in 2026 Experimente la vida en cada viaje con la nueva tarjeta Toyota Platinum Metrobank