Los investigadores del MIT han pasado más de una década estudiando técnicas que permiten a los robots encontrar y manipular objetos ocultos “viendo” a través de los obstáculos. El método utiliza señales inalámbricas que penetran en superficies que reflejan elementos ocultos. Los investigadores ahora están aprovechando los modelos de inteligencia artificial generativa para superar un problema de larga data que limita la precisión de enfoques anteriores. El resultado es un nuevo método que produce reconstrucciones de formas más precisas, lo que podría mejorar la capacidad de un robot para agarrar y manipular objetos bloqueados a la vista. Esta nueva técnica construye una reconstrucción parcial de un objeto oculto a partir de señales inalámbricas reflejadas y completa las partes faltantes de su forma utilizando un modelo de IA generativa especialmente entrenado. Los investigadores también introdujeron un sistema ampliado que utiliza IA generativa para reconstruir con precisión una habitación entera, incluidos todos los muebles. El sistema utiliza señales inalámbricas enviadas desde un radar estacionario, que se reflejan en las personas que se mueven en el espacio. Esto supera un desafío clave en muchos métodos existentes, que requieren montar un sensor inalámbrico en un robot móvil para escanear el entorno. Y a diferencia de algunas técnicas populares basadas en cámaras, los métodos preservan la privacidad de las personas en el entorno. Estas innovaciones pueden permitir que los robots de almacén verifiquen los artículos empaquetados antes de enviarlos, eliminando el desperdicio de las devoluciones de productos. También podrían permitir que los robots domésticos inteligentes comprendan la ubicación de una persona en una habitación, mejorando la seguridad y la eficiencia de las interacciones entre humanos y robots. “Lo que hemos hecho ahora es desarrollar modelos generativos de IA que nos ayuden a comprender los reflejos inalámbricos. Esto abre muchas nuevas aplicaciones interesantes, pero técnicamente también supone un crecimiento cualitativo de las capacidades, al poder llenar los vacíos que no podíamos ver antes de que pudiéramos interpretar reflejos y reconstruir escenas completas”, dice Fadel Adib, director asociado del Departamento de Ciencias de la Computación en Señales Eléctricas, profesor de Ciencias Eléctricas. MIT Media Lab y ex autor de dos artículos sobre estas técnicas. “Estamos utilizando la IA para desbloquear finalmente la visión inalámbrica”. La autora principal y asistente de investigación, Laura Dodds, se unió a Adib en el primer artículo; así como los asistentes de investigación Maisy Lam, Waleed Akbar y Yibo Cheng; y en el segundo artículo del autor principal y postdoctorado senior Kaichen Zhou; Dodds; y el asistente de investigación Sayed Saad Afzal. Ambos artículos se presentarán en la Conferencia IEEE sobre Visión por Computadora y Reconocimiento de Patrones. Superar la especularidad El grupo Adib ha demostrado previamente el uso de señales de ondas milimétricas (mmWave) para crear reconstrucciones precisas de objetos 3D ocultos a la vista, como una billetera perdida enterrada bajo una pila. Estas ondas, que son el mismo tipo de señal que se utiliza en Wi-Fi, pueden atravesar obstáculos comunes como paneles de yeso, plástico y cartón, y reflejarse en objetos ocultos. Pero las ondas mm suelen reflejarse de una manera especial, lo que significa que una onda se refleja en una sola dirección después de golpear una superficie. Por lo tanto, grandes porciones de la superficie reflejarán señales lejos del sensor mmWave, haciendo que estas áreas sean efectivamente invisibles. “Cuando queremos reconstruir un objeto, sólo podemos ver la superficie superior y no podemos ver la parte inferior ni los lados”, explicó Dodds. Los investigadores ya han utilizado principios de la física para interpretar las señales reflejadas, pero esto limita la precisión de la forma reconstruida en 3D. En su nuevo artículo, superan esta limitación utilizando un modelo de IA generativa para completar las partes faltantes de una reconstrucción parcial. “Pero el desafío es: ¿cómo se entrenan estos modelos para llenar estos vacíos?” Dijo Adib. Los investigadores suelen utilizar conjuntos de datos muy grandes para entrenar un modelo de IA generativa, que es una de las razones por las que modelos como Claude y Llama muestran un rendimiento tan impresionante. Pero ningún conjunto de datos mmWave es lo suficientemente grande para el entrenamiento. En cambio, los investigadores adaptaron las imágenes de grandes datos de visión por computadora para imitar las propiedades de los reflejos mmWave. “Hemos simulado las propiedades de especularidad y ruido que encontramos en estas reflexiones para poder aplicar los datos existentes en nuestro campo. Se necesitarían varios años para recopilar suficientes datos nuevos para hacer esto”, dijo Lam. Los investigadores integraron la física de los reflejos de ondas milimétricas directamente en estos datos ajustados, creando un conjunto de datos sintéticos utilizado para entrenar un modelo de IA generativa para realizar reconstrucciones de formas plausibles. El sistema completo, llamado Wave-Former, propone una serie de posibles superficies de objetos basadas en reflejos de mmWave, las introduce en el modelo generativo de IA para completar la forma y luego refina las superficies hasta lograr una reconstrucción completa. Wave-Former pudo generar reconstrucciones fieles de aproximadamente 70 objetos por día, como cajas, latas, utensilios y frutas, para aumentar la precisión en casi un 20 por ciento con respecto a la base de referencia de última generación. Los objetos estaban escondidos detrás o debajo de cajas de cartón, madera, paneles de yeso, plástico y tela. ver “fantasma” El equipo utilizó este mismo enfoque para construir un sistema ampliado que reconstruye completamente escenas interiores aprovechando los reflejos mmWave de las personas que se mueven por una habitación. El movimiento humano genera reflejos de múltiples trayectorias. Algunas ondas milimétricas se reflejan en el ser humano, luego se reflejan nuevamente en una pared o en un objeto y luego regresan al sensor, explicó Dodds. Estos reflejos secundarios crean las llamadas “señales fantasma”, que reflejan copias de la señal original que cambian de ubicación cuando una persona se mueve. Estas señales fantasma normalmente se descartan como ruido, pero también contienen información sobre la distribución de la habitación. “Al analizar cómo estos reflejos cambian con el tiempo, podemos comenzar a obtener una comprensión aproximada del entorno que nos rodea. Pero intentar interpretar directamente estas señales tendrá una precisión y resolución limitadas”. Dijo Dodds. Se utilizó un método de entrenamiento similar para enseñar a un modelo de IA generativo a interpretar estas reconstrucciones de escenas aproximadas y comprender el comportamiento de los reflejos de ondas mm de trayectos múltiples. Este modelo llena los vacíos, refinando la reconstrucción inicial hasta completar la escena. Probaron su sistema de reconstrucción de escenas, llamado RISE, utilizando más de 100 trayectorias humanas capturadas por un solo radar mmWave. En promedio, RISE produjo reconstrucciones que fueron aproximadamente el doble de precisas que las técnicas existentes. En el futuro, los investigadores quieren mejorar la granularidad y el detalle de las reconstrucciones. También quieren construir grandes modelos fundamentales para la señalización inalámbrica, como los modelos fundamentales GPT, Claude y Gemini para el lenguaje y la visión, que podrían abrir nuevas aplicaciones. Este trabajo cuenta con el apoyo, en parte, de la National Science Foundation (NSF), el MIT Media Lab y Amazon. Source link Post navigation Netflix está organizando una activación de fans de 3 días en varios lugares de Metro Manila para celebrar BTS THE COMEBACK LIVE | ARIRANG 8 stunning coastal walks in Sydney, Australia