Avride ha integrado modelos de lenguaje de visión en sus robots de entrega. Fuente: Avride
Avride Inc. ha construido sus robots de entrega para un alto nivel de autonomía. Cada día, cientos de ellos navegan calles ocupadas por su cuenta, procesando datos complejos de sensores localmente en sus unidades de computación a bordo. Nuestros robots de acera corren con mínima participación humana, manejando fiablemente maniobras urbanas estándar, peatones y semáforos por su cuenta.
Sin embargo, gestionar eficientemente la mecánica de navegación – incluso en condiciones difíciles como caminos estrechos o mal tiempo – es sólo una parte de la ecuación. Asegurar que un robot se comporta adecuadamente en entornos inusuales, sensibles o de alto rendimiento del mundo real requiere un tipo diferente de inteligencia.
Para añadir una capa proactiva de conciencia ambiental, hemos integrado modelos pesados y basados en la nube de visión (VLM) en su sistema como un “VLM-watcher automatizado”.
De la detección de objetos a la comprensión de escena holística
La pila de percepción a bordo de Avride ya es altamente capaz. Usando una combinación de a bordo sensores y redes neuronales locales, nuestras robots de entrega están diseñados para detectar agentes circundantes, incluyendo ciclistas, niños, sillas de ruedas y vehículos de emergencia.
Sin embargo, mientras nuestros modelos a bordo pueden identificar estos elementos individuales, ciertos escenarios del mundo real requieren una capa mucho más profunda de comprensión contextual.
Considere cómo se desarrolla un escenario en una calle de la ciudad. Contender a un oficial de policía o a un bombero en la acera podría insinuar que algo inusual está sucediendo, pero la detección básica de objetos no es suficiente para captar la imagen completa.
Por ejemplo, distinguir a un oficial de policía caminando a casa después de un cambio de una escena del crimen activa y sensible es una tarea altamente no-trivial. Requiere una comprensión holística de cómo interactúan múltiples elementos dentro del marco – interpretando la escena como un escenario completo en lugar de una mera lista de verificación de objetos detectados.
Queremos reducir significativamente la probabilidad de que nuestros robots de entrega ingresen accidentalmente a una zona de emergencia activa, cruzando una escena de crimen en vivo, o rodando en una carretera no cubierta donde el cemento fresco y húmedo parece una acera gris estándar. Mientras que los modelos a bordo capturan las entidades primarias necesarias para navegar, un modelo de base pesado en la nube se destaca en esta interpretación holística, tocando instantáneamente el profundo contexto semántico de toda la situación.
Cómo funciona: VLMs como guardianes de la nube
Es importante aclarar: no utilizamos VLMs para conducir el robot. Utilizar un modelo de nube pesada para dirigir en tiempo real introduciría dependencias de latencia y conectividad que comprometen la seguridad. En cambio, el VLM actúa como un sistema automatizado de alerta temprana para nuestro equipo de asistencia remota.
- Ingestión de datos: Mientras conduce de forma autónoma, el robot transmite una instantánea de sus cámaras a la nube una vez cada pocos segundos. Para proteger la privacidad pública, todos los datos visuales se anónimon automáticamente en el robot, con caras y placas de licencia borrosas localmente, antes de que abandone el computador a bordo.
- Evaluación contextual: En la nube, el relojero VLM procesa los feeds de instantáneas, traduciendo los datos visuales en una descripción semántica de lo que está sucediendo en la calle. Guíamos el modelo usando un aviso detallado que define exactamente qué tipos de situaciones inusuales, sensibles o complejas buscar. El VLM evalúa la escena contra estas instrucciones específicas y asigna etiquetas específicas de alto rendimiento a las escenas.
- Human-in-the-loop: Si el modelo marca una etiqueta situacional crítica, alerta inmediatamente a nuestro equipo de asistencia remota. Un asistente puede entonces revisar la alimentación en vivo para asegurar que el robot se comporta sin problemas, rinde a los trabajadores de emergencia, o se mantiene alejado de zonas restringidas.
Porque… AI paisaje evoluciona a un ritmo de ruptura, no atamos nuestra infraestructura a un solo proveedor. Tratamos esta capa de nube como una arquitectura abierta, plug-and-play – experimentando continuamente, probando y comparando los últimos modelos de vanguardia para asegurarnos de que siempre estamos usando el intérprete semántico más preciso disponible.
Una vista desde las cámaras del robot muestra autonomía con una capa de seguridad extra: El robot rinde autónomamente a los primeros equipos que mueven una camilla. Simultáneamente, el relojero VLM de la nube marca el contexto inusual, trayendo un asistente remoto para monitorear la escena. Fuente: Avride
La evolución de la minería de datos a las operaciones en vivo
La integración de las VLM en vivo Avride‘s operaciones diarias es una evolución natural de nuestras herramientas de ingeniería interna.
Robar y procesar cada minuto de vídeo de cientos de robots que operan cada día es increíblemente caro e innecesario. No queremos salvar todo; sólo queremos preservar datos que nos ayuden genuinamente a mejorar nuestra tecnología y mantener la seguridad.
Históricamente, usamos este oleoducto de análisis directo de 5 segundos exactamente como herramienta de identificación de datos. Cloud VLMs monitoreó los flujos entrantes en tiempo real para extraer automáticamente escenarios raros y valiosos, como las interacciones animales específicas o la infraestructura compleja, que podríamos ahorrar de forma segura como datos previamente anónimos para seguir etiquetando y entrenando.
A medida que el oleoducto resultó ser excepcionalmente preciso al detectar un contexto único del mundo real en vivo, se convirtió en un próximo paso lógico para ampliar esta herramienta en operaciones en vivo. Si el sistema ya es capaz de identificar contextos únicos en tiempo real, podría utilizarse de la misma manera para desencadenar la supervisión humana en vivo.
Integramos esta infraestructura de medición de datos directamente en nuestro oleoducto de producción, creando un puente sin fisuras entre la IA de vanguardia y la asistencia humana.
El camino por delante: Llevando VLMs al borde
Operar estos modelos pesados en la nube es una solución increíblemente eficaz para hoy, pero es sólo el principio. A medida que los VLM se vuelven más compactos a través de técnicas de optimización, y a medida que el hardware robótico a bordo de próxima generación crece más poderoso, nuestro objetivo final es claro.
Eventualmente, esta profunda capa semántica migrará desde la nube directamente sobre el computador del robot a bordo. Esto permitirá a nuestros robots alcanzar un nivel aún más profundo de toma de decisiones autónomas completamente al borde, completamente independiente de conectividad de red.
Hasta entonces, nuestra red de seguridad de la nube-a-remote-assistance garantiza que los robots de entrega de Avride sigan siendo educados, responsables y ciudadanos conscientes en la acera.
Sobre el autor
Roman Nefedov es el jefe de la entrega autónoma en Avride, donde tiene la responsabilidad de extremo a extremo del producto de la entrega autónoma, supervisando tanto las operaciones comerciales globales como el desarrollo de software. Nefedov dirigió previamente el empresa’s delivery robot engineering division, building on over a decade and a half of expertise in the technology sector.
A lo largo de su carrera, se ha centrado en liderar equipos de ingeniería a gran escala y conducir el desarrollo de dispositivos inteligentes y productos de consumo IoT.
El puesto Contexto es el rey: Cómo Avride utiliza VLMs en la nube como una red de seguridad para robots de entrega apareció primero The Robot Report.
Fuente: Leer completo
Somos tu guía de robótica referente en la región.



