Uso de datos sintéticos para acelerar el desarrollo del modelo de percepción de IA para la detección de objetos

/globalassets/oem---flir/product-families/prism-ecosystem/prism-aimmgen/how-to-use-automated-synthetic-data-generation-in-ai-model-development-for-object-detection_article-header.jpg

DESCARGAR VERSIÓN EN PDF

Introducción

El concepto de operaciones (CONOPS) para plataformas aéreas y sistemas autónomos está evolucionando rápidamente. La interferencia de radiofrecuencia (RF) ahora puede interrumpir las comunicaciones y la navegación del sistema satelital de navegación global (GNSS), lo que aumenta la necesidad de detección y seguimiento de objetivos de múltiples clases, autonomía integrada, reconocimiento automático de objetivos basado en el borde y orientación de terminales que pueden funcionar en entornos controvertidos. Para los OEM e integradores de sistemas, este cambio está impulsando la demanda de productos de percepción digital que detecten, clasifiquen y rastreen objetos relevantes para la misión en el borde utilizando cámaras electroópticas (EO) e infrarrojas (IR).

Los detectores de objetos generalizados pueden ser suficientes para muchas aplicaciones de conciencia situacional, pero muchas aplicaciones de defensa requieren una clasificación detallada de objetivos, comportamientos y puntos de mira. Las soluciones de percepción de IA adoptan una oncología similar a la percepción humana después de tres niveles de percepción: detección, reconocimiento e identificación. Cada nivel tiene un píxel en el umbral objetivo, y a menudo es muy difícil recopilar datos de campo que cubran todos los píxeles en los requisitos objetivo para capacitar un modelo de alto rendimiento. El factor limitante son los datos, ya que los datos de imágenes suelen estar aislados entre organizaciones militares, agencias gubernamentales, instituciones de investigación y contratistas de defensa, cada uno con diferentes políticas de acceso y comercialización. Al mismo tiempo, las clases objetivo continúan expandiéndose, y las condiciones del mundo real como camuflaje, falsificación, modalidad de sensor, geometría de visualización y entorno deben estar representadas en los datos de capacitación. Cumplir con estos requisitos exige la generación de datos y la capacitación de modelos en días en lugar de semanas o meses. El OEM de Teledyne FLIR desarrolló AIMMGenÔ para abordar este desafío como una capacidad de generación de datos sintéticos y capacitación de modelos de IA que admite la cartera más amplia de productos digitales Prism.

Conclusiones clave

  • AIMMGen acelera el desarrollo de modelos de objetos al generar grandes volúmenes de datos sintéticos etiquetados de EO, IR y multiespectrales para escenarios ricos en objetivos.
  • La cadena de herramientas reduce la dependencia de conjuntos de datos escasos, costosos o restringidos del mundo real, al tiempo que preserva la capacidad de aumentar los datos medidos cuando están disponibles.
  • La gestión automatizada de metadatos, la curación de conjuntos de datos y la optimización de modelos admiten el desarrollo repetible y rastreable de modelos de percepción específicos de la misión.
  • Como parte del ecosistema de productos digitales Prism, AIMMGen ayuda a convertir datos sintéticos y flujos de trabajo de capacitación en capacidades de percepción digital implementables para plataformas OEM.
  • Los resultados de ejemplo muestran una mejora medible del rendimiento en la detección de aire a tierra y demuestran una capacitación de modelo solo sintético para la clasificación marítima MWIR de grano fino.

Por qué los datos sintéticos importan ahora

El valor estratégico de los datos sintéticos para la capacitación de modelos ya no se limita a cubrir las brechas de datos de capacitación. Se está convirtiendo en una forma práctica de acelerar la detección definida por software y las capacidades de percepción de IA adaptables en campo. A medida que evolucionan los requisitos de la misión, los clientes necesitan modelos que puedan expandirse a nuevas clases de objetivos, validarse a través de modalidades de sensores e implementarse en procesadores integrados sin reiniciar campañas de recopilación y etiquetado de datos de meses de duración.

Para el OEM de Teledyne FLIR, AIMMGen es la base de generación de modelos detrás de esta estrategia de productos digitales. Ayuda a convertir imágenes dispersas, costosas o difíciles de recopilar en modelos de IA validados que admiten aplicaciones Prism para la detección, el seguimiento, el reconocimiento de objetivos y la percepción específica de la misión.

Generación de datos sintéticos y modelos de IA

Los desarrolladores en mercados como la conducción autónoma a menudo tienen acceso a grandes bibliotecas de capacitación. Por el contrario, las organizaciones que desarrollan sistemas de detección militares y específicos para misiones con frecuencia tienen acceso limitado a datos de objetivos representativos. Los datos reales siguen siendo importantes para los clasificadores de precisión, pero los datos sintéticos ofrecen una forma práctica de aumentar los conjuntos de datos medidos o desarrollar clasificadores detallados cuando los datos medidos no están disponibles, están restringidos o son prohibitivamente costosos de recopilar.

AIMMGen (modelado de IA y generación de modelos) de Teledyne FLIR OEM combina la generación automatizada de datos a gran escala, la recuperación inteligente de datos y la optimización del modelo de IA en un solo canal para desarrolladores de algoritmos de reconocimiento automático de objetivos (Automatic Target Recognition, ATR) e integradores de OEM. Dentro del ecosistema de productos digitales Prism, AIMMGen funciona como una fábrica de modelos: ayuda a crear, capacitar, probar y entregar modelos de percepción de IA para aplicaciones de software listas para la misión y módulos de percepción integrados. La cadena de herramientas genera rápidamente datos sintéticos para escenarios del mundo real, incluidos tipos de objetos objetivo, posiciones, orientaciones, modalidades de sensores, configuraciones, trayectorias y estados ambientales. Puede producir millones de imágenes etiquetadas en días, en lugar de las semanas o meses que generalmente se requieren para la recopilación de datos de campo y el etiquetado manual.

AIMMGen genera automáticamente etiquetas para cada imagen y almacena metadatos de colección con el conjunto de imágenes. Para respaldar la capacitación, la validación y la implementación repetible en todos los casos de uso, los metadatos para cada imagen y objetivo se almacenan en un lago de datos para una rápida curación y construcción de conjuntos de datos. Estos metadatos incluyen parámetros de recopilación, información de destino y parámetros de imagen. El marco de capacitación extensible e independiente del modelo de AIMMGen permite la capacitación y optimización a escala de nube en una gama de casos de uso y tareas. Este flujo de trabajo rastreable ayuda a los clientes a comprender no solo cómo funciona un modelo, sino también qué datos, condiciones y suposiciones moldearon su desarrollo.

Desde datos sintéticos hasta percepción digital implementable

El flujo de trabajo de AIMMGen es más valioso cuando se lo considera parte de un proceso de percepción digital integral. La generación de datos sintéticos crea imágenes etiquetadas a escala. La curación de conjuntos de datos y la gestión de metadatos hacen que los datos sean buscables y reutilizables. La capacitación y optimización automatizadas convierten los datos seleccionados en modelos. Las pruebas de validación y rendimiento proporcionan evidencia de que el modelo puede admitir una aplicación en campo. En el ecosistema Prism, estas salidas pueden admitir productos y módulos de software que realizan detección, seguimiento, clasificación, imágenes computacionales y reconocimiento de objetivos en el borde.

Para los clientes OEM, el desafío rara vez es la capacitación de modelos solamente. El objetivo más grande es reducir el riesgo de desarrollo, acortar el tiempo de capacidad y adaptar el software de percepción a medida que cambian los objetivos, sensores, plataformas de implementación y requisitos de misión.

Paso 1: Proceso de generación de datos sintéticos AIMMGen

La primera etapa del proceso AIMMGen es la generación de datos, que comienza con especificaciones para tipos de ubicación, resolución de sensores, tipos de objetos objetivo, condiciones de imágenes, configuraciones de sensores y la cantidad deseada de imágenes. Las combinaciones aleatorizadas de estas especificaciones se crean hasta que el número total de imágenes alcanza o supera el número deseado. El canal de generación de datos utiliza un motor de simulación geoespecífico que incluye terreno preciso para el mundo, establece las condiciones ambientales, inserta objetivos muestreados de más de 20 000 modelos únicos y comienza a recopilar datos. La verdad en tierra se genera automáticamente como metadatos y se almacena junto con metadatos objetivo.

FIGURA 1.  LOS DATOS DE CAPACITACIÓN SINTÉTICA SE GENERAN EN MINUTOS Y A BAJO COSTO.png

Figura 1. Los datos sintéticos de capacitación se generan en minutos y a bajo costo

Los metadatos de imagen, incluido el URI final de cada ubicación de imagen y los metadatos objetivo asociados, se capturan y almacenan en una base de datos de Elasticsearch. Estos metadatos se almacenan en índices separados y se vinculan a través de identificadores únicos, lo que permite a los usuarios visualizar, filtrar y buscar en subconjuntos de datos. Después de la generación, los datos pueden seleccionarse a través de herramientas de visualización para respaldar el diseño de experimentos y el desarrollo de conjuntos de datos.

Paso 2: Capacitación y optimización del modelo AIMMGen

La segunda etapa es la capacitación y optimización automatizada del modelo. Los usuarios especifican conjuntos de datos, características de rendimiento del modelo deseado y métricas de optimización. AIMMGen organiza un grupo de nodos de capacitación de IA para entrenar, evaluar y producir modelos optimizados contra métricas de referencia y definidas por el usuario. Debido a que el marco de capacitación es independiente del modelo, los usuarios pueden crear procesos de datos personalizados y arquitecturas de modelos dentro de AIMMGen. Los modelos de salida se rastrean y almacenan en una base de datos para respaldar la trazabilidad, la reproducibilidad y el refinamiento futuro a medida que evolucionan las misiones o los conjuntos de objetivos del cliente.

FIGURA 2. CAPACITACIÓN AUTOMÁTICA Y OPTIMIZACIÓN.png

Figura 2. Capacitación y optimización automáticas

Métricas de rendimiento de referencia para la optimización del modelo de percepción de IA

En el desarrollo de modelos de percepción de IA, la precisión, el recuerdo y F1-score son métricas clave para evaluar qué tan bien un modelo identifica y clasifica objetos o instancias.

La precisión mide la precisión de las predicciones positivas realizadas por el modelo. Es importante cuando el costo de los falsos positivos es alto. En aplicaciones militares, identificar erróneamente una no amenaza como amenaza podría llevar a acciones innecesarias.

Precisión = verdaderos positivos/(verdaderos positivos + falsos positivos)

Recordar, también conocido como sensibilidad o tasa positiva verdadera, mide la capacidad del modelo para identificar todas las instancias relevantes. Esto es fundamental cuando la falta de una instancia positiva tiene consecuencias graves, como el peligro de no detectar una amenaza real.

Recuerdo = Positivos verdaderos/(Positivos verdaderos + Falsos negativos)

F1-Score proporciona una vista equilibrada del rendimiento del modelo, lo que garantiza que se consideren tanto la precisión como la recuperación. Esta es una buena medida del desempeño general del modelo cuando se trata de conjuntos de datos desequilibrados y es esencial para desarrollar sistemas de percepción sólidos.

F1 - Puntaje = 2 x (Precisión * Recordar)/(Precisión + Recordar)

Aplicaciones y resultados de ejemplo AIMMGen

AIMMGen se ha validado en múltiples dominios de aplicaciones y sensores, incluida la detección de aire a tierra y la clasificación marítima de grano fino.

En un experimento de detección de aire a tierra, el OEM de Teledyne FLIR agregó datos electroópticos sintéticos (EO) e infrarrojos de onda larga (LWIR) a un conjunto de datos de capacitación de detección de objetos que ya incluía datos medidos de EO e IR. Con solo cambios limitados en el esquema de capacitación, los modelos entrenados por AIMMGen lograron una mejora medible en la recuperación. Esto importa operativamente porque las detecciones perdidas pueden ser más consecuentes que los falsos positivos adicionales en muchos flujos de trabajo de vigilancia, focalización y protección de la fuerza. La mejora se refleja en el aumento general en el F1-score.

Tabla 1. Modelos AIMMGen comparados con modelos entrenados solo en realidad

Modelos AIMMGen

Modelo solo real existente

Precisión

0,71 ± 0,01

0.71

Recuerdo

0,52 ± 0,01

0.48

F1-Score

0,60 ± 0,01

0.57


AIMMGen también puede admitir la generación de modelos de IA con pocos o ningún dato de entrenamiento real, como se demuestra en un ejemplo marítimo infrarrojo de onda media (MWIR). La identificación de objetos marítimos de grano fino generalmente requiere conjuntos de datos MWIR costosos con etiquetas detalladas de tipo embarcación. Con datos reales limitados, los modelos solo pueden distinguir entre categorías amplias como “embarcación pequeña” y “embarcación grande”. Sin embargo, mediante el uso de AIMMGen, un modelo se capacitó exclusivamente en datos sintéticos y fue capaz de clasificar subtipos de vasos específicos. El rendimiento se validó en múltiples colecciones del mundo real, incluido el agua dulce y los entornos litorales, lo que demuestra la solidez de la capacitación solo sintética y el potencial de ampliar las clases objetivo cuando las imágenes reales son escasas o difíciles de recopilar.

FIGURA 3 IDENTIFICACIÓN DE GRANO FINO EN MWIR DE RECIPIENTES DE MARÍTIMA CON SYNTHETIC.png

Figura 3: Identificación de grano fino en MWIR de embarcaciones marítimas mediante modelos de IA sintéticos entrenados en datos

Resumen

La creación de conjuntos de datos de capacitación grandes y diversos para aplicaciones de EO, IR y multiespectrales sigue siendo una barrera importante para implementar sistemas de percepción de IA sólidos. AIMMGen aborda esta barrera con imágenes sintéticas, gestión automatizada de metadatos, curación de conjuntos de datos y optimización de modelos. Como parte de la estrategia más amplia de productos digitales Prism de Teledyne FLIR OEM, AIMMGen es más que una cadena de herramientas de generación de datos. Proporciona una base de generación de modelos para desarrollar, validar y expandir las capacidades de percepción de IA específicas de la misión en defensa, autonomía, primeros auxilios y otras aplicaciones OEM.

Para obtener más información sobre la familia de software Prism y los productos digitales OEM de Teledyne FLIR, consulte oem.flir.com/prism.

Artículos relacionados