Más allá de la IA integrada: Optimización del conducto de percepción térmica desde los datos del sensor hasta la implementación en el borde
RESUMEN
Los rápidos avances en el aprendizaje profundo, las imágenes computacionales y los procesadores integrados han hecho posible ejecutar cargas de trabajo de percepción sofisticadas en el borde. Para sistemas térmicos y multiespectrales, el beneficio competitivo va más allá de colocar un modelo de inteligencia artificial (IA) en un procesador integrado. La mayor ventaja proviene de optimizar el proceso de percepción completo, desde el procesamiento de datos de sensores y señales de imágenes hasta la detección de objetos, el seguimiento, la optimización del tiempo de ejecución, la gestión térmica y la implementación en campo, bajo restricciones del mundo real en cuanto a tamaño, peso, potencia, latencia, ancho de banda y condiciones ambientales.
Este documento describe cómo Teledyne FLIR OEM integra el procesamiento térmico y multiespectral de señales de imágenes Prism , bibliotecas de detección y seguimiento específicas de aplicaciones y plataformas modernas de IA integradas para ayudar a los clientes a construir sistemas de imágenes inteligentes que proporcionan información procesable en el punto de detección.
.
ÍNDICE
- Acróynmos
- Introducción
- Avances en modelos livianos y procesadores móviles
- Diseño de una red neuronal para plataformas integradas - Presentamos PeleeTM
- Optimización
- El poder de desarrollo rápido de los procesadores móviles
- Marcos
- Tubería de procesamiento de video
- Funciones de Prism ISP
- Conclusiones
1. Acrónimos
| Acrónimo | Definición |
|---|---|
| ADAS | Sistemas avanzados de asistencia al conductor |
| AGC | Control de ganancia automático |
| IA | Inteligencia artificial |
| BRAZO | Arquitectura avanzada del procesador de máquinas RISC |
| ASIC | Circuito integrado específico de la aplicación |
| ATR | Reconocimiento automático de objetivos |
| CI | Imágenes computacionales |
| CNN | Red neuronal convolucional |
| CPU | Unidad de procesamiento central |
| DSP | Procesador de señales digitales |
| FFB | Bloque de fusión de funciones |
| FPGA | Matriz de puertas programable en campo |
| GPU | Unidad de procesamiento de gráficos |
| HTP | Procesador de tensor hexagonal |
| ILSVRC | Desafío de reconocimiento visual a gran escala ImageNet |
| INT | Formato de precisión de entero, como en INT8 o INT4 |
| IP | Propiedad intelectual |
| IR | Infrarrojo |
| ISR | Inteligencia, vigilancia y reconocimiento |
| ISP | Procesamiento de señal de imagen/procesador de señal de imagen |
| LCE | Mejora del contraste local |
| MSX | Imágenes dinámicas multiespectrales |
| NMS | Supresión no máxima |
| NPU | Unidad de procesamiento neuronal |
| ONNX | Intercambio de redes neuronales abiertas |
| PANet | Red de pirámide de características de agregación de rutas |
| RAM | Memoria de acceso aleatorio |
| RISC | Computadora de conjunto de instrucciones reducidas |
| SDK | Kit de desarrollo de software |
| SLAM | Localización y mapeo simultáneos |
| SoC | Sistema en chip |
| SoM | Sistema en el módulo |
| SSD | Detector de disparo único |
| SWaP | Tamaño, peso y potencia |
| TOPS | billones de operaciones por segundo |
| YOLO | Solo mira una vez |
2. Introducción
Durante la última década, los avances en el aprendizaje profundo han transformado la visión informática de sistemas construidos en torno a la extracción de características artesanales en modelos basados en datos capacitados en grandes conjuntos de datos y optimizados para tareas de percepción especializadas. Este cambio cambió fundamentalmente los desafíos de la detección de objetos: en lugar de diseñar características visuales fijas a mano, los desarrolladores ahora se centran en recopilar datos de capacitación representativos, seleccionar arquitecturas de modelo adecuadas y adaptar redes neuronales cada vez más sofisticadas a condiciones de implementación del mundo real. Como suele suceder en el desarrollo temprano de la tecnología, inicialmente se prestó menos atención a la potencia informática necesaria para capacitar y ejecutar estos modelos.
Esta falta de preocupación limitó la forma en que la nueva tecnología podría utilizarse en sistemas basados en la visión, especialmente en aplicaciones centradas en video donde la necesidad de clasificación de objetos en tiempo real, generación de metadatos y alertas es fundamental. Al mismo tiempo, se estaba librando una carrera de armas en la industria de teléfonos móviles en torno al rendimiento de la cámara. Esto condujo al rápido desarrollo de procesadores de señal de imagen (ISP) altamente avanzados que permitieron un rendimiento de cámara cada vez mejor utilizando algoritmos y lo que ahora se conoce como imágenes computacionales (CI). Más recientemente, la rápida adopción de grandes modelos de lenguaje, modelos de visión-lenguaje e IA multimodal ha aumentado la demanda de procesadores heterogéneos que puedan ejecutar canales de visión tradicionales y cargas de trabajo más nuevas inspiradas en modelos de base más cerca del sensor.
Los procesadores actuales cuentan con arquitecturas heterogéneas con múltiples unidades de procesamiento central (CPU), unidades de procesamiento de gráficos (GPU), procesadores de señales digitales (DSP), unidades de procesamiento neural (NPU) y bloques de cómputo ISP. Además, la comunidad de código abierto ha contribuido con muchos de los componentes básicos utilizados para crear sistemas de percepción, incluidos detectores de objetos de la familia YOLO, modelos de detección basados en transformadores, formatos de archivos independientes de la plataforma como Open Neural Network Exchange (ONNX), marcos de desarrollo como PyTorch y TensorFlow, y tiempos de ejecución de producción como TensorRT, ONNX Runtime, OpenVINO, LiteRT/TensorFlow Lite y kits de desarrollo de software (SDK) específicos de hardware. Se ha convertido en un flujo de trabajo común capacitarse en PyTorch o TensorFlow, exportar a ONNX, optimizar y cuantificar para el tiempo de ejecución objetivo y luego validar la latencia, la potencia, el uso de memoria y la precisión directamente en el hardware implementado.
El OEM de Teledyne FLIR se centra en integrar la percepción y el procesamiento computacional de imágenes o señales de imagen en procesadores optimizados de gran tamaño, peso y potencia (SWaP) para una amplia gama de aplicaciones. Aprovechar los nuevos diseños de silicio fabricados en los nodos más avanzados permite a los desarrolladores de sistemas aumentar la vida útil de la batería y simplificar la gestión térmica del sistema.
Este es el desafío de diseño central para los sistemas térmicos inteligentes. Las técnicas de IA de cámara visible no se pueden transferir simplemente a imágenes térmicas sin tener en cuenta la física del sensor, el contenido de textura más bajo, la variabilidad ambiental, los efectos atmosféricos, el tamaño del objetivo, la óptica, la velocidad de fotogramas, la calibración y los pasos de procesamiento de imágenes que dan forma a lo que ve el detector. En la práctica, el rendimiento de detección y seguimiento depende de toda la cadena: datos sin procesar del sensor, procesamiento radiométrico o no radiométrico, mapeo de tonos, eliminación de ruido, estabilización, superresolución, arquitectura del modelo, cuantificación, mapeo de tiempo de ejecución, ancho de banda de memoria y administración de energía. La ventaja de Teledyne FLIR OEM radica en su capacidad de optimizar en toda esa cadena en lugar de tratar la inferencia de IA como una función independiente.
3. Avances en modelos livianos
y procesadores móviles
Una vez que se reconoció el impacto del aprendizaje profundo en la visión computarizada, comenzó el trabajo en el desarrollo de redes neuronales y modelos que podrían ejecutarse en el borde de la red en procesadores móviles de bajo costo, lo que permitió la detección de objetos para aplicaciones de video en tiempo real, incluido el reconocimiento automático de objetivos (Automatic Target Recognition, ATR), la autonomía del vehículo, los sistemas avanzados de asistencia al conductor (Advanced Driver Assistance Systems, ADAS), la seguridad y para inteligencia, vigilancia y reconocimiento (ISR) terrestres y aéreos. Otros paquetes de software incorporados en productos basados en la visión incluyen localización y mapeo simultáneos (Simultaneous Localization and Mapping, SLAM), prevención de colisiones, fusión de sensores, flujo óptico y seguimiento de objetos. Estas características computacionalmente exigentes, cuando se compilan para una arquitectura de hardware específica, se mapean a través de subsistemas de CPU, GPU, DSP, NPU, ISP y memoria dentro del sistema objetivo en chip (SoC). Administrar esas tareas en procesadores heterogéneos modernos es un desafío de ingeniería significativo, pero permite importantes ventajas de energía, latencia y administración térmica en comparación con las arquitecturas dependientes de la nube. En solo unas pocas generaciones de procesadores, los SoC avanzados se han movido de nodos de clase de 10 nm a diseños de clase de 7 nm, 5 nm y 4 nm, lo que resulta en un rendimiento sustancialmente mejorado por vatio.
Tabla 1: Procesadores y módulos de IA de borde integrado representativos
| PLATAFORMA | NODO DE PROCESO | RENDIMIENTO DE AI | RANGO DE POTENCIA | CASOS DE USO MEJOR AJUSTABLES |
|---|---|---|---|---|
| Kit para superdesarrolladores NVIDIA Jetson Orin Nano | Clase de 8 nm | Hasta 67 TOPS INT8 | 7 W a 25 W configurable | Creación de prototipos, robótica, IA de visión, IA perimetral multimodal y ecosistemas de desarrolladores con soporte CUDA y TensorRT. |
| NVIDIA Jetson AGX Orin | Clase de 8 nm | Hasta 275 TOPS | 15 W a 60 W configurable | Robótica de alto rendimiento, percepción de múltiples cámaras, sistemas autónomos y cargas de trabajo de IA perimetrales más grandes. |
| Qualcomm Dragonwing QCS8550 | 4 nm | Hasta 48 TOPS INT8, según la implementación del módulo | Dependiente de la aplicación | Cámaras inteligentes, drones industriales, robots móviles autónomos, cajas de IA perimetrales y plataformas de IoT de baja potencia altamente integradas. |
| Aceleradores de clase Hailo-8 Hailo-10-class | Dependiente del acelerador | Decenas a cientos de TOPS, según el dispositivo | Clase de acelerador de baja potencia | Aceleración de la visión en cámaras, puertas de enlace, sistemas industriales e implementaciones sensibles a costos o energía. |
El procesamiento de señales de imagen y los algoritmos de detección de objetos de IA son computacionalmente costosos. Por ejemplo, los algoritmos avanzados de eliminación de ruido y superresolución de OEM de Teledyne FLIR realizan hasta 100 000 operaciones por píxel por segundo (aproximadamente 2 billones de operaciones por segundo (TOPS) para una entrada de resolución de 640 x 512 a 60 cuadros por segundo (fps)) y se ejecutan en un núcleo de GPU. La ejecución de modelos de detección de objetos grandes también consume mucha potencia de procesamiento y se ejecuta en el subsistema DSP (Qualcomm®) o GPU (NVIDIA®).
Para los sistemas térmicos, TOPS sin procesar es una métrica útil pero incompleta. El rendimiento real depende de la eficiencia con la que se asigne cada etapa de la tubería al recurso informático adecuado, cuántas veces los datos de video deben moverse a través de la memoria, si la mejora de la imagen mejora o degrada la confianza del detector y si el sistema completo puede mantener las velocidades de fotogramas requeridas sin exceder los límites de energía o térmicos. Por lo tanto, los diseños de IA integrados más eficaces comienzan con el problema de detección y el entorno de implementación, no solo con la especificación del procesador.
Hay muchas variables a considerar al desarrollar e implementar un detector de objetos, incluida la arquitectura del procesador, la precisión deseada, la latencia o velocidad de fotogramas aceptables, el ancho de banda de la memoria, el tiempo de ejecución del software, el tamaño del modelo y el presupuesto de energía/térmico. En respuesta a las demandas de ejecutar detectores de objetos en procesadores integrados, Joseph Redmon desarrolló varias redes neuronales de baja potencia, incluidas You Only Look Once (YOLO) de la Universidad de Washington en 2015 y MobileNet de Google en 2017. Desde entonces, el panorama de detectores se ha ampliado sustancialmente para incluir modelos más nuevos de la familia YOLO, detectores basados en transformadores, arquitecturas sin supresión máxima (NMS) y modelos diseñados para la percepción de múltiples tareas y la detección de vocabulario abierto. Para sistemas térmicos y multiespectrales integrados, la pregunta más importante no es simplemente qué red es la más reciente, sino qué modelo ofrece el rendimiento de detección, la latencia, el consumo de energía y la confiabilidad de integración requeridos en el procesador seleccionado.
YOLO revolucionó la detección de objetos con su enfoque de un solo paso. A diferencia de las redes neuronales convolucionales basadas en regiones (RCNN) que involucran múltiples etapas, como propuestas de región seguidas de clasificación, YOLO logra la detección y localización en una sola pasada directa de la red. Al dividir una imagen de entrada en una cuadrícula y predecir múltiples casillas delimitadoras y probabilidades de clase simultáneamente para cada celda de cuadrícula, el algoritmo YOLO ofrece velocidad y precisión. Los detectores de una etapa utilizan una sola red de alimentación directa para predecir directamente las clases y ubicaciones de objetos. El detector de disparo único (SSD) mejora YOLO en varios aspectos, incluido el uso de múltiples escalas de características para la predicción y el uso de cuadros predeterminados y relaciones de aspecto para ajustar a diferentes formas de objetos. Si bien los enfoques de dos etapas generalmente producen mayor precisión, los enfoques de una etapa a menudo operan con mayor eficiencia. Los detectores más nuevos continúan mejorando este espacio comercial a través de una mejor agregación de características, un diseño consciente de la cuantificación, mecanismos de atención inspirados en transformadores y arquitecturas fáciles de implementar que reducen los gastos generales de posprocesamiento.
4. Diseño de una red neuronal para plataformas integradas - Presentamos Pelee
![]()
Figura 1: Arquitectura del detector de objetos (Juan R. Terven, 2023)
Diseñar la detección de objetos para cámaras térmicas requiere un punto de partida diferente al de seleccionar un modelo de visión de propósito general. Las imágenes térmicas a menudo contienen menos texturas visuales que las imágenes visibles; los objetivos pueden ocupar solo una pequeña cantidad de píxeles; y las condiciones ambientales pueden cambiar el contraste, la forma aparente y el desorden del fondo. Estos factores hacen que sea importante codiseñar el detector con el sensor, la óptica, la tubería de procesamiento de imágenes y el hardware de implementación.
El OEM de Teledyne FLIR amplió el enfoque de paso único con el desarrollo de su red Pelee (patente pendiente). Las redes neuronales convolucionales (CNN) están compuestas por tres bloques principales: el extractor de características o la red troncal; un agregador o cuello de características; y el detector de cabeza u objeto. Pelee cuenta con un nuevo diseño de red troncal que está construido con un patrón de conectividad denso para fomentar la reutilización de características y una capa densa bidireccional para obtener diferentes escalas de campos receptivos. Pelee incorpora un nuevo bloque de fusión de características (FFB) basado en la Red de pirámide de características de agregación de rutas (PANet). Diseñado pensando en la detección de objetivos pequeños, el nuevo FFB adopta una estrategia de fusión tardía, que tiene como objetivo garantizar que cada mapa de características de la salida conserve la información detallada aprendida de las capas superficiales y adquiera características semánticas de alto nivel.
| MARCO | COLUMNA VERTEBRAL | COSTO COMPUTATIVO (FLOP) | ||
|---|---|---|---|---|
| Espina dorsal | Total | Porción de la columna vertebral | ||
| SSD | VGG | 31.9 | 34.2 | 93.3 % |
| RefineDet | VGG | 31.9 | 37.38 | 85.3 % |
| YOLOv3 | DarkNet 53 | 14.51 | 19.54 | 74,2 % |
| RetinaNet | ResNet101 | 15.48 | 34.51 | 53.4 % |
La red troncal afecta directamente la memoria, la velocidad y el rendimiento del detector de objetos. En SSD CNN, más del 90 % del costo de cómputo es consumido por la red troncal. La CNN del OEM de Teledyne FLIR incorpora un nuevo diseño de red troncal que evita el uso de un bloque de compresión y excitación, selecciona cuidadosamente las funciones de activación de acuerdo con el hardware y ajusta el ancho y la profundidad de la red de acuerdo con el hardware.
Por lo tanto, Pelee debe entenderse como una arquitectura de detector orientada a la implementación específica de la aplicación en lugar de como un punto de referencia de uso general ganador frente a cada nueva familia de modelos. Su valor está en el espacio comercial de ingeniería que importa para las cámaras térmicas inteligentes: rendimiento de objetivo pequeño, latencia predecible, eficiencia de memoria, opciones de activación conscientes del hardware y la capacidad de ejecutarse junto con las funciones de ISP de Prism, estabilización de video, seguimiento y otras cargas de trabajo de percepción dentro de un entorno SWaP limitado.
![]()
Figura 2: Rendimiento del modelo basado en la red troncal de colegas
![]()
Figura 3: Comparación de rendimiento de redes entre colegas y YOLO
5. Optimización
Cuantificación
La cuantificación es la compresión de valores de punto flotante en parámetros de red neuronal para mejorar la latencia del modelo, reducir la huella de memoria y reducir el consumo de energía cuando se ejecuta la inferencia. La capacitación sobre modelos generalmente se realiza utilizando datos de punto flotante de 32 bits en potentes sistemas basados en GPU. Luego, la inferencia en procesadores integrados se optimiza mediante FP16, FP8, INT8, INT4 u otras precisiones compatibles con el tiempo de ejecución, según el procesador, la arquitectura del modelo, los datos de calibración y las compensaciones de precisión aceptables.
Teledyne FLIR OEM utiliza INT8 para reducir la huella de memoria, el tiempo de cómputo y el consumo de energía porque sigue siendo un compromiso práctico entre precisión y velocidad para muchas cargas de trabajo de visión integradas. Sin embargo, la implementación ahora depende cada vez más de flujos de trabajo de cuantificación explícitos, datos de calibración representativos, capacitación consciente de la cuantificación cuando sea necesario y generación de motores específicos para el objetivo. Los desarrolladores deben validar las opciones FP16, INT8 y de menor precisión en el hardware real porque el rendimiento, la precisión, el uso de memoria y el comportamiento térmico pueden variar significativamente entre las implementaciones de tiempo de ejecución de GPU, DSP, NPU y específicas del proveedor. Recuperar recursos informáticos les brinda a los desarrolladores la flexibilidad de agregar más capacidades, incluida la inferencia en tiempo real en dos o más transmisiones de cámara.
Poda
La poda es un método utilizado para reducir las rutas de datos no utilizadas en la red neuronal al determinar la importancia de cada unidad y eliminar las rutas pasivas. Después del entrenamiento, muchas de las neuronas de red tienen un valor de peso de 0, por lo que estas neuronas pueden eliminarse a través de un proceso de entrenamiento de red secundario después de la cuantificación. Los métodos actuales de poda incluyen poda de peso, poda de canales y poda de neuronas, cada uno con sus ventajas y desventajas.
Los criterios para determinar la importancia de la unidad pueden afectar la precisión. El uso de métodos de aprendizaje restringidos puede mejorarlo, aunque la implementación es compleja. El método de búsqueda aleatoria de poda es fácil de implementar, pero el rendimiento del modelo de red es limitado en comparación con otros métodos que lo mejoran. Por lo tanto, cada método debe seleccionarse junto con el escenario de aplicación real. No existe un único método que pueda sintetizar la complejidad y modelar la eficiencia de compresión.[i]
Gestión térmica
Para muchas categorías de productos, incluidos drones y miras de armas, el consumo de energía es una restricción crítica del diseño. El alto consumo limita el tiempo operativo, agrega desafíos logísticos de soporte y agrega complejidad y costos para la gestión térmica. Para algunos dispositivos que funcionan con baterías, la opción es utilizar un conjunto de puertas programables en campo (FPGA) o un procesador de circuito integrado específico de la aplicación (ASIC) para mantener la energía al mínimo absoluto, pero el análisis de terceros y el software ISP no están disponibles, ya que estas bibliotecas generalmente se compilan para ejecutarse en procesadores de máquina RISC avanzada (ARM) y otros núcleos que utilizan componentes y marcos de trabajo de código abierto como OpenCV. Si bien este no es el caso de los productos con mayor limitación de potencia, las demandas de potencia de los procesadores integrados de nueva generación fabricados en nodos de 4 nm a 7 nm ofrecen a los diseñadores de sistemas muchas opciones para agregar capacidades de alto valor a los productos.
Para un sistema que ejecuta varias cámaras y varias rutinas de funciones como un detector de objetos, un rastreador de objetivos y una mejora de contraste local, el desarrollador alcanzará el límite superior del rendimiento del procesador y generará mucho calor. Para ayudar a gestionar esto, los desarrolladores de software pueden incorporar parámetros de configuración que se pueden configurar o ajustar dinámicamente. Por ejemplo, para muchas aplicaciones no es necesario hacer inferencia a velocidad de fotogramas. Al reducir la salida de inferencia a 10 fps o menos, el perfil de potencia de toda la pila de software puede gestionarse para ajustarse al presupuesto de potencia.
6. El poder del desarrollo rápido
de procesadores móviles
Ejecutar modelos de CNN y algoritmos de CI es extremadamente exigente desde el punto de vista computacional. Hasta hace poco, los procesadores integrados no tenían el poder de cumplir con las cargas de trabajo de IA y CI. La IA requiere un paralelismo masivo de funciones de acumulación múltiple. Las GPU tradicionales pudieron hacer paralelismo de manera similar para los gráficos, por lo que se reutilizaron para aplicaciones de IA, especialmente para el entrenamiento de modelos. Como resultado, NVIDIA se ha establecido como el jugador dominante en el entrenamiento de modelos.
Los procesadores móviles e integrados actuales son hazañas increíbles de la ingeniería. Por ejemplo, Dragonwing QCS8550 SoC de Qualcomm es un diseño de 4 nm que cuenta con CPU, GPU, DSP, NPU, visión de computación y recursos de ISP dedicados para aplicaciones exigentes de IoT e IA perimetral. El ISP integrado y los recursos de visión artificial admiten funciones como eliminación de ruido de video, estabilización, corrección de imágenes, balance de blancos, procesamiento de colores, control automático de ganancia, enfoque y otras funciones de cámara. Esta clase de chip requiere una enorme inversión en desarrollo y depende de la capacidad avanzada de fundición, las herramientas de software y el soporte del ecosistema a largo plazo.
![]()
Figura 5 - Núcleos del procesador QCS 8550
El OEM de Teledyne FLIR quería crear una plataforma en la que los clientes pudieran construir sus productos y permitiría la creación de pilas de software altamente integradas y minimizar el costo, la latencia y la energía mediante el uso de un único procesador cuando fuera práctico. Este ha sido el objetivo a lo largo de varias generaciones de plataformas, incluida la selección del procesador Intel® MyriadÔ para el módulo de cámara térmica infrarroja (IR) Boson® OEM de Teledyne FLIR. La arquitectura de chip Myriad no pudo satisfacer las necesidades informáticas más pesadas de imágenes computacionales o detectores de objetos basados en CNN. Con la introducción de NVIDIA Xavier, los módulos de la clase NVIDIA Jetson Orin, Qualcomm RB5/QCS5165 y los procesadores de la QCS8550-class, se volvió práctico ejecutar múltiples pilas de software distribuidas entre núcleos de procesadores y aceleradores específicos.
Descripción general del sistema en chip (SoC)
Los procesadores integrados actuales aprovechan lo último en nodos de fundición, lo que permite diseños multinúcleo con memoria unificada. Los proveedores de procesadores ofrecen un soporte de desarrollo muy integral, y los desarrolladores pueden implementar su código en estos procesadores multinúcleo para maximizar el rendimiento mientras cumplen con los presupuestos de energía y térmica.
CPU
La funcionalidad principal de la CPU es obtener instrucciones de la memoria de acceso aleatorio (RAM) y luego decodificar y ejecutar las instrucciones. Las CPU son procesadores generalistas diseñados para ejecutar rutinas que manejan cargas de trabajo secuenciales. Muchas CPU tienen procesadores de vectores integrados para acelerar algunas operaciones (p. ej., NEON en CPU basadas en ARM). Varias de las capacidades de productos digitales de OEM de Teledyne FLIR se ejecutan en núcleos de CPU, incluido el rastreador de video de correlación Prism ISP y la estabilización electrónica de video. Dada la gran cantidad de núcleos de CPU disponibles en los SoC de la generación actual, los desarrolladores tienen una enorme flexibilidad para optimizar el rendimiento y la energía. Las CPU no son adecuadas para tareas que requieren grandes cantidades de operaciones matemáticas por píxel. Las CPU tienen limitaciones de rendimiento y consumen energía relativamente alta por operación.
GPU
Las cargas de trabajo de IA e IC son masivas, y exigen una cantidad significativa de ancho de banda y potencia de procesamiento. Los diseñadores de procesadores han creado potentes arquitecturas de chip que integran memoria, seguridad y conectividad de datos en tiempo real. Las CPU tradicionales generalmente carecen del rendimiento de procesamiento necesario, pero son ideales para realizar tareas secuenciales. Las GPU pueden manejar el paralelismo de las funciones de múltiples acumulados de IA y se pueden aplicar a aplicaciones de IA. De hecho, las GPU pueden servir como aceleradores de IA, lo que mejora el rendimiento para redes neuronales y cargas de trabajo similares. Las GPU pueden tener miles de núcleos de computación y se utilizan para muchas tareas de procesamiento en paralelo. Las GPU son especialmente útiles para modelos de entrenamiento. Sin embargo, las GPU consumen energía significativa y tienen mayores requisitos de memoria en chip. Por este motivo, los procesadores móviles modernos emplean coprocesadores de IA dedicados que utilizan procesadores de señal digital (DSP) para ejecutar la inferencia en el borde.
DSP
Los DSP son subsistemas de SoC especializados y de bajo consumo optimizados para ejecutar operaciones matemáticas. Utilizan palabras de instrucción amplia para ayudar a maximizar el procesamiento por ciclo de reloj. Sin embargo, no son tan fáciles de programar y requieren familiarizarse con las características del hardware DSP, el entorno de programación y la optimización del software DSP para lograr el mejor rendimiento. El procesador tensor (HTP) Qualcomm Hexagon-Tensor Processor es un acelerador de IA adecuado para ejecutar cargas de trabajo de IA computacionalmente intensivas. Para obtener un rendimiento mejorado y ejecutar un modelo de IA en HTP, un modelo debe cuantificarse con una de las precisiónes compatibles: INT4, INT8, INT16 o FP16.
ISP
Debido a que la fotografía digital es la primera línea de la batalla competitiva en la industria de los teléfonos móviles, los proveedores de procesadores móviles incorporan bloques dedicados de propiedad intelectual (IP) de silicio para realizar funciones de mejora de imágenes que incluyen reducción de ruido, corrección de distorsión de lentes, balance de blancos, exposición automática, enfoque automático, desmosaicing y compresión de imágenes. A nivel del sistema, normalmente se necesita sintonización ISP para optimizar los parámetros y varios filtros a un sensor de imagen y lente específicos. El ajuste fino de ISP es una industria en sí misma. Muchos proveedores de SoC ofrecen bibliotecas ISP para sensores de imagen populares, lo que potencialmente ahorra a los desarrolladores de sistemas una inversión significativa.
Hay poca justificación para que los proveedores de procesadores móviles diseñen y fabriquen un ISP de cámara térmica. Aun así, los beneficios del procesamiento de señales de imagen son valiosos, por lo que Teledyne FLIR OEM ha desarrollado un conjunto integral de características ISP que incluyen mapeo de tonos de 16 a 8 bits (control automático de ganancia), eliminación de ruido espacial, superresolución, mitigación de turbulencias y estabilización electrónica de imágenes. La mayoría de estos algoritmos se ejecutan en GPU dadas las importantes demandas de procesamiento.
Memoria
Dadas las altas velocidades de datos en flujos de video digital y el hecho de que los datos pueden leerse repetidamente mediante múltiples algoritmos, la capacidad de memoria y el ancho de banda de memoria son fundamentales para el procesamiento eficiente de la señal. A través de una combinación de velocidades de reloj aumentadas, mayor ancho de banda de memoria, aceleración de IA dedicada y optimización de software mejorada, el modelo de IA existente más grande de Teledyne FLIR OEM (resolución de entrada de 768 x 768 píxeles) se ejecuta en 6 ms en Qualcomm QCS8550 frente a 33 ms en QRB5165. Esto representa un aumento de más de 5X en la velocidad de inferencia y proporciona un margen seguro para lograr la inferencia a velocidad de fotogramas para cámaras de resolución SXGA (1280 x 1024) de próxima generación.
7. Marcos
Los marcos de IA son componentes fundamentales que dan forma a cómo se crean, optimizan e implementan los sistemas inteligentes. Estos marcos, equipados con bibliotecas y funciones prediseñadas, permiten a los desarrolladores crear algoritmos de IA sofisticados sin tener que diseñar cada función desde cero. En los sistemas de IA en el borde de la producción, la discusión del marco ahora se extiende más allá de la capacitación del modelo para incluir formatos de exportación, optimización del tiempo de ejecución, herramientas de cuantificación, compiladores específicos de hardware, pruebas de regresión, estrategias de actualización inalámbrica y monitoreo del rendimiento a nivel de flota.
PyTorch sigue siendo ampliamente utilizado para investigación, experimentación y desarrollo de modelos debido a su flexibilidad y modelo de ejecución fácil de usar. Su gráfico de cómputo dinámico permite a los desarrolladores cambiar el comportamiento de los modelos sobre la marcha y utilizar las operaciones de flujo de control de Python, lo que lo hace muy adecuado para arquitecturas de modelos complejos, prototipos rápidos y experimentación iterativa.
TensorFlow sigue siendo importante en entornos de producción y flujos de trabajo de implementación móvil, especialmente cuando TensorFlow Lite o LiteRT ya están integrados. Sin embargo, la implementación integrada moderna rara vez es una simple opción PyTorch-versus-TensorFlow. Una ruta de producción común es entrenar en PyTorch o TensorFlow, exportar a ONNX u otra representación portátil, optimizar el gráfico, cuantificar el modelo, compilar a un tiempo de ejecución como TensorRT, ONNX Runtime, OpenVINO, LiteRT/TensorFlow Lite o Qualcomm AI Engine Direct y luego validar la latencia, precisión, potencia y comportamiento térmico en el dispositivo objetivo. Por lo tanto, el mejor marco es el que admite el proceso de implementación completo para el procesador y la aplicación seleccionados, no solo el que es más conveniente durante la capacitación.
8. Tubería de procesamiento de video
El proceso de procesamiento de video es donde el enfoque del OEM de Teledyne FLIR se diferencia más. En lugar de tratar la cámara, el ISP, el detector, el rastreador y el procesador integrado como componentes independientes, el ducto está diseñado como un sistema conectado. Cada etapa afecta a la siguiente: la eliminación de ruido cambia la textura del objetivo, la distribución de entrada del modelo de cambios de mejora de contraste, la estabilización mejora la consistencia temporal, la superresolución puede mejorar los detalles efectivos y el seguimiento convierte las detecciones de cuadro por cuadro en información persistente. Optimizar estas interacciones es esencial para una percepción de borde confiable.
Teledyne FLIR OEM desarrolló Prism ISP, una colección de bibliotecas de software de procesamiento de imágenes para imágenes térmicas que incluyen mejora de contraste local (LCE), reducción de ruido espacial y temporal, estabilización electrónica de imágenes, mitigación de turbulencias, superresolución y varias técnicas de fusión de video. Estas funciones mejoran la calidad de la imagen para la interpretación humana y, al mismo tiempo, moldean la información presentada a los algoritmos de detección y seguimiento posteriores. El objetivo es hacer que el video se vea mejor y mejorar la confiabilidad, eficiencia y capacidad de implementación de la tubería de percepción térmica completa, a la vez que se minimizan los requisitos de energía y los costos. Los módulos de cámara térmica de Teledyne FLIR OEM no incluyen procesadores integrados para ejecutar Prism ISP. Con la disponibilidad de procesadores móviles e integrados modernos, ahora es práctico agregar un módulo electrónico accesorio con la potencia para ejecutar algoritmos de ISP, detección y seguimiento a velocidades de fotogramas de video útiles mientras se cumplen las restricciones térmicas y de energía del mundo real.
![]()
Figura 6: Tubería de procesamiento de video Prism
Las imágenes térmicas se utilizan en muchos casos de uso para visualizar objetos: a distancias de metros para inspección y extinción de incendios; a múltiples kilómetros en inteligencia, vigilancia y reconocimiento (ISR); y desde perspectivas aéreas, basadas en torres y a nivel del suelo. La combinación de rango, perspectiva y condiciones ambientales basadas en el día, la noche y el clima crea desafíos de imágenes del mundo real que se pueden mitigar con las funciones del algoritmo Prism ISP.
9. Funciones de Prism ISP
Mitigación de turbulencia
![]()
Figura 7: Comparación sin (izquierda) y con (derecha) mitigación de turbulencia
La turbulencia atmosférica se refiere al movimiento irregular y caótico del fluido o aire caracterizado por fluctuaciones de velocidad, presión y densidad. La turbulencia afecta la transmisión de fotones porque la ganancia solar de la superficie hace que la atmósfera se mezcle. Gira el aire y hace que el vapor de agua, el humo y otras sustancias alteren la refracción de la señal infrarroja. Las técnicas avanzadas eliminan los efectos de distorsión mientras mantienen una buena calidad temporal del elemento de imagen, lo que significa que los objetos en movimiento no se transforman en manchas o estrías indistinguibles. Esto es fundamental cuando se detectan objetivos, incluidas personas y vehículos, mediante IA.
Para la detección y el seguimiento de IA, la mitigación de turbulencias es más que una característica de calidad de imagen. La distorsión, el brillo y el movimiento aparente pueden reducir la confianza del detector y hacer que las pistas sean menos estables. Al mejorar la consistencia temporal antes de la inferencia y el seguimiento, el pipeline puede ofrecer información de objetivos más confiable sin depender únicamente de modelos más grandes o presupuestos de computación más altos.
Los objetivos principales de los algoritmos de mitigación de turbulencias son mejorar la calidad de la señal, reducir el ruido y restaurar la claridad y la estabilidad en condiciones turbulentas. El algoritmo Prism ISP emplea varias técnicas matemáticas y de procesamiento de señales para analizar y procesar los datos afectados por la turbulencia.
- Adquisición de datos: El primer paso es adquirir los datos afectados por la turbulencia. Esto se presenta en forma de marcos de imagen.
- Procesamiento previo: Los datos adquiridos se procesan previamente para eliminar ruidos o artefactos que no están directamente relacionados con la turbulencia. Esto implica técnicas de filtrado, reducción de ruido y calibración para mejorar la calidad de la señal.
- Estimación de turbulencia: Es esencial estimar las características de turbulencia presentes en los datos. Esto implica analizar las propiedades estadísticas de las fluctuaciones e identificar parámetros relevantes, como la intensidad de la turbulencia, la longitud de correlación y las escalas de tiempo.
- Desconvolución o reconstrucción: Las técnicas de deconvolución intentan revertir los efectos borrosos causados por la turbulencia. Los algoritmos de deconvolución a menudo utilizan modelos matemáticos de turbulencia o conocimiento empírico para restaurar la señal original.
- Filtrado adaptativo: Las condiciones de turbulencia pueden variar con el tiempo y el espacio, por lo que muchos algoritmos de mitigación de turbulencias emplean técnicas de filtrado adaptativo. Estos métodos ajustan dinámicamente los parámetros de filtrado en función de los parámetros de turbulencia estimados para optimizar la compensación entre la reducción de ruido y la preservación de las características esenciales de la señal.
- Posprocesamiento: Después de los pasos de mitigación de turbulencias, se puede realizar un posprocesamiento adicional para mejorar aún más la calidad y reducir los artefactos en la salida final. Dependiendo de la aplicación específica, esto puede implicar técnicas como eliminación de ruido, afilado, mejora del contraste o extracción de características.
Súper resolución
![]()
Figura 8: Comparación sin (izquierda) y con (derecha) Superresolución
La superresolución multicuadro es una técnica poderosa que tiene como objetivo reconstruir una imagen de alta resolución a partir de una o más imágenes de baja resolución. La resolución óptica de un sistema está limitada por el límite de difracción establecido por la apertura del sistema y la resolución de muestreo del detector. Una apertura pequeña y un sensor de baja resolución darán como resultado un sistema más barato y pequeño que dará como resultado imágenes de mala calidad con bordes altamente alias y/o borrosos. Esto es especialmente cierto cuando los objetivos de largo alcance se capturan utilizando una óptica de larga distancia focal que escala los efectos de la difracción cuando se combina con un tamaño de apertura finito. Al emplear algoritmos sofisticados, la superresolución reconstruye imágenes de alta resolución utilizando datos de las entradas degradadas. Si bien los métodos tradicionales se han enfocado predominantemente en explotar las correlaciones espaciales inherentes dentro de imágenes de baja resolución, los avances recientes han demostrado la eficacia de aprovechar las técnicas de alias para lograr resultados superiores.
En un canal de percepción, la superresolución también puede afectar el rango de detección, la clasificación de objetivo pequeño y la confianza del operador. El beneficio debe evaluarse a nivel del sistema porque los artefactos de afilado o reconstrucción pueden ayudar a la interpretación visual, pero también pueden cambiar la distribución de entrada vista por un modelo de IA. Esto refuerza la necesidad de ajustar el ISP y la detección juntos en lugar de como funciones aisladas.
Estabilización de imágenes
![]()
Figura 9: Aplicaciones típicas para la estabilización electrónica
Las cámaras a menudo se montan en plataformas móviles como vehículos terrestres, embarcaciones marinas, aeronaves, drones o torres. El movimiento de la plataforma se transfiere directamente a la imagen de video, lo que puede provocar fatiga del espectador y mala calidad de imagen, lo que afecta la conciencia situacional y la fidelidad de la evidencia. La estabilización electrónica elimina la mayor parte de la distorsión de imagen inducida por el movimiento, especialmente cuando se obtienen imágenes a través de una óptica de zoom de campo de visión estrecho utilizada para imágenes de largo alcance.
Para una percepción automatizada, la estabilización mejora la consistencia temporal y puede reducir el inicio de pistas falsas, las detecciones perdidas y la fatiga del operador. También ayuda a los algoritmos descendentes a usar señales de movimiento de manera más efectiva porque el movimiento de la imagen causado por la plataforma se reduce antes de que se realice la detección y el seguimiento.
MSX - Imágenes dinámicas multiespectrales
![]()
Figura 10: MSX graba los bordes visibles en imágenes térmicas en tiempo real
Existen muchos enfoques diferentes para la fusión de imágenes o la combinación de imágenes térmicas y visibles en una sola transmisión de video fusionado. El objetivo es sacar a relucir la información única y valiosa de cada espectro sin requerir la transmisión de dos o más flujos para que los operadores humanos o sistemas posteriores los analicen. Esto puede ser complejo en la práctica debido a la necesidad de un registro de imagen perfecto (alineación) de dos o más canales y problemas debido a los diferentes tiempos de integración para cada sensor.
Teledyne FLIR OEM ha patentado una tecnología única llamada MSX (Imágenes dinámicas multiespectrales). A diferencia de la mezcla de imágenes (mezcla de una luz visible y una imagen térmica), MSX no elimina detalles térmicos ni disminuye la transparencia térmica. En cambio, aplica un filtro de alta frecuencia para extraer detalles visibles nítidos como simbología, incluidos contornos, palabras, números y otros detalles de bordes de alto contraste, y los superpone en la imagen térmica. Esto ayuda a dar definición a la imagen y ha demostrado ser una tecnología beneficiosa en campos como mantenimiento predictivo, seguridad y aplicaciones de ISR aéreas.
AGC – Control automático de ganancia
![]()
Figura 11: Mejora del contraste local (video fuente Boson® 640)
En el contexto de las imágenes, el contraste se refiere a la diferencia de intensidad entre las regiones más brillantes y más oscuras. Juega un papel crucial en la definición del impacto visual general de una imagen. El realce de contraste local, también conocido como estiramiento de contraste local, opera sobre el principio de expandir el rango dinámico de contraste dentro de regiones específicas de una imagen en lugar de alterar globalmente el contraste de toda la imagen.
La mejora del contraste local resalta detalles intrincados, mejora las texturas y acentúa las características. La conversión de datos sin procesar de sensores monocromáticos de 16 bits en la profundidad de color de 8 bits que vemos en las pantallas depende de algoritmos para mapear la amplia distribución de valores de píxeles en 1 de 256 tonos de color o gris. Debido a que la distribución de valores de píxeles en una imagen rara vez es lineal, maximizar el contraste es altamente complejo y dinámico de un escenario a otro. A diferencia del realce de contraste global, que ajusta el contraste en toda la imagen de manera uniforme, el realce de contraste local se centra en preservar los detalles locales y las texturas finas. Se dirige a regiones más pequeñas dentro de la imagen y amplifica el contraste dentro de esas regiones mientras mantiene las relaciones de contraste relativas entre las regiones vecinas.
Para las tuberías de IA, el mapeo de tonos y la mejora del contraste local deben gestionarse cuidadosamente porque dan forma a la entrada numérica al detector. Un ajuste que parezca visualmente agradable puede no siempre maximizar la confianza del modelo, reducir las falsas alarmas o preservar los detalles de objetivo pequeño. El enfoque a nivel de canalización de OEM de Teledyne FLIR permite evaluar estas opciones de procesamiento de imágenes frente a los objetivos finales del sistema de detección, seguimiento y soporte de decisiones confiables dentro del entorno SWaP disponible.
10. Conclusión
Ha habido avances notables en el aprendizaje profundo, procesadores integrados y herramientas de implementación de IA de producción. Para los sistemas térmicos y multiespectrales, estos avances son importantes, pero no son suficientes por sí mismos. El mercado va más allá de la cuestión de si la IA puede funcionar en el borde. La pregunta más importante es si el proceso de percepción completo puede diseñarse para proporcionar información confiable y procesable en el campo, al tiempo que cumple con las exigentes restricciones de SWaP, latencia, ancho de banda y térmicas.
La ventaja de Teledyne FLIR OEM va más allá de simplemente ejecutar IA en procesadores integrados. Es la capacidad de optimizar la línea de percepción térmica completa de datos de sensores, procesamiento de señales de imágenes, diseño de modelos, cuantificación, implementación de tiempo de ejecución, seguimiento, uso de memoria, gestión de energía y solidez ambiental como un sistema integrado. En aplicaciones prácticas en sistemas de defensa, autonomía, robótica, automatización industrial, seguridad y automotrices, la diferenciación provendrá de esta integración de pila completa en lugar de de la selección de TOPS o modelos genéricos solos.
Por lo tanto, la próxima generación de cámaras térmicas inteligentes se definirá por qué tan bien se combinan la física de detección, las imágenes computacionales, la IA integrada y la ingeniería de implementación. Al combinar la experiencia en sensores térmicos, Prism ISP, bibliotecas de detección y seguimiento específicas de aplicaciones y experiencia en la optimización de software en procesadores heterogéneos modernos, Teledyne FLIR OEM ayuda a los clientes a pasar de demostraciones de IA perimetral a sistemas de percepción implementados que funcionan en entornos operativos del mundo real.
[i] https://patentimages.storage.googleapis.com/f5/e3/05/021253fa9a6921/US20220019843A1.pdf
[ii] https://patents.google.com/patent/US20220019843A1/en?oq=17 %2f374909
[iii] Una revisión de la inteligencia artificial en sistemas integrados https://doi.org/10.3390/mi14050897