데이터 소스에서 더 스마트하게: 센서 내 AI 처리
목차
Sony IMX501: 비전과 지능을 하나의 패키지에
센서 내 AI와 기존 처리 방식 비교
기존 머신 비전 센서는 일반적으로 원시 이미지 데이터를 캡처한 후 처리 및 분석을 위해 PC나 클라우드 서버 같은 외부 시스템에 의존합니다. 이 방식은 크고 복잡한 AI 모델을 지원하고 보다 고급 전처리 및 후처리를 수행할 수 있지만, 많은 사용자에게는 실제 필요 수준을 크게 넘어설 수 있습니다. 또한 추가적인 지연 시간이 발생하고 전력 및 대역폭 요구량이 증가하며 시스템 복잡성과 비용도 크게 높아집니다.
반면 AI 처리를 센서 자체에 직접 통합하면 데이터 처리 효율과 의사결정 속도를 높이는 동시에 호스트 PC 리소스를 다른 작업에 사용할 수 있습니다. 디바이스에서 직접 실행되는 머신러닝 알고리즘은 대량의 이미지 데이터를 중앙 시스템으로 전송할 필요 없이 보다 즉각적인 추론을 가능하게 합니다. 비교적 제한된 처리 리소스를 사용하면서도 이 아키텍처는 다양한 실제 애플리케이션에서 효율적이고 실용적인 성능을 제공해 대부분의 사용자 요구를 충족할 수 있습니다. 그 결과 더 빠른 응답, 낮은 대역폭 사용량, 그리고 더 작고 비용 효율적인 시스템을 구현할 수 있습니다.

적층형 AI 센서 아키텍처
Sony의 IMX501은 이러한 새로운 지능형 센서의 대표적인 예입니다. 12.3 MP(4056 x 3040 px) 해상도의 후면조사형 CMOS 롤링 셔터 센서로, 통합된 합성곱 신경망(CNN) 프로세서를 통해 센서 내 AI 엔진을 제공합니다. 주요 AI 처리 구성 요소는 CNN 입력 이미지 전처리를 위한 ISP, CNN 연산을 수행하는 Digital Signal Processor(DSP) 서브시스템, CNN 가중치와 런타임 데이터를 저장하는 8 MB L2 SRAM으로 구성됩니다. AI 구성 요소는 별도의 다이에 구현되어 상단 다이(픽셀 어레이 센서) 아래에 적층됩니다. 이 적층 아키텍처 덕분에 IMX501의 AI 추론은 센서 패키지 내부에서 완전히 수행되며, 두 다이 사이의 고속 이미지 데이터 전송을 통해 풀 해상도에서 내부적으로 약 30프레임/초의 처리 속도를 지원합니다. 다만 실제 이미지 판독 성능은 센서와 카메라 FPGA 사이의 대역폭에 따라 달라지고, CNN 추론 시간은 AI 모델의 복잡도와 크기에 따라 달라집니다. 전체 처리량은 1GigE 카메라 인터페이스에 의해서도 제한되며, 이미지 출력과 처리에 사용할 수 있는 최대 데이터 전송 속도에 상한이 있습니다.
IMX501의 적층형 센서 다이와 AI 다이는 12.3 MP에서 약 30 fps의 빠른 패키지 내 데이터 전송을 지원합니다. 다만 실제 성능은 센서-FPGA 간 대역폭, AI 모델의 복잡도, 1GigE 인터페이스의 한계에 따라 달라집니다.
| Triton Smart 프레임 레이트(최대 FPS) |
7.9 FPS @ 12.3 MP(객체 검출 + 풀 이미지) 29 FPS(객체 검출 + 4×4 이미지) 8.0 FPS @ 12.3 MP(분류 / 이상 감지 + 풀 이미지) 30 FPS(분류 / 이상 감지 + 4×4 이미지) |
효율적인 AI 추론을 위한 병렬 DSP 코어
AI 처리를 위한 핵심 엔진은 DSP 서브시스템 코어입니다. 이 코어는 High-Computation-Intensity(CI) DSP 코어, Standard-CI DSP 코어, Tensor DMA(TDMA)로 구성됩니다. High-CI DSP와 Standard-CI DSP는 병렬로 동작하면서 신경망 연산을 수행하고 데이터를 TDMA로 직접 이동한 다음 L2 메모리로 전송합니다. 이후 이미지 데이터와 추론 데이터는 MIPI 인터페이스를 통해 카메라의 FPGA로 전송됩니다.
CNN 프로세서에는 High-CI DSP 코어와 Standard-CI DSP 코어가 모두 포함되어 있습니다. 두 DSP 코어에는 여러 개의 Processing Element(PE), Memory-Access Element(ME), 레지스터(RE)가 포함됩니다. 이 아키텍처는 분류, 검출, 이상 감지 모델을 효율적으로 실행하기에 충분한 처리 성능을 제공합니다.

Standard-CI DSP 코어는 범용적이고 불규칙하며 순차적인 작업에 최적화되어 있어 High-CI DSP 코어가 연산 집약적인 작업에 집중할 수 있도록 합니다. Standard-CI 코어는 메모리 액세스 요구가 더 높은 워크로드를 처리하므로 더 많은 Memory Engine(ME)을 통합하고 있습니다.

High-CI DSP 코어는 컨볼루션 및 행렬 연산과 같은 고처리량 작업에 최적화되어 있으며, 데이터를 효율적으로 재사용해 메모리 액세스를 최소화합니다. 이를 위해 더 많은 Processing Element(PE)와 더 큰 레지스터(RE) 저장 용량을 갖추고 있습니다.
이 센서 아키텍처를 통해 IMX501은 전력 효율적인 AI 추론을 수행할 수 있으며, 풀 해상도 처리 시 소비 전력은 약 280 mW에 불과합니다. 모든 추론은 인터넷이나 클라우드 연결 없이 완전히 오프라인으로 실행됩니다. 따라서 외부 의존성과 잠재적인 장애 지점을 줄이기 위해 완전히 독립적이고 외부 네트워크와 분리된 에어갭 네트워크가 필요한 자동화 환경에 적합합니다.
Triton Smart용 오픈 소스 AI 모델 개발
IMX501의 센서 내 AI 기능을 활용하려면 모델을 학습하고 양자화한 뒤, 센서의 AI 프로세서와 메모리 제약에 최적화된 형식으로 변환해야 합니다. LUCID의 Triton Smart 개발 워크플로는 Sony의 오픈 소스 IMX500 Model Zoo를 기반으로 합니다. IMX500 Model Zoo는 IMX500/IMX501 플랫폼용 신경망 모델을 학습하고 양자화하기 위한 샘플 스크립트와 도구 모음입니다. Sony의 Model Zoo에는 이미지 분류, 객체 검출, 이상 감지, 자세 추정, 시맨틱 세그멘테이션 등의 작업을 위한 모델 아키텍처가 포함되어 있습니다.

LUCID는 Triton Smart 호환 모델을 만드는 데 필요한 도구가 포함된 사전 구성 Google Cloud Platform(GCP) 가상 머신을 제공합니다. 이 VM은 IMX500 Model Zoo 학습 샘플과 Docker 기반 환경을 포함한 즉시 사용 가능한 개발 환경을 제공하므로, 개발자는 전체 소프트웨어 툴체인을 수동으로 구성하지 않고도 학습을 시작할 수 있습니다. 예를 들어 LUCID가 제공하는 MobileNetV2 분류 예제로 시작하거나, 샘플 학습 이미지를 자체 데이터 세트로 교체해 사용자 정의 분류 모델을 만들 수 있습니다.
학습 과정에서 모델은 최적화되고 양자화됩니다. 신경망의 수치 정밀도를 낮춤으로써 IMX501에 내장된 AI 하드웨어와 사용 가능한 8 MB 메모리 내에서 효율적으로 동작하도록 합니다. Triton Smart 워크플로는 양자화된 모델을 생성한 뒤 Triton Smart Model Converter에서 처리합니다. Triton Smart Model Converter는 학습된 네트워크를 카메라에 필요한 파일로 변환합니다. 이 파일은 VM에서 호스트 PC로 다운로드한 후 ArenaView MP를 사용해 Triton Smart에 업로드합니다.
이 워크플로를 통해 개발자는 오픈 소스 개발 환경을 사용하면서 데이터 세트, 모델 구성, 학습 프로세스를 보다 폭넓게 제어할 수 있습니다. 배포 후 최적화된 모델은 IMX501에서 직접 추론을 실행하므로 Triton Smart는 클라우드 또는 호스트 기반 추론과 독립적으로 AI 처리를 수행할 수 있습니다.
Triton Smart: 산업 환경을 위한 견고한 엣지 AI
29 x 29 mm
67 g

M12 / M8 커넥터
주변 온도 -20°C~55°C
LUCID의 Triton Smart 카메라는 IMX501을 산업 환경용으로 설계된 작고 가벼운 하우징(67 g, 29 x 29 mm)에 통합합니다. 견고한 2피스 알루미늄 케이스는 밀폐 구조이며 4개의 M2 나사로 단단히 고정됩니다. 또한 견고한 M12 및 M8 커넥터를 사용해 안정적인 Ethernet 및 GPIO 연결을 제공합니다. 먼지나 물기가 있는 환경에서는 옵션으로 제공되는 IP67 등급 렌즈 튜브를 사용해 별도의 인클로저 없이도 추가적인 보호 성능을 확보할 수 있습니다.
-20°C~55°C의 넓은 주변 온도 범위에서 동작하며 충격과 진동을 견디도록 설계된 Triton Smart는 공장 생산 현장, 물류 센터, 옥외 설치 환경에서 장기간 사용할 수 있도록 제작되었습니다.

듀얼 ISP
Triton Smart는 AI 처리와 이미지 처리를 동시에 수행할 수 있는 듀얼 ISP 설계를 채택했습니다. IMX501 센서에 내장된 ISP는 캡처한 이미지를 AI 엔진용 입력 텐서로 전처리합니다. AI 모델마다 입력 텐서 사양이 다르며, 분류는 256 x 256픽셀, 객체 검출은 320 x 320픽셀, 이상 감지는 512 x 512픽셀입니다. 추론이 완료되면 출력 텐서가 생성되며, 두 텐서에는 AI 분석 결과가 포함됩니다.
한편 원시 이미지 데이터는 카메라 FPGA 내의 두 번째 ISP로 전달되어 표준 머신 비전 카메라와 같은 일반적인 이미지 처리를 수행합니다. AI 결과는 청크 데이터로 포함되어 최종 이미지와 결합되며, 시각적 출력과 메타데이터를 하나의 데이터 스트림으로 호스트 PC에 제공합니다. 카메라는 세 가지 출력 옵션을 제공합니다. 일반 이미지, 입력 텐서(AI 엔진으로 전달되는 다운샘플링 이미지), 출력 텐서(추론 결과)입니다. 더 높은 프레임 레이트나 강화된 프라이버시가 필요한 애플리케이션에서는 입력 / 출력 텐서를 수신하면서 일반 이미지를 4 × 4픽셀로 줄일 수 있습니다. 풀 해상도(4056 × 3040 px) 이미지와 AI 추론 결과를 함께 출력할 경우 8.3 FPS를 제공하며, 일반 이미지를 4 × 4픽셀로 줄이면 AI 추론과 함께 최대 30 FPS까지 구현할 수 있습니다.
이 듀얼 패스 아키텍처를 통해 고품질 이미징과 실시간 AI 추론을 병렬로 수행하면서도 게인, 감마, 블랙 레벨, 화이트 밸런스, LUT, CCM, 픽셀 보정, 색조, 채도, 색 공간 변환, ROI와 같은 표준 카메라 이미지 처리 기능을 그대로 사용할 수 있습니다.
실제 적용 분야
AI 추론을 카메라에 직접 통합한 Triton Smart는 낮은 지연 시간, 오프라인 기능, 전력 효율이 중요한 애플리케이션에 적합합니다.
주요 적용 분야:
- 스마트 제조: 인라인 결함 검출, 부품 검증, 예지 정비.
- 리테일 및 스마트 키오스크: 재고 추적, 진열대 분석, 무인 결제 시스템.
- 물류 및 창고: 실시간 패키지 분류, 라벨 판독, 보관함 검증.
- 출입 통제 및 공공 안전: 침입 감지, 인원 계수, 보안 구역 모니터링.
AI를 데이터 소스에 더 가깝게
센서 내 AI 처리는 엣지에서 구현할 수 있는 가능성을 새롭게 정의하고 있습니다. Triton Smart는 고성능 AI 서버를 대체하기 위한 제품은 아니지만, 다양한 산업 및 임베디드 애플리케이션에서 효율성과 처리 능력 사이의 균형을 효과적으로 제공합니다. Sony IMX501을 탑재한 LUCID의 Triton Smart와 같이 센서에서 실시간 의사결정을 수행하는 솔루션은 시스템 복잡성을 줄이고 응답성을 향상시키며 클라우드 또는 호스트 인프라와 독립적으로 동작할 수 있습니다. 여기에 오픈 소스 모델 개발 워크플로를 결합하면 개발자는 센서 내 추론을 위한 AI 모델을 보다 유연하게 학습, 최적화, 배포할 수 있으며, 더 폭넓은 머신 비전 애플리케이션에 지능형 자동화를 적용할 수 있습니다.

