사상 리더

보이지 않는 왜곡: ADAS 카메라 시스템이 현장에서 실패하는 이유와 물리 기반 ML이 이를 바꾸는 방법

mm
Unite.AI를 Google의 선호 소스에 추가

제가 하는 일은 안경을 쓰기 전에 안경이 시야를 어떻게 왜곡할지를 예측하는 것과 같습니다 — 단, 잘못될 경우의 결과는 두통이 아니라 110km/h에서 발생한 비상 제동 실패 사건입니다.

디자인 검증(DV) 사이클이 진행 중 늦은 시점에 결함이 나타났습니다 — ADAS 전방 카메라에서 발생한 심각한 방사형 및 접선 렌즈 왜곡으로, 공급업체와 광학 조립 공차가 확정된 후에야 발견되었습니다. 해결을 위해서는 이미지 센서와 렌즈 마운트 사이의 오프셋을 수동으로 조정하고, MTF와 그리드 왜곡 테스트를 다시 수행하며, 후기 단계 DV 실패에 뒤따르는 연쇄적인 프로그램 마일스톤 위험을 관리해야 했습니다. 근본 원인은 단순한 제조 결함이나 설계 오류가 아니라, 보다 구조적인 문제였습니다: 카메라 왜곡 특성화는 완전히 사후 대응식이었습니다. 실제 프로토타입이 존재할 때쯤에는 광학 스택을 저렴하게 수정하기에는 너무 늦었습니다.

그 사건은 저를 직접 머신러닝 분야로 이끌었습니다. 렌즈가 제조되기 전에 광학 설계 파라미터만으로 GAN으로 합성된 왜곡 맵을 학습한 CNN이 배럴, 핀쿠션, 그리고 머스타시 왜곡 위험을 감지할 수 있다면, DV에서의 갑작스러운 결함을 완전히 없앨 수 있습니다. 이것이 제가 지난 몇 년간 구축해 온 문제이며, 물리 시뮬레이션과 AI를 활용해 열 및 기계적 스트레스가 차량 운용 수명 동안 카메라 광학을 어떻게 변형시키는지 예측함으로써, 실패를 생산 단계가 아니라 개념 단계에서 수정하도록 하는 것입니다.

다음 내용은 제가 배운 것들 — 아키텍처, 데이터, 실패 모드, 그리고 이 산업이 AI에 대해 이야기하는 방식과 실제 생산 시스템에서 AI가 행동하는 방식 사이의 격차에 관한 것입니다.

아키텍처: 하드웨어와 ML의 결합

제가 가장 깊이 이해하고 있는 시스템은 여러 OEM 프로그램에 적용된 ADAS 전방 카메라 플랫폼으로, 광학 조립의 물리와 인식 ML 파이프라인의 성능이 불가분하게 연결된 안전 핵심 모듈입니다.

하드웨어 스택은 정밀 기계 하우징을 통해 CMOS 이미지 센서에 장착된 다중 요소 렌즈 배럴(시야(FOV) 변형에 따라 6~8 요소 설계)로 시작합니다. 주 광선 각도 매칭렌즈 출구 동공과 이미지 센서 마이크로렌즈 어레이 사이의 주 광선 각도 매칭은 핵심 정렬 제약 조건이며, 불일치는 코너 섀딩 및 필드 의존적 왜곡의 주요 원인입니다. 이미지 센서는 원시 Bayer 패턴 프레임을 ISP로 전달하여 디모자이킹, 노이즈 감소 및 렌즈 섀딩 보정을 수행한 뒤 인식 SoC에 전달합니다.

ML 왜곡 탐지 파이프라인은 물리적 프로토타이핑 이전 단계에 위치합니다. 데이터 흐름:

  • 합성 광학 파라미터 공간(렌즈 곡률 반경, 요소 간격 공차, 이미지 센서 기울기 각도, 주 광선 각도 편차)
  • 물리 조건부 U-Net 생성기를 갖춘 cGAN이 실제와 같은 왜곡 프레임을 합성 전체 시야(FOV) 전역에 걸쳐
  • ResNet-50 그래디언트 크기 이미지로 학습된 CNN 분류기가 감지하도록 배럴, 핀쿠션, 그리고 머스타시 왜곡 패턴
  • 왜곡 위험 점수와 공간 히트맵 출력 — 고위험 FOV 영역을 표시 물리적 렌즈가 제조되기 전에

왜 일반 DC-GAN 대신 물리 조건부 cGAN을 사용하나요?DC-GAN은 무작위 잠재 벡터에서 이미지를 생성하며, 훈련 이미지의 주변 분포만 학습하고 특정 FEA 변형 상태가 주어졌을 때의 조건부 분포는 학습하지 않습니다. 왜곡 맵 합성에서는 이 차이가 결정적입니다. U-Net 생성기를 갖춘 물리 조건부 cGAN은 생성기와 판별기 모두를 입력 FEA 변형 필드에 조건화하여, 물리적 변형 상태에서 광학 왜곡 패턴으로의 매핑을 학습하도록 강제합니다. U-Net의 스킵 연결은 코너 FOV 영역에서 서브픽셀 왜곡 기울기를 보존하는데, 표준 인코더‑디코더는 연속적인 다운샘플링 과정에서 이를 잃게 됩니다 — 그리고 이러한 코너 기울기가 DV 실패 예측을 위한 주요 신호입니다.

왜 순수 회귀 CNN이 아닌가요?회귀 모델은 훈련 세트 전체에 대해 평균 제곱 오차를 최소화하며, 코너에서의 피크 왜곡을 체계적으로 과소평가합니다. GAN의 적대적 목표는 생성기가 선명하고 고대비의 왜곡 맵을 생성하도록 유도하는데, 이는 우연히 회귀 모델이 평탄화시키는 피크 크기를 보존합니다. DV 실패 임계값이 엄격한 경계(코너 MTF50 < 25% 또는 왜곡 > 3 px 로컬)일 때, 피크를 과소평가하는 것은 보수적인 오류가 아니라 실패 예측을 놓치는 것입니다.

실제로 중요한 메트릭

광학 및 ML 성능 메트릭은 함께 추적됩니다. 하나만으로는 불완전하기 때문입니다.

광학 인식 품질

  • MTF50: 목표: 이미지 중앙에서 ≥45–50%, 코너에서 ≥30%. DV 실패 코너 MTF50 <25% 또는 중앙-코너 차이가 40%를 초과할 때 — 하위 인식 알고리즘이 FOV 주변부에서 신뢰할 수 있는 에지 검출을 잃게 되는 지점.
  • 기하학적 왜곡: 전체 시야에서 RMS ≤2 px 목표. 3 px 로컬 왜곡 또는 이상적인 투영 모델에서 1.5–2% 이상 편차 시 DV 실패 — 차선 이탈 및 물체 거리 추정 오류가 안전 관련이 될 때.
  • 열 안정성: 동작 범위 −40°C ~ +85°C. 허용 이미지 이동 ≤1–2 px (센서면에서 약 5–10 µm). 3 px 이동 또는 비선형 왜곡 발생 시 DV 실패. 비선형성은 핵심 플래그: 선형 이동은 펌웨어로 보정 가능하지만, 비선형 드리프트는 내재 캘리브레이션 매트릭스를 완전히 무효화한다.

ML 모델 성능

  • 탐지: mAP ≥0.90, IoU ≥0.75–0.80 목표. 보유된 합성 검증 세트에서 mAP 0.92–0.95, IoU 0.78–0.85 달성.
  • 오류 율: FPR ≤5%, FNR ≤3% 목표. 실제 FPR 3–5%, FNR 2–3% 달성. 비대칭은 의도된 설계 — 안전 핵심 카메라 프로그램에서 왜곡 실패(FN)를 놓치는 것이 불필요한 엔지니어링 검토를 초래하는 거짓 경보보다 명백히 더 심각하다.
  • 학습 건강도: GAN 학습 전반에 걸쳐 생성기/판별기 손실 균형을 TensorBoard로 추적 판별기가 붕괴되는 것은 가장 위험한 학습 실패이며, 미니배치별 판별기 신뢰도를 모니터링함으로써 조기에 포착한다.

내가 해결한 가장 어려운 문제

내가 진단한 가장 복잡한 실패는 단일 결함이 아니었다 — 열‑기계‑광학 결합 실패였으며, 이는 4개 팀이 6–8주에 걸쳐 완전히 분석해야 했고 궁극적으로 개념 단계부터 프로그램에 내재된 가정을 재검토해야 했다.

증상은 명확했다: +85°C에서 열 침수 중 코너 MTF50이 25% DV 실패 임계값 이하로 떨어졌고, 실온에서는 나타나지 않던 비선형 왜곡 패턴이 나타났다. 비선형성은 핵심 적신호였으며 — 선형 열 변위는 내재 캘리브레이션 매트릭스에서 보정 가능하지만, 비선형 왜곡은 캘리브레이션을 완전히 무효화하고 생산 단계에서 펌웨어 패치가 불가능하다.

진단 순서

  • IR 열화상 렌즈 배럴 전체에 비균일한 열 구배가 있음을 밝혀냈으며 — 열전도율 차이에 따른 비대칭 가열, 하우징 재료와 접착제 결합층.
  • FEA 열팽창 모델링 +85°C에서 12–15 µm 렌즈 오프셋을 예측했으며, CTE UV 경화 에폭시와 알루미늄 하우징 사이의 불일치 때문입니다. 중요하게도, 접착제는 크리프 지속적인 열 하중 하에서—시간 의존적이며 복구 불가능한 변형을 보였습니다.
  • 공차 적층 분석 이 오프셋이 명목상의 이미지 센서 장착 높이 공차(±8 µm)와 결합되어, 결합된 주광선 각도 편차가 이미지 센서 마이크로렌즈 수용 콘을 초과했습니다. 단일 요인이 독립적으로 실패한 경우는 없습니다.

해결을 위해 세 가지 조정이 필요했다: 필드 곡률 보상을 재분배하기 위한 렌즈 설계 수정, CTE 레버 암을 줄이기 위한 접합부 기하학 수정, 그리고 하우징 접합 포켓의 소규모 공급업체 재툴링. 추가적인 DV 열 사이클 하나가 복구를 확인했다. 프로그램 영향: 2–3주 마일스톤 지연, 추가 DV/PV 테스트 사이클 1회.

생산에 이르는 고장 모드는 거의 경우 명목상 분석에서 나타나는 것과 다르다. 이는 가정의 경계에 있는 경우이며, 시스템 모델이 정확성을 잃는 지점이다.

이 고장은 ML 탐지 파이프라인에 직접적인 영향을 주었다. 만약 FEA 열 변형 예측이 CV에서 학습된 왜곡 모델과 연계되었다면, 접착제 크리프 위험이 프로토타입 하나도 제작되기 전에 고위험 FOV 영역으로 표시되었을 것이다.

아무도 이야기하지 않는 데이터 문제

내가 해결한 가장 난해한 데이터 문제는 합성 GAN 학습 데이터셋의 일관성 없고 누락된 라벨이었다 — 그리고 어려웠던 이유는 라벨이 물리 기반이며 인간이 주석을 단 것이 아니었기 때문이다. 이 구분은 라벨 오류가 어떻게 작용하는지를 완전히 바꾼다.

데이터셋은 180개의 FEA 시뮬레이션으로 18,000개의 합성 이미지 쌍을 생성했으며 — 열 및 변형 필드를 .npy 배열로, .png 왜곡 맵과 master labels.csv와 짝지었다. 세 가지 고장 모드는 명시적인 파이프라인 개입이 필요했다:

  • FEA 그리드 해상도 불일치: 비균일한 메쉬 밀도로 인해 균일한 CNN 입력 그리드로 래스터화할 때 공간 불연속성이 발생했습니다. 해결책: scipy griddata와 큐빅 보간을 사용해 이중선형 재샘플링을 대체합니다.
  • 불완전 시뮬레이션 내보내기: FEA 실행이 조기에 중단되어 NaN 필드가 포함된 부분 .npy 파일을 생성함 또는 변형이 0인 배열 — 물리적으로 불가능한 출력으로 극한 열 입력에 대해 왜곡이 전혀 올바르지 않다고 모델에게 학습시킬 것이다 열 입력. 해결: 생성 후 스캔으로 NaN 비율을 제거 >0.1% 및 제로 필드 사례.
  • 좌표 변환 정렬 오류: FEA-이미지 좌표 변환에서 오프바이원 인덱싱 오류가 ~6–8%의 샘플에 영향을 미쳤으며 — 시각적 왜곡 맵 오버레이 검사를 통해 포착되었고, 자동 검사에서는 보이지 않았다.

분포 불균형도 마찬가지로 중요했습니다: 데이터셋은 중간 온도 경우(20°C–60°C)에서는 과다하게, 극한 경우(−40°C 및 +85°C)에서는 심각하게 부족했으며 — 이는 DV 합격/불합격을 결정하는 운영 조건과 정확히 일치합니다. 800개의 추가 극한 경우 샘플을 수동으로 재생성하여 전체 샘플 중 극한 경우 비중을 2.2%에서 6.8%로 늘렸습니다.

핵심 요약: 물리 기반 라벨이 자동으로 신뢰할 수 있는 것은 아닙니다.수치적 불안정성, 해상도 불일치, 좌표계 오류가 특정 입력 조건과 연관된 라벨 노이즈를 생성하여, 신뢰할 수 있는 예측이 가장 필요한 시나리오에서 모델에 정확히 편향을 일으킵니다.

산업이 무시하고 있는 위험

분포 이동, 알고리즘 편향, 적대적 공격 등 잘 문서화된 위험을 넘어, ADAS 산업은 체계적으로 열 사이클링과 기계적 노화에 의해 발생하는 서비스 중 교정 드리프트를 과소평가하고 있습니다.

카메라 시스템은 SOP 조건에서 검증됩니다 — 생산 승인 시 카메라가 견뎌야 하는 열, 기계, 환경 상태의 정의된 집합입니다. 그 검증은 철저합니다. 하지만 이것이 다루지 못하는 것은 100,000km 및 10년 동안의 차량 운행 중 반복적인 열 사이클링, 재료 크리프, 장착 스트레스 이완, 도로 진동 하중의 누적 효과입니다.

메커니즘은 잘 이해되고 있습니다: 접착제 크리프와 이질적인 재료 간의 열팽창계수(CTE) 불일치가 렌즈와 이미지 센서 간 상대 위치를 느리고 시간에 따라 변하게 합니다. −30°C와 +70°C 사이의 온도 사이클링을 3년간 겪은 후, 렌즈 바렐은 이미지 센서에 비해 8–12 µm 정도 이동했을 수 있습니다. ECU에 저장된 내재된 교정 매트릭스는 이제 물리적 광학을 정확히 나타내지 못합니다. 물체 거리 추정치는 체계적으로 편향되어 있습니다 — 단일 프레임에서는 눈에 띄지 않을 정도로 작지만, 고속도로 속도에서 자동 긴급 제동 활성 임계값에 영향을 줄 정도로 충분히 큽니다.

산업계의 대응은 두 가지 구체적인 측면에서 부적절합니다: 주기적인 재보정이 표준화되어 있지 않음 (시간 의존적 열화 메커니즘이 잘 이해되고 있음에도 불구하고, 예정된 카메라 재보정 간격이 존재하지 않음), 그리고 서비스 중 모니터링이 요구되지 않음 (SOTIF는 SOP에서의 기능 부족을 다루지만, 운영 수명 동안의 기능 저하를 다루지는 않습니다).

그 결과는 숨겨진 고장 모드 집단입니다: 현장에서 운행 중인 차량들은 오래된 교정 매트릭스를 사용하고 있으며, 각각은 임계값 이하이지만 전체 대규모 차량군에서는 의미 있는 정도로 저하된 인식 시스템을 가지고 있습니다.

사람들을 위험에 빠뜨릴 수 있는 신화

자율 시스템에서 가장 널리 퍼지고 위험한 신화는 전체 모델 정확도가 높을수록 시스템이 더 안전해진다.

mAP는 평가 데이터셋의 클래스 및 시나리오 분포에 대한 평균입니다. 모든 샘플에 동일한 가중치를 부여합니다. 실제 ADAS 시스템은 시나리오를 동일한 빈도로 만나지 않으며 — 고속도로 차선 유지 상황을 주차된 차량 뒤에서 도로로 뛰어들어오는 부분적으로 가려진 어린이 상황보다 1만 배 더 자주 마주합니다. 고빈도 정상 시나리오에서 약간 개선되어 mAP가 0.02 상승한 모델이 희귀한 안전 핵심 시나리오에서는 변함이 없다면, 실제 안전성을 의미 있게 향상시킨 것이 아닙니다. 단지 지표를 개선한 것입니다.

나는 이를 직접 관찰했다. 표준 벤치마크에서 mAP 0.95를 기록한 모델이라도, 햇빛 눈부심 각도, 차선 표시 손상, 차량 형상의 특정 조합에 대해 훈련 데이터가 충분히 반영하지 못한 경우, 높은 확률의 자신감 있는 오탐지를 생성할 수 있습니다. 110 km/h에서 발생한 그 오탐지는 안전 사고입니다. 0.95 mAP는 이를 방지하지 못했습니다.

안전 핵심 인식에서 신뢰성을 실제로 결정하는 것은 다른 속성 집합입니다:

  • 심각도 고장 모드의 탐지 가능성 — 모델이 조용히 실패하거나 낮은 신뢰도 출력을 생성하여 백업을 트리거하는가?
  • 극단 상황 행동 운용 설계 영역의 경계에서
  • 시스템 수준의 중복성 인식 오류가 제어로 전파되기 전에 포착하는 출력
  • 보정된 불확실성 — 모델이 모르는 것을 알고 있는지 여부

업계는 mAP를 주요 안전 커뮤니케이션 지표로 사용하는 것을 시나리오별 성능 보고 — 정상 조건, 열화된 센서 조건, 희귀 객체 클래스, 그리고 ODD 경계 시나리오에 대한 별도 지표와 명시적인 실패 모드 분석을 결합한 형태입니다. 이러한 전환이 이루어지기 전까지, 프로그램은 통계적으로 인상적이면서도 정확히 가장 중요한 시나리오에서 때때로 위험한 시스템을 계속 제공할 것입니다.

내일 신입 엔지니어에게 전하고 싶은 말

대학원 과정에서 명시적으로 가르치지 않는 가장 중요한 교훈: 모델은 단독으로 실패하지 않는다. 시스템이 그렇다.

6개월을 투자해 mAP 0.93을 달성하고 손실 곡선이 깨끗하며 IoU 수치가 견고한 인식 모델을 만들 수 있습니다. 그런 다음 실제 카메라 하드웨어에 배포하면 모델 아키텍처와는 무관한 방식으로 실패합니다. 운영 온도와 15°C 차이 나는 열 조건에서 카메라 내재 보정이 마지막으로 업데이트되었습니다. 데이터 파이프라인은 코너 시야 영역에서 1픽셀 오프셋을 도입하는 좌표 변환을 가지고 있습니다. 이미지 전처리 스크립트는 사용된 학습 파이프라인과 약간 다른 정규화를 적용합니다. 이 중 어느 것도 모델 문제는 아니며, 모두 시스템 성능을 저하시킵니다.

실제로: 모든 새로운 프로젝트에서 모델을 건드리기 전에, 센서 출력에서 학습 라벨까지 전체 데이터 경로를 추적하고 각 단계마다 — 이 단계가 어떤 가정을 하고 있으며, 그 가정이 언제 깨지는가? — 를 물어보세요. 그 답은 어떤 양의 아키텍처 실험보다도 시스템이 실제 운영에서 어디서 실패할지에 대해 더 많은 정보를 제공할 것입니다.

실제 엔지니어링 영향은 물리, 데이터, 시스템 제약의 교차점에서 비롯됩니다 — 모델 성능만으로는 아닙니다. 이것이 이력서에 보이지 않을 부분이지만, 실제 엔지니어링이 일어나는 곳입니다.

이 분야가 향하는 방향

3년 후에, 합성 데이터 생성과 디지털 트윈 통합이 ADAS 카메라 개발 파이프라인에서 연구용 기능이 아니라 표준 관행이 될 것입니다 광학 및 기계적 기본 원리를 아키텍처 제약으로 내재한 물리 기반 ML 모델이 순수 데이터 기반 접근 방식을 대체하여 인식 품질 예측을 수행할 것입니다. 디바이스 내 자체 보정 — 카메라 자체 인식 출력을 사용해 내부 드리프트를 감지하고 보정하는 — 은 연구 프로토타입에서 제품 기능으로 전환될 것입니다.

무엇 해결되지 않을 것은 롱테일 엣지 케이스 문제입니다. 복합 실패 시나리오의 조합적 공간 — 센서 열화가 비정형 도로 기하와 교차하고, 희귀한 날씨와 교차하며, 비정형 도로 이용자 행동과 교차하는 — 은 데이터셋 규모에 따라 선형적으로 감소하지 않습니다. 최선의 경우에도 거듭제곱 법칙에 따라 감소하며, 꼬리는 사실상 무한합니다. 규모가 이 문제를 없앨 것이라는 가정이 현재 업계 사고방식에서 가장 위험하다고 생각합니다. 엔지니어링 대응은 단순히 더 많은 데이터를 확보하는 것이 아니라, 보수적인 운영 설계 도메인 정의, 견고한 실패 감지, 그리고 이러한 시스템이 신뢰성 있게 처리할 수 없는 부분에 대해 최종 사용자에게 솔직히 전달하는 것입니다.

그 솔직한 소통이 바로 업계가 가장 전달하기를 꺼리는 부분입니다.

Vijayababu Pulla는 ADAS Camera & AI/ML 엔지니어이며, 12년 이상의 자동차 시스템 엔지니어링 경험을 보유하고 있습니다. 여기에는 Tier-1 공급업체에서 GM, Stellantis, Mazda 프로그램을 지원하며 ADAS 카메라 엔지니어 팀장을 2년 이상 맡은 경력이 포함됩니다. 그는 Colorado State University – Global에서 인공지능 & 머신러닝 석사(MS)를 취득했으며 (GPA 3.94) . 그의 연구는 GAN 기반 합성 데이터 생성, 광학 왜곡 예측을 위한 물리 조건부 cGAN 아키텍처, 센서 융합, 그리고 Transformer 기반 궤적 모델링을 포괄합니다. 그는 미시간주 Ann Arbor에 거주하고 있습니다.