Liderzy opinii
Zniekształcenie, którego nie widać: dlaczego systemy kamer ADAS zawodzą w praktyce i jak ML z uwzględnieniem fizyki to zmienia

To, co robię, jest jak przewidywanie, jak para okularów zniekształci Twój wzrok, zanim je założysz — z tą różnicą, że konsekwencje pomyłki nie są bólem głowy. To nieudane zdarzenie awaryjnego hamowania przy 110 km/h.
Pod koniec cyklu weryfikacji projektowej pojawiła się awaria — poważne promieniowe i styczne zniekształcenia soczewki w przedniej kamerze ADAS, wykryte dopiero po zablokowaniu tolerancji montażu optycznego u dostawcy. Naprawa wymagała ręcznego dostosowania offsetu pomiędzy matrycą a mocowaniem soczewki, ponownego przeprowadzenia testów MTF i siatki zniekształceń oraz zarządzania narastającym ryzykiem kamieni milowych programu, które towarzyszy każdej późnej awarii DV. Przyczyną nie był pojedynczy defekt produkcyjny ani błąd projektowy. Było to coś bardziej strukturalnego: charakterystyka zniekształceń kamery była całkowicie reaktywna. Gdy fizyczne prototypy już istniały, było za późno, aby tanio skorygować stos optyczny.
Ten incydent wciągnął mnie bezpośrednio w uczenie maszynowe. Gdyby sieć CNN wytrenowana na mapach zniekształceń syntetyzowanych przez GAN potrafiła wykrywać ryzyko zniekształceń beczkowatych, poduszkowych i wąsowych na podstawie parametrów projektowych optyki, zanim jakakolwiek soczewka zostanie wyprodukowana, niespodzianka DV mogłaby zostać całkowicie wyeliminowana. To jest problem, nad którym pracowałem przez ostatnie kilka lat: wykorzystanie symulacji fizycznej i AI do przewidywania, jak ciepło i naprężenia mechaniczne odkształcą optykę kamery w trakcie eksploatacji pojazdu, tak aby awarie były korygowane na etapie koncepcji, a nie odkrywane przy bramie produkcji.
Co dalej, to to, czego się nauczyłem — o architekturze, danych, trybach awarii oraz o rozbieżności między tym, jak branża mówi o AI, a tym, jak AI faktycznie zachowuje się w systemach produkcyjnych.
Architektura: sprzęt spotyka się z ML
System, który znam najdokładniej, to platforma przedniej kamery ADAS wdrażana w wielu programach OEM — moduł krytyczny pod względem bezpieczeństwa, w którym fizyka montażu optycznego i wydajność pipeline’u percepcyjnego ML są nierozerwalne.
Stos sprzętowy zaczyna się od wieloelementowego korpusu soczewki (projekt 6–8 elementów w zależności od wariantu FOV) zamontowanego do matrycy CMOS za pomocą precyzyjnej obudowy mechanicznej. Dopasowanie kąta głównego promienia pomiędzy wyjściową pupillą soczewki a matrycą mikrosoczewek jest krytycznym warunkiem wyrównania — niezgodność jest głównym źródłem zacienienia narożników i zniekształceń zależnych od pola widzenia. Matryca wyjmuje surowe klatki w układzie Bayera do ISP, który zajmuje się demosaikowaniem, redukcją szumów i korekcją zacienienia soczewki przed SoC percepcji.
Pipeline wykrywania zniekształceń ML znajduje się przed etapem prototypowania fizycznego. Przepływ danych:
- Syntetyczna przestrzeń parametrów optycznych (promienie krzywizny soczewki, odstępy elementów tolerancje, kąty pochylenia matrycy, odchylenie kąta głównego promienia)
- Warunkowany fizyką cGAN z generatorem U-Net syntetyzujący realistyczne zniekształcone klatki na całym FOV
- ResNet-50 klasyfikator CNN wytrenowany na obrazach gradientu magnitudy w celu wykrywania wzorców zniekształceń beczkowatych, poduszkowych i wąsowych
- Zniekształcenie wynik ryzyka i wyjściowa mapa cieplna przestrzenna — oznaczająca regiony FOV o wysokim ryzyku przed wyprodukowaniem jakiejkolwiek fizycznej soczewki
Dlaczego cGAN warunkowany fizyką zamiast zwykłego DC-GAN? DC-GAN generuje obrazy z losowych wektorów ukrytych — uczy się rozkładu marginalnego obrazów treningowych, a nie rozkładu warunkowego dla konkretnego stanu deformacji FEA. Dla syntezy mapy zniekształceń ta różnica jest decydująca. cGAN warunkowany fizyką z generatorem U‑Net warunkuje zarówno generator, jak i dyskryminator na wejściowym polu deformacji FEA, zmuszając model do nauczenia się mapowania stanu deformacji fizycznej na wzorzec zniekształcenia optycznego. Połączenia skip w U‑Net zachowują gradienty zniekształceń podpikselowych w narożnych regionach FOV, które standardowy enkoder‑dekoder traci przy kolejnych downsamplingu — a te gradienty narożne są głównym sygnałem do prognozowania awarii DV.
Dlaczego nie czysta regresja CNN? Modele regresyjne minimalizują średni błąd kwadratowy w całym zestawie treningowym, systematycznie niedoszacowując szczytowych zniekształceń w narożnikach. Adwersarialny cel GAN wymusza na generatorze tworzenie ostrych, wysokokontrastowych map zniekształceń — co przypadkowo zachowuje szczytowe wartości, które model regresyjny wygładza. Gdy próg awarii DV jest twardą granicą (corner MTF50 < 25% lub zniekształcenie > 3 px lokalnie), niedoszacowanie szczytów nie jest konserwatywnym błędem. To jest pominięta prognoza awarii.
Metryki, które naprawdę mają znaczenie
Metryki wydajności optycznej i ML są monitorowane razem, ponieważ jedna bez drugiej jest niekompletna.
Jakość percepcji optycznej
- MTF50: Cel ≥45–50% w centrum obrazu, ≥30% w narożnikach. Awaria DV wywołana przy MTF50 w narożniku <25% lub spadku od środka do narożnika przekraczającego 40% — punkt, w którym algorytmy percepcyjne dalszego przetwarzania tracą wiarygodne wykrywanie krawędzi na peryferiach FOV.
- Geometryczna zniekształcenie: Cel ≤2 px RMS w całym polu widzenia. Awaria DV przy lokalnym zniekształceniu 3 px lub odchyleniu ≥1,5–2 % od idealnego modelu projekcji — gdzie odchylenia w wykrywaniu pasa ruchu i szacowaniu odległości obiektów stają się istotne dla bezpieczeństwa.
- Termiczna stabilność: Zakres pracy −40°C do +85°C. Dopuszczalne przesunięcie obrazu ≤1–2 px (≈5–10 µm w płaszczyźnie sensora). Niepowodzenie DV przy przesunięciu 3 px lub pojawieniu się nieliniowego zniekształcenia. Nieliniowość jest krytycznym sygnałem: liniowe przesunięcie można skorygować w oprogramowaniu; nieliniowy dryf unieważnia wewnętrzną macierz kalibracji całkowicie.
Wydajność modelu ML
- Wykrywanie: Cel mAP ≥0.90, IoU ≥0.75–0.80. Osiągnięto mAP 0.92–0.95, IoU 0.78–0.85 na odrębnych syntetycznych zestawach walidacyjnych.
- Wskaźniki błędów: Cel FPR ≤5 %, cel FNR ≤3 %. Osiągnięto FPR 3–5 %, FNR 2–3 %. Asymetria jest zamierzona — pominięcie awarii zniekształcenia (FN) w programie kamery krytycznej dla bezpieczeństwa jest wyraźnie gorsze niż fałszywy alarm wywołujący niepotrzebny przegląd inżynieryjny.
- Zdrowie treningu: Równowaga strat generatora/rozpoznawacza monitorowana przez cały proces treningu GAN za pomocą TensorBoard. Upadek rozpoznawacza jest najgroźniejszą awarią treningową — wykrywaną wcześnie poprzez monitorowanie pewności rozpoznawacza w mini‑batchach.
Najtrudniejszy problem, który rozwiązałem
Najbardziej złożona awaria, którą zdiagnozowałem, nie była pojedynczą wadą — była to awaria sprzężenia termiczno‑mechaniczno‑optycznego, której pełne rozłożenie zajęło 6–8 tygodni w czterech zespołach i ostatecznie wymagało ponownego przeanalizowania założeń wprowadzonych do programu od fazy koncepcyjnej.
Objaw był prosty: MTF50 w narożniku spadło poniżej progu awarii DV 25 % podczas zanurzenia termicznego przy +85°C, a pojawił się nieliniowy wzorzec zniekształcenia, którego nie było w temperaturze pokojowej. Nieliniowość była krytycznym czerwonym flagą — liniowe, termicznie wywołane przesunięcie można skorygować w wewnętrznej macierzy kalibracji, ale nieliniowe zniekształcenie unieważnia kalibrację całkowicie i nie może być naprawione w firmware w produkcji.
Sekwencja diagnostyczna
- IR termografia ujawniła niejednorodny gradient termiczny wzdłuż korpusu soczewki — asymetryczne nagrzewanie spowodowane różnicą przewodności cieplnej między materiałem obudowy a warstwą kleju.
- FEA modelowanie rozszerzalności cieplnej przewidywało odchylenie soczewki o 12–15 µm przy +85°C, spowodowane niezgodnością CTE pomiędzy epoksydem utwardzanym UV a aluminiową obudową. Krytycznie, klej wykazywał creep pod stałym obciążeniem cieplnym — zależny od czasu, nieodwracalny odkształcenie.
- Tolerancja analiza kumulacji tolerancji ujawniła, że to odchylenie, w połączeniu z nominalną tolerancją wysokości mocowania sensora (±8 µm), spowodowało przekroczenie odchylenia kąta głównego promienia poza stożkiem akceptacji mikrosoczewek sensora. Żaden pojedynczy czynnik nie zawiódł w izolacji.
Rozdzielczość wymagała trzech skoordynowanych zmian: zmodyfikowanego projektu soczewki w celu redystrybucji kompensacji krzywizny pola, zmiany geometrii połączenia klejowego w celu zmniejszenia ramienia dźwigni CTE oraz niewielkiej przebudowy u dostawcy obudowy. Jeden dodatkowy cykl termiczny DV potwierdził odzyskanie. Wpływ na program: opóźnienie kamienia milowego o 2–3 tygodnie, dodatkowy cykl testowy DV/PV.
Tryby awarii, które docierają do produkcji, prawie nigdy nie są tymi, które znajdują się w analizie nominalnego przypadku. To są te na granicy twoich założeń — tam, gdzie model systemu przestaje być dokładny.
Ta awaria bezpośrednio ukształtowała pipeline wykrywania ML. Gdyby prognozy odkształceń termicznych FEA zostały skorelowane z wytrenowanym modelem zniekształceń przy CV, ryzyko przemęczania kleju zostałoby oznaczone jako region wysokiego ryzyka w polu widzenia przed zbudowaniem pierwszego prototypu.
Problem z danymi, o którym nikt nie mówi
Najbardziej zawiłym problemem z danymi, który rozwiązałem, były niezgodne i brakujące etykiety w syntetycznym zestawie danych treningowych GAN — a trudność polegała na tym, że etykiety były pochodzenia fizycznego, a nie ręcznie anotowane. To rozróżnienie zmienia wszystko, co dotyczy zachowania błędów etykiet.
Zestaw danych składał się z 180 symulacji FEA generujących 18 000 syntetycznych par obrazów — pola termiczne i odkształceń jako tablice .npy, sparowane z mapami zniekształceń .png oraz głównym plikiem labels.csv. Trzy tryby awarii wymagały wyraźnej interwencji w pipeline:
- FEA niezgodność rozdzielczości siatki: Niejednorodna gęstość siatki powodowała dyskontynuacje przestrzenne po przeskalowaniu do jednorodnej siatki wejściowej CNN. Naprawa: scipy griddata z interpolacją sześcienną zamiast dwuliniowego przeskalowania.
- Niekompletne eksporty symulacji: Uruchomienia FEA zakończone przedwcześnie zapisały częściowe pliki .npy z polami NaN lub tablicami zerowej deformacji — fizycznie niemożliwe wyniki, które nauczyłyby model, że brak zniekształcenia jest prawidłowy przy skrajnych wejściach termicznych. Naprawa: skan po generacji odrzucający fragmenty NaN >0,1% oraz przypadki zerowych pól.
- Transformacja niezgodność transformacji: Błąd indeksowania o jeden w transformacji współrzędnych FEA‑do‑obrazu wpłynął na ~6–8% próbek — wykryty podczas wizualnej inspekcji nakładek mapy zniekształceń, niewidocznej dla automatycznych kontrolek.
Nierównowaga rozkładu była równie istotna: zbiór danych był przeładowany przypadkami umiarkowanych temperatur (20 °C–60 °C) i krytycznie niedostatecznie reprezentował skrajne wartości (−40 °C i +85 °C) — dokładnie te warunki operacyjne, które decydują o przejściu lub nieprzejściu testu DV. Dodatkowo ręcznie odtworzono 800 próbek skrajnych przypadków, aby zwiększyć ich udział z 2,2 % do 6,8 % całkowitej liczby próbek.
Wniosek: etykiety wyprowadzone z fizyki nie są automatycznie godne zaufania. Niestabilność numeryczna, niezgodności rozdzielczości i błędy w systemie współrzędnych generują szum w etykietach, który koreluje z określonymi warunkami wejściowymi — co wprowadza uprzedzenia w modelu właśnie w scenariuszach, w których potrzebne są najbardziej wiarygodne prognozy.
Ryzyko, które przemysł ignoruje
Poza dobrze udokumentowanymi zagrożeniami związanymi ze zmianą rozkładu, uprzedzeniami algorytmicznymi i atakami adwersarialnymi, branża ADAS systematycznie niedoszacowuje dryfu kalibracji w eksploatacji spowodowanego cyklami termicznymi i starzeniem mechanicznym.
Systemy kamer są weryfikowane w warunkach SOP — określonym zestawie stanów termicznych, mechanicznych i środowiskowych, które kamera musi wytrzymać przy zatwierdzeniu produkcyjnym. Ta weryfikacja jest rygorystyczna. Nie obejmuje ona jednak skumulowanego wpływu powtarzających się cykli termicznych, wypływu materiałów, relaksacji naprężeń montażowych oraz drgań drogowych na dystansie 100 000 kilometrów i dziesięciu latach eksploatacji pojazdu.
Mechanizm jest dobrze poznany: wypływ kleju i niezgodność współczynników rozszerzalności cieplnej (CTE) między różnymi materiałami powodują powolne, zależne od czasu przesunięcia względnej pozycji soczewki względem sensora. Po trzech latach cykli temperaturowych od −30 °C do +70 °C obudowa soczewki może przemieścić się o 8–12 µm względem sensora. Wewnętrzna macierz kalibracji przechowywana w ECU nie odzwierciedla już dokładnie fizycznej optyki. Szacowanie odległości obiektów jest systematycznie obciążone — na tyle małe, że jest niewidoczne w pojedynczej klatce, a jednocześnie na tyle duże, że ma znaczenie przy progach aktywacji automatycznego hamowania awaryjnego przy prędkościach autostradowych.
Odpowiedź przemysłu jest niewystarczająca na dwa konkretne sposoby: okresowa rekalkulacja nie jest ustandaryzowana (nie istnieje zaplanowany interwał rekalkulacji kamer, mimo dobrze zrozumianych mechanizmów degradacji zależnych od czasu), oraz monitorowanie w eksploatacji nie jest wymagane (SOTIF zajmuje się niewystarczalnością funkcjonalną w warunkach SOP; nie obejmuje degradacji funkcjonalnej w trakcie całego okresu eksploatacji).
Rezultatem jest ukryta populacja trybów awarii: pojazdy w terenie z systemami percepcji działającymi na przestarzałych macierzach kalibracji, które uległy degradacji w stopniu indywidualnie poniżej progu, ale łącznie znaczącym w całej flocie.
Mit, który może doprowadzić do śmierci ludzi
Najbardziej wszechobecny i niebezpieczny mit w systemach autonomicznych brzmi wyższa łączna dokładność modelu bezpośrednio przekłada się na bezpieczniejsze systemy.
mAP jest średnią pośród rozkładu klas i scenariuszy w zestawie oceny. Każda próbka jest ważona jednakowo. System ADAS w produkcji nie napotyka scenariuszy o równej częstotliwości — napotyka utrzymanie pasa na autostradzie dziesięć tysięcy razy częściej niż sytuację, w której częściowo zasłonięte dziecko wbiega na drogę zza zaparkowanego pojazdu. Model, który poprawia mAP o 0,02 dzięki nieznacznemu ulepszeniu w wysokoczęstotliwościowych scenariuszach nominalnych, pozostając niezmienionym w rzadkich, krytycznych pod względem bezpieczeństwa, nie podnosi istotnie bezpieczeństwa. Poprawił jedynie miarę.
Zaobserwowałem to osobiście. Model osiągający mAP 0,95 w standardowym benchmarku może nadal wygenerować pewny, wysokoprawdopodobny fałszywy negatyw w specyficznej kombinacji kąta olśnienia słonecznego, degradacji oznaczeń pasa i geometrii pojazdu, której dane treningowe nie odzwierciedlały wystarczająco. Ten fałszywy negatyw przy 110 km/h jest zdarzeniem bezpieczeństwa. mAP 0,95 nie zapobiegło temu.
To, co naprawdę decyduje o wiarygodności w percepcji krytycznej dla bezpieczeństwa, to inny zestaw właściwości:
- Ciężkość i wykrywalność trybów awarii — czy model zawodzi cicho, czy generuje wynik o niskim poziomie pewności wywołujący przejście na tryb awaryjny?
- Skrajny zachowanie na granicach operacyjnego zakresu projektowego
- Poziom systemowy redundancja która wychwytuje awarie percepcji zanim rozprzestrzenią się na sterowanie wyjścia
- Skalibrowana niepewność — czy model wie, czego nie wie
Branża musi zastąpić mAP jako podstawowy wskaźnik komunikacji bezpieczeństwa raportowanie wydajności podzielone na scenariusze — oddzielne metryki dla warunków nominalnych, zdegradowanych warunków czujnika, rzadkich klas obiektów oraz scenariuszy granicznych ODD — połączone z wyraźną analizą trybów awarii. Dopóki ta zmiana nie nastąpi, programy będą nadal dostarczać systemy, które są statystycznie imponujące i okazjonalnie niebezpieczne w dokładnie tych scenariuszach, które mają największe znaczenie.
Co powiedziałbym jutro młodszemu inżynierowi
Najważniejsza lekcja, której żaden kurs magisterski nie uczy wprost: modele nie zawodzą w izolacji. Systemy tak.
Możesz poświęcić sześć miesięcy na budowę modelu percepcji, który osiąga mAP 0.93 przy czystych krzywych strat i solidnych wartościach IoU. Następnie wdrażasz go na prawdziwym sprzęcie kamerowym i zawodzi w sposób, który nie ma nic wspólnego z architekturą modelu. kalibracja wewnętrzna kamery była ostatnio zaktualizowana przy warunkach termicznych o 15 °C różniących się od temperatury operacyjnej. Rurociąg danych posiada transformację współrzędnych wprowadzającą przesunięcie o 1 piksel w narożnych obszarach pola widzenia. Skrypt przetwarzania obrazu stosuje nieco inną normalizację niż używany rurociąg treningowy. Żadne z tych nie są problemami modelu. Wszystkie one obniżają wydajność systemu.
Praktycznie: przy każdym nowym projekcie, przed dotknięciem modelu, śledź pełną ścieżkę danych od wyjścia czujnika do etykiety treningowej i pytaj na każdym etapie — jakie założenie przyjmuje ten krok i kiedy to założenie przestaje obowiązywać? Odpowiedź powie ci więcej o tym, gdzie system zawiedzie w produkcji, niż jakakolwiek ilość eksperymentów z architekturą.
Realny wpływ inżynierii pochodzi ze skrzyżowania fizyki, danych i ograniczeń systemowych — nie z wydajności modelu w izolacji. To jest część, której nie zobaczysz w CV, ale to właśnie tam odbywa się prawdziwa inżynieria.
Gdzie zmierza ta dziedzina
Za trzy lata, generowanie danych syntetycznych i integracja bliźniaka cyfrowego będzie standardową praktyką w pipeline’ach rozwoju kamer ADAS, a nie jako zdolność badawcza. Modele ML z uwzględnieniem fizyki, wbudowujące zasady optyczne i mechaniczne jako ograniczenia architektoniczne, zastąpią czysto oparte na danych podejścia do prognozowania jakości percepcji. Samokalibracja na urządzeniu — wykorzystująca własne wyjście percepcyjne kamery do wykrywania i kompensacji wewnętrznego dryfu — przejdzie od prototypu badawczego do funkcji produkcyjnej.
Co nie zostanie rozwiązane to problem rzadkich przypadków na długim ogonie. Przestrzeń kombinatoryczna złożonych scenariuszy awarii — degradacja czujnika łącząca się z nietypową geometrią drogi, rzadkimi warunkami pogodowymi oraz nietypowym zachowaniem uczestników ruchu — nie zmniejsza się liniowo wraz z rozmiarem zestawu danych. W najlepszym wypadku zmniejsza się zgodnie z prawem potęgowym, a ogon jest de facto nieskończony. Założenie, że skala eliminuje ten problem, jest tym, co uważam za najniebezpieczniejsze w obecnym myśleniu branży. Odpowiedź inżynieryjna nie polega jedynie na większej ilości danych; to konserwatywna definicja operacyjnego obszaru projektowego, solidne wykrywanie awarii oraz szczera komunikacja z użytkownikami końcowymi o tym, czego te systemy nie są w stanie niezawodnie obsłużyć.
Ta szczera komunikacja jest częścią, którą branża jest najbardziej niechętna dostarczyć.












