Лідери думок
Спотворення, яке ви не бачите: чому системи камер ADAS провалюються в реальних умовах і як фізично‑інформоване машинне навчання це змінює

Те, що я роблю, схоже на передбачення того, як пара окулярів спотворить ваш зір ще до того, як ви їх надягнете — лише наслідки помилки не є головним болем. Це невдалий випадок екстренного гальмування при 110 км/год.
Був пізній етап циклу верифікації дизайну, коли з’явилася помилка — важке радіальне та тангенціальне спотворення лінзи в передній камері ADAS, виявлене лише після того, як допуски оптичного збірки були затверджені з постачальником. Виправлення вимагало ручного налаштування зсуву між сенсором і кріпленням лінзи, повторного проведення тестів MTF та сіткових спотворень, а також управління каскадним ризиком етапу програми, що виникає після будь‑якої пізньої помилки DV. Основна причина не була виробничим дефектом чи окремою помилкою дизайну. Це було щось більш структурне: характеризація спотворення камери була повністю реактивною. До того часу, коли існували фізичні прототипи, було вже надто пізно дешево виправити оптичний стек.
Той інцидент змусив мене безпосередньо зайнятися машинним навчанням. Якби CNN, навчена на GAN‑синтезованих картах спотворень, могла виявляти ризик спотворень типу «бочка», «подушка» та «вусик» за параметрами оптичного дизайну ще до виготовлення будь‑якої лінзи, несподіванка під час DV могла б бути повністю усунута. Це саме та проблема, над якою я працював останні кілька років: використання фізичного моделювання та ШІ для передбачення того, як тепло і механічні навантаження деформуватимуть оптику камери протягом експлуатаційного життя транспортного засобу, щоб відмови виправлялися на етапі концепції, а не виявлялися на виробничих воротах.
Далі йде те, чого я навчився — про архітектуру, дані, режими відмов і розрив між тим, як ця індустрія говорить про ШІ, і тим, як ШІ насправді поводиться в виробничих системах.
Архітектура: апаратне забезпечення зустрічає машинне навчання
Система, яку я знаю найглибше, — це платформа передньої камери ADAS, впроваджена в кількох програмах OEM, — критично важливий модуль, де фізика оптичного збірки та продуктивність конвеєра сприйняття на базі ШІ нероздільні.
Аппаратний стек починається з багатократного лінзового бареля (дизайн 6–8 елементів залежно від варіанту поля зору), змонтованого до CMOS‑сенсора за допомогою прецизійного механічного корпусу. Відповідність головного куту променя між вихідним зрачком лінзи та мікролінзовим масивом сенсора є критичним обмеженням вирівнювання — невідповідність є основним джерелом затемнення кутових ділянок та спотворень, залежних від поля. Сенсор виводить необроблені кадри у Bayer‑формат до ISP, який виконує демозаїку, шумозаглушення та корекцію затемнення лінзи перед модулем сприйняття SoC.
Конвеєр виявлення спотворень на базі ШІ розташований перед фізичним прототипуванням. Потік даних:
- Синтетичний простір оптичних параметрів (радіуси кривизни лінз, відстані між елементами допуски, кути нахилу сенсора, відхилення головного куту променя)
- Фізично‑умовний cGAN з генератором U‑Net, що синтезує реалістичні спотворені кадри по всьому полю зору
- ResNet-50 CNN‑класофікатор, навчений на зображеннях величини градієнта для виявлення спотворень типу «бочка», «подушка» та «вусик»
- Спотворення оцінка ризику та просторовий тепловий мапа — позначення високоризикових ділянок поля зору до виготовлення будь‑якої фізичної лінзи
Чому фізично‑умовлений cGAN замість звичайного DC‑GAN? DC‑GAN генерує зображення з випадкових латентних векторів — він навчається маргінальному розподілу навчальних зображень, а не умовному розподілу за конкретним станом деформації FEA. Для синтезу карт спотворень ця різниця вирішальна. Фізично‑умовлений cGAN з генератором U‑Net умовляє як генератор, так і дискримінатор на вхідному полі деформації FEA, змушуючи модель вивчити відображення від фізичного стану деформації до патерну оптичного спотворення. Пропускні зв’язки U‑Net зберігають субпіксельні градієнти спотворень у кутових ділянках поля зору, які стандартний енкодер‑декодер втрачає через послідовне зменшення розмірності — і саме ці кутові градієнти є основним сигналом для передбачення відмови DV.
Чому не чистий регресійний CNN? Регресійні моделі мінімізують середньоквадратичну помилку по всьому навчальному набору, систематично недооцінюючи пікові спотворення у кутах. Адверсарна мета GAN змушує генератор створювати різкі, висококонтрастні карти спотворень — що випадково зберігає пікові величини, які регресійна модель згладжує. Коли поріг відмови DV є жорсткою межою (кутовий MTF50 < 25% або спотворення > 3 px локально), недооцінка піків не є консервативною помилкою. Це пропущене передбачення відмови.
Метрики, які дійсно мають значення
Оптичні та ШІ‑метрики продуктивності відстежуються разом, оскільки одна без іншої є неповною.
Якість оптичного сприйняття
- MTF50: Ціль ≥45–50% у центрі зображення, ≥30% у кутах. Відмова DV спрацьовує, коли кутовий MTF50 <25% або падіння від центру до кута перевищує 40% — це точка, коли алгоритми сприйняття нижчого рівня втрачають надійне виявлення країв у периферії поля зору.
- Геометричний спотворення: Ціль ≤2 px RMS по всьому полю зору. DV‑відмова при 3 px локальному спотворенні або відхиленні ≥1.5–2% від ідеальної проекційної моделі — де помилки відхилення смуги та оцінки відстані до об’єкта становлять загрозу безпеці.
- Тепловий стабільність: Діапазон роботи −40°C до +85°C. Допустиме зміщення зображення ≤1–2 px (≈5–10 µm у площині сенсора). DV‑відмова при 3 px зміщенні або початок нелінійних спотворень. Нелінійність — критичний індикатор: лінійне зміщення можна виправити прошивкою; нелінійний дрейф анулює внутрішню матрицю калібрування повністю.
Продуктивність моделі машинного навчання
- Виявлення: Цільовий mAP ≥0.90, IoU ≥0.75–0.80. Досягнутий mAP 0.92–0.95, IoU 0.78–0.85 на відкладених синтетичних валідаційних наборах.
- Помилкові рівні: Ціль FPR ≤5%, FNR ≤3%. Досягнуто FPR 3–5%, FNR 2–3%. Асиметрія навмисна — пропущена відмова спотворення (FN) у програмі камери, критичній для безпеки, категорично гірше, ніж тривога, що викликає непотрібний інженерний огляд.
- Навчання стан: Баланс втрат генератора/дискримінатора відстежувався протягом навчання GAN за допомогою TensorBoard. Колапс дискримінатора — найнебезпечніша відмова навчання — виявлена рано шляхом моніторингу впевненості дискримінатора по всіх міні‑батчах.
Найскладніша проблема, яку я вирішив
Найскладніша відмова, яку я діагностував, не була одиничним дефектом — це теплово‑механічно‑оптична помилка зв’язку яка зайняла 6–8 тижнів для повного розбору чотирма командами та в кінцевому підсумку вимагала переосмислення припущень, закладених у програму з етапу концепції.
Симптом був очевидний: кутовий MTF50 впав нижче порогу 25% DV‑відмови під час термічної замочування при +85°C, і з’явився нелінійний шаблон спотворень, якого не було при кімнатній температурі. Нелінійність була критичним червоним прапором — лінійне термічно‑індуковане зміщення можна виправити у внутрішній матриці калібрування, проте нелінійне спотворення анулює калібрування повністю і не може бути виправлене прошивкою у виробництві.
Діагностична послідовність
- ІЧ термографія виявила неоднорідний тепловий градієнт по всій довжині об’єктива — асиметричний нагрів через різну теплопровідність між матеріалом корпусу та шаром адгезивного зв’язку.
- FEA моделювання теплового розширення прогнозувало зсув об’єктива 12–15 µm при +85°C, викликаний невідповідністю CTE між UV‑затверджувальним епоксидом та алюмінієвим корпусом. Критично, адгезив проявив creep під постійним тепловим навантаженням — залежний від часу, невідновлюваний деформація.
- Терпимість аналіз накопичення виявило, що цей зсув, у поєднанні з номінальним допуском висоти монтажу іміджера (±8 µm), призвів до того, що сумарний головний промінь відхилення кута виходить за межі конуса приймання мікролінз іміджера. Жоден окремий фактор не зазнав відмови самостійно.
Для вирішення проблеми знадобилося три координовані зміни: переглянути параметри об’єктива для перерозподілу компенсації викривлення поля, змінити геометрію з’єднувального з’єднання для зменшення важеля CTE, а також незначне переналагодження постачальником гнізда з’єднання корпусу. Один додатковий тепловий цикл DV підтвердив відновлення. Вплив на програму: затримка етапу на 2–3 тижні, один додатковий тестовий цикл DV/PV.
Режими відмов, які потрапляють у виробництво, майже ніколи не збігаються з тими, що у вашому аналізі номінального випадку. Це ті, що знаходяться на межі ваших припущень — там, де ваша модель системи перестає бути точною.
Ця відмова безпосередньо сформувала конвеєр виявлення ML. Якби прогнози теплової деформації FEA були зіставлені з навченою моделлю спотворень у CV, ризик адгезивного просідання був би позначений як високоризикова область поля зору ще до створення першого прототипу.
Проблема даних, про яку ніхто не говорить
Найбільш хаотична проблема з даними, яку я вирішив, була неспівпадіння та відсутність міток у синтетичному наборі даних для навчання GAN — і те, що робило її по‑справжньому складною, полягало в тому, що мітки були отримані з фізики, а не аннотовані людьми. Це розрізнення змінює все щодо того, як поводяться помилки міток.
Набір даних складався з 180 симуляцій FEA, що генерували 18 000 синтетичних пар зображень — теплові та деформаційні поля у вигляді масивів .npy, у поєднанні з .png картами спотворень та головним файлом labels.csv. Три режими відмов вимагали явного втручання в конвеєр:
- FEA невідповідність роздільної здатності сітки: Неоднорідна щільність сітки створювала просторові розриви при растеризації до уніфікованої вхідної сітки CNN. Виправлення: scipy griddata з кубічною інтерполяцією замість білярної ресемплінгу.
- Неповний експорт симуляцій: Запуски FEA завершились рано, записавши часткові .npy файли з NaN полями або масиви нульових деформацій — фізично неможливі результати, які навчали б модель, що жодне спотворення не є правильним для екстремальних термальних входів. Виправлення: сканування після генерації з відкиданням частки NaN >0.1% та випадків з нульовим полем.
- Координатний зсув трансформації: Помилка індексації на один у FEA‑до‑зображення координат трансформація вплинула приблизно на 6–8 % зразків — виявлено під час візуального огляду накладок карти спотворень, невидимих для автоматизованих перевірок.
Дисбаланс розподілу був також суттєвим: набір даних був переважаючим у помірних термальних випадках (20 °C–60 °C) і критично недопредставленим у крайніх (−40 °C та +85 °C) — саме ті експлуатаційні умови, які визначають проходження DV. 800 додаткових зразків крайніх випадків було вручну відтворено, щоб підвищити представлення крайніх випадків з 2,2 % до 6,8 % від загальної кількості зразків.
Висновок: етикетки, отримані з фізики, не є автоматично достовірними.Числова нестабільність, невідповідність роздільної здатності та помилки системи координат створюють шум етикеток, який корелює зі специфічними вхідними умовами — що упереджує модель саме у сценаріях, де потрібні найнадійніші прогнози.
Ризик, який ігнорує індустрія
Окрім добре задокументованих ризиків зміни розподілу, алгоритмічної упередженості та атак‑зловмисників, індустрія ADAS систематично недооцінює дрейф калібрування в експлуатації, спричинений термічними циклами та механічним старінням.
Системи камер проходять валідацію при умовах SOP — визначеному наборі термічних, механічних та екологічних станів, які камера повинна витримати під час затвердження виробництва. Ця валідація є суворою. Вона не охоплює кумулятивний вплив повторюваних термічних циклів, ползання матеріалів, релаксації напруги кріплення та навантаження від дорожніх вібрацій протягом 100 000 кілометрів і десяти років експлуатації транспортного засобу.
Механізм добре зрозумілий: ползання клею та невідповідність коефіцієнтів теплового розширення (CTE) між різними матеріалами викликають повільні, часозалежні зміщення відносного положення об’єктива щодо сенсора. Після трьох років температурних циклів між −30 °C та +70 °C корпус об’єктива може зміститися на 8–12 µм щодо сенсора. Внутрішня калибрувальна матриця, збережена в ECU, більше не точно відображає фізичну оптику. Оцінки відстані до об’єктів систематично упереджені — достатньо малі, щоб залишатися непомітними в окремому кадрі, але достатньо великі, щоб впливати на пороги активації автоматичного екстреного гальмування на швидкостях шосе.
Відповідь індустрії є недостатньою у двох конкретних аспектах: періодичне перекалібрування не стандартизовано (не існує запланованих інтервалів перекалібрування камер, незважаючи на добре зрозумілі часозалежні механізми деградації), і моніторинг в експлуатації не вимагається (SOTIF розглядає функціональну недостатність на SOP; вона не охоплює функціональну деградацію протягом експлуатаційного життя).
Результатом є прихована популяція режимів відмов: транспортні засоби в експлуатації з системами сприймання, які працюють на застарілих калибрувальних матрицях, деградованих у величинах, які окремо є підпороговими, але колективно значущими для великого парку.
Міф, який може вбивати людей
Найпоширеніший і найнебезпечніший міф в автономних системах полягає в тому, що вища сукупна точність моделі безпосередньо переводить у безпечніші системи.
mAP — це середнє за розподілом класів та сценаріїв у наборі даних оцінювання. Він зважує кожен зразок однаково. Система ADAS у виробництві не стикається зі сценаріями з однаковою частотою — вона стикається з підтриманням смуги на шосе в десять тисяч разів частіше, ніж з частково заслоненою дитиною, що вибігає на дорогу з-під припаркованого автомобіля. Модель, яка підвищує mAP на 0,02, лише трохи покращуючись у високочастотних номінальних сценаріях, залишаючись незмінною у рідкісних критично важливих для безпеки, не підвищила безпеку значущим чином. Вона лише покращила метрику.
Я спостерігав це безпосередньо. Модель, що досягає mAP 0,95 за стандартним бенчмарком, все ще може генерувати впевнений, високоймовірний хибний негатив у конкретному поєднанні кута сонячного відблиску, деградації розмітки смуги та геометрії транспортного засобу, яку навчальні дані недостатньо представили. Такий хибний негатив при 110 км/год — це інцидент безпеки. mAP 0,95 цього не запобіг.
Те, що справді визначає довірливість у безпечному сприйманні, — це інший набір властивостей:
- Серйозність та виявлюваність режимів відмов — чи модель відмовляє без сигналу або генерує вихід з низькою впевненістю який викликає резервний режим?
- Крайовий випадок поведінка на межах операційної області проектування
- Системний резерв який виявляє відмови сприймання до того, як вони поширяться на контроль виходи
- Калібрована невизначеність — чи модель знає, чого вона не знає
Галузі потрібно замінити mAP як основний показник безпеки на звітність про продуктивність, розподілену за сценаріями — окремі метрики для номінальних умов, умов деградованих сенсорів, рідкісних класів об’єктів та сценаріїв на межі ODD — у поєднанні з явним аналізом режимів відмов. Поки ця зміна не відбудеться, програми продовжуватимуть випускати системи, які статистично вражають, але іноді небезпечні саме в тих сценаріях, які мають найбільше значення.
Що я сказав би молодшому інженеру завтра
Найважливіший урок, який жоден магістерський курс не викладає явно: моделі не падають самостійно. Системи — так.
Ви можете витратити шість місяців на створення моделі сприйняття, яка досягає mAP 0.93 зі стабільними кривими втрат і хорошими показниками IoU. Потім ви розгортаєте її на реальному апаратному забезпеченні камери, і вона відмовляє способами, які не мають нічого спільного з архітектурою моделі. Калібрування внутрішніх параметрів камери було останній раз оновлено при температурі, що відрізнялася на 15°C від вашої робочої температури. У конвеєрі даних є координатне перетворення, яке вводить зсув у 1 піксель у кутах області зору. Скрипт попередньої обробки зображень застосовує трохи іншу нормалізацію, ніж використаний у навчальному конвеєрі. Жодне з цих не є проблемою моделі. Усі вони порушують продуктивність системи.
Практично: для кожного нового проєкту, перед тим як торкатися моделі, прослідкуйте повний шлях даних від виходу сенсора до мітки навчання і на кожному кроці задавайте питання — яке припущення робить цей крок і коли це припущення порушується? Відповідь розповість вам більше про те, де система зазнає відмови у виробництві, ніж будь‑які експерименти з архітектурою.
Справжній інженерний вплив походить від перетину фізики, даних та системних обмежень — а не від продуктивності моделі в ізоляції. Це та частина, яку ви не побачите у резюме, але саме тут відбувається справжня інженерна робота.
Куди прямує ця галузь
Через три роки, генерація синтетичних даних та інтеграція цифрових двійників стануть стандартною практикою у конвеєрах розробки камер ADAS, а не лише дослідницькою можливістю. Моделі машинного навчання, інформовані фізикою, які вбудовують оптичні та механічні фундаментальні принципи як архітектурні обмеження, замінять суто даними керовані підходи для передбачення якості сприйняття. Самокалібрування на пристрої — використання власного виходу сприйняття камери для виявлення та компенсації внутрішнього дрейфу — перейде від дослідницького прототипу до виробничої функції.
Те, що не буде вирішено — це проблема довгохвостих крайових випадків. Комбінаторний простір складних сценаріїв відмов — деградація сенсора, що перетинається з незвичною геометрією дороги, з рідкісними погодними умовами, з нетиповою поведінкою учасників дорожнього руху — не зменшується лінійно зі збільшенням розміру набору даних. Він зменшується, у кращому випадку, за законом степеневого спаду, і хвіст ефективно нескінченний. Припущення, що масштаб усуває цю проблему, є, на мій погляд, найнебезпечнішим у сучасному мисленні галузі. Інженерна відповідь полягає не лише у збільшенні даних; це консервативне визначення операційної області застосування, надійне виявлення відмов і чесне інформування кінцевих користувачів про те, що ці системи не можуть надійно обробляти.
Саме це чесне інформування є тією частиною, яку галузь найбільше вагається надати.












