Погляд Anderson

Перетворення LiDAR у фото-реалістичні зображення за допомогою Генеративної Адверсарної Мережі

mm
Додайте Unite.AI до бажаних джерел у Google

На початку цього тижня було опубліковано відео, яке показує, як система автопілота Tesla зіштовхнулась з нерухомим транспортним засобом на автомагістралі у червні 2021 року. Той факт, що автомобіль був темним і важко розрізним, спровокував обговорення про обмеження використання комп’ютерного зору в автономному водінні.

Відео, опубліковане у грудні 2021 року, показує момент зіткнення. Джерело: https://twitter.com/greentheonly/status/1473307236952940548

Відео, опубліковане у грудні 2021 року, показує момент зіткнення. Джерело: https://twitter.com/greentheonly/status/1473307236952940548

Хоча відео-компресія у широко поширеному відео дає трохи перебільшене враження про те, як швидко нерухомий транспортний засунувся на водія в цьому випадку, відео вищої якості того самого події демонструє, що навіть повністю сприйнялий водій би мав труднощі з реакцією, окрім запізнілої зміни напрямку або напів-ефективного гальмування.

Відео додає до суперечок навколо рішення Tesla відмовитися від радарних датчиків для Автопілота, оголошеного у травні 2021 року, та його позиції щодо віддавання переваги системам, заснованим на зорі над іншими технологіями ехо-локалізації, такими як LiDAR.

Випадково, нова дослідницька робота з Ізраїлю цього тижня пропонує підхід, який поєднує домени LiDAR і комп’ютерного зору, перетворюючи LiDAR-потоки точок у фото-реалістичні зображення за допомогою Генеративної Адверсарної Мережі (GAN).

У новому проєкті з Ізраїлю чорні автомобілі, ідентифіковані у LiDAR-відео, перетворюються у 'денну' сцену для аналізів, заснованих на комп'ютерному зорі, подібно до підходу, який Tesla переслідує для розробки своєї системи Автопілота. Джерело: https://arxiv.org/pdf/2112.11245.pdf

У новому проєкті з Ізраїлю чорні автомобілі, ідентифіковані у LiDAR-відео, перетворюються у ‘денну’ сцену для аналізів, заснованих на комп’ютерному зорі, подібно до підходу, який Tesla переслідує для розробки своєї системи Автопілота. Джерело: https://arxiv.org/pdf/2112.11245.pdf

Автори заявляють:

‘Наші моделі навчилися передбачати реалістичні зображення лише з даних точкових хмар, навіть зображення з чорними автомобілями.

‘Чорні автомобілі важко виявити безпосередньо з точкових хмар через їх низький рівень відбивної здатності. Цей підхід може бути використаний у майбутньому для виконання візуального розпізнавання об’єктів на фото-реалістичних зображеннях, згенерованих з LiDAR-точкових хмар.’

Фото-реалістичні, LiDAR-орієнтовані потоки зображень

Нова робота названа Генерування фото-реалістичних зображень з LiDAR-точкових хмар за допомогою Генеративної Адверсарної Мережі, і походила від семи дослідників трьох ізраїльських академічних факультетів, разом з шістьма дослідниками з Israel-based Innoviz Technologies.

Дослідники намагалися виявити, чи може GAN-орієнтована синтетична графіка бути вироблена на достатній швидкості з точкових хмар, згенерованих системами LiDAR, так, щоб наступний потік зображень міг бути використаний у роботах розпізнавання об’єктів і семантичної сегментації.

Дані

Центральна ідея, як і у багатьох нових [x]>[x] проектах зображення, полягає у навчанні алгоритму на парних даних, де LiDAR-точкові хмари (які залежать від світла, випроміненого пристроєм) навчаються проти відповідного кадру з передньої камери.

Оскільки відео було знято вдень, коли система комп’ютерного зору може легше індивідуалізувати інакше-елузивний чорний автомобіль (такий як той, у який врізалася Tesla у червні), це навчання повинно забезпечити центральну істину, яка більш стійка до темних умов.

Дані були зібрані за допомогою датчика LiDAR InnovizOne, який пропонує швидкість захоплення 10 кадрів у секунду або 15 кадрів у секунду, залежно від моделі.

Дані LiDAR, захоплені пристроєм Innoviz. Джерело: https://www.youtube.com/watch?v=wmcaf_VpsQI

Дані LiDAR, захоплені пристроєм Innoviz. Джерело: https://www.youtube.com/watch?v=wmcaf_VpsQI

Результати містять близько 30 000 зображень і 200 000 зібраних 3D-точок. Дослідники провели два експерименти: один, у якому дані точкової хмари містили лише інформацію про відбивну здатність; і другий, у якому дані точкової хмари мали два канали, по одному для відбивної здатності і відстані.

Для першого експерименту GAN була навчена протягом 50 епох, після чого спостерігалося перевчування.

GAN-згенеровані зображення з першого експерименту. Зліва, дані точкової хмари; у центрі, фактичні кадри з захопленого відео, використані як істина; справа, синтетичні представлення, створені Генеративною Адверсарною Мережею.

GAN-згенеровані зображення з першого експерименту. Зліва, дані точкової хмари; у центрі, фактичні кадри з захопленого відео, використані як істина; справа, синтетичні представлення, створені Генеративною Адверсарною Мережею.

Автори коментують:

‘Тестовий набір є повністю новим записом, який GAN ніколи не бачила раніше тесту. Це було передбачено лише за інформацією про відбивну здатність з точкової хмари.

‘Ми вирішили показати кадри з чорними автомобілями, оскільки чорні автомобілі зазвичай важко виявити з LiDAR. Ми бачимо, що генератор навчився генерувати чорні автомобілі, ймовірно, з контекстної інформації, через те, що кольори і точні форми об’єктів у передбачених зображеннях не ідентичні тим, що в реальних зображеннях.’

Для другого експерименту автори навчили GAN протягом 40 епох при розмірі партії 1, що призвело до подібного представлення ‘репрезентативних’ чорних автомобілів, отриманих в основному з контексту. Ця конфігурація також була використана для генерації відео, яке показує GAN-згенеровані кадри (зображено зверху, у зразковому зображенні нижче) разом з кадрами істини.

Оцінка

Звичайний процес оцінки і порівняння з існуючими найкращими результатами не був можливим у цьому проєкті через його унікальну природу. Замість цього дослідники розробили спеціальну метрику щодо ступеня, у якому автомобілі (дрібні і мимовільні частини джерельного відео) представлені у вихідному відео.

Вони обрали 100 пар LiDAR/згенерованих зображень з кожного набору і ефективно розділили кількість зображень автомобілів, присутніх у джерельному відео, на кількість зображень автомобілів, присутніх у синтетичних даних, що призвело до метричної шкали від 0 до 1.

Автори заявляють:

‘Результат у обидвох експериментах був між 0,7 і 0,8. Враховуючи той факт, що загальна якість передбачених зображень нижча, ніж у реальних зображень (це загалом складніше виявити об’єкти у зображеннях нижчої якості), цей результат вказує на те, що більша частина автомобілів, присутніх у джерельному матеріалі, присутня у передбачених зображеннях.’

Дослідники прийшли до висновку, що виявлення чорних транспортних засобів, яке є проблемою як для систем, заснованих на комп’ютерному зорі, так і для LiDAR, може бути здійснено шляхом виявлення відсутності даних для секцій зображення:

‘Той факт, що у передбачених зображеннях інформація про кольори і точні форми не ідентичні тим, що в реальних зображеннях, свідчить про те, що передбачення чорних автомобілів в основному походить з контекстної інформації, а не з LiDAR-відбивної здатності точок самих по собі.

‘Ми пропонуємо, що, окрім традиційної системи LiDAR, друга система, яка генерує фото-реалістичні зображення з LiDAR-точкових хмар, повинна працювати одночасно для візуального розпізнавання об’єктів в реальному часі.’

Дослідники планують розвивати роботу в майбутньому з більшим набором даних.

Затримка і переповнений стек обробки SDV

Один з коментаторів широко поширеного твіту про аварію Автопілота оцінив, що, рухаючись зі швидкістю близько 75 миль у годину (110 футів у секунду), відеопотік, що працює з частотою 20 кадрів у секунду, би покрив лише 5,5 футів на кадр. Однак, якщо транспортний засіб був обладнаний останнім апаратним і програмним забезпеченням Tesla, частота кадрів би була 36 кадрів у секунду (для основної камери), що встановлює оціночну швидкість на рівні 110 футів у секунду (три фути на кадр).

Окрім вартості і ергономіки, проблема використання LiDAR як додаткового потоку даних полягає у величезному масштабі інформаційного “затору” входних даних у фреймворк обробки SDV. У поєднанні з критичним характером завдання це, здається, змусило радар і LiDAR вийти з стека Автопілота на користь методів оцінки, заснованих на зображенні.

Отже, здається малоймовірним, що система, яка використовує LiDAR – яка сама по собі додала б до переробного затору в Автопілоті – для виведення фото-реалістичної графіки, є здійсненною з точки зору Tesla.

Засновник Tesla Ілон Маск не є повним критиком LiDAR, який, як він зазначає, використовується компанією SpaceX для процедур докування, але вважає, що ця технологія “марна” для самохідних транспортних засобів. Маск пропонує, що проникаюча довжина хвилі, така як ~4 мм точної радіолокації, була б більш корисною.

Однак, станом на червень 2021 року, транспортні засоби Tesla не обладнані радаром. Наразі не видно багато проєктів, призначених для генерації потоків зображень з радара таким же чином, як і поточний ізраїльський проєкт намагається (хоча Міністерство енергетики США спонсорувало одну спробу для радар-джереленої графіки GAN у 2018 році).

 

Перша публікація 23 грудня 2021 року.

 

Письменник про машинне навчання, спеціаліст у галузі синтезу людських зображень. Колишній керівник дослідницького контенту в Metaphysic.ai, до його розформування в DNEG's Brahma.ai.
Портфоліо сайт: martinanderson.ai
Контакт: martin@martinanderson.ai