Моделі та платформи ШІ

DataGen отримує 18 мільйонів доларів інвестицій для створення синтетичних даних для штучного інтелекту

mm
Додайте Unite.AI до бажаних джерел у Google

Ізраїльська стартап-компанія DataGen недавно зібрала 18,5 мільйонів доларів для фінансування створення платформи, присвяченої виробництву синтетичних даних для компаній штучного інтелекту.

Будь-яка компанія штучного інтелекту стикається з однією і тією же основною проблемою – збором даних, необхідних для навчання моделей штучного інтелекту. Потребність у високоякісних навчальних даних така велика, що призвела до появи цілої підгалузі, присвяченої постачанню компаній штучного інтелекту необхідними даними для навчання моделей. Компанії штучного інтелекту та компанії, пов’язані зі штучним інтелектом, завжди шукають нові способи отримання необхідних даних. Одним із способів отримання цих навчальних даних є просто виготовлення або генерація даних.

Як повідомляє Fortune, DataGen спеціалізується на використанні власних моделей машинного навчання для створення синтетичних даних для навчання моделей інших компаній, особливо зображень і відеоданих. Генеровані компанією дані потім використовуються клієнтами для навчання своїх власних моделей штучного інтелекту. За словами генерального директора і засновника DataGen Офіра Чакона, компанія може створити повністю синтетичний набір даних для клієнтської компанії за кілька годин. Це значно швидше, ніж час, необхідний для підготовки набору даних для використання, який часто становить тижні або навіть місяці маркування даних.

Є інші причини, чому синтетичні дані привабливі для компаній, крім відносної швидкості, з якою їх можна підготувати. Синтетичні дані не супроводжуються проблемами конфіденційності, які існують у реальних даних. Коли створюються закони про захист даних, стає більш привабливим мати синтетичні навчальні дані. Одна з оцінок, зроблених технологічною аналітичною фірмою Gartner, передбачає, що до 2023 року близько 65% населення світу буде захищено якимись законами про захист даних.

Незважаючи на те, що синтетичні дані не засновані на реальних людях, вони все одно можуть бути упередженими. Дані, згенеровані синтетичною моделлю даних, матимуть ті самі закономірності, які мали原始ні навчальні дані, тобто якщо набір даних упереджений, ці упередження існуватимуть у nově згенерованих даних. DataGen має стратегії зниження упередженості даних у згенерованих даних. Одним із методів зниження упередженості синтетичних даних є збільшення частоти відносно рідкісних подій, тобто якщо один клас у наборі даних підrepresented, його частота може бути збільшена до більш рівної.

Техніка збільшення частоти рідкісних подій вкрай важлива при створенні наборів даних, які включають потенційно небезпечні сценарії. Розгляньте набір даних, використовуваний для навчання автономного транспортного засобу. Транспортний засіб повинен надійно реагувати на рідкісні події, наприклад, відкриття провалу на дорозі. Однак ці події дуже рідкісні, і отримання навчальних даних для цих подій є складним. Через це навчальні дані для цих рідкісних подій часто потрібно генерувати.

Як пояснив Чакон через Fortune:

“Наші клієнти мають повний контроль над усіма параметрами, які входять до даних, які вони створюють. Реальне значення полягає в тому, що після розгортання ви можете бути впевнені, що воно працюватиме добре в різних доменах, з різними етнічними групами, у різних географічних місцях або в будь-якому середовищі, яке ви можете уявити.”

DataGen використовує генеративні суперницькі мережі (GAN) для генерації реалістичних симуляцій реальних об’єктів і подій. Чакон пояснив, що компанія може надійно генерувати реалістичні приклади всього, що涉ляє внутрішнє середовище або сприйняття людини. Наприклад, набір даних зображень, згенерований DataGen, міг би включати приклади об’єктів, використовуваних для навчання роботизованої руки для логістики складу, при цьому згенеровані зображення були б нерозрізними від реальних. Програмне забезпечення DataGen може генерувати 3D-об’єкти шляхом поєднання візуальної сітки з фізичною системою моделювання.

Інвесторами DataGen є різні відомі особи та компанії. Інвесторами є директори відділу досліджень штучного інтелекту Nvidia (NVDA ) та Інституту Макса Планка з інтелектуальних систем, а також Ентоні Голдблюм, генеральний директор Kaggle.

Блогер і програміст з спеціалізацією у темах Machine Learning і Deep Learning. Даніель сподівається допомогти іншим використовувати силу штучного інтелекту для соціальної добробути.