Моделі та платформи ШІ
Дослідження Datagen свідчить про широке впровадження синтетичних даних
Нове дослідження, замовлене компанією Datagen, лідером у сфері генерації синтетичних даних, містить багато цікавих висновків про використання синтетичних даних у галузі комп’ютерного бачення (CV) для розвитку штучного інтелекту (AI) та машинного навчання (ML).
Нове дослідження, яке провело Wakefield Research, та дослідило навчальні дані у сфері комп’ютерного бачення, мало назву «Синтетичні дані: ключ до готових до виробництва AI у 2022 році». Воно опитало 300 фахівців CV з 300 різних організацій у різних галузях.
Консолідування навколо синтетичних даних
Одним з головних висновків було те, що галузь починає консолідуватися навколо синтетичних даних, використовуючи їх для вирішення проблем, пов’язаних із затримками та скасуванням проектів.
Іншим важливим висновком дослідження було те, що навчальні дані стали джерелом ускладнень для фахівців комп’ютерного бачення, що призводить до сповільнення прогресу компанії у сфері CV.
Найбільш поширеними проблемами були: марно витрачений час і/або ресурси на повторну підготовку системи; погана анотація, що призводить до проблем із якістю; погане покриття даних щодо області застосування; та відсутність достатньої кількості даних.
Такі проблеми уповільнюють прогрес проекту, і вони призвели до того, що більшість команд CV пережили значні затримки та скасування проектів. За даними опитування, 99% респондентів пережили скасування проектів, 80% пережили затримки проектів тривалістю не менше 3 місяців, а 33% пережили затримки проекту тривалістю 7 місяців або більше.
Широке зацікавлення та впровадження
Дослідження також виявило багато тенденцій, які свідчать про широке зацікавлення синтетичними даними. Зокрема, 96% команд комп’ютерного бачення повідомили, що вони вже використовують синтетичні дані у процесі навчання та тестування моделей комп’ютерного бачення.
Datagen також запитала організації про основну мотивацію використання синтетичних даних, і команди повідомили, що це тестування, навчання та вирішення крайніх випадків.
Відносно переваг синтетичних даних, респонденти повідомили, що найбільш помітними були скорочення часу до виробництва, ліквідація проблем конфіденційності, зменшення упередженості, зменшення кількості помилок анотації та маркування, а також покращення передбачувальної моделі.
Офір Чакон є засновником та генеральним директором Datagen.
«Синтетичні дані – це майбутнє даних. Це новий спосіб контролю та споживання даних, необхідних нашим системам AI», – сказав Чакон. «По мірі того, як симуляція покращується з часом, із усіма її перевагами, вона займе місце ручного збору даних, який вже не є масштабованим за швидкістю, з якою розвивається світ».
Ви можете прочитати повний звіт Datagen тут.












