Модели и платформы ИИ

Исследование Datagen показывает широкое внедрение синтетических данных

mm
Добавьте Unite.AI в избранные источники в Google

Новое исследование, заказанное компанией Datagen, лидером в области генерации синтетических данных, содержит много интересных выводов о том, как синтетические данные используются в области компьютерного зрения (CV) для продвижения искусственного интеллекта (AI) и машинного обучения (ML).

Новое исследование, проведенное компанией Wakefield Research и исследовавшее обучающие данные в области компьютерного зрения, было озаглавлено «Синтетические данные: ключ к производству готового ИИ в 2022 году». Оно опросило 300 специалистов в области компьютерного зрения из 300 уникальных организаций из разных отраслей.

Сосредоточение вокруг синтетических данных

Одним из основных выводов стало то, что область начинает сосредотачиваться вокруг синтетических данных, используя их для решения проблем, связанных с задержками и отменами проектов.

Другой важный момент исследования был акцент на том, что обучающие данные стали источником осложнений для специалистов в области компьютерного зрения, что приводит к замедлению прогресса компании в CV.

Наиболее распространенными проблемами были: потраченное время и/или ресурсы на переобучение системы; плохая аннотация, в результате которой возникают проблемы с качеством; плохое покрытие данных области применения; и недостаточное количество данных.

Такие проблемы препятствуют прогрессу проекта, и они привели к тому, что большинство команд CV столкнулись с значительными задержками и отменами проектов. Согласно опросу, 99% респондентов столкнулись с отменами проектов, 80% столкнулись с задержками проектов, продолжавшимися не менее 3 месяцев, и 33% столкнулись с задержками проектов, продолжавшимися 7 месяцев или более.

Широкий интерес и внедрение

Исследование также показало многие тенденции, указывающие на широкий интерес к синтетическим данным. Более конкретно, 96% команд компьютерного зрения сообщили, что они уже используют синтетические данные в обучении и тестировании моделей компьютерного зрения.

Datagen также спросил организации, какова была их основная мотивация для использования синтетических данных, и команды сообщили, что это было тестирование, обучение и решение крайних случаев.

Когда речь идет о преимуществах синтетических данных, респонденты сказали, что наиболее заметными были сокращение времени до производства, устранение проблем с конфиденциальностью, снижение предвзятости, уменьшение ошибок аннотации и маркировки, и улучшение прогностического моделирования.

Офир Чакон – основатель и генеральный директор Datagen.

«Синтетические данные – это будущее данных. Это новый способ контроля и потребления данных, необходимых нашим системам ИИ», – сказал Чакон. «По мере того, как симуляция улучшается со временем, с всеми ее преимуществами, она займет место трудоемкого ручного сбора данных, который больше не масштабируется с той скоростью, с которой развивается мир».

Вы можете прочитать полный отчет Datagen здесь.

Алекс возглавляет новостные операции Unite.AI, основанные на ИИ, сочетая журналистику, исследования и автоматизацию, чтобы обеспечить своевременное и масштабируемое освещение искусственного интеллекта. Его работа способствует эффективному выявлению новых разработок в области искусственного интеллекта, при этом поддерживая редакционные стандарты издания.