Модели и платформы ИИ
DataGen привлекла $18 миллионов инвестиций для создания синтетических данных для ИИ
Израильская стартап-компания DataGen недавно привлекла $18,5 миллионов долларов для финансирования создания платформы, посвященной производству синтетических данных для компаний, занимающихся искусственным интеллектом.
Любая компания, занимающаяся искусственным интеллектом, сталкивается с одной и той же основной проблемой – сбором данных, необходимых для обучения моделей ИИ. Потребность в высококачественных тренировочных данных так велика, что привела к возникновению целой подотрасли, посвященной предоставлению компаниям ИИ данных, необходимых для обучения их моделей. Компании ИИ и смежные компании всегда ищут новые способы получения необходимых им данных. Одним из способов получить эти тренировочные данные является создание или генерация данных.
Как сообщает Fortune, DataGen специализируется на использовании своих собственных моделей машинного обучения для создания синтетических данных для других компаний для обучения их моделей, особенно изображений и видео. Сгенерированные компанией данные затем используются ее клиентами для обучения своих собственных моделей ИИ. Согласно генеральному директору и основателю DataGen, Офиру Чакону, компания может создать полностью синтетический набор данных для клиентской компании всего за несколько часов. Это существенно быстрее, чем время, необходимое для подготовки набора данных к использованию, которое часто занимает недели или даже месяцы标记 данных.
Существуют и другие причины, почему синтетические данные привлекательны для компаний, помимо относительной скорости, с которой они могут быть подготовлены. Синтетические данные не вызывают тех же проблем с конфиденциальностью, что и реальные данные. По мере создания все большего количества законов, направленных на защиту конфиденциальности данных людей, становится более привлекательным иметь синтетические тренировочные данные. Одна из оценок, предоставленная технологическим аналитическим фирмой Gartner, предполагает, что к 2023 году около 65% населения мира будут иметь свои данные, защищенные некоторым типом закона о конфиденциальности данных.
Несмотря на то, что синтетические данные не основаны на реальных людях, они все равно могут быть предвзятыми. Данные, сгенерированные синтетической моделью данных, будут иметь те же закономерности, что и исходные тренировочные данные, что означает, что если набор данных предвзят, эти предвзятости будут существовать в сгенерированных данных. DataGen имеет стратегии снижения предвзятости данных в сгенерированных данных. Одним из методов снижения предвзятости в синтетических данных является увеличение частоты относительно редких событий, что означает, что если один класс в наборе данных недопредставлен, его частота может быть увеличена до чего-то более равного.
Техника увеличения частоты редких событий чрезвычайно важна при создании наборов данных, которые включают потенциально опасные сценарии. Рассмотрим набор данных, используемый для обучения автономного транспортного средства. Транспортное средство должно надежно реагировать на редкие события, такие как образование sinkhole на дороге. Однако эти события очень редки, и получение тренировочных данных для этих событий сложно. По этой причине тренировочные данные для этих редких событий часто необходимо генерировать.
Как объяснил Чакон через Fortune:
“Наши клиенты имеют полный контроль над всеми параметрами, которые входят в данные, которые они создают. Реальное последствие заключается в том, что, как только оно развернуто, вы можете быть уверены, что оно будет работать хорошо в разных доменах, с разными этническими группами, в разных географических местах или любой среде, которую вы можете представить.”
DataGen использует генеративные состязательные сети (GAN) для создания реалистичных симуляций реальных объектов и событий. Чакон объяснил, что компания может надежно генерировать реалистичные примеры всего, что связано с внутренними средами или человеческим восприятием. Например, набор данных изображений, сгенерированный DataGen, может включать примеры объектов, используемых для обучения роботизированной руки для логистики складов, с сгенерированными изображениями, которые выглядят неотличимыми от реальных. Программное обеспечение DataGen может создавать 3D-объекты, объединяя визуальную сетку с системой физического симулятора.
Инвесторами DataGen являются различные известные лица и компании. Инвесторами являются директора исследовательского отдела ИИ Nvidia (NVDA ) и Института интеллектуальных систем Макса Планка, а также Энтони Голдблюм, генеральный директор Kaggle.












