Modele i platformy AI
Badanie Datagen sugeruje powszechną adopcję danych syntetycznych
Nowe badanie zlecone przez Datagen, lidera w generowaniu danych syntetycznych, miało wiele interesujących ustaleń na temat tego, jak dane syntetyczne są wykorzystywane w całym polu widzenia komputera (CV), aby rozwijać aplikacje sztucznej inteligencji (AI) i uczenia maszynowego (ML).
Nowe badanie, które zostało przeprowadzone przez Wakefield Research i które badało dane szkoleniowe w dziedzinie widzenia komputera, nosi tytuł „Dane syntetyczne: klucz do gotowości do produkcji AI w 2022 roku”. Zapytano 300 profesjonalistów z dziedziny CV z 300 unikalnych organizacji z różnych branż.
Konsolidacja wokół danych syntetycznych
Jednym z głównych ustaleń było to, że dziedzina zaczyna się konsolidować wokół danych syntetycznych, wykorzystując je do rozwiązywania problemów związanych z opóźnieniami i anulowaniami projektów.
Innym ważnym punktem badania było podkreślenie, że dane szkoleniowe stały się źródłem komplikacji dla profesjonalistów z dziedziny widzenia komputera, co prowadzi do spowolnienia postępów firmy w dziedzinie CV.
Najbardziej rozpowszechnione problemy obejmowały: zmarnowane czas i/lub zasoby na ponowne szkolenie systemu; słabą adnotację, która skutkuje problemami z jakością; słabą pokrycie danych w dziedzinie aplikacji; oraz brak wystarczającej ilości danych.
Problemy takie jak te utrudniają postęp projektu i doprowadziły do tego, że większość zespołów CV doświadczyła znacznych opóźnień i anulowań projektów. Według ankiety, 99% respondentów doświadczyło anulowania projektów, 80% doświadczyło opóźnień trwających co najmniej 3 miesiące, a 33% doświadczyło opóźnień trwających 7 miesiące lub dłużej.
Powszechny zainteresowanie i adopcja
Badanie wykazało również wiele trendów, które wskazują na powszechne zainteresowanie danymi syntetycznymi. Konkretnie, 96% zespołów CV zgłosiło, że już teraz wykorzystuje je w szkoleniu i testowaniu modeli widzenia komputera.
Datagen również zapytał organizacje, jaki był ich główny motyw wykorzystania danych syntetycznych, a zespoły zgłosiły, że jest to testowanie, szkolenie i rozwiązywanie przypadków brzegowych.
Jeśli chodzi o korzyści z danych syntetycznych, respondenci stwierdzili, że najbardziej wyraziste są: zmniejszony czas produkcji, wyeliminowanie problemów z prywatnością, zmniejszona stronniczość, mniej błędów adnotacji i etykietowania, oraz poprawa modelowania predykcyjnego.
Ofir Chakon jest założycielem i dyrektorem generalnym Datagen.
„Dane syntetyczne to przyszłość danych. To nowy sposób kontrolowania i konsumowania danych, których potrzebują nasze systemy AI”, powiedział Chakon. „W miarę jak symulacja staje się lepsza z czasem, ze wszystkimi swoimi korzyściami, zajmie miejsce pracochłonnej ręcznej kolekcji danych, która nie jest już skalowalna w tempie, w jakim ewoluuje świat.”
Można przeczytać pełne sprawozdanie Datagen tutaj.












