Modele i platformy AI

DataGen zabezpiecza 18 milionów dolarów inwestycji w celu stworzenia syntetycznych danych dla sztucznej inteligencji

mm
Dodaj Unite.AI do preferowanych źródeł w Google

Izraelska firma startupowa DataGen niedawno zebrała 18,5 miliona dolarów, aby sfinansować stworzenie platformy poświęconej produkcji syntetycznych danych dla firm sztucznej inteligencji.

Każda firma sztucznej inteligencji stoi przed tym samym podstawowym wyzwaniem, jakim jest zebranie danych niezbędnych do szkolenia modeli sztucznej inteligencji. Potrzeba wysokiej jakości danych szkoleniowych jest tak duża, że doprowadziła do powstania całej gałęzi przemysłu poświęconej dostarczaniu firmom sztucznej inteligencji danych, których potrzebują do szkolenia swoich modeli. Firmy sztucznej inteligencji i pokrewne firmy sztucznej inteligencji są zawsze w poszukiwaniu nowych sposobów, aby uzyskać niezbędne dane. Jednym ze sposobów uzyskania tych danych jest po prostu sfabrykowanie lub wygenerowanie danych.

Według doniesień Fortune, DataGen specjalizuje się w wykorzystywaniu własnych modeli sztucznej inteligencji do tworzenia syntetycznych danych dla innych firm w celu szkolenia ich modeli, szczególnie danych obrazów i wideo. Dane wygenerowane przez firmę są następnie wykorzystywane przez ich klientów do szkolenia własnych modeli sztucznej inteligencji. Jak powiedział CEO i założyciel DataGen, Ofir Chakon, firma może stworzyć cały syntetyczny zestaw danych dla firmy-klienta w zaledwie kilka godzin. Jest to znacznie szybciej niż czas, jaki zwykle zajmuje przygotowanie zestawu danych do użycia, który często trwa tygodnie lub nawet miesiące oznaczania danych.

Istnieją inne powody, dla których syntetyczne dane są atrakcyjne dla firm, poza relatywnie szybkim czasem, w jakim mogą być przygotowane. Syntetyczne dane nie wiążą się z tymi samymi problemami dotyczącymi prywatności, co dane rzeczywiste. Im więcej praw jest tworzonych w celu ochrony prywatności danych, tym bardziej atrakcyjne staje się posiadanie syntetycznych danych szkoleniowych. Jedna z szacunków przedstawionych przez firmę analityczną Gartner przewiduje, że do 2023 roku około 65% ludności świata będzie miało swoje dane chronione przez jakiś rodzaj prawa dotyczącego prywatności danych.

Pomimo faktu, że syntetyczne dane nie opierają się na danych rzeczywistych, mogą one nadal być tendencyjne. Dane wygenerowane przez model syntetycznych danych będą miały te same wzorce, jakie miały dane szkoleniowe, co oznacza, że jeśli zestaw danych jest tendencyjny, te tendencyjności będą istnieć w nowo wygenerowanych danych. DataGen ma strategie redukowania tendencyjności danych w wygenerowanych danych. Jedną z metod redukowania tendencyjności w syntetycznych danych jest zwiększanie częstotliwości występowania rzadkich zdarzeń, co oznacza, że jeśli jeden klasa w zestawie danych jest niedoreprezentowana, jej częstotliwość występowania może być zwiększona do czegoś bardziej równego.

Technika zwiększania częstotliwości występowania rzadkich zdarzeń jest niezwykle ważna podczas tworzenia zestawów danych, które obejmują potencjalnie niebezpieczne sytuacje. Rozważmy zestaw danych wykorzystywany do szkolenia samochodu autonomicznego. Samochód musi niezawodnie reagować na rzadkie zdarzenia, takie jak otwarcie się studni na drodze. Jednak te zdarzenia są bardzo rzadkie, a uzyskanie danych szkoleniowych dla tych zdarzeń jest trudne. Z tego powodu dane szkoleniowe dla tych rzadkich zdarzeń często muszą być generowane.

Jak wyjaśnił Chakon za pośrednictwem Fortune:

“Nasi klienci mają pełną kontrolę nad wszystkimi parametrami, które są wprowadzane do danych, które tworzą. Rzeczywiste znaczenie tego jest takie, że raz wdrożone, możesz być pewien, że będzie działać dobrze w różnych domenach, z różnymi etnicznościami, w różnych lokalizacjach geograficznych lub w jakimkolwiek środowisku, które możesz sobie wyobrazić.”

DataGen wykorzystuje Sieci Przeciwstawne (GAN) do generowania realistycznych symulacji rzeczywistych obiektów i zdarzeń. Chakon wyjaśnił, że firma może niezawodnie generować realistyczne przykłady wszystkiego, co dotyczy środowisk wewnętrznych lub percepcji ludzkiej. Na przykład, zestaw danych obrazów wygenerowanych przez DataGen mógłby zawierać przykłady obiektów wykorzystywanych do szkolenia ramienia robota do logistyki magazynowej, z wygenerowanymi obrazami, które są nie do odróżnienia od rzeczywistych. Oprogramowanie DataGen może generować obiekty 3D, łącząc siatkę wizualną z systemem symulacji fizyki.

Inwestorzy w DataGen obejmują różnorodne wysokoprofilowe osoby i firmy. Inwestorzy obejmują dyrektorów wydziału badań sztucznej inteligencji Nvidia (NVDA ) oraz Instytutu Maxa Plancka dla Systemów Inteligentnych, a także Anthony’ego Goldbloom, CEO Kaggle.

Blogger i programista ze specjalnościami w Machine Learning i Deep Learning tematy. Daniel liczy, że pomoże innym wykorzystać moc sztucznej inteligencji dla dobra społecznego.