Modely a platformy AI
Nová auto-označovací technologie Voxel51 slibuje snížit náklady na anotaci o 100 000x
Zásadně nová studie počítačové vize startupu Voxel51 naznačuje, že tradiční model anotace dat je na pokraji převratu. Ve výzkumu zveřejněném dnes společnost uvádí, že její nový auto-označovací systém dosahuje až 95% lidské úrovně přesnosti, zatímco je 5 000x rychlejší a až 100 000x levnější než ruční označování.
Studie porovnala základní modely, jako je YOLO-World a Grounding DINO, na známých datech, včetně COCO, LVIS, BDD100K a VOC. Zajímavé je, že v mnoha reálných scénářích modely školené výhradně na umělými inteligencí generovanými značkami fungovaly stejně dobře nebo dokonce lépe než ty, které byly školeny na lidských značkách. Pro společnosti, které staví počítačové vidění systémy, jsou důsledky obrovské: miliony dolarů na nákladech na anotaci by mohly být ušetřeny a cykly vývoje modelů by se mohly zkrátit z týdnů na hodiny.
Nová éra anotace: Od manuální práce k modelům vedeným potrubím
Po desetiletích byla anotace dat bolestivou uzávěrkou v rozvoji umělé inteligence. Od ImageNetu po datasety autonomních vozidel se týmy spoléhaly na obrovské armády lidských pracovníků, aby nakreslili ohraničující rámečky a segmentovaly objekty – úsilí, které bylo jak nákladné, tak pomalé.
Převládající logika byla jednoduchá: více lidsky označených dat = lepší umělé inteligence. Ale výzkum Voxel51 otočil tento předpoklad vzhůru nohama.
<p Jejich přístup využívá předem naučené základní modely – některé s nulovou ranou schopností – a integruje je do potrubí, které automatizuje rutinní označování, zatímco používá aktivní učení, aby označilo nejisté nebo složitější případy pro lidskou kontrolu. Tato metoda dramaticky snižuje jak čas, tak náklady.
V jednom testu označování 3,4 milionu objektů pomocí NVIDIA (NVDA ) L40S GPU trvalo jen něco přes hodinu a stálo 1,18 dolaru. Ruční označování pomocí AWS SageMaker by trvalo téměř 7 000 hodin a stálo by přes 124 000 dolarů. V besonders náročných případech – jako je identifikace vzácných kategorií v datech COCO nebo LVIS – modely s automatickým označením občas překonaly své lidsky označené protějšky. Tento překvapivý výsledek může pocházet z konzistentních vzorců označování základních modelů a jejich školení na velkých internetových datech.
Uvnitř Voxel51: Tým, který mění pracovní postupy vizuální umělé inteligence
Založena v roce 2016 profesorem Jasonem Corsem a Brianem Moorem na University of Michigan, Voxel51 původně začala jako poradenská firma zaměřená na videoanalytiku. Corso, veterán v počítačovém vidění a robotice, publikoval přes 150 akademických článků a přispívá rozsáhlým otevřeným kódem do komunity umělé inteligence. Moore, bývalý doktorand Corso, působí jako generální ředitel.
Zásadním okamžikem se stalo, když tým uznal, že většina uzávěrek umělé inteligence nebyla v návrhu modelu, ale v datech. Tato inspirace je vedla k vytvoření FiftyOne, platformy navržené pro umožnění inženýrům prozkoumat, kurátovat a optimalizovat vizuální dataset více efektivně.
Za roky společnost získala přes $45 milionů, včetně $12,5 milionu série A a $30 milionů série B vedené Bessemer Venture Partners. Následovala adopce podniků, s významnými klienty, jako jsou LG Electronics, Bosch, Berkshire Grey (BGRY ) , Precision Planting a RIOS, kteří integrovali nástroje Voxel51 do svých produkčních pracovních postupů umělé inteligence.
Od nástroje k platformě: Rozšiřující se role FiftyOne
FiftyOne vyrostla z jednoduchého nástroje pro vizualizaci datasetů na komplexní, datocentrickou platformu umělé inteligence. Podporuje širokou škálu formátů a schémat označování – COCO, Pascal VOC, LVIS, BDD100K, Open Images – a integruje se bezproblémově s rámci, jako jsou TensorFlow a PyTorch.
Více než jen nástroj pro vizualizaci, FiftyOne umožňuje pokročilé operace: najít duplicitní obrázky, identifikovat chybně označené vzorky, zobrazit outliery a měřit režimy selhání modelu. Jeho ekosystém pluginů podporuje vlastní moduly pro optickou charakterovou rozpoznávání, video Q&A a analýzu založenou na vkládání.
Verze pro podniky, FiftyOne Teams, zavádí funkce pro spolupráci, jako je kontrola verzí, oprávnění přístupu a integrace s cloudovým úložištěm (například S3), stejně jako nástroje pro anotaci, jako je Labelbox a CVAT. Značně také spolupracovala s V7 Labs, aby zjednodušila tok mezi kurátorem datasetů a ruční anotací.
Přemýšlení o anotačním průmyslu
Výzkum auto-označování Voxel51 zpochybňuje předpoklady, na nichž stojí téměř 1miliardový anotační průmysl. V tradičních pracovních postupech musí být každý obrázek dotčen člověkem – nákladný a často zbytečný proces. Voxel51 tvrdí, že většina této práce může být nyní eliminována.
S jejich systémem jsou většina obrázků označena umělou inteligencí, zatímco pouze hraniční případy jsou eskalovány lidem. Tato hybridní strategie nejen snižuje náklady, ale také zajišťuje vyšší celkovou kvalitu dat, protože lidské úsilí je rezervováno pro nejobtížnější nebo nejvýznamnější anotace.
Tento posun se shoduje s širšími trendy v oblasti umělé inteligence směrem k datocentrické umělé inteligenci – metodologii, která se zaměřuje na optimalizaci trénovacích dat, spíše než na neustálé ladění architektur modelů.
Konkurenční krajina a průmyslové přijetí
Investoři, jako je Bessemer, považují Voxel51 za “datovou orchestraci” pro umělou inteligenci – podobně jako nástroje DevOps transformovaly vývoj softwaru. Jejich open-source nástroj získal miliony stažení a jejich komunita zahrnuje tisíce vývojářů a týmů strojového učení po celém světě.
Zatímco jiné startupy, jako Snorkel AI, Roboflow a Activeloop, se také zaměřují na datové pracovní postupy, Voxel51 se vyznačuje svou šíří, open-source etikou a podnikovou infrastrukturou. Spíše než soutěžit s poskytovateli anotací, platforma Voxel51 je doplňuje – dělá stávající služby efektivnější prostřednictvím selektivní kurátorky.
Budoucí důsledky
Dlouhodobé důsledky jsou hluboké. Pokud bude široce přijata, Voxel51 metodologie by mohla dramaticky snížit bariéru vstupu pro počítačové vidění, demokratizovat toto pole pro startupy a výzkumníky, kteří postrádají rozsáhlé rozpočty na označování.
Mimo úspory nákladů tato přístup také vytváří základ pro kontinuální učící se systémy, kde modely ve výrobě automaticky označí selhání, která jsou pak přezkoumána, přeožnána a vrácena do trénovacích dat – vše v rámci stejného orchestrovaného potrubí.
Širší vize společnosti se shoduje s tím, jak se umělá inteligence vyvíjí: ne jen chytřejší modely, ale chytřejší pracovní postupy. V této vizi anotace není mrtvá – ale již není doménou hrubé síly. Je strategická, selektivní a poháněná automatizací.












