AI-modeller och plattformar
Voxel51:s nya auto-etikettningsteknik lovar att skära ner anteckningskostnaderna med 100 000 gånger
En banbrytande ny studie från datorseende-startup Voxel51 tyder på att den traditionella dataanteckningsmodellen är på väg att vändas upp och ner. I forskning som släpptes idag rapporterar företaget att deras nya auto-etikettningssystem uppnår upp till 95% av mänsklig nivås noggrannhet medan det är 5 000 gånger snabbare och upp till 100 000 gånger billigare än manuell etikettning.
Studien benchmarkade grundmodeller som YOLO-World och Grounding DINO på välkända datamängder som COCO, LVIS, BDD100K och VOC. Förvånansvärt nog presterade modeller som tränats uteslutande på AI-genererade etiketter i många verkliga scenarier lika bra som – eller till och med bättre än – de som tränats på mänskliga etiketter. För företag som bygger datorseendesystem är implikationerna enorma: miljontals dollar i anteckningskostnader kunde sparas, och modellutvecklingscykler kunde förkortas från veckor till timmar.
Den nya eran av anteckning: Från manuellt arbete till modell-ledda pipelines
Under decennier har dataanteckning varit en smärtsam flaskhals i AI-utveckling. Från ImageNet till autonoma fordon datamängder har team förlitat sig på enorma arméer av mänskliga arbetare för att rita begränsningsrutor och segmentera objekt – en insats som är både kostsam och långsam.
Den rådande logiken var enkel: mer mänskligt etiketterad data = bättre AI. Men Voxel51:s forskning vänder den antagandet på huvudet.
Deras tillvägagångssätt utnyttjar förtränade grundmodeller – vissa med nollskott -förmåga – och integrerar dem i en pipeline som automatiserar rutinmässig etikettning medan den använder aktivt lärande för att flagga osäkra eller komplexa fall för mänsklig granskning. Denna metod minskar dramatiskt både tid och kostnad.
I ett test tog etikettering av 3,4 miljoner objekt med en NVIDIA (NVDA ) L40S GPU bara över en timme och kostade 1,18 dollar. Att göra det manuellt med AWS SageMaker skulle ha tagit nästan 7 000 timmar och kostat över 124 000 dollar. I särskilt utmanande fall – som att identifiera sällsynta kategorier i COCO- eller LVIS-dataseten – presterade auto-etiketterade modeller ibland bättre än sina mänskligt etiketterade motsvarigheter. Detta överraskande resultat kan bero på de grundläggande modellernas konsekventa etikettmönster och deras utbildning på stora internetdata.
Inuti Voxel51: Teamet som omformar visuella AI-arbetsflöden
Voxel51 grundades 2016 av Professor Jason Corso och Brian Moore vid University of Michigan. Voxel51 började ursprungligen som ett konsultföretag med fokus på videoanalys. Corso, en veteran inom datorseende och robotik, har publicerat över 150 akademiska artiklar och bidrar med omfattande öppen källkod till AI-samhället. Moore, en före detta doktorsexamen student till Corso, fungerar som VD.
Vändpunkten kom när teamet insåg att de flesta AI-flaskhalsar inte var i modellutformning – utan i data. Den insikten inspirerade dem att skapa FiftyOne, en plattform utformad för att ge ingenjörer möjlighet att utforska, kurera och optimera visuella datamängder mer effektivt.
Under åren har företaget samlat in över $45M, inklusive en $12,5M Series A och en $30M Series B ledd av Bessemer Venture Partners. Företagsadoption följde, med stora kunder som LG Electronics, Bosch, Berkshire Grey (BGRY ) , Precision Planting och RIOS integrerar Voxel51:s verktyg i sina produktions AI-arbetsflöden.
Från verktyg till plattform: FiftyOne:s utvidgande roll
FiftyOne har vuxit från ett enkelt datamängdsvisualiseringsverktyg till en omfattande, datacentrerad AI-plattform. Den stöder en mängd olika format och etikett scheman – COCO, Pascal VOC, LVIS, BDD100K, Open Images – och integreras sömlöst med ramverk som TensorFlow och PyTorch.
Mer än ett visualiseringsverktyg möjliggör FiftyOne avancerade operationer: hitta dubblettbilder, identifiera felaktigt etiketterade prover, visa avvikare och mäta modellfelmoder. Dess plugin-ekosystem stöder anpassade moduler för optisk teckenigenkänning, video Q&A och inbäddningsbaserad analys.
Företagsversionen, FiftyOne Teams, introducerar samarbetsfunktioner som versionskontroll, åtkomstbehörigheter och integration med molnlagring (t.ex. S3), samt etikettverktyg som Labelbox och CVAT. Noterbart är att Voxel51 också samarbetat med V7 Labs för att strömlinjeforma flödet mellan datamängdskurering och manuell etikettning.
Omprövning av anteckningsindustrin
Voxel51:s auto-etikettningforskning utmanar antagandena som ligger till grund för en nästan 1 miljard dollar stor anteckningsindustri. I traditionella arbetsflöden måste varje bild beröras av en människa – en dyrbart och ofta onödig process. Voxel51 hävdar att de flesta av dessa arbete nu kan elimineras.
Med deras system etiketteras de flesta bilderna av AI, medan endast gränsfall eskaleras till människor. Denna hybridstrategi inte bara skär ner kostnaderna utan säkerställer också högre övergripande datakvalitet, eftersom mänskligt arbete reserveras för de mest svåra eller värdefulla anteckningarna.
Denna förändring följer bredare trender inom AI-området mot datacentrerad AI – en metodik som fokuserar på att optimera utbildningsdata snarare än att ständigt justera modellarkitektur.
Konkurrenslandskap och branschmottagning
Investorer som Bessemer ser Voxel51 som “dataorkestreringslagret” för AI – liknande hur DevOps -verktyg förvandlade programvaruutveckling. Deras öppen källkodsverktyg har fått miljontals nedladdningar, och deras community består av tusentals utvecklare och ML-team över hela världen.
Medan andra startup-företag som Snorkel AI, Roboflow och Activeloop också fokuserar på dataarbetsflöden, sticker Voxel51 ut för sin bredd, öppen källkodsanda och företagsklassad infrastruktur. Snarare än att konkurrera med anteckningsleverantörer kompletterar Voxel51:s plattform dem – gör befintliga tjänster mer effektiva genom selektiv kurering.
Framtida implikationer
De långsiktiga implikationerna är djupgående. Om det antas i stor utsträckning kunde Voxel51:s metodik dramatiskt sänka inträdesbarriären för datorseende, demokratisera området för startup-företag och forskare som saknar stora etikettbudgetar.
Förutom att spara kostnader lägger denna tillvägagångssätt också grunden för kontinuerliga lärandesystem, där modeller i produktion automatiskt flaggar fel, som sedan granskas, ometiketteras och återförs till utbildningsdata – allt inom samma orkestrerade pipeline.
Företagets bredare vision stämmer överens med hur AI utvecklas: inte bara smartare modeller, utan smartare arbetsflöden. I den visionen är anteckning inte död – men det är inte längre området för brutalt arbete. Det är strategiskt, selektivt och driven av automatisering.












