AI-modeller og plattformer
Voxel51s nye auto-merkingsteknologi lover å kutte annoteringskostnadene med 100 000 ganger
En banebrytende ny studie fra computer vision-startup Voxel51 antyder at den tradisjonelle data-annoteringsmodellen er på vei til å bli erstattet. I forskning som er offentliggjort i dag, rapporterer selskapet at deres nye auto-merkingssystem oppnår opptil 95 % av menneske-nivå-nøyaktighet mens det er 5 000 ganger raskere og opptil 100 000 ganger billigere enn manuell merking.
Studien benchmarket foundation-modeller som YOLO-World og Grounding DINO på godt kjente datasett som COCO, LVIS, BDD100K og VOC. Merkbart, i mange virkelige scenarier, fungerte modeller som ble trent eksklusivt på AI-genererte merker like godt som – eller endog bedre enn – de som ble trent på menneske-merker. For selskaper som bygger computer vision-systemer, er implikasjonene enorme: millioner av dollar i annoteringskostnader kan spares, og modellutviklingscyklusene kan forkortes fra uker til timer.
Den nye æraen for annotering: Fra manuell arbeid til modell-drevne pipelines
I tiår, har data-annotering vært en smertefull flaskehals i AI-utvikling. Fra ImageNet til datasett for autonome kjøretøy, har teamene avhengig av enorme hærer av menneskelige arbeidere for å tegne avgrensningsskjermer og segmentere objekter – en innsats som både er kostbar og treg.
Den rådende logikken var enkel: mer menneske-merket data = bedre AI. Men Voxel51s forskning snur denne antagelsen på hodet.
Deres tilnærming utnytter forhånds-trente foundation-modeller – noen med zero-shot-evner – og integrerer dem i en pipeline som automatiserer rutinemessig merking mens den bruker aktiv læring for å flagge usikre eller komplekse saker for menneskelig gjennomgang. Denne metoden reduserer både tid og kostnad dramatisk.
I en test, tok merking av 3,4 millioner objekter med en NVIDIA (NVDA ) L40S GPU bare over en time og kostet 1,18 dollar. Å gjøre det manuelt med AWS SageMaker ville ha tatt nesten 7 000 timer og kostet over 124 000 dollar. I særlig utfordrende tilfeller – som å identifisere sjeldne kategorier i COCO- eller LVIS-datasettene – fungerte auto-merkede modeller av og til bedre enn deres menneske-merkede motparter. Dette overraskende resultat kan stamme fra foundation-modellens konsekvente merkingmønster og deres trening på stor skala internett-data.
Innsiden Voxel51: Teamet som omdefinerer visuelle AI-arbeidsflyter
Grunnlagt i 2016 av Professor Jason Corso og Brian Moore ved University of Michigan, startet Voxel51 opprinnelig som en konsulentbedrift som fokuserte på videoanalyse. Corso, en veteran i computer vision og robotikk, har publisert over 150 akademiske artikler og bidrar med omfattende åpen kildekode til AI-samfunnet. Moore, en tidligere Ph.D.-student under Corso, fungerer som CEO.
Vendepunktet kom da teamet innsett at de fleste AI-flaskehalser ikke var i modell-design – men i data. Denne innsikten inspirerte dem til å skape FiftyOne, en plattform designet for å gi ingeniører mulighet til å utforske, kuratere og optimalisere visuelle datasett mer effektivt.
Over årene har selskapet samlet inn over $45 millioner, inkludert en $12,5 millioner Series A og en $30 millioner Series B ledet av Bessemer Venture Partners. Bedrifts-adoptsjon fulgte, med store kunder som LG Electronics, Bosch, Berkshire Grey (BGRY ) , Precision Planting og RIOS integrerte Voxel51s verktøy i sine produksjons-AI-arbeidsflyter.
Fra verktøy til plattform: FiftyOnes utvidende rolle
FiftyOne har vokst fra et enkelt datasett-visningsverktøy til en omfattende, data-sentrert AI-plattform. Den støtter en rekke formater og merkingsskjemaer – COCO, Pascal VOC, LVIS, BDD100K, Open Images – og integrerer sammen med rammeverk som TensorFlow og PyTorch.
Mer enn et visningsverktøy, FiftyOne muliggjør avanserte operasjoner: finne duplikate bilder, identifisere feilmerkede eksempler, fremheve outliers og måle modellfeilmoduser. Dets plugin-økosystem støtter tilpassede moduler for optisk tegngjenkjenning, video Q&A og innbedningsbasert analyse.
Bedriftsversjonen, FiftyOne Teams, introduserer samarbeidsfunksjoner som versjonskontroll, tilgangsberettigelse og integrasjon med sky-lagring (f.eks. S3), samt merkingverktøy som Labelbox og CVAT. Merkverdig, Voxel51 har også inngått partnerskap med V7 Labs for å strømlinje flyten mellom datasettkurering og manuell merking.
Omtenkning av annoteringsindustrien
Voxel51s auto-merking-forskning utfordrer antagelsene som ligger til grunn for en nesten $1 milliarder stor annoteringsindustri. I tradisjonelle arbeidsflyter må hver bilde berøres av en menneske – en kostbar og ofte redundant prosess. Voxel51 argumenterer for at mesteparten av denne arbeidskraften nå kan elimineres.
Med deres system, merkes de fleste bildene av AI, mens kun randtilfeller eskaleres til mennesker. Denne hybridstrategien kutter ikke bare kostnader, men sikrer også høyere overordnet datakvalitet, ettersom menneskelig innsats reserveres for de mest vanskelige eller verdifulle annoteringene.
Denne skiftet paralleller bredere trender i AI-feltet mot data-sentrert AI – en metode som fokuserer på å optimalisere treningdataene i stedet for å justere modellarkitekturer uten ende.
Konkurranselandskap og bransjemottak
Investorer som Bessemer ser på Voxel51 som “data-orkestreringslaget” for AI – likt hvordan DevOps-verktøy transformerte programvareutvikling. Deres åpne kildekode-verktøy har samlet inn millioner av nedlastinger, og deres samfunn inkluderer tusenvis av utviklere og ML-team verden over.
Mens andre startup-bedrifter som Snorkel AI, Roboflow og Activeloop også fokuserer på data-arbeidsflyter, skiller Voxel51 seg ut med sin bredde, åpne kildekode-mentalitet og bedrifts-klasse-infrastruktur. I stedet for å konkurrere med annoteringsleverandører, kompletterer Voxel51s plattform dem – gjør eksisterende tjenester mer effektive gjennom selektiv kurering.
Fremtidige implikasjoner
De langvarige implikasjonene er dyptgående. Hvis Voxel51s metode blir vidt akseptert, kan den dramatisk senke terskelen for inngang til computer vision, demokratisere feltet for startup-bedrifter og forskere som mangler store merkingbudsjett.
Ut over å spare kostnader, legger denne tilnærmingen også grunnlaget for kontinuerlige læringsystemer, hvor modeller i produksjon automatisk flagger feil, som deretter gjennomgås, merkes på nytt og foldes tilbake inn i treningdataene – alt innen samme orkestrerte pipeline.
Selskapets bredere visjon harmonerer med hvordan AI utvikler seg: ikke bare smartere modeller, men smartere arbeidsflyter. I den visjonen, er annotering ikke død – men det er ikke lenger domenet for brutt arbeid. Det er strategisk, selektivt og drevet av automatisering.












