AI-modellen en platforms
Nieuwe standaarddatasets (OTS) van Appen versnellen AI-implementatie
Appen Limited (ASX:APX), de toonaangevende aanbieder van hoogwaardige trainingsdata voor organisaties die effectieve AI-systemen op grote schaal bouwen, heeft vandaag nieuwe standaarddatasets (OTS) aangekondigd. Deze datasets zijn ontworpen om het voor bedrijven gemakkelijker en sneller te maken om de hoogwaardige trainingsdata te verkrijgen die nodig zijn om hun artificial intelligence (AI) en machine learning (ML) projecten te versnellen. De nieuwe OTS-datasets omvatten menselijke lichaamsbewegingen en innovatieve babyhuilgeluiden, evenals gesproken taal en afbeeldingen met tekst die geschikt zijn voor optische tekenherkenning (OCR) voor talen met hoge vraag maar moeilijk te verkrijgen, zoals Arabisch, Kroatisch, Grieks, Hongaars, Thai en meer. Met de uitgebreide datasets omvat Appens totale OTS-aanbod meer dan 250 datasets, bestaande uit meer dan 11.000 uur audio, meer dan 25.000 afbeeldingen en meer dan 8,7 miljoen woorden in 80 talen en meerdere dialecten.
Appens OTS-datasets zijn een snelle, kosteneffectieve manier om een AI- of ML-project te starten met consistente hoogwaardige trainingsdata. Teams die hun AI-mogelijkheden uitbreiden, kunnen OTS-datasets ook gebruiken om effectief de nauwkeurigheid te verbeteren, nieuwe modelvaardigheden te ontwikkelen en andere verbeteringen aan te brengen in hun AI-modellen. Een OTS-dataset wordt vaak binnen een week geleverd, bijvoorbeeld, in vergelijking met acht tot twaalf weken voor een nieuw datasetverzameling- en annotatieproject – of nog langer, afhankelijk van de complexiteit. Alle Appen-datasets worden ontwikkeld met een volledig transparante, opt-in-methode, zodat AI-specialisten er zeker van kunnen zijn dat hun data schoon en conform is, waardoor het potentieel risico van backlash en reputatieschade wordt geëlimineerd.
“AI-teams over de hele wereld die werken aan projecten met strakke deadlines en flexibele gegevensvereisten, kunnen profiteren van het gebruik van standaarddatasets”, zei Wilson Pang, CTO van Appen. “OTS-datasets verkorten de tijd tot waarde en bieden toegang tot hoogwaardige data tegen een lagere totale kost dan traditionele methoden. Wij bij Appen nemen de nodige stappen om ervoor te zorgen dat alle onze datasets op een ethische manier worden verkregen en demografisch gebalanceerd, waardoor bedrijven verantwoorde AI-praktijken kunnen handhaven door bias in hun modellen te minimaliseren en de eerlijke behandeling van data-annotators te garanderen. U weet altijd de precieze kwaliteit van een OTS-dataset, wat helpt bij het bouwen van betere AI die werkt in de echte wereld.”
MediaInterface heeft taaltechnologieoplossingen geleverd aan gezondheidsinstellingen in Duitsland en andere delen van Europa gedurende meer dan 20 jaar. Toen het bedrijf uitbreidde naar Frankrijk, had het volledig gelokaliseerde software, maar ontbrak het aan Franse lexicondata, met name Franse namen en plaatsen, die vaak worden verwezen in patiëntgegevens. Met behulp van Appen OTS-datasets verwierf MediaInterface ongeveer 21.000 Franse namen en 14.000 plaatsnamen. “De kritieke data van Appen is geïntegreerd in onze achtergrondlexicon om succesvol te lanceren in een nieuwe markt, en dit helpt ons om nieuwe vocabulaires te bouwen voor onze klanten en onze aanpak te versterken voor toekomstige marktlanceringen”, zei Ines Wendler, productmanager bij MediaInterface.
De meest ervaren AI-experts combineren OTS-datasets met op maat gemaakte datasetverzameling- en annotatieprojecten om aan hun complexe AI-modeltrainingsgegevensbehoeften te voldoen. Appen is de leider in het bieden van voortdurende ondersteuning via een reeks specifieke dataverzamelingsservices, zoals voortdurende data-annotatie en slim labelen, via AI-gestuurde tools en geautomatiseerde workflows om de efficiëntie te maximaliseren.
“We interacteren met AI vanaf het moment dat we wakker worden tot het moment dat we naar bed gaan – via virtuele assistenten, chatbots, zoekmachines, sociale netwerken, medische apparaten, slimme auto’s en andere toepassingen”, zei Judith Bishop, senior directeur AI-specialisten van Appen, die een team van 100 AI-linguïsten en taalpecialisten leidt. “Taal is vaak de primaire interface voor veel van deze overtuigende AI-gevallen, dus om een geweldige ervaring te garanderen, moet het model getraind worden om voor iedereen te werken. Appens toewijding aan hoogwaardige data en verantwoorde, ethische AI-ontwikkeling stelt bedrijven die onze standaarddatasets kopen in staat om hun AI-projecten met volledig vertrouwen in hun data te versnellen.”
De lijst met nieuwe Appen OTS-datasets die nu beschikbaar zijn, omvat:
- Gesproken taal voor Arabisch (Egypte), Arabisch (Saoedi-Arabië), Arabisch (Verenigde Arabische Emiraten), Centraal Khmer (Cambodja), Kroatisch, Grieks, Hongaars, Pools, Spaans (Spanje) en Turks
- Afbeelding OCR voor vereenvoudigd Chinees gedrukte tekst, Thai gedrukte tekst en Fins gedrukte tekst – Bevat vooraf opgenomen billboards, buitenverpakking, borden, tijdschriften en menu’s om computer vision OCR-modellen te trainen en bij te werken
- Menselijke lichaamsbeweging (China) – Bevat geannoteerde video’s van mensen in beweging, getrackt op pixelniveau, geschikt voor game-ontwikkeling, fitness-apps en meer
- Babyhuilgeluid (China) – Bevat vooraf opgenomen en geannoteerde babygeluiden die kunnen worden gebruikt om AI-modellen te trainen om verschillende huilgeluiden te herkennen en ouders te waarschuwen
Voor meer informatie en om een Appen OTS-datasetvoorbeeld aan te vragen, klikt u hier.












