Modele și platforme AI

Noi seturi de date gata de utilizare (OTS) de la Appen accelerează implementarea AI

mm
Adaugă Unite.AI la sursele tale preferate pe Google

Appen Limited (ASX:APX), principalul furnizor de date de antrenament de înaltă calitate pentru organizațiile care construiesc sisteme AI eficiente la scară largă, a anunțat astăzi noi seturi de date gata de utilizare (OTS). Aceste seturi de date sunt proiectate pentru a face mai ușoară și mai rapidă achiziționarea datelor de antrenament de înaltă calitate necesare pentru a accelera proiectele de inteligență artificială (AI) și învățare automată (ML). Noile seturi de date OTS includ mișcări ale corpului uman și sunete inovatoare de plâns de bebeluși, precum și discursuri scrise și imagini cu text adecvat pentru recunoașterea optică a caracterelor (OCR) pentru limbile cu cerere ridicată, dar greu de obținut, cum ar fi arabă, croată, greacă, maghiară, thailandeză și multe altele. Cu seturile de date extinse, oferta totală OTS a Appen include peste 250 de seturi de date, cuprinzând peste 11.000 de ore de audio, peste 25.000 de imagini și peste 8,7 milioane de cuvinte în 80 de limbi și dialecte multiple.

Seturile de date OTS ale Appen sunt un instrument rapid și eficient din punct de vedere al costurilor pentru a demara un proiect AI sau ML cu date de antrenament de înaltă calitate și consistente. Echipele care își extind capacitățile AI pot, de asemenea, să utilizeze seturile de date OTS pentru a îmbunătăți în mod eficient acuratețea, a dezvolta noi abilități ale modelului și a incorpora alte îmbunătățiri în modelele lor AI. Un set de date OTS este adesea livrat într-o săptămână, de exemplu, comparativ cu cele opt până la doisprezece săptămâni pentru un proiect de colectare și anotare a datelor noi – sau chiar mai mult, în funcție de complexitate. Toate seturile de date Appen sunt dezvoltate utilizând o metodologie complet transparentă și opțională, astfel încât specialiștii AI să poată fi siguri că datele lor sunt curate și conforme, eliminând riscul potențial de backlash și daune de reputație.

„Echipele de AI din întreaga lume care lucrează la proiecte cu termene limită stricte și cerințe flexibile de date pot beneficia de utilizarea seturilor de date gata de utilizare”, a declarat Wilson Pang, CTO al Appen. „Seturile de date OTS scurtează timpul până la valoare și oferă acces la date de înaltă calitate la un cost total mai mic decât utilizarea metodelor tradiționale. Noi, la Appen, luăm măsurile necesare pentru a ne asigura că toate seturile noastre de date sunt surse etice și echilibrate din punct de vedere demografic, permițând companiilor să mențină practici AI responsabile prin minimizarea bias-ului în modelele lor și asigurarea unui tratament corect al annotatorilor de date. Întotdeauna știți calitatea exactă a unui set de date OTS, ceea ce ajută la crearea unui AI mai bun care funcționează în lumea reală.”

MediaInterface a furnizat soluții de tehnologie lingvistică pentru instituții din domeniul sănătății din Germania și alte părți ale Europei timp de peste 20 de ani. Când compania s-a extins în Franța, a avut software complet localizat, dar a lipsit datele lexicale franceze, în special numele și locurile franceze, care sunt adesea menționate în informațiile despre sănătatea pacientului. Utilizând seturile de date OTS Appen, MediaInterface a obținut aproximativ 21.000 de nume franceze și 14.000 de nume de locuri. „Datele critice de la Appen au fost incorporate în lexiconul nostru de fond pentru a lansa cu succes pe un nou market, și acest lucru ne ajută să construim noi vocabulare pentru clienții noștri și să consolidăm abordarea noastră pentru lansările viitoare de pe piață”, a declarat Ines Wendler, manager de produs la MediaInterface.

Cei mai experimentați specialiști AI combină seturile de date OTS cu proiectele de colectare și anotare a datelor la cerere pentru a-și satisface nevoile complexe de date de antrenament pentru modelele AI. Appen este lider în oferirea de sprijin continuu prin intermediul unor servicii specifice de colectare a datelor, cum ar fi anotarea continuă a datelor și etichetarea inteligentă, prin instrumente și fluxuri de lucru bazate pe AI pentru a maximiza eficiența.

„Interacționăm cu AI din momentul în care ne trezim până în momentul în care ne culcăm – prin asistenți virtuali, chatboti, motoare de căutare, rețele sociale, dispozitive medicale, mașini inteligente și alte aplicații”, a declarat Judith Bishop, director senior al specialiștilor AI de la Appen, care conduce o echipă de 100 de lingviști și experți în limbi. „Limbajul este adesea interfața principală pentru multe dintre aceste cazuri de utilizare AI convingătoare, astfel încât pentru a garanta o experiență excelentă, modelul trebuie să fie antrenat pentru a funcționa pentru toată lumea. Angajamentul Appen față de date de înaltă calitate și dezvoltarea AI responsabilă și etică permite companiilor care cumpără seturile noastre de date gata de utilizare să-și accelereze proiectele AI cu încredere deplină în datele lor.”

Noile seturi de date OTS Appen disponibile, care se alătură celor sute de seturi de date existente deja pe appen.com, includ:

  • Discursuri scrise pentru arabă (Egipt), arabă (Arabia Saudită), arabă (Emiratele Arabe Unite), centrală khmeră (Cambodgia), croată, greacă, maghiară, poloneză, spaniolă (Spania) și turcă
  • Imagini OCR pentru textul chinezesc simplificat tipărit, textul thailandez tipărit și textul finlandez tipărit – Include panouri publicitare preînregistrate, ambalaje exterioare, semne, reviste și meniuri pentru a antrena și actualiza modelele OCR de viziune computerizată
  • Mișcări ale corpului uman (China) – Include videoclipuri anotate cu oameni care se mișcă, urmărite la nivel de pixel, adecvate pentru dezvoltarea de jocuri, aplicații de fitness și multe altele
  • Sunete de plâns de bebeluși audio (China) – Include sunete preînregistrate și anotate de bebeluși care pot fi utilizate pentru a antrena modele AI pentru a recunoaște diferite sunete de plâns și a alerta părinții

Pentru mai multe informații și pentru a solicita un exemplu de set de date OTS Appen, faceți clic aici.

Daniel este un mare susținător al modului în care IA va perturba în cele din urmă totul. El respiră tehnologia și trăiește pentru a încerca gadgeturi noi.