Моделі та платформи ШІ

Нові готові набори даних (OTS) від Appen прискорюють розгортання штучного інтелекту

mm
Додайте Unite.AI до бажаних джерел у Google

Appen Limited (ASX:APX), провідний постачальник високоякісних навчальних даних для організацій, які будують ефективні системи штучного інтелекту у великому масштабі, сьогодні оголосив про нові готові набори даних (OTS). Ці набори даних розроблені для того, щоб зробити процес отримання високоякісних навчальних даних для прискорення проектів штучного інтелекту (AI) та машинного навчання (ML) простішим і швидшим для бізнесу. Нові OTS-набори даних включають дані про рух людського тіла та інноваційні звуки плачу дитини, а також записані тексти та зображення з текстом, придатні для оптичного розпізнавання символів (OCR) для мов, які складно отримати, таких як арабська, хорватська, грецька, угорська, тайська та інші. З розширенням наборів даних загальна кількість OTS-наборів даних від Appen тепер нараховує понад 250 наборів, що складаються з понад 11 000 годин аудіо, понад 25 000 зображень та понад 8,7 мільйонів слів у 80 мовах та діалектах.

OTS-набори даних від Appen є швидким та економічно ефективним інструментом для початку проекту штучного інтелекту чи машинного навчання з високоякісними навчальними даними. Команди, які розширюють свої можливості штучного інтелекту, також можуть використовувати OTS-набори даних для ефективного покращення точності, розвитку нових навичок моделей та впровадження інших удосконалень у свої моделі штучного інтелекту. OTS-набір даних часто доставляється протягом одного тижня, наприклад, порівняно з 8-12 тижнями для нового проекту збору та анотації даних – або навіть довше, залежно від складності. Усі набори даних Appen розроблені за допомогою повністю прозорої, добровільної методології, тому спеціалісти штучного інтелекту можуть бути впевнені, що їхні дані чисті та відповідають вимогам, що виключає потенційний ризик негативної реакції та шкоди репутації.

«Команди штучного інтелекту у всьому світі, які працюють над проектами з тісними термінами та гнучкими вимогами до даних, можуть виграти від використання готових наборів даних», – сказав Вілсон Панг, технічний директор Appen. «OTS-набори даних скорочують час до отримання результатів та забезпечують доступ до високоякісних даних за нижчу загальну вартість порівняно з традиційними методами. Ми в Appen докладаємо зусиль для забезпечення того, щоб усі наші набори даних були отримані етично та мали демографічний баланс, що дозволяє компаніям підтримувати відповідальну практику штучного інтелекту, мінімізуючи упередженість у своїх моделях та забезпечуючи справедливе ставлення до анотаторів даних. Ви завжди знаєте точну якість OTS-набору даних, що допомагає створювати краще штучний інтелект, який працює у реальному світі».

MediaInterface надавав рішення мовної технології для закладів охорони здоров’я в Німеччині та інших частинах Європи понад 20 років. Коли компанія розширювала свою діяльність до Франції, у неї був повністю локалізований програмний продукт, але бракувало даних французької лексики, особливо французьких імен та назв місць, які часто згадуються у інформації про здоров’я пацієнтів. Використовуючи OTS-набори даних Appen, MediaInterface отримав близько 21 000 французьких імен та 14 000 назв місць. «Критичні дані від Appen були включені до нашої фонової лексики для успішного запуску на новому ринку, і це допомагає нам розбудовувати нові словники для наших клієнтів та зміцнювати наш підхід для майбутніх запусків ринку», – сказав Інес Вендлер, менеджер продукту в MediaInterface.

Най досвідченіші експерти штучного інтелекту поєднують OTS-набори даних з проектами збору та анотації даних на вимогу для задоволення складних потреб їхніх моделей штучного інтелекту. Appen є лідером у сфері надання продовжуваної підтримки через ряд спеціальних послуг збору даних, таких як постійна анотація даних та розумне маркування, через інструменти штучного інтелекту та автоматизовані робочі процеси для максимізації ефективності.

«Ми взаємодіємо зі штучним інтелектом з моменту пробудження до моменту сну – через віртуальних помічників, чат-ботів, пошукових систем, соціальних мереж, медичних пристроїв, розумних автомобілів та інших застосунків», – сказав Джудіт Бішоп, старший директор команди спеціалістів штучного інтелекту Appen, яка очолює команду з 100 лінгвістів та мовних експертів. «Мова часто є основним інтерфейсом для багатьох цих привабливих випадків використання штучного інтелекту, тому для забезпечення гарантії хорошого досвіду модель повинна бути навчена працювати для всіх. Зобов’язання Appen щодо високоякісних даних та відповідальної, етичної розробки штучного інтелекту дозволяє компаніям, які купують наші готові набори даних, прискорювати свої проекти штучного інтелекту з повною впевненістю у своїх даних».

До існуючих сотень наборів даних, доступних на appen.com, список нових OTS-наборів даних від Appen, які зараз доступні, включає:

  • Записані тексти для арабської (Єгипет), арабської (Саудівська Аравія), арабської (Об’єднані Арабські Емірати), центрального кхмерського (Камбоджа), хорватської, грецької, угорської, польської, іспанської (Іспанія) та турецької
  • OCR-зображення для спрощеного китайського друку, тайського друку та фінського друку – Включає попередньо записані білборди, зовнішню упаковку, знаки, журнали та меню для навчання та оновлення моделей комп’ютерного зору OCR
  • Рух людського тіла (Китай) – Включає анотовані відео людей, відстежуваних на рівні пікселів, придатних для розробки ігор, фітнес-додатків та іншого
  • Аудіо плачу дитини (Китай) – Включає попередньо записані та анотовані звуки дитини, які можна використовувати для навчання моделей штучного інтелекту розпізнавати різні звуки плачу та попереджати батьків

Для отримання більшої інформації та запиту зразка набору даних Appen OTS натисніть тут.

Даніель є великим прибічником того, як штучний інтелект в кінцевому підсумку порушить все. Він дихає технологіями і живе, щоб спробувати нові гаджети.