Модели и платформы ИИ

Стартап Diffbot читает весь публичный интернет для создания факто-ориентированного текстового генерирования

mm
Добавьте Unite.AI в избранные источники в Google

Недавние достижения в области обработки естественного языка и генерации текста, достигнутые OpenAI с помощью своих языковых моделей GPT-2 и GPT-3, были впечатляющими, позволяя генерировать текст, который выглядит как написанный человеком. К сожалению, хотя эти модели отлично справляются с написанием естественно звучащего текста, они не способны писать факто-ориентированный текст. Продвинутые языковые модели собирают предложения из слов, которые имеют наиболее смысл в контексте, не обращая внимания на достоверность утверждений в сгенерированном тексте. Как сообщает MIT Technology Review, стартап под названием Diffbot стремится решить эту проблему, извлекая из интернета как можно больше фактов.

Diffbot – это стартап, который надеется сделать ИИ более полезным для практических задач генерации текста, таких как автозаполнение таблиц и автодополнение предложений или кода. Чтобы сгенерированный текст был надежным, сам ИИ должен быть достоверным и иметь представление о фактах и вымышленных утверждениях. Подход Diffbot к предоставлению программе генерации текста возможности генерировать факто-ориентированные утверждения начинается с сбора огромных объемов текста с практически всего публичного интернета. Diffbot парсит текст на нескольких языках и разбивает текст на наборы факто-ориентированных триплетов, где субъект, объект и глагол каждого факта используются для связи одной концепции с другой. Например, он может представить факты о Билле Гейтсе и Microsoft (MSFT ) следующим образом:

Билл Гейтс – основатель Microsoft. Microsoft – компания по производству компьютерной техники.

Diffbot собирает все эти короткие фактоиды и объединяет их в знаний граф. Знания графы создают сеть отношений между концепциями, часто вместе с рассуждением, которое помогает создавать новые выводы на основе этих отношений. Иными словами, знания графы используют связывание данных и могут помочь алгоритмам машинного обучения моделировать области знаний. Знания графы существуют уже несколько десятилетий, и многие ранние исследователи ИИ считали их важными инструментами для понимания человеческого мира. Однако знания графы обычно создавались вручную, что является трудным и утомительным процессом. Автоматизация создания знаний графов может позволить ИИ получить гораздо большее контекстное понимание концепций и производить факто-ориентированный текст.

Google (GOOGL ) начал использовать знания графы несколько лет назад, чтобы помочь в предоставлении сводок информации, когда пользователь ищет популярную тему. Знания графы используются для извлечения наиболее релевантных фактоидов и представления их в виде сводки. Diffbot хочет сделать то же самое для каждой темы, а не только для самых популярных. Для этого необходимо создать абсолютно огромный знаний граф, собранный путем сканирования всего публичного интернета, что делают только Google и Microsoft. Diffbot сканирует весь интернет и обновляет знаний граф с новой информацией каждые четыре или пять дней, и за месяц добавляет около 100-150 миллионов записей.

Diffbot не читает текст веб-сайта, как обычные веб-краулеры, а вместо этого использует алгоритмы компьютерного зрения, чтобы извлечь сырые пиксели веб-страницы и извлечь видео, изображения, статьи и обсуждения с страницы. Он определяет ключевые элементы веб-страницы, а затем извлекает факты на нескольких языках, в соответствии со схемой трехчастного фактоида.

В настоящее время Diffbot предлагает как платный, так и бесплатный доступ к своему знаний графу. Хотя исследователи могут получить доступ к графу бесплатно, компании, такие как DuckDuckGo и Snapchat, используют его для сводки текста и извлечения фрагментов новостей. Тем временем Nike и Adidas используют платформу для поиска сайтов, продающих поддельные продукты, что возможно, потому что Diffbot может определить, какие сайты действительно продают обувь, а не просто обсуждают их.

В будущем Diffbot планирует расширить свои возможности и добавить естественно-языковый интерфейс к платформе, способный отвечать几乎 на любой вопрос и подтверждать ответы источниками. Идеально, возможности Diffbot будут объединены с мощной моделью синтеза языка, такой как GPT-3.

Блогер и программист с специализацией в Machine Learning и Deep Learning темах. Daniel надеется помочь другим использовать силу ИИ для социального блага.