Моделі та платформи ШІ
Стартап Diffbot читає весь публічний Інтернет для створення фактів на основі текстової генерації
Нещодавні досягнення в галузі обробки природної мови та генерації тексту, досягнуті OpenAI завдяки своїм мовним моделям GPT-2 та GPT-3, були вражаючими, оскільки вони能够 генерувати текст, який виглядає так, ніби його справді написала людина. На жаль, хоча ці моделі добре справляються з написанням природного тексту, вони не здатні писати текст, який є фактичним. Розроблені мовні моделі збирають речення з слів, які найбільш підходять у контексті, не звертаючи уваги на правдивість заяв у згенерованому тексті. За повідомленням MIT Technology Review, стартап під назвою Diffbot намагається вирішити цю проблему, витягуючи якомога більше фактів з Інтернету.
Diffbot – це стартап, який сподівається зробити штучний інтелект більш корисним для практичних завдань генерації тексту, таких як автозаповнення таблиць та автодоповнення речень чи коду. Для того, щоб текст, згенерований штучним інтелектом, був надійним, сам штучний інтелект повинен бути надійним і мати певне поняття про фактичні та вигадані заяви. Підхід Diffbot до надання програмі генерації тексту можливості генерувати фактичні заяви починається з збору величезної кількості тексту з практично всього публічного вебу. Diffbot розбирає текст кількома мовами та розділяє текст на набори фактів, що складаються з суб’єкта, об’єкта та дієслова певного факту, використовуючи їх для зв’язку однієї концепції з іншою. Наприклад, він може представити факти про Білла Гейтса та Microsoft (MSFT ) так:
Білл Гейтс – засновник Microsoft. Microsoft – це компанія з виробництва комп’ютерної техніки.
Diffbot збирає всі ці короткі факти та з’єднує їх, щоб створити граф знань. Графи знань створюють мережу відносин між концепціями, часто разом із розумним інструментом, який допомагає у створенні нових висновків на основі цих відносин. Інакше кажучи, графи знань використовують зв’язування даних та можуть допомогти алгоритмам машинного навчання моделювати області знань. Графи знань фактично існують уже десятиліття, і багато ранніх дослідників штучного інтелекту вважали їх важливими інструментами для розуміння людського світу. Однак графи знань зазвичай створювалися вручну, що є складним та трудомістким процесом. Автоматизація створення графів знань могла б дозволити штучному інтелекту досягти значно більшого контекстного розуміння концепцій та генерувати текст, який є фактівим.
Google (GOOGL ) почав використовувати графи знань кілька років тому, щоб допомогти у створенні підсумків інформації, коли шукається популярна тема. Граф знань використовується для виділення найбільш актуальних фактів та представлення їх у вигляді підсумку. Diffbot хоче зробити те саме для кожної теми, а не тільки для найбільш популярних. Для цього потрібно створити абсолютно масштабний граф знань, складений шляхом сканування всього публічного вебу, що робить тільки Google та Microsoft. Diffbot сканує весь веб та оновлює граф знань новою інформацією кожні чотири-п’ять днів, і протягом місяця він додає між 100 мільйонами та 150 мільйонами записів.
Diffbot не читає текст веб-сайту, як звичайні веб-сканери, а використовує алгоритми комп’ютерного зору для витягування суцільних пікселів веб-сторінки та отримання даних про відео, зображення, статті та обговорення зі сторінки. Він визначає ключові елементи веб-сторінки, а потім витягує факти кількома мовами, дотримуючись схеми трьохчастинних фактів.
Наразі Diffbot пропонує як платний, так і безкоштовний доступ до свого графа знань. Хоча дослідники можуть отримати доступ до графа безкоштовно, компанії, такі як DuckDuckGo та Snapchat, використовують його для підсумкування тексту та витягування уривків популярних новин. Між тим, Nike та Adidas використовують платформу для пошуку сайтів, які продають підроблені товари, що стало можливим тому, що Diffbot здатний визначити, які сайти насправді продають взуття, а не просто обговорюють про них.
У майбутньому Diffbot планує розширити свої можливості та додати до платформи природно-мовний інтерфейс, здатний відповідати на майже будь-яке питання, яке ви йому поставите, та підтверджувати ці відповіді джерелами. Ідеально, якщо можливості Diffbot будуть поєднані з потужною мовною синтезуючою моделлю, подібною до GPT-3.












