AI 模型与平台

AI创业公司Diffbot阅读整个公共互联网以追求基于事实的文本生成

mm
将 Unite.AI 添加到您在 Google 上的首选来源

最近,OpenAI通过其GPT-2和 GPT-3语言模型在自然语言处理和文本生成方面取得了令人印象深刻的进步,能够生成看似由人类撰写的文本。不幸的是,尽管这些模型在撰写听起来自然的文本方面表现出色,但它们并未具备撰写事实性文本的能力。高级语言模型通过组合上下文中最有意义的单词来构造句子,而不关心生成文本中声明的真实性。 据MIT技术评论报道,一家名为Diffbot的创业公司旨在通过让AI从互联网中提取尽可能多的事实来解决这个问题。

Diffbot是一家希望使AI更适用于实际文本生成任务的创业公司,例如自动填充电子表格和自动完成句子或代码。为了使AI生成的文本可靠,AI本身需要值得信赖,并且需要有一些关于事实性和虚构性陈述的概念。Diffbot的方法是首先从几乎整个公共网络中收集大量文本。Diffbot解析多种语言的文本,并将文本分成基于事实的三元组,使用给定事实的主语、宾语和动词将一个概念链接到另一个概念。例如,它可能以这样的方式表示关于比尔·盖茨和微软的事实:

(MSFT )

比尔·盖茨是微软的创始人。微软是一家计算机技术公司。

Diffbot将所有这些简短的事实连接起来,创建一个知识图谱。知识图谱创建概念之间的关系网,通常还带有一个推理器,帮助根据这些关系创建新的结论。换句话说,知识图谱使用数据互联,并且可以帮助机器学习算法建模知识领域。知识图谱已经存在了几十年,许多早期的AI研究人员认为它们是允许AI理解人类世界的重要工具。然而,知识图谱通常是手工创建的,这是一个困难且耗时的过程。自动创建知识图谱可以让AI获得更大的上下文理解,并生成基于事实的文本。

几年前,谷歌开始使用知识图谱来帮助提供热门话题的摘要。知识图谱用于提取最相关的事实并将其表示为摘要。Diffbot希望为每个话题做同样的事情,而不仅仅是最热门的话题。这需要构建一个巨大的知识图谱,通过爬行整个公共网络来编译,这是只有谷歌和微软才做的事情。Diffbot扫描整个网络,并每四到五天更新一次知识图谱,一个月内添加大约1亿到1.5亿个条目。

(GOOGL )

Diffbot不像正常的网络爬虫一样读取网站的文本,而是使用计算机视觉算法来提取网页的原始像素,并从页面中提取视频、图像、文章和讨论数据。它识别网页的关键元素,然后以多种语言提取事实,遵循三部分事实模式。

目前,Diffbot提供对其知识图谱的免费和付费访问。虽然研究人员可以免费访问图谱,但像DuckDuckGo和Snapchat这样的公司使用它来总结文本和提取热门新闻项目。同时,耐克和阿迪达斯使用该平台来查找销售假货的网站,这是因为Diffbot能够确定哪些网站实际上正在销售鞋子,而不仅仅是讨论它们。

在未来,Diffbot计划扩展其功能并添加自然语言接口到平台,能够回答几乎任何问题,并用来源支持答案。理想情况下,Diffbot的功能将与像GPT-3这样的强大语言合成模型相结合。

博客作者和程序员,专攻 Machine Learning Deep Learning 领域。Daniel 希望帮助他人利用 AI 的力量为社会做好事。