Modelos e plataformas de IA

Startup de IA Diffbot Lê a Internet Pública para Gerar Textos Baseados em Fatos

mm
Adicione Unite.AI às suas fontes preferidas no Google

Os recentes avanços em processamento de linguagem natural e geração de textos alcançados pela OpenAI por meio de seus modelos de linguagem GPT-2 e GPT-3 têm sido impressionantes, capazes de gerar textos que parecem ter sido escritos por humanos. Infelizmente, embora esses modelos sejam excelentes em escrever textos que soam naturais, eles não são capazes de escrever textos que sejam fatuais. Modelos de linguagem avançados constroem frases a partir de palavras que fazem mais sentido no contexto, sem prestar atenção à veracidade das afirmações dentro do texto gerado. Conforme relatado pela MIT Technology Review, uma startup conhecida como Diffbot visa resolver esse problema fazendo com que um IA extraia tantos fatos quanto possível da internet.

Diffbot é uma startup que espera tornar a IA mais útil para tarefas práticas de geração de textos, como preencher automaticamente planilhas e autocompletar frases ou códigos. Para que o texto gerado pela IA seja confiável, a própria IA precisa ser confiável e ter algum conceito de afirmações fatuais versus fictícias. A abordagem da Diffbot para dar a um programa de geração de textos a capacidade de gerar afirmações fatuais começa coletando grandes quantidades de texto de praticamente toda a web pública. Diffbot analisa texto em vários idiomas e divide o texto em conjuntos de tripletos baseados em fatos, com o sujeito, objeto e verbo de um fato dado sendo usados para ligar um conceito a outro. Por exemplo, pode representar fatos sobre Bill Gates e Microsoft (MSFT ) da seguinte forma:

Bill Gates é o fundador da Microsoft. A Microsoft é uma empresa de tecnologia de computadores.

Diffbot pega todos esses pequenos fatos e os une para criar um gráfico de conhecimento. Gráficos de conhecimento criam teias de relacionamentos entre conceitos, frequentemente com um raciocinador que ajuda na criação de novas conclusões com base nesses relacionamentos. Para colocar de outra forma, gráficos de conhecimento usam interligação de dados e podem ajudar algoritmos de aprendizado de máquina a modelar domínios de conhecimento. Gráficos de conhecimento existem há décadas e muitos pesquisadores de IA iniciais consideravam-nos ferramentas importantes para permitir que a IA entendesse o mundo humano. No entanto, gráficos de conhecimento eram criados à mão, o que é um processo difícil e trabalhoso. A automação da criação de gráficos de conhecimento pode permitir que as IAs atinjam uma compreensão contextual muito maior dos conceitos e produzam textos baseados em fatos.

O Google (GOOGL ) começou a usar gráficos de conhecimento há alguns anos para ajudar a fornecer resumos de informações quando um tópico popular é procurado. O gráfico de conhecimento é usado para extrair os fatos mais relevantes e representá-los como um resumo. Diffbot quer fazer a mesma coisa para todos os tópicos, não apenas os mais populares. Isso requer a construção de um gráfico de conhecimento absolutamente massive, compilado por meio da varredura da internet pública, algo que apenas o Google e a Microsoft fazem de outra forma. Diffbot varre a web inteira e atualiza o gráfico de conhecimento com novas informações a cada quatro ou cinco dias, e ao longo de um mês adiciona cerca de 100 a 150 milhões de entradas.

Diffbot não lê o texto de um site como os crawlers web normais, mas usa algoritmos de visão computacional para extrair os pixels brutos de uma página da web e extrair dados de vídeo, imagem, artigo e discussão da página. Identifica os elementos-chave da página da web e então extrai fatos em vários idiomas, de acordo com o esquema de fatos de três partes.

Atualmente, Diffbot oferece acesso pago e gratuito ao seu gráfico de conhecimento. Embora os pesquisadores possam acessar o gráfico gratuitamente, empresas como DuckDuckGo e Snapchat usam-no para resumir textos e extrair trechos de itens de notícias em tendência. Enquanto isso, Nike e Adidas utilizam a plataforma para encontrar sites que vendem produtos falsificados, o que é possível porque Diffbot é capaz de determinar quais sites estão realmente vendendo calçados, e não apenas discutindo sobre eles.

No futuro, Diffbot planeja expandir suas capacidades e adicionar uma interface de linguagem natural à plataforma, capaz de responder a quase qualquer pergunta que você faça e apoiar essas respostas com fontes. Idealmente, as capacidades da Diffbot seriam combinadas com um poderoso modelo de síntese de linguagem como o GPT-3.

Blogueiro e programador com especialidades em Machine Learning e Deep Learning tópicos. Daniel espera ajudar os outros a usar o poder da IA para o bem social.