Modelos y plataformas de IA

Inicio de la empresa de inteligencia artificial Diffbot lee toda la internet pública para perseguir la generación de texto basada en hechos

mm
Añade Unite.AI a tus fuentes preferidas en Google

Los recientes avances en el procesamiento de lenguaje natural y la generación de texto logrados por OpenAI a través de sus modelos de lenguaje GPT-2 y GPT-3 han sido impresionantes, capaces de generar texto que parece haber sido escrito genuinamente por un ser humano. Desafortunadamente, aunque estos modelos sobresalen en la escritura de texto natural, no están equipados para escribir texto que sea factual. Los modelos de lenguaje avanzados ensamblan oraciones a partir de palabras que tienen más sentido en contexto, sin prestar atención a la veracidad de las afirmaciones dentro del texto generado. Según un informe de la revista de tecnología de MIT, una startup conocida como Diffbot busca resolver este problema haciendo que una inteligencia artificial extraiga tantos hechos como sea posible de la internet.

Diffbot es una startup que espera hacer que la inteligencia artificial sea más útil para tareas prácticas de generación de texto, como auto completar hojas de cálculo y autocompletar oraciones o código. Para que el texto generado por la inteligencia artificial sea confiable, la inteligencia artificial en sí misma necesita ser confiable y tener algún concepto de declaraciones factuales versus ficticias. El enfoque de Diffbot para dar a un programa de generación de texto la capacidad de generar declaraciones factuales comienza recopilando grandes cantidades de texto de prácticamente toda la web pública. Diffbot analiza texto en varios idiomas y divide el texto en conjuntos de tripletas basadas en hechos, con el sujeto, objeto y verbo de un hecho determinado utilizado para vincular un concepto con otro. Por ejemplo, podría representar hechos relacionados con Bill Gates y Microsoft (MSFT ) de la siguiente manera:

Bill Gates es el fundador de Microsoft. Microsoft es una empresa de tecnología informática.

Diffbot toma todos estos pequeños hechos y los une para crear un gráfico de conocimiento. Los gráficos de conocimiento crean redes de relaciones entre conceptos, a menudo con un razonador que ayuda en la creación de nuevas conclusiones basadas en estas relaciones. En otras palabras, los gráficos de conocimiento utilizan la interconexión de datos y pueden ayudar a los algoritmos de aprendizaje automático a modelar dominios de conocimiento. Los gráficos de conocimiento han existido durante décadas y muchos investigadores de inteligencia artificial consideraron que eran herramientas importantes para permitir que la inteligencia artificial comprenda el mundo humano. Sin embargo, los gráficos de conocimiento se creaban típicamente a mano, lo que es un proceso difícil y tedioso. La automatización de la creación de gráficos de conocimiento podría permitir que las inteligencias artificiales adquieran una comprensión contextual mucho mayor y produzcan texto basado en hechos.

Google (GOOGL ) comenzó a utilizar gráficos de conocimiento hace unos años para ayudar a proporcionar resúmenes de información cuando se busca un tema popular. El gráfico de conocimiento se utiliza para extraer los hechos más relevantes y representarlos como un resumen. Diffbot quiere hacer lo mismo para todos los temas, no solo los más populares. Esto requiere construir un gráfico de conocimiento absolutamente masivo, compilado mediante el rastreo de toda la web pública, algo que solo Google y Microsoft hacen de otra manera. Diffbot escanea toda la web y actualiza el gráfico de conocimiento con nueva información cada cuatro o cinco días, y a lo largo de un mes agrega entre 100 y 150 millones de entradas.

Diffbot no lee el texto de un sitio web como los rastreadores web normales, sino que utiliza algoritmos de visión por computadora para extraer los píxeles brutos de una página web y extraer datos de video, imagen, artículo y discusión de la página. Identifica los elementos clave de la página web y luego extrae hechos en varios idiomas, de acuerdo con el esquema de tripletas de tres partes.

Actualmente, Diffbot ofrece acceso gratuito y de pago a su gráfico de conocimiento. Mientras que los investigadores pueden acceder al gráfico de forma gratuita, las empresas como DuckDuckGo y Snapchat lo utilizan para resumir texto y extraer fragmentos de noticias de tendencia. Mientras tanto, Nike y Adidas utilizan la plataforma para encontrar sitios que venden productos falsificados, lo cual es posible porque Diffbot puede determinar qué sitios están vendiendo realmente zapatos, no solo discutiendo sobre ellos.

En el futuro, Diffbot planea expandir sus capacidades y agregar una interfaz de lenguaje natural a la plataforma, capaz de responder casi cualquier pregunta que se le haga y respaldar esas respuestas con fuentes. Idealmente, las capacidades de Diffbot se combinarían con un poderoso modelo de síntesis de lenguaje como GPT-3.

Bloguero y programador con especialidades en Machine Learning y Deep Learning temas. Daniel espera ayudar a otros a utilizar el poder de la IA para el bien social.