Modelos y plataformas de IA

La Batalla de los Modelos de Lenguaje Abiertos contra Cerrados: Un Análisis Técnico

mm
Añade Unite.AI a tus fuentes preferidas en Google

Los modelos de lenguaje grande (LLM) han cautivado a la comunidad de inteligencia artificial en los últimos años, liderando avances en el procesamiento del lenguaje natural. Detrás del hype se esconde un debate complejo: ¿deben estos modelos poderosos ser de código abierto o cerrado?

En este post, analizaremos la diferenciación técnica entre estos enfoques para entender las oportunidades y limitaciones que cada uno presenta. Cubriremos los siguientes aspectos clave:

  • Definir modelos de lenguaje de código abierto vs cerrado
  • Transparencia arquitectónica y personalización
  • Benchmarkeo de rendimiento
  • Requisitos computacionales
  • Versatilidad de aplicación
  • Accesibilidad y licencia
  • Privacidad y confidencialidad de datos
  • Apoyo y respaldo comercial

Al final, tendrás una perspectiva informada sobre los compromisos técnicos entre los modelos de lenguaje de código abierto y cerrado para guiar tu propia estrategia de inteligencia artificial. ¡Vamos a sumergirnos!

Definiendo Modelos de Lenguaje Abiertos vs Cerrados

Los modelos de lenguaje de código abierto tienen arquitecturas de modelo, código fuente y parámetros de peso accesibles públicamente. Esto permite a los investigadores inspeccionar los internos, evaluar la calidad, reproducir resultados y crear variantes personalizadas. Ejemplos destacados incluyen ConstitutionalAI de Anthropic, LLaMA de Meta y GPT-NeoX de EleutherAI.

En contraste, los modelos de lenguaje de código cerrado tratan la arquitectura del modelo y los pesos como activos propiedad. Entidades comerciales como Anthropic, DeepMind y OpenAI los desarrollan internamente. Sin código o detalles de diseño accesibles, la reproducibilidad y la personalización enfrentan limitaciones.

Transparencia Arquitectónica y Personalización

El acceso a los internos de los modelos de lenguaje de código abierto desbloquea oportunidades de personalización que simplemente no son posibles con alternativas de código cerrado.

Al ajustar la arquitectura del modelo, los investigadores pueden explorar técnicas como introducir conectividad dispersa entre capas o agregar tokens de clasificación dedicados para mejorar el rendimiento en tareas especializadas. Con acceso a los parámetros de peso, los desarrolladores pueden transferir aprendizaje de representaciones existentes o inicializar variantes con bloques de construcción preentrenados como T5 y BERT.

Esta personalización permite que los modelos de lenguaje de código abierto sirvan mejor a dominios especializados como la investigación biomédica, la generación de código y la educación. Sin embargo, la experiencia requerida puede elevar la barrera para entregar implementaciones de producción de alta calidad.

Los modelos de lenguaje de código cerrado ofrecen personalización limitada, ya que sus detalles técnicos permanecen propiedad. Sin embargo, sus partidarios comprometen recursos extensivos para la investigación y el desarrollo internos. Los sistemas resultantes empujan el límite de lo que es posible con una arquitectura de modelo de lenguaje generalizada.

Así que, aunque menos flexibles, los modelos de lenguaje de código cerrado destacan en tareas de lenguaje natural ampliamente aplicables. También simplifican la integración al ajustarse a interfaces establecidas como el estándar OpenAPI.

Benchmarkeo de Rendimiento

A pesar de la transparencia arquitectónica, medir el rendimiento de los modelos de lenguaje de código abierto introduce desafíos. Su flexibilidad permite configuraciones y estrategias de ajuste infinitas. También permite que los modelos con el prefijo “de código abierto” incluyan en realidad técnicas propiedad que distorsionan las comparaciones.

Los modelos de lenguaje de código cerrado tienen objetivos de rendimiento más claramente definidos, ya que sus partidarios realizan pruebas de rendimiento y publicitan umbrales de métricas específicas. Por ejemplo, Anthropic publicita la precisión de ConstitutionalAI en conjuntos de problemas de comprensión del lenguaje natural (NLU) curados. Microsoft (MSFT ) destaca cómo GPT-4 supera los umbrales humanos en la herramienta de comprensión del lenguaje SuperGLUE.

Dicho esto, estas pruebas de rendimiento estrechas han enfrentado críticas por exagerar el rendimiento en tareas del mundo real y subrepresentar los fallos. La evaluación imparcial de los modelos de lenguaje sigue siendo una pregunta de investigación abierta, tanto para los enfoques de código abierto como cerrado.

Requisitos Computacionales

Entrenar modelos de lenguaje grande requiere recursos computacionales extensivos. OpenAI gastó millones en entrenar GPT-3 en infraestructura en la nube, mientras que Anthropic consumió hasta $10 millones en GPUs para ConstitutionalAI.

La factura para dichos modelos excluye a la mayoría de los individuos y equipos pequeños de la comunidad de código abierto. De hecho, EleutherAI tuvo que eliminar el modelo GPT-J del acceso público debido a los costos de alojamiento explosivos.

Sin fondos profundos, los éxitos de los modelos de lenguaje de código abierto aprovechan recursos computacionales donados. LAION curó su modelo LAION-5B enfocado en tecnología utilizando datos obtenidos mediante crowdsourcing. El proyecto ConstitutionalAI de Anthropic sin fines de lucro utilizó computación de voluntarios.

El respaldo de las grandes empresas como Google (GOOGL ), Meta y Baidu proporciona a los esfuerzos de código cerrado el combustible financiero necesario para industrializar el desarrollo de los modelos de lenguaje. Esto permite escalar a longitudes inimaginables para las iniciativas de base.

Versatilidad de Aplicación

La personalización de los modelos de lenguaje de código abierto permite abordar casos de uso altamente especializados. Los investigadores pueden modificar agresivamente los internos del modelo para mejorar el rendimiento en tareas como la predicción de la estructura de proteínas, la generación de documentación de código y la verificación de pruebas matemáticas.

Dicho esto, la capacidad de acceder y editar el código no garantiza una solución de dominio específico efectiva sin los datos adecuados. Los conjuntos de datos de entrenamiento completos para aplicaciones estrechas requieren un esfuerzo significativo para curar y mantener actualizados.

Aquí los modelos de lenguaje de código cerrado se benefician de los recursos para obtener datos de entrenamiento de repositorios internos y socios comerciales. Por ejemplo, DeepMind licencia bases de datos como ChEMBL para la química y UniProt para las proteínas para ampliar el alcance de la aplicación. El acceso a datos a escala industrial permite que los modelos como Gopher logren una versatilidad notable a pesar de la opacidad arquitectónica.

Accesibilidad y Licencia

La licencia permisiva de los modelos de lenguaje de código abierto promueve el acceso gratuito y la colaboración. Modelos como GPT-NeoX, LLaMA y Jurassic-1 Jumbo utilizan acuerdos como Creative Commons y Apache 2.0 para permitir la investigación no comercial y la comercialización justa.

En contraste, los modelos de lenguaje de código cerrado llevan licencias restrictivas que limitan la disponibilidad del modelo. Las entidades comerciales controlan estrictamente el acceso para salvaguardar las posibles corrientes de ingresos de las API de predicción y las asociaciones empresariales.

Es comprensible que las organizaciones como Anthropic y Cohere cobren por el acceso a las interfaces ConstitutionalAI y Cohere-512. Sin embargo, esto arriesga excluir importantes dominios de investigación, sesgando el desarrollo hacia las industrias bien financiadas.

La licencia abierta plantea desafíos, particularmente en torno a la atribución y la responsabilidad. Sin embargo, para los casos de uso de investigación, las libertades otorgadas por la accesibilidad de código abierto ofrecen ventajas claras.

Privacidad y Confidencialidad de Datos

Los conjuntos de datos de entrenamiento para los modelos de lenguaje grande suelen agregar contenido de diversas fuentes en línea como páginas web, artículos científicos y foros de discusión. Esto arriesga exponer información personalmente identificable o sensible en las salidas del modelo.

Para los modelos de lenguaje de código abierto, examinar la composición del conjunto de datos proporciona la mejor protección contra problemas de confidencialidad. Evaluar las fuentes de datos, los procedimientos de filtrado y documentar los ejemplos preocupantes encontrados durante las pruebas puede ayudar a identificar vulnerabilidades.

Desafortunadamente, los modelos de lenguaje de código cerrado impiden dicha auditoría pública. En cambio, los consumidores deben confiar en la rigidez de los procesos de revisión interna basados en las políticas anunciadas. Por ejemplo, Azure Cognitive Services promete filtrar los datos personales, mientras que Google especifica revisiones formales de privacidad y etiquetado de datos.

En general, los modelos de lenguaje de código abierto permiten una identificación más proactiva de los riesgos de confidencialidad en los sistemas de inteligencia artificial antes de que esos fallos se manifiesten a gran escala. Los contrapartes cerrados ofrecen una transparencia relativamente limitada en las prácticas de manejo de datos.

Apoyo y Respaldo Comercial

La posibilidad de monetizar los modelos de lenguaje de código cerrado incentiva una inversión comercial significativa para el desarrollo y el mantenimiento. Por ejemplo, anticipando retornos lucrativos de su cartera de Azure AI, Microsoft acordó asociaciones de varios miles de millones de dólares con OpenAI alrededor de los modelos GPT.

En contraste, los modelos de lenguaje de código abierto dependen de los voluntarios que asignan tiempo personal para el mantenimiento o de subvenciones que proporcionan financiación de plazo limitado. Esta asimetría de recursos arriesga la continuidad y la longevidad de los proyectos de código abierto.

Sin embargo, las barreras para la comercialización también liberan a las comunidades de código abierto para centrarse en el progreso científico sobre el beneficio. Y la naturaleza descentralizada de los ecosistemas abiertos mitiga la dependencia excesiva del interés sostenido de un solo partidario.

En última instancia, cada enfoque conlleva compensaciones entre recursos e incentivos. Los modelos de lenguaje de código cerrado disfrutan de una mayor seguridad de financiación, pero concentran la influencia. Los ecosistemas abiertos promueven la diversidad, pero sufren una mayor incertidumbre.

Navegando el Paisaje de Modelos de Lenguaje Abiertos vs Cerrados

Decidir entre modelos de lenguaje de código abierto o cerrado requiere emparejar las prioridades organizacionales como la personalización, la accesibilidad y la escalabilidad con las capacidades del modelo.

Para los investigadores y las startups, los modelos de lenguaje de código abierto ofrecen más control para ajustar los modelos a tareas específicas. La licencia también facilita la compartición gratuita de conocimientos entre colaboradores. Sin embargo, la carga de obtener datos de entrenamiento y la infraestructura puede socavar la viabilidad en el mundo real.

Por el contrario, los modelos de lenguaje de código cerrado prometen mejoras significativas en la calidad gracias a la financiación y los datos abundantes. Sin embargo, las restricciones en torno al acceso y las modificaciones limitan la transparencia científica, mientras que atan las implementaciones a las hojas de ruta de los proveedores.

En la práctica, los estándares abiertos alrededor de las especificaciones de arquitectura, los puntos de control del modelo y los datos de evaluación pueden ayudar a compensar las desventajas de ambos enfoques. Las fundaciones compartidas como el Transformador de Google o los benchmarks REALTO de Oxford mejoran la reproducibilidad. Los estándares de interoperabilidad como ONNX permiten mezclar componentes de fuentes abiertas y cerradas.

En última instancia, lo que importa es elegir la herramienta adecuada, abierta o cerrada, para el trabajo en cuestión. Las entidades comerciales que respaldan los modelos de lenguaje de código cerrado llevan una influencia innegable. Pero la pasión y los principios de las comunidades de ciencia abierta seguirán desempeñando un papel crucial en el impulso del progreso de la inteligencia artificial.

He dedicado los últimos cinco años sumergiéndome en el fascinante mundo de Machine Learning y Deep Learning. Mi pasión y experiencia me han llevado a contribuir a más de 50 proyectos de ingeniería de software diversos, con un enfoque particular en AI/ML. Mi curiosidad en curso también me ha llevado hacia el Procesamiento de Lenguaje Natural, un campo que estoy ansioso por explorar más a fondo.