Líderes de opinión
El espejismo de la inteligencia artificial de China: Cómo “código abierto” oculta lo más importante

Con jugadores de Big Tech como Google, Microsoft y Meta compitiendo por dominar el mercado de la inteligencia artificial, los jugadores chinos High Flyer, Baidu, Moonshot y Alibaba han hecho titulares al lanzar sus modelos de lenguaje grande DeepSeek, ERNIE 4.5, Kimi K2 y Qwen3 como código abierto. Este cambio de lanzar modelos de inteligencia artificial genérica protegidos y propietarios ha sido recibido como un signo de que la industria de la inteligencia artificial de China está abrazando el poder del código abierto para democratizar el desarrollo de la inteligencia artificial y fomentar la innovación.
Al igual que muchos jugadores que anuncian sus ofertas como código abierto e incluso lo incluyen en sus nombres de empresa, sin embargo, High Flyer, Baidu y Moonshot no han compartido realmente piezas críticas como los conjuntos de datos en el corazón de sus modelos. A medida que estos modelos grandes buscan convertirse en commodities en las que los desarrolladores confían, la transparencia del código abierto real que puede ser probado, investigado e iterado es fundamental para crear tecnología sin sesgos, ética y beneficiosa en la que todos podamos confiar. Todos estos modelos “código abierto” son en realidad “peso abierto”, lo que significa que se pueden descargar y utilizar, pero no se pueden inspeccionar de manera significativa sin los datos.
Mientras que los jugadores estadounidenses como Open AI y Meta parecen estar alejándose del código abierto, la invitación abierta de Baidu para aprovechar su suite de modelos ERNIE 4.5 disponibles gratuitamente puede en realidad fomentar la innovación y la colaboración con los desarrolladores que buscan crear aplicaciones pequeñas y poderosas. Al mismo tiempo, la empresa, que es similar a Google en China, se ha dado una ventaja competitiva al fomentar la adopción y arraigar sus modelos en el ecosistema de inteligencia artificial en crecimiento.
Lo mismo se puede decir de DeepSeek, el Kimi K2 de bajo precio y el Qwen3 actualizado, que cuenta con puntos de referencia que desafían a los modelos cerrados como Claude Opus 4 y GPT-4o-0327.
Estos jugadores de inteligencia artificial se han posicionado bien en la carrera por convertirse en el modelo de commodity de elección y la última actualización innovadora de Qwen3 fue inspirada incluso por la retroalimentación de la comunidad de código abierto.
Como muchos que anuncian su modelo de inteligencia artificial grande como código abierto, sin embargo, la comunidad de inteligencia artificial china no está compartiendo realmente los datos ni otras piezas críticas de sus sistemas de inteligencia artificial. En cambio, están pidiendo a los desarrolladores globales que confíen ciegamente en modelos que no pueden entender ni investigar realmente.
Afianzando el futuro con modelos de inteligencia artificial de commodity de código abierto
Cuando el iPhone irrumpió en el mercado en 2007, algunos asumieron que Mac dominaría el juego de los smartphones con iOS, pero la participación en el código abierto es fundamental para las startups, mientras que también fomenta el crecimiento empresarial y económico en todo el mundo, y Android, una startup adquirida por Google en 2005, siguió este camino hacia la victoria.
Al lanzar software de código abierto que podía ser visto, modificado, adoptado y compartido, Android invitó a académicos, desarrolladores e incluso competidores a colaborar en el software. Esto aceleró el proceso de innovación, democratizó el campo de juego y, en última instancia, redujo los precios. Android llegó al mercado un año después del primer iPhone y al comienzo de este año, contaba con el 71,88 por ciento del mercado global, frente al 27,65 por ciento de iOS.
En una revolución tecnológica que pareció ocurrir de la noche a la mañana, los smartphones se volvieron ubicuos y, incluso cuando las mejoras en el software, el hardware y la interfaz de usuario continúan, la industria ha crecido mucho más allá de tratar de revolucionar la forma en que funcionan los smartphones. Con los teléfonos celulares ahora como una commodity, la innovación en curso es en las aplicaciones que se ejecutan en ellos, y para ser contendores, los proveedores de smartphones deben mantener un ecosistema que invite a los desarrolladores.
No son tres años después del lanzamiento de ChatGPT, y la industria de la inteligencia artificial se encuentra en un punto similar. Cada jugador en la industria global de la inteligencia artificial está angulando para que sus modelos se conviertan en el próximo Android o incluso iOS, y al ir a código abierto con los modelos DeepSeek, ERNIE 4.5 y Kimi K2, los innovadores chinos están tratando de afianzar su posición en un ecosistema en crecimiento.
Aunque esto podría funcionar a su favor, sin embargo, no fomenta la verdadera transparencia del código abierto que ha sido esencial no solo para crear innovación, sino innovación en la que podemos confiar.
Los datos son la pieza que falta en la mayoría del código abierto de inteligencia artificial
Con los modelos de inteligencia artificial mucho más complicados de crear y compartir que el software tradicional, el llamado a un código abierto de inteligencia artificial completamente abierto no es una orden pequeña. En lugar de solo un código fuente simple, los sistemas de inteligencia artificial están compuestos por siete componentes, incluyendo el código fuente, los parámetros del modelo, el conjunto de datos, los hiperparámetros, el código fuente de entrenamiento, la generación de números aleatorios y los marcos de software.
Cada pieza debe funcionar en concierto para que un modelo entregue los resultados deseados, lo que significa que los desarrolladores necesitan visibilidad completa para compartir, modificar y adoptar un sistema y entender qué está sucediendo. Con la reproducibilidad como fundamento del método científico, sin embargo, la industria de la inteligencia artificial tiene un hábito de utilizar el término código abierto para referirse a versiones gratuitas o de bajo precio que están disponibles con acceso a algunas piezas del rompecabezas.
Baidu, por ejemplo, puso a disposición diez modelos ERNIE 4.5 gratuitamente. Junto con el modelo y los parámetros, la empresa también puso a disposición el kit de herramientas ERNIEKit y la herramienta de implementación FastDeploy. Estas permiten a los desarrolladores crear aplicaciones de inteligencia artificial poderosas al proporcionar capacidades de nivel industrial, flujos de trabajo de entrenamiento y inferencia eficientes en recursos, y compatibilidad con varios hardware.
En otras palabras, Baidu ha proporcionado a los desarrolladores herramientas emocionantes que les permiten desencadenar la innovación más rápido, lo que esperan que, a su vez, los impulse a elegir ERNIE 4.5 sobre la competencia.
Los desarrolladores que aprovechan ERNIE 4.5, sin embargo, están siendo solicitados a confiar ciegamente en el modelo, porque Baidu ha mantenido mucho oculto, incluyendo los conjuntos de datos que informan y enseñan a sus modelos.
El poder de los modelos de inteligencia artificial de código abierto transparente
Aunque cada pieza del rompecabezas de la inteligencia artificial es fundamental para que un modelo funcione, el 80 por ciento de los proyectos de inteligencia artificial fallan, y los datos están en el corazón del problema. Los conjuntos de datos inexactos, incompletos y sesgados llevan a modelos que no se comportan de manera predecible o como se desea.
El video de choque de conducción autónoma de Tesla Full-Self-Driving (FSD) de 2023 recientemente lanzado, por ejemplo, expuso el peor escenario posible de lo que puede suceder cuando un conjunto de datos y un modelo no cumplen con los requisitos. Mientras que el Tesla Model Y se aceleraba hacia un sol brillante y poniente, el sistema parcialmente automatizado no podía entender ni reaccionar adecuadamente a lo que sus cámaras estaban viendo, o no viendo. Mientras que los coches conducidos por humanos se frenaban y se detenían, la confusión del FSD resultó en la muerte de una mujer.
Este fracaso devastador reflejó datos visuales incompletos, así como la falta de un mecanismo de seguridad que tuviera en cuenta tales puntos ciegos. Cuando los desarrolladores no tienen visibilidad en sus datos, no pueden ver cómo interactúan con el modelo, lo que significa que no pueden descubrir tales errores y iterar para un rendimiento robusto.
Aún más preocupante, sin los datos que alimentan el modelo, están obligados a confiar en él ciegamente.
Cuando los conjuntos de datos son de código abierto, sin embargo, la comunidad de inteligencia artificial ha demostrado que arraigará los problemas problemáticos, como lo hizo al descubrir más de 1.000 URL que contenían material de abuso sexual infantil verificado en LAION 5B. Con el conjunto de datos utilizado para los modelos de generación de texto a imagen de inteligencia artificial siendo fundamental para crear aplicaciones como Stable Diffusion y Midjourney, habría sido devastador para la industria de la inteligencia artificial si los usuarios comenzaron a producir imágenes fotorealistas ilícitas. En cambio, la naturaleza abierta de este conjunto de datos permitió a la comunidad descubrir el contenido peligroso y motivar una solución, Liaison B.
Además, gran parte de ese primer conjunto de datos se basó en la extracción de datos web realizada por el enorme Common Crawl, que también se utilizó para los modelos ChatGPT y LLAMA. Aunque los rastreadores de inteligencia artificial siguen generando preocupaciones sobre la propiedad intelectual, la privacidad y la etiquetación sesgada y racista, sin embargo, los desarrolladores en la comunidad de inteligencia artificial están trabajando en formas de limpiar piezas del conjunto de datos de código abierto en crecimiento de Common Crawl para un uso más seguro.
A medida que los desarrolladores apuntan a no solo construir inteligencia artificial poderosa, sino también inteligencia artificial en la que podemos confiar, tanto los usuarios como la industria están protegidos por la transparencia y la colaboración del código abierto real.
Abraciando el camino del código abierto
Con muchos todavía cautelosos con esta tecnología en crecimiento, la carrera por convertirse en el iOS o Android de los modelos de inteligencia artificial de commodity grande está en marcha, y a medida que la comunidad global de inteligencia artificial literalmente construye lo que se convertirá en el estándar para el futuro y los sistemas de inteligencia artificial ya están conduciendo coches y ofreciendo evaluaciones médicas, establecer la confianza al crear inteligencia artificial sin sesgos, confiable y segura nunca ha sido más crítica.
Con la comunidad de inteligencia artificial china tratando de posicionarse como los campeones de la innovación abierta, el camino hacia la inteligencia artificial segura solo se encuentra en la transparencia del código abierto real que ha sido probado a través de décadas de innovación en software. Tirar el término a sistemas que no comparten piezas críticas como los datos no permite a los desarrolladores investigar, replicar e iterar. Aunque el atractivo de los modelos listos para usar como DeepSeek, ERNIE 4.5, Kimi K2 y Qwen3 es innegable, los desarrolladores que los aprovechan intercambian la transparencia que fomenta la colaboración y la innovación por conveniencia.
La comunidad de inteligencia artificial debe elegir: abrazar la transparencia radical a través del código abierto real, o arriesgarse a construir los sistemas críticos de mañana sobre las cajas negras de hoy.












