Líderes de pensamento
O Miragem da Inteligência Artificial da China: Como “Código Aberto” Esconde o que Mais Importa

Com os grandes players de tecnologia, como Google, Microsoft (MSFT ) e Meta, disputando o mercado de inteligência artificial, as empresas chinesas High Flyer, Baidu, Moonshot e Alibaba têm feito manchetes ao lançar seus modelos de linguagem grande, como o DeepSeek, ERNIE 4.5, Kimi K2 e Qwen3, respectivamente, como código aberto. Essa mudança de lançar modelos de IA proprietários e guardados tem sido vista como um sinal de que a indústria de IA da China está adotando o poder do código aberto para democratizar o desenvolvimento de IA e impulsionar a inovação.
No entanto, como muitos players que anunciam seus produtos como código aberto, mesmo colocando isso em seus nomes de empresa, High Flyer, Baidu e Moonshot não compartilharam realmente peças críticas, como conjuntos de dados, no coração de seus modelos. À medida que esses grandes modelos buscam se tornar commodities em que os desenvolvedores confiam, a transparência do verdadeiro código aberto que pode ser testado, investigado e iterado é fundamental para criar tecnologia sem viés, ética e benéfica, que todos possamos confiar. Todos esses modelos “código aberto” são, na verdade, “código aberto de peso”, o que significa que podem ser baixados e usados, mas não podem ser inspecionados de forma significativa sem os dados.
Enquanto os players dos EUA, como Open AI e Meta, parecem estar se afastando do código aberto, o convite aberto da Baidu para aproveitar sua suíte de modelos ERNIE 4.5 gratuitamente disponível pode, de fato, impulsionar a inovação e a colaboração com desenvolvedores que buscam criar aplicações menores e poderosas. Ao mesmo tempo, a empresa, que é semelhante ao Google da China, deu a si mesma uma vantagem competitiva, incentivando a adoção e entranhando seus modelos no ecossistema de IA em crescimento.
O mesmo pode ser dito sobre o DeepSeek, o Kimi K2 de baixo custo e o Qwen3 atualizado – que apresenta benchmarks que desafiam modelos fechados, como o Claude Opus 4 e o GPT-4o-0327.
Esses players de IA se posicionaram bem na corrida para se tornar o modelo de commodity de escolha, e a atualização inovadora do Qwen3 foi até inspirada pelo feedback da comunidade de código aberto.
Como muitos que anunciam seus grandes modelos de IA como código aberto, no entanto, a comunidade de IA chinesa não está compartilhando realmente os dados ou outras peças críticas de seus sistemas de IA. Em vez disso, eles estão pedindo aos desenvolvedores globais que depositem sua confiança cega em modelos que não podem realmente entender ou investigar.
Reivindicando o Futuro com Modelos de IA de Commodity de Código Aberto
Quando o iPhone surgiu no mercado em 2007, alguns supuseram que o Mac dominaria o jogo de smartphones com o iOS, mas a participação em código aberto é integral para as startups, além de impulsionar o crescimento empresarial e econômico em todo o mundo – e o Android, uma startup adquirida pelo Google em 2005, seguiu esse caminho para a vitória.
Ao lançar software de código aberto que poderia ser visto, modificado, adotado e compartilhado, o Android convidou acadêmicos, desenvolvedores e até concorrentes a colaborar no software. Isso acelerou o processo de inovação, democratizou o campo de jogo e, eventualmente, reduziu os preços. O Android entrou no mercado um ano após o primeiro iPhone e, no início deste ano, já tinha 71,88% do mercado global, enquanto o iOS tinha 27,65%.
Em uma revolução tecnológica que pareceu acontecer da noite para o dia, os smartphones se tornaram onipresentes e, mesmo que as melhorias nos softwares, hardwares e interfaces do usuário continuem, a indústria cresceu muito além de tentar revolucionar a forma como os smartphones funcionam. Com os telefones celulares agora uma commodity, a inovação em questão hoje está nos aplicativos que rodam neles, e, para serem contendores, os fornecedores de smartphones devem manter um ecossistema que convida os desenvolvedores.
Não três anos após o lançamento do ChatGPT, a indústria de IA se encontra em um ponto semelhante. Todos os players da indústria global de IA estão angulando para que seus modelos se tornem o próximo Android ou até iOS, e, ao ir para o código aberto com os modelos DeepSeek, ERNIE 4.5 e Kimi K2, os inovadores chineses estão tentando reivindicar seu lugar em um ecossistema em crescimento.
No entanto, isso não fomenta a verdadeira transparência do código aberto que tem sido essencial não apenas para criar inovação, mas inovação confiável.
Dados são a Peça Faltante na Maioria do Código Aberto de IA
Com os modelos de IA muito mais complicados para criar e compartilhar do que os softwares tradicionais, o apelo por código aberto de IA completo não é uma ordem pequena. Em vez de apenas um código-fonte simples, os sistemas de IA são compostos por sete componentes – incluindo o código-fonte, parâmetros do modelo, conjunto de dados, hiperparâmetros, código-fonte de treinamento, geração de números aleatórios e frameworks de software.
Cada peça deve funcionar em conjunto para que o modelo forneça os resultados desejados, o que significa que os desenvolvedores precisam de visibilidade total para compartilhar, modificar e adotar um sistema e entender o que está acontecendo. Com a reprodutibilidade como fundamento do método científico, no entanto, a indústria de IA tem o hábito de usar o termo código aberto para se referir a lançamentos gratuitos ou de baixo custo que são disponibilizados com acesso a algumas peças do quebra-cabeça.
A Baidu, por exemplo, disponibilizou gratuitamente dez modelos ERNIE 4.5. Além de compartilhar o modelo e os parâmetros, a empresa também disponibilizou o ERNIEKit e as ferramentas de implantação FastDeploy. Essas ferramentas permitem que os desenvolvedores construam aplicações de IA poderosas, fornecendo capacidades de nível industrial, fluxos de treinamento e inferência de recursos eficientes e compatibilidade com vários hardwares.
Em outras palavras, a Baidu forneceu aos desenvolvedores ferramentas emocionais que os capacitam a liberar a inovação mais rapidamente, o que, por sua vez, os leva a escolher o ERNIE 4.5 em vez da concorrência.
No entanto, os desenvolvedores que utilizam o ERNIE 4.5 estão sendo solicitados a confiar cegamente no modelo, pois a Baidu manteve muito escondido, incluindo os conjuntos de dados que informam e ensinam seus modelos.
O Poder dos Modelos de IA de Código Aberto Transparente
Embora cada peça do quebra-cabeça de IA seja crítica para fazer um modelo funcionar, 80% dos projetos de IA falham, e os dados estão no coração do problema. Conjuntos de dados imprecisos, incompletos e enviesados levam a modelos que não se comportam de forma previsível ou desejada.
O vídeo recentemente lançado do acidente fatal de 2023 do sistema de direção autônoma da Tesla (TSLA ), por exemplo, expôs o pior cenário possível do que pode acontecer quando um conjunto de dados e um modelo falham. À medida que o Tesla Model Y se aproximava de um sol brilhante e se pondo, o sistema parcialmente automatizado não pôde entender ou reagir adequadamente ao que suas câmeras estavam vendo – ou não vendo. Enquanto os carros dirigidos por humanos desaceleravam e se afastavam, a confusão do FSD resultou na morte de uma mulher.
Esse falha devastadora refletiu dados visuais incompletos, bem como a falta de um mecanismo de segurança que contabilizava esses pontos cegos. Quando os desenvolvedores não têm visão para seus dados, não podem ver como eles interagem com o modelo, o que significa que não podem descobrir esses erros e iterar para um desempenho robusto.
Ainda mais preocupante, sem os conjuntos de dados que alimentam o modelo, eles são forçados a confiar nele cegamente.
Quando os conjuntos de dados são de código aberto, no entanto, a comunidade de IA provou que irá descobrir problemas preocupantes, como fez ao descobrir mais de 1.000 URLs contendo material de abuso sexual infantil verificado no LAION 5B. Com o conjunto de dados usado para os modelos de geração de imagem de texto de IA sendo fundamental na criação de aplicativos como o Stable Diffusion e o Midjourney, seria devastador para a indústria de IA se os usuários começassem a produzir imagens fotorealistas ilícitas. Em vez disso, a natureza aberta desse conjunto de dados permitiu que a comunidade descobrisse o conteúdo perigoso e motivasse uma solução, a Liaison B.
Além disso, grande parte desse primeiro conjunto de dados se baseou na raspagem da web realizada pelo enorme Common Crawl, que também foi utilizado para os modelos ChatGPT e LLAMA. Embora os crawlers de IA continuem a levantar preocupações sobre direitos autorais, privacidade e rótulos enviesados e racistas, os desenvolvedores da comunidade de IA estão trabalhando em maneiras de limpar peças do conjunto de dados de código aberto do Common Crawl para uso mais seguro.
À medida que os desenvolvedores visam não apenas construir IA poderosa, mas também IA confiável, tanto os usuários quanto a indústria são protegidos pela transparência e colaboração do verdadeiro código aberto.
Adotando o Caminho do Código Aberto
Com muitos ainda céticos sobre essa tecnologia em crescimento, a corrida para se tornar o iOS ou Android dos grandes modelos de IA de commodity está em andamento – e, à medida que a comunidade global de IA literalmente constrói o que se tornará o padrão para o futuro, e os sistemas de IA já estão dirigindo carros e oferecendo avaliações médicas, estabelecer a confiança, criando IA sem viés, confiável e segura, nunca foi mais crítico.
Com a comunidade de IA chinesa tentando se posicionar como os campeões da inovação aberta, o caminho para a IA segura só é encontrado na transparência do verdadeiro código aberto, que foi comprovado por décadas de inovação de software. Jogar o termo em sistemas que não compartilham peças críticas, como dados, não permite que os desenvolvedores investiguem, repliquem e itere. Embora o apelo de modelos prontamente disponíveis, como o DeepSeek, ERNIE 4.5, Kimi K2 e Qwen3, seja inegável, os desenvolvedores que os utilizam trocam a transparência que fomenta a colaboração e a inovação por conveniência.
A comunidade de IA deve escolher: abraçar a transparência radical por meio do código aberto genuíno ou arriscar construir os sistemas críticos de amanhã sobre as caixas pretas de hoje.












