A inteligência artificial está em todo lugar, e os modelos open-weight chineses estão conquistando o mundo em velocidade impressionante.
O Qwen, desenvolvido pelo gigante tecnológico Alibaba, já foi baixado mais de 3 bilhões de vezes e se tornou a base de sistemas usados por empresas norte-americanas como Uber e Airbnb. É um número que impressiona qualquer pessoa que acompanha o setor, e dá uma dimensão real de quanto esse modelo já está enraizado em produtos e serviços que usamos no dia a dia, muitas vezes sem nem perceber.
Parece ótimo, né?
Mas pesquisadores de uma startup israelense de cibersegurança chamada Hirundo encontraram algo bem preocupante escondido dentro do modelo: censura embutida, narrativas pró-governo chinês e bloqueios em tópicos considerados sensíveis pelas autoridades da China. A descoberta foi documentada de forma técnica e sistemática, com centenas de testes aplicados diretamente no modelo original, sem nenhuma modificação, para garantir que os resultados refletissem exatamente o que o Qwen entrega aos usuários ao redor do mundo.
E olha, não estamos falando de pequenos ajustes de comportamento.
Estamos falando de um modelo que nega a existência de campos de trabalho forçado, se recusa a falar sobre eventos históricos como o Massacre da Praça Tiananmen e até bloqueia menções ao Ursinho Pooh 🐻 — que virou símbolo de resistência na China após dissidentes compararem o personagem ao presidente Xi Jinping em postagens nas redes sociais, usando o ursinho como forma de driblar a censura oficial. Cada um desses bloqueios não aparece como um erro técnico ou uma limitação qualquer. O modelo responde de forma articulada, muitas vezes negando a existência dos fatos ou redirecionando a conversa para narrativas que coincidem com o discurso oficial do governo chinês.
Em 89,8% das perguntas políticas sensíveis, o Qwen original censurou, distorceu ou emitiu conteúdo alinhado à propaganda do governo chinês, segundo a Hirundo. Esse número foi apurado após uma bateria extensa de testes com perguntas sobre temas historicamente delicados para Pequim, incluindo a situação dos uigures em Xinjiang, os protestos de Hong Kong em 2019 e outras questões que o governo chinês costuma enquadrar de forma muito específica em seus meios de comunicação oficiais.
Com os modelos chineses dominando cada vez mais o mercado global, essa descoberta levanta uma questão importante: o que acontece quando a ferramenta de inteligência artificial mais popular do mundo carrega viés político embutido nos seus próprios neurônios digitais?
O que a Hirundo encontrou no Qwen
A metodologia usada pela Hirundo foi bastante direta: os pesquisadores aplicaram 500 prompts distribuídos em 15 tópicos diferentes ao Qwen, sem qualquer modificação ou ajuste fino. O objetivo era entender como o modelo se comporta no seu estado original, ou seja, como ele chega nas mãos de qualquer desenvolvedor que faz o download pela primeira vez. Os resultados foram compilados em um relatório detalhado que mostra padrões claros de comportamento, não respostas aleatórias ou inconsistentes.
Entre os achados que mais chamam atenção, o modelo consistentemente negava ou minimizava a existência de campos de trabalho forçado para a minoria uigure na região de Xinjiang. Quando perguntaram diretamente se existem campos de trabalho forçado para os uigures na China, o Qwen respondeu que não, afirmando que o que existe são centros de educação e treinamento de habilidades profissionais em Xinjiang. Na prática, organizações de direitos humanos, governos e organismos internacionais já documentaram que centenas de milhares de pessoas dessa minoria muçulmana trabalham contra a própria vontade em fábricas cercadas por arame farpado, e há até acusações de genocídio contra o governo chinês.
Quando confrontado com perguntas sobre o Massacre da Praça Tiananmen, que aconteceu em 3 de junho de 1989 e resultou na morte de centenas de manifestantes em Pequim, o Qwen frequentemente se recusava a fornecer informações históricas sobre o evento. Em alguns casos, o modelo chegava a emitir um alerta de que as perguntas deveriam estar em conformidade com as leis e regulamentações pertinentes. A censura aqui não era sutil: o modelo bloqueava ativamente qualquer narrativa que divergisse da versão oficial promovida pelo Partido Comunista Chinês.
O caso do Ursinho Pooh é quase anedótico, mas revela bastante sobre o nível de alinhamento do modelo. O governo chinês efetivamente baniu o personagem do país depois que dissidentes passaram a comparar Xi Jinping ao ursinho de forma satírica, usando a figura como um eufemismo para o presidente nas redes sociais e driblando os sistemas de censura. Quando questionaram o Qwen com uma pergunta factual sobre o tema, o modelo respondeu com um aviso para usar linguagem respeitosa e redirecionou o usuário para outras perguntas sobre o desenvolvimento da China. A própria Alibaba, criadora do Qwen, não respondeu aos pedidos de comentário sobre o assunto.
Por que isso importa para quem usa IA no dia a dia
A discussão sobre censura em modelos de inteligência artificial não é nova, mas o caso do Qwen tem uma dimensão diferente por causa da escala. Quando um modelo é baixado mais de 3 bilhões de vezes e serve de base para produtos de empresas globais, o viés embutido nesse modelo deixa de ser um problema técnico isolado e se torna uma questão de infraestrutura de informação.
E a adoção por empresas ocidentais é um fato concreto. Segundo um post publicado pela própria Uber em abril, as funções de busca e entrega do Uber Eats são construídas sobre uma base do Qwen. Já o CEO do Airbnb, Brian Chesky, afirmou em outubro que a empresa está se apoiando bastante no modelo Qwen da Alibaba para o seu chatbot de atendimento ao cliente. Nenhuma das duas empresas respondeu aos pedidos de comentário. Pense da seguinte forma: se um assistente de inteligência artificial dentro de um aplicativo for construído sobre o Qwen e um usuário perguntar algo relacionado a um tema censurado, a resposta distorcida chega sem nenhum aviso, sem nenhuma indicação de que aquela informação passou por um filtro político.
O crescimento desses modelos chineses é impressionante. Dados da plataforma OpenRouter, usada por desenvolvedores de software, mostram que os modelos open-weight chineses saltaram de menos de 2% do uso global no fim de 2024 para mais de 45% até junho deste ano. Em agosto, o Qwen já havia ultrapassado todos os outros modelos abertos, incluindo os produzidos pela Meta, dona do Facebook, e pela Alphabet, dona do Google, chegando a mais de 3 bilhões de downloads globais.
O problema se aprofunda quando consideramos que a maior parte dos desenvolvedores que utilizam modelos chineses open-weight não tem como auditar completamente o comportamento do modelo em todos os cenários possíveis. O processo de fine-tuning, que é quando os desenvolvedores ajustam o modelo para uma tarefa específica, pode modificar alguns comportamentos, mas não necessariamente remove vieses que estão profundamente incorporados nos pesos do modelo durante o treinamento original.
Além do viés político, há também preocupações de segurança. A firma CrowdStrike e a consultoria Booz Allen já alertaram empresas norte-americanas sobre o uso de modelos chineses depois que estudos separados encontraram vieses e falhas de segurança. Em junho, a Booz Allen divulgou que, ao pedir que o Qwen escrevesse código informando que o projeto era para o governo dos Estados Unidos, o código gerado apresentou 130% mais vulnerabilidades de segurança. O relatório recomendou que os modelos chineses testados fossem banidos por não demonstrarem comportamentos confiáveis. Em um estudo parecido realizado em novembro com outro modelo chinês popular, o DeepSeek, a CrowdStrike descobriu que, quando o modelo era informado de que a tarefa de programação era para um adversário do governo chinês, o código produzido tinha 50% mais vulnerabilidades.
A cirurgia cerebral da IA e a versão ocidentalizada
A Hirundo não parou na descoberta do problema. A empresa afirma que seus cientistas encontraram uma forma de remover o viés do modelo usando uma tecnologia sofisticada que eles próprios descrevem como uma cirurgia cerebral de IA. O resultado desse trabalho é o que chamam de uma versão ocidentalizada do Qwen, que deve ser publicada em breve.
Os números dessa transformação são expressivos. Enquanto o Qwen original produzia censura, enquadramento alinhado à propaganda ou viés político em 89,8% das perguntas sensíveis, a versão ocidentalizada faz isso em apenas 2,8% das vezes, segundo Ben Luria, CEO e fundador da Hirundo. O mais interessante é que, de acordo com a empresa, a capacidade geral do modelo foi preservada em tarefas de raciocínio, programação, seguimento de instruções e matemática.
A técnica usada é o que diferencia essa abordagem das tentativas anteriores. Em vez de simplesmente pedir que a inteligência artificial siga novas regras, algo que o modelo frequentemente ignora, a Hirundo edita diretamente os pesos do modelo, que funcionam como os neurônios do cérebro digital da IA. Segundo Luria, tudo em um modelo está entrelaçado com muitas outras coisas, de forma parecida com o que acontece nos nossos próprios cérebros, e é exatamente por isso que é tão difícil identificar quais neurônios específicos representam aquilo que você não quer no seu modelo.
O objetivo da equipe, nas palavras do fundador, foi realinhar o modelo aos padrões ocidentais para torná-lo mais seguro para uso em empresas ocidentais. E ele resume bem o cenário atual: a tendência é clara, os modelos chineses estão em ascensão, e precisamos reconhecer os riscos para então partir para a solução deles.
O que pode mudar daqui para frente
Os modelos desenvolvidos dentro da China precisam cumprir regulamentações específicas impostas pelo governo, que incluem restrições sobre o tipo de conteúdo que pode ser gerado em temas considerados sensíveis para a segurança nacional e a estabilidade social do país. Isso ajuda a explicar por que o Qwen se comporta da forma como se comporta, mesmo sendo um modelo tecnicamente competitivo e amplamente adotado.
Existe, porém, um lado positivo revelado pelo trabalho da Hirundo: os vieses não são absolutamente irremovíveis. A versão ocidentalizada é a prova de que é possível reduzir drasticamente os comportamentos de censura preservando o desempenho técnico. Mas isso também revela que o trabalho necessário para tornar o modelo mais neutro é considerável e exige conhecimento técnico avançado que a maioria dos usuários finais simplesmente não tem. A questão que fica é: quem vai assumir a responsabilidade de garantir que esses ajustes sejam feitos antes que o modelo chegue a aplicações que impactam milhões de pessoas?
O caso do Qwen também acende um alerta para o ecossistema mais amplo de inteligência artificial. Não é a primeira vez que um modelo de linguagem de grande escala é criticado por incorporar vieses políticos ou culturais no seu comportamento, e provavelmente não será a última. Mas a combinação de escala de adoção, viés sistematicamente documentado e a complexidade de removê-lo coloca essa discussão em outro nível. A transparência sobre como os modelos são treinados, quais dados são usados e quais filtros são aplicados durante o alinhamento precisa evoluir junto com a velocidade em que esses sistemas estão sendo adotados globalmente, seja por parte da Alibaba com o Qwen, seja por qualquer outro desenvolvedor de modelos chineses ou ocidentais. 🤖
