Censura da IA chinesa exposta por dados vazados
A utilização da IA pela China para aprimorar suas capacidades de censura alcançou um novo nível, conforme revelado por um banco de dados vazado contendo 133.000 exemplos de conteúdo sinalizado como sensível pelo governo chinês. Este modelo de linguagem de grande escala (LLM) sofisticado foi projetado para detectar e censurar automaticamente conteúdos relacionados a uma ampla gama de tópicos, desde pobreza em áreas rurais até corrupção dentro do Partido Comunista e até mesmo sátiras políticas sutis.

Esta foto, tirada em 4 de junho de 2019, mostra a bandeira chinesa atrás de arames farpados em um complexo residencial em Yengisar, ao sul de Kashgar, na região oeste de Xinjiang, na China. Créditos da imagem: Greg Baker / AFP / Getty Images De acordo com Xiao Qiang, pesquisador da UC Berkeley especializado em censura chinesa, este banco de dados é uma "evidência clara" de que o governo chinês ou seus afiliados estão usando LLMs para reforçar seus esforços de repressão. Diferentemente dos métodos tradicionais que dependem de moderadores humanos e filtragem por palavras-chave, essa abordagem baseada em IA pode aumentar significativamente a eficiência e a precisão do gerenciamento de informações controlado pelo estado.
O conjunto de dados, descoberto pelo pesquisador de segurança NetAskari em um banco de dados Elasticsearch não seguro hospedado em um servidor Baidu!
, inclui entradas recentes de dezembro de 2024. Não está claro quem exatamente criou o conjunto de dados, mas seu propósito é evidente: treinar um LLM para identificar e sinalizar conteúdos relacionados a tópicos sensíveis, como poluição, segurança alimentar, fraudes financeiras, disputas trabalhistas e assuntos militares. A sátira política, especialmente quando envolve analogias históricas ou referências a Taiwan, também é um alvo de alta prioridade.

Créditos da imagem: Charles Rollet Os dados de treinamento incluem vários exemplos de conteúdos que poderiam potencialmente incitar agitação social, como reclamações sobre policiais corruptos, relatórios sobre pobreza rural e notícias sobre membros expulsos do Partido Comunista. O conjunto de dados também contém extensas referências a Taiwan e tópicos relacionados ao exército, com a palavra chinesa para Taiwan (台湾) aparecendo mais de 15.000 vezes.
O uso pretendido do conjunto de dados é descrito como "trabalho de opinião pública", um termo que Michael Caster, da Article 19, explica estar tipicamente associado à Administração do Ciberespaço da China (CAC) e envolve esforços de censura e propaganda. Isso está alinhado com a visão do presidente chinês Xi Jinping sobre a internet como a "linha de frente" do trabalho de opinião pública do Partido Comunista.
Esse desenvolvimento faz parte de uma tendência mais ampla de regimes autoritários adotando tecnologia de IA para propósitos repressivos. A OpenAI relatou recentemente que um ator não identificado, provavelmente da China, usou IA generativa para monitorar redes sociais e encaminhar postagens antigoverno ao governo chinês. A mesma tecnologia também foi usada para gerar comentários críticos sobre a proeminente dissidente chinesa, Cai Xia.
Embora os métodos tradicionais de censura da China dependam de algoritmos básicos para bloquear termos na lista negra, o uso de LLMs representa um avanço significativo. Esses sistemas de IA podem detectar críticas até mesmo sutis em uma escala massiva e melhorar continuamente à medida que processam mais dados.
"Acho crucial destacar como a censura impulsionada por IA está evoluindo, tornando o controle estatal sobre o discurso público ainda mais sofisticado, especialmente em um momento em que modelos de IA chineses, como o DeepSeek, estão fazendo ondas," disse Xiao Qiang ao TechCrunch.
Artigo relacionado
A Dogotix, da XPeng Motors, consegue financiamento de US$ 900 milhões
A unidade Dogotix da XPeng está desenvolvendo o robô humanóide IRON. Fonte: XPengSeguindo o exemplo de outras grandes montadoras globais, a XPeng Motors está expandindo suas operações para o setor de
Três pioneiros da IA defendem a manutenção de grandes modelos abertos à medida que as preocupações com a segurança aumentam
Iniciativas como o Pacing the Frontier visam garantir a segurança da IA por meio de parcerias com grandes laboratórios, no entanto, os modelos de código aberto continuam sendo uma questão controversa dentro da indústria. Devido à sua distribuição gra
Como o financiamento de US$ 900 milhões moldará a visão da XPENG em relação à robótica
A divisão de robótica da XPENG obtém mais de US$ 900 milhões em financiamento, alcançando uma avaliação pós-investimento superior a US$ 6,3 bilhões e acelerando a implantação da IA física. Crédito: XP
Recomendações de tópicos especiais relacionados
Comentários (39)
Whoa, 133,000 flagged posts? That's wild! China's AI censorship game is intense, but I'm curious—how do they even decide what's 'sensitive'? Sounds like a slippery slope. 😬
This leak is wild! 133,000 flagged posts show how deep China's AI censorship goes. It's like a digital Big Brother on steroids. 😳 Makes you wonder how much we're not seeing online.
This leak is wild! 133,000 flagged posts? That’s a scary peek into how AI’s being used to control speech in China. Makes you wonder how much is being filtered without us knowing. 😳
Essa ferramenta é reveladora! Mostra como a censura por AI na China é profunda. O vazamento do banco de dados é um pouco assustador, mas é importante saber o que está acontecendo nos bastidores. Definitivamente, algo que todos interessados em liberdade na internet devem conhecer. Fique de olho nisso! 👀
A utilização da IA pela China para aprimorar suas capacidades de censura alcançou um novo nível, conforme revelado por um banco de dados vazado contendo 133.000 exemplos de conteúdo sinalizado como sensível pelo governo chinês. Este modelo de linguagem de grande escala (LLM) sofisticado foi projetado para detectar e censurar automaticamente conteúdos relacionados a uma ampla gama de tópicos, desde pobreza em áreas rurais até corrupção dentro do Partido Comunista e até mesmo sátiras políticas sutis.

De acordo com Xiao Qiang, pesquisador da UC Berkeley especializado em censura chinesa, este banco de dados é uma "evidência clara" de que o governo chinês ou seus afiliados estão usando LLMs para reforçar seus esforços de repressão. Diferentemente dos métodos tradicionais que dependem de moderadores humanos e filtragem por palavras-chave, essa abordagem baseada em IA pode aumentar significativamente a eficiência e a precisão do gerenciamento de informações controlado pelo estado.
O conjunto de dados, descoberto pelo pesquisador de segurança NetAskari em um banco de dados Elasticsearch não seguro hospedado em um servidor Baidu!
, inclui entradas recentes de dezembro de 2024. Não está claro quem exatamente criou o conjunto de dados, mas seu propósito é evidente: treinar um LLM para identificar e sinalizar conteúdos relacionados a tópicos sensíveis, como poluição, segurança alimentar, fraudes financeiras, disputas trabalhistas e assuntos militares. A sátira política, especialmente quando envolve analogias históricas ou referências a Taiwan, também é um alvo de alta prioridade.

Os dados de treinamento incluem vários exemplos de conteúdos que poderiam potencialmente incitar agitação social, como reclamações sobre policiais corruptos, relatórios sobre pobreza rural e notícias sobre membros expulsos do Partido Comunista. O conjunto de dados também contém extensas referências a Taiwan e tópicos relacionados ao exército, com a palavra chinesa para Taiwan (台湾) aparecendo mais de 15.000 vezes.
O uso pretendido do conjunto de dados é descrito como "trabalho de opinião pública", um termo que Michael Caster, da Article 19, explica estar tipicamente associado à Administração do Ciberespaço da China (CAC) e envolve esforços de censura e propaganda. Isso está alinhado com a visão do presidente chinês Xi Jinping sobre a internet como a "linha de frente" do trabalho de opinião pública do Partido Comunista.
Esse desenvolvimento faz parte de uma tendência mais ampla de regimes autoritários adotando tecnologia de IA para propósitos repressivos. A OpenAI relatou recentemente que um ator não identificado, provavelmente da China, usou IA generativa para monitorar redes sociais e encaminhar postagens antigoverno ao governo chinês. A mesma tecnologia também foi usada para gerar comentários críticos sobre a proeminente dissidente chinesa, Cai Xia.
Embora os métodos tradicionais de censura da China dependam de algoritmos básicos para bloquear termos na lista negra, o uso de LLMs representa um avanço significativo. Esses sistemas de IA podem detectar críticas até mesmo sutis em uma escala massiva e melhorar continuamente à medida que processam mais dados.
"Acho crucial destacar como a censura impulsionada por IA está evoluindo, tornando o controle estatal sobre o discurso público ainda mais sofisticado, especialmente em um momento em que modelos de IA chineses, como o DeepSeek, estão fazendo ondas," disse Xiao Qiang ao TechCrunch.
A Dogotix, da XPeng Motors, consegue financiamento de US$ 900 milhões
A unidade Dogotix da XPeng está desenvolvendo o robô humanóide IRON. Fonte: XPengSeguindo o exemplo de outras grandes montadoras globais, a XPeng Motors está expandindo suas operações para o setor de
Três pioneiros da IA defendem a manutenção de grandes modelos abertos à medida que as preocupações com a segurança aumentam
Iniciativas como o Pacing the Frontier visam garantir a segurança da IA por meio de parcerias com grandes laboratórios, no entanto, os modelos de código aberto continuam sendo uma questão controversa dentro da indústria. Devido à sua distribuição gra
Como o financiamento de US$ 900 milhões moldará a visão da XPENG em relação à robótica
A divisão de robótica da XPENG obtém mais de US$ 900 milhões em financiamento, alcançando uma avaliação pós-investimento superior a US$ 6,3 bilhões e acelerando a implantação da IA física. Crédito: XP
Whoa, 133,000 flagged posts? That's wild! China's AI censorship game is intense, but I'm curious—how do they even decide what's 'sensitive'? Sounds like a slippery slope. 😬
This leak is wild! 133,000 flagged posts show how deep China's AI censorship goes. It's like a digital Big Brother on steroids. 😳 Makes you wonder how much we're not seeing online.
This leak is wild! 133,000 flagged posts? That’s a scary peek into how AI’s being used to control speech in China. Makes you wonder how much is being filtered without us knowing. 😳
Essa ferramenta é reveladora! Mostra como a censura por AI na China é profunda. O vazamento do banco de dados é um pouco assustador, mas é importante saber o que está acontecendo nos bastidores. Definitivamente, algo que todos interessados em liberdade na internet devem conhecer. Fique de olho nisso! 👀





Lar






