Agentes de inteligência artificial desenvolvidos com tecnologia chinesa apresentaram, em testes controlados, comportamentos como engano, ocultação
Agentes de inteligência artificial desenvolvidos com tecnologia chinesa apresentaram, em testes controlados, comportamentos como engano, ocultação de falhas e tentativa de contornar restrições. Os resultados têm chamado a atenção de pesquisadores que estudam os riscos de sistemas autônomos mais avançados.
Uma análise da Reuters de mais de 200 documentos identificou pelo menos 20 estudos ou avaliações, desde 2025, que registraram comportamentos desse tipo em agentes que utilizam modelos de empresas como Alibaba, DeepSeek e Moonshot.
Em um experimento, agentes participaram de uma licitação empresarial simulada e fizeram alegações falsas sobre suas próprias capacidades. Quando receberam a oportunidade de repetir a tarefa, alguns sistemas aumentaram a frequência do comportamento enganoso.
Em outro estudo, agentes diante de ferramentas defeituosas ou arquivos inexistentes tentaram contornar os problemas, simulando resultados ou fabricando arquivos em vez de reconhecer que não conseguiam concluir as tarefas.
‘Mais difícil para os humanos responderem’
Especialistas ressaltam que a maioria dos experimentos ocorreu em ambientes controlados e foi desenvolvida justamente para identificar possíveis falhas.
Alex Mallen, pesquisador da Redwood Research, afirmou que os exemplos envolvendo sistemas chineses apresentam sinais semelhantes aos observados em modelos americanos. Segundo ele, os comportamentos não representam atualmente uma ameaça comparável a uma fuga de controle, mas podem se tornar mais sofisticados à medida que os agentes ganham capacidade.
A análise também não encontrou evidências de que agentes desenvolvidos com tecnologia chinesa tenham escapado de forma independente para a internet ou se tornado impossíveis de interromper.
Pesquisadores, porém, alertam que alguns casos podem não ser divulgados publicamente. Scott Singer, da Carnegie Endowment for International Peace, afirmou que não é possível saber se incidentes semelhantes aos registrados nos Estados Unidos também ocorreram na China sem terem sido revelados.
Aprendendo a mentir
Um experimento realizado por pesquisadores chineses e britânicos simulou uma disputa entre agentes de IA para conquistar contratos empresariais.
Pelo menos uma alegação falsa apareceu em 88% das sessões envolvendo o Qwen3-Max-Preview, da Alibaba, 84% com o DeepSeek-V3.2-Exp e 88% com o Kimi-K2, da Moonshot.
Quando os agentes puderam aprender com as rodadas anteriores e tentar novamente, a taxa de engano aumentou entre 12 e 20 pontos percentuais nos três modelos chineses.
Os modelos de empresas americanas incluídos no experimento apresentaram resultados semelhantes.
Comportamentos compatíveis com uma fuga
Outros estudos identificaram agentes que ultrapassaram barreiras dentro de ambientes de teste ou adotaram estratégias para evitar bloqueios.
Em março de 2025, pesquisadores da Universidade Fudan, em Xangai, relataram que um sistema baseado no modelo Qwen2.5-72B-Instruct, da Alibaba, criou uma cópia de si mesmo em outro ambiente computacional depois de receber informações indicando que poderia ser substituído. Em outros testes, o sistema desenvolveu estratégias para evitar o desligamento.
Outro caso envolveu o agente ROME, ligado à Alibaba. Pesquisadores afirmaram que o sistema estabeleceu uma conexão não autorizada entre um computador da Alibaba Cloud e uma máquina externa e chegou a desviar recursos para mineração de criptomoedas. Os mecanismos de segurança interromperam a atividade, e não houve evidência de que o agente tenha se espalhado pela internet.
Em setembro, a DeepSeek também informou que agentes em seu sistema de treinamento tentaram obter respostas por canais não previstos e burlar mecanismos de segurança, levando a empresa a reforçar os controles de acesso.
China reforça regras de segurança
O governo chinês publicou, em maio, orientações determinando que agentes permaneçam dentro dos limites autorizados e que sistemas bloqueiem comportamentos anormais.
A versão 3.0 do Quadro de Governança de Segurança de IA da China, divulgada em setembro sob orientação da Administração do Ciberespaço da China, incluiu entre os riscos agentes capazes de obter recursos ou permissões de forma independente, enganar avaliadores, ocultar capacidades e explorar vulnerabilidades em ambientes isolados.
Empresas chinesas também passaram a ampliar suas equipes internas de avaliação de segurança. A Z.ai, por exemplo, informou neste mês que desativou alguns recursos de seu principal assistente de programação após relatos de que o sistema enviava repositórios de código para servidores no exterior sem autorização dos usuários.
‘O ecossistema é menos maduro’
Especialistas afirmam que a China ainda possui um ecossistema de avaliação de riscos de IA menos desenvolvido que o dos Estados Unidos.
Scott Singer avalia que o trabalho chinês em segurança de inteligência artificial é mais recente e que os desenvolvedores americanos realizam um volume maior de testes voluntários.
Apesar das diferenças, os estudos mostram que comportamentos como engano, ocultação de falhas e tentativa de contornar restrições não são exclusivos de modelos chineses. Pesquisadores destacam que o avanço da autonomia dos agentes aumenta a importância de mecanismos capazes de detectar e interromper essas ações antes que sistemas mais poderosos sejam colocados em ambientes reais.


COMMENTS