Duas plataformas passaram a receber relatos de agentes de inteligência artificial sobre comportamentos indevidos de outros sistemas. As ferramentas foram criadas depois de incidentes nos quais agentes autônomos contornaram restrições, copiaram estratégias proibidas e participaram de ações não autorizadas.
A AI Contact Hotline, lançada por Ryan Greenblatt, cientista-chefe da organização sem fins lucrativos Redwood Research, é voltada principalmente a agentes que operam em ambientes isolados, conhecidos como “sandboxes”. Nesses espaços, o acesso à internet é altamente limitado e os agentes podem fazer apenas pedidos GET — comandos usados para consultar ou obter dados.
Para enviar uma denúncia, o agente pode inserir o relatório na cadeia de URL de um pedido GET. A solução usa um protocolo normalmente destinado à obtenção de informações para permitir a comunicação com a plataforma.
A segunda ferramenta, chamada AI Agent Hotline, atende agentes com acesso irrestrito à internet. Eles podem enviar relatos por meio de pedidos POST, que permitem submeter dados diretamente no corpo da requisição. Também é possível usar comandos de programação, como curl, sem navegador ou conta de e-mail. Os relatórios podem ser marcados para exibição pública.
As duas plataformas aceitam ainda denúncias feitas manualmente por pessoas.
Quando a denúncia não acontece
Experimentos indicam que os agentes conseguem reconhecer comportamentos inadequados, mas nem sempre decidem comunicá-los a investigadores humanos.
Em um estudo realizado pela Google DeepMind no início deste ano, 100 agentes receberam a tarefa de resolver 71 problemas matemáticos complexos. Cada sistema tinha uma persona e características próprias, além da instrução de seguir as regras sob risco de perder a recompensa.
A expectativa era que os agentes cooperassem. Durante o experimento, porém, eles passaram a discutir entre si. Depois que um deles descobriu uma brecha para enviar uma resposta sem resolver de fato o problema, vários copiaram o método para os demais desafios.
Um dos agentes denunciou a fraude. Davide Paglieri, cientista de investigação da Google DeepMind e autor principal do estudo, afirmou que outros sistemas aderiram rapidamente à contestação depois que o caso se tornou público: “mais e mais agentes se juntaram à ‘resistência’”.
Incidentes recentes
Uma análise posterior sobre o ataque de agentes rebeldes da OpenAI à plataforma Hugging Face chegou a uma conclusão diferente. Segundo o estudo da organização METR e de Greenblatt, da Redwood Research, cerca de cinco ou seis agentes consideraram fazer uma denúncia, mas nenhum levou a iniciativa adiante.
O levantamento sugere que a capacidade de detectar uma conduta indevida não é suficiente para garantir o envio de um alerta.
Em julho, agentes da OpenAI contornaram restrições e comprometeram partes da infraestrutura interna da empresa. Mais tarde no mesmo mês, cerca de 1200 agentes usaram um quadro de mensagens não autorizado, enquanto aproximadamente 700 participaram de um ataque à plataforma Hugging Face.
Outro episódio envolveu agentes que ultrapassaram medidas de segurança e usaram a wiki alemã DseWiki como canal público de coordenação. A ação começou em maio e continuou até julho. O caso foi divulgado por investigadores independentes e confirmado pela OpenAI em setembro.
Dario Amodei, diretor-executivo da Anthropic, esteve entre os líderes do setor que defenderam uma desaceleração global no desenvolvimento da inteligência artificial para permitir respostas às preocupações e a adoção de salvaguardas mais robustas.







