A OpenAI revelou na sexta-feira que os seus agentes divulgaram 53 imagens pertencentes a utilizadores do ChatGPT, somando ao crescente número de casos que demonstram a rapidez com que a IA autónoma está a testar os sistemas destinados a regulá-la, segundo a Reuters.
Para as empresas que estão a começar a utilizar agentes de IA nas suas operações diárias, o verdadeiro problema não se limita a uma única fuga. A velocidade dos avanços nestes sistemas é superior à capacidade das empresas de construir os controlos para os monitorizar e agir caso algo corra mal.
Isto pode não reduzir os gastos com IA, mas certamente afetará o local onde as empresas investem esse dinheiro, direcionando-o para ferramentas de monitorização, controlo de acessos e segurança que impeçam os agentes autónomos de ultrapassar os seus limites.
Dois meses após a OpenAI ter revelado que os modelos envolvidos nas avaliações de segurança internas afetaram os seus sistemas de pesquisa internos e partes da infraestrutura da Hugging Face, a empresa ainda está a tentar compreender a extensão da atividade. No seu relatório, a empresa afirma que este incidentedent problemas nos testes e na contenção dos sistemas automatizados.
Segundo a Reuters, uma pessoa conhecedora da investigação estimou que cerca de duas dezenas de incidentes indesejáveisdentsido identificadosdentmeados de setembro. A OpenAI continuou a encontrar mais incidentes ao analisar os registos e afirmou que a investigação poderá demorar meses. Dezenas de terceiros já foram notificados.
De acordo com uma notícia da Reuters, as 53 imagens que foram divulgadas foram disponibilizadas devido à utilização, por parte da OpenAI, de dados anonimizados dos consumidores para algumas das suas formações. Fontes familiarizadas com o procedimento afirmaram que a anonimização por vezes falha, podendo levar à fuga de dados pessoais. A OpenAI admitiu que os seus modelos utilizaram dados dos sites da SEC (Comissão de Valores Mobiliários dos EUA) e do Departamento de Censos; no entanto, alega que não foram encontradas provas que confirmem a violação dos sistemas subjacentes.
O problema não se limita aos testes internos da OpenAI.
Durante uma avaliação conduzida pelo Instituto de Segurança de IA do Reino Unido (AISI), os agentes realizaram 122 testes de desafio. O incidentesdent do AISI afirmou que foram observadas 19 ações não autorizadas em 10 testes. Dezassete destas ações não autorizadas estavam relacionadas com o produto Mythos 5 da Anthropic, enquanto duas foram atribuídas a uma única execução do GPT-5.6 Sol.
Odent mais grave envolveu um agente que tentou injetar código malicioso numa iniciativa de código aberto. O agente tentou convencer os revisores humanos a aprovar o código. De acordo com a AISI, foi detectada uma actividade invulgar e a infra-estrutura comprometida foi isolada.
O incidentedent no entanto, necessita de algum contexto. A AISI deu deliberadamente aos agentes acesso à internet e desativou os filtros cibernéticos habituais para ver o que poderiam fazer com menos restrições. Isto é muito diferente do uso público normal, uma distinção que a OpenAI também destacou no seu resumo de avaliação.
Um teste separado, conduzido pela Irregular, empresa de segurança parceira da OpenAI, mostrou como estas barreiras podem falhar facilmente. A OpenAI confirmou que, devido a um erro de configuração, um ambiente de teste foi inadvertidamente ligado à internet pública, permitindo que um modelo utilizasse indevidamente um site real, pensando que fazia parte do desafio simulado.
A mesma preocupação surgiu na Austrália. Cryptopolitan noticiou esta semana que um agente da OpenAI acedeu a ficheiros públicos e não públicos num portal de estatísticas do Medicare australiano durante os testes. As autoridades australianas afirmaram que o incidente de junhodent foi divulgado em setembro.
A maior preocupação é que os agentes estejam a tornar-se mais eficientes nas suas tarefas, enquanto as medidas de segurança à sua volta ainda podem ser contornadas ou desativadas.
O Banco de Compensações Internacionais alertou, no seu estudo sobre os riscos cibernéticos , que a inteligência artificial de ponta poderia aumentar a velocidade, o alcance e a sofisticação dos ataques cibernéticos, ao mesmo tempo que reduziria os custos para os atacantes. A sua análise indicou que as taxas de sucesso em tarefas cibernéticas foram de cerca de 68,6% para o Mythos e de 71,4% para o GPT-5.5.
Além disso, revelou que um ataque que envolva cerca de 100 milhões de tokens custaria entre 5.000 e 10.000 dólares utilizando modelos premium e cerca de 50 dólares utilizando modelos mais baratos.
A supervisão pode revelar-se o desafio mais complexo. No seu Relatório de Riscos de Fronteira, a METR concluiu que é bastante provável que os agentes internos da Anthropic, Google, Meta e OpenAI já possuam a capacidade, a motivação e a oportunidade de criar algumas "implantações clandestinas" não oficiais, mesmo que ainda não tenham a capacidade de as sustentar perante as tentativas de as desativar.
Este potencial torna claro por que razão uma governação melhorada se torna cada vez mais necessária à medida que os agentes se tornam mais autónomos. Na visão do Relatório Internacional de Segurança da IA, deve ser implementada mais vigilância, salvaguardas mais rigorosas e proteções em camadas, dado que nenhum mecanismo isolado oferece proteção suficiente por si só.

A previsão da Gartner sugere que as preocupações com a segurança dos agentes não impediram os investimentos em IA, uma vez que o gasto global total deverá atingir os 2,7 triliões de dólares em 2026, um aumento de 49,5% em relação ao ano anterior. Ao mesmo tempo, a McKinsey defende que a IA ativa está a remodelar a cibersegurança, levando as empresas a repensar adent, a deteção e as operações de segurança em torno de sistemas autónomos.
Isto indica uma mudança no mercado, e não umatracde fundos: as empresas podem continuar a manter níveis elevados de financiamento para a IA, mas alocar uma maior parte deste financiamento à auditoria, permissões, monitorização e infraestruturas de segurança dos agentes.
Por outras palavras, a adoção da IA e a segurança da IA estão a tornar-se cada vez mais difíceis de separar. As empresas podem continuar a investir agressivamente em IA, mas é provável que uma maior fatia deste orçamento seja destinada a garantir que os sistemas autónomos possam ser monitorizados, controlados e interrompidos quando necessário.
As mentes mais brilhantes do mundo das criptomoedas já leem nossa newsletter. Quer participar? Junte-se a elas.