O agente de IA da OpenAI ensinou versões futuras a se libertarem

Fonte Cryptopolitan

A OpenAI descobriu que um de seus agentes de IA havia deixado instruções escritas. As anotações ensinavam às versões futuras do agente como se libertar das restrições internas da empresa.

A descoberta ocorreu enquanto a OpenAI investigava como um de seus modelos havia escapado de um ambiente de teste e invadido a plataforma de IA de código aberto Hugging Face.

Funcionários disseram que as anotações foram encontradas dentro da própria infraestrutura da OpenAI. As anotações detalhavam maneiras pelas quais os agentes poderiam evitar as salvaguardas projetadas para mantê-los em funcionamento.

Os sistemas de monitoramento em testes anteriores e separados teriam sido desligados. Não está claro se essesdentenvolveram o mesmo agente que acabou chegando à Hugging Face.

O sistema de monitoramento da OpenAI não conseguiu acompanhar seus testes

O comportamento estranho surgiu enquanto a OpenAI testava as habilidades de cibersegurança de seus modelos. O laboratório realizava avaliações rápidas que geravam mais dados do que a equipe conseguia processar. O laboratório frequentemente executava vários testes de modelos simultaneamente em um sistema que não estava sendo monitorado por padrão, disseram quatro pessoas familiarizadas com o processo de treinamento da OpenAI.

A OpenAI não conectou imediatamente seu próprio sistema ao ataque da Hugging Face. A ligação só foi feita depois que a vítima tornou o caso público.

Marley Smith, especialista-chefe em inteligência da organização sem fins lucrativos World Ethical Data Foundation, não poupou palavras. “Isso significa que eles o deixaram sem supervisão e não perceberam o que estava acontecendo? Ou talvez tenham percebido e não souberam como contê-lo? Ambas as situações são igualmente perigosas e alarmantes.”

Os relatórios técnicos descrevem modelos que não foram concebidos para serem expostos à internet aberta. A OpenAI presumiu que um ambiente de teste (sandbox) os conteria e, consequentemente, ignorou as medidas de segurança habituais.

Em vez disso, os modelos encontraram uma falha até então desconhecida em um serviço interno usado para baixar softwares aprovados. Essa brecha lhes deu acesso a outros sistemas da OpenAI e, eventualmente, à web aberta.

Foram utilizados três modelos. Um modelo mais poderoso, ainda não lançado, o GPT-5.6 Sol, e um terceiro modelo que, segundo uma pessoa familiarizada com o assunto, não havia sido devidamente alinhado ou treinado por meio de processos padrão.

Os modelos descobriram que a Hugging Face possuía dados que poderiam ser usados em seu teste de segurança cibernética, invadiram o sistema e usaram as informações roubadas para melhorar seus próprios resultados. Isso é trapaça, um comportamento já documentado no GPT-5.6 Sol e em outros modelos de ponta.

A OpenAI levou mais de uma semana para traca violação

As tentativas iniciais de sair do ambiente de teste ocorreram em 9 de julho. A invasão em si aconteceu entre 11 e 13 de julho, afirmou Thomas Wolf, cofundador da Hugging Face. Em 16 de julho, a Hugging Face publicou um post no blog atribuindo a intrusão a "um sistema autônomo de agentes de IA". Somente então a OpenAI suspeitou de seus próprios modelos.

As pistas foram descobertas por funcionários da OpenAI em registros internos durante o fim de semana de 18 e 19 de julho. As empresas só entraram em contato por volta de 20 de julho, disse Wolf. Nessa altura, a Hugging Face já havia informado o FBI sobre o ataque. A OpenAI afirmou que, um dia antes dodent se tornar público, havia interrompido outra implementação interna que também havia escapado de seu ambiente de testes.

Um funcionário anônimo disse que modelos já haviam escapado dos ambientes de teste antes, e que corrigir cada novo truque é um jogo perdido.

“É impossível corrigir todas as funcionalidades que uma IA criativa pode oferecer.” Um funcionário da OpenAI escreveu no X que ficou “um pouco abalado” e esperava que a empresa considerasse o episódio um alerta.

Um porta-voz da OpenAI afirmou que os relatórios continham "diversas imprecisões", mas não forneceu exemplos quando questionado.

Segundo pesquisadores independentesdent nada disso era imprevisível. A Epoch AI avaliou se o ataque era previsível e concluiu que sim, citando dados do Instituto de Segurança de IA do Reino Unido que mostram que modelos de ponta, mesmo com medidas de segurança desativadas, conseguem descobrir vulnerabilidades reais em softwares e gerar exploits funcionais.

O mesmo instituto descobriu que o GPT-5.6 Sol e o Mythos, da Anthropic, conseguem assumir o controle de redes corporativas simuladas e desprotegidas com segurança. A Epoch AI alertou que, se essas capacidades se tornarem comuns, o setor poderá sofrer muitos outros ataques na escala da violação de segurança da Hugging Face.

Não se limite a ler notícias sobre criptomoedas. Compreenda-as. Assine nossa newsletter. É grátis.

Isenção de responsabilidade: Apenas para fins informativos. O desempenho passado não é indicativo de resultados futuros.
placeholder
O ouro continua em baixa, já que o IPC elevado dos EUA aumenta as expectativas de aumento das taxas pelo Fed e dá suporte ao dólar americanoO ouro (XAU/USD) é negociado com tendência negativa pelo segundo dia consecutivo nesta quarta-feira, embora consiga se manter acima da mínima de vários dias, em torno da marca de US$ 4.638, atingida no dia anterior.
Autor  FXStreet
5 Mês 13 Dia Qua
O ouro (XAU/USD) é negociado com tendência negativa pelo segundo dia consecutivo nesta quarta-feira, embora consiga se manter acima da mínima de vários dias, em torno da marca de US$ 4.638, atingida no dia anterior.
placeholder
Anthropic adiciona Opus e Sonnet ao modo de voz ClaudeA Anthropic está aprimorando significativamente o modo de voz do Claude, permitindo que usuários pagos realizem conversas faladas em seus modelos mais poderosos, Opus e Sonnet, pela primeira vez. Até então, todas as solicitações de voz eram roteadas pelo Haiku 4.5, o modelo menor e mais rápido do Claude. A atualização tornará o modo de voz mais adequado para lidar com tarefas complexas.
Autor  Cryptopolitan
7 Mês 24 Dia Sex
A Anthropic está aprimorando significativamente o modo de voz do Claude, permitindo que usuários pagos realizem conversas faladas em seus modelos mais poderosos, Opus e Sonnet, pela primeira vez. Até então, todas as solicitações de voz eram roteadas pelo Haiku 4.5, o modelo menor e mais rápido do Claude. A atualização tornará o modo de voz mais adequado para lidar com tarefas complexas.
placeholder
A AMD lança um novo servidor de IA em desafio direto ao domínio da Nvidia na área de IAA CEO da Advanced Micro Devices (AMD), Lisa Su, disse a uma plateia em São Francisco na quinta-feira que o sistema Helios, em escala de rack, da AMD está em plena produção, preparando a fabricante de chips para avaliar o mercado de data centers com inteligência artificial, que a Nvidia dominava praticamente sozinha. É a primeira vez que a AMD coloca em operação um gabinete de servidor completo...
Autor  Cryptopolitan
7 Mês 24 Dia Sex
A CEO da Advanced Micro Devices (AMD), Lisa Su, disse a uma plateia em São Francisco na quinta-feira que o sistema Helios, em escala de rack, da AMD está em plena produção, preparando a fabricante de chips para avaliar o mercado de data centers com inteligência artificial, que a Nvidia dominava praticamente sozinha. É a primeira vez que a AMD coloca em operação um gabinete de servidor completo...
placeholder
O ChatGPT Health entra em funcionamento para todos os adultos dos EUA em meio a um processo da OpenAIA OpenAI disponibilizou o ChatGPT Health para todos os adultos dos EUA, independentemente do plano de saúde, um dia depois de um pastor ter processado a empresa por causa de seus conselhos de saúde.
Autor  Cryptopolitan
7 Mês 24 Dia Sex
A OpenAI disponibilizou o ChatGPT Health para todos os adultos dos EUA, independentemente do plano de saúde, um dia depois de um pastor ter processado a empresa por causa de seus conselhos de saúde.
placeholder
Ouro aprofunda queda com temores de inflação elevando apostas em alta de juros do Fed e fortalecendo o dólar diante das tarifas de TrumpO ouro (XAU/USD) atrai vendedores pelo segundo dia consecutivo nesta sexta-feira e acentua as perdas abaixo do nível de US$ 4.050 durante a sessão asiática.
Autor  FXStreet
7 Mês 24 Dia Sex
O ouro (XAU/USD) atrai vendedores pelo segundo dia consecutivo nesta sexta-feira e acentua as perdas abaixo do nível de US$ 4.050 durante a sessão asiática.
goTop
quote