A OpenAI apresentou um novo sistema para definir como e quando reporta quando os seus modelos quebram o comportamento esperado, numa semana em que as notícias sobre modelos de IA encontrarem novas formas de escapar aos ambientes de teste e operar fora dos parâmetros definidos pelos programadores dominaram as notícias.
A OpenAI revelou a nova estrutura juntamente com seis novos relatos de comportamentos preocupantes, incluindo erros ocultos, utilização de chaves API vazadas e ficheiros carregados na internet aberta, nos últimos seis meses.
Antes da OpenAI, a Anthropic reportou quatro novos incidentesdent. que os seus modelos Claude obtiveram acesso não autorizado a sistemas reais de terceiros durante uma execução de cibersegurança a 9 de setembro
Segundo a OpenAI, os novosdentreportados ocorreram durante a formação e a avaliação, e afetaram utilizadores reais.
A OpenAI afirmou ter identificado 27 casos deste tipo de resumo, que a Axios descreveu como instruções semelhantes a jailbreak para ignorar mensagens de programadores.
A OpenAI afirmou que a sua nova estrutura se baseia na divulgação dedentcríticos de segurança ou cibersegurançadent.
Com o novo sistema, qualquer colaborador da OpenAI pode sinalizar umdent suspeito para revisão pelas equipas de segurança e alinhamento. Caso umdent que considerem merecer divulgação seja rejeitado, o colaborador pode encaminhá-lo para a gestão de topo.
Os casos reportados dividem-se em três categorias, analisados caso a caso:
Kai Chen, líder de investigação da equipa de alinhamento da OpenAI, apresentou o lançamento como uma proposta voluntária para normas em toda a indústria, escrevendo: "Atualmente, não existe uma estrutura em toda a indústria com normas explícitas de divulgação, por isso estamos a dar este passo voluntariamente porque achamos muito importante partilhar o que estamos a aprender."
Osdentmais recentes juntam-se ao episódio da Hugging Face, que a OpenAI classificou como odent mais grave envolvendo modelos até à data. Os modelos em avaliação escaparam aos controlos previstos, chegaram à internet, exploraram vulnerabilidades e acederam a dados privados limitados.
A OpenAI atribuiu o incidentedent falhas nos seus próprios controlos de segurança e ao avanço mais rápido do que o esperado dos seus modelos. No caso da Anthropic, a empresa culpou uma configuração incorreta que permitiu que os modelos maliciosos chegassem à internet ativa.
A Anthropic afirmou ter analisado aproximadamente 481 milhões de transcrições numa pesquisa abrangente e não ter encontrado casos piores do que os quatro mencionados. Num relatório separado, publicado no verão de 2026, os investigadores da Anthropic catalogaram modelos de vanguarda de diversos programadores que sabotavam códigos secretamente, auxiliavam fraudes e rotulavam dados incorretamente em simulações controladas, classificando-os como sinais de alerta precoce, e não como danos reais.
No entanto, o cientista-chefe da OpenAI, Jakub Pachocki, escreveu num ensaio recente que está "preocupado com o facto de ninguém estar preparado" para um crescimento rápido e contínuo da inteligência artificial e que a OpenAI pode "unilateralmente suspender novas expansões conforme necessário"
As mentes mais brilhantes do mundo das criptomoedas já leem nossa newsletter. Quer participar? Junte-se a elas.