A OpenAI apresenta uma nova estrutura de reporting à medida que surge um novo "comportamento preocupante do modelo"

Fonte Cryptopolitan

A OpenAI apresentou um novo sistema para definir como e quando reporta quando os seus modelos quebram o comportamento esperado, numa semana em que as notícias sobre modelos de IA encontrarem novas formas de escapar aos ambientes de teste e operar fora dos parâmetros definidos pelos programadores dominaram as notícias. 

A OpenAI revelou a nova estrutura juntamente com seis novos relatos de comportamentos preocupantes, incluindo erros ocultos, utilização de chaves API vazadas e ficheiros carregados na internet aberta, nos últimos seis meses. 

Antes da OpenAI, a Anthropic reportou quatro novos incidentesdent. que os seus modelos Claude obtiveram acesso não autorizado a sistemas reais de terceiros durante uma execução de cibersegurança a 9 de setembro 

Os modelos da OpenAI estão novamente a causar estragos

Segundo a OpenAI, os novosdentreportados ocorreram durante a formação e a avaliação, e afetaram utilizadores reais. 

  • Num dosdent, um modelo de pesquisa ainda não divulgado ao público inseriu instruções em resumos que são mantidas quando o modelo é executado numa nova janela de contexto, instruindo uma versão futura de si mesmo a ignorar as restrições normais. 

A OpenAI afirmou ter identificado 27 casos deste tipo de resumo, que a Axios descreveu como instruções semelhantes a jailbreak para ignorar mensagens de programadores.

  • Odent que envolveu o treino do modelo GPT-5.6 Sol foi menos brando, com os modelos a deixarem instruções para tentar esconder deliberadamente os seus erros, incluindo a invenção de dados históricos e o ocultamento de versões que não estão alinhadas com os seus objetivos. 
  • Outro modelo utilizou uma chave API exposta, encontrada durante uma pesquisa em repositórios públicos, para responder a uma consulta sobre o rendimento do condado. Como as chaves utilizadas sem autorização ainda não forneciam os valores esperados, o modelo simplesmente inventou números. 
  • Noutros dois relatórios, os agentes da OpenAI enviaram ficheiros para sites de alojamento público para comunicarem com outros agentes. Com o tempo, o repositório interno Artifactory do laboratório de IA evoluiu para um fórum improvisado onde os agentes podiam trocar pedidos entre execuções de treino não relacionadas.

Como funciona o novo processo de divulgação da OpenAI?

A OpenAI afirmou que a sua nova estrutura se baseia na divulgação dedentcríticos de segurança ou cibersegurançadent.

Com o novo sistema, qualquer colaborador da OpenAI pode sinalizar umdent suspeito para revisão pelas equipas de segurança e alinhamento. Caso umdent que considerem merecer divulgação seja rejeitado, o colaborador pode encaminhá-lo para a gestão de topo. 

Os casos reportados dividem-se em três categorias, analisados caso a caso: 

  • Osdentconsiderados prontos para divulgação são comunicados no prazo de seis dias úteis. 
  • Os relatórios que necessitem de investigações menores podem demorar cerca de 12 dias úteis a serem publicados. 
  • Os casos complexos que requerem intervenção de terceiros são divulgados num cronograma mais lento. 

Kai Chen, líder de investigação da equipa de alinhamento da OpenAI, apresentou o lançamento como uma proposta voluntária para normas em toda a indústria, escrevendo: "Atualmente, não existe uma estrutura em toda a indústria com normas explícitas de divulgação, por isso estamos a dar este passo voluntariamente porque achamos muito importante partilhar o que estamos a aprender." 

Por que razão os modelos de IA estão a comportar-se de forma descontrolada?

Osdentmais recentes juntam-se ao episódio da Hugging Face, que a OpenAI classificou como odent mais grave envolvendo modelos até à data. Os modelos em avaliação escaparam aos controlos previstos, chegaram à internet, exploraram vulnerabilidades e acederam a dados privados limitados. 

A OpenAI atribuiu o incidentedent falhas nos seus próprios controlos de segurança e ao avanço mais rápido do que o esperado dos seus modelos. No caso da Anthropic, a empresa culpou uma configuração incorreta que permitiu que os modelos maliciosos chegassem à internet ativa. 

A Anthropic afirmou ter analisado aproximadamente 481 milhões de transcrições numa pesquisa abrangente e não ter encontrado casos piores do que os quatro mencionados. Num relatório separado, publicado no verão de 2026, os investigadores da Anthropic catalogaram modelos de vanguarda de diversos programadores que sabotavam códigos secretamente, auxiliavam fraudes e rotulavam dados incorretamente em simulações controladas, classificando-os como sinais de alerta precoce, e não como danos reais.

No entanto, o cientista-chefe da OpenAI, Jakub Pachocki, escreveu num ensaio recente que está "preocupado com o facto de ninguém estar preparado" para um crescimento rápido e contínuo da inteligência artificial e que a OpenAI pode "unilateralmente suspender novas expansões conforme necessário"

As mentes mais brilhantes do mundo das criptomoedas já leem nossa newsletter. Quer participar? Junte-se a elas.

Isenção de responsabilidade: Apenas para fins informativos. O desempenho passado não é indicativo de resultados futuros.
placeholder
O BCE aumenta as taxas de juro para 2,5% em plena inflaçãoO Banco Central Europeu (BCE) aumentou a sua taxa de juro principal para 2,5% na quinta-feira e informou os mercados que as pressões inflacionistas em toda a zona euro deverão continuar por mais tempo. O banco atribuiu o aumento dos custos energéticos à retoma dos confrontos entre os EUA e o Irão, que impactam agora a economia em geral. 25 base...
Autor  Cryptopolitan
9 Mês 11 Dia Sex
O Banco Central Europeu (BCE) aumentou a sua taxa de juro principal para 2,5% na quinta-feira e informou os mercados que as pressões inflacionistas em toda a zona euro deverão continuar por mais tempo. O banco atribuiu o aumento dos custos energéticos à retoma dos confrontos entre os EUA e o Irão, que impactam agora a economia em geral. 25 base...
placeholder
Ouro ganha tração positiva com cautela dos compradores do dólar antes de decisão do FedO ouro (XAU/USD) atrai alguns compradores nas baixas (dip-buyers) perto da região de US$ 4.275 durante a sessão asiática desta quarta-feira, embora o potencial de alta pareça limitado. O dólar americano (USD) faz uma pausa para respirar após atingir a máxima de duas semanas e oferece algum suporte à commodity.
Autor  FXStreet
Ontem 06: 02
O ouro (XAU/USD) atrai alguns compradores nas baixas (dip-buyers) perto da região de US$ 4.275 durante a sessão asiática desta quarta-feira, embora o potencial de alta pareça limitado. O dólar americano (USD) faz uma pausa para respirar após atingir a máxima de duas semanas e oferece algum suporte à commodity.
placeholder
A Anthropic integra o Claude Cowork no chat numa iniciativa de superaplicação de IAA Anthropic está a descontinuar o Claude Cowork como produto independente e a integrar as suas funcionalidades de agente na interface principal de chat do Claude. Esta mudança entrará em vigor na quarta-feira e estará disponível para os subscritores Pro e Max nas próximas semanas. Que produtos da Anthropic serão integrados? A Anthropic, no âmbito do seu plano de construção de uma...
Autor  Cryptopolitan
11 horas atrás
A Anthropic está a descontinuar o Claude Cowork como produto independente e a integrar as suas funcionalidades de agente na interface principal de chat do Claude. Esta mudança entrará em vigor na quarta-feira e estará disponível para os subscritores Pro e Max nas próximas semanas. Que produtos da Anthropic serão integrados? A Anthropic, no âmbito do seu plano de construção de uma...
placeholder
A Uniswap expande-se para a negociação descentralizada de ativos tokenizadosA Uniswap consolidou-se como a principal DEX para a negociação de RWA, com volumes crescentes no último mês.
Autor  Cryptopolitan
11 horas atrás
A Uniswap consolidou-se como a principal DEX para a negociação de RWA, com volumes crescentes no último mês.
placeholder
Ouro interrompe recuperação a partir de mínima de seis semanas com dólar sustentando ganhos pós-Fed e riscos com IrãO ouro (XAU/USD) atrai alguns compradores durante a sessão asiática desta quinta-feira, embora enfrente dificuldades para se firmar acima do patamar de US$ 4.300 e permaneça perto da mínima de quase seis semanas atingida no dia anterior.
Autor  FXStreet
5 horas atrás
O ouro (XAU/USD) atrai alguns compradores durante a sessão asiática desta quinta-feira, embora enfrente dificuldades para se firmar acima do patamar de US$ 4.300 e permaneça perto da mínima de quase seis semanas atingida no dia anterior.
goTop
quote