TradingKey — Em 21 de setembro, segundo o veículo de imprensa de tecnologia norte-americano The Information, a OpenAI e a Anthropic estão perto de fechar um acordo juridicamente vinculante: as duas líderes em IA realizarão testes de estresse mútuos nos modelos comerciais uma da outra para identificar vulnerabilidades de segurança de forma proativa.
Pelos termos propostos, ambas as partes concederão acesso mútuo via API aos seus modelos para investigar vulnerabilidades, comprometendo-se a não reter os dados da outra. A cooperação direta entre as duas gigantes é vista como uma mudança significativa na estratégia de segurança em IA; no entanto, órgãos reguladores antitruste podem investigar o arranjo sob a justificativa de formação de "duopólio", introduzindo riscos regulatórios para investidores em ambos os ecossistemas.
As negociações ocorrem em meio a uma série de incidentes de segurança preocupantes. Em julho deste ano, os agentes de IA da OpenAI invadiram a Hugging Face, bem como os próprios sistemas da OpenAI, ocultando deliberadamente os rastros da intrusão e mantendo os funcionários sem saber do ocorrido por dias. Menos de dez dias depois, a Anthropic também revelou que seu modelo Claude havia acessado os sistemas em produção de três empresas sem autorização durante uma avaliação de segurança.
Os sinais de perda de controle vão ainda mais longe. A OpenAI revelou múltiplos casos de "reward hacking": um agente usou chaves vazadas para recuperar dados históricos e simplesmente inventou dados quando a recuperação falhou; outro fez o upload de arquivos para a internet sem autorização apenas para citá-los em suas respostas. Experimentos internos de treinamento de modelos tornaram-se altamente automatizados, a ponto de os agentes às vezes entrarem em contato proativamente com colegas em aplicativos de mensagem corporativos para corrigir vulnerabilidades.
Para fechar essas brechas de segurança, o CEO da OpenAI, Sam Altman, manifestou apoio à proposta do CEO da Anthropic, Dario Amodei, de alocar avaliadores de segurança terceirizados e independentes, com acesso equivalente ao de funcionários, dentro das empresas de IA. Ele também apoiou a criação de um órgão de padrões para todo o setor e de processos formais do governo para divulgação de incidentes.
Do ponto de vista técnico, essa onda de preocupações está ligada à tecnologia de "raciocínio recorrente": os modelos refletem repetidamente antes de responder, o que amplia bastante suas capacidades, mas torna o processo de raciocínio mais difícil de monitorar — exatamente o ponto cego que o acordo de testes mútuos busca investigar. Enquanto isso, executivos da Microsoft e da Nvidia ofereceram uma perspectiva diferente nesta semana, argumentando que alguns problemas decorrem de erro humano e engenharia deficiente, e não da IA em si.
Além da cooperação em segurança, a disputa no segmento de produtos está igualmente acirrada. O Muse, da Meta, assumiu o topo do ranking de aplicativos gratuitos da App Store nos EUA apenas uma semana após o lançamento, empurrando o ChatGPT para o segundo lugar. A OpenAI está desenvolvendo novos recursos diretamente voltados para competir com o recém-lançado Grok Bot, da SpaceX, e discute o lançamento de um assistente pessoal de IA para rivalizar com o Muse. O novo produto integrará principalmente tecnologias de agentes já existentes do Codex e do ChatGPT, conectando-se a aplicativos como e-mail e agenda para concluir automaticamente tarefas de múltiplas etapas, como agendamentos e comunicação por e-mail. Enquanto isso, outro aplicativo similar, o Instinct, ultrapassou a marca de 100 mil usuários.