O cientista-chefe e CEO da OpenAI alertam para a "impossibilidade de monitorização" à medida que a Astra desbloqueia capacidades críticas

Fonte Cryptopolitan

O cientista-chefe da OpenAI, Jakub Pachocki, manifestou-se poucas horas depois de a empresa se ter tornado a primeira na corrida da IA a alcançar a designação de cibersegurança "Crítica" na sua Estrutura de Preparação, após apresentar uma antevisão do seu futuro modelo Astra.

O alerta de Pachocki na manhã de quarta-feira teve como objetivo acalmar a histeria em torno dos crescentes comentários de que o laboratório de IA pode não ter mais garantias quanto às capacidades dos seus modelos mais avançados.

Porque é que o Astra da OpenAI é considerado "crítico"?

A designação Crítica é um nível do Quadro de Preparação que a OpenAI introduziu no setor da IA em dezembro de 2023. O Quadro de Preparação mede o quanto de intervenção e estímulo humano um modelo de IA precisa para encontrar e desenvolver exploits de dia zero viáveis em diversos sistemas reforçados, ou para executar um ataque totalmente novo.

Uma vulnerabilidade zero-day refere-se à exploração de falhas que nem os criadores do software descobriram ainda.

A OpenAI declarou no dia 1 de setembro, na sua publicação "Path to Astra", que o modelo será capaz de completar todos os passos para ataques totalmente novos ou explorações de vulnerabilidades zero-day com intervenção humana mínima quando for lançado.

A OpenAI citou a pontuação de 100% da Astra no ExploitBench, um teste de como os modelos conseguem explorar bugs conhecidos, como prova no seu post de blog.

O Astra não só é melhor a mapear ataques de dia zero, como também é mais eficiente. A OpenAI demonstrou esta capacidade utilizando um teste interno realizado em 20 avarias de alta gravidade do V8 que só recentemente se tornaram públicas. O Astra utilizou menos tokens, identificou duas vulnerabilidades de dia zero e superou o Sol na geração de execução de código arbitrário no geral.

A mesma publicação afirmava que o Astra poderia encadear bugs desconhecidos do browser para escapar a uma sandbox e, durante testes conduzidos por especialistas, conseguiu elaborar uma escalada de privilégios do sistema operativo, de utilizador comum a root.

Como refere o TechCrunch, o Astra junta-se ao modelo Mythos da Anthropic, lançado no início deste ano, como o primeiro modelo de linguagem de grande porte com estas capacidades.

Pachocki pede para evitar o pânico em relação a Astra

Pachocki, cientista-chefe da OpenAI, está a refutar a histeria de que a OpenAI esteja a entrar em território desconhecido com o Astra. Segundo o próprio, não gostaria de "uma corrida para a falta de monitorização iniciada por relatos confusos".

O executivo da OpenAI insistiu que o laboratório fez a devida diligência na utilização da monitorização da cadeia de raciocínio, a prática de ler o raciocínio passo a passo que um modelo expõe enquanto funciona. Citou a profundidade do grafo computacional por detrás dos modelos de ponta atuais da OpenAI, incluindo o Astra, que está dentro de um fator de dois do GPT-4 na publicação X.

Antes de Pachocki, também o diretor executivo da OpenAI, Sam Altman, tinha pedido calma no mesmo dia em que o blogue da Astra foi publicado.

“Há uma tensão óbvia aqui”, escreveu na terça-feira, chamando o Astra de “muito bom”, mas argumentando que as medidas de segurança precisam de avançar em paralelo com a capacidade bruta. Altman disse que a OpenAI passou todo o verão a fazer a sua parte para garantir que o modelo era lançado com as medidas de segurança necessárias.

A discussão sobre a segurança já dura há semanas. A 18 de agosto, a OpenAI comprometeu-se a pausar o treino de aprendizagem por reforço para modelos destinados à implementação durante duas semanas, a fim de permitir que os seus engenheiros reforçassem os clusters de investigação e otimizassem a monitorização. O treino foi retomado a 28 de agosto.

Segundo a OpenAI, o Astra não esteve envolvido no já infamedentdo Hugging Face. A empresa afirmou ainda que o modelo nem sequer tentou sair do seu ambiente controlado, mesmo quando apresentado a um cenário criado para o tentar a recriar o episódio do Hugging Face.

Os laboratórios de IA estão agora a ser cautelosos quanto a quem pode aceder aos seus modelos de ponta

A OpenAI anunciou que agora todos terão acesso às funções mais avançadas do Astra, reservando estes recursos para as organizações da coligação Daybreak da OpenAI, enquanto as empresas da Daybreak Blue terão acesso aos recursos de defesa mais robustos.

Tal como Cryptopolitan foi noticiado, a Anthropic afirmou ainda que apenas as empresas participantes no seu Projecto Glasswing terão acesso ao Mythos 5.1, que é basicamente o Fable 5.1 com medidas de segurança adicionais.

A OpenAI afirmou ainda que irá monitorizar e limitar as respostas a consultas de contas que considera de alto risco. No geral, o Astra também contará com uma monitorização adicional da cadeia de raciocínio para detetar comportamentos inadequados e rejeitar pedidos cibernéticos prejudiciais com mais frequência.

A maior parte da informação sobre o Astra foi fornecida pela própria OpenAI, com validação limitada por terceiros das alegações de segurança ou capacidade da OpenAI.

Yona Shavit, ex-funcionário da OpenAI que agora trabalha com resiliência de IA na OpenAI Foundation, questionou publicamente se o comportamento do Astra durante os testes reflete um alinhamento genuíno ou um modelo que simplesmente sabia o que os avaliadores queriam ver.

A OpenAI afirma que um cartão de sistema completo e avaliações adicionais serão divulgados quando o Astra for lançado em larga escala. Até lá, o alcance das suas capacidades cibernéticas e a robustez das proteções que as rodeiam continuam a ser difíceis de avaliar.

Se você está lendo isto, já está um passo à frente. Continue assim assinando nossa newsletter.

Isenção de responsabilidade: Apenas para fins informativos. O desempenho passado não é indicativo de resultados futuros.
placeholder
Conflito entre EUA e Irã castiga ações do Japão e da Coreia do Sul; Kospi cai 4% enquanto Samsung e SK Hynix despencam, Nikkei cai abaixo de 65.000, SoftBank despenca mais de 6%TradingKey - Disparada do petróleo desencadeia pânico de inflação! Ações do Japão e da Coreia do Sul despencam de forma generalizada, SoftBank tomba mais de 6%, e Samsung e SK Hynix caem mais de 4% ca
Autor  TradingKey
6 horas atrás
TradingKey - Disparada do petróleo desencadeia pânico de inflação! Ações do Japão e da Coreia do Sul despencam de forma generalizada, SoftBank tomba mais de 6%, e Samsung e SK Hynix caem mais de 4% ca
placeholder
Previsão do Preço do Ouro: O Ouro Continuará Caindo Após Cair Abaixo de US$ 4.300 Enquanto o Conflito entre EUA e Irã Impulsiona os Preços do Petróleo?TradingKey - Durante a sessão de negociação asiática de 2 de setembro, os preços do ouro (XAUUSD) caíram abaixo de US$ 4.300 no intraday, atingindo uma mínima de US$ 4.282,45, com o preço mais recente
Autor  TradingKey
6 horas atrás
TradingKey - Durante a sessão de negociação asiática de 2 de setembro, os preços do ouro (XAUUSD) caíram abaixo de US$ 4.300 no intraday, atingindo uma mínima de US$ 4.282,45, com o preço mais recente
placeholder
Ouro cai para a mínima de quatro semanas, abaixo de US$ 4.300, com fortalecimento do dólar diante de apostas no Fed e riscos do IrãO ouro (XAU/USD) cai para a mínima de quase quatro semanas durante a sessão asiática desta quarta-feira e agora busca estender a queda para abaixo de US$ 4.300 em meio a um cenário fundamentalista de baixa (bearish).
Autor  FXStreet
9 horas atrás
O ouro (XAU/USD) cai para a mínima de quase quatro semanas durante a sessão asiática desta quarta-feira e agora busca estender a queda para abaixo de US$ 4.300 em meio a um cenário fundamentalista de baixa (bearish).
placeholder
O rendimento dos títulos japoneses a 10 anos atinge os 3%, com a venda massiva de ações de empresas de inteligência artificial a abalar o NikkeiOs rendimentos dos títulos do governo subiram nos mercados asiáticos na terça-feira, com o rendimento do título de referência de 10 anos do Japão a atingir a marca dos 3% pela primeira vez em 30 anos, no meio de preocupações com a inflação e crescentes dificuldades fiscais. Este aumento dos custos de empréstimo continua a pesar fortemente sobre as ações japonesas, particularmente as ações de tecnologia e de inteligência artificial. Isto ocorre após uma segunda-feira volátil...
Autor  Cryptopolitan
14 horas atrás
Os rendimentos dos títulos do governo subiram nos mercados asiáticos na terça-feira, com o rendimento do título de referência de 10 anos do Japão a atingir a marca dos 3% pela primeira vez em 30 anos, no meio de preocupações com a inflação e crescentes dificuldades fiscais. Este aumento dos custos de empréstimo continua a pesar fortemente sobre as ações japonesas, particularmente as ações de tecnologia e de inteligência artificial. Isto ocorre após uma segunda-feira volátil...
placeholder
Agosto foi o mês mais quente para as 100 melhores altcoins e tokensAs 100 melhores altcoins e tokens tiveram o seu melhor mês de 2026 em agosto. 83% dos ativos fecharam o mês com ganhos positivos, à medida que a liquidez se deslocou para os ativos mais ativos.
Autor  Cryptopolitan
14 horas atrás
As 100 melhores altcoins e tokens tiveram o seu melhor mês de 2026 em agosto. 83% dos ativos fecharam o mês com ganhos positivos, à medida que a liquidez se deslocou para os ativos mais ativos.
goTop
quote