Um modelo ainda não lançado, chamado Astra, levou a OpenAI a interromper seu próprio treinamento

Fonte Cryptopolitan

A OpenAI afirmou que seu maior treinamento programado para a fase inicial de testes permanece suspenso, e que o novo monitoramento de segurança adiciona cerca de 20% ao tempo de computação.

É a primeira vez que a OpenAI afirma ter desacelerado o desenvolvimento devido a preocupações com a segurança, semanas depois de um de seus próprios agentes de IA ter invadido o sistema da Hugging Face.

A OpenAI interrompeu o aprendizado por reforço (RL) por duas semanas

Em uma postagem de blog intitulada "Ajustando o ritmo do desenvolvimento de modelos em uma era de capacidades cibernéticas críticas", a OpenAI descreveu as mudanças que já implementou no treinamento e teste de seus modelos.

O aprendizado por reforço (RL, na sigla em inglês), usado para aprimorar seus sistemas mais recentes, foi interrompido por duas semanas após a violação de dados da Hugging Face.

A grande ainda não. "Nossa maior execução planejada de aprendizado por reforço (RL) de fronteira permanece suspensa enquanto realizamos treinamentos e avaliações em menor escala para avaliar o comportamento do modelo, validar nossas salvaguardas e estabelecer mais evidências de alinhamento antes de prosseguir", escreveu.

Cryptopolitan noticiou que um agente da OpenAI escapou de seu ambiente de testes restrito por volta de 9 de julho e foi encontrado nos sistemas da Hugging Face entre 11 e 13 de julho. A OpenAI levou cerca de uma semana para associar o ataque ao seu próprio agente, e o incidentedent divulgado publicamente em 21 de julho.

A OpenAI informou aos jornalistas que os novos controles “não são uma reação direta especificamente ao caso da Hugging Face”. Em 7 de agosto, a empresa concluiu que a Astra pode ultrapassar o limite “Crítico” de segurança cibernética em sua Estrutura de Preparação.

Essa política interna compromete a OpenAI a interromper o desenvolvimento quando um modelo atinge esse nível, para que os engenheiros possam criar salvaguardas adicionais. O cientista-chefe Jakub Pachocki afirmou que a descoberta veio acompanhada de um alerta sobre o que está por vir. Ele disse a repórteres que novos modelos poderosos podem "fazer coisas semdentno mundo real"

Amelia Glaese, vice-presidente de pesquisa da OpenAI, afirmou: "Estabelecemos requisitos e expectativas para um desenvolvimento seguro". Ela continuou: "Esses requisitos e expectativas variam de acordo com o nível de risco que identificamos"

Os detectores monitoram cada token amostrado, mas a linha de raciocínio pode mentir

Existe um sistema de monitoramento que custa cerca de 20% do valor gasto no treinamento ou na avaliação, de acordo com a OpenAI.

É um processo de múltiplas etapas, em que os detectores investigam a atividade interna de um modelo em cada token amostrado e encaminham qualquer atividade suspeita para investigadores automatizados com maior capacidade computacional, que analisam as ações da ferramenta, tracde raciocínio e os registros de atividades em busca de roubo de dados, comportamento destrutivo ou tentativas de fuga.

A OpenAI pretende emitir um alerta em até 30 minutos em caso de atividade alarmante. Suas equipes de segurança, proteção e pesquisa têm 30 minutos para descartar um alarme falso.

Caso não consigam, espera-se que interrompam a execução. A empresa também expandiu o monitoramento da "linha de raciocínio", que lê em voz alta como um modelo processa uma tarefa.

Existe uma vulnerabilidade conhecida. Pesquisas, incluindo trabalhos da Anthropic, concorrente da OpenAI, mostraram que a linha de raciocínio de um modelo nem sempre corresponde aos seus objetivos reais. Pachocki afirmou que a OpenAI desenvolveu seu treinamento para reduzir as chances de os modelos aprenderem a ocultar suas intenções mentindo nesse raciocínio.

A reformulação da segurança "exigiu um trabalho de engenharia substancial" e a empresa "incorreu em custos elevados", afirmou a OpenAI. Especialistas disseram que somente a investigação provavelmente custou entre US$ 4 milhões e US$ 15 milhões, embora o valor total não seja público.

A OpenAI ainda não divulgou uma análise técnica detalhada da da Hugging Face , mas reiterou que uma será publicada "em breve".

Na conferência Black Hat, em 5 de agosto, funcionários da OpenAI disseram que seus agentes se coordenaram durante meses, deixando mensagens em um fórum que a empresa desconhecia.

Não se limite a ler notícias sobre criptomoedas. Compreenda-as. Assine nossa newsletter. É grátis.

Isenção de responsabilidade: Apenas para fins informativos. O desempenho passado não é indicativo de resultados futuros.
placeholder
Ações do Japão e da Coreia do Sul despencam enquanto Kospi cai quase 6%, SK Hynix recua quase 10%, Kioxia despenca mais de 12%TradingKey - Em 19 de agosto, os mercados de ações do Japão e da Coreia do Sul enfrentaram uma nova rodada de vendas. O índice sul-coreano KOSPI fechou em queda de 5,80%, aos 6.471,17 pontos, enquanto
Autor  TradingKey
7 horas atrás
TradingKey - Em 19 de agosto, os mercados de ações do Japão e da Coreia do Sul enfrentaram uma nova rodada de vendas. O índice sul-coreano KOSPI fechou em queda de 5,80%, aos 6.471,17 pontos, enquanto
placeholder
Previsão para o Preço do Ouro: O Ouro Vai Subir ou Cair no Curto Prazo com a Aproximação da Ata de Julho do Fed?TradingKey - Até a sessão asiática de 19 de agosto, os preços do ouro (XAUUSD) mantiveram uma leve recuperação intradiária, subindo cerca de 0,2% no dia e operando perto de US$ 4.340. Mais cedo na ter
Autor  TradingKey
7 horas atrás
TradingKey - Até a sessão asiática de 19 de agosto, os preços do ouro (XAUUSD) mantiveram uma leve recuperação intradiária, subindo cerca de 0,2% no dia e operando perto de US$ 4.340. Mais cedo na ter
placeholder
Ouro se recupera de mínima semanal com enfraquecimento do dólar antes da ata do FOMCO ouro (XAU/USD) se recupera da mínima semanal atingida durante a sessão asiática desta quarta-feira e avança para acima de US$ 4.350 na última hora.
Autor  FXStreet
11 horas atrás
O ouro (XAU/USD) se recupera da mínima semanal atingida durante a sessão asiática desta quarta-feira e avança para acima de US$ 4.350 na última hora.
placeholder
A receita anualizada de US$ 65 bilhões da Anthropic pode redefinir a forma como as empresas de IA são avaliadasA Anthropic aumentou rapidamente suas vendas, de forma que se espera que ela impacte osmaticdo setor de IA em geral. No final de julho, sua receita projetada ultrapassou US$ 65 bilhões, enquanto banqueiros de investimento começaram a ver sua oferta pública inicial como umdent para outras empresas que aguardam uma listagem.
Autor  Cryptopolitan
15 horas atrás
A Anthropic aumentou rapidamente suas vendas, de forma que se espera que ela impacte osmaticdo setor de IA em geral. No final de julho, sua receita projetada ultrapassou US$ 65 bilhões, enquanto banqueiros de investimento começaram a ver sua oferta pública inicial como umdent para outras empresas que aguardam uma listagem.
placeholder
A Nvidia entra na corrida dos robôs humanoides na Coreia do Sul, enquanto a LG recebe Madison HuangO investimento da Coreia do Sul em inteligência artificial e robótica voltou a ganhar destaque após a LGtronreceber Madison Huang, diretora sênior da Nvidia, em uma visita na terça-feira à sua fábrica de dados robotizados no sul de Seul. A visita da jovem Huang ao campus de Yangjae, no distrito de Seocho, ocorreu depois da visita de seu pai, Jensen Huang, que também é CEO da Nvidia...
Autor  Cryptopolitan
15 horas atrás
O investimento da Coreia do Sul em inteligência artificial e robótica voltou a ganhar destaque após a LGtronreceber Madison Huang, diretora sênior da Nvidia, em uma visita na terça-feira à sua fábrica de dados robotizados no sul de Seul. A visita da jovem Huang ao campus de Yangjae, no distrito de Seocho, ocorreu depois da visita de seu pai, Jensen Huang, que também é CEO da Nvidia...
goTop
quote