Em 6 de outubro, a OpenAI enviou 719 artigos de matemática de um modelo interno não lançado para o GitHub.
Uma semana antes, seu próprio grupo consultivo pediu aos laboratórios que parassem de testar problemas avançados de matemática em modelos proprietários.
O Grupo Consultivo sobre Matemática e Inteligência Artificial está sediado no Institute for Advanced Study, em Princeton, Nova Jersey. Em 29 de setembro, ele publicou recomendações baseadas em mais de 600 respostas de pesquisa.
“Queremos deixar claro desde o início: não endossamos essa prática e pedimos que parem de testar problemas matemáticos avançados em modelos proprietários”, escreveu o grupo.
O mesmo documento alerta que os modelos internos privados correm o risco de criar um sistema de duas camadas, no qual os laboratórios ultrapassam o resto do campo.
Como parte do desenvolvimento do modelo, a OpenAI afirma em seu repositório que testa seus modelos em problemas de pesquisa abertos. Ela estendeu esses testes após a saturação de seus benchmarks matemáticos existentes.
A OpenAI disse que conversou com o grupo e utilizou suas recomendações para o lançamento. Em uma declaração divulgada em 6 de outubro, o grupo afirmou que seu papel consultivo não “é um endosso do processo pelo qual a OpenAI os obteve.”
O grupo confiou a veredicto sobre a conformidade à comunidade matemática mais ampla.
A OpenAI agrupou os 719 artigos em 372 famílias matemáticas, cada uma construída em torno de um resultado principal e suas provas relacionadas. Ela forneceu ao modelo proprietário cerca de 4.000 problemas, e cada resultado levou em média três horas de poder computacional de raciocínio do ChatGPT Pro.
O grupo pediu aos laboratórios de IA que publicassem o nome do modelo, os prompts, um resumo da cadeia de pensamento, o tempo gasto e o custo computacional para cada resultado.
A OpenAI publicou 10 resumos de raciocínio, e cerca de 42% dos resultados principais possuem formalizações em Lean.
Lean é uma linguagem de programação que pode ser usada para verificar uma prova por meio de um computador. Se o código compilar, isso não significa que o código e o argumento escrito sejam idênticos. Significa apenas que a declaração formalizada é verdadeira.
Alexander Bastounis, Fabian Circelli e Anders C. Hansen examinaram essa lacuna em um artigo publicado em 6 de outubro. Eles constatam que o artigo escrito sobre Navier-Stokes da OpenAI faz afirmações mais fortes do que aquelas comprovadas por seu código Lean, e uma estimativa altera a ordem das derivadas de entrada.
Os autores detectaram traduções errôneas semelhantes na prova de Euler da OpenAI. A prova escrita da OpenAI e outras provas em Lean autoformalizadas "não devem ser confiáveis à primeira vista sem o mesmo processo de revisão por pares e escrutínio a que outras provas são submetidas", escreveram eles.
O resultado sobre Navier-Stokes foi anunciado pela OpenAI em 8 de setembro. De acordo com Cryptopolitan, o matemático da NYU Tristan Buckmaster contestou então a descrição do mínimo de contribuição humana envolvida no trabalho.
A empresa comprometeu-se a fornecer recursos financeiros para workshops, conferências e programas especiais sobre grandes resultados de IA.
Em 6 de outubro, Terence Tao escreveu que os criadores de prompts de IA frequentemente resolvem problemas e depois perdem o interesse na área. Muitos não conseguem responder a perguntas ou dar palestras sobre o resultado, escreveu ele. Seu post não mencionou a OpenAI.
A empresa afirmou que seus conselheiros não têm influência sobre o ritmo de sua pesquisa, conforme reportado pela Cryptopolitan em setembro.
Se você está lendo isso, já está à frente. Mantenha-se assim com nosso boletim informativo.