Claudim — inteligência aplicada aos negócios
Claudim
Assine

Quem verifica o que a IA promete

24 de setembro de 2026 · 8 min de leitura

terence-tao

Em 21 de setembro de 2026, nove matemáticos anunciaram a criação de um grupo para aconselhar empresas de inteligência artificial sobre suas interações com a pesquisa matemática. O Advisory Group on Mathematics and Artificial Intelligence está sediado no Institute for Advanced Study, em Princeton, e se apresentou no blog do matemático Terence Tao e em site próprio.

Integram o grupo François Charles (ENS-PSL), Camillo De Lellis (Institute for Advanced Study e GSSI), Timothy Gowers (Collège de France e Cambridge), Martin Hairer (EPFL e Imperial College London), Nikhil Srivastava (Berkeley e Simons Institute), Ulrike Tillmann (Oxford e Isaac Newton Institute), Ravi Vakil (Stanford), Edward Witten (Institute for Advanced Study) e Melanie Matchett Wood (Harvard). Segundo o texto de apresentação, nenhum deles aceita pagamento pelo trabalho.

O grupo se formou depois que a OpenAI procurou alguns de seus membros propondo um conselho consultivo externo. E a primeira tarefa é bem delimitada: aconselhar a empresa sobre como coordenar a divulgação de um grande número de resultados matemáticos relevantes que ela relata terem sido produzidos por um modelo interno.

O que chama atenção nesse anúncio não é matemática. É engenharia institucional.

O fato novo não é "a IA fez matemática"

Modelos de linguagem vêm sendo usados em problemas matemáticos há alguns anos, com resultados que variam de úteis a irrelevantes dependendo de quem avalia. Isso não é novidade.

A novidade é que foi preciso montar uma estrutura externa, com nomes de peso e sem vínculo financeiro, só para mediar a forma como as alegações de desempenho de um fornecedor chegam ao público. Isso acontece quando o volume e a velocidade das alegações passam a exceder a capacidade normal de verificação.

A matemática é, provavelmente, a área com o padrão de prova mais rígido que existe. Um teorema não é aceito porque alguém afirmou que fechou a conta. Ele é lido, contestado, reescrito e validado por outras pessoas, e isso leva tempo. Quando um fornecedor consegue produzir alegações mais rápido do que a comunidade consegue conferi-las, o mecanismo de verificação deixa de funcionar na velocidade em que é necessário.

É esse o problema que os nove estão tentando resolver. Não o problema matemático.

A alegação, e o que dela já está verificado

A OpenAI afirma que um modelo interno resolveu mais de 100 problemas em aberto, em praticamente todas as áreas da matemática. A informação aparece na reportagem do TechCrunch sobre o anúncio do grupo.

Vale separar as duas camadas dessa frase, porque elas têm status muito diferentes.

A primeira camada é fato: a empresa declarou isso publicamente. A segunda camada é alegação: não existe, até aqui, verificação independente de quais problemas seriam esses, em que áreas, por qual método, nem quanto de trabalho humano anterior está embutido em cada solução. Até que a revisão aconteça, o número correto de resultados confirmados é desconhecido, não é 100.

Ainda segundo a reportagem, a OpenAI descreveu o grupo como uma ponte para a comunidade matemática e para o público, dando aos matemáticos voz sobre como a empresa avança. Mas também deixou claro que o grupo não será responsável por aconselhá-la sobre o ritmo do próprio progresso interno em matemática.

Um conselho que opina sobre a divulgação, mas não sobre o ritmo. A distinção é pequena no texto e grande na prática.

Por que a comunidade reagiu mal

O anúncio não caiu em terreno neutro. Dez dias antes, em um texto publicado no mesmo blog, Tao descreveu o que chamou de desalinhamento grave entre os objetivos dos laboratórios de IA e os da comunidade matemática, a partir de uma carta aberta assinada por 25 medalhistas Fields.

O argumento central da carta é menos óbvio do que parece. Não é que a IA erre. É que resolver problemas, na formulação dos signatários, é apenas uma ferramenta e um substituto para o objetivo primário, que é a compreensão conceitual. Resultados anunciados às pressas, sem tempo para redação adequada, isolamento dos métodos novos e citação do trabalho anterior, geram problemas sérios de atribuição e de crédito, mesmo quando estão tecnicamente corretos.

Nos comentários do post que apresentou o grupo, parte dos leitores foi além e questionou o próprio arranjo: a possibilidade de transferir legitimidade acadêmica para uma empresa, a concentração de decisões sobre o conhecimento em poucas mãos, o efeito sobre carreiras de pesquisadores em início de trajetória e a falta de transparência metodológica. Esse ceticismo aparece no registro publicado por Tao e não deve ser lido como posição da comunidade matemática como um todo.

A dúvida de fundo é legítima e o próprio grupo a alimenta ao declarar que não tem poder de decisão sobre nenhuma empresa de IA, e que a responsabilidade pelas decisões continua sendo da empresa. Um conselho sem poder de decisão pode ser um mecanismo de verificação. Pode também ser um selo. A diferença entre as duas coisas não está no anúncio, está no que ele vai publicar depois.

O mesmo problema, em escala de empresa

Aqui é onde isso deixa de ser assunto de Princeton.

Toda empresa que compra inteligência artificial está na mesma posição da comunidade matemática, só que sem os nove. O fornecedor afirma um resultado: reduz 40% do tempo de atendimento, substitui dois analistas, corta metade do retrabalho. A afirmação chega pronta, com demonstração, e quase sempre chega mais rápido do que a capacidade da empresa de conferi-la.

E aí vem a pergunta que a maioria dos projetos nunca responde por escrito: quem verifica, e com qual método?

Na prática, o que acontece é previsível. O piloto começa sem linha de base medida. Três meses depois, alguém pergunta se funcionou. A resposta é construída na memória das pessoas envolvidas, que não são neutras, e no material do próprio fornecedor, que é menos neutro ainda. O projeto é aprovado ou cancelado por impressão.

O que a comunidade matemática está tentando fazer, de forma imperfeita, é exatamente o que falta ali: criar uma instância de verificação com regras de divulgação definidas antes do resultado aparecer.

O protocolo de aceite que quase ninguém escreve

Nenhum piloto de IA deveria começar sem quatro definições registradas por escrito, antes da primeira linha rodar.

1. Quem mede

Alguém que não seja o fornecedor. Pode ser o financeiro, pode ser um analista da própria casa, pode ser um terceiro. O ponto não é desconfiança, é método: quem construiu a solução não é a melhor pessoa para avaliar se ela funcionou, pelo mesmo motivo que o autor de uma demonstração não é quem a aprova.

2. O que se mede

Uma métrica, não cinco. E uma métrica que já existia antes do projeto, de preferência uma que apareça em algum lugar do resultado financeiro. Tempo médio de resposta, custo por atendimento, horas da equipe em determinada tarefa. Indicador criado junto com o piloto costuma ser indicador desenhado para o piloto ganhar.

3. Contra qual linha de base

O número de antes, medido antes. Sem isso não existe comparação, existe anedota. Se a empresa não tem a linha de base, a primeira entrega do projeto é levantá-la, e isso normalmente já paga o investimento: boa parte das organizações descobre nessa etapa que não sabia quanto custava o processo que pretendia automatizar.

4. Quando a decisão é tomada

Data e critério definidos na largada. Continua, ajusta ou encerra, com o número na mesa. Critério definido depois do resultado é sempre critério negociado.

O que enfraquece essa leitura

Duas ressalvas honestas.

A primeira é que a analogia tem limite. Uma empresa não precisa de revisão por pares, precisa de um resultado defensável dentro do seu apetite de risco. Protocolo de aceite desproporcional ao valor em jogo é burocracia: ninguém vai montar comitê de verificação para uma automação de 300 reais por mês. O rigor deve ser proporcional ao que está sendo apostado.

A segunda é que excesso de exigência prévia mata experimentação. Há projetos cujo objetivo legítimo é descobrir se existe problema ali, e nesses casos a linha de base é justamente o que se busca. A regra continua valendo, com uma diferença: declare que aquilo é exploração, e não deixe um piloto exploratório virar contrato anual por inércia.

O que observar daqui para frente

Três sinais dirão se o arranjo de Princeton é verificação ou cerimônia: se as recomendações do grupo serão publicadas na íntegra, se as alegações da OpenAI passarão por conferência externa antes do anúncio, e se algum resultado será atrasado por causa de um parecer.

Se nada disso acontecer nos próximos meses, a leitura mais plausível é que o grupo funcionou como intermediário de comunicação, não como instância de controle.

De qualquer forma, a lição para quem compra tecnologia já está dada. Se a área com o padrão de prova mais rigoroso do mundo precisou montar uma estrutura para avaliar alegações de um fornecedor de IA, nenhuma empresa vai conseguir fazer isso no olho, na reunião de quinta-feira, com o slide do vendedor aberto na tela.

Defina quem mede, o que mede e contra qual número, antes de começar.

Depois do resultado, já não é medição. É negociação.

Continue explorando

Posts relacionados