IA sinalizou divergência em 3.460 estudos de economia: o que o número mede — e o que ele não prova
30 de setembro de 2026 · 8 min de leitura

Um número começou a circular e ele é fácil de ler errado: 3.460 de 4.452.
Ele vem de um working paper divulgado pelo National Bureau of Economic Research (NBER) em setembro de 2026, assinado por Matthew D. Schwartz (Harvard), Isaiah Andrews (MIT) e Jesse M. Shapiro (Harvard). Os três montaram um workflow com vários agentes de LLM (modelo de linguagem de grande porte, a tecnologia por trás dos assistentes de IA) que pega o pacote de replicação de um artigo de economia publicado — os dados e o código que o periódico exige do autor — e refaz as contas do zero. Aplicado a 4.452 pacotes, o workflow sinalizou divergência em 3.460 artigos ou em seus apêndices.
A leitura preguiçosa é óbvia: a IA descobriu que a economia está errada.
Não é isso. E a distância entre essa leitura e a correta é o que torna o estudo útil para quem nunca vai abrir um paper de econometria na vida, mas assina relatório gerencial, modelo de precificação e estudo de viabilidade toda semana.
1. O que conta como "divergência sinalizada"
Quase toda a interpretação do resultado depende dessa pergunta.
O workflow registra uma divergência em três situações, descritas na seção de métodos. A primeira: o cálculo foi refeito e produziu um valor diferente do que está impresso no artigo. A segunda: o cálculo não pôde nem ser tentado, porque faltavam dados que o pacote não havia declarado como indisponíveis. A terceira, mais fraca: quando a documentação declara que todos os cálculos dependem de dados restritos, o workflow não reproduz nada — apenas compara o código e os registros de execução com o texto do artigo e anota divergências aparentes que, como os autores escrevem, não consegue verificar. Esse caso responde por 1,3% dos pacotes auditados.
Antes de entrar na conta final, cada divergência passa por dois controles. Um agente adversarial de LLM é encarregado de derrubá-la e sustentar a reprodutibilidade do resultado original. E, onde os autores conseguiram acesso licenciado ao software em que o código foi escrito, o cálculo é reconferido nele.
Ou seja: não é um alerta solto. Mas continua sendo um alerta, não um veredito.
2. O tamanho da divergência muda a leitura
Aqui está o dado que quase nunca sobrevive ao resumo de manchete. O paper classifica cada divergência de cálculo pelo primeiro dígito significativo em que o valor recalculado passa a diferir do valor publicado. Entre os 3.166 artigos que entram nessa classificação, 35,6% batem com o valor impresso dentro de 1,0 unidade do último dígito publicado — algo compatível com arredondamento ou truncamento. Na outra ponta, 24,9% divergem já no primeiro dígito significativo ou antes dele, e 25,1% no segundo.
Traduzindo: cerca de um terço das divergências é a diferença entre 3,42 e 3,43. Cerca de um quarto é a diferença entre 3,4 e 5,1.
São coisas muito diferentes. O estudo não trata as duas como equivalentes; quem comprime o resultado em uma frase é que trata.
3. O achado que deveria incomodar mais
Reprodução não foi a única coisa testada. Para os cálculos que conseguiu refazer, o workflow aplicou um teste de sensibilidade: identificar as cinco unidades de dados com maior influência sobre uma estimativa e removê-las, uma de cada vez, para ver quanto o resultado se mexe.
Foi possível fazer isso em 1.908 artigos. Em 963 deles, remover uma única unidade mudou uma estimativa publicada em mais de 100%. Em 512 desses 963 casos, o valor publicado tinha pelo menos dois dígitos significativos — não era um número tão arredondado que qualquer mexida estouraria o percentual.
Esse resultado não fala sobre erro. Fala sobre fragilidade — um problema que continua existindo mesmo quando a conta está perfeitamente certa. Se o número depende de um cliente, de um mês ou de uma linha da base, ele não está errado. Está apoiado em uma perna só.
4. As outras duas tarefas: velocidade e extensão
O workflow também reescreveu código: reduziu o tempo de cálculo em mais de 10 vezes em 496 dos 1.781 casos em que tentou melhorar algum cálculo. Em um deles, um bootstrap de mil repetições processadas uma a uma virou um único produto de matrizes, devolveu exatamente os mesmos intervalos publicados e rodou cerca de 440 vezes mais rápido. Em outro, uma calibração de sete parâmetros ganhou solução fechada, bateu todos os dígitos impressos do original e ficou cerca de 24 mil vezes mais rápida.
A terceira tarefa foi propor extensões, e o workflow encontrou alguma em 923 dos 4.418 artigos avaliados. A maioria acrescenta análise de sensibilidade; 143 acrescentam um cálculo substantivo novo. Mas a categoria mais interessante para quem lida com número dentro de empresa são os 367 casos em que a extensão quantifica uma incerteza que o trabalho original não quantificou. Um exemplo do paper: um estudo de 2022 estimava perda de bem-estar de US$ 18,69 por participante, sem intervalo de confiança; o workflow derivou um, de US$ 12,75 a US$ 23,99.
5. Por que isso interessa a quem decide com relatório interno
Daqui em diante é leitura minha, não resultado medido pelo estudo. Vale dizer isso com todas as letras, porque a transposição é exatamente onde esse tipo de notícia costuma se perder.
O corpus são os pacotes de cinco periódicos: American Economic Review, Econometrica, Journal of Political Economy, Quarterly Journal of Economics e Review of Economic Studies — descritos no estudo como os cinco periódicos generalistas de economia mais bem ranqueados segundo o RePEc. É material que passou por revisão por pares e por exigência formal de depósito de dados e código. Um dos ambientes mais rigorosos que existem para produzir um número.
Agora pense no acervo analítico da sua empresa. A planilha de precificação herdada de quem saiu há dois anos. O modelo de payback montado às pressas para uma reunião de conselho. O indicador de margem por produto que ninguém refez desde que criou. Quantos passaram por revisão independente?
Não existe estudo que meça isso, e eu não vou fingir que existe. Mas não me parece plausível supor que material que roda sem revisão nenhuma se comporte melhor do que material que passou por revisão editorial.
Repare no tipo de saída que o workflow produz. Nenhuma das três tarefas é gerar mais análise. São: refazer a conta, mostrar o quanto ela balança e dizer o que ela não disse. Isso tem um nome: auditoria.
É por isso que a primeira aplicação séria de IA sobre conhecimento corporativo provavelmente não é produção — é revisão do que já existe. E é a mais fácil de defender internamente: escopo fechado, resultado verificável contra o original e custo baixo de a ferramenta errar, porque nada é publicado a partir dali. Só conferido.
6. O contraponto: detectar ficou barato, decidir continua caro
Triagem automática gera volume. Se 3.460 sinalizações chegam sem ordem de prioridade, o gargalo não desaparece: desloca-se do analista que produz para o revisor que precisa julgar cada alerta.
O paper trata disso do jeito certo — agente adversarial, reconferência em software licenciado, classificação por dígito significativo. Tudo isso é priorização — e é a parte cara do trabalho. Quem montar a ideia dentro de uma empresa sem essa camada termina com uma fila de alertas que ninguém lê e um projeto de IA dado como fracassado pelo motivo errado.
7. Os limites: o que ler com cuidado
Quatro ressalvas, todas registradas no próprio documento.
É um working paper. O NBER declara que seus working papers circulam para discussão e comentário e que não passaram por revisão por pares nem pela revisão do conselho que acompanha suas publicações oficiais.
O trabalho está em andamento. Os autores escrevem que os valores são os vigentes na data da divulgação, que o processamento está mais completo para os valores do corpo dos artigos do que para os dos apêndices e que o workflow segue sendo melhorado. Ele é descrito como open-source, mas a liberação pública do código ainda está anunciada como algo por vir, no repositório MetaEconomics.
Há interesse a declarar. O paper informa que LLMs foram usados na análise e na escrita, que Schwartz trabalhou como contratado da Anthropic neste projeto e que os resultados não são endossados pela empresa. O experimento de avaliação usou dois modelos da Anthropic, Claude Opus 5 e Claude Fable 5.1.
E, principalmente: o workflow não se propõe a avaliar pesquisa. Os autores escrevem isso de forma literal — "does not aim to evaluate research". No experimento de avaliação, feito sobre 100 artigos, os dois modelos classificaram os achados como reproduzidos apenas com diferenças menores em 83,1% e 83,6% das avaliações. Divergência sinalizada não é erro confirmado, e está longe de ser conclusão derrubada.
Cinco perguntas para levar para a sua próxima reunião de números
• Qual é o número que mais pesa na sua decisão dos próximos 90 dias?
• Quem foi a última pessoa a refazer a conta por trás dele sem olhar o resultado anterior?
• Se você remover o maior cliente, o maior mês ou a maior linha da base, esse número muda mais de 100%?
• Ele tem intervalo, ou é um ponto único apresentado como se fosse exato?
• Existe um pacote de replicação dele — dado bruto, cálculo e premissa, em um lugar só?
Se a resposta da última pergunta for "reconstruir isso levaria uma semana de garimpo", o problema não é a IA. É que o seu acervo analítico não é auditável por ninguém, humano ou não.
Lincoln Ferraz — Arquiteto de Negócios

