Claudim — inteligência aplicada aos negócios
Claudim
Assine

Modelos de decisão viram categoria de produto e mudam a conta de custo dos agentes

07 de outubro de 2026 · 8 min de leitura

decision-models

Em 6 de outubro, duas organizações sem relação entre si fizeram o mesmo movimento no mesmo dia.

A OpenAI colocou em beta pública a Decisions API, um endpoint que não escreve texto: recebe uma pergunta com um conjunto fechado de respostas possíveis e devolve um valor tipado, com a probabilidade associada. No mesmo dia, a Musubi apresentou o PolicyLM-1.7B, um modelo pequeno de pesos abertos que lê a política de conteúdo de uma plataforma em linguagem natural no momento da consulta e julga uma mensagem em menos de 50 milissegundos, segundo reportagem do TechCrunch.

Cinco dias antes, o laboratório de agentes da AWS havia publicado o Strands Decider 2B, com pesos, dados de treino e scripts abertos.

Em 15 de setembro, nenhum desses produtos existia.

O que esses modelos entregam

A premissa da categoria é estreita de propósito. Em vez de pedir um texto a um modelo de linguagem e depois extrair dele um valor utilizável, a aplicação faz uma pergunta de forma fixa e recebe de volta o valor já tipado. Não há texto para interpretar nem parágrafo para descartar.

O guia da OpenAI descreve três formatos de pergunta:

• Predicado: devolve a probabilidade, de 0 a 1, de uma afirmação sobre a entrada ser verdadeira.

• Escolha: seleciona uma opção dentro de um conjunto fixo e devolve a confiança associada.

• Nota: avalia a entrada contra níveis ordenados e devolve uma média ponderada pelas probabilidades.

Os casos de uso que o próprio guia nomeia são operacionais, não criativos: checar se uma imagem mostra dano visível, rotear uma reclamação de cliente, pontuar um incidente contra níveis de severidade. Classificação, roteamento e priorização.

O que esses modelos não fazem importa igualmente. A própria AWS registra que o Strands Decider 2B é significativamente pior que modelos de raciocínio em problemas complexos e inadequado para programação, chatbots e resumo de documentos. Ele não escreve, não explica o raciocínio e não usa ferramentas. É um componente de fluxo, não um substituto do modelo que conversa com o cliente.

Três semanas, uma prateleira

O marco zero da categoria é 15 de setembro, quando a TypeSafe AI lançou o Jev e cunhou o rótulo "System One model" — referência ao Sistema 1 de Daniel Kahneman, o julgamento rápido e intuitivo.

A velocidade da resposta do mercado é o fato mais informativo da história. O diretório independente System One Models já listava 14 modelos dessa classe em 2 de outubro, incluindo o Clef da Cloudflare, em versões de 27B e 9B sob licença Apache 2.0, e o pplx-decider da Perplexity. O TechCrunch escreveu, em 1º de outubro, que dezenas de modelos similares já tinham sido produzidos por pesquisadores.

Não é só volume. A convergência de arquitetura revela o quanto a categoria é barata de reproduzir: o Strands Decider 2B parte do Qwen3.5-2B, remove a cabeça de linguagem — a parte que gera texto — e a substitui por uma cabeça de ponteiro que pontua as alternativas oferecidas. A AWS informa latência mediana de cerca de 115 ms em uma Nvidia RTX 3090 e 153 ms para tarefas pequenas em um MacBook M3, e posiciona o modelo em terceiro lugar entre 33 na classe de 2B do conjunto público do JevBench.

Marc Brooker, engenheiro distinguido da Amazon que iniciou o projeto, disse ao TechCrunch que o que despertou seu interesse nessa classe de modelos foi que eles funcionam como um decisor perfeito para uma etapa de fluxo de trabalho.

O ceticismo mais direto veio de uma fonte interessada. Diogo Almeida, fundador e presidente-executivo da TypeSafe — a empresa que abriu a categoria e tem a perder com a enxurrada de concorrentes —, afirmou ao TechCrunch entender que as pessoas vejam ali uma corrida do ouro, mas que podem estar subestimando a dificuldade de fazer esses modelos realmente inteligentes. Para ele, a safra atual parece mais gente de aprendizado de máquina implementando uma arquitetura interessante do que um time dedicado a tornar a inteligência útil.

A conta de custo, de fato

O que mudou em 6 de outubro não foi a existência da tecnologia. Foi o preço publicado.

A Decisions API custa US$ 0,10 por 1 milhão de tokens de entrada, sem cobrança por tokens de saída nem por leitura ou escrita de cache. O Jev é cotado a US$ 0,042 por milhão de tokens de entrada, também sem cobrança de saída, segundo o mesmo diretório.

A assimetria entre entrada e saída é o ponto estrutural. Quando uma classificação é feita com um modelo generativo, parte da fatura é gasta para o modelo escrever a resposta — pagam-se tokens de saída para receber de volta a palavra "reclamação". Num modelo de decisão, essa linha da conta desaparece, porque não há texto a gerar. Nos modelos de pesos abertos, o custo sai da API e vira custo de GPU: o Strands Decider 2B roda em uma placa de consumo, o que torna viável manter a decisão dentro da própria infraestrutura.

A OpenAI afirma que o endpoint responde até dez vezes mais rápido que a mesma chamada pela Responses API. É uma alegação da empresa, medida por ela.

O número independente mais útil até aqui não vem de nenhum fornecedor. Em um estudo submetido ao arXiv em 21 de setembro, Hazem Ibrahim e Yasir Zaki avaliaram o primeiro modelo de decisão comercial e duas alternativas de pesos abertos contra 19 modelos de linguagem, em 18 tarefas de classificação de ciências sociais computacionais, com 7.977 itens e o mesmo protocolo sem exemplos prévios para todos.

Os resultados cortam para os dois lados. O custo medido foi 44 vezes menor na mediana. E o modelo de decisão ficou atrás do melhor modelo de linguagem de cada tarefa em 14 das 15 tarefas em que essa comparação foi feita, com déficit mediano de 11,6 pontos de macro-F1 — a métrica que mede o acerto médio entre todas as categorias, sem favorecer as mais frequentes.

Onde o gargalo foi parar

A leitura mais plausível desses dois números juntos é que o modelo de decisão não é um substituto mais barato. É uma etapa de triagem.

É também a conclusão dos autores: rotear para um modelo de linguagem apenas os itens de baixa confiança iguala ou supera o desempenho do modelo de linguagem isolado, a um quarto ou metade do custo. O ganho não está em trocar de modelo. Está em separar as decisões fáceis das difíceis antes de pagar pelas difíceis.

Isso desloca o trabalho. Se a decisão precisa chegar ao modelo como uma pergunta com conjunto fechado de respostas, alguém tem de escrever a pergunta, enumerar as opções e definir o limiar de confiança a partir do qual o caso sobe para revisão humana. Em muitas empresas de serviço, essa regra nunca foi escrita em lugar nenhum — vive na cabeça de quem triou chamados nos últimos cinco anos. A camada barata ficou barata; a cara passou a ser a especificação.

O estudo também mostra por que o limiar não pode ser herdado do fornecedor. A confiança declarada pelo modelo de decisão foi melhor calibrada que a confiança verbalizada de 16 dos 19 modelos de linguagem testados, mas três modelos de fronteira apresentaram erro de calibração mediano menor: 0,066 contra 0,157. Itens acima de 0,9 de confiança foram rotulados corretamente com acurácia mediana de 0,815 — e, em uma tarefa específica, identificar empatia em diálogos de apoio entre pares, o modelo reportou alta confiança com desempenho próximo do acaso.

Ou seja: a confiança é um número útil, não uma garantia. Ela precisa ser validada na distribuição de dados em que vai operar, não na do fornecedor.

Há limites técnicos mais imediatos. Na própria discussão da beta, desenvolvedores relataram que a ordem em que as alternativas são apresentadas pode alterar a distribuição de probabilidades devolvida — um efeito incômodo em um produto vendido justamente pela calibração. A documentação registra ainda que decisões cujas respostas dependem umas das outras exigem requisições separadas, e que o endpoint segue em beta, com disponibilidade geral prevista para as próximas semanas.

O que acompanhar

Uma categoria que vai de um produto a mais de uma dúzia em três semanas não vai permanecer assim. A consolidação é o cenário mais provável, e ela recomenda cautela com acoplamento: quem construir um fluxo em cima de um endpoint proprietário desta safra assume um risco de descontinuidade que a versão de pesos abertos não tem.

O sinal de que a camada veio para ficar, porém, já está fora dos anúncios. Menos de uma semana depois do lançamento, o Strands Decider 2B tinha no Hugging Face versões derivadas em GGUF, ONNX e WebGPU e ajustes de terceiros para tarefas específicas, como detecção de dados pessoais. Isso é adoção de infraestrutura, não curiosidade.

Para quem decide onde colocar dinheiro de automação, a conclusão é menos sobre modelo e mais sobre inventário. Ficou barato executar milhares de julgamentos pequenos por hora com custo e latência previsíveis. Continua caro — e agora é o gargalo — saber exatamente quais julgamentos a operação faz todos os dias, e qual deles a empresa está disposta a deixar passar sem um humano olhando.

Continue explorando

Posts relacionados