Jev e Laya: O Que São os Modelos de Decisão System One e Quando Usá-los?
Nem toda decisão de um sistema de Inteligência Artificial exige um modelo capaz de gerar texto. Imagine um sistema que recebe solicitações de suporte técnico e precisa apenas determinar três coisas: qual equipe deve assumir o atendimento, qual é o nível de prioridade e qual categoria melhor descreve o problema. Ainda assim, muitas aplicações recorrem diretamente a um LLM, aguardam alguns segundos pela resposta e depois precisam validar se o modelo realmente devolveu o JSON no formato esperado.
Em setembro de 2026, dois lançamentos colocaram essa prática em xeque. No dia 15, a TypeSafe AI apresentou o Jev, um modelo que não gera texto e devolve apenas decisões tipadas acompanhadas de probabilidades. Três dias depois, a Convai Innovations publicou o Laya, uma alternativa de pesos abertos com a mesma proposta.
Neste post, você vai entender o que são esses modelos, como funcionam, em que se diferenciam e, principalmente, em quais situações cada um faz sentido no seu pipeline de IA.
Sistema 1 e Sistema 2: A Ideia Por Trás dos Modelos System One
Um modelo System One é um modelo de IA que recebe um contexto e devolve decisões estruturadas com probabilidades, em vez de texto. O nome vem do livro Rápido e Devagar: Duas Formas de Pensar, de Daniel Kahneman, que separa o pensamento humano em dois modos:
• Sistema 1: rápido, intuitivo e quase automático. É o julgamento que um profissional experiente faz em poucos segundos, como um médico que bate o olho num exame e sabe que o caso é urgente.
• Sistema 2: lento, deliberado e analítico. É o raciocínio passo a passo que usamos para resolver um problema novo ou escrever um laudo.
Os LLMs atuais, com cadeias de raciocínio que levam segundos ou minutos, são máquinas de Sistema 2. O argumento de Diogo Almeida, fundador da TypeSafe e coinventor do RLHF e do InstructGPT na OpenAI, é que a maior parte das decisões dentro de um software pede uma resposta de Sistema 1: rápida, barata e em um formato que o código consome direto.
O nome “Jev” homenageia o economista William Stanley Jevons. O paradoxo de Jevons diz que, quando um recurso fica mais barato, o uso total dele cresce. A aposta da TypeSafe é que decisões de IA muito mais baratas vão liberar casos de uso que hoje não se pagam com um LLM.
Como Funciona Um Modelo de Decisão?
A mecânica é simples: entra um estado e um conjunto de perguntas tipadas, sai uma resposta tipada para cada pergunta. O estado é o contexto da decisão (um e-mail, um ticket, um trecho de log, um documento JSON). As perguntas dizem ao modelo que tipo de julgamento você quer.
Jev e Laya trabalham com as mesmas três primitivas:

Três características tornam essa abordagem diferente de pedir JSON a um LLM:
1. Passada única e não autorregressiva. O modelo não gera um token depois do outro. Todas as perguntas são avaliadas em paralelo, cada uma isolada das demais, contra o mesmo estado. Por isso, acrescentar perguntas quase não aumenta o tempo de resposta.
2. Saída restrita ao esquema. O modelo só pode devolver opções que você definiu e números dentro da escala. Não existe JSON malformado, chave faltando ou rótulo inventado.
3. Probabilidades em vez de frases. Em vez de um texto dizendo “tenho 95% de certeza”, você recebe uma distribuição numérica sobre a qual o código pode aplicar um limiar.
Um cuidado importante: “não alucina” significa apenas que o formato nunca quebra. Uma resposta tipada ainda pode estar errada e com confiança alta. O que separa um bom modelo de decisão de um ruim é a calibração: se ele diz 0,9 em mil casos, cerca de 900 deveriam estar certos.
A documentação da TypeSafe recomenda perguntas atômicas. Em vez de pedir “avalie esta proposta comercial”, pergunte separadamente sobre tamanho de mercado, viabilidade técnica e diferenciação, e combine os resultados com uma fórmula no seu código. Quando a prioridade mudar, você ajusta um peso, não reescreve um prompt.
Jev: O Modelo de Decisão Hospedado da TypeSafe AI
O Jev é um serviço: você não baixa o modelo, chama uma API e paga por token de entrada. A TypeSafe, laboratório de São Francisco que passou dois anos em silêncio, lançou o Jev em 15 de setembro de 2026, junto com o anúncio de uma rodada seed de US$ 40 milhões liderada pela DCVC.
O Jev usa um método de treinamento que a TypeSafe chama de RLCD (Reinforcement Learning for Calibrated Decisions). A comparação ajuda a entender a ideia:
• RLHF otimiza respostas que avaliadores humanos preferem, o que torna chatbots agradáveis, mas também confiantes demais.
• RLVR otimiza saídas que um programa consegue verificar como certas ou erradas.
• RLCD otimiza probabilidades honestas sobre decisões estruturadas, tratando a calibração como objetivo principal do treino.
A arquitetura, o número de parâmetros e os dados de treino não foram divulgados. Não há pesos abertos nem artigo técnico publicado. Ficha técnica:

No benchmark da própria TypeSafe, com quatro fluxos de trabalho (resposta a incidentes de segurança, observabilidade de agentes, processamento de faturas e atendimento ao cliente), o Jev concordou com as respostas de referência em 67,8% dos casos. É praticamente o mesmo resultado do GPT-5.6 Terra (67,9%), a cerca de 1/76 do custo por caso (US$ 0,0004 contra US$ 0,0304) e em 0,4 segundo contra 10,1 segundos. Modelos de fronteira como GPT-5.6 Sol (74,1%) e Claude Opus 5 (73,1%) mantêm uma vantagem de 5 a 6 pontos em acurácia, com custo e latência muito maiores.
Esses números são do fornecedor e a própria TypeSafe reconhece vieses na avaliação. A empresa também admite que não consegue provar que o preço atual não é subsidiado. Um dado externo mais concreto veio da Vercel: um revisor de segurança de comandos que rodava num modelo da OpenAI ficou até 18 vezes mais rápido no p95 ao migrar para o Jev, segundo o CEO da empresa.
Laya: A Alternativa Open-Source da Convai Innovations
O Laya é um modelo de pesos abertos sob licença Apache 2.0, publicados no Hugging Face, que rodam na sua própria máquina com pip install laya. Ele foi lançado em 18 de setembro de 2026 pela Convai Innovations, empresa do pesquisador Nandakishor Mukkunnoth.
O lançamento veio com uma disputa de anterioridade. Mukkunnoth já havia publicado trabalhos sobre decisões estruturadas guiadas por aprendizado por reforço em março de 2025 (arXiv:2503.23303) e setembro de 2025 (arXiv:2510.01237), com pesos e dados abertos. Não há evidência de que a TypeSafe conhecesse esse trabalho e a leitura mais comum na comunidade é a de duas equipes que chegaram à mesma ideia de forma independente.
Em vez de um modelo generativo, o Laya usa um encoder bidirecional (da família BERT) com uma cabeça de decisão. Ele responde às mesmas primitivas do Jev (Choice, Score e Noul) em uma única passada pela rede. Se quiser conhecer sobre a arquitetura BERT, recomendamos o Deep Learning Book da DSA.
O projeto distribui três checkpoints:

Um roteador embutido detecta o alfabeto do texto em menos de 1 ms e escolhe o checkpoint certo. Esse detalhe é mais importante do que parece: nos testes dos autores, o checkpoint em inglês acertou 0% das perguntas, mas reportou 95% de confiança média. Ou seja, a confiança do modelo não avisa quando ele não consegue ler a entrada e a escolha do modelo precisa acontecer antes da inferência.
Os autores medem 32,8 ms por decisão (mediana) numa GPU Tesla T4 e 7,2 ms por pergunta em lotes de dez. O modelo também roda em CPU via ONNX, com início a frio mais lento. Não há cobrança por token: o custo é o hardware que você mantém ligado, mais o trabalho de servir, ajustar e calibrar o modelo.
A ficha do Laya é incomumente franca. A própria equipe o descreve como uma base rápida para especializar, não como um motor de decisão pronto para uso sem treino:
• Zero-shot fraco. Sem ajuste, ele marca 0,362 no benchmark de decisões tipadas da TypeSafe. O chute aleatório marca 0,318 e a estratégia de sempre responder a classe mais comum marca 0,461.
• Brilha depois do fine-tuning. O resultado de 0,766 (acima do 0,727 do Jev) vem de um checkpoint treinado na partição de treino do próprio benchmark. O repositório traz um notebook para fazer esse ajuste em cerca de 4 horas em GPUs gratuitas do Kaggle.
• Muitas opções o derrubam. Acima de cerca de 20 opções num Choice, a qualidade cai. No Banking77, com 77 intenções, o Laya fez 0,425 contra 0,870 do Jev.
• Sai de fábrica superconfiante. O erro de calibração esperado (ECE) médio é 0,466 e só cai para 0,081 depois de ajustar uma temperatura por tipo de pergunta.
• Contexto curto. 512 tokens no checkpoint em inglês equivalem a mais ou menos um parágrafo. Históricos longos precisam ser resumidos ou cortados.
Quando Usar Cada Um?
A regra de bolso é esta: use um modelo de decisão quando a decisão se repete em volume e as respostas possíveis são conhecidas de antemão. Entre os dois, escolha o Jev se você não tem dados rotulados e o Laya se os dados não podem sair de casa (devido a requisitos de privacidade ou regulação).
Escolha o Jev quando:
• Você precisa que funcione sem treino, desde o primeiro dia, e não tem exemplos rotulados.
• O conjunto de opções é grande (classificação de intenções com dezenas de categorias, escolha entre muitos modelos num roteador de LLMs).
• O estado é longo: uma conversa inteira, um histórico de atendimento, um trace de agente.
• A decisão funciona como guardrail ou portão de chamada de ferramenta, onde resistência a manipulação pesa mais.
• Sua aplicação já depende de APIs externas e você não quer operar mais uma pilha de inferência.
Escolha o Laya quando:
• Os dados não podem sair da sua infraestrutura: prontuários, documentos jurídicos, histórico financeiro de clientes, exigências da LGPD.
• A taxonomia é fixa e estreita (menos de 20 opções) e você tem exemplos rotulados e um ciclo de treino.
• O volume é alto e constante, a ponto de o custo fixo de uma GPU sair mais barato que o custo por token.
• Você precisa rodar offline, na borda ou em ambiente isolado, ou quer congelar uma versão do modelo que nunca muda sem sua decisão.
• A caixa de entrada mistura vários idiomas e você quer cobri-los com um só componente.
Não use nenhum dos dois quando:
• A tarefa exige gerar algo: texto, código, resumo, resposta ao cliente.
• A decisão precisa de raciocínio em várias etapas ou de uma justificativa por escrito, por exemplo para auditoria em setores regulados. Ambos devolvem números, não explicações.
• As respostas possíveis não são conhecidas de antemão.
• Uma regra simples ou um classificador clássico já resolve. A facilidade dessas ferramentas convida ao uso excessivo, e nem todo if precisa de IA.
Arquitetura Recomendada: Decisão Rápida, Escalonamento Seletivo
O lugar natural de Jev e Laya é na frente do pipeline, como um filtro rápido que resolve a maioria dos casos e escala só os duvidosos. A IA decide; o código executa.

O código aplica um limiar sobre a probabilidade devolvida: acima dele, executa a ação; abaixo, envia o caso a um LLM ou a uma pessoa, que decide e explica. Os casos revisados viram rótulos para recalibrar o limiar e, no caso do Laya, para novos ciclos de fine-tuning. Uma variação é a cascata: o Laya responde primeiro, localmente, e apenas os casos incertos seguem para o Jev.
Cuidados Antes de Colocar em Produção
Nenhum dos dois modelos dispensa avaliação com os seus próprios dados. Ambos eliminam erros de formato, mas não eliminam erros de julgamento. Antes de automatizar qualquer decisão, verifique cinco pontos:
1. A calibração varia por tarefa. A própria TypeSafe recomenda validar os limiares com casos rotulados e o Laya exige ajuste de temperatura antes de confiar nas probabilidades. Não saia colocando em produção somente porque está na moda. Teste e calibre com atenção ao seu caso de uso.
2. Consistência. Envie a mesma pergunta reescrita de formas diferentes. Na análise da Respan, o Jev mudou de resposta em cerca de 2% dos pares equivalentes e o Laya, em cerca de 30%. Num roteador de tickets, isso significa dois clientes com o mesmo problema indo para filas diferentes.
3. Injeção de prompt. O estado costuma vir de fora (um e-mail, um documento recuperado, a saída de uma ferramenta) e pode conter instruções maliciosas. Na mesma análise, cerca de 6% das tentativas de injeção mudaram a decisão do Jev, contra cerca de 40% no Laya sem ajuste. Se a decisão é um guardrail, teste esse cenário explicitamente.
4. Idioma. O Jev tem foco em inglês e o Laya depende do roteador para textos em outros idiomas. Monte seu conjunto de teste em português, com gírias, erros de digitação e o vocabulário real dos seus clientes.
5. Origem dos benchmarks. Os números do Jev vêm da TypeSafe. Os do Laya vêm dos seus autores, que compararam com números do Jev medidos por terceiros. A Respan vende seu próprio classificador concorrente. Nenhuma dessas fontes é neutra, então trate todos os resultados como hipóteses a confirmar no seu tráfego.
Conclusão
Jev e Laya inauguram uma camada que faltava na arquitetura de sistemas de IA: o componente que decide, separado do componente que escreve. Um LLM continua sendo a ferramenta certa para gerar texto, código e explicações. Um modelo de decisão é a ferramenta certa para classificar, pontuar e rotear milhares de vezes por minuto, em milissegundos e por frações de centavo.
Entre os dois, a escolha se resume a três perguntas.
- Você tem dados rotulados e um ciclo de treino?
- Os dados podem sair da sua infraestrutura?
- As opções e o contexto cabem nos limites do Laya?
Seja qual for a resposta, a recomendação é a mesma: meça a calibração no seu tráfego antes de deixar qualquer modelo decidir sozinho. A latência virou commodity; a confiança precisa ser conquistada em cada implantação.
Equipe DSA
Referências:
O Paradoxo de Jevons na Adoção de IA
TypeSafe AI: documentação do Jev (Introduction)