Jev: A IA 400x mais barata que o ChatGPT não sabe escrever uma frase

Jev, da TypeSafe AI, custa US$ 0,042 por milhão de tokens e promete não alucinar. Dissecamos o que ela faz, o que o marketing esconde e onde usar.

Quim PierottoQuim Pierotto22/09/2026
A IA 400 vezes mais barata que o ChatGPT não sabe escrever uma frase

Imagem criada por inteligência artificial

A Jev, modelo lançado em 15 de setembro de 2026 pela TypeSafe AI, cobra US$ 0,042 por milhão de tokens de entrada e nada pela saída. A empresa afirma que ela é de 40 a 400 vezes mais barata que os LLMs, e o número fecha na tabela de preços.

A comparação, porém, troca de categoria: a Jev não escreve texto.

Ela recebe um estado, em texto ou JSON, e devolve decisões tipadas com probabilidades. Para quem opera digital, ela interessa como camada de decisão barata para classificar, rotear e pontuar em escala, com o LLM seguindo responsável por tudo que precisa ser escrito.

Resumo: A Jev é real, barata e rápida, e entrega um produto diferente do que a manchete sugere. Custa US$ 0,042 por milhão de tokens de entrada, responde entre 70 e 500 milissegundos segundo a TypeSafe e só devolve escolhas, notas e probabilidades de sim ou não. Os 400x saem de avaliações da própria empresa, com o GPT-6 Astra e o Claude Fable 5.1 como gabarito. O "não alucina" cobre apenas o formato: o conteúdo pode vir errado com 99% de confiança. Faz sentido para classificação, roteamento, moderação e gates de qualidade em pipeline, com o LLM cuidando do que precisa ser escrito.

Neste artigo

O que a Jev é, e o que ela deixou de ser

Quem chega pela manchete espera um ChatGPT de desconto. A Jev pertence a outra família. A TypeSafe a chama de System One Model, em referência à divisão de Daniel Kahneman entre o pensamento rápido e intuitivo e o pensamento lento e deliberado. O modelo não gera strings. Ele recebe um estado: uma frase de cliente, um ticket inteiro ou um JSON com vários campos. E responde perguntas que você definiu antes da chamada.

São três primitivas. Choice escolhe uma opção dentro de um conjunto fechado, com até 255 alternativas. Score posiciona o estado numa escala ordenada que você descreve, como calmo, frustrado e muito irritado. Noul, abreviação de Bernoulli, devolve a probabilidade de uma afirmação ser verdadeira. Cada resposta vem com probabilidades e um índice de confiança, e todas as perguntas de uma chamada são avaliadas em paralelo sobre o mesmo estado.

O fundador resume o produto como uma chamada de função com inteligência de fronteira: estado não estruturado entra, decisões probabilísticas tipadas saem. Diogo Almeida trabalhou na OpenAI nos métodos que ensinaram os modelos a seguir instruções, a pesquisa que virou base do ChatGPT. Saiu há dois anos, e a TypeSafe deixou o stealth com um seed de US$ 40 milhões liderado pela DCVC. O treinamento usa um método próprio, o RLCD, Reinforcement Learning for Calibrated Decisions, e a empresa diz usar apenas dados sintéticos.

O nome homenageia William Stanley Jevons, o economista do paradoxo em que a eficiência no uso do carvão aumentou o consumo de carvão. A aposta da empresa está no enunciado: cada queda de uma ordem de grandeza no custo da inteligência abre ordens de grandeza de novos usos. Isso explica o preço, e explica por que a comparação com o ChatGPT foi escolhida como manchete.

A conta dos 400x: de onde sai o número

O preço de lista é US$ 42 por bilhão de tokens de entrada, ou US$ 0,042 por milhão. A saída não é cobrada porque, nas palavras da empresa, é barata demais para medir. A TypeSafe posiciona isso contra LLMs que cobram de US$ 0,20 a US$ 10 por milhão de tokens de entrada, com saída cerca de cinco vezes mais cara. The Register fez a conta contra o topo da tabela e chegou a 238 vezes menos que o Claude Fable 5.1.

Os 400x e os 200x vêm de outro lugar. A página inicial fala em 193,6 vezes mais rápida e 444,6 vezes mais barata. O post de lançamento admite que esses números saem dos workflow evals da própria TypeSafe e que devem estar no topo dos ganhos reais. A latência declarada fica entre 70 e 500 milissegundos, contra 3 a 329 segundos que a empresa atribui aos modelos de fronteira. Os testes de velocidade, por admissão da empresa, rodam de laptops na Costa Oeste dos Estados Unidos, onde o serviço está hospedado.

A comparação carrega um detalhe que muda a leitura. Nos evals, os LLMs foram obrigados a responder no formato da Jev por meio de um wrapper da própria TypeSafe. A empresa considera esse wrapper o jeito mais preciso de extrair decisões de um LLM. Também reconhece que ele tende a ser mais lento e mais caro do que pedir decisões sem probabilidades. Em outras palavras, o LLM foi medido fazendo o trabalho da Jev pelo caminho mais custoso. Um comentarista do Hacker News apontou o mesmo problema: o LLM gasta geração autoregressiva escrevendo nomes de tipos e schema. Uma comparação mais justa o faria devolver só os números.

Sobre a sustentabilidade do preço, a empresa foi direta: não consegue provar que não há subsídio. Vai precisar do longo prazo para mostrar que o valor se sustenta, embora espere que ele caia. Trato os US$ 0,042 como preço de early access até segunda ordem. A conta que interessa a quem opera é o custo por decisão útil no próprio dado, e ela só aparece em testes de terceiros, que trago adiante.

“Não alucina”: o que a frase entrega

A TypeSafe escreve que a Jev não pode alucinar e coloca 0% no gráfico de alucinação. O mesmo post explica que o número não é empírico: como a resposta sempre respeita o schema, a empresa se sentiu à vontade para adicionar 0% ao gráfico. A garantia, portanto, cobre o formato. A Jev nunca devolve uma quarta opção quando você ofereceu três, nunca devolve uma string onde você pediu um número e nunca quebra o parser.

O conteúdo da resposta é outra história, e o CEO reconheceu isso no Hacker News: por serem modelos probabilísticos, é possível estar confiantemente errado, e modelos futuros continuarão com essa possibilidade. A comunidade cravou a distinção numa frase: segurança de tipo não é correção factual. The Register seguiu pelo mesmo caminho: a comparação nem é justa, já que a saída não é linguagem natural. Uma resposta estruturada com probabilidades continua podendo estar incorreta. A documentação da Vercel para o modelo diz o mesmo com outras palavras: o schema restringe as respostas e não garante que elas estejam corretas.

A crítica mais útil que li veio de Armin Ronacher, CTO da Earendil, ao TechCrunch: a Jev delega parte do problema da alucinação para o usuário. É você quem decide o que fazer com 50% ou com 95%. O trabalho de engenharia migra do prompt para o desenho das perguntas e dos limiares de confiança. Um exemplo do Hacker News mostra a armadilha. O cliente escreve que quer um humano ligando amanhã às 17h. Você pergunta se ele quer falar com um humano. A resposta é sim, com confiança alta, tecnicamente correta e operacionalmente inútil. A solução é uma segunda pergunta sobre o momento, e essa pergunta você precisa escrever antes.

Quem mediu, com que régua

A TypeSafe não publicou paper de arquitetura nem pesos abertos, e nenhum benchmark independente apareceu até agora. O que existe é o site de evals da própria empresa, com quatro workflows publicados. Nesses testes, a resposta de referência é a média do GPT-6 Astra e do Claude Fable 5.1. Por admissão da TypeSafe, isso enviesa os resultados para os modelos de OpenAI e Anthropic. Os workflows foram criados por pessoas do time de capacidades do modelo, e a empresa reconhece que algum viés pode existir.

Transparência que devo ao leitor: minha operação roda em Claude, e o modelo usado como gabarito nesses evals é o Fable 5.1, da Anthropic. Isso não muda a leitura que faço da Jev, mas você deve saber de onde eu falo.

Sobre a arquitetura, Almeida disse ao TechCrunch que se trata de um modelo baseado em transformer, treinado apenas com dados sintéticos, e guarda o resto. Observadores externos suspeitam que a base seja um LLM de pesos abertos. No Hacker News, um usuário afirmou que um clone funcional foi montado em duas horas com modelos abertos. Um pesquisador acusou a TypeSafe de apresentar como inédito um conceito que ele já havia publicado em código aberto, o projeto Laya, sem resposta pública da empresa. Não verifiquei nenhuma dessas alegações. Registro porque elas afetam o quanto a novidade técnica sustenta a estrutura de preço.

Os testes de terceiros são o melhor sinal disponível, e são poucos. Um engenheiro da Vercel relatou ter trocado o Luna 5.6 pela Jev num classificador de segurança de comandos. Obteve respostas de 5 a 18 vezes mais rápidas, com maior acurácia. O CTO da Bryo AI testou contra o Gemini em classificação de e-mails. O Gemini foi um pouco mais preciso e de 10 a 20 vezes mais caro. O que mais o interessou foi a Jev ser a única a devolver uma probabilidade real. São dois relatos em rede social, sobre dado próprio, sem metodologia aberta. Servem como direção; o teste que decide é o seu.

O sinal de adoção é mais forte que o de evidência. Em três dias, Vercel, Cloudflare, LangChain e Langfuse integraram o modelo. A Vercel, segundo a cobertura do lançamento, chama de adoção mais rápida da história do seu AI Gateway. A demanda foi tanta que a TypeSafe perdeu brevemente a capacidade de servir a API. Adoção rápida mede curiosidade e distribuição, e essas duas métricas ainda não dizem nada sobre acurácia.

Onde isso importa na operação digital

Aqui a dissecção vira uso. Quase toda operação de conteúdo, mídia e performance tem dezenas de decisões escondidas dentro de chamadas caras a um LLM. São decisões em que o que se precisa é de um sim ou não, uma categoria ou uma nota. A TypeSafe chama isso de if-statement inteligente, e a descrição é justa. O exercício prático é listar essas decisões e separar as que têm espaço de resposta fechado.

Alguns exemplos no formato de pergunta da Jev. Na triagem de leads, uma Choice para segmento, um Score para maturidade e um Noul para “menciona orçamento”. Na moderação de comentários em escala, um Noul para spam, um Noul para ataque pessoal e um Score para urgência de revisão humana. No tagueamento de acervo editorial, uma Choice sobre a editoria correta entre as suas categorias reais. Em gates de qualidade num pipeline de SEO, um Noul para “o texto responde à intenção de busca”, um Score para densidade de conteúdo original e um Noul para “cita fonte primária”. No roteamento de tickets, departamento, frustração e urgência numa chamada só, que é o exemplo da própria documentação.

O desenho que faz sentido é o de camada, e a própria TypeSafe posiciona o modelo assim: verificação de saídas de LLM, detecção de jailbreak e roteamento de modelos. Ronacher citou o roteamento como um dos usos mais promissores. Prever se uma tarefa exige um modelo caro é útil, e fazer essa previsão com um LLM sai caro. Com a Jev, a triagem em tempo real fica viável. A conta muda quando cada decisão custa uma fração de centavo. No preço de lista, uma decisão com mil tokens de entrada custa US$ 0,000042, e dez mil delas custam US$ 0,42.

O que muda no trabalho é o tipo de escrita. Você deixa de redigir prompts longos e passa a escrever perguntas atômicas com critérios explícitos. A documentação, citada no Hacker News, recomenda manter cada Score numa dimensão só: “pontual, inteligente e experiente” mede três coisas e derruba a confiança. Um comentarista chamou isso de construir um LLM com if-statements, e a crítica procede em casos fluidos de linguagem. Theo Browne foi na mesma direção ao dizer que os demos virais empurram a Jev para tarefas que um classificador simples ou uma regra resolveria. Concordo em parte: se a decisão cabe numa regra, use a regra. A Jev entra onde a regra fica frágil e o LLM fica caro.

Os limites que ficam fora da manchete

A ficha técnica oficial resolve dúvidas que a cobertura embaralhou. O contexto é de 64 mil tokens por requisição, com 32 mil reservados para o estado mais a pergunta mais longa. A entrada é só texto: string, objeto JSON ou array, sem imagem, áudio ou vídeo. Os limites de conta são 250 mil tokens por segundo e 1.200 requisições por minuto, ajustados enquanto a capacidade de GPU chega.

A Jev não explica a decisão. Você recebe probabilidades e nenhuma justificativa. Em auditoria, compliance ou qualquer fluxo em que alguém precise entender por que o sistema rejeitou um lead, isso pesa. O modelo é hospedado e fechado, sem pesos para rodar localmente. Isso incomoda quem mantém automações locais por privacidade e por resiliência a queda de internet.

O acesso segue em early access por waitlist, embora o modelo já esteja disponível pelo Cloudflare Workers AI, pelo Vercel AI Gateway e pelo OpenRouter. As Choices aceitam até 255 opções; acima disso, a própria TypeSafe usa dois estágios, pontuação independente seguida de escolha explícita, com perda de velocidade. O demo do Doom, que virou cartão de visita, roda sobre o estado estruturado do jogo, em texto, como o post de lançamento reconhece. Ler pixels ainda está fora do escopo.

A calibração, argumento central da empresa, ainda não tem evidência pública. Nenhuma curva de confiabilidade nem número de erro de calibração foi publicado. A própria documentação, segundo o guia da Agentpedia que a cita, restringe a promessa. Calibração é medida em grupos de previsões e não garante que uma resposta individual esteja correta. Para quem vai automatizar em cima disso, essa frase vale mais que os 400x.

O que eu faria com isso

Ainda não rodei a Jev. Escrevo com fontes primárias e testes de terceiros, e por isso digo o que eu faria antes de colocar qualquer decisão de produção em cima dela, em vez de fingir resultado.

Primeiro, escolheria uma decisão que hoje passa por LLM e tem gabarito humano, como a triagem de comentários ou a classificação de leads. Rodaria Jev e LLM sobre o mesmo lote de mil itens. Mediria acurácia contra o gabarito e mediria a calibração: das respostas com 90% de confiança, a fração que estava certa. Se a calibração segurar no meu dado, a Jev vira alavanca. Se não segurar, o preço baixo só barateia o erro.

Segundo, definiria limiares por custo do erro. Decisão barata e reversível acima de 0,9 age sozinha; decisão cara pede confirmação; abaixo do limiar, o item vai para uma pessoa ou para o LLM. Terceiro, guardaria as probabilidades em log, porque elas são o único rastro de auditoria que o modelo oferece. Quarto, repetiria a medição a cada versão, já que o modelo está em early access e os limites, segundo a própria documentação, mudam sem aviso. Um limiar calibrado numa versão pode não valer na seguinte.

A Jev justifica a atenção que recebeu, pelo desenho e pelo preço. A manchete que a acompanhou compara produtos diferentes e atrapalha quem quer avaliá-la a sério. O ganho real aparece quando você trata decisões como decisões e texto como texto, e cobra de cada camada exatamente o que ela sabe fazer.

Jev e LLMs de chat, lado a lado

CritérioLLM de chat (ChatGPT, Claude)Jev (TypeSafe AI)
SaídaTexto livre: resposta, código, JSON após parse e validaçãoValores tipados: Choice, Score e Noul, com probabilidades e confiança
GeraçãoSequencial, token a tokenParalela, todas as perguntas numa única passada
Preço de entrada (lista)US$ 0,20 a US$ 10 por milhão de tokens, faixa citada pela TypeSafeUS$ 0,042 por milhão de tokens
Preço de saídaCerca de 5x o de entrada, segundo a TypeSafeGratuito
Latência3 a 329 segundos em modelos de fronteira, segundo a TypeSafe70 a 500 milissegundos, segundo a TypeSafe
ContextoCentenas de milhares de tokens64 mil por requisição; 32 mil para estado mais a pergunta mais longa
EntradaTexto, imagem e, em alguns modelos, áudio e vídeoSó texto: string, JSON ou array
Explica a decisãoSim, em linguagem naturalNão; só probabilidades
Pesos e execução localDepende do modeloFechado e hospedado
AcessoPúblicoEarly access por waitlist; disponível via Cloudflare Workers AI, Vercel AI Gateway e OpenRouter

Perguntas frequentes sobre a Jev

A Jev substitui o ChatGPT ou o Claude?

Não. A Jev não gera texto, código nem resumos. Ela responde perguntas tipadas com probabilidades e serve como camada de decisão ao lado de um LLM, que continua responsável por tudo que precisa ser escrito ou raciocinado em etapas.

Quanto custa a Jev?

US$ 0,042 por milhão de tokens de entrada, ou US$ 42 por bilhão, com saída gratuita. A própria TypeSafe admite que não consegue provar que o preço não é subsidiado, e o modelo ainda está em early access.

É verdade que a Jev não alucina?

A garantia cobre o formato: a resposta sempre respeita o schema definido. O conteúdo pode estar errado com alta confiança, como o CEO reconheceu no Hacker News. O 0% do gráfico oficial não é um número empírico.

Para que a Jev serve numa operação de marketing e conteúdo?

Para decisões com espaço de resposta fechado e alto volume: triagem de leads, moderação de comentários, categorização de acervo, gates de qualidade em pipeline de SEO, roteamento de tickets e roteamento entre modelos.

Como acessar a Jev hoje?

Pelo waitlist de early access no site da TypeSafe ou pelas integrações já publicadas no Cloudflare Workers AI, no Vercel AI Gateway e no OpenRouter. Há SDKs oficiais em Python e JavaScript.

FONTES PRIMÁRIAS USADAS:

Post de lançamento: https://typesafe.ai/blog/introducing-system-one-models-and-jev
Ficha técnica (modelos e limites): https://docs.typesafe.ai/models
Guia da Vercel: https://vercel.com/kb/guide/typesafe-jev-and-ai-sdk
Cloudflare Workers AI: https://developers.cloudflare.com/ai/models/typesafe/jev/
TechCrunch (18/09/2026): https://techcrunch.com/2026/09/18/a-new-kind-of-ai-model-from-a-chatgpt-inventor-is-thrilling-developers/
The Register (16/09/2026): https://www.theregister.com/ai-and-ml/2026/09/16/typesafe-ai-debuts-model-for-machines-that-plays-doom/5296711
Hacker News (thread de lançamento): https://news.ycombinator.com/item?id=49717558

Quim Pierotto
Transforma tecnologia, estratégia digital e inovação em resultados.
Artigos criados 313

Artigos relacionados

Digite acima o seu termo de pesquisa e prima Enter para pesquisar. Prima ESC para cancelar.

Voltar ao topo

Operado por Spreable