TypeSafe Jev: el primer modelo System One, explicado

Alicia Kirana Utomo
Escrito por

Alicia Kirana Utomo

Katelin Teen
Revisado por

Katelin Teen

Última edición September 21, 2026

Verificado por expertos
Banner principal ilustrado de TypeSafe Jev, el primer modelo de IA System One

Qué es realmente TypeSafe Jev

TypeSafe es un laboratorio de IA de San Francisco que pasó dos años en modo sigiloso antes de lanzar Jev. Su planteamiento es deliberadamente provocador: en la página de inicio de TypeSafe, los LLM "producen palabras para las personas", mientras que "Jev produce decisiones tipadas y se parece más al código: confiable, rápido, autoconsistente y type-safe". El post de lanzamiento llama a Jev "una llamada a función con inteligencia de frontera: estado no estructurado entra, decisiones probabilísticas tipadas salen".

La página de inicio de TypeSafe explicando qué hace el modelo System One Jev, tomado de TypeSafe

El nombre es un juego de palabras con dos partes. "System One" toma prestado de Pensar rápido, pensar despacio de Daniel Kahneman: la distinción que planteó entre el pensamiento rápido e intuitivo del Sistema 1 y el razonamiento lento y deliberado del Sistema 2. Los modelos de chat persiguen el Sistema 2. Jev está construido para el Sistema 1: el juicio instantáneo que una persona con conocimiento hace en un par de segundos. "Jev" en sí lleva el nombre del economista William Stanley Jevons, cuya paradoja TypeSafe cita como su tesis: cada caída de un orden de magnitud en el costo de la inteligencia desbloquea órdenes de magnitud más casos de uso.

La premisa detrás de todo esto es que RLHF, la técnica que hizo que los chatbots fueran agradables para conversar, también los volvió poco fiables para el consumo por máquinas. La propuesta de TypeSafe es que "tomó la dirección de investigación opuesta" y entrenó una nueva clase de modelo con un nuevo algoritmo que llama Reinforcement Learning for Calibrated Decisions (RLCD).

Cómo funciona Jev: estado entra, decisiones tipadas salen

El bucle central es una solicitud a una respuesta. Envías un estado (ya sea un string simple o un objeto estructurado) más un conjunto de preguntas tipadas. Jev evalúa cada pregunta en paralelo contra ese mismo estado, y devuelve respuestas tipadas con probabilidades y confianza. Tu código entonces ramifica, ordena y enruta según esas respuestas.

Cómo Jev evalúa preguntas tipadas contra un estado en un único paso paralelo
Cómo Jev evalúa preguntas tipadas contra un estado en un único paso paralelo

La decisión de diseño que más importa: cada pregunta se evalúa de forma independiente y aislada contra el mismo estado. TypeSafe dice que agregar preguntas apenas cambia el tiempo de respuesta, y como cada una se puntúa por separado, no obtienes el "context-rot" que se cuela cuando metes una docena de instrucciones en un solo prompt.

El consejo de TypeSafe es mantener cada pregunta atómica. En lugar de preguntar "califica este pitch de startup", preguntas cada dimensión por separado (tamaño de mercado, viabilidad técnica, diferenciación) y combinas las puntuaciones con tu propia fórmula. Cuando las prioridades cambian, cambias un coeficiente en el código en lugar de reescribir un prompt. Si alguna vez has peleado con un mega-prompt para que se comporte, ese instinto de descomposición te resultará familiar, y es la misma lógica detrás de una buena automatización de flujos de trabajo con IA.

Los tres primitivos: Noul, Choice y Score

Jev expone exactamente tres tipos de preguntas, y puedes mezclar los tres en una sola llamada a la API.

Los tres primitivos de Jev, Noul, Choice y Score, cada uno con un ejemplo de soporte
Los tres primitivos de Jev, Noul, Choice y Score, cada uno con un ejemplo de soporte
  • Noul responde "¿es verdadera esta afirmación?" y devuelve una única probabilidad de 0 a 1.
  • Choice elige una opción de una lista que defines, y devuelve la elección, probabilidades por opción y un valor de confianza.
  • Score puntúa el estado según una rúbrica que defines, y devuelve un valor numérico (puede caer entre niveles, como 1,04 sobre 2), probabilidades por nivel y confianza.

El ejemplo trabajado que publica Cloudflare es, reveladoramente, un ticket de soporte. Dale a Jev el mensaje "Help! My payouts have been failing for 3 days" y tres preguntas mixtas, y responde con is_urgent (Noul) en 0,95, department (Choice) como billing con 0,8 de confianza, y frustration (Score) en 1,04 en una escala de calma a muy enojado, todo en una sola llamada. Eso es triaje, enrutamiento y sentimiento en una sola solicitud, exactamente el tipo de decisión que necesita un paso de triaje de tickets con IA.

Dónde Jev rompe con un LLM normal

Si solo te llevas un modelo mental, que sea este: un LLM escribe, Jev decide.

Una comparación lado a lado de un modelo de lenguaje y un modelo System One
Una comparación lado a lado de un modelo de lenguaje y un modelo System One

Un modelo de lenguaje muestrea un token a la vez, en secuencia, hasta producir un string que un humano lee. Jev genera todas sus salidas en un único paso paralelo y nunca produce texto libre en absoluto. Por eso es rápido, y también por eso la comparación no es del todo justa, un punto al que volveré. La conclusión práctica para quienes construyen es que Jev encaja en cualquier lugar donde actualmente estés forzando a un LLM a emitir un blob JSON que luego parseas y esperas que sea válido. Es la misma pregunta de "qué capa estoy eligiendo en realidad" que aparece en AgentKit frente a la API de Anthropic.

Las cifras que afirma TypeSafe

TypeSafe no se guarda las cifras, así que aquí están con sus salvedades.

AfirmaciónJevReferencia declarada por TypeSafe
Latencia de extremo a extremo70 ms a 500 msde 3 a 329 segundos para LLM de frontera
Múltiplo de velocidad40x a 200x más rápidoen consultas con forma System One
Titular de flujo de trabajo193,6x más rápido, 444,6x más barato"en el extremo alto de las ganancias del mundo real"
Precio de entrada0,042 $ / MTok, salida gratuita238x menor que Claude Fable 5.1
Ventana de contexto32.000 tokensversión del modelo jev-1.13.0

Jev ya está en vivo en Cloudflare Workers AI como typesafe/jev, y TypeSafe está abriendo el acceso anticipado desde una lista de espera. Todavía no hay una página de precios independiente; la cifra de 0,042 $ proviene de la página de inicio y del post de lanzamiento. Sobre la sostenibilidad, TypeSafe es refrescantemente franco en su post de lanzamiento: "We can't prove it isn't subsidized; we'll need the long-term to prove the sustainability of our pricing (which we expect to go down, not up)."

El dato externo más creíble vino del CEO de Vercel, que puso a Jev en un producto real:

"We're seeing extraordinary results from @typesafeai. Default mode in 𝚏𝚡 is auto, with a safety reviewer analyzing every command. That reviewer runs on GPT Luna today. Jev is up to 18x faster (p95) and more accurate."

Una aceleración de 18x en un paso real de revisión de seguridad es una afirmación mucho más fundamentada que la cifra de marketing de 200x, y señala dónde brilla realmente Jev: el verificador rápido que se sitúa delante de un sistema más lento.

Qué significa realmente "no puede alucinar"

Esta es la afirmación que encendió el hilo de lanzamiento en Hacker News (1.929 puntos, 508 comentarios), y vale la pena detenerse en ella porque es lo que la mayoría de la gente entenderá mal.

Jev no puede cometer un error de tipo y no puede devolver una opción que no estaba en tu lista. En ese sentido mecánico, "no puede alucinar". Pero una respuesta tipada aún puede estar equivocada con alta confianza, y varios comentaristas lo señalaron con claridad:

Hacker News

"if it puts a high confidence value on a wrong answer, thats still hallucinating, no?"

La defensa es que Jev siempre te entrega un valor de confianza, así que puedes actuar sobre las respuestas seguras y enrutar las dudosas a un humano:

Hacker News

"they mean they produce a confidence value for every result, so you could see for example it has 0.1 confidence, and you can disregard the result."

La verdadera prueba es la calibración, no el eslogan de "no puede alucinar". Como dijo un comentarista, si el modelo dice 0,9 en mil respuestas, alrededor de 900 deberían ser correctas. Se supone que RLCD está optimizado exactamente para eso. Hasta que existan cifras de calibración independientes, trata "no puede alucinar" como "no devolverá una salida mal formada", no como "siempre tiene razón". Para cualquiera que despliegue IA en preguntas reales de clientes, esa distinción lo es todo, y por eso nos apoyamos tanto en el grounding y las pruebas para prevenir las alucinaciones de IA en soporte.

Quién está detrás de Jev

TypeSafe tiene una trayectoria difícil de ignorar. El fundador y CEO Diogo Almeida coinventó RLHF e InstructGPT en OpenAI, la línea de investigación que llevó a ChatGPT, y antes trabajó en Google Brain. Lo acompañan la COO Sasha Sheng (ex-Meta/FAIR) y el CTO Erik Gafni, con un equipo procedente de OpenAI, Google Brain, Meta, Stripe, Airbnb y Docker.

La empresa dice que está "respaldada por inversores de primer nivel" pero no ha publicado una cifra de financiación en sus propias páginas, así que no le pondré un número. El eslogan, "Build Prod, Not God", revela la postura: es un equipo que optimiza para lanzar piezas de producción confiables, no para perseguir la AGI.

¿Deberías usar Jev realmente?

Esta es mi lectura después de revisar la documentación, las demos y las críticas.

Recurre a Jev cuando el trabajo es una decisión estrecha y bien acotada que consume tu código: enrutamiento, moderación, detección de intención, puntuación, filtros de extracción, o una verificación de seguridad rápida delante de un modelo más grande. La opinión de desarrollador más convincente en Hacker News vino de alguien que ya hacía esto a mano:

Hacker News

"this is exactly how I am using LLMs in production, to narrowly make choices and return structured data... Jev's focus on structured I/O and confidence scores are game changing. If this does at all what it claims, I think this is going to quickly become the new standard approach for agentic systems."

No recurras a Jev cuando necesites generación, explicación o razonamiento en varios pasos. El comentario más votado de todo el hilo dio en el clavo con el planteamiento honesto:

Hacker News

"Seems like a more accurate title would be 'Jev: Trading general purpose generation for fast typed inference.'"

Y los escépticos más ruidosos, incluido el desarrollador Theo Browne, argumentaron que las demos virales lo empujan hacia trabajos que debería tener un clasificador simple o una regla. Es una advertencia justa: una herramienta tan rápida invita al sobreuso. La línea a mantener es que Jev es una pieza primitiva. Te da una gran decisión; tú sigues siendo responsable del pipeline, la lógica de escalamiento, la estrategia de deflection y cada acción que ocurre después de la decisión.

Prueba eesel

Si diriges soporte, la traducción honesta de todo esto es: Jev es un motor brillante, no un auto. Te dirá que un ticket es urgente, de facturación y viene de un cliente frustrado en 114 milisegundos. No abrirá el ticket, no redactará la respuesta fundamentada en tu centro de ayuda, no aplicará el reembolso ni lo transferirá a un humano cuando no esté seguro. Alguien todavía tiene que construir eso.

eesel es ese compañero de equipo terminado. Es un compañero de equipo de IA para soporte que conectas a tu helpdesk, y ya toma las decisiones de triaje, enrutamiento y escalamiento que Jev expone como primitivos, y luego actúa sobre ellas de principio a fin. Se une a tu cola de servicio al cliente existente, aprende de tus tickets pasados y tu centro de ayuda, y puedes simularlo contra tickets históricos antes de que toque a un cliente real.

La vista de actividad de eesel mostrando tickets resueltos y ejecuciones de automatización
La vista de actividad de eesel mostrando tickets resueltos y ejecuciones de automatización

Y si te gustó la ergonomía para desarrolladores de Jev, esto te va a gustar: eesel no es solo un panel. La CLI de eesel (npx @eesel/cli) opera al mismo compañero de equipo y espacio de trabajo desde una terminal. Una persona puede ejecutar eesel chat, eesel activity o eesel approvals a mano; los scripts pueden automatizarlo en CI; y agentes de programación como Claude Code, Codex y Cursor pueden manejarlo, ya que cada comando imprime JSON y --dry-run muestra la llamada exacta antes de ejecutarla. Cada espacio de trabajo es además un servidor MCP. Jev te da la decisión; eesel te da al compañero de equipo que actúa sobre ella, y permite que tus agentes lo operen. Puedes probar eesel gratis.

Preguntas frecuentes

¿Qué es TypeSafe Jev?

TypeSafe Jev es el primer modelo System One público: en lugar de generar texto, evalúa preguntas tipadas frente a un estado y devuelve decisiones tipadas con probabilidades y una puntuación de confianza. Está diseñado para los juicios estrechos y estructurados que el software consume directamente, como la triaje de nivel 1 y el enrutamiento.

¿Cuánto cuesta TypeSafe Jev?

TypeSafe fija el precio de Jev en 0,042 $ por millón de tokens de entrada, con la salida gratuita, lo que la empresa presenta como un precio de entrada 238 veces menor que Claude Fable 5.1. Todavía no hay una tabla de niveles de precios publicada, y el acceso es mediante una lista de espera de acceso anticipado.

¿De verdad Jev no puede alucinar?

No puede producir un error de tipo ni inventar una opción fuera de la lista que le diste, pero una respuesta tipada con alta confianza aún puede ser incorrecta, un punto debatido en Hacker News. La verdadera prueba es la calibración. Si quieres respuestas fundamentadas en una cola de soporte, aplica la misma disciplina que describimos en nuestra guía para prevenir alucinaciones de IA.

¿Es Jev un reemplazo para un LLM?

No. Jev toma decisiones tipadas rápidas, no escribe texto, no razona paso a paso ni mantiene una conversación. Muchos equipos lo combinan con un LLM, usando Jev para el paso de clasificar y enrutar, de forma similar a como funciona en la práctica una división entre un sistema basado en reglas y un agente de IA.

¿En qué se diferencia Jev de un agente de servicio al cliente de IA normal?

Jev es infraestructura: una pieza de decisión que conectas a tu propio código. Un producto de servicio al cliente con IA como eesel es el compañero de equipo terminado que toma esas decisiones y ejecuta la acción dentro de tu helpdesk. Incluso puedes manejarlo desde una terminal con la CLI de eesel.

Share this article

Alicia Kirana Utomo

Article by

Alicia Kirana Utomo

Kira is a writer at eesel AI with a Computer Science background and over a year of hands-on experience evaluating AI-powered customer service tools. She focuses on breaking down how helpdesk platforms and AI agents actually work so that support teams can make better buying decisions.

Related Posts

All posts →
Banner principal de la reseña de Grok 4.7 con el logo de Grok sobre un fondo oscuro y abstracto de cómputo
Trending

Reseña de Grok 4.7: ¿el modelo económico de xAI es realmente bueno?

Una reseña práctica de Grok 4.7: en qué destaca, dónde todavía pierde frente a Fable 5.1 y GPT-5.6 Sol, los precios reales, el recargo de la variante Fast y quién debería usarlo realmente.

Rama Adi NugrahaRama Adi NugrahaSep 23, 2026
Banner principal del lanzamiento de Grok 4.7 con el logotipo de Grok sobre un fondo oscuro y abstracto de cómputo
Trending

Grok 4.7: lo que el nuevo modelo puntero de xAI realmente cambia

Un vistazo claro a Grok 4.7: qué hay de nuevo frente a Grok 4.6, las especificaciones, los precios reales y el recargo de la variante Fast, cómo se compara con GPT-5.6 Sol y Fable 5.1, y para quién es.

Alicia Kirana UtomoAlicia Kirana UtomoSep 23, 2026
Banner principal de alternativas a Grok 4.7 con el logotipo de Grok sobre un fondo abstracto oscuro de cómputo
Trending

Alternativas a Grok 4.7: 6 modelos que vale la pena comparar en 2026

Las mejores alternativas a Grok 4.7 en 2026, comparadas por precio, contexto, pesos abiertos y en qué es realmente buena cada una, además de cómo saber si de verdad necesitas un modelo.

Kurnia Kharisma Agung SamiadjieKurnia Kharisma Agung SamiadjieSep 23, 2026
Banner principal de precios de Grok 4.7 con el logotipo de Grok y una tabla de costes de tokens de la API
Trending

Precios de Grok 4.7: costes de tokens de la API, niveles y el recargo Fast

Un desglose completo de los precios de Grok 4.7: las tarifas de $2 / $6 por token, el precipicio de contexto largo en 200k, los medidores de llamadas a herramientas que la mayoría de modelos de coste pasan por alto, el recargo Fast, dónde se puede comprar realmente y cómo se compara con GPT-6 Sol y Fable 5.1.

Kurnia Kharisma Agung SamiadjieKurnia Kharisma Agung SamiadjieSep 23, 2026
Ilustración abstracta de un agente de IA conectado a una pila de sistemas mediante API
Guides

Integración de API para agentes de IA: qué estás realmente conectando

Una integración de API para agentes de IA nunca es un solo endpoint. Aquí está la superficie real del trabajo, por qué los triggers se comen la mitad del esfuerzo y cómo delimitar el alcance antes de empezar.

Rama Adi NugrahaRama Adi NugrahaSep 8, 2026
Una persona demostrando un flujo de trabajo en su Mac mientras Codex lo graba como una habilidad reutilizable y un agente de IA lo reproduce
Guides

Grabación y reproducción de OpenAI Codex, explicado

Qué hace realmente la grabación y reproducción de OpenAI Codex: demuestra un flujo de trabajo en tu Mac una vez, y Codex lo convierte en una habilidad reutilizable. Cómo funciona, sus límites y dónde encaja.

Alicia Kirana UtomoAlicia Kirana UtomoJun 22, 2026
Ilustración del modelo de IA multimodal MiniMax M3 con entradas de imagen, audio y video
Guides

¿Qué es MiniMax M3? El modelo open-weight explicado

¿Qué es MiniMax M3? Una guía directa al modelo open-weight de MiniMax: su contexto de 1M con atención dispersa, benchmarks reales, precios y qué significa para los equipos de soporte.

Alicia Kirana UtomoAlicia Kirana UtomoJun 20, 2026
Texto alternativo de la imagen
Guides

Una reseña detallada de Claude Cowork: Características, precios y limitaciones

Claude Cowork de Anthropic lleva las capacidades de los agentes de IA al escritorio, permitiendo a los usuarios automatizar tareas mediante la gestión de archivos y la navegación web. Esta reseña explora sus características, rendimiento y limitaciones.

Katelin TeenKatelin TeenFeb 6, 2026
Texto alternativo de la imagen
Guides

Nuestra reseña completa de GPT 5.3 Codex: Una nueva era para la IA agéntica

Una reseña profunda de GPT 5.3 Codex. Analizamos las nuevas capacidades agénticas, el rendimiento en pruebas de referencia, los precios y las limitaciones como la falta de acceso a la API.

Stevia PutriStevia PutriFeb 6, 2026

Listo para contratar tu companero de IA?

Configuracion en minutos. Sin tarjeta de credito requerida.

Comienza gratis