JEV y el Paradigma System One: Por qué generar texto token por token es un desperdicio para tomar decisiones

JEV y el Paradigma System One: Por qué generar texto token por token es un desperdicio para tomar decisiones

Si llevas los últimos dos años integrando modelos de lenguaje en aplicaciones reales, seguro has sentido esa incomodidad en el estómago cuando miras el flujo de tu sistema: tienes un ticket de soporte, una transacción financiera o una solicitud de usuario, y todo lo que necesitas saber es si es urgente o no, o a cuál de cinco categorías pertenece.

¿Y qué es lo que solemos hacer? Yo antes hacía lo de siempre: armaba un prompt kilométrico, le rezaba al modelo para que respondiera únicamente en formato JSON, pagaba por cientos de tokens de entrada, esperaba varios segundos mientras el decodificador escupía token por token de forma autorregresiva (así funcionan por dentro los Transformers generativos, como explico en Attention Is All You Need explicado), y cruzaba los dedos para que la librería de validación no reventara por una coma mal puesta.

Parce, seamos honestos: usar un LLM generativo de 70.000 millones de parámetros para tomar una decisión discreta es matar un mosquito con un misil balístico. Es lento, es costoso y, desde el punto de vista arquitectónico, no tiene sentido.

En septiembre de 2026, la empresa TypeSafe AI (fundada por Alex Graveley, una de las mentes detrás del GitHub Copilot original) puso sobre la mesa un enfoque que cambia por completo este paradigma: JEV y los llamados Modelos System One.

En este artículo te voy a desglosar qué es JEV por debajo del capó, por qué su forma de calcular probabilidades le da sopa y seco a la generación autorregresiva tradicional, cómo funcionan sus primitivas tipadas y cuáles son sus límites reales cuando lo sacas de su zona de confort.


1. La teoría de fondo: Sistema 1 vs. Sistema 2 en Inteligencia Artificial

El nombre System One no es una casualidad de marketing; rinde homenaje directo a la teoría del pensamiento dual propuesta por el psicólogo Daniel Kahneman:

  • Sistema 2 (Deliberativo y secuencial): Es el pensamiento lento, analítico y consciente. Cuando calculas mentalmente cuánto es 37×4837 \times 48, tienes que ir paso a paso. Los LLMs generativos tradicionales (como Claude 3.7 Sonnet o los modelos con thinking tipo OpenAI) operan en este nivel: son secuenciales, tardan tiempo y construyen su razonamiento paso a paso.
  • Sistema 1 (Intuitivo e instantáneo): Es la respuesta inmediata, reactiva y subconsciente. Si vas manejando y un carro frena de golpe frente a ti, no te pones a deducir las leyes de la fricción de Newton; clavas el freno en 200 milisegundos.
Dimensión / CriterioModelos Sistema 2 (LLMs)Modelos Sistema 1 (JEV)
Tipo de InferenciaInferencia autorregresiva (token por token)Proyección directa no generativa (pase único)
Latencia Observada1 a 30 segundos30 a 200 ms
Formato de SalidaTexto libre / JSONPrimitivas tipadas (Choice, Noul, Score)
Objetivo / CalibraciónOptimizado para elocuencia y coherenciaCalibrado con reglas Brier / RLCD

En la gran mayoría de flujos de software (triaje de eventos, clasificación de textos, moderación de contenido, enrutamiento en grafos agénticos), no necesitas que el modelo te recite un ensayo ni que sea elocuente. Necesitas que evalúe el estado, proyecte una distribución de probabilidad sobre tus opciones y te dé una respuesta tipada en milisegundos.


2. Anatomía de JEV: Estado y Primitivas Tipadas

A diferencia de un LLM tradicional que recibe una conversación en texto libre y devuelve texto libre, JEV opera como una función pura de software:

Recibe como entrada un diccionario estructurado llamado state (que puede contener campos de texto, números o metadatos de hasta 32.000 tokens) y evalúa concurrentemente una o más preguntas declarativas construidas sobre tres primitivas fundamentales:

---
title: EVALUACIÓN DE ESTADO Y PRIMITIVAS TIPADAS JEV
---
flowchart TD
    STATE["<strong>STATE (JSON)</strong><br/><code>{&quot;texto&quot;: &quot;...&quot;, ...}</code>"] -->|Pase hacia adelante<br/>Un solo viaje| MOTOR["<strong>MOTOR JEV</strong><br/><em>Proyección directa</em>"]
    
    MOTOR --> CHOICE["<strong>Choice (Opciones)</strong><br/>Distribución de probabilidad<br/>sobre hasta 255 opciones"]
    MOTOR --> NOUL["<strong>Noul (Booleano)</strong><br/>Probabilidad directa<br/>calibrada (0.0 a 1.0)"]

1. Choice: Selección categórica de alto volumen

Permite definir una pregunta junto con un catálogo cerrado de hasta 255 alternativas discretas. A diferencia de los clasificadores BERT antiguos —donde añadir una categoría implicaba reentrenar el modelo con miles de ejemplos—, en JEV pasas las opciones y sus criterios en tiempo de ejecución (zero-shot). El modelo no “escribe” el nombre de la opción: proyecta una distribución Softmax sobre el espacio latente y te devuelve la opción ganadora con su vector de confianza.

2. Noul: La decisión binaria honesta

Un selector booleano (true/false) que devuelve la probabilidad condicional de cumplimiento. Se utiliza para compuertas lógicas inmediatas: ¿este ticket requiere escalamiento?, ¿este texto infringe la política de seguridad?, ¿hubo falla real?

3. Score: Evaluación continua sobre rúbricas

Emite un valor escalar continuo entre 0.0 y 1.0 evaluado contra una rúbrica cualitativa. Es ideal para evaluar la calidad de un resumen, el nivel de agresividad en una conversación o la completitud de una respuesta.

[!IMPORTANT] Type Safety por construcción: Como la arquitectura evalúa directamente logits sobre las primitivas y no depende de decodificación de texto, la tasa de error sintáctico es matemáticamente cero. No existen comas faltantes, ni llaves sin cerrar, ni campos inventados fuera de tu esquema.


3. El secreto bajo el capó: RLCD y calibración estadística

Cualquiera que haya intentado usar las probabilidades de un LLM tradicional (como los logprobs que expone la API de OpenAI) sabe que son una mentira piadosa. Los modelos generativos comerciales están alineados con RLHF (Reinforcement Learning from Human Feedback), una técnica diseñada para que el modelo suene seguro, elocuente y convincente ante un juez humano. El resultado es que los LLMs son arrogantes: te dicen una barbaridad con un 99% de confianza aparente.

JEV rompe con esto mediante una metodología llamada RLCD (Reinforcement Learning for Calibrated Decisions).

Bajo RLCD, el modelo no se optimiza para complacer a un humano, sino para minimizar Reglas de Puntuación Estrictamente Propias (Strictly Proper Scoring Rules), como la pérdida cuadrática de Brier:

BS=1N∑i=1N(pi−yi)2BS = \frac{1}{N} \sum_{i=1}^N (p_i - y_i)^2

Donde pip_i es la probabilidad reportada por el modelo y yiy_i es el resultado binario real.

Matemáticamente, la única forma en que una red neuronal minimiza la pérdida de Brier a largo plazo es diciendo la verdad estadística. Si JEV te dice que una opción tiene una probabilidad de 0.85, significa que en el 85% de los casos idénticos esa opción es efectivamente la correcta.

{
  "type": "line",
  "title": "CALIBRACIÓN PROBABILÍSTICA: JEV VS. LLM CONVENCIONAL",
  "subtitle": "Confianza reportada por el modelo vs. Exactitud real comprobada",
  "unit": "%",
  "max": 100,
  "categories": ["0%", "20%", "40%", "60%", "80%", "100%"],
  "series": [
    {
      "name": "Modelo Calibrado (JEV con RLCD)",
      "data": [0, 20, 40, 60, 80, 100]
    },
    {
      "name": "LLM Convencional (RLHF Sobreconfiado)",
      "data": [5, 15, 28, 42, 55, 62]
    }
  ],
  "colors": ["#00ff9d", "#fc4269"]
}

¿Por qué esto le importa a un ingeniero de software?

Porque te permite implementar automatización selectiva con presupuesto de error.

Imagina que en tu producto tienes una regla de negocio inquebrantable: “No podemos tolerar más de un 3% de falsos positivos en producción”.

  • Con un LLM generativo, tendrías que adivinar umbrales o auditarlo todo a ciegas.
  • Con un modelo calibrado como JEV, puedes poner una compuerta matemática determinista: si la confianza de la predicción es ≥0.90\ge 0.90, la solicitud pasa directo a base de datos de forma desatendida; si cae por debajo, se desvía a una cola de revisión humana.

En pruebas de estrés independientes (como los benchmarks de Deußer, Sparrenberg y Sifa sobre más de 340.000 solicitudes), JEV demostró que permite automatizar de forma segura hasta el 70% del volumen operativo manteniendo un margen de error inferior al 5%, una cifra inalcanzable para modelos abiertos tradicionales.


4. La Paradoja de Jevons: De dónde viene su nombre

El nombre del modelo es un guiño directo a la Paradoja de Jevons, formulada en 1865 por el economista inglés William Stanley Jevons: cuando una innovación tecnológica aumenta la eficiencia con la que se utiliza un recurso, el consumo total de ese recurso no disminuye, sino que se dispara masivamente porque se vuelve accesible para infinidad de nuevos usos.

Con la inteligencia artificial ocurre exactamente lo mismo:

  1. Cuando clasificar una consulta te cuesta $0,02 dólares y tarda 3 segundos con un LLM generativo, te limitas a usarlo únicamente en las tareas más críticas de tu arquitectura.
  2. Cuando clasificar esa misma consulta pasa a costar una fracción minúscula de centavo y tarda 40 a 70 milisegundos, de repente puedes meter inteligencia semántica en todos los rincones de tu software: en el middleware de tu API, en el enrutamiento de consultas SQL, en la validación de formularios en tiempo real o en la priorización de eventos en streaming.

5. Dónde se estrella JEV: Sus patologías conocidas

Para no caer en fanatismos, hay que tener muy claro para qué NO sirve JEV. Al ser un modelo puramente de Sistema 1, carece de mecanismos de razonamiento iterativo:

  1. Incapacidad total para matemáticas y fechas: Si le pides a JEV que clasifique si una compra aplica para devolución bajo la regla “devoluciones válidas antes de 30 días”, calculando la diferencia entre el 12 de marzo y el 8 de abril, el modelo colapsa. No sabe restar días ni hacer cálculos secuenciales. Esas tareas pertenecen al Sistema 2.
  2. Descentramiento en la primitiva Noul: La comunidad técnica ha documentado que el umbral de decisión para la primitiva booleana a veces no está centrado exactamente en 0.5. En tareas especializadas con sesgo de clase, es indispensable calibrar el umbral óptimo empíricamente con un pequeño conjunto de validación antes de congelarlo en producción.
  3. No escribe explicaciones: Si tu cliente necesita que el sistema le devuelva un párrafo explicando el porqué de la decisión, JEV no te va a servir. Su trabajo termina en la emisión de las probabilidades estructuradas.

6. El patrón arquitectónico: JEV es solo una capa, no el sistema completo

Uno de los errores más comunes cuando la gente descubre un modelo nuevo es querer resolver absolutamente todo con él. Pero la clave de una arquitectura moderna en 2026 es el desacoplamiento por capas: JEV o Laya no están diseñados para ser una bala de plata monolítica, sino un componente especializado dentro de una cadena de decisiones (si quieres ver cómo se compara con su alternativa open source, revisa JEV vs. Laya).

En mis sistemas me gusta estructurarlo en tres capas bien definidas:

---
title: PATRÓN ARQUITECTÓNICO EN TRES CAPAS
---
flowchart TD
    REQ["<strong>Solicitud / Evento</strong>"] --> CAPA0["<strong>CAPA 0: REGLAS DURAS Y LÓGICA PURA</strong><br/><em>Regex, filtros, diccionarios, reglas de negocio</em><br/>(Latencia: 0 ms | Costo: $0)"]
    
    CAPA0 --> Q1{"¿Es un caso trivial?"}
    
    Q1 -- "SÍ" --> CODE["<strong>Resuelto por Código</strong>"]
    Q1 -- "NO" --> CAPA1["<strong>CAPA 1: SYSTEM 1 (JEV / Laya)</strong><br/><em>Triaje semántico</em><br/>(Latencia: ~30-70 ms | Costo ínfimo)"]
    
    CAPA1 --> Q2{"¿Alta confianza (≥ 0.85)?"}
    
    Q2 -- "SÍ" --> EXEC["<strong>Ejecución Directa</strong><br/>Base de datos / API"]
    Q2 -- "NO (&lt; 0.85 o duda)" --> CAPA2["<strong>CAPA 2: SYSTEM 2 (LLMs)</strong><br/><em>Modelos Flash o Generativos</em><br/>(Razonamiento profundo)"]
    
    CAPA2 --> VERIF["<strong>Decisión Verificada</strong>"]
  1. Capa 0 (Lógica determinista y reglas duras): Todo lo que puedas resolver con código tradicional (validaciones de esquema, fechas, cálculos matemáticos, permisos de usuario o normalización de abreviaturas con diccionarios), resuélvelo en código. No gastes un solo ciclo de IA en cosas que un if/else o un hash map resuelven en microsegundos y con 100% de certeza. Es la misma lógica de contratos y reglas deterministas que defiendo en desarrollo modular con IA.
  2. Capa 1 (Inferencia System One con JEV o Laya): Aquí entra la inteligencia semántica rápida. El modelo procesa la intención, clasifica categorías, evalúa rúbricas continuas y escupe probabilidades calibradas en milisegundos. Si la confianza es alta, la orden o ticket se ejecuta automáticamente sin intervención humana.
  3. Capa 2 (Verificación con LLMs o agentes generativos): Si JEV detecta una inconsistencia lógica, si la confianza cae por debajo del umbral de seguridad, o si el usuario necesita una explicación redactada en lenguaje natural, la consulta se deriva a un modelo generativo (como Gemini 3.8 Flash) o a un operador humano. Este patrón lo puse a prueba en Clasificar Texto Sucio a Gran Escala.

Este desacoplamiento no solo reduce tu factura de cómputo en más de un 80%, sino que blinda tu aplicación: las reglas de negocio garantizan que nada viole las políticas de la empresa, JEV absorbe el 70-80% del volumen a velocidad de red, y los LLMs pesados solo se despiertan cuando de verdad hay que pensar.


Fuentes y lecturas recomendadas

Ideas, herramientas y lecturas de IA que merecen ser probadas

EXPLORAR SILO COMPLETO→