Jev se vuelve viral de repente: no sabe chatear, no escribe código, solo hace juicios

By: mp.weixin.qq.com|2026/09/21 00:32:00

Autor: Zhu Xueying

En los últimos días, un modelo de IA algo inusual ha estado en boca de todos.

Se llama Jev.

No sabe chatear, no escribe código, ni siquiera genera largas respuestas como ChatGPT. Solo hace una cosa: emitir juicios.

Pero este modelo, que parece tener "la mitad de las capacidades recortadas", ha ganado popularidad de repente en el círculo de desarrolladores.

Alguien lo utilizó para analizar 724 anuncios en tiempo real en 40 segundos, haciendo un total de 8724 juicios; alguien más lo conectó a Claude Code, específicamente para limpiar contextos innecesarios; y otros lo han utilizado como "árbitro" para verificar si las tareas se han completado realmente. LangChain también ha comenzado a probar a Jev como evaluador de agentes.

Lo más sorprendente es la velocidad y el precio.

En las pruebas publicadas por TypeSafe, Jev logró aumentar la velocidad hasta aproximadamente 193.6 veces y reducir los costos hasta 444.6 veces. La entrada de cada millón de tokens cuesta solo 0.042 dólares, y la salida de tokens es incluso gratuita.

¿Por qué un modelo que parece tener menos capacidades ha ganado popularidad?

Porque en la era de los agentes, lo que realmente necesita la IA puede no ser solo "reflexión profunda", sino juicios masivos, rápidos y baratos: ¿qué hacer a continuación?, ¿qué herramienta utilizar?, ¿se ha completado realmente la tarea? Más importante aún, estos juicios necesitan ser realizados por la IA en segundo plano, sin que una persona tenga que estar siempre frente a la pantalla. Jev se enfoca en estas pequeñas decisiones que pueden ocurrir millones de veces al día.

Más interesante aún, el fundador del modelo Jev, Diogo Almeida, ha participado en RLHF y ahora comienza a reflexionar sobre RLHF: este método de entrenamiento que hizo que ChatGPT fuera útil puede no ser adecuado para que la IA realmente se automatice.

Hace más de un mes, Almeida dio una charla. Ahora, al mirar hacia atrás, esa charla casi se convierte en el "manual de instrucciones" de Jev.

La IA puede hacer matemáticas avanzadas, ¿por qué no puede manejar el servicio al cliente?

El currículum de Diogo Almeida es bastante especial.

Trabajó en OpenAI y participó en el desarrollo de GPT-4, ChatGPT y trabajos relacionados con InstructGPT/RLHF. En otras palabras, ayudó a construir uno de los paradigmas de entrenamiento más importantes de los grandes modelos actuales.

Pero en esa charla, comenzó bromeando sobre sí mismo, diciendo que era uno de los pocos que criticaba abiertamente a ChatGPT dentro de OpenAI.

El tema de su charla fue más directo: ¿Qué sigue después de RLHF?

Diogo planteó una pregunta que parecía contradictoria.

Los grandes modelos de hoy pueden desafiar problemas matemáticos muy difíciles, y el código, el razonamiento y varios benchmarks están en constante ascenso.

Sin embargo, en muchos negocios que las empresas realmente quieren automatizar, las personas siguen siendo necesarias.

Por ejemplo, el servicio al cliente.

Dejar que la IA busque información, resuma documentos y redacte respuestas no es un problema.

Pero si se le pide a la IA que decida por sí misma: ¿devolver este dinero o no? ¿Debería compensar a este usuario?

Las empresas se vuelven cautelosas de inmediato.

Aparentemente, estas cosas son mucho más simples que las matemáticas avanzadas, ¿por qué no se atreven a dejarlas en manos de la IA?

La respuesta de Diogo es muy simple: La IA de hoy es increíble en asistencia, no en automatización.

La IA de hoy es muy buena ayudando, pero aún no puede completar el trabajo por sí sola.

Estas dos cosas parecen diferir solo un poco, pero en realidad son completamente diferentes.

Por muy potente que sea Claude Code, normalmente todavía estás sentado frente a la computadora. Escribe código, tú miras; modifica archivos, tú revisas; si se equivoca, le pides que lo corrija.

Así que, en la opinión de Diogo, Claude Code sigue perteneciendo a la "era de asistencia" iniciada por ChatGPT.

¿Qué es la verdadera automatización?

La gente no está presente.

La IA juzga y ejecuta por sí misma en segundo plano, lo que puede ocurrir decenas de miles o incluso millones de veces al día, y tú ni siquiera verás lo que ha hecho.

Surge la pregunta: ¿por qué la IA de hoy es tan inteligente, pero aún depende de las personas?

Diogo apunta a algo que conoce muy bien: RLHF.

Cuando entrenamos a la IA, metemos a las personas en el circuito

Esto es un poco irónico.

Porque RLHF es precisamente una de las rutas tecnológicas que Diogo ayudó a impulsar.

La lógica básica de RLHF no es complicada: recopilar las preferencias humanas y hacer que el modelo se ajuste cada vez más a esas preferencias.

Así que Diogo dio una explicación muy directa en su charla: ¿por qué los grandes modelos de hoy siempre necesitan a alguien en el circuito?

Porque cuando los entrenamos, literalmente metemos a las personas en ese circuito.

El modelo desde el principio aprende: ¿qué tipo de respuestas prefieren las personas?

Esto también explica una característica que ya conocemos muy bien de los grandes modelos: incluso si no saben, a menudo pueden sonar muy convincentes.

Diogo dio un ejemplo bastante gracioso en el evento.

Alguien envió a ChatGPT una grabación de un pedo, diciéndole que era una canción que había creado y pidiéndole que la evaluara "sinceramente y con franqueza".

El resultado fue que ChatGPT elogió la canción, diciendo que era una música ambiental con una atmósfera inquietante y extraña.

Diogo incluso resumió con una frase: "Prometer en exceso es una característica".

Prometer en exceso no es un error, es una característica.

Para los productos de chat, esto no es necesariamente mortal. Los usuarios todavía están frente a la pantalla y pueden corregir errores.

Pero un sistema de automatización real es completamente diferente.

La máquina no se preocupa por si tu respuesta suena bien, solo necesita saber dos cosas: ¿qué hacer y cuánta confianza tienes?

Esto también explica por qué Jev, que se lanzó más de un mes después, parece tan inusual.

Así que, Jev simplemente no deja que la IA "hable"

Los modelos grandes normales, incluso si al final solo necesitan responder "A o B", a menudo pasan por el proceso de generar tokens.

Jev elimina directamente esta parte.

Actualmente, se enfoca en tres cosas:

  • Noul, responde Sí o No;

  • Choice, elige una opción de varias;

  • Score, califica según un estándar.

Luego devuelve directamente el juicio y la probabilidad.

No te escribe un pequeño ensayo, ni te acompaña en una conversación.

La latencia de extremo a extremo publicada oficialmente es de solo 70 a 500 milisegundos, lo que es de 20 a 200 veces más rápido que los modelos de vanguardia, y el precio es de 40 a 400 veces más bajo.

Pero lo realmente clave no es "rápido", sino la probabilidad posterior.

Para ello, TypeSafe propuso un nuevo método de entrenamiento: RLCD, Aprendizaje por Refuerzo para Decisiones Calibradas.

El problema que busca resolver es muy realista: si la IA te dice que hay un 80% de probabilidad de que algo ocurra, ¿puedes confiar en ese 80%?

En un escenario ideal, un grupo de cosas que el modelo juzga con un 80% de probabilidad debería ocurrir aproximadamente un 80% de las veces.

Esto es muy importante en sistemas de automatización.

Un 99% de confianza puede ejecutarse directamente.

Un 51% de confianza puede ser enviado a un modelo más grande y costoso, o incluso a una persona.

El verdadero problema no es que la IA no sepa, sino que la IA no sabe que no sabe.

Así que lo que Jev realmente quiere cambiar es el objeto de salida de la IA.

Las respuestas generadas por ChatGPT estaban principalmente destinadas a ser vistas por humanos. Los juicios y probabilidades que ofrece Jev están destinados a ser entregados directamente a software.

En la era de los agentes, puede que no necesitemos un cerebro más grande

Esto también explica por qué Jev ha ganado popularidad ahora.

Porque cuando los agentes realmente funcionan, generarán una gran cantidad de pequeños juicios:

¿Qué herramienta llamar a continuación? ¿Qué botón presionar en esta página web? ¿Esta información sigue siendo útil? ¿Se ha completado la tarea? ¿Es necesario revisar el resultado?

Cada una de estas preguntas no es difícil por sí sola, pero un agente puede necesitar hacer juicios cientos de miles o millones de veces al día.

Si cada vez llamas al modelo más potente, gastando unos segundos en "reflexionar profundamente" y luego escupiendo un gran número de tokens, los costos y la latencia aumentarán rápidamente.

Jev quiere captar esta capa.

Dejar que Jev maneje muchas decisiones pequeñas y de alta frecuencia, y dejar las tareas que realmente requieren razonamiento complejo a los grandes modelos.

Por eso TypeSafe llama a Jev el Modelo del Sistema Uno.

Este concepto proviene de "Sistema 1" y "Sistema 2" de Daniel Kahneman: uno se encarga de juicios rápidos e intuitivos, y el otro de pensamientos lentos y complejos.

Jev incluso toma su nombre del "paradoja de Jevons":

Cuando un recurso se vuelve cada vez más barato, las personas pueden no usarlo menos, sino más.

Si llamar a la IA es muy caro, solo la usarás en los lugares más importantes.

Pero, ¿qué pasa si el juicio de la IA es tan barato que casi se puede ignorar?

Un correo electrónico, un registro, una llamada a una herramienta, un botón de página web, cada paso que ejecuta un agente podría incluir un juicio de IA.

Por supuesto, es demasiado pronto para decir que Jev representa la próxima generación de IA.

Lo que llama "cero ilusiones" significa más que no salirse del tipo de respuesta establecido, no significa que no pueda equivocarse; los extremos de 193.6 veces y 444.6 veces provienen principalmente de las pruebas de TypeSafe.

Pero lo que realmente merece la pena observar sobre el repentino éxito de Jev puede no ser si puede desafiar a GPT o Claude.

Sino que una persona que participó en la creación de ChatGPT está volviendo a cuestionar una pregunta más fundamental:

En los últimos años, toda la industria ha estado pensando en cómo hacer que la IA piense más tiempo y hable más.

Pero si lo que realmente se necesita en el futuro son miles de millones de juicios entre máquinas, ¿por qué cada vez la IA tiene que "decir un párrafo" primero?

ChatGPT enseñó a las máquinas cómo hablar con las personas.

Y lo que Jev apuesta en el siguiente paso es: cuando las personas ya no están frente a la pantalla, ¿puede la máquina tomar decisiones por sí misma?

Precio de --

--
--
--

Este contenido se ofrece únicamente con fines informativos generales y no constituye un asesoramiento financiero, de inversión, legal ni fiscal. Cualquier evento, recompensa, promoción en línea o información relacionada que se mencione en el presente documento no debe considerarse como una recomendación, solicitud o invitación a comprar, vender, operar o de negociar de otra manera con cualquier criptoactivo. Los criptoactivos son sumamente volátiles y pueden provocar pérdidas. La disponibilidad de los servicios, productos y eventos relacionados de WEEX puede variar según la región. Tienes la responsabilidad de asegurarte de que tu participación esté de acuerdo con las leyes y regulaciones locales vigentes.

Te puede gustar

iconiconiconiconiconiconicon
Atención al cliente:@weikecs
Cooperación empresarial:@weikecs
Trading cuantitativo y CM:[email protected]
Programa VIP:[email protected]