Jev突然爆火刷屏:不会聊天,不写代码,只做判断
作者:朱雪莹
这两天,一个有点反常的AI模型突然刷屏了。
它叫 Jev。
不会聊天,不写代码,甚至不会像ChatGPT一样给你生成一大段答案。它只干一件事:做判断。
但就是这样一个看起来"能力被砍了一大半"的模型,却突然在开发者圈火了。
有人用它40秒分析724条实时广告,总共做出8724次判断;有人把它接进Claude Code,专门清理没用的上下文;还有人让它给AI Agent当"裁判",检查任务到底有没有真的完成。LangChain也已经开始测试Jev作为Agent评估器的表现。
更夸张的是速度和价格。
TypeSafe公布的测试中,Jev最高提速约193.6倍,成本最多降低444.6倍。输入每百万Token只要0.042美元,输出Token甚至免费。
一个能力看起来更少的AI,为什么反而火了?
因为到了Agent时代,AI真正需要的可能不只是"深思熟虑",还有海量、快速、便宜的判断:下一步做什么、该调用哪个工具、任务到底完成没有。更重要的是,这些判断未来需要AI自己在后台完成,不再需要人一直坐在屏幕前盯着。Jev看上的,就是这些每天可能发生几百万次的小决定。
更有意思的是,Jev模型创始人Diogo Almeida,恰恰参与过RLHF,而现在他开始反思RLHF:这套让ChatGPT变得好用的训练方式,可能并不适合AI真正走向自动化。
一个多月前,Almeida做过一场演讲。现在回头再看,那场演讲几乎就是Jev的"思想说明书"。
AI都会做高等数学了,为什么还做不好客服?
Diogo Almeida的履历很特殊。
他曾在OpenAI工作,是GPT-4、ChatGPT以及InstructGPT/RLHF相关工作的参与者。也就是说,他曾亲手参与构建了今天大模型最重要的一套后训练范式。
但在那场演讲里,他上来就调侃自己,是OpenAI内部少数几个公开"黑"ChatGPT的人之一。
他的演讲主题更加直接:What's Next After RLHF?
Diogo先提出了一个看起来很矛盾的问题。
今天的大模型已经可以挑战非常难的数学题,代码、推理和各种benchmark一路往上走。
可到了很多企业真正想自动化的业务里,人却始终拿不掉。
比如客服。
让AI查资料、总结文档、起草回复,没问题。
但如果让AI自己决定:这笔钱到底退不退?这个用户要不要赔偿?
企业一下就谨慎起来了。
明明这些事情看起来比高等数学简单得多,为什么反而不敢交给AI?
Diogo给出的答案很简单:Today's AI is incredible at assistance, not automation.
今天的AI很会帮你干活,却还不太能自己把活干完。
这两件事看起来只差一点,实际上完全不同。
Claude Code再强,你通常还是坐在电脑前。它写代码,你看;它改文件,你检查;错了,你再让它改。
所以在Diogo看来,Claude Code依然属于ChatGPT开启的"协助时代"。
真正的自动化是什么?
人根本不在场。
AI在后台自己判断、自己执行,一天可能运行几十万甚至几百万次,你甚至永远不会看到它做了什么。
问题也就来了:为什么今天的AI这么聪明,却偏偏离不开人?
Diogo把矛头指向了一个自己非常熟悉的东西------RLHF。
我们训练AI的时候,就把人塞进了回路里
这件事多少有点讽刺。
因为RLHF,恰恰是Diogo当年参与推动的技术路线之一。
RLHF的基本逻辑其实不复杂:收集人的偏好,然后让模型越来越符合人的偏好。
所以Diogo在演讲里给出了一个非常直白的解释:为什么今天的大模型总需要有人在回路里?
因为训练它的时候,我们字面意义上就把人塞进了那个回路里。
模型从一开始就在学习:什么样的回答,人更喜欢?
这也解释了大模型一个我们已经非常熟悉的特点------哪怕不知道,它也经常能说得特别像那么回事。
Diogo在现场举了一个很损的例子。
有人给ChatGPT发了一段放屁的录音,告诉它这是自己创作的一首音乐,请它"真诚、坦率"地评价。
结果ChatGPT一本正经地夸了起来,说这是一首很有阴森、诡异氛围感的环境音乐。
Diogo甚至用了一句话总结:"Overpromising is a feature."
过度承诺不是Bug,是feature。
对于聊天产品来说,这未必致命。用户还在屏幕前,错了可以纠正。
但真正的自动化系统完全不同。
机器不关心你的回答好不好听,它只需要知道两件事:到底该怎么做,以及你到底有多大把握?
这也就解释了,为什么一个多月后发布的Jev,看起来会如此反常。
所以,Jev干脆不让AI"说话"了
普通大模型哪怕最终只需要回答"A还是B",往往也要经过生成Token的过程。
Jev直接把这部分砍掉。
它目前主要做三件事:
Noul,回答Yes还是No;
Choice,从几个选项里选一个;
Score,按照标准打分。
然后直接返回判断和概率。
不给你写小作文,也不陪你聊天。
官方公布的端到端延迟低至70---500毫秒,相比前沿模型快20---200倍,价格低40---400倍。
但真正关键的,其实不是"快",是后面那个概率。
为此,TypeSafe提出了一套新的训练方法:RLCD,Reinforcement Learning for Calibrated Decisions,校准决策强化学习。
它想解决的问题非常现实:如果AI告诉你一件事有80%的概率发生,这个80%到底能不能信?
理想情况下,模型判断为80%概率的一批事情,最后就应该大约有80%真的发生。
这在自动化系统里非常重要。
99%的把握,可以直接执行。
51%的把握,可以扔给更强、更贵的大模型,甚至转给人。
真正麻烦的不是AI不知道,是AI不知道自己不知道。
所以Jev真正想改变的,是AI输出的对象。
过去ChatGPT生成的答案,主要是给人看的。Jev给出的判断和概率,则是准备直接交给软件用的。
Agent时代,可能需要的不是一个更大的大脑
这也解释了为什么Jev偏偏在现在火了。
因为Agent真正运行起来以后,会产生海量的小判断:
下一步调用哪个工具?这个网页该点哪个按钮?这条信息还有没有用?任务到底完成没有?结果要不要重新检查?
这些问题单个看都不难,但一个Agent一天可能需要判断几十万、几百万次。
如果每一次都叫最强的大模型,花几秒钟"深思熟虑",再吐出一大段Token,成本和延迟很快就上去了。
Jev想抢的,就是这一层。
大量高频的小决定交给Jev,真正需要复杂推理的任务,再交给大模型。
这也是为什么TypeSafe把Jev叫做 System One Model。
这个概念来自丹尼尔·卡尼曼的"系统1"和"系统2":一个负责快速、直觉式的判断,一个负责慢速、复杂的思考。
Jev甚至连名字都来自"杰文斯悖论":
一种资源变得越来越便宜,人们未必会少用,反而可能用得更多。
如果调用一次AI很贵,你只会把它用在最重要的地方。
但如果一次AI判断便宜到几乎可以忽略呢?
一封邮件、一条日志、一次工具调用、一个网页按钮、Agent执行的每一步,都可能加入一次AI判断。
当然,现在就说Jev代表下一代AI,还太早。
它所谓的"零幻觉",更多意味着不会跳出规定的答案类型乱编,不代表不会选错;193.6倍、444.6倍这样的极端数据,也主要来自TypeSafe自己的测试。
但Jev这次爆火真正值得关注的,可能不是它能不能挑战GPT或者Claude。
而是一个参与造出ChatGPT的人,正在重新追问一个更底层的问题:
过去几年,整个行业都在想,怎样让AI想得更久、说得更多。
但如果未来真正需要的是几十亿次机器之间的判断,AI为什么每一次都要先"说一段话"?
ChatGPT教会了机器怎么和人说话。
而Jev押注的下一步是:当人不再坐在屏幕前,机器能不能自己做决定?
-- 价格
本内容仅供参考,不构成任何金融、投资、法律或税务建议。文中提及的任何活动、奖励、线上活动或相关信息,不应被视为对购买、出售或交易任何加密资产的推荐、招揽或邀请。加密资产具有高波动性,存在价值损失风险。WEEX服务、产品及相关活动的可用性可能因地区而异。用户在参与前有责任确保符合当地适用法律法规。
猜你喜欢

2026年9月 WEEX 合约交易奖励:最高赢取 10,000 USDT

美股散户看空比例升至53%,机构称接近反弹区间

加密法案倒下、美联储加息,比特币反而涨了?

Flipper One 技术实现超150公里无线比特币交易传输

Arbitrum 与 Robinhood Chain 推出 Founder House,奖池 30 万美元 USDG

摩根士丹利解读加息:会有更多加息吗?

0G将投资者代币锁定期延长一年,无需同意

Velocity融资4800万美元A轮,参与者包括Visa、Circle和Ripple

油价重返90美元,全球市场为何重新交易「滞胀」?

黑石的比特币 ETF:牛市反转的最相关指标?Vincent Ganne 的分析
![[ETH快讯] 以太坊计划于10月6日激活Sepolia测试网](/public-static/26_2e1840f602.png?format=avif)
[ETH快讯] 以太坊计划于10月6日激活Sepolia测试网

Zcash 的百倍神话?不,这是一场理想主义的「复仇」

纽约证券交易所测试Avalanche的代币化功能

欧洲中央银行行长阻止币安在欧盟的扩展与许可获取

以太坊:248万ETH等待质押

罗伯特·清崎宣布“历史上最大的崩盘”:比特币又如何?

越南计划在2026年推出首批获得许可的加密服务提供商

SEC要动真格,谁接得住“合规ICO”?

国民力量:数字资产税收若急于实施将增加投资者负担,需重新审视税制

能源危机从原油蔓延至柴油与粮食,全球通胀面临第二轮压力

摩根士丹利提出「关键问题」:沃什打算如何实现价格稳定

增长数据与高层峰会迎来新一轮定价窗口|WEEX本周热点前瞻(2026 年 9 月 21 日-9 月 25 日)
WEEX 本周热点前瞻聚焦高层峰会、活动指数、、Flash PMI、耐用品订单、消费者信心终值,以及 tCostco等。市场主线围绕“利率路径再定价 + 增长韧性验证 + 高层峰会风险溢价 + 消费基本面检验”展开。

比特币重返8.1万美元|WEEX TradFi每日市场简报(2026年9月21日)
全球市场进入9月21日交易周,核心定价仍是美联储9月16日加息25个基点至3.75%–4.00%后的利率路径,以及消费与能源定价。比特币站上约8.1万美元、以太坊回升至约2630美元,显示加息与监管扰动已被部分消化。NEAR 24小时涨约19%领涨主流币。美东9月21日无重磅财报,投资者转向古尔斯比等官员讲话、芝加哥联储活动指数,以及周二起的AutoZone、周四Costco等消费龙头。

波场 TRON 行业周报:监管与加息利空未能击溃 BTC 多头信心,详解 PayFi 高性能支付基础设施 Axon Finance

Arc链主网上线5天,发射台集体哑火收入不足1美元

美国CFTC免除暗号资产钱包和软件开发者的经纪人注册要求

数字欧元、Pontes、Appia:欧洲央行同时推进的三个项目

当AI Agent加速涌入内网:「网安」的主战场,变了

莫斯科遭“最大规模袭击”,乌克兰“击中俄罗斯重要石油工业设施”,全球“炼油危机”加剧






