知道吗?ChatGPT早期研究者做了一个“不会说话”的AI

文学城原文

TypeSafe AI创始人Diogo Almeida。 图片由AI生成

编辑|徐青阳

9月15日前后,一个名叫Jev的新模型突然在硅谷AI开发者社区刷屏。

它颠覆了大家对当下大模型的认知,不会写代码、写文章甚至是聊天,主动砍掉了过去几年大模型最重要的一项能力——生成文字,只保留“判断”。TypeSafe给它的定义是:“Decisions, not strings”——要决策,不要文本。

给它一段信息和几个提前定义好的问题,它可以直接返回选择、评分以及相应概率。例如收到一封客服邮件,Jev可以同时判断应该分给哪个部门、紧急程度、退款风险以及是否需要人工介入。

TypeSafe公布的性能数字也很夸张:在特定工作流评测中,Jev最高比对照大模型快193.6倍、便宜444.6倍,端到端延迟70—500毫秒,输入价格每百万Token 0.042美元,输出不按Token收费。

Jev背后的团队同样也是自带流量。它来自刚刚走出隐身模式的旧金山创业公司TypeSafe AI,由Diogo Almeida、Erik Gafni和Sasha Sheng共同创立,刚完成DCVC领投的4000万美元种子轮融资,Forbes援引知情人士称估值约2亿美元。

Almeida曾是OpenAI研究员,也是2022年InstructGPT论文的主要作者之一,参与建立了后来广泛采用的RLHF训练流程。OpenAI在GPT-4贡献名单中也将他列入“Foundational RLHF and InstructGPT work”。

离开OpenAI后,Almeida称自己花了两年时间思考一个问题:如果大模型已经这么聪明,为什么世界上的大多数工作还没有被自动化?

Jev可以看作他给出的第一个答案。

Agent真的需要每一步都“说话”吗?

今天的大语言模型,本质上仍然是一台极其强大的Token生成机器。以一个电商Agent为例,它打开网页后需要判断下一步点击哪个按钮。常见做法是把网页状态交给GPT、Claude或Gemini,模型理解页面后,以自回归方式一个Token接一个Token生成答案,比如“根据当前页面,我应该点击右下角的Checkout按钮”。软件随后再从这段文字中提取Checkout,调用浏览器工具完成点击。

但从软件系统的角度看,它真正需要的信息可能只是“第三个按钮”。

类似的情况大量存在于Agent内部:这个工单应该交给销售还是售后,这笔交易风险高不高,搜索出来的十条结果哪个最相关。这些任务都需要模型具备语义理解和判断能力,却没有多少开放式文本生成的必要。

Jev的目标就是这一部分工作。TypeSafe把它定义为“System One Model”,名字来自丹尼尔·卡尼曼《思考,快与慢》中的System 1——快速、直觉式判断。

Jev这个名字则来自经济学家William Stanley Jevons以及“杰文斯悖论”:一种资源的使用效率提高、成本下降之后,最终需求可能反而增加。TypeSafe希望同样的事情发生在AI上,让“智能判断”足够便宜后被大规模嵌入软件。

Jev目前公开的基本输出主要包括Choice、Score和Noul。

Choice负责在预定义选项中选择,Score给出等级或连续评分,Noul处理yes/no判断,同时输出相应概率。例如一个风控系统可以让Jev判断某个用户退款风险为低、中还是高,模型最终返回“高风险75%”。软件拿到这个结果后,可以通过普通代码直接决定是否进入人工审核。

从这个角度看,Jev很像一个拥有通用语义理解能力的“智能if语句”。这也是它与传统分类器最重要的差别。

传统分类器当然也可以判断垃圾邮件、欺诈风险或者图片类别,但每增加一种任务,往往需要重新定义数据、训练或者微调模型。Jev希望把大模型已经获得的通用知识和零样本泛化能力保留下来,同时把输出压缩成软件真正需要的选择和概率。

这个需求在Agent时代明显放大。一个复杂Agent任务内部可能发生几十次甚至数百次模型调用,其中很多都属于routing、classification、verification和状态判断。如果这些步骤全部交给完整的生成式大模型,模型不仅要理解问题,还要花时间生成一段最后不会被人阅读的文字。这部分额外成本看起来确实没必要。

图:TypeSafe演示显示,Jev直接返回多项结构化判断,而传统LLM仍在逐步生成文本。官方示例中,前者耗时0.114秒,后者为8.566秒。

这也是判断Jev技术含量最关键的问题。

GPT、Claude、Gemini等大语言模型采用自回归生成。模型先处理输入,再根据此前所有Token预测下一个Token,一个句子因此必须按照顺序不断Decode。这样的机制给予模型巨大的输出自由度,它可以写文章、生成代码、解释原因,也可以进行复杂推理,但代价是生成过程具有顺序性,输出越长,需要执行的Decode步骤通常越多。

Jev主动限制了输出空间。开发者提前规定可能的答案,例如refund_risk={low, medium, high},模型只需要判断三个结果的概率,无需再生成“我认为这个用户具有较高退款风险”这样的自然语言。TypeSafe还宣称Jev采用新的parallel sampler,可以在一次查询中同时回答多个相互独立的问题。例如处理一张发票时,同时判断发票类型、异常风险、审批级别和是否需要人工复核。

这也是理解Jev效率数字的关键。

它和最近越来越受重视的Flash路线因此存在明显区别。Google Gemini Flash、DeepSeek V4.1 Flash等模型依然属于生成式LLM,通过架构、激活参数、KV Cache和推理系统等方式降低每个Token的计算成本,解决“怎样更快地生成Token”。

Jev是直接减少token。如果一个Agent完成任务需要100次模型调用,其中10次需要复杂规划和自然语言生成,剩余90次只是工具选择、结果排序、风险判断和任务状态检查,那么全部调用同一种大型生成模型显然存在优化空间。

未来更现实的Agent系统可能采用多层模型结构:复杂任务交给Frontier Model,普通推理交给Flash,路由、分类、验证等高频判断交给Decision Model,确定性的部分继续由传统代码处理,Harness负责在这些能力之间调度。

这也是Jev最值得关注的产业意义,并不是“一切需要智能的地方都需要调用生成式LLM”。

图:TypeSafe称,Jev会为每次判断返回经过校准的概率,软件可以据此设置自动执行阈值:高置信度任务直接处理,低置信度任务转交人工复核。

03 零幻觉?

TypeSafe官网对Jev最醒目的宣传之一是“Zero Hallucinations”。这句话容易让人误以为Jev解决了大模型长期存在的幻觉问题,但它只是能保证输出不会超出预定义类型。

图:TypeSafe公布的官方评测显示,Jev在其工作流测试中以更低成本获得接近前沿模型的准确率;右图则显示,Jev的工具调用类型错误率为0%

例如,开发者规定模型只能在“猫、狗、鸟”三个选项中选择,Jev不会返回“大象”,也不会生成一段软件无法解析的文字。

TypeSafe因此强调其type error可以做到0%。这对生产系统确实重要,尤其是在Agent自动调用API、修改数据库和执行工作流时,结构化输出越稳定,系统越容易接入后续操作。

但类型正确不等于判断正确。如果输入明明是一只猫,模型却返回“狗:97%”,它依然没有发生type error,业务结果却完全错误。因此,“Zero Hallucinations”更准确地说,是对输出格式和类型的约束,目前没有证据表明Jev消除了事实和判断层面的错误。

Jev更值得关注的部分,其实是TypeSafe提出的RLCD——Reinforcement Learning for Calibrated Decisions,即面向校准决策的强化学习。按照团队的解释,RLHF主要优化人类偏好,RLVR依赖可验证奖励提升数学、代码等任务能力,RLCD重点解决“模型说自己有多大把握,这个概率到底靠不靠谱”。

这对Agent进入生产环境尤其关键。假设一个模型实际判断正确率只有80%,却经常给出99%的置信度,那么这个数字几乎无法用于自动化决策。理想情况下,当模型对一批任务都给出90%的置信度时,其中大约90%应该判断正确。只有做到这一点,企业才能建立稳定的分流机制:高置信度任务直接执行,中等置信度交给更强模型复核,低置信度再转给人工。

如果RLCD最终能够被独立验证,它的实际意义很重要。一个校准良好的Decision Model,本身就可以充当Agent系统里的路由器。

不过,TypeSafe目前尚未公开完整论文,也没有披露参数规模、网络结构、训练数据和足够的消融实验。外界因此还无法判断RLCD究竟代表一种明显不同的训练范式,还是对强化学习、概率校准等已有方法的工程化组合。同样,TypeSafe宣称的parallel sampler和System One Model目前也缺少足够细节,很难据此认定Jev已经完成了类似Transformer、Attention或MoE级别的基础架构突破。

04 “193倍快、444倍便宜”?

Jev传播过程中吸引眼球的还有一组性能数字。TypeSafe公布的production-style workflow评测显示,Jev在其设计的四类工作流上平均得分约67.8%,部分前沿模型大约在68%—74%区间;与此同时,Jev单个case的成本可以压到约0.0004美元,响应时间约0.4秒。公司据此给出了最高193.6倍速度提升和444.6倍成本下降的数据。

这些数字完全不能简单理解为“Jev拥有接近GPT的智能,同时快了193倍”。

首先,这些任务本身就是Jev最擅长的System One型任务,即分类、选择、评分和判断。让一个专门为结构化决策设计的模型与通用生成模型比赛这类任务,本身就会放大Jev的优势。其次,目前最完整的评测主要由TypeSafe自己完成,公司也承认测试任务由自己的model capabilities团队设计,可能存在偏差;部分参考答案还来自强模型生成,而非全部使用人工标注的ground truth。

“193.6倍”和“444.6倍”也是特定任务、特定模型比较中的最大差距,并不代表Jev处理任何任务都能获得这样的提升。

它更能够证明一个常识:如果任务最终只需要一个选择或概率,那么专门为判断设计的模型确实有机会比完整的生成式LLM便宜很多。

更重要的是,Jev真正应该比较的对手也不只是GPT、Claude等昂贵前沿模型。今天的Flash小模型已经可以配合JSON Schema、Structured Output、Function Calling和Constrained Decoding返回结构化答案。传统classifier以及embedding+classifier的成本还可能更低。

因此,一套真正有说服力的独立测试,应该把Jev、Flash模型+Constrained Decoding、传统分类器和Embedding分类器放进同一批真实生产任务,统一比较Accuracy(准确度)、Calibration(置信度校准)、Latency(延迟)、Cost(成本))、OOD Robustness(分布外鲁棒性)和Batch Scaling(批处理扩展能力)。目前看来,还没有这类测试。

噱头大于实质,还是真的创新?社区已经吵成一锅粥。

图:一位Reddit用户调侃“行业又重新发现了分类模型”,另一位认为,Jev更像是加入了LLM级语义理解能力的通用分类器,如果成本和速度数据成立,意义并不小。

Jev确实提出了一个基于Agent范式的痛点:AI的“智能”是否一定要通过高资源消耗的语言生成来完成。还有没有更好、更靠谱、更高效的方式?

不过,也有开发者直接对腾讯科技说:“哪有这好事儿?”

来源:文学城 · 查看原文
Scroll for more