教ChatGPT说话的人,做了个哑巴AI
9月15日前后,一个名叫Jev的新模型突然在硅谷AI开发者社区刷屏。
它颠覆了大家对当下大模型的认知,不会写代码、写文章甚至是聊天,主动砍掉了过去几年大模型最重要的一项能力——生成文字,只保留“判断”。TypeSafe给它的定义是:“Decisions,not strings”——要决策,不要文本。
TypeSafe AI创始人Diogo Almeida。 图片由AI生成
给它一段信息和几个提前定义好的问题,它可以直接返回选择、评分以及相应概率。例如收到一封客服邮件,Jev可以同时判断应该分给哪个部门、紧急程度、退款风险以及是否需要人工介入。
TypeSafe公布的性能数字也很夸张:在特定工作流评测中,Jev最高比对照大模型快193.6倍、便宜444.6倍,端到端延迟70—500毫秒,输入价格每百万Token0.042美元,输出不按Token收费。
Jev背后的团队同样也是自带流量。它来自刚刚走出隐身模式的旧金山创业公司TypeSafe AI,由DiogoAlmeida、Erik Gafni和SashaSheng共同创立,刚完成DCVC领投的4000万美元种子轮融资,Forbes援引知情人士称估值约2亿美元。
Almeida曾是OpenAI研究员,也是2022年InstructGPT论文的主要作者之一,参与建立了后来广泛采用的RLHF训练流程。OpenAI在GPT-4贡献名单中也将他列入“FoundationalRLHF and InstructGPT work”。
离开OpenAI后,Almeida称自己花了两年时间思考一个问题:如果大模型已经这么聪明,为什么世界上的大多数工作还没有被自动化?
Jev可以看作他给出的第一个答案。
Agent真的需要每一步都“说话”吗?
今天的大语言模型,本质上仍然是一台极其强大的Token生成机器。以一个电商Agent为例,它打开网页后需要判断下一步点击哪个按钮。常见做法是把网页状态交给GPT、Claude或Gemini,模型理解页面后,以自回归方式一个Token接一个Token生成答案,比如“根据当前页面,我应该点击右下角的Checkout按钮”。软件随后再从这段文字中提取Checkout,调用浏览器工具完成点击。
但从软件系统的角度看,它真正需要的信息可能只是“第三个按钮”。
类似的情况大量存在于Agent内部:这个工单应该交给销售还是售后,这笔交易风险高不高,搜索出来的十条结果哪个最相关。这些任务都需要模型具备语义理解和判断能力,却没有多少开放式文本生成的必要。
Jev的目标就是这一部分工作。TypeSafe把它定义为“System OneModel”,名字来自丹尼尔·卡尼曼《思考,快与慢》中的System 1——快速、直觉式判断。
Jev这个名字则来自经济学家William StanleyJevons以及“杰文斯悖论”:一种资源的使用效率提高、成本下降之后,最终需求可能反而增加。TypeSafe希望同样的事情发生在AI上,让“智能判断”足够便宜后被大规模嵌入软件。
Jev目前公开的基本输出主要包括Choice、Score和Noul。
Choice负责在预定义选项中选择,Score给出等级或连续评分,Noul处理yes/no判断,同时输出相应概率。例如一个风控系统可以让Jev判断某个用户退款风险为低、中还是高,模型最终返回“高风险75%”。软件拿到这个结果后,可以通过普通代码直接决定是否进入人工审核。
从这个角度看,Jev很像一个拥有通用语义理解能力的“智能if语句”。这也是它与传统分类器最重要的差别。
传统分类器当然也可以判断垃圾邮件、欺诈风险或者图片类别,但每增加一种任务,往往需要重新定义数据、训练或者微调模型。Jev希望把大模型已经获得的通用知识和零样本泛化能力保留下来,同时把输出压缩成软件真正需要的选择和概率。
这个需求在Agent时代明显放大。一个复杂Agent任务内部可能发生几十次甚至数百次模型调用,其中很多都属于routing、classification、verification和状态判断。如果这些步骤全部交给完整的生成式大模型,模型不仅要理解问题,还要花时间生成一段最后不会被人阅读的文字。这部分额外成本看起来确实没必要。
图:TypeSafe演示显示,Jev直接返回多项结构化判断,而传统LLM仍在逐步生成文本。官方示例中,前者耗时0.114秒,后者为8.566秒。
这也是判断Jev技术含量最关键的问题。
GPT、Claude、Gemini等大语言模型采用自回归生成。模型先处理输入,再根据此前所有Token预测下一个Token,一个句子因此必须按照顺序不断Decode。这样的机制给予模型巨大的输出自由度,它可以写文章、生成代码、解释原因,也可以进行复杂推理,但代价是生成过程具有顺序性,输出越长,需要执行的Decode步骤通常越多。
Jev主动限制了输出空间。开发者提前规定可能的答案,例如refund_risk={low, medium,high},模型只需要判断三个结果的概率,无需再生成“我认为这个用户具有较高退款风险”这样的自然语言。TypeSafe还宣称Jev采用新的parallelsampler,可以在一次查询中同时回答多个相互独立的问题。例如处理一张发票时,同时判断发票类型、异常风险、审批级别和是否需要人工复核。
这也是理解Jev效率数字的关键。
它和最近越来越受重视的Flash路线因此存在明显区别。Google Gemini Flash、DeepSeek V4.1Flash等模型依然属于生成式LLM,通过架构、激活参数、KVCache和推理系统等方式降低每个Token的计算成本,解决“怎样更快地生成Token”。
Jev是直接减少token。如果一个Agent完成任务需要100次模型调用,其中10次需要复杂规划和自然语言生成,剩余90次只是工具选择、结果排序、风险判断和任务状态检查,那么全部调用同一种大型生成模型显然存在优化空间。
未来更现实的Agent系统可能采用多层模型结构:复杂任务交给FrontierModel,普通推理交给Flash,路由、分类、验证等高频判断交给DecisionModel,确定性的部分继续由传统代码处理,Harness负责在这些能力之间调度。
这也是Jev最值得关注的产业意义,并不是“一切需要智能的地方都需要调用生成式LLM”。
图:TypeSafe称,Jev会为每次判断返回经过校准的概率,软件可以据此设置自动执行阈值:高置信度任务直接处理,低置信度任务转交人工复核。
03 零幻觉?
TypeSafe官网对Jev最醒目的宣传之一是“ZeroHallucinations”。这句话容易让人误以为Jev解决了大模型长期存在的幻觉问题,但它只是能保证输出不会超出预定义类型。


