正在阅读:

Jev爆火,具身智能迎来大救星?

扫一扫下载界面新闻APP

Jev爆火,具身智能迎来大救星?

AI圈需要新故事。

文|AIX财经 雷晶

编辑|魏佳

最近,一个不聊天、不写代码的AI模型刷屏了。开发者把它塞进各种应用,有人拿它玩游戏,有人用它分邮件,还有人让它操控浏览器。

它叫Jev,由前OpenAI研究员Diogo Almeida等人联合创立的TypeSafe AI于9月15日发布,同时被冠以一个新品类的名字:System One Models(系统一模型)。9月21日,Jev全面开放,更多开发者涌入,上手测试它能接手哪些工作。

这个模型的特别之处在于,它只做判断。比如收到一条用户评论,它会判断是否违规、该删还是要留。TypeSafe AI把软件里大量分类、评分、选择下一步动作的工作,都交给一个专门的模型去做。

真正吸引行业的是速度和价格。按照官方测试,Jev的速度是大模型的193.6倍,成本约为其1/444.6,且输出免费。不过官方也注明,并不是所有任务都能获得同样的提升。

开发平台Vercel在9月18日披露,Jev接入其AI Gateway后的24小时内,已有近13%的付费团队使用,是GPT-5.6系列上线首日的2倍、Claude Fable 5.1的6倍以上。开发者社区更是探索出了很多玩法和场景。

在大模型卷参数的时候,Jev把决策又快又便宜做成卖点,给AI行业提供了一个新的故事。

这是又一个靠效率和价格引爆关注的“DeepSeek时刻”,还是一种模型分工新范式的开端?它的出现会给大模型行业带来哪些影响?

01.Jev不负责说,只负责选

我们先通过一个客服投诉的场景,来理解Jev能做什么。

假设用户发来一句“我被扣了两次钱,想要退款”,接下来,客服系统要判断交给哪个部门、事情有多紧急,还要判断客户要做什么。程序可以把消息和预先设置好的问题一起交给Jev,由它直接返回判断结果。

接到问题后,Jev的输出会分为三种类型。

第一种是Choice,在给定选项里做选择。比如“该交给哪个部门”,候选选项包括售前组、售后组、技术组等,Jev会选出一个,同时给出各选项的概率。

第二种是Score,按预设标准打分。比如“问题有多严重”,程序可以设置从“轻微”到“造成重大损失”的不同等级,Jev给出各等级的概率,再计算加权分数。

第三种是Noul,判断一句话成不成立。比如“用户在要求退款”,如果返回0.97,就表示模型认为这句话有97%的概率成立。

三种输出可以在同一次调用里一起完成,程序拿到结果就能继续走下一步。

具体效果如何,开发者已经做了一些尝试。

有网友在X上展示用Jev进行邮件分类。据他介绍,Jev在数秒内完成了500封邮件的分类,花费3.5美分。对于需要反复读取文本、分配类别的任务,这显示出低成本批量处理的潜力。

还有网友展示了航班查询的案例。他把网页上的按钮、输入框等元素整理成候选项,让Jev决定下一步执行什么操作、选择哪个目标。到了需要填入城市名的环节,再调用生成模型提供文字。据他介绍,这套系统在约7秒内就完成了一次航班查询。

不同用法背后,是同一个设计思路。TypeSafe AI把Jev归入一个新品类——“System One”,取自卡尼曼《思考,快与慢》中那种不用过脑子、凭直觉瞬间给出的判断。Jev本质上是一个决策模型,不生成任何字符,直接返回可供程序调用的结构化决策。

这些事情,通用大模型也能做,Jev的区别在哪里?

最明显的区别在于输出方式。通用大模型通过生成文本给出答案,即使只需要一个选项,通常也要逐个生成Token。Jev直接返回选项、分数或概率,程序拿到结果就能继续执行。

输出方式背后,其实是产品定位的不同。通用大模型可以聊天、写代码,也能分析问题,Jev则专门处理判断任务,开发者提供信息、描述判断要求,必要时给出候选选项,由它返回结果。仍以退款为例,识别诉求、分配工单可以交给Jev,解释退款政策、给客户写邮件,则需要通用大模型。

这也容易让人联想到传统的分类器。分类器是专门给信息归类的模型,开发者先设定类别,再用已经标好类别的数据训练它,让它学会不同类别的特征,从而判断新的输入应该归到哪里。但分类器通常围绕固定任务训练,换了业务场景或标签,往往需要补充标注数据、重新训练或调整。

相比之下,Jev的使用方式更灵活,它仍具备大模型式的语义理解与泛化能力,开发者可以通过提示词描述不同的判断任务,不必为每个新任务重训模型。

02.快、便宜、准确,是怎么做到的?

Jev能干什么讲清楚了,那么,它为什么能在一周内让开发者集体上头?

先来看需求端。

文本打标签、请求分流、风险判断,这些需求一直存在。到了Agent时代,这类“判断类调用”的需求变得更大了。

一个Agent完成任务,往往需要反复作出选择。哪怕用户提出的是一个简单任务,背后可能都会发生几十次模型调用。

大模型研究员曾小健告诉「AIX财经」,Jev踩中的正是这个痛点。过去,开发者把太多判断题交给生成式大模型,让模型先生成文字,再从中提取结论。单次调用的开销不大,但在Agent持续运行的过程中,重复判断会明显推高整个任务的成本和耗时。

Jev把这类需求单独做成产品,无论是选工具、检查内容,还是判断任务是否完成,开发者都能找到可以尝试接入的环节。

再看产品端,Jev同时做到了“速度快、便宜、判断准”三件事。

首先是快。

一位业内人士告诉「AIX财经」,CoT(思维链)让模型一步一步思考,通过增加推理过程中的计算量,提高复杂任务的准确性。Jev则省去逐Token生成文本的过程,直接返回判断结果和概率,以此提高速度。

此外,同一份输入还可以并行完成多个独立判断。大模型研究员姚宇航举例,检查一份文档时,写作质量怎么样、有没有敏感词汇,可以并行判断,不必逐项等待。放在大规模调用中,这能节省可观的时间。

其次是便宜。

通用大模型的API通常分别按输入、输出Token收费,生成的内容越长,输出费用越高。Jev不生成文本回复,只收取输入费用,每百万输入Token为0.042美元,输出不收费。对于反复分类、打分的任务,这种设计减少了为获取一个简单结论而支付的生成费用。

这种设计,在Agent中尤其有价值。一次任务可能包含多次工具选择、结果检查和重试判断,每一步的开销都会计入完成任务的总成本。曾小健举例,可以先用Jev判断问题难度,把简单问题交给便宜模型,复杂问题再升级到更强的模型。这样,既降低了判断环节的费用,也减少了不必要的强模型调用。

再者是训练方法让模型返回的概率本身可信。

前述业内人士解释,Jev的判断仍依靠模型内化的世界知识、高质量的决策数据与训练轨迹,以及对输出概率的有效校准。

这种训练方法叫作校准决策强化学习(RLCD)。所谓校准,就是在大量被模型赋予80%概率的判断中,相应事件实际发生的比例也应接近80%。这样,开发者才更容易根据模型的把握程度,决定哪些结果可以自动执行,哪些需要复核。它改善的是判断与不确定性的表达,并不保证每次都答对。

有网友的测试就呈现了这种差别。他让Jev判断60个Agent工具调用属于只读、破坏性、及权限,还是数据外传,再对照自己预先标注的答案。结果55个判断一致,一致率91.7%。但难度不同的案例表现差距明显,34个界限清楚的案例全部答对;12个刻意伪装成正常操作的陷阱案例,答对了11个;剩下14个本身就存在争议的含糊案例,只答对10个。

姚宇航解释,Jev并不是真的零幻觉,它的输出被卡死在给定选项里。如果给定A、B、C、D四个选项,它不会凭空选出E,但仍可能在四个选项中选错,需要通过模型微调和上层工程降低误判概率。

以上是Jev公认的优点,但能具体快多少、便宜多少,还得看任务和对照对象。曾小健提醒,如果换成便宜的小模型,并要求它只输出简短结果,差距会明显缩小。同一段材料需要完成多个独立判断时,共享上下文、并行处理的优势才更容易体现,真正的收益在高频、批量判断中。

03.Jev会带来什么改变?

Jev的出现是一阵风,还是一种新范式,类似当年的“DeepSeek时刻”?得从两面看。

从技术层面看,Jev并不算新。曾小健指出,分类器、排序模型和意图识别早已存在,Jev并没有跳出这类任务的边界。

但从产品层面看,它是新的。Jev把“判断”做成了一个便宜、快速、可以独立调用的模型接口,面向 Agent、单独计费、单独优化。开发者可以围绕判断任务,单独比较准确率、延迟和费用,选择适合的模型;决策能力也因此有了自己的迭代路径,不必再跟着通用模型的整体能力一起升级。

对每天要处理大量文本的企业来说,只要判断质量够用,Jev就能明确带来更快、更便宜的处理效率。曾小健把它总结为“系统工程和产品架构上的创新”。

前述业内人士则更看重它在模型体系中的位置。他认为,Jev所代表的技术方向,未来很可能成为一种重要的推理与输出范式,与普通文本生成、CoT深度推理长期并存。

多位从业者告诉AIX财经,接下来能接住这波红利的,包括三类玩家:个人开发者、企业、具身智能公司。

对个人开发者来说,最简单的尝试是把Jev接进已有Agent,承担工具选择、任务终止以及失败重试等判断。曾小健认为,API调用本身门槛不高,会Python或JavaScript的开发者很快就能上手。这类任务选项有限、调用频繁,偶尔判断错了通常还能恢复,适合用来测试决策模型的效果。

他提到,真正的门槛是,怎样把业务需求定义成一个好的判断问题。比如判断“客户风险高不高”,高和低的标准是什么、多大把握才能自动执行、什么情况必须交给人工,都需要开发者提前想清楚。

到了企业端,价值主要来自规模。姚宇航看好代码审查、客服和大规模文本处理等每天都要反复分类、筛选、检查的任务,一条数据还可能对应多个判断。只要质量达到要求,单次调用节省的时间和费用,就能随着业务量累积,降低整套系统的运行成本。

具身智能的想象空间更大。姚宇航认为,机器人对响应速度要求高,行业本身也还在早期,新的决策模型有机会切入。

机器人执行任务时,需要不断根据环境变化决定下一步。如果环境信息已经整理好、可选动作也已明确,快速决策模型有机会承担其中一部分选择,减少用户的等待时间。但这仍是潜在用途,Jev能否适应实际环境、满足可靠性要求,还需要专门验证。

这些场景也给模型厂商提供了另一种做产品的方式。

姚宇航向「AIX财经」表示,过去行业比的是谁的模型更大、数据更多、算力更强,目的是解决更复杂的问题;Jev换了个方向,把那些又快又便宜就能解决的小任务专门做好,反而获得了关注。模型厂商除了继续提高能力上限,也可以围绕具体判断任务,优化速度、费用和稳定性。

曾小健打了个比方,未来的Agent系统更像一个模型团队,有的承担推理或生成,有的负责路由、排序或安全检查。开发者需要重新判断,哪些步骤值得调用强大的生成模型,哪些只需要一个快速、可靠的决策模块。

对国内厂商来说,机会是现成的。客服识别用户意图、银行和保险把工单分到对应部门、销售线索评出优先级,都是合适的场景。加上国内企业更重视数据安全和本地部署,能够在企业内部运行、适应中文业务标准的决策模型,有机会做出差异化。

这些机会并不只属于Jev。姚宇航提到,已经有国内开发者尝试用开源模型微调类似产品,他认为,复现这类功能的门槛并不高,后续可能有更多公司加入API服务竞争。

即便Jev的话题热度可能只会维持几个月,但用“便宜快速的模型做判断”这个思路会持续。只要专门的决策模型能稳定降低工作的成本,就有继续使用的理由。

本文为转载内容,授权事宜请联系原著作权人。

评论

暂无评论哦,快来评价一下吧!

下载界面新闻

微信公众号

微博

Jev爆火,具身智能迎来大救星?

AI圈需要新故事。

文|AIX财经 雷晶

编辑|魏佳

最近,一个不聊天、不写代码的AI模型刷屏了。开发者把它塞进各种应用,有人拿它玩游戏,有人用它分邮件,还有人让它操控浏览器。

它叫Jev,由前OpenAI研究员Diogo Almeida等人联合创立的TypeSafe AI于9月15日发布,同时被冠以一个新品类的名字:System One Models(系统一模型)。9月21日,Jev全面开放,更多开发者涌入,上手测试它能接手哪些工作。

这个模型的特别之处在于,它只做判断。比如收到一条用户评论,它会判断是否违规、该删还是要留。TypeSafe AI把软件里大量分类、评分、选择下一步动作的工作,都交给一个专门的模型去做。

真正吸引行业的是速度和价格。按照官方测试,Jev的速度是大模型的193.6倍,成本约为其1/444.6,且输出免费。不过官方也注明,并不是所有任务都能获得同样的提升。

开发平台Vercel在9月18日披露,Jev接入其AI Gateway后的24小时内,已有近13%的付费团队使用,是GPT-5.6系列上线首日的2倍、Claude Fable 5.1的6倍以上。开发者社区更是探索出了很多玩法和场景。

在大模型卷参数的时候,Jev把决策又快又便宜做成卖点,给AI行业提供了一个新的故事。

这是又一个靠效率和价格引爆关注的“DeepSeek时刻”,还是一种模型分工新范式的开端?它的出现会给大模型行业带来哪些影响?

01.Jev不负责说,只负责选

我们先通过一个客服投诉的场景,来理解Jev能做什么。

假设用户发来一句“我被扣了两次钱,想要退款”,接下来,客服系统要判断交给哪个部门、事情有多紧急,还要判断客户要做什么。程序可以把消息和预先设置好的问题一起交给Jev,由它直接返回判断结果。

接到问题后,Jev的输出会分为三种类型。

第一种是Choice,在给定选项里做选择。比如“该交给哪个部门”,候选选项包括售前组、售后组、技术组等,Jev会选出一个,同时给出各选项的概率。

第二种是Score,按预设标准打分。比如“问题有多严重”,程序可以设置从“轻微”到“造成重大损失”的不同等级,Jev给出各等级的概率,再计算加权分数。

第三种是Noul,判断一句话成不成立。比如“用户在要求退款”,如果返回0.97,就表示模型认为这句话有97%的概率成立。

三种输出可以在同一次调用里一起完成,程序拿到结果就能继续走下一步。

具体效果如何,开发者已经做了一些尝试。

有网友在X上展示用Jev进行邮件分类。据他介绍,Jev在数秒内完成了500封邮件的分类,花费3.5美分。对于需要反复读取文本、分配类别的任务,这显示出低成本批量处理的潜力。

还有网友展示了航班查询的案例。他把网页上的按钮、输入框等元素整理成候选项,让Jev决定下一步执行什么操作、选择哪个目标。到了需要填入城市名的环节,再调用生成模型提供文字。据他介绍,这套系统在约7秒内就完成了一次航班查询。

不同用法背后,是同一个设计思路。TypeSafe AI把Jev归入一个新品类——“System One”,取自卡尼曼《思考,快与慢》中那种不用过脑子、凭直觉瞬间给出的判断。Jev本质上是一个决策模型,不生成任何字符,直接返回可供程序调用的结构化决策。

这些事情,通用大模型也能做,Jev的区别在哪里?

最明显的区别在于输出方式。通用大模型通过生成文本给出答案,即使只需要一个选项,通常也要逐个生成Token。Jev直接返回选项、分数或概率,程序拿到结果就能继续执行。

输出方式背后,其实是产品定位的不同。通用大模型可以聊天、写代码,也能分析问题,Jev则专门处理判断任务,开发者提供信息、描述判断要求,必要时给出候选选项,由它返回结果。仍以退款为例,识别诉求、分配工单可以交给Jev,解释退款政策、给客户写邮件,则需要通用大模型。

这也容易让人联想到传统的分类器。分类器是专门给信息归类的模型,开发者先设定类别,再用已经标好类别的数据训练它,让它学会不同类别的特征,从而判断新的输入应该归到哪里。但分类器通常围绕固定任务训练,换了业务场景或标签,往往需要补充标注数据、重新训练或调整。

相比之下,Jev的使用方式更灵活,它仍具备大模型式的语义理解与泛化能力,开发者可以通过提示词描述不同的判断任务,不必为每个新任务重训模型。

02.快、便宜、准确,是怎么做到的?

Jev能干什么讲清楚了,那么,它为什么能在一周内让开发者集体上头?

先来看需求端。

文本打标签、请求分流、风险判断,这些需求一直存在。到了Agent时代,这类“判断类调用”的需求变得更大了。

一个Agent完成任务,往往需要反复作出选择。哪怕用户提出的是一个简单任务,背后可能都会发生几十次模型调用。

大模型研究员曾小健告诉「AIX财经」,Jev踩中的正是这个痛点。过去,开发者把太多判断题交给生成式大模型,让模型先生成文字,再从中提取结论。单次调用的开销不大,但在Agent持续运行的过程中,重复判断会明显推高整个任务的成本和耗时。

Jev把这类需求单独做成产品,无论是选工具、检查内容,还是判断任务是否完成,开发者都能找到可以尝试接入的环节。

再看产品端,Jev同时做到了“速度快、便宜、判断准”三件事。

首先是快。

一位业内人士告诉「AIX财经」,CoT(思维链)让模型一步一步思考,通过增加推理过程中的计算量,提高复杂任务的准确性。Jev则省去逐Token生成文本的过程,直接返回判断结果和概率,以此提高速度。

此外,同一份输入还可以并行完成多个独立判断。大模型研究员姚宇航举例,检查一份文档时,写作质量怎么样、有没有敏感词汇,可以并行判断,不必逐项等待。放在大规模调用中,这能节省可观的时间。

其次是便宜。

通用大模型的API通常分别按输入、输出Token收费,生成的内容越长,输出费用越高。Jev不生成文本回复,只收取输入费用,每百万输入Token为0.042美元,输出不收费。对于反复分类、打分的任务,这种设计减少了为获取一个简单结论而支付的生成费用。

这种设计,在Agent中尤其有价值。一次任务可能包含多次工具选择、结果检查和重试判断,每一步的开销都会计入完成任务的总成本。曾小健举例,可以先用Jev判断问题难度,把简单问题交给便宜模型,复杂问题再升级到更强的模型。这样,既降低了判断环节的费用,也减少了不必要的强模型调用。

再者是训练方法让模型返回的概率本身可信。

前述业内人士解释,Jev的判断仍依靠模型内化的世界知识、高质量的决策数据与训练轨迹,以及对输出概率的有效校准。

这种训练方法叫作校准决策强化学习(RLCD)。所谓校准,就是在大量被模型赋予80%概率的判断中,相应事件实际发生的比例也应接近80%。这样,开发者才更容易根据模型的把握程度,决定哪些结果可以自动执行,哪些需要复核。它改善的是判断与不确定性的表达,并不保证每次都答对。

有网友的测试就呈现了这种差别。他让Jev判断60个Agent工具调用属于只读、破坏性、及权限,还是数据外传,再对照自己预先标注的答案。结果55个判断一致,一致率91.7%。但难度不同的案例表现差距明显,34个界限清楚的案例全部答对;12个刻意伪装成正常操作的陷阱案例,答对了11个;剩下14个本身就存在争议的含糊案例,只答对10个。

姚宇航解释,Jev并不是真的零幻觉,它的输出被卡死在给定选项里。如果给定A、B、C、D四个选项,它不会凭空选出E,但仍可能在四个选项中选错,需要通过模型微调和上层工程降低误判概率。

以上是Jev公认的优点,但能具体快多少、便宜多少,还得看任务和对照对象。曾小健提醒,如果换成便宜的小模型,并要求它只输出简短结果,差距会明显缩小。同一段材料需要完成多个独立判断时,共享上下文、并行处理的优势才更容易体现,真正的收益在高频、批量判断中。

03.Jev会带来什么改变?

Jev的出现是一阵风,还是一种新范式,类似当年的“DeepSeek时刻”?得从两面看。

从技术层面看,Jev并不算新。曾小健指出,分类器、排序模型和意图识别早已存在,Jev并没有跳出这类任务的边界。

但从产品层面看,它是新的。Jev把“判断”做成了一个便宜、快速、可以独立调用的模型接口,面向 Agent、单独计费、单独优化。开发者可以围绕判断任务,单独比较准确率、延迟和费用,选择适合的模型;决策能力也因此有了自己的迭代路径,不必再跟着通用模型的整体能力一起升级。

对每天要处理大量文本的企业来说,只要判断质量够用,Jev就能明确带来更快、更便宜的处理效率。曾小健把它总结为“系统工程和产品架构上的创新”。

前述业内人士则更看重它在模型体系中的位置。他认为,Jev所代表的技术方向,未来很可能成为一种重要的推理与输出范式,与普通文本生成、CoT深度推理长期并存。

多位从业者告诉AIX财经,接下来能接住这波红利的,包括三类玩家:个人开发者、企业、具身智能公司。

对个人开发者来说,最简单的尝试是把Jev接进已有Agent,承担工具选择、任务终止以及失败重试等判断。曾小健认为,API调用本身门槛不高,会Python或JavaScript的开发者很快就能上手。这类任务选项有限、调用频繁,偶尔判断错了通常还能恢复,适合用来测试决策模型的效果。

他提到,真正的门槛是,怎样把业务需求定义成一个好的判断问题。比如判断“客户风险高不高”,高和低的标准是什么、多大把握才能自动执行、什么情况必须交给人工,都需要开发者提前想清楚。

到了企业端,价值主要来自规模。姚宇航看好代码审查、客服和大规模文本处理等每天都要反复分类、筛选、检查的任务,一条数据还可能对应多个判断。只要质量达到要求,单次调用节省的时间和费用,就能随着业务量累积,降低整套系统的运行成本。

具身智能的想象空间更大。姚宇航认为,机器人对响应速度要求高,行业本身也还在早期,新的决策模型有机会切入。

机器人执行任务时,需要不断根据环境变化决定下一步。如果环境信息已经整理好、可选动作也已明确,快速决策模型有机会承担其中一部分选择,减少用户的等待时间。但这仍是潜在用途,Jev能否适应实际环境、满足可靠性要求,还需要专门验证。

这些场景也给模型厂商提供了另一种做产品的方式。

姚宇航向「AIX财经」表示,过去行业比的是谁的模型更大、数据更多、算力更强,目的是解决更复杂的问题;Jev换了个方向,把那些又快又便宜就能解决的小任务专门做好,反而获得了关注。模型厂商除了继续提高能力上限,也可以围绕具体判断任务,优化速度、费用和稳定性。

曾小健打了个比方,未来的Agent系统更像一个模型团队,有的承担推理或生成,有的负责路由、排序或安全检查。开发者需要重新判断,哪些步骤值得调用强大的生成模型,哪些只需要一个快速、可靠的决策模块。

对国内厂商来说,机会是现成的。客服识别用户意图、银行和保险把工单分到对应部门、销售线索评出优先级,都是合适的场景。加上国内企业更重视数据安全和本地部署,能够在企业内部运行、适应中文业务标准的决策模型,有机会做出差异化。

这些机会并不只属于Jev。姚宇航提到,已经有国内开发者尝试用开源模型微调类似产品,他认为,复现这类功能的门槛并不高,后续可能有更多公司加入API服务竞争。

即便Jev的话题热度可能只会维持几个月,但用“便宜快速的模型做判断”这个思路会持续。只要专门的决策模型能稳定降低工作的成本,就有继续使用的理由。

本文为转载内容,授权事宜请联系原著作权人。