亚洲财经

搜索

我们用190次财报任务实测了Jev:当AI判断被卖成零件

我们用190次财报任务实测了Jev:当AI判断被卖成零件

作者 | 林克、郑好

2026年上半年,贵州茅台营业收入907亿元,涨了不到两个百分点;归母净利润445亿元,降了两个百分点;经营现金流707亿元,涨了将近5倍半。

如果把这段话放进一场考试,给5个描述让你选最贴合的那个,你会选什么。

9月15日,美国创业公司TypeSafe AI结束了两年隐身期,发布了一个叫Jev的模型,点燃了硅谷和AI圈的目光。 

上手之后,我们把上面这道题喂给它,它连选三次,每次都选同一个描述,每次都满格把握。整道题花了不到0.001美元。 

这个模型特殊性在于,它不写任何一个字,不解释为什么,不写代码或聊天,给它一段材料和几个备选描述,它只在其中勾一个,再报一个数字表示自己有多大把握。 

这么一个只做减法的东西,一周内被OpenRouter等多家开发者平台和模型网关接入,几天内还有人做出了开源仿制版,引发了硅谷和AI圈的躁动。 

Jev创始人Diogo Almeida在OpenAI做了4年研究,参与的InstructGPT是后来ChatGPT的前身。DCVC领投了4000万美元种子轮。模型名取自19世纪经济学家杰文斯,这个名字里藏着公司的全部赌注。

回到开头茅台那道题会发现,几个正确选项几乎把材料的事实复述了一遍,这道题本身没有多难,但真正值得问的是:一个连字都不写的AI,最终能引起这种热度,凭什么。

一. 从顾问换成开关

做过AI产品的人,都清楚一个日常困境。

一家公司的系统每天做着大量琐碎的判断,这封邮件算不算投诉,这份公告有没有提到诉讼,这笔退款该不该自动批。

最常见的方案是每次都请一个大模型来回答,但大模型的核心工作方式是生成,需要一字一字写,你问它一个“是或否”,它可能先写三段分析再给结论,按字数收费,等上几秒甚至几十秒,回来的文字还需要程序去拆解和校验,格式不对就得重来。

更麻烦的是,大模型说“我很确定”的时候,这句话本身并不附带刻度。

有时候“很确定”如同传统烹饪时的“少许”,究竟是7成还是9成,预制对应的那1-3成不确定落在哪个错误方向上,都无从得知。

于是,大量本该由机器自动完成的判断,卡在了某种两难里:用大模型太贵太慢,靠写死的规则又不够灵活。

Jev对此做了件看上去很简单的事:把答案提前写好,让模型只负责挑选。

把材料和备选答案一起丢给它,它同时给每个选项打出一个支持程度,选出最高的那个返回。因为不用逐字生成,速度快了不止一个数量级;因为只按读入的材料字数收费,不收输出费,每次判断的价格几乎可以忽略。

这里面最关键的商业差异,是计价单位变了。

大模型卖的是“字数”,Jev卖的是“一次判断”。

字数是服务的计价方式,一次判断是零件的计价方式。零件可以进采购清单,可以算单位经济账,可以塞进一行代码里跑上万次。如果这个零件足够便宜,软件里会冒出大量此前根本不值得调用AI的判断点。

TypeSafe自己做过一组评测,在5个业务场景里把Jev和几个大模型工作流做了对比。

准确率上,Jev只追平了中档水平,比最强的那个低了6个百分点。全部优势集中在单价和速度上:每次判断便宜几百倍而且快几十倍。

另一个常被提起的卖点是“不会胡编”。

严格地说,Jev的答案只能落在你给定的选项里,所以它编不出一个凭空的概念或数字。

但它可以很有把握地选错,错误的形态从“写出一段不存在的话”变成了“自信地勾错一个选项”,后者更不容易被察觉。

创始人自己也承认,高把握下答错是可能的。

TypeSafe还做了一件在AI公司里不太常见的事——在说明书里列出了自己模型的所有已知短板。它写到,Jev读日期像读普通文字,不擅长做算术,材料里塞进无关内容会分心,英语表现最好,中文能用但弱一些,并建议非英语场景下先用自己的材料测试。

这份说明书之所以值得写,是因为它正好定义了我们接下来要做的事。

二. 面对猪周期,它犹豫了

TypeSafe的说明书写明中文弱于英文,并建议用户先自测。

Jev发布以来,公开可见的中文实测极少。所以我们解决了API后,用国内的财经场景材料做了一轮测试。

规矩定得很简单,材料取自监管部门、各公司的中报原始公告,用Wind做了交叉核对。每道题的参考答案在调用模型之前写好封存,写完一个字没改。

每道题反复问三遍,看它会不会自己改主意。

我们准备了15道题,覆盖从“两新”政策到降准降息、从煤炭供应冲击到汽车芯片短缺、从光伏到生猪周期,再加上宁德时代、比亚迪、万科、腾讯、茅台、美团、京东、泡泡玛特、安踏九家公司的中报。

45次判断,全部命中,每道题3次答案完全一致。

这张成绩单最没意思的部分就是那个满分,有意思的是第15题。

2021年8月的生猪存栏同比增了将近3成,养殖户每头猪平均亏损上千元,能繁母猪的存栏同比还在涨,尽管环比已经下降了,过剩还没结束,产能收缩的信号已经出现,这道题正好站在拐点上。

Jev3轮都选了“从过剩走向再平衡”,但这是15道题里唯一一道把握没有拉满的,三轮分别报出85%、88%、85%。剩下那一成多不确定,它给了“仍然过剩”,没有给别的错误方向。

一串满格把握什么也说明不了,这个犹豫说明它仍然形成一定的判断力。

满分的原因和测试题目有关。

比如增长率,“同比增长54.80%”“同比下降7.13%”,都是提前算好递给它的,它从头到尾没做过一次加减法。

TypeSafe自己的评测里,Jev最差的一项是发票核对,要比对金额、数量和交货日期,只拿了61.8%,TypeSafe的说明书也写着:算术请留在代码里。

我们相当于照着说明书出了一张卷子,把它已知短板都绕开了。

一个模型表现好坏与否,更取决于给它出题的设计,这也意味着,围绕它做产品的人,核心竞争力可能落在选项设计和数据预处理上。

接着我们做了第二轮测试,把算账的活还给它。

三. 同一道除法,连错10次

第二轮选了3家公司,出了26道题,每道反复问5遍,题目和我们预测一样,在调用之前全部封存。

我们押了13处它会失手,最后只中了两处。

例如它数数居然数对了,泡泡玛特半年报里11个IP和业务线的收入两列中,数出其中几个下降了,它5轮给出的区间都是对的,只是列表越长越不确定。TypeSafe的说明书说它不会可靠计数,这道题它做到了。

青岛啤酒的二季度利润在降,上半年累计利润在涨,方向相反地混在同一段材料里,5次都没被单季数字带偏;海尔2024年的收入增长有多少来自年底完成的3笔收购,有多少来自自身,需要用总增量减去收购贡献再算比例,它5次都归对了。

4家公司的收入增速分档题也全部答对,比如针对伊利业绩,实际增速4.13%,分界线定在4%,只差0.13个百分点,这道题给了97%的把握。

把茅台整章管理层讨论直接投进去,答案准确;泡泡玛特的英文版4.4万字符也放进去了,10次全对,但同样是一整章中报文字,海尔的中文版5次都被接口拒收。

可见同样的篇幅,中文消耗的计费单位明显更高,也更容易撞上读入上限。

然后测试来到了模型的边界。

我们分别给宁德时代、金山办公和茅台两年的收入和成本,问毛利率是变好了还是变差了。

这种题需要先算出两年的毛利率再比较变化幅度,人看一眼也得拿计算器,这种基本答不对,但它自己知道,提出报出来的把握只有不到两成,概率几乎平摊在6个选项上,等于明牌说自己"在猜"。

计算结果离分界线远、粗算一眼就能判断方向的题,它基本都对;结果贴着分界线、要算到小数点后才分得出来的题,三道错了两道。

这印证了说明书的定义:Jev不是计算器,算术要留在代码里,对想用它做金融产品的人来说,这条线划得很清楚:从取数、对齐口径到算比率,这些活必须由程序完成,Jev只能接手最后那一步语义判断。

不过测试中发现的一个意外是,它答错了一道不知道自己错了的题。

为了测它在贴线题上的表现,我们挑了美的2025 年中报做对照:营业成本同比增长 16.83%,我们的分界线划在 17%。

材料里2024 年同期营业成本同时列了原口径约 1584 亿元和调整后约 1599 亿元两个数。它5次都选了"达到 17%",而且都有超过8成把握。

我们原以为是两套口径把它带偏了如果按原口径算,增速确实会到17.9%,刚过线;于是删掉原口径和调整额,只留调整后的两个干净数再问5次。

结果居然还是全错,把握反而更高了。

同一道题的两种问法,问了10 次错了 10 次。这是我们第 3 次猜错它会在哪里出错。伊利贴着线答对,美的贴着线答错,原因无法确定,主要因为 Jev 不展示解题过程无法溯源,能说的只有观察位数和单位差异,比如美的的数字是 9 位数、单位千元,伊利是 4 位小数、单位亿元。

毛利率题的错误会报警,它自己知道在猜,用它的人可以设一个门槛,把握不够就转人工。

要警惕的反而是美的那道题,它很确定自己是对的,这在真实的产品里,后者更危险。

比较令人好奇的是,它所谓的“把握”到底在衡量什么。

对此我们又做了一组测试:把开篇那道茅台题的正确答案和“以上都不对”从选项表里拿掉,只留3个和事实矛盾的描述,它几乎把全部支持压在了“收入下降”的选项上,但茅台的收入其实在涨。

更直观的对照,是同一个错误描述在2种测试上的待遇不一样。

当设定有“以上都不对”这个选项时,它几乎不给这些描述任何支持;但选项一旦拿掉,支持度一下子跳到8成以上,3家公司无一例外。

TypeSafe在文档里解释过这个机制:把握衡量的是“在这几个答案里,模型有多偏向其中一个”,它并不衡量答案本身对不对。把握打到95%,意思是“这几个里面最像这个”,读成“95%等于100%”就错了。

它只会在你写好的答案里挑一个,挑得再笃定,也挑不出你没写的那个。

四. 衍生的价值流向

190次判断,按公开标价其实合计不到1毛钱,这种判断,1元钱大约可以买数千次。

19世纪,蒸汽机更省煤之后,英国的煤反而烧得更多了,因为便宜到值得用在以前不值得烧煤的地方,这正是杰文斯悖论的起点。

TypeSafe把这种理念写进了模型名,一次AI判断的成本每降一个数量级,调用量的增长会超过省下来的钱,如果判断真能变成零件价格,软件里会冒出大量本就不值得唤起生成式AI的调用点。

应用场景大概率会分为两类。

一是在大模型工作流上叠甲,也就是AI助手每次要动手操作前,由它判断这一步需不需要人来批;检索回来的文档由它先筛一遍再喂给大模型,一些开发者平台已经发教程教人这么用。

另一类是原本就不值得用AI的大量琐碎判断,包括并不限于工单分派、退款原因归类、设备告警分级、商品分类、合同条款初筛,数量巨大、单次不值钱、对速度和成本极其敏感。

但我们在测试中也发现了一件事,真正的成本在接口账单之外。

在我们刻意挑选的难题里,把门槛设到最保守、保证放行的判断零错误,大约4成的判断要转给人。

门槛稍微松一点,错误就混了进来,即便门槛拉到最高,也拦不住一张漏掉了正确答案的选项表。

所以衍生的商业价值会从模型身上往5个方向流动,包括写进代码里的算术规则和口径处理,由懂行的人设计、且留好“以上都不对”出口的选项模板,用自己的业务数据反复校准的门槛,以及承接转人工流量的复核团队。

而一条能跑起来的流水线大致会是这样的一种状态——程序负责取数和算账,Jev负责语义判断,把握不够的交给人,会写字的大模型负责把结果讲给人听。

TypeSafe自己选的商业姿态很明确,一周内接入多家第三方平台和网关,自己不做应用层。它赌的是"被集成",在别人的产品里跑上万次,按量收费。

不过这里有一个待验证的风险,TypeSafe自己承认无法证明当前的定价不依赖补贴。

对科技行业更深远的影响可能是计量体系的变化。过去3年,AI产业最通行的需求指标是token消耗量。

如果高频低复杂度的判断被从通用大模型手里切走,这套以“字数”为锚的指标就会开始失真。

推理算力的需求形状也会分化:“长输出、能忍几秒”和“短输入、高并发、一秒内返回”,对应的硬件和调度结构完全不同。

五. 但零件未必稀缺

Jev发布一周,公开信息里,似乎还没有国内模型公司把“只判断、不写字”做成一个单独定价的商业产品。

但国内类似能力其实本身不缺。

蚂蚁和人大做的LLaDA系列也跳出了"一个字一个字往外写"的框架,但它的目的是写得更快,Jev干脆不写,方向稍有区别。

做判断的能力在国内大量存在,智源的BGE、阿里Qwen3的排序模型、各家的内容审核和金融文本打标,在搜索、风控、合规链路里每天跑无数次。

关键它们只是被当成被调用模型来用,没有人把它们包装成一个独立的模型品类、定出独立的计价单位。

事实上,Jev发布几天后就有开源仿制版冒了出来:最受关注的Laya用的是ModernBERT-large(4.21亿参数)纯编码器架构,另有项目直接微调阿里通义开源的Qwen系列模型跑同款决策任务。

中国团队的开源模型成了仿制它的底座,做成商业产品的却是一家旧金山公司。Laya在项目说明里也写明,没有复现TypeSafe声称的校准训练方法。

校准意味着“说8成把握的时候真有8成对”,是TypeSafe标榜的核心差异,壳容易复制,这一层到底有多厚,还需要更多独立测试来验证。

我们的测试,也留下了一个和国内市场相关度更高的发现:

同样篇幅的财报章节,中文材料折算成的Token消耗比英文高出不少,也更容易撞上单次读入的上限。

当然TypeSafe自己都承认中文弱于英文,一个中文原生的判断模型,在纸面上有空间。

国内模型公司的竞争叙事还锁在参数规模、编程能力和Agent榜单上,"把一次判断的单价打到零"这条路,目前还没有人走。

但考虑到底层能力具备、开源底座现成、应用场景天然对接中国庞大的金融数据和内容审核需求,这个商业模式大概率会被快速跟进。

快不快,要看有没有团队愿意把它从一个零件变成一门生意。

我们三轮测试下来,接上模型接口其实容易,但更难的反而是把9家公司的中报数据逐条核对干净,再给每道题设计出一组不漏选项的答案。

这门生意把一次判断的价格压到了几乎为零,剩下的价钱,其实就在了出题人的账上。

风险提示及免责条款
市场有风险,投资需谨慎。本文不构成个人投资建议,也未考虑到个别用户特殊的投资目标、财务状况或需要。用户应考虑本文中的任何意见、观点或结论是否符合其特定状况。据此投资,责任自负。