锐意创新 · 敏锐洞察 · 锐不可当

一个连字都不写的AI,凭什么一周内让硅谷躁动

贵州茅台2026年上半年营收907亿元,增速不到两个百分点,归母净利润445亿元,同比降了两个百分点。把这组数据连同五个描述选项喂给一个叫Jev的模型,它连选三次,每次答案一致,每次报出满格把握。整道题成本不到0.001美元。

希鸥网观察到,这个由美国创业公司TypeSafe AI推出的模型,2026年9月15日结束两年隐身期发布,创始人Diogo Almeida在OpenAI做了4年研究,参与过InstructGPT。DCVC领投4000万美元种子轮。它不写字、不解释、不写代码,只在给定选项里勾一个,再报一个把握数字。

这套逻辑切中的是AI产品日常困境。企业系统每天做大量琐碎判断——邮件算不算投诉、公告有没有提到诉讼、退款该不该自动批。大模型按字数收费,答一个是或否先写三段分析,等几秒回来还得程序拆解校验。Jev把答案提前写好,模型只负责挑选,按读入材料字数计费,不收输出费。

计价单位变了。大模型卖“字数”,Jev卖“一次判断”。字数是服务计价方式,一次判断是零件计价方式。零件能进采购清单,能算单位经济账,能塞进一行代码跑上万次。一次判断成本每降一个数量级,调用量增长会超过省下的钱——杰文斯悖论,TypeSafe把赌注写进了模型名。

TypeSafe在说明书里列出所有已知短板:读日期像读普通文字,不擅长算术,材料有无关内容会分心,中文弱于英文。这份坦率定义了产品边界。希鸥网用15道国内财经题实测,覆盖两新政策、降准降息、生猪周期及九家公司中报,45次判断全部命中。唯一犹豫的是生猪周期拐点题,三轮分别报85%、88%、85%把握。

希鸥网认为,这个模型最值得警惕的不是错误本身,而是错误的形态变了。它编不出凭空概念,但可以很有把握地选错。“写出不存在的话”变成“自信勾错选项”,后者更难察觉。美的2025年中报毛利率题,同一道除法两种问法,问10次错10次,把握始终超过8成。伊利贴着4%分界线答对,美的贴着17%分界线答错,原因无法溯源,因为Jev不展示解题过程。

这给创业者的第一课是:工具越确定,出题人的价值越稀缺。TypeSafe自己不做应用层,一周内接入OpenRouter等平台,赌的是被集成。但测试中真正的成本在接口账单之外——门槛设到最保守,约4成判断要转人工;门槛松一点,错误就混进来。写进代码的算术规则、留好“以上都不对”出口的选项模板、用业务数据反复校准的门槛,这些活比接API难得多。

第二课关乎组织能力评估。Jev的把握衡量的是“在这几个答案里偏向哪一个”,不衡量答案本身对不对。把握95%的意思是“这几个里面最像这个”,读成“95%等于100%”就错了。管理工具给的是不带偏见的员工情况,而非只考虑管理者对下属的绩效评价。对零件型AI的能力边界,同样需要客观数据来校准,而非凭直觉判断。

第三课是中文市场的窗口期。同样篇幅财报章节,中文消耗计费单位明显更高,更容易撞上单次读入上限。智源BGE、阿里Qwen3排序模型在搜索风控链路每天跑无数次,但被当成调用模型,没人包装成独立品类、定出独立计价单位。Jev发布几天后开源仿制版就冒出来,最受关注的Laya用ModernBERT-large纯编码器架构,底座来自中国团队的开源模型,做成商业产品的却是旧金山公司。把一次判断单价打到零,这条路国内还没人走。

金鸥品牌榜·2026年度创新案例库开放申报了。免费提报,独立评估,入榜品牌将获得电子版《入榜证明》及年度专题公示,优秀案例可获得深度专访+全平台分发。如需修改或发布文章,请加微信号:sheisceo

阅读量:1356
阅读时间:3分钟