Jev 实测:把判断从大模型里拆出来
2026 年 9 月中旬,一个叫 Jev 的模型在 AI 圈刷屏。它来自创业公司 TypeSafe AI,创始人之一是 ChatGPT 的共同发明人。而它最反常识的地方是:不生成任何文本。
传统大模型的接口是消息进、文本出,Jev 是材料进、判断出:state 加 questions 进,类型化答案、概率和置信度出。一次请求可以带多个问题,并行求值,互不干扰。
问题只有三种原语:noul 是非题,返回 0 到 1 的概率;choice 从固定选项里选一个;score 按有序标尺评分。比如三档低中高返回 1.97,对应分布是低 0、中 0.03、高 0.97,所以真正该读的是概率分布,不是那个分值。
把它的每一块拆开,都是旧的:判别式分类、概率校准、风控的拒绝推断、zero-shot 分类、意图识别,它没有发明任何一块。唯一可辩护的新位置是:把判定标准从训练资产变成请求参数。
过去这两件事是互斥的:要可靠就训分类器,标准冻结在标签里;要灵活就调大模型,标准变成 prompt,代价是延迟和成本。Jev 赌它们可以不互斥——名字里的杰文斯,说的就是判断更便宜,不是模型更聪明。
官方站点还在白名单,但 OpenRouter 已经上架,用现有账号就能调。我实测多次:端到端延迟 303、395、946 毫秒,含跨境网络往返;单次成本约 $0.00002,1 美元大约能跑 5 万次判定。
一次真实的客服工单判定里,urgency 是 0.98,department 选中 technical。confidence 和 probabilities 是两件事:前者是判断有多可靠,后者是选项怎么分布,自动化阈值通常看 confidence。
两个实测发现。语言上,官方文档说主训练语言是英文,CJK 可用但准确率较低,稳妥做法是材料保留原文、判定标准用英文写。确定性上,同一输入两次跑出 0.06 和 0.05,所以阈值不要卡在 0.5,要么留缓冲带,要么多次采样。
state 支持三种形态:string、object 和 array。object 是官方推荐的默认形态,因为命名字段本身就是信息,问题可以用反引号写路径,精确指向具体字段。我实测确认:数字、布尔、null 和三层嵌套路径都支持。
设计原则有三条:判断标准放 instructions,被比较的事实放 state;只放判定要用的上下文,别把整篇报告照抄进去;值保持原生类型。API 不校验结构,schema 只存在于你的代码里,每个场景都该写一个 state 构造函数。
落地时把 rubric 从 prompt 挪进代码,拆成多个原子问题。最实际的收益是置信度分级路由:confidence 大于等于 0.9 自动放行,0.6 到 0.9 转人工复核,命中确定性规则直接驳回。它不产出理由,返工反馈靠预置模板拼。
先问一个问题:如果判定成本降到百分之一、延迟降到二十分之一,你的架构会不会变得不一样?如果不会,它对你就是多余的。四个问题全部为是才值得:标准是否固定、是否大量重复执行、答案范围能否提前枚举、结果是否直接驱动下一步动作。
它也有局限。官方 benchmark 是自测的,准确率 67.8%,和 GPT-5.6 Terra 基本打平,比最强的 Sol 和 Opus 5 低 5 到 6 个点。它不产出理由,合规审计要把低置信度样本转给能解释的模型。还在 early access,定价未经验证。
Comments
Post a Comment