Jev:一种只输出决策分数的新型模型
TypeSafe AI 上周发布了 Jev,并把它称为一种新的 “System One models”。相比这个命名,“决策模型”可能更容易理解:它不像常规大语言模型那样生成一段文本,而是接收文本输入,然后输出与分类、是/否判断、评分相关的浮点数,以及对应的置信度。
TypeSafe 对 Jev 的描述可以概括为:把非结构化状态输入模型,得到类型化的概率决策输出。
Jev 和常规 LLM 有什么不同?
常规 LLM 通常按输入 token 和输出 token 收费,而且输出 token 往往更贵。Jev 的计费方式不同:只收输入费用,输出免费。其首个模型的输入价格为每百万 token 0.042 美元,低于 OpenAI GPT-5 Nano 的每百万 token 0.05 美元。
Jev 的使用方式是:先构造一个 “state” 对象,其中可以包含字符串、字符串数组,或一组键值对。这个对象可以表示一篇文章、一位客户,或任何类型的记录。随后,把这个对象和一个或多个问题一起发送给 API,模型会针对每个问题返回结果。
三类问题形式
Jev 支持三类问题:
-
是/否问题
Jev 称其为 “Noul” 问题。TypeSafe CEO 在 Hacker News 上确认,这个名称来自 Bernoulli,即伯努利分布。用户提出一个陈述,模型返回 0 到 1 之间的浮点数,表示它认为该陈述为真的置信度。 -
选择题
模型从用户提供的一组选项中选择答案。返回结果不仅包含一个置信度,也包含所有选项上的概率分布。 -
评分题
用户提供一组带描述的数值等级,模型会在这个范围内返回一个浮点评分。
Jev API 可以接受单个文档作为 “state”,并在上下文窗口允许的范围内同时提交多个问题。这些问题会并行评估,因此提交多个问题的耗时理论上接近提交一个问题。
适合做什么?
用“决策模型”的框架来看,Jev 适合被表达为分类任务的场景,例如:
- 垃圾内容检测
- 自动打标签
- 优先级判断
- 排序与重排
作者还尝试将 Jev 用于搜索结果重排:先用 BM25 这类低成本算法取回 100 个候选结果,再让 Jev 根据原始查询对这些候选结果进行相关性评分。
不过,Jev 1.13 的相关文档也提示了它的短板:目前它并不擅长处理数字、日期,以及“对抗性内容”。
黑箱问题更明显了
Jev 的一个重要问题是:它把机器学习系统进一步推向黑箱。
LLM 本身已经是黑箱。即便可以要求它解释判断理由,也无法保证解释一定可靠或准确。而 Jev 连这一步都没有:无论输入多少文本,最终得到的只是一个浮点数。
例如,如果 Jev 把某段内容标记为垃圾信息,用户很难知道到底是哪些信号影响了判断。
这也使偏见问题更加重要。作者特别提醒,不希望有人用 Jev 来给求职者排名,因为一个浮点数可能隐藏模型内部难以察觉的偏见,而通过实验拆解这些偏见会很困难。
作者还做过一个小实验:让 Jev 对旧金山湾区所有城市进行“是否是好城市?”的是/否判断评分。结果中,Cupertino 排在最前,East Palo Alto 排在最后。这个结果本身足以说明,这类模型在价值判断类任务中需要非常谨慎。
因此,在使用 Jev 时,评估和结构化实验比普通 LLM 项目更加重要。好在 Jev 成本很低,运行数百甚至数千条实验提示的费用可能只有几美分。
社区中的非常规玩法
Jev 发布后,社区很快出现了一些有趣的实验:
- jevchat:Kyle Pena 把 Jev 改造成一个聊天模型。它每一步都问 Jev 一个问题:在用户问题和已经写出的回复基础上,下一个符号应该是什么?效果被描述为“糟糕的聊天模型”。
- jev-leftpad:Fatih Kadir Akın 用 Jev 实现 left-pad。提示大意是:“为了达到目标长度,值前面需要多少个空格?”选项从 0 个空格到 10 个空格。
- jev-2048:Andy Gayton 用 Jev 来玩 2048 滑块游戏。
这些项目更像是探索边界的实验,展示了这种“只输出决策”的模型能被如何重新组合。
开放权重复刻也开始出现
社区中也已经有人尝试基于开放权重模型复刻类似 Jev 的系统。Kev 是其中一个例子,它使用 Qwen 3.5 生成了 0.8B、4B 和 9B 规模的模型。
此外,JevBench 这样的基准也已经出现,用于比较“Jev 类决策模型”。考虑到 Jev 发布还不到一周,围绕它产生的社区活动已经相当密集。
小结
Jev 的意义不在于替代聊天模型,而在于把“语言理解”压缩成结构化决策输出:分类、判断、选择、评分。它便宜、快速,适合大规模评估类任务;但同时,它也更不透明,更需要严肃的评估体系和偏见测试。
对于需要高频、低成本、结构化判断的应用,Jev 代表了一条值得关注的方向。但在涉及人、价值判断或高风险决策时,仅凭一个浮点数做决定显然并不稳妥。
