Jev 两天内引出 6 个复刻版本:判别式决策模型为何突然走红

Latent Space7 天前

Jev 热度迅速升温

Jev 发布后在两天内获得了大量关注。其发布视频据称达到 3600 万次观看。作为对比,同期被提及的 OpenAI Navier-Stokes 结果约为 7400 万次观看,Anthropic Fable 5 约为 5700 万次观看。

Vercel 也表示,Jev 在 AI Gateway 历史上是被采用最快的模型之一:首日触达约 13% 的团队,约为 GPT-5.6 系列的 2 倍、Fable 5.1 的 6 倍。

Jev 本身并未开源,这直接引发了大量架构猜测、复刻尝试和示例演示。讨论的核心集中在:它是否更接近 ModernBERT 一类编码器模型,还是基于扩散模型;以及它作为非生成式“决策模型”能否成为 LLM 工作流中的新基础组件。

6 个类 Jev 实现

目前社区已经出现多个复刻或类 Jev 项目,主要方向包括编码器判别模型、扩散模型、Qwen 微调和轻量注意力模型。

1. Laya

Laya 约 4.21 亿参数,采用 ModernBERT-large 编码器,并额外加入两个 Transformer 层,用于对用户提供的选项进行打分。

其方法包括:

  • 在序列嵌入上使用 PPO;
  • 输出逐轮转换轨迹;
  • 给出 0.0 到 1.0 的概率分数。

相关讨论中也有一些争议:

  • 有人认为项目作者没有获得足够认可;
  • 有人声称其使用 RLCD,但尚未给出充分论证;
  • 其置信度被认为更偏向基于熵的估计,而不是经过校准的概率。

2. DiffusionGemmaJev

DiffusionGemmaJev 从扩散模型角度尝试复现 Jev 的能力。有讨论称,它在部分基准上表现接近 Jev。

3. Bespoke Nimble

Bespoke Nimble 是基于 Qwen3.5-9B 的 LoRA 微调方案,使用对比式数据筛选方法。

在其自建评测中:

  • Qwen 基座从 66% 提升到 90%;
  • Jev 的对应成绩为 93%;
  • 推理延迟报告为 H100 上约 100ms;
  • 可用于本地运行场景。

不过,该结果来自项目方或社区自建评测,尚缺乏统一标准基准验证。

4. SemIf / OpenJev

SemIf(原 OpenJev)使用 4B 和 35B 规模的因果 Qwen3.5 骨干模型,并在最后一个 token 上接入一个小型三分类 NLI 分类器。

它与 Laya 的差异主要在于:

  • Laya 更偏编码器和选项打分架构;
  • SemIf 更接近因果语言模型骨干加分类头的方案。

5. Jevlike

Jevlike 是一个轻量级选项注意力模型,使用 40K 字节嵌入。

其基本思路是:

  • 每个候选项被表示为 query;
  • query 从共享上下文表示中读取信息;
  • 最后为每个候选项输出分数。

6. Kev-0.5B

Kev-0.5B 基于 Qwen2.5-0.5B,在其上加入 LoRA adapter 和一个小型 readout head。

它的定位是一个更小、更轻量的类 Jev 模型,目标之一是在 MacBook Pro 等本地设备上运行。

为什么 Jev 引发关注?

Jev 被讨论最多的不是聊天能力,而是它作为非生成式决策模型在系统中的位置。

一些开发者将其称为“System 1”式组件:不是负责长文本生成或复杂推理,而是负责快速判断、路由、筛选和分类。

被反复提及的应用包括:

  • 请求路由;
  • 引用选择;
  • 是否升级给人工处理;
  • 法务或运营流程中的决策;
  • 工具调用选择;
  • 浏览器自动化中的下一步动作判断;
  • 通知、界面适配和设备端传感器决策。

这种模型的潜在价值在于:如果它能以更低成本、更低延迟给出可靠判断,就可以承担过去由小型生成式模型完成的一部分控制流任务。

早期集成场景:浏览器与工作流控制

目前较有说服力的应用集中在浏览器和计算机使用工作流中。例如:

  • 将事故报告分类到不同升级路径;
  • 在浏览器任务中辅助结构化决策;
  • 与 LangChain、Cline 等工具结合,用于浏览器操作或插件工作流。

从这些案例看,Jev 更像是工作流控制平面的一部分,而不是传统意义上的聊天机器人。

关键问题:数据与基准仍不清晰

围绕 Jev 和复刻模型,仍有几个重要问题没有解决。

首先是数据。已有讨论指出,相关数据被承认为 100% 合成数据。合成数据能快速构造训练集,但其覆盖范围、偏差和泛化能力仍需要更严格验证。

其次是基准。许多演示强调速度和延迟,但对于“决策质量”的评估还缺乏统一标准。不同项目使用不同自建评测,很难直接横向比较。

第三是概率校准。Jev 类模型常被用于路由和升级决策,如果输出概率没有经过可靠校准,就可能在实际系统中带来误判风险。

小结

Jev 的走红说明,AI 系统并不只需要更强的生成模型,也需要更便宜、更快、可嵌入工作流的判断层。

两天内出现多个复刻版本,表明社区正在快速探索这类“判别式决策模型”的边界。但目前关于架构、数据、评测和真实生产效果仍缺乏统一答案。对开发者来说,Jev 值得关注,但更适合作为系统组件实验,而不是已经定型的新范式。

评论

请登录后发表观点

暂无数据