参数量不再是核心指标:GLM-5.3押注后训练扩展

Latent Space1 小时前

参数量正在失去解释力

过去讨论大模型时,参数量往往是最醒目的指标。但智谱AI CEO、清华大学教授唐杰认为,单独询问“模型有多少参数”已经不足以判断模型能力。

他的核心观点是:参数量必须与数据规模、算力如何投入,以及模型由谁、在什么条件下运行等因素结合起来理解。随着推理和智能体工作负载越来越重要,传统以参数量为中心的缩放思路正在发生变化。

记忆与推理需要不同的扩展方式

相关讨论将模型能力进一步拆分:记忆类能力更受益于更多参数,而推理能力则更依赖后训练数据和更高的“有效深度”

文中引用的观点认为,当模型已经达到足以承载知识的参数规模后,一些高级能力并不会简单随着总参数量继续增长。例如软件漏洞发现等任务并非单纯的信息检索或记忆问题,而是需要模型维持较长的因果链,在超过20个推理步骤的过程中仍然保持任务上下文。

这意味着,对于复杂推理和智能体任务,“模型多大”可能不如“模型接受了什么样的后训练”重要。

GLM-5.3把增量押在长周期强化学习上

GLM-5.3此次被强调的能力提升,主要来自长周期环境中的强化学习(RL)

训练环境覆盖了更广泛的真实生产工作流,其中一些任务被设计成接近资深工程师数天才能完成的工作量。例如在机器学习基础设施任务中,模型可能获得计算集群、存储系统、内部文档、代码库和实验结果等资源,然后需要自行完成:

  • 定位训练系统中的性能瓶颈;
  • 实现优化方案;
  • 运行实验验证效果;
  • 在保持正确性的同时实现可衡量的端到端加速。

训练目标因此不再只是完成一个局部问题,而是让模型承担一项复杂工作的完整执行过程,减少用户逐步拆解任务和持续监督的需要。

后训练的瓶颈正在转向“环境”

随着智能体能力提高,后训练扩展面临的难点也开始从模型本身转向训练环境。

一个适合强化学习的专业任务环境需要同时满足几个条件:能够实际执行、结果可以验证,并且足够接近真实工作。更重要的是,这类环境需要大规模生成,而不能依赖少量人工构造的任务。

GLM-5.3采用了端到端合成环境的流水线,部分任务的强化学习奖励信号也由系统生成。其流程包括:研究智能体从真实工作中提取任务模式,将其转化成长周期、多步骤并包含隐藏状态的可执行环境;随后由评判智能体尝试完成任务,以确认任务本身确实可解。

验证器在不知道参考答案的情况下生成,同时利用求解轨迹寻找并修补可能被模型利用的奖励漏洞。通过既定检查后的验证器,可以产生用于训练的二元奖励信号。

从“Scaling Parameters”转向“Scaling Intelligence”

唐杰进一步提出,应当从多个维度理解模型扩展,而不是继续执着于参数总量,其中还包括MoE模型的稀疏性等因素。

这一变化背后的逻辑是:当基础知识容量达到一定水平后,决定复杂任务能力上限的因素可能逐渐转向后训练规模、任务环境质量、有效推理深度以及推理阶段可以投入的计算资源

如果这一方向持续成立,未来比较大模型时,仅看“多少B参数”会越来越难以解释真实能力。对于面向编码、研究和长周期智能体工作的模型而言,训练环境和后训练方法可能成为更值得关注的指标。

评论

请登录后发表观点

暂无数据