AI 日报:Codex 使用激增,智能体工程走向执行与可观测

Latent Space12 天前

概览

近两日 AI 社区的讨论重点集中在三个方向:

  1. 编程智能体从“聊天式辅助”加速转向“可执行任务系统”;
  2. 开源模型通过量化与压缩继续推进本地部署能力;
  3. 多模态系统开始从静态理解走向实时感知、长视频推理与世界模型。

其中,OpenAI 的 Codex 与 ChatGPT Work 使用增长尤其受到关注。有公开发言称,Codex 与 ChatGPT Work 的使用量一周内增长了 2.5 倍;另有社区讨论称,Codex 活跃用户数可能在约一天内增加 100 万。相关说法仍主要来自社交平台公开信息与社区观察,需谨慎看待。

编程智能体:从对话走向执行

OpenAI 智能体产品需求快速上升

OpenAI 相关人员表示,Codex 与 ChatGPT Work 的使用量在一周内增长 2.5 倍,并称 GPT-5.6 Sol 的需求非常强,可能在基础设施扩容前带来一定服务压力。

围绕这一变化,开发者生态也出现了快速响应:

  • JetBrains 将 Codex 列为推荐智能体;
  • 有开发者强调 Codex 中相对低调的“问题工具”能力;
  • OpenAI 开发者团队展示了使用 GPT-5.6 从头构建命令行评测工具的案例;
  • OpenAI 还进行了多轮使用额度重置,引发社区用户关注。

这些信号表明,编程智能体正在从“代码建议工具”逐渐变成能够承担更完整开发流程的执行环境。

工具链、可观测性与评测环境变得关键

社区讨论的另一个共识是:模型能力本身已经不再是唯一差异点,智能体运行环境的质量正在成为竞争关键。

多个案例体现了这一趋势:

  • 有开发者提醒,过时的 agents.md 指令可能像“自我注入的提示攻击”一样,导致长任务卡顿数小时;
  • LangChain 为 Codex 增加了追踪能力,并将 LangSmith 的可观测范围扩展到 Cursor、Copilot、Pi 和 OpenCode,覆盖工具调用、子智能体与 token 使用情况;
  • Hermes 更新了并行工具调用能力,并在 Hermes Agent 中展示了重置额度相关功能;
  • 有观点认为,能够把自身业务价值编码进评测体系与运行环境的公司,可能比单纯依赖资本或模型规模的公司拥有更持久优势。

这意味着未来的智能体竞争不只是“谁的模型更强”,还包括谁能提供更可靠的任务编排、更清晰的调试方式和更贴近业务场景的评测环境。

开源模型:压缩、量化与本地推理

低比特模型推动本地部署

开源模型社区继续围绕极限压缩展开探索。

PrismML 发布了基于 Qwen 3.6 27B 的 Bonsai 27B,并提供两个紧凑版本:

  • Ternary Bonsai 27B:约 5.9GB,等效 1.71 bit;
  • 1-bit Bonsai 27B:约 3.9GB,等效 1.125 bit;
  • 授权协议为 Apache 2.0。

相关发布强调,这些模型不仅体积较小,还试图保留多模态、工具调用、长上下文和智能体工作流能力。社区演示中,Hermes 在 RTX 5090 上运行了相关模型,也有移动端部署方向的展示。

腾讯混元也发布了 1-bit 与 4-bit Hy3,称其 295B 旗舰级模型可通过 llama.cpp 和 MTP 在单张 GPU 上服务。

量化拓宽开源模型使用边界

量化工具与本地推理方案也在持续扩展。社区中有人宣布为 Gemma-4 系列以及 Qwen3.5-122B-A10B、GLM-4.7-Flash 等模型提供 NVFP4 动态量化。

另有本地部署讨论提到,多节点 DGX Spark 配置可运行:

  • 1M 上下文的 DeepSeek v4 Flash;
  • MiMo-V2.5;
  • 跨四节点部署的 GLM 5.2 NVFP4。

这些信息共同指向一个趋势:本地推理已不再只是实验性玩法。在低比特权重格式、优化推理框架和更成熟智能体工具链的配合下,本地模型开始进入更严肃的智能体工作流场景。

多模态系统:实时视觉、长视频与世界模型

实时多模态从“看完再答”走向持续感知

OpenMOSS 发布了 MOSS-VL-Realtime,这是一个 11B 视觉语言模型家族,采用 Apache 2.0 协议,支持 256K 上下文,面向连续视频流。

其核心特性包括:

  • 在生成回答时继续观看视频流;
  • 随着场景变化修正或打断回答;
  • 在证据不足时保持沉默;
  • 面向离线、流式与实时场景使用统一模板。

技术讨论中还提到,该系统采用跨注意力架构,并使用 XRoPE 统一时间与空间位置表达。

这类能力意味着多模态模型正在从“输入一段图像或视频后回答问题”,走向更接近人类观察方式的持续感知。

长视频理解转向主动证据搜索

长视频理解也出现了从“被动读取帧”向“主动寻找证据”的变化。

社区总结提到 OmniAgent,该系统基于 Qwen2.5-Omni-7B,采用 Observation–Thought–Action 循环,让模型只请求自己需要的画面帧或音频片段。

相关结果显示:

  • OmniAgent-7B 在 LVBench 上得分 50.5;
  • Qwen2.5-VL-72B 得分为 47.3;
  • OmniAgent 消耗约 203 帧,而对比方案消耗约 768 帧。

训练方法方面,相关讨论称,被动监督微调反而会损害表现,而 5.8 万条智能体轨迹以及基于 TAURA 的熵加权强化学习带来了改进。

这一方向的关键变化在于:视频理解不再只是把更多帧塞进上下文,而是让模型主动决定“该看哪里、该听什么、何时停止”。

世界模型向更长时域模拟推进

世界模型方向也出现了新的工程讨论。有团队介绍了全模态世界模型的数据栈,强调需要 PB 级视频数据、六个流水线阶段,以及数据质量提升在“生成视频”和“理解视频”两端带来的双重收益。

从这些讨论看,视频、运动和交互正在被视为不同于静态图像的新型数据类型。要让模型理解现实世界,仅靠把视频拆成一系列图片可能并不充分,还需要专门的数据采集、基础设施和建模方式。

小结

本轮 AI 社区动态中,值得关注的不是单个产品更新,而是几条主线的同时推进:

  • 编程智能体正在承担更完整的软件工程任务;
  • 工具链、评测、可观测性和运行环境成为智能体产品的核心竞争层;
  • 低比特量化和模型压缩让本地推理能力继续增强;
  • 实时多模态、长视频主动推理与世界模型正在成为下一阶段研究重点。

这些变化共同说明,AI 系统的竞争正在从单点模型能力,转向模型、工具、环境、数据和工作流的综合工程能力。

评论

请登录后发表观点

暂无数据