Qwen3.8-Max:2.4T 参数开源权重模型可在 GB300 NVL72 上部署
NVIDIA Generativ8 天前
阿里巴巴发布了 Qwen3.8-2.4T-A95B(Qwen3.8-Max)的开源权重。这是其规模最大的开源权重模型,目标是将接近前沿模型的能力带入开放生态。
关键信息
- 模型名称:Qwen3.8-2.4T-A95B,也称 Qwen3.8-Max
- 参数规模:总参数量 2.4T
- 激活参数:每个 token 激活 95B 参数
- 架构类型:细粒度混合专家模型(MoE)
- 注意力机制:结合 full attention 与 linear attention 的混合设计
- 部署方向:可在 NVIDIA GB300 NVL72 上提供服务
- 推理特性:支持可配置推理
为什么值得关注
Qwen3.8-Max 的核心看点在于,它把超大规模 MoE 模型以开源权重形式释放出来。2.4T 总参数与 95B/token 激活参数的组合,意味着模型规模很大,但推理时并不会激活全部参数,而是通过 MoE 路由选择部分专家参与计算。
从部署角度看,文章重点讨论的是在 NVIDIA GB300 NVL72 上服务该模型,并强调可配置推理能力。这类配置通常对实际服务很关键,因为不同场景会在推理质量、延迟、吞吐和资源成本之间做取舍。
社区讨论点
- 超大规模开源权重模型是否会推动企业自部署大模型的门槛下降?
- MoE 架构在推理服务中的成本优势,是否足以抵消部署复杂度?
- 可配置推理会不会成为大模型服务的标准能力之一?
- GB300 NVL72 这类高端硬件平台,对开源大模型生态的影响会有多大?
目前可确认的信息主要集中在模型规模、架构特征和部署平台。关于具体性能指标、上下文窗口完整长度、基准测试结果和实际部署成本,仍需更多完整技术细节才能进一步判断。
