品玩

科技创新者的每日必读

打开APP
关闭

2.4万亿参数Qwen3.8发布当天,智源FlagOS让九大芯片同步“开箱即用”

5小时前

阿里巴巴开源超大规模MoE模型Qwen3.8-2.4T-A95B,众智FlagOS社区同步完成Day0多芯片适配。Qwen3.8-2.4T-A95B已在平头哥、英伟达、摩尔线程、华为昇腾、沐曦、昆仑芯、海光、清微智能、隧原等9家AI芯片上完成基于FlagOS统一开源技术栈的多芯适配、精度对齐与部署验证,针对不同芯片情况提供包括BF16、FP8、INT8等多种精度的版本,开发者可直接获取对应芯片的开箱即用方案。

从今年2月首次开展MiniCPM4.5-o模型的多芯片Day0适配,到今天实现Qwen3.8-2.4T模型在9款芯片上的Day0适配,Flag OS已累计完成来自7大头部模型团队、12款主流开源模型、覆盖多达10款芯片的跨芯Day0适配,向AI芯片与大模型产业验证了:基于统一、开放的系统软件栈,实现沿模型"—次开发、多芯快速适配"已具备规模化落地能力。

本次发布的Qwen3.8-2.4T-A95B是阿里巴巴开源模型系列中规模最大、能力最强的一代,首次将Qwen-Max级别的模型开放出来。主要特性:

·超大规模Mo E架构,总参数2.4T,激活参数95B,纯文本模型

·编程、专业工作、科研、长程智能体任务能力显著提升;支持reasoning_effort调节推理深度,preserve_thinking保留历史推理

·原生262,144 tokens,可扩展至1,010,000;提供BF16/FP8权重,兼容vLLMSGLang、Token Speed

在Coding Agent相关基准测试中,Qwen3.8-Max相比Qwen3.7-Max有明显提升:Terminal Bench 2.1从74.5升至86.6,SWE-bench Pro从60.6升至67.7,接近Opus 4.8(69.2),Paper Bench从64.8升至93.0,并超过Opus 4.8(80.3)。

本次Qwen3.8-2.4T模型的适配,虽然相比Qwen3.5/Qwen3.6模型主体结构变化有限,但最重要的挑战是模型参数规模比Qwen3.5-397B扩大了6倍。为了让当下已经部署的主流AI芯片能跑起来,Flag OS需要解决因参数规模巨大带来的一系列系统优化问题。为了解决超大规模参数问题,本次Flag OS技术栈新增了面向多款AI芯片的统INT8量化支持,通过Flag OS-Compressor多芯片模型量化工具链,实现了对Qwen3.8的FP8/BF16原生权重到INT8的两条量化压缩路径,并完成量化推理算子的在多款AI芯片的适配。量化迁移后的权重,在多种AI芯片上评测,与英伟达原生基于CUDA的FP8版本对照,误差平均分偏差均在对齐区间内,保证了量化+跨芯迁移后的模型质量。基于众智Flag OS建立的从编译器、算子库、多芯片框架统一plugin等技术,Flag OS团队得以快速完成了模型压缩量化、跨芯适配及验证、精度对齐评测、开源版本发布等重要步骤。

—、从Day0适配到规模化验证:打通前沿模型与多元算力的"首日可用"

Qwen3.8-2.4T的多芯片Day0适配,是Flag OS紧跟前沿模型发布节奏、实现新模型“首日多芯可用”的又一次实践。自今年2月首次开展Day0适配以来,Flag OS技术团队已在6个月内完成10余款

这一能力回应了国产AI算力产业化落地的两项核心需求:一方面,使云服务与应用生态能够第一时间部署最新模型;另一方面,让既有算力基础设施持续承接模型演进,延长使用周期、释放存量算力价值。

1、为国产AI算力云服务抢占新模型"首发窗口"

对国内云厂商、智算中心和新兴Token算力服务商而言,每一次大模型发布,都意味着一次新的模型迁移与底层适配。用户希望第一时间在各种国产AI算力上使用最新模型,但不同芯片的适配链路相对独立,往往需要重复投入大量工程资源。上线速度因此不仅是技术能力,也直接决定云服务商能否抓住新模型发布后的市场窗口。

这一痛点对中小型Token算力服务商尤为突出。由于采购规模和技术资源有限,它们往往难以推动芯片厂商针对单一模型开展专项适配,也难以长期维持完整的底层适配团队,因此更加需要Flag OS这样的开源第三方平台提供公共技术支撑。

Flag OS Day0适配将新模型从发布到多芯可用的周期压缩至24小时以内,使中小型算力服务商能够基于国产芯片快速上线推理API和MaaS服务,无需重复投入大量人力进行底层开发。

目前,腾讯云HAI社区、超算互联网等多个云平台已将Flag OS适配的模型纳入其容器镜像中心。开发者可直接拉取镜像并部署至云端加速卡,快速构建面向自身业务的MaaS推理服务。这表明Flag OS Day0适配正在从技术验证进一步走向云服务交付,缩短国产算力从"支持新模型"到"形成可用服务"的最后一公里。

2、让存量算力持续承接前沿模型:Flag OS释放硬件投资的长期价值

大模型规模持续增长,正在加快AI芯片的迭代节奏。对于以多年周期规划和建设的AI算力集群基础设施,能否持续承载最新模型,直接关系到智算中心AI服务器的利用率和产业投资的可持续性。Flag OS希望通过量化、算子优化和跨芯适配,为来自多个芯片厂商的存量AI算力继续运行前沿模型拓展空间。

以Qwen3.8-2.4T为例,Flag OS-Compressor已支持W8A8量化,将权重和激活由BF16压缩至INT8,显著降低模型的显存占用与访存压力,同时也解决了当下80%以上存量AI算力不能支持FP8的问题为了让模型在不同代际的国产AI芯片上部署,通过Flag OS技术栈进一步针对量化后的权重规模单卡显存、卡数、内存带宽以及并行通信方案进行全栈优化,让存量的当代和上一代AI算力也有机会继续承载最新的超大规模Mo E模型。

对智算中心重资产场景而言,这不仅是延长设备服役周期的问题,更关系到算力投资的长期回报通过量化与系统软件优化弥补部分硬件代际差距,可以提高存量设备利用率,缓解因模型快速演进带来的硬件更新压力。其目标并非让旧硬件获得与新一代硬件相同的性能,也不是无条件延长所有设备的生命周期,而是在部署条件、模型精度和性能表现均可验证的前提下,为国产算力持续承接前沿模型提供可持续经济的选择。

取消 发布

下载品玩App,比99.9%的人更先知道关于「阿里巴巴」的新故事

下载品玩App

比99.9%的人更先知道关于「阿里巴巴」的新故事

iOS版本 Android版本
立即下载
AI阅读助手
以下有两点提示,请您注意:
1. 请避免输入违反公序良俗、不安全或敏感的内容,模型可能无法回答不合适的问题。
2. 我们致力于提供高质量的大模型问答服务,但无法保证回答的准确性、时效性、全面性或适用性。在使用本服务时,您需要自行判断并承担风险;
感谢您的理解与配合
该功能目前正处于内测阶段,尚未对所有用户开放。如果您想快人一步体验产品的新功能,欢迎点击下面的按钮申请参与内测 申请内测