阿里通义 Qwen3 模型技术报告全公开-品玩

品玩5月15日讯，据爱范儿报道，阿里通义千问正式公开了其 Qwen3 系列模型的技术报告。在技术报告中，用户可以深入了解到 Qwen3 模型架构、预训练及后训练过程、模型性能表现等诸多此前尚未公布的技术细节。

据介绍，Qwen3 的核心创新在于将两种模式整合至统一框架：思考模式（用于复杂多步推理）和非思考模式（基于上下文的快速响应）。这一设计无需切换模型（比如对话优化模型 GPT-4o 和专用推理模型 QwQ-32B），而是在同一个模型内根据用户查询或对话模板进行动态模式切换。同时，Qwen3 引入思考预算机制，允许用户在推理过程中自适应分配计算资源，从而根据任务复杂度平衡延迟与性能。

此外，通过利用旗舰模型的知识，Qwen3 团队显著降低了构建轻量级模型所需的计算资源，同时确保其性能具有高度竞争力。