品玩

科技创新者的每日必读

打开APP
关闭

Qwen3.8-27B就是新的模型斩杀线

人人都爱Qwen3.8-27B。

王兆洋

发布于 7小时前

最能动手折腾模型的开源社区开发者,往往也是最会玩梗造概念的一群人。最近半年,他们最爱的一个概念是“斩杀线”。

这个词借自游戏,后来在更广泛的场合里变得更加流行。它原指血量落到某个数字以下,对手下一回合就能把你带走,比赛实际上已经提前结束。

把它套到模型上,过往一段时间人们指代的是 DeepSeek 一直在扮演的角色:一个新模型出来,先和 DeepSeek 比能力,再比价格。如果性能上不去、价格又降不下来,发布当天基本就失去了讨论价值。

从 R1 开始,DeepSeek 一度成为模型世界默认的那条线。

但现在,这条线看起来要换人了。

8月14日,Qwen3.8-27B 发布,开源两天下载量破百万,登顶 Hugging Face 全球趋势榜,编程 Agent 工具 Cline 的开发者里,它只用四天就成了被选择最多的本地模型。Artificial Analysis 的 Intelligence Index 给了它 52 分,已经进入 GPT-5.6 Luna、DeepSeek V4 Flash 这一档模型所在的区间。开发者给它起了一个更直白的外号:

“本地 Opus 4.6”。

当然,这个模型还是一个进化中的模型,一个综合 benchmark 的接近,不能直接等同于真实体验完全追平 Claude Opus 4.6。在 Terminal-Bench、HLE 等高难度任务上,Qwen3.8-27B 仍然存在差距。

另外,在很多评测里,它还有一个很突出的特点:特别能“想”,很多任务会生成远多于同类模型的 reasoning token,用时间换能力——Simon Willison 实测时,默认推理档让它画一只骑自行车的鹈鹕 SVG,它想了 21 分钟。

不过这些都没有改变真正重要的地方:

它只有 270 亿参数。

这意味着,几个月前还需要数百亿、数千亿乃至更大规模模型才能稳定达到的能力区间,现在第一次被压进一个消费级硬件真正有机会容纳的尺寸。

而在4-bit 量化之后,模型权重可以压到 17GB 左右。一张 24GB 级显卡已经进入可以部署它的范围;拥有较大统一内存的 Apple Silicon 设备也能运行。当然,17GB 的权重不等于 17GB 内存就够了。真正运行还要给 KV Cache、上下文、视觉组件和运行时留空间,长上下文尤其吃内存。但事实上,重要的边界已经跨过去了。

过去,本地模型经常面临一个尴尬:跑得动的不够聪明,够聪明的跑不动。Qwen3.8-27B 第一次让这两件事情在一个非常有现实意义的尺寸上碰到了一起。

所以从现在开始,任何新发布的,不只是小尺寸的模型,甚至包括DeepSeek等模型在内,都会被开发者拿来先问一个问题:

比 Qwen3.8-27B 怎么样?

过不了这一关,很难再有讨论的价值。这就是新的斩杀线。

1

由DeepSeek 定义的上一条斩杀线,最重要的武器其实是性价比。

旗舰模型的能力,以 Flash 级的价格卖出来。开发者第一次意识到,顶级智能未必意味着昂贵 API。

但这套性价比仍然建立在云端。模型放在数据中心,开发者按 token 购买使用权。单价可以不断降低,只要 Agent 开始长时间工作,token 消耗仍然会持续累积——一个 Coding Agent 读代码库、改代码、跑测试、再修改,一项任务产生几十万 token 已经越来越常见。国内日均 token 调用量已经站上 140 万亿,比 2024 年初增长超过千倍。

而且单价也未必一直往下走。8月中,DeepSeek 完成了成立以来幅度最大的一轮提价,V4-Pro 高峰时段的输出价格从每百万 token 6 元调到 27 元,同步引入峰谷计费,智谱和 Kimi 此前也已相继调价。如果你的线画在报价单上,那就注定会跟着报价单移动。

也就是说,过去两年模型公司的竞争,基本是在回答:同样的智能,谁的 token 更便宜?但Qwen3.8-27B 把问题推进了一步:同样的智能,究竟需要多大的模型?

这是两种完全不同的效率。一个千亿参数模型便宜 30%,依然要住在数据中心里;一个 27B 模型如果能够完成过去千亿级模型才能完成的大部分工作,它改变的是模型部署的物理边界。

过去半年,行业所谓的“斩杀线”仍然大致锚在千亿级甚至更大的模型上。今天,参数规模缩到了 270 亿,智能水平却进入了上一代千亿级旗舰所在的区间。参数量缩了接近一个数量级,智能没有跟着掉一个数量级。

模型竞争因此出现了一个越来越重要的指标:智能密度。

每十亿参数究竟能装下多少能力?做到同样一件事情,需要多少显存、多少内存带宽、什么级别的机器?这些问题过去是模型评测的配角,现在正在走到前台。

原因也不复杂。对绝大多数真实任务而言,智能正在逐渐从稀缺走向过剩。其实我们今天大部分的真实 AI 任务,真正的瓶颈已经不是模型够不够聪明,而是这么聪明的模型能不能足够便宜、足够快、足够容易地跑起来。

企业知识库不需要解决 IMO,会议纪要用不上世界最强的推理模型,大量代码修改、信息抽取和后台 Agent 同样如此。模型能力达到某个阈值以后,再多五分 benchmark,对大量产品已经没有前五十分那么重要;但如果同样的能力从 200GB 显存降到 24GB,产品形态会直接改变。

Qwen3.8-27B 斩掉了这道硬件门槛。

2

Qwen3.8-27B 能力突破背后的原因,其实也不只是简单的“模型越来越强”能概括的。

过去两年,为了让大模型更便宜,行业最成功的一条技术路线是 MoE,混合专家。它的办法很好理解:模型里养很多“专家”,一次任务只叫其中一部分出来工作。这样可以把模型总容量做得很大,同时控制一次推理实际需要的计算量。DeepSeek 把这条路线推到了很高的位置。

但 MoE 有一个在云端不明显、到了个人设备上却很麻烦的问题,就是专家不工作,不代表专家不存在。模型的总权重仍然需要被存储,驻留在显存和内存里,或者在层级存储之间高效调度。稀疏激活可以大幅降低每个 token 的计算量,却不会让一个数千亿总参数的模型凭空缩成 20GB。

所以 MoE 特别适合数据中心——几十张甚至几百张 GPU 共同承载一个巨大的模型,再用稀疏激活降低推理成本。到了 PC、机器人、汽车和边缘设备,另一件事变得更重要:模型本身能不能放得下。

Qwen3.8-27B 是一个稠密模型。这意味着它没有 MoE 那种依靠大量闲置专家换容量的空间,效率必须从架构本身一点一点抠出来。

Qwen 在这一代继续使用混合注意力结构:64 层里 48 层是线性注意力,其余保留传统全注意力。线性注意力的一项重要价值,是长上下文运行时不需要像纯 Transformer 那样让 KV Cache 随序列长度不断膨胀;保留部分全注意力层,又避免完全牺牲模型回看细节和复杂上下文的能力。这是典型的工程取舍,在能力、显存和长上下文成本之间找平衡。

MTP,也就是 Multi-Token Prediction,解决另一个问题。大模型通常一个 token 一个 token 往外吐,本地推理很容易被串行解码速度卡住。MTP 让模型具备一次预测多个未来 token 的能力,配合 speculative decoding 提高生成吞吐。在云端,这可能只是又一项优化;在本地,它直接影响一个模型究竟是能启动还是真的能用起来。

此外,它还有原生视觉能力,Qwen3.8-27B 可以直接处理图像和视频,很多场景里不必再外挂一套视觉模型。

这几项技术单独拿出来都不是突然出现的新发明。真正困难的是把它们同时塞进一个 27B 稠密模型里,然后仍然维持足够高的智能。

这件事情显然也不是 Qwen 到 3.8 才突然想明白的。

3

回头看 Qwen 过去三年的路线,会发现 Qwen3.8-27B 并不是一次偶然命中。

2023 年 8 月,Qwen 第一批开源模型发布的时候,全世界的聚光灯还在 Llama 身上。几个月后,Qwen 同时放出了 72B 和 1.8B。

这个细节现在回头看很重要。也就是Qwen从第一年开始,小模型就不是旗舰模型旁边顺手附送的缩水版,而是它开源路线的一部分。

到了 Qwen2,参数尺寸进一步从 0.5B 一路铺到 72B;Qwen2.5 延续同样的做法;后来 QwQ-32B 又用 32B 这个尺寸专门挑战当时最热门的 reasoning 模型。这几年 Qwen 的产品线一直有一个非常鲜明的特点:尺寸特别全。大模型、小模型,Dense、MoE,通用、Coding、数学、视觉,不断往同一套模型体系里填。

这条路线在相当长一段时间里并不显眼。模型行业最容易获得关注的永远是那个最大的型号和榜单第一,尤其 DeepSeek R1 爆发以后,开源模型的叙事几乎完全被 DeepSeek 接管。Qwen 做的事情显得没那么性感:继续发模型,继续填尺寸,继续让开发者量化、微调、魔改。

但今天这件事情开始产生复利。

Hugging Face 今年的开源生态报告专门把 Qwen 拿出来讨论:Qwen 已经产生超过 15 万个明确的衍生模型,如果计算所有带有 Qwen 标签的模型仓库,数量超过 20 万;今年 Qwen 系列的下载量超过 30 亿次,超过 Google 和 Meta 的总和。报告同时观察到一个很重要的趋势:小模型的下载和实际部署量远高于超大型模型。原因很简单,绝大多数开发者并没有一个数据中心。

这解释了 Qwen 为什么会走到今天这个位置。

长期做小模型,积累的并不只是“怎么把参数砍掉”。训练数据怎么配,什么能力缩模型后最容易丢,教师模型和学生模型之间,应该保什么,量化之后哪部分最敏感,长上下文怎样降低内存消耗,开发者手里最常见的硬件是什么——这些细节需要一代一代模型实际发布之后,靠大量部署和反馈磨出来。

另一方面,大模型继续负责往上探能力边界。Qwen 的大尺寸 MoE 和小尺寸 Dense 并不是两条互不相关的产品线:这一代的旗舰是 2.4T 参数的 MoE,27B 和它共享同一套混合注意力骨架,更大的模型负责探索能力、生产数据和提供学习来源,经过验证的架构和训练方法,再逐渐向更小尺寸迁移——老师和学生长在同一个架构里。

所以今天回头看,Qwen 过去几年的技术路线其实很清楚:

大模型负责把智能做出来,小模型负责把智能压进去。

Qwen3.8-27B 是这两条路线第一次在一个非常醒目的位置汇合。它证明 Qwen 做了三年的“全尺寸”,并不仅仅是为了 Hugging Face 页面上多摆几个型号。真正的目标,是让同一档智能不断向更小的参数规模下沉。

27B 只是目前最引人注目的那个落点。

4

Qwen3.8-27B打开的是一类过去一直卡在中间的产品。

机器人就是最典型的例子。今天很多具身智能系统,本体真正能够长期运行的仍然是比较小的模型,碰到复杂视觉理解、任务规划或者高难度判断,再把请求送到云端更大的模型。原因并不神秘:本地跑得动的还不够聪明,够聪明的又太大。AI PC、汽车、智能眼镜和大量企业本地 Agent,本质上都面对同一个问题。这里缺的从来就是一样东西:足够强,同时真的塞得进去的模型。

硬件生态的反应最能说明问题。Qwen3.8-27B发布当天,NVIDIA 为它做了从 RTX 显卡、DGX Spark 到 Jetson 边缘平台的全线适配,机器人业务的官方账号专门发帖,说它已经为边缘准备好;官方博客强调的卖点,是开发者可以让敏感代码和专有数据留在自己的设备上。芯片公司为一个模型连夜铺路,赌的是自己的硬件销量。

Qwen3.8-27B 还远远没有小到能直接塞进一副眼镜或者普通手机,24GB 级显存目前也称不上真正的大众设备。但产业里一个重要的边界已经向前移动了。

当上一代旗舰级别的智能先从数据中心下降到一张消费显卡,“小模型”的春天正式到来。

Qwen3.8-27B 会成为新的一条斩杀线,它第一次把这条线明显地往设备侧挪了一步。以后判断一个模型有没有价值,问题不会只是它还能不能再聪明一点,还要看这一档智能,究竟能被压进多小的机器里。

毕竟当智能足够以后,谁能把它装进更多设备,谁才拥有更大的分发能力。这才是AI进入现实世界解决真问题的关键。

王兆洋

这家伙很懒,什么也没留下,却只想留下你!

取消 发布
AI阅读助手
以下有两点提示,请您注意:
1. 请避免输入违反公序良俗、不安全或敏感的内容,模型可能无法回答不合适的问题。
2. 我们致力于提供高质量的大模型问答服务,但无法保证回答的准确性、时效性、全面性或适用性。在使用本服务时,您需要自行判断并承担风险;
感谢您的理解与配合
该功能目前正处于内测阶段,尚未对所有用户开放。如果您想快人一步体验产品的新功能,欢迎点击下面的按钮申请参与内测 申请内测