不再卷低价,“量大管饱”才是大模型新的“分水岭”
8月26日晚,阿里发布并同步开源千问最新模型Qwen3.8-Flash。这款采用全新下一代架构的多模态混合专家(MoE)模型,以千亿总参数仅激活60亿(6B)的超高效率,在多项评测中超越Claude Opus4.6、接近Opus4.8。更关键的是,它的推理定价仅为每百万Tokens输入0.8元,输出2.7元,不到Opus4.6的1/40,比DeepSeek-V4-Flash忙时价格的1/3还低。
Qwen3.8-Flash的出现,将悄然重划大模型的“斩杀线”——从Token单价走向任务总成本,从“谁能做出最强的模型”转向“谁能用最低成本交付足够强的智能”。这一转变,或将重塑上游硬件产业的竞争逻辑。未来决定推理效率的,将不再只是GPU的FLOPS峰值,还涵盖HBM容量与带宽、CPU与GPU间的互联速度、KV Cache管理效率,以及推理框架能否有效减少数据搬运等。大模型的竞争,正从单一的算力比拼,走向模型架构、芯片、内存与推理系统深度协同的多维角逐。
何为大模型 “斩杀线”?
所谓的“斩杀线”不是单纯的价格洼地,而是把原本只有高价旗舰模型才能提供的能力,拉入多数开发者和企业都能长期使用的成本区间。正如DeepSeek此前被社区视为一道“斩杀线”,核心不在于因为便宜,而是出现迫使市场开始思考:大家愿意为相同水平的智能付费多少?
Qwen3.8-Flash的发布,让这条斩杀线进一步上移。125B总参数、每token仅激活6B,在SWE-bench Pro智能体编程评测中领先Opus4.6达9.1分,在JobBench专业工作任务评测中领先近20分,在AndroidWorld移动端智能体评测中高出22.5分,在MathVision视觉推理数学任务中超出25.1分,在具身智能ERQA任务中领先31.5分。与此同时,训练成本较Qwen3.7-Plus骤降近90%。

目前,Qwen3.8-Flash已上线千问AI平台并对外提供API服务。针对Agent工作流长输入、高缓存命中的特点,其缓存命中价格低至每百万Tokens 0.1元,让高频、大批量的日常智能体任务真正实现“量大管饱”。
当低价模型已能高质量完成大量日常工作,昂贵的企业级模型是否还保有天然的“默认调用权”? Qwen3.8-Flash有望推动一个共识的形成:够用且足够便宜的模型,才是真正的生产力底座。
尤其是在大模型发展进入Agent时代后,企业的Agent业务往往需要长期、高贵、大规模的运行。因此,和普通C端消费者相比,企业天然会对高调用量下价格能否持续,高并发下算力供给是否充足,模型/应用响应速度与服务稳定性是否会打折等问题保持高度关注。可以说,只有真正长期供得上、跑得稳的低价,才是可兑现的低价。
“斩杀线”新标尺:任务总成本
Qwen3.8-Flash真正的杀伤力,不仅在于大幅降低了Token单价,更在于以更低的任务总成本,重新定义“斩杀线”本身。
一次真实任务的成本,除了API费用,还包含了等待时间、失败后的重复调用、多个Agent之间的复杂协同、乃至人工接管和结果修正。Qwen3.8-Flash能够同时压低这几项成本。不仅单次调用便宜,而且完成任务的轮次更少、失败率更低、长上下文处理更快。同时,得益于背后阿里云的算力储备和成熟的云服务体系,不仅让企业用得起,也能让企业放开用、大胆用。
以千问办公场景为例,一次文档或PPT的成型,从资料搜集到排版调整,背后可能产生几十次模型调用。Qwen团队与千问办公团队联合推出了办公专属版本,针对多步规划、工具选择、上下文压缩等场景进行专项训练调优。在真实办公场景测试中,千问办公标准模式的单任务生成速度提升约100%,Token消耗平均减少75%。
据悉,千问办公“标准模式”已内置了Qwen3.8-Flash,可完成95%的日常办公任务。大模型的斩杀线,正在从“每百万token值多少钱” 转向更务实的维度,即“每块钱最终能完成多少工作”。
更便宜的模型不是终点
直觉上,模型效率提高、单次调用成本下降,似乎意味着行业需要的GPU会减少。但更可能出现的是类似“杰文斯悖论”的结果:单位使用成本越低,使用总量反而越大。
过去,成本限制使得用户只敢让AI回答单一问题,现在人们已经逐渐习惯让Agent帮自己处理各种工作。而每次任务变得更便宜后,用户不会只节省预算,反而会把AI部署到更多流程中。单次任务消耗下降,但任务数量、调用轮次和上下文长度可能更快增长。
摩根士丹利的报告也指出,开放权重模型降低AI成本后,更低的推理成本可能加速AI在更多业务场景中的采用,触发“杰文斯悖论”,即成本降低最终会推动对Token、计算能力、电力和基础设施的总体需求增加。
因此,Qwen3.8-Flash对产业链的真正影响,并非削减算力总需求,而是改变算力需求的结构,从集中于模型训练的大规模投入,扩展至海量、持续、高并发的推理负载。更便宜的模型不是GPU需求的终点,反而可能成为推理需求大爆发的起点。
新一代千问大模型Qwen4雏形显现
随着Qwen3.8-Flash的发布,千问Qwen3.8系列形成了更完整的模型矩阵,覆盖能力上限、开发者生态和规模化应用三个关键点。
Qwen3.8-Max负责建立系列的能力高度;Qwen3.8-27B负责扩大生态广度,将高水平能力带到消费级硬件和本地部署环境;Qwen3.8-Flash则负责承接最大规模的真实使用,以接近顶级模型的能力和更低的调用成本,进入办公、编程、Agent和高并发业务。
一套从前沿模型探索到实际能力落地的完整模型组合,就此形成:Max证明Qwen3.8能够做到多强,27B让更多开发者能够使用和共建,Flash则让这些能力能够被高频、长期、规模化调用,同时Flash-Next则将下一代技术路线开放给社区,由社区进行验证,提前让开发者完整框架适配、部署优化、以及应用探索,同时也能为后续架构演进积累真实的社区反馈。
据了解,Qwen3.8-Flash所采用的Next新架构将是全新一代千问大模型Qwen4的雏形。Qwen3.8-Flash-Next模型权重已在Hugging Face、魔搭社区全面开源,交由全球AI开源社区检验。
截至目前,Qwen3.8已开源发布2.4T参数量的Qwen3.8-Max、Qwen3.8-27B及Qwen3.8-Flash三大尺寸模型。Qwen模型全球下载量突破30亿次,衍生模型数超30万个。全尺寸、全模态的全面开源正在全球掀起新一轮中国模型浪潮。
斩杀线被一次次刷新的背后,是中国大模型在效率赛道上的集体突进。大模型的终极竞争,从来不是谁能造出最聪明的模型,而是谁能让聪明变得足够便宜、足够普及。而Qwen3.8-Flash,以实打实的性价比,为这场长跑写下新的注脚。
“特别声明:以上作品内容(包括在内的视频、图片或音频)为凤凰网旗下自媒体平台“大风号”用户上传并发布,本平台仅提供信息存储空间服务。
Notice: The content above (including the videos, pictures and audios if any) is uploaded and posted by the user of Dafeng Hao, which is a social media platform and merely provides information storage space services.”




