
2026-8-27 11:04
【天极网人工智能频道】8月26日晚,阿里千问Qwen3.8-Flash-Next与智谱GLM-5.3-Flash几乎同时上线,模型权重落到Hugging Face与魔搭社区:前者是下一代Qwen4架构的先导预览版,后者是GLM-5系列首个原生多模态模型;而两款模型几乎同时把价格表打到了一个新的低点——每百万Token输入 1 元、输出 3 元,以及Claude Opus 4.8的四十分之一。连续打出开源、降价牌,意味着比DeepSeek更便宜正在成为国产前沿大模型竞争的新赛道。
Qwen3.8-Flash-Next主模型125B参数、额外挂载51B的N-gram Embedding,每个Token 仅激活6B,训练成本相比Qwen3.7-Plus下降约九成,但编码与办公任务更强;262K原生上下文,YaRN可扩至1M,1M长上下文Attention在Prefill/Decode加速7.6倍/4.9倍。架构上用Gated DeltaNet+Qwen Sparse Attention混合Attention、4路并行的Gated Residual、51B N-gram查表扩展Embedding容量、优化器改为Muon并重拟合 Scaling Law——这些改动把单位算力承载的智能密度,推到新位置。
GLM-5.3-Flash同样激进。320B总参数、激活18B,Artificial Analysis综合智能指数57分、与Claude Opus 4.8持平,超过参数高一倍的GLM-5.2;它是首个在开源前沿模型里采用稀疏与线性注意力混合架构的模型,注意力计算量降至前代近三分之一、KV缓存缩减4倍以上,100万Token上下文、MIT协议开源。发布前以Ox-Alpha匿名身份在OpenCode与 OpenRouter公开测试,OpenRouter七天调用量登顶,DeepSeek-V4-Flash只及其一半。所有请求流量跑在国产芯片集群上,智谱自研推理引擎端到端性能提升3倍。
比起参数,定价对开发者的冲击更直观。Qwen3.8-Flash上线千问AI平台后输入1元、输出3元每百万Token,比DeepSeek-V4-Flash闲时报价再低三分之一;GLM-5.3-Flash定价为GLM-5.3的十分之一,限时折扣内为二十分之一,约Opus 4.8的四十分之一,这意味着同一笔预算能跑的真实任务量与半年前不可同日而语。开发者与中小企业的受益无疑是直接的:用Agent工具搭一套私有化部署、塞进几万字研报做金融分析、或者把长文档丢给模型做摘要与问答,单位成本被同时压到了新的低位。
小结
一夜间同时开源、降价并非偶然,而是回答了一个被长期误解的问题——前沿模型不等于贵。两家拉低成本靠的不是无止境的烧钱投入,而是架构创新与国产算力集群对训练与推理的全链路支撑。Qwen3.8-Flash-Next在四个底层部件同时动手,GLM-5.3-Flash 在稀疏与线性注意力混合架构上找到新的密度增长点,再叠加国产芯片的承载,让前沿智能不需要“省着用”。当私有化部署、长文档、Agent、原生多模态这些高价值场景一夜间被重新定价,国产大模型的普惠时代也将以前所未有的速度渗透至AI相关的方方面面。
微博认证登陆
QQ账号登陆
微信账号登陆
取消
©2026 天极网旗下网站