GLM-5.3-Flash 深度分析报告

目录

一、概述

GLM-5.3-Flash(320B-A18B) 是智谱 AI(Z.ai)于 2026 年 8 月 26 日正式上线并开源的多模态模型,也是 GLM-5 系列的首个原生多模态模型。其发布方式十分特殊:正式发布前一周,智谱以匿名模型身份 Ox-Alpha(中文社区称为"牛来")在 OpenRouter 与 OpenCode 上进行大规模真实流量测试,登顶双平台调用量榜首后才正式揭晓身份——"匿名上线、全网实测、择日揭晓"(据财联社搜狐/DoNews)。以 GLM-5.3 十分之一的价格,提供与 Claude Opus 4.8 持平的智能水平,且全部跑在国产芯片上。

值得注意的是,这是一次"以紧凑架构对标前沿旗舰"的发布:模型总参数 320B、激活参数仅 18B、层数较 GLM-4.5 减半(92 → 45),在 Artificial Analysis 智能指数上取得 57 分,与 Claude Opus 4.8 持平,全面超越参数量高出一倍的 GLM-5.2;定价则仅为 GLM-5.3 的 1/10(限时折扣内 1/20)、Opus 4.8 的 1/40。开源计划方面,权重以 MIT 协议即刻上线 HuggingFace,已接入 ZCode 等编程平台并纳入 GLM Coding Plan(每天限量 1 万张体验卡),API 同步开放。同时,该模型测试期及发布后的全部线上流量均由 10 万张国产芯片承载——这也是国产算力芯片首次大规模直接服务全球真实负载。

二、发布策略:Ox-Alpha 匿名实测

GLM-5.3-Flash 的发布流程在行业内开创了一种新打法:

  • 8 月 20 日 — 模型以 "Ox-Alpha" 匿名身份上线全球最大模型聚合平台 OpenRouter 与 OpenCode:1M token 多模态上下文、131,072 token 最大输出,并以完全免费方式提供当周服务;
  • 上线首日 — 调用量登顶并创下单日历史纪录,终结 DeepSeek 在 OpenCode 长达 56 天的霸榜
  • 测试期内 — 单日处理 tokens 达 62T(峰值承载能力约 100 万亿 Token/天),6 天内全球开发者消耗数十万亿 Token,成为双平台当周最受欢迎模型,刷新双平台历史纪录;
  • 身份猜测 — 独立研究员发布"技术指纹"报告:分词器在 25 组提示词测试中与 GLM-5.3 的 Token 计数完全一致、11 项探针交叉测试与 GLM 家族全匹配,"99% 把握"指向智谱(亦有观点因 Ox Alpha 的 cl100k_base BPE 分词器猜测其为微软 MAI 2,最终被证伪);
  • 8 月 26 日晚 — 智谱正式揭晓:Ox-Alpha 即 GLM-5.3-Flash,并同步开源权重。

该发布方式的核心价值在于:在正式发布模型前便完成了真实流量压测、收割盲测口碑,一定程度上规避了发布后才发现服务问题的风险,同时为官方后续的性能声明提供市场验证背书。

三、模型家族与规格概览

3.1 版本定位对比

维度 GLM-5.3-Flash GLM-5.3(旗舰)
定位 低价多模态走量,性价比标杆 前沿编程 + 网安能力旗舰
参数规模 320B-A18B,45 层 744B-A40B,78 层
基座 全新训练的基座模型 与 GLM-5.2 同基座(纯后训练)
模态 原生多模态(图文视频) 纯文本
架构 稀疏 + 线性注意力混合 传统注意力 + IndexShare
开源节奏 发布即开源(MIT) 发布两周后开源
定价 GLM-5.3 的 1/10 基准

3.2 技术规格与参数

参数 数值
总参数量 321B(官方宣传口径 320B)
激活参数 18B(每 token 激活 8/288 个专家)
层数 45 层(34 层 KDA + 11 层 NoPE 稀疏 MLA,约 3:1)
架构 多模态 MoE + 混合注意力(KDA 线性注意力层 + NoPE 稀疏 MLA 层)
上下文窗口 1,048,576(1M)token
最大输出 131,072 token
模态 文本 + 图像 + 视频
权重精度 原生 FP8(默认);BF16 变体
KV 缓存 FP8(Blackwell);Hopper 需 BF16
多 token 预测 MTP 草稿层(num_speculative_tokens=5)
推理框架 SGLang、vLLM(0.27.0+)、TokenSpeed、KTransformers;FlashInfer 0.6.17+(NoPE 稀疏 MLA 必需)
硬件支持 NVIDIA Hopper+;AMD Instinct gfx950(ROCm)
权重体积 FP8 约 306 GiB;BF16 约为其 2 倍
开源协议 MIT(HuggingFace:zai-org/GLM-5.3-Flash-BF16

3.3 与 GLM-5.3 的关系:同代代号下的两条独立技术线

需要澄清一个容易误解的点:GLM-5.3-Flash 与 GLM-5.3 并非同一基座。官方模型卡明确写道:"GLM-5.3-Flash starts from a newly trained base model, with its architecture and training recipe redesigned around capability and efficiency";而 GLM-5.3 旗舰版官方声明是"It uses the same base model as GLM-5.2 — every gain comes from post-training"。两者对比:

维度 GLM-5.3(旗舰) GLM-5.3-Flash
基座 与 GLM-5.2 相同 全新训练
预训练语料 沿用 5.2 30T Token 多模态语料
架构 与 5.2 相同(IndexShare 稀疏注意力;256 路由专家选 8 + 1 共享) 全新混合注意力(34 层 KDA + 11 层 NoPE 稀疏 MLA,3:1)、mHC、45 层
参数规模 744B / 40B 激活 / 78 层 320B / 18B 激活 / 45 层
模态 纯文本(1M / 128K 输出) 原生图文视频(1M / 131K 输出)
能力来源 后训练规模化 架构重建 + 多模态预训练

这与 DeepSeek 的命名逻辑(V4-Pro / V4-Flash 同基座、同代不同尺寸)形成鲜明对比:智谱的 "Flash" 不是旗舰的"缩水版",而是"新架构 + 更小规模 + 多模态"的差异化新线。两条线共享的只有"5.3"世代代号、后训练方法论与产品生态,而非模型权重。这也解释了为何 Flash 的 AA 指数(57)能超过 GLM-5.2(53)——它本质上比 GLM-5.2 更新一整代,而 GLM-5.3 只是同一基座上的后训练加强。

此外,Flash 线本就有自己的谱系:其前代是 GLM-4.7-Flash、GLM-4.6,历来是智谱的独立产品线,本次才升级至 5.x 世代编号并首次多模态化;据华尔街见闻报道,Flash 参数规模约为旗舰的 40%来源)。

推论:智谱实际上在并行验证两条路线——旗舰线验证"同一基座 + 后训练规模化"(能力上限,如网安涌现),Flash 线验证"架构重建 + 成本极致化"(性价比普适,如多模态)。

四、核心技术与新特性

1. 混合注意力架构:开源前沿模型首次

GLM-5.3-Flash 是首个采用"稀疏注意力 + 线性注意力"混合架构的开源前沿模型,其 45 层语言模型由 KDA 线性注意力层(34 层)与 NoPE 稀疏 MLA 层(11 层)以约 3:1 交错构成(Sebastian Raschka 称此为类似 Kimi Linear 的"超级混合"模式):

  • KDA 线性注意力:通过递归机制捕获局部依赖关系,支持 1M 上下文下的高效解码;
  • NoPE 稀疏 MLA:借助轻量级索引器召回全局上下文,无需位置编码(NoPE);
  • IndexPool:通过加权池化将索引器的 4 个缓存向量压缩为 1 个,进一步降低 1M 上下文下索引器的时延与内存开销。

配合流形约束超连接(mHC)提升模型 Scaling 能力,并以智谱最新的 30T Token 多模态预训练语料完成预训练。官方强调,该模型从全新训练的基座起步,架构与训练流程围绕效率与成本重新设计,而非在既有旗舰上做后训练——与 GLM-5.3(和 5.2 同基座)形成两种截然不同的升级路径。

2. 多模态能力:GLM-5 系列首次原生多模态

  • 原生支持图像与视频输入,与文本推理在同一参数空间内进行;
  • 1M token 上下文 + 131K 输出,适配长视频理解与长文档代理任务。

3. 效率优化:以更少计算实现更强性能

指标 GLM-5.3-Flash 相对 GLM-5.3
每层注意力计算量 降低 3.01 倍
每层平均 KV 缓存(BF16) 降低 4.44 倍
![[Pasted image 20260827110932.png]]
关键观察:在所有对比基线(含 DeepSeek-V4-Flash、Kimi-K3)中,GLM-5.3-Flash 的注意力计算量最低;但 KV 缓存仍略高于 Kimi-K3 与 DeepSeek-V4-Flash,官方表示这是后续优化的方向。

4. 推理系统优化

  • 原生 FP8 权重:默认权重即 FP8(约 306 GiB),降低显存与带宽压力;KV 缓存同样支持 FP8(Blackwell 平台);
  • MTP 投机解码:内置 MTP 草稿层,vLLM 侧可用 --speculative-config 启用多 token 推理,解码吞吐大幅提升;
  • Prefill/Decode 分离:支持单节点内编解码池拆分,通过 NIXL KV 传输桥接,KDA 卷积状态与 KV 布局需两侧一致(vLLM 配置中通过 VLLM_SSM_CONV_STATE_LAYOUT=DSVLLM_KV_CACHE_LAYOUT=HND 固定)。

5. 本地部署生态

SGLang(官方 cookbook)、vLLM(recipes + FlashInfer)、TokenSpeed(Lightseek)、KTransformers 均已适配;显存需求 FP8 约 306 GiB(8 卡 80G 可 TP4 部署),BF16 约翻倍。

五、性能评测:追平 Claude Opus 4.8

  • AA 智能指数(Artificial Analysis Intelligence Index):57 分,与 Anthropic 最受欢迎的模型 Claude Opus 4.8 持平;高于 GLM-5.2(53 分)和 DeepSeek V4 Pro 正式版(53 分)。
  • 编程能力:在智谱自研 Z.ai Code Bench 体感评估中,编程表现与 Claude Opus 4.8 相当;官方表示其在编码与 Agent 基准上"逼近 Opus 4.8"。
  • 综合表现:全面超越参数量高出一倍的 GLM-5.2。

评测口径说明(据官方模型卡):HLE w/ tools 在 300K 上下文压缩策略下评测(temperature=1.0、top_p=0.95、最大生成 163,840 token,以 GPT-5.6-luna medium 为裁判模型);NL2Repo 在 1M 上下文下评测(max_new_tokens=64K)。跨模型对比时需注意口径差异。

这说明 GLM-5.3-Flash 已进入全球前沿模型能力区间,且以极低价格实现——"同样智力,1/40 价格"。

六、定价分析

6.1 API 定价(人民币 / 百万 token)

计费项 价格
输入 ¥0.8
输出 ¥2.8
缓存命中 ¥0.23

海外平台报价约 $0.15 / $0.50(每百万 token,据 Wccftech 引述)。

6.2 价格锚定

  • GLM-5.3 的 1/10;限时折扣期内低至 1/20
  • 仅为 Claude Opus 4.8 的 1/40

6.3 市场背景:DeepSeek 涨价之后

GLM-5.3-Flash 发布于 DeepSeek V4 全系涨价(8 月 17 日生效,最高涨幅 1100%)之后。在"用得起的前沿模型"呼声日高的背景下,智谱以"前沿能力 + 1/40 价格 + 国产算力底座"的组合再度击穿前沿模型的价格底线,与 DeepSeek 的涨价形成鲜明对比,被视为对价格敏感市场的精准卡位(据财联社)。

七、产品生态与市场表现

  • 开源:权重已上线 HuggingFace(zai-org/GLM-5.3-Flashzai-org/GLM-5.3-Flash-BF16),MIT 协议;
  • 编程工具:已接入 ZCode 等编码平台;
  • 订阅计划:纳入 GLM Coding Plan,每天限量发放 10,000 张体验卡;
  • API:已同步开放调用;
  • 市场表现:测试期(8 月 20–26 日)单日最高 62T tokens、峰值承载约 100 万亿 Token/天,终结 DeepSeek 在 OpenCode 56 天霸榜,双平台当周最受欢迎。

八、国产算力底座:10 万张芯片与 SGLang 定制引擎

GLM-5.3-Flash 发布中最具战略意义的细节在于其推理底座:

  • 规模:测试期全部线上流量 + 发布后的线上服务,均由 10 万张国产芯片承载,通过自研高带宽互联网络连接。这是国产算力芯片首次大规模直接服务全球真实负载
  • 芯片来源:据相关人士透露,或来自华为、海光、摩尔线程;
  • 工程挑战:国产芯片的主要瓶颈在内存容量与带宽,支撑 1M 上下文极具挑战。智谱为此在 SGLang 基础上构建了专用推理引擎:
  • EPD(Encode–Prefill–Decode)分离式架构:将多模态编码、prompt 预填充、逐 token 解码拆分为可独立调度与扩缩容的工作池;
  • 激进内存优化:算力换带宽、通信换显存;节点内张量并行、ReplaySSM、W8A8 量化、INT8/FP8/BF16 混合缓存量化、Layer Split 等;
  • 成果:与同一硬件上的初始基线相比,端到端服务性能提升 3 倍;硬件效率和单 token 成本已达到与主流英伟达 GPU 相当的水平。

另一个值得注意的细节:整套推理引擎的构建由 GLM-5.3 驱动的 infra agent 大大加速——协助工程师开发与优化算子、诊断性能瓶颈、改进部署服务栈,形成"模型优化系统,系统承载模型"的正向循环。海外研究机构 SemiAnalysis 评论称,这一事件意味着"英伟达护城河再受考验"。

九、竞争格局

参数 GLM-5.3-Flash DeepSeek V4-Flash Kimi K3 Claude Opus 4.8
总参数量 321B 284B 2.8T 未公布(闭源)
激活参数 18B 13B 104B 未公布
架构 MoE + 混合注意力 MoE(CSA+HCA) MoE + KDA 混合线性注意力 未公布
模态 图文视频 纯文本 图文视频 图文
上下文 1M 1M 1M 未公布
AA 智能指数 57 未公布 57(#3) 57
开源 已开源(MIT) 已开源(MIT) 已开源 闭源
输入/输出定价 ¥0.8 / ¥2.8 ¥1.5–3 / ¥4.5–9 ≈¥20 / ¥100 $5 / $25

关键观察:GLM-5.3-Flash 以不到 Kimi K3 三十分之一的输出价格,取得与其整数级别的智能表现;与 DeepSeek V4-Flash 相比规模略大但价格更低近一半。开源三强中,它目前是唯一"多模态 + 1M 上下文 + 前沿 AA 分数 + 极致低价"四者兼得的模型。

十、双轨协同:旗舰探顶与 Flash 落地的战略闭环

智谱在 2026 年 8 月通过 GLM-5.3(8 月 14 日)与 GLM-5.3-Flash(8 月 26 日)两波密集发布,确立了明确的技术分工与战略闭环:不再沿用"参数越大越好"的粗放迭代,而是转向"旗舰探顶 + Flash 落地"的双轨并行范式

路线一:旗舰线(GLM-5.3)——「同一基座 + 后训练规模化」

旗舰线的核心使命是不计成本地探索智能上限与能力涌现

  • 基座零变动:GLM-5.3 完全沿用 GLM-5.2 的 744B 总参数 / 40B 激活(MoE,256 个路由专家每 Token 选 8 个 + 1 个共享专家;78 层 + IndexShare 稀疏注意力)预训练权重,未增加预训练 Token,算力重心彻底转向后训练阶段;
  • 后训练 Scaling 基础设施:通过 SAO(长时程 RL 策略)、IndexShare 与可交互仿真沙箱环境,配合 slime 框架,让模型在接近专家数天工作量的复杂长程任务中进行强化学习(端到端训练吞吐较前代提升 2.3 倍以上);
  • 网安能力的意外涌现:在 CyberGym(84.5%,SOTA)、ExploitBench(54.4%,较 5.2 翻倍以上)等基准上,模型不仅识别孤立漏洞,还自主涌现出跨阶段多步推理、串联漏洞利用链(Exploitation Chain)的端到端攻防能力,并在真实代码库中发现 2,436 个漏洞(含 1,097 个中高危)——引发全球对开放权重模型自主安全边界的技术讨论。

路线二:Flash 线(GLM-5.3-Flash)——「架构重建 + 成本极致化」

Flash 线的核心使命是重构能效比,让前沿多模态与 Agent 能力走向大规模低成本普及

  • 架构深度瘦身与重构:打破旗舰架构包袱,总参数降至 320B、激活参数压缩至 18B,层数从 92 层削减至 45 层;首创稀疏注意力与线性注意力混合架构(34 层 KDA + 11 层 NoPE 稀疏 MLA),使注意力计算量与 KV 缓存占用分别骤降 3.01 倍4.44 倍
  • 原生多模态与 Visual Coding:不同于纯文本旗舰,Flash 原生融入视觉编码能力,将视觉编码并入 Coding 循环,形成"生成 — 观察 — 修正"闭环——官方演示中,模型在 Blender 中自主运行 16 小时,从零搭建出约 400 平方米的专业主厨自宅与测试厨房(前端 UI 渲染验证、游戏构建、3D 视效等场景均属此类);
  • 国产芯片适配与成本下探:将多模态编码、Prefill 预填充、Decode 解码拆为 EPD 三套独立调度池,在 10 万张国产芯片集群上端到端性能较基线提升 3 倍;API 定价仅为 GLM-5.3 的 1/10(限时折扣内 1/20),约为 Claude Opus 4.8 的 1/40

双轨协同架构对比

维度 旗舰线(GLM-5.3) Flash 线(GLM-5.3-Flash)
战略定位 探索智能上界、突破前沿基准 极低成本落地、多模态全场景渗透
模型结构 744B-A40B,78 层 MoE(256 选 8 + 1 共享) 320B-A18B,45 层混合注意力(34 KDA + 11 稀疏 MLA)
训练重心 纯文本后训练 RL Scaling(复杂环境/沙箱) 30T 多模态全新预训练 + 后训练对齐
核心突破 复杂编程(Coding Agent)、网安攻防链涌现 原生 Visual Coding(生成-观察-修正闭环)、超轻 KV 缓存、国产芯片高吞吐
模态支持 纯文本(1M Context / 128K 输出) 原生图文多模态(1M Context / 131K 输出)
定价与门槛 旗舰标准计费(输出约 ¥28/百万) 价格砍至 1/10 ~ 1/20,约为 Opus 4.8 的 1/40,全面开源(MIT)

核心本质

这种双轨并行印证了当前大模型演进的新规律:旗舰线通过"加深后训练(RL)"验证大模型在自主规划、工具协同与复杂领域(如攻防)的能力天花板;一旦在天花板上测出关键规律,Flash 线便通过"架构重构 + 高效稀疏化"将这套能力以极致低成本形态下沉——既保证技术探索的先锋性,又守住商业化交付与开发者生态的护城河。旗舰的网安涌现成果与 Flash 的视觉编码闭环,分别代表"能力上限"与"成本普适"两种价值,构成智谱在港交所上市(02513.HK)后兼顾利润率与市场份额的完整叙事。

十一、挑战与隐忧

  1. KV 缓存仍落后:每层 KV 高于 Kimi-K3 与 DeepSeek-V4-Flash,长上下文场景的成本竞争力尚未完全兑现,官方承诺继续优化;
  2. 折扣期后的真实定价:限时 1/20 折扣结束后能否留住用户,取决于 1/10 定价下的长期成本结构;
  3. 国产芯片稳定性未知数:10 万张国产芯片集群在全球真实负载下运行尚属首次,更大规模流量下的稳定性、故障率与成本账仍有待时间检验;
  4. 匿名测试的合规与平台规则:以匿名模型在开放平台大规模免费放量测试,可能引发 OpenRouter/OpenCode 对"匿名模型"的规则调整或其他厂商效仿;
  5. 能力分层:Flash 未继承 GLM-5.3 旗舰的网安后训练成果(漏洞发现 2436 个等),多模态 + 代码双强之外,安全类能力的下沉路径尚不明朗。

十二、总结与展望

核心结论

  1. GLM-5.3-Flash 以 320B/18B 的紧凑架构、57 分 AA 指数(持平 Opus 4.8)和 1/40 价格,重新定义了前沿多模态模型的性价比基准;
  2. Ox-Alpha 匿名实测是发布策略上的创新,发布即带市场验证;
  3. 10 万张国产芯片 + SGLang 深度定制引擎支撑起全球真实负载,国产算力首次大规模集体出海并证明可用;
  4. 在 DeepSeek 涨价之际逆势击穿价格底线,战略时机精准;
  5. 技术路径分化:GLM-5.3-Flash 与旗舰并非同一基座——旗舰走"同基座、纯后训练"路线,Flash 走"全新基座、架构重建 + 多模态"路线,二者共享世代代号与生态、不共享模型权重;智谱正在用两条腿同时验证"能力"与"成本"两个极限。

后续值得关注的问题

  • 限时折扣(GLM-5.3 的 1/20)结束后,实际留存定价与用户规模;
  • KV 缓存仍高于 Kimi-K3 / DeepSeek-V4-Flash,后续优化进度;
  • 国产芯片集群在更大规模流量下的稳定性与成本账;
  • GLM Coding Plan 体验卡每日 1 万张的转化效果;
  • 匿名测试打法是否会引发其他厂商效仿,以及 OpenRouter 等平台对"匿名模型"的规则变化;
  • Flash 是否会把 GLM-5.3 旗舰版的网安后训练成果(漏洞发现能力)部分下沉。

参考来源

  1. 财联社/科创板日报:10万张国产算力卡扛起"牛来":智谱开源GLM-5.3-Flash
  2. 品玩:Z.ai开源GLM-5.3-Flash多模态模型 定价仅为Opus 4.8的1/40
  3. 搜狐/DoNews:智谱发布今日上线并开源多模态模型GLM-5.3-Flash:320B总参数
  4. 凤凰科技:Ox Alpha现身:智谱开源GLM-5.3-Flash原生多模态模型
  5. SiliconAngle:Z.ai open-sources 'Ox Alpha' model as GLM-5.3-Flash
  6. 新京报:智谱开源GLM-5.3-Flash"牛来",背后是国产芯片
  7. 36氪:智谱"牛来"模型算力谜底:全部国产卡承载,价格仅为Opus 4.8的1/40
  8. 钛媒体:GLM-5.3-Flash发布,多模态终于来了
  9. Wccftech:Zhipu Unmasks The Mystery Ox Alpha Model as GLM-5.3-Flash
  10. vLLM Recipes:zai-org/GLM-5.3-Flash 部署配置
  11. HuggingFace:zai-org/GLM-5.3-Flash 模型卡
  12. Z.ai 官方博客:GLM-5.3-Flash
  13. 智谱官方文档:GLM-5.3-Flash API
  14. CSDN:GLM-5.3 技术解析:不换基座,Coding 能力为何暴涨 50%?(744B/40B、78 层、256 专家选 8 等规格口径)
  15. 站长之家/AIbase:国产大模型打出王炸!智谱GLM-5.3-Flash原生多模态颠覆行业价格战(Visual Coding 闭环与 Blender 16 小时案例)
  16. 华尔街见闻/大象银行:智谱认领"牛来":SemiAnalysis 评"英伟达护城河再受考验"(参数约旗舰 40%、DeepSeek 提价后需求外溢)
  17. DataLearner:GLM-5.3-Flash:架构、视觉编程能力、官方评测与价格(前代 GLM-4.7-Flash、5 折期至 9 月 9 日、第三方评测)
  18. 新浪科技:Sebastian Raschka 绘制的 GLM-5.3-Flash 架构图(34 层 KDA + 11 层 MLA 的 3:1 混合构成)

本页是这篇文章的静态镜像。在互动版中打开,可使用附件下载、作者署名与目录导航。