目录
- 一、概述
- 二、发布策略:Ox-Alpha 匿名实测
- 三、模型家族与规格概览
- 四、核心技术与新特性
- 五、性能评测:追平 Claude Opus 4.8
- 六、定价分析
- 七、产品生态与市场表现
- 八、国产算力底座:10 万张芯片与 SGLang 定制引擎
- 九、竞争格局
- 十、双轨协同:旗舰探顶与 Flash 落地的战略闭环
- 十一、挑战与隐忧
- 十二、总结与展望
- 参考来源
一、概述
GLM-5.3-Flash(320B-A18B) 是智谱 AI(Z.ai)于 2026 年 8 月 26 日正式上线并开源的多模态模型,也是 GLM-5 系列的首个原生多模态模型。其发布方式十分特殊:正式发布前一周,智谱以匿名模型身份 Ox-Alpha(中文社区称为"牛来")在 OpenRouter 与 OpenCode 上进行大规模真实流量测试,登顶双平台调用量榜首后才正式揭晓身份——"匿名上线、全网实测、择日揭晓"(据财联社、搜狐/DoNews)。以 GLM-5.3 十分之一的价格,提供与 Claude Opus 4.8 持平的智能水平,且全部跑在国产芯片上。
值得注意的是,这是一次"以紧凑架构对标前沿旗舰"的发布:模型总参数 320B、激活参数仅 18B、层数较 GLM-4.5 减半(92 → 45),在 Artificial Analysis 智能指数上取得 57 分,与 Claude Opus 4.8 持平,全面超越参数量高出一倍的 GLM-5.2;定价则仅为 GLM-5.3 的 1/10(限时折扣内 1/20)、Opus 4.8 的 1/40。开源计划方面,权重以 MIT 协议即刻上线 HuggingFace,已接入 ZCode 等编程平台并纳入 GLM Coding Plan(每天限量 1 万张体验卡),API 同步开放。同时,该模型测试期及发布后的全部线上流量均由 10 万张国产芯片承载——这也是国产算力芯片首次大规模直接服务全球真实负载。
二、发布策略:Ox-Alpha 匿名实测
GLM-5.3-Flash 的发布流程在行业内开创了一种新打法:
- 8 月 20 日 — 模型以 "Ox-Alpha" 匿名身份上线全球最大模型聚合平台 OpenRouter 与 OpenCode:1M token 多模态上下文、131,072 token 最大输出,并以完全免费方式提供当周服务;
- 上线首日 — 调用量登顶并创下单日历史纪录,终结 DeepSeek 在 OpenCode 长达 56 天的霸榜;
- 测试期内 — 单日处理 tokens 达 62T(峰值承载能力约 100 万亿 Token/天),6 天内全球开发者消耗数十万亿 Token,成为双平台当周最受欢迎模型,刷新双平台历史纪录;
- 身份猜测 — 独立研究员发布"技术指纹"报告:分词器在 25 组提示词测试中与 GLM-5.3 的 Token 计数完全一致、11 项探针交叉测试与 GLM 家族全匹配,"99% 把握"指向智谱(亦有观点因 Ox Alpha 的 cl100k_base BPE 分词器猜测其为微软 MAI 2,最终被证伪);
- 8 月 26 日晚 — 智谱正式揭晓:Ox-Alpha 即 GLM-5.3-Flash,并同步开源权重。
该发布方式的核心价值在于:在正式发布模型前便完成了真实流量压测、收割盲测口碑,一定程度上规避了发布后才发现服务问题的风险,同时为官方后续的性能声明提供市场验证背书。
三、模型家族与规格概览
3.1 版本定位对比
| 维度 | GLM-5.3-Flash | GLM-5.3(旗舰) |
|---|---|---|
| 定位 | 低价多模态走量,性价比标杆 | 前沿编程 + 网安能力旗舰 |
| 参数规模 | 320B-A18B,45 层 | 744B-A40B,78 层 |
| 基座 | 全新训练的基座模型 | 与 GLM-5.2 同基座(纯后训练) |
| 模态 | 原生多模态(图文视频) | 纯文本 |
| 架构 | 稀疏 + 线性注意力混合 | 传统注意力 + IndexShare |
| 开源节奏 | 发布即开源(MIT) | 发布两周后开源 |
| 定价 | GLM-5.3 的 1/10 | 基准 |
3.2 技术规格与参数
| 参数 | 数值 |
|---|---|
| 总参数量 | 321B(官方宣传口径 320B) |
| 激活参数 | 18B(每 token 激活 8/288 个专家) |
| 层数 | 45 层(34 层 KDA + 11 层 NoPE 稀疏 MLA,约 3:1) |
| 架构 | 多模态 MoE + 混合注意力(KDA 线性注意力层 + NoPE 稀疏 MLA 层) |
| 上下文窗口 | 1,048,576(1M)token |
| 最大输出 | 131,072 token |
| 模态 | 文本 + 图像 + 视频 |
| 权重精度 | 原生 FP8(默认);BF16 变体 |
| KV 缓存 | FP8(Blackwell);Hopper 需 BF16 |
| 多 token 预测 | MTP 草稿层(num_speculative_tokens=5) |
| 推理框架 | SGLang、vLLM(0.27.0+)、TokenSpeed、KTransformers;FlashInfer 0.6.17+(NoPE 稀疏 MLA 必需) |
| 硬件支持 | NVIDIA Hopper+;AMD Instinct gfx950(ROCm) |
| 权重体积 | FP8 约 306 GiB;BF16 约为其 2 倍 |
| 开源协议 | MIT(HuggingFace:zai-org/GLM-5.3-Flash 与 -BF16) |
3.3 与 GLM-5.3 的关系:同代代号下的两条独立技术线
需要澄清一个容易误解的点:GLM-5.3-Flash 与 GLM-5.3 并非同一基座。官方模型卡明确写道:"GLM-5.3-Flash starts from a newly trained base model, with its architecture and training recipe redesigned around capability and efficiency";而 GLM-5.3 旗舰版官方声明是"It uses the same base model as GLM-5.2 — every gain comes from post-training"。两者对比:
| 维度 | GLM-5.3(旗舰) | GLM-5.3-Flash |
|---|---|---|
| 基座 | 与 GLM-5.2 相同 | 全新训练 |
| 预训练语料 | 沿用 5.2 | 30T Token 多模态语料 |
| 架构 | 与 5.2 相同(IndexShare 稀疏注意力;256 路由专家选 8 + 1 共享) | 全新混合注意力(34 层 KDA + 11 层 NoPE 稀疏 MLA,3:1)、mHC、45 层 |
| 参数规模 | 744B / 40B 激活 / 78 层 | 320B / 18B 激活 / 45 层 |
| 模态 | 纯文本(1M / 128K 输出) | 原生图文视频(1M / 131K 输出) |
| 能力来源 | 后训练规模化 | 架构重建 + 多模态预训练 |
这与 DeepSeek 的命名逻辑(V4-Pro / V4-Flash 同基座、同代不同尺寸)形成鲜明对比:智谱的 "Flash" 不是旗舰的"缩水版",而是"新架构 + 更小规模 + 多模态"的差异化新线。两条线共享的只有"5.3"世代代号、后训练方法论与产品生态,而非模型权重。这也解释了为何 Flash 的 AA 指数(57)能超过 GLM-5.2(53)——它本质上比 GLM-5.2 更新一整代,而 GLM-5.3 只是同一基座上的后训练加强。
此外,Flash 线本就有自己的谱系:其前代是 GLM-4.7-Flash、GLM-4.6,历来是智谱的独立产品线,本次才升级至 5.x 世代编号并首次多模态化;据华尔街见闻报道,Flash 参数规模约为旗舰的 40%(来源)。
推论:智谱实际上在并行验证两条路线——旗舰线验证"同一基座 + 后训练规模化"(能力上限,如网安涌现),Flash 线验证"架构重建 + 成本极致化"(性价比普适,如多模态)。
四、核心技术与新特性
1. 混合注意力架构:开源前沿模型首次
GLM-5.3-Flash 是首个采用"稀疏注意力 + 线性注意力"混合架构的开源前沿模型,其 45 层语言模型由 KDA 线性注意力层(34 层)与 NoPE 稀疏 MLA 层(11 层)以约 3:1 交错构成(Sebastian Raschka 称此为类似 Kimi Linear 的"超级混合"模式):
- KDA 线性注意力:通过递归机制捕获局部依赖关系,支持 1M 上下文下的高效解码;
- NoPE 稀疏 MLA:借助轻量级索引器召回全局上下文,无需位置编码(NoPE);
- IndexPool:通过加权池化将索引器的 4 个缓存向量压缩为 1 个,进一步降低 1M 上下文下索引器的时延与内存开销。
配合流形约束超连接(mHC)提升模型 Scaling 能力,并以智谱最新的 30T Token 多模态预训练语料完成预训练。官方强调,该模型从全新训练的基座起步,架构与训练流程围绕效率与成本重新设计,而非在既有旗舰上做后训练——与 GLM-5.3(和 5.2 同基座)形成两种截然不同的升级路径。
2. 多模态能力:GLM-5 系列首次原生多模态
- 原生支持图像与视频输入,与文本推理在同一参数空间内进行;
- 1M token 上下文 + 131K 输出,适配长视频理解与长文档代理任务。
3. 效率优化:以更少计算实现更强性能
| 指标 | GLM-5.3-Flash 相对 GLM-5.3 |
|---|---|
| 每层注意力计算量 | 降低 3.01 倍 |
| 每层平均 KV 缓存(BF16) | 降低 4.44 倍 |
| ![[Pasted image 20260827110932.png]] | |
| 关键观察:在所有对比基线(含 DeepSeek-V4-Flash、Kimi-K3)中,GLM-5.3-Flash 的注意力计算量最低;但 KV 缓存仍略高于 Kimi-K3 与 DeepSeek-V4-Flash,官方表示这是后续优化的方向。 |
4. 推理系统优化
- 原生 FP8 权重:默认权重即 FP8(约 306 GiB),降低显存与带宽压力;KV 缓存同样支持 FP8(Blackwell 平台);
- MTP 投机解码:内置 MTP 草稿层,vLLM 侧可用
--speculative-config启用多 token 推理,解码吞吐大幅提升; - Prefill/Decode 分离:支持单节点内编解码池拆分,通过 NIXL KV 传输桥接,KDA 卷积状态与 KV 布局需两侧一致(vLLM 配置中通过
VLLM_SSM_CONV_STATE_LAYOUT=DS、VLLM_KV_CACHE_LAYOUT=HND固定)。
5. 本地部署生态
SGLang(官方 cookbook)、vLLM(recipes + FlashInfer)、TokenSpeed(Lightseek)、KTransformers 均已适配;显存需求 FP8 约 306 GiB(8 卡 80G 可 TP4 部署),BF16 约翻倍。
五、性能评测:追平 Claude Opus 4.8
- AA 智能指数(Artificial Analysis Intelligence Index):57 分,与 Anthropic 最受欢迎的模型 Claude Opus 4.8 持平;高于 GLM-5.2(53 分)和 DeepSeek V4 Pro 正式版(53 分)。
- 编程能力:在智谱自研 Z.ai Code Bench 体感评估中,编程表现与 Claude Opus 4.8 相当;官方表示其在编码与 Agent 基准上"逼近 Opus 4.8"。
- 综合表现:全面超越参数量高出一倍的 GLM-5.2。
评测口径说明(据官方模型卡):HLE w/ tools 在 300K 上下文压缩策略下评测(temperature=1.0、top_p=0.95、最大生成 163,840 token,以 GPT-5.6-luna medium 为裁判模型);NL2Repo 在 1M 上下文下评测(max_new_tokens=64K)。跨模型对比时需注意口径差异。
这说明 GLM-5.3-Flash 已进入全球前沿模型能力区间,且以极低价格实现——"同样智力,1/40 价格"。
六、定价分析
6.1 API 定价(人民币 / 百万 token)
| 计费项 | 价格 |
|---|---|
| 输入 | ¥0.8 |
| 输出 | ¥2.8 |
| 缓存命中 | ¥0.23 |
海外平台报价约 $0.15 / $0.50(每百万 token,据 Wccftech 引述)。
6.2 价格锚定
- 为 GLM-5.3 的 1/10;限时折扣期内低至 1/20;
- 仅为 Claude Opus 4.8 的 1/40。
6.3 市场背景:DeepSeek 涨价之后
GLM-5.3-Flash 发布于 DeepSeek V4 全系涨价(8 月 17 日生效,最高涨幅 1100%)之后。在"用得起的前沿模型"呼声日高的背景下,智谱以"前沿能力 + 1/40 价格 + 国产算力底座"的组合再度击穿前沿模型的价格底线,与 DeepSeek 的涨价形成鲜明对比,被视为对价格敏感市场的精准卡位(据财联社)。
七、产品生态与市场表现
- 开源:权重已上线 HuggingFace(
zai-org/GLM-5.3-Flash、zai-org/GLM-5.3-Flash-BF16),MIT 协议; - 编程工具:已接入 ZCode 等编码平台;
- 订阅计划:纳入 GLM Coding Plan,每天限量发放 10,000 张体验卡;
- API:已同步开放调用;
- 市场表现:测试期(8 月 20–26 日)单日最高 62T tokens、峰值承载约 100 万亿 Token/天,终结 DeepSeek 在 OpenCode 56 天霸榜,双平台当周最受欢迎。
八、国产算力底座:10 万张芯片与 SGLang 定制引擎
GLM-5.3-Flash 发布中最具战略意义的细节在于其推理底座:
- 规模:测试期全部线上流量 + 发布后的线上服务,均由 10 万张国产芯片承载,通过自研高带宽互联网络连接。这是国产算力芯片首次大规模直接服务全球真实负载;
- 芯片来源:据相关人士透露,或来自华为、海光、摩尔线程;
- 工程挑战:国产芯片的主要瓶颈在内存容量与带宽,支撑 1M 上下文极具挑战。智谱为此在 SGLang 基础上构建了专用推理引擎:
- EPD(Encode–Prefill–Decode)分离式架构:将多模态编码、prompt 预填充、逐 token 解码拆分为可独立调度与扩缩容的工作池;
- 激进内存优化:算力换带宽、通信换显存;节点内张量并行、ReplaySSM、W8A8 量化、INT8/FP8/BF16 混合缓存量化、Layer Split 等;
- 成果:与同一硬件上的初始基线相比,端到端服务性能提升 3 倍;硬件效率和单 token 成本已达到与主流英伟达 GPU 相当的水平。
另一个值得注意的细节:整套推理引擎的构建由 GLM-5.3 驱动的 infra agent 大大加速——协助工程师开发与优化算子、诊断性能瓶颈、改进部署服务栈,形成"模型优化系统,系统承载模型"的正向循环。海外研究机构 SemiAnalysis 评论称,这一事件意味着"英伟达护城河再受考验"。
九、竞争格局
| 参数 | GLM-5.3-Flash | DeepSeek V4-Flash | Kimi K3 | Claude Opus 4.8 |
|---|---|---|---|---|
| 总参数量 | 321B | 284B | 2.8T | 未公布(闭源) |
| 激活参数 | 18B | 13B | 104B | 未公布 |
| 架构 | MoE + 混合注意力 | MoE(CSA+HCA) | MoE + KDA 混合线性注意力 | 未公布 |
| 模态 | 图文视频 | 纯文本 | 图文视频 | 图文 |
| 上下文 | 1M | 1M | 1M | 未公布 |
| AA 智能指数 | 57 | 未公布 | 57(#3) | 57 |
| 开源 | 已开源(MIT) | 已开源(MIT) | 已开源 | 闭源 |
| 输入/输出定价 | ¥0.8 / ¥2.8 | ¥1.5–3 / ¥4.5–9 | ≈¥20 / ¥100 | $5 / $25 |
关键观察:GLM-5.3-Flash 以不到 Kimi K3 三十分之一的输出价格,取得与其整数级别的智能表现;与 DeepSeek V4-Flash 相比规模略大但价格更低近一半。开源三强中,它目前是唯一"多模态 + 1M 上下文 + 前沿 AA 分数 + 极致低价"四者兼得的模型。
十、双轨协同:旗舰探顶与 Flash 落地的战略闭环
智谱在 2026 年 8 月通过 GLM-5.3(8 月 14 日)与 GLM-5.3-Flash(8 月 26 日)两波密集发布,确立了明确的技术分工与战略闭环:不再沿用"参数越大越好"的粗放迭代,而是转向"旗舰探顶 + Flash 落地"的双轨并行范式。
路线一:旗舰线(GLM-5.3)——「同一基座 + 后训练规模化」
旗舰线的核心使命是不计成本地探索智能上限与能力涌现:
- 基座零变动:GLM-5.3 完全沿用 GLM-5.2 的 744B 总参数 / 40B 激活(MoE,256 个路由专家每 Token 选 8 个 + 1 个共享专家;78 层 + IndexShare 稀疏注意力)预训练权重,未增加预训练 Token,算力重心彻底转向后训练阶段;
- 后训练 Scaling 基础设施:通过 SAO(长时程 RL 策略)、IndexShare 与可交互仿真沙箱环境,配合 slime 框架,让模型在接近专家数天工作量的复杂长程任务中进行强化学习(端到端训练吞吐较前代提升 2.3 倍以上);
- 网安能力的意外涌现:在 CyberGym(84.5%,SOTA)、ExploitBench(54.4%,较 5.2 翻倍以上)等基准上,模型不仅识别孤立漏洞,还自主涌现出跨阶段多步推理、串联漏洞利用链(Exploitation Chain)的端到端攻防能力,并在真实代码库中发现 2,436 个漏洞(含 1,097 个中高危)——引发全球对开放权重模型自主安全边界的技术讨论。
路线二:Flash 线(GLM-5.3-Flash)——「架构重建 + 成本极致化」
Flash 线的核心使命是重构能效比,让前沿多模态与 Agent 能力走向大规模低成本普及:
- 架构深度瘦身与重构:打破旗舰架构包袱,总参数降至 320B、激活参数压缩至 18B,层数从 92 层削减至 45 层;首创稀疏注意力与线性注意力混合架构(34 层 KDA + 11 层 NoPE 稀疏 MLA),使注意力计算量与 KV 缓存占用分别骤降 3.01 倍与 4.44 倍;
- 原生多模态与 Visual Coding:不同于纯文本旗舰,Flash 原生融入视觉编码能力,将视觉编码并入 Coding 循环,形成"生成 — 观察 — 修正"闭环——官方演示中,模型在 Blender 中自主运行 16 小时,从零搭建出约 400 平方米的专业主厨自宅与测试厨房(前端 UI 渲染验证、游戏构建、3D 视效等场景均属此类);
- 国产芯片适配与成本下探:将多模态编码、Prefill 预填充、Decode 解码拆为 EPD 三套独立调度池,在 10 万张国产芯片集群上端到端性能较基线提升 3 倍;API 定价仅为 GLM-5.3 的 1/10(限时折扣内 1/20),约为 Claude Opus 4.8 的 1/40。
双轨协同架构对比
| 维度 | 旗舰线(GLM-5.3) | Flash 线(GLM-5.3-Flash) |
|---|---|---|
| 战略定位 | 探索智能上界、突破前沿基准 | 极低成本落地、多模态全场景渗透 |
| 模型结构 | 744B-A40B,78 层 MoE(256 选 8 + 1 共享) | 320B-A18B,45 层混合注意力(34 KDA + 11 稀疏 MLA) |
| 训练重心 | 纯文本后训练 RL Scaling(复杂环境/沙箱) | 30T 多模态全新预训练 + 后训练对齐 |
| 核心突破 | 复杂编程(Coding Agent)、网安攻防链涌现 | 原生 Visual Coding(生成-观察-修正闭环)、超轻 KV 缓存、国产芯片高吞吐 |
| 模态支持 | 纯文本(1M Context / 128K 输出) | 原生图文多模态(1M Context / 131K 输出) |
| 定价与门槛 | 旗舰标准计费(输出约 ¥28/百万) | 价格砍至 1/10 ~ 1/20,约为 Opus 4.8 的 1/40,全面开源(MIT) |
核心本质
这种双轨并行印证了当前大模型演进的新规律:旗舰线通过"加深后训练(RL)"验证大模型在自主规划、工具协同与复杂领域(如攻防)的能力天花板;一旦在天花板上测出关键规律,Flash 线便通过"架构重构 + 高效稀疏化"将这套能力以极致低成本形态下沉——既保证技术探索的先锋性,又守住商业化交付与开发者生态的护城河。旗舰的网安涌现成果与 Flash 的视觉编码闭环,分别代表"能力上限"与"成本普适"两种价值,构成智谱在港交所上市(02513.HK)后兼顾利润率与市场份额的完整叙事。
十一、挑战与隐忧
- KV 缓存仍落后:每层 KV 高于 Kimi-K3 与 DeepSeek-V4-Flash,长上下文场景的成本竞争力尚未完全兑现,官方承诺继续优化;
- 折扣期后的真实定价:限时 1/20 折扣结束后能否留住用户,取决于 1/10 定价下的长期成本结构;
- 国产芯片稳定性未知数:10 万张国产芯片集群在全球真实负载下运行尚属首次,更大规模流量下的稳定性、故障率与成本账仍有待时间检验;
- 匿名测试的合规与平台规则:以匿名模型在开放平台大规模免费放量测试,可能引发 OpenRouter/OpenCode 对"匿名模型"的规则调整或其他厂商效仿;
- 能力分层:Flash 未继承 GLM-5.3 旗舰的网安后训练成果(漏洞发现 2436 个等),多模态 + 代码双强之外,安全类能力的下沉路径尚不明朗。
十二、总结与展望
核心结论
- GLM-5.3-Flash 以 320B/18B 的紧凑架构、57 分 AA 指数(持平 Opus 4.8)和 1/40 价格,重新定义了前沿多模态模型的性价比基准;
- Ox-Alpha 匿名实测是发布策略上的创新,发布即带市场验证;
- 10 万张国产芯片 + SGLang 深度定制引擎支撑起全球真实负载,国产算力首次大规模集体出海并证明可用;
- 在 DeepSeek 涨价之际逆势击穿价格底线,战略时机精准;
- 技术路径分化:GLM-5.3-Flash 与旗舰并非同一基座——旗舰走"同基座、纯后训练"路线,Flash 走"全新基座、架构重建 + 多模态"路线,二者共享世代代号与生态、不共享模型权重;智谱正在用两条腿同时验证"能力"与"成本"两个极限。
后续值得关注的问题
- 限时折扣(GLM-5.3 的 1/20)结束后,实际留存定价与用户规模;
- KV 缓存仍高于 Kimi-K3 / DeepSeek-V4-Flash,后续优化进度;
- 国产芯片集群在更大规模流量下的稳定性与成本账;
- GLM Coding Plan 体验卡每日 1 万张的转化效果;
- 匿名测试打法是否会引发其他厂商效仿,以及 OpenRouter 等平台对"匿名模型"的规则变化;
- Flash 是否会把 GLM-5.3 旗舰版的网安后训练成果(漏洞发现能力)部分下沉。
参考来源
- 财联社/科创板日报:10万张国产算力卡扛起"牛来":智谱开源GLM-5.3-Flash
- 品玩:Z.ai开源GLM-5.3-Flash多模态模型 定价仅为Opus 4.8的1/40
- 搜狐/DoNews:智谱发布今日上线并开源多模态模型GLM-5.3-Flash:320B总参数
- 凤凰科技:Ox Alpha现身:智谱开源GLM-5.3-Flash原生多模态模型
- SiliconAngle:Z.ai open-sources 'Ox Alpha' model as GLM-5.3-Flash
- 新京报:智谱开源GLM-5.3-Flash"牛来",背后是国产芯片
- 36氪:智谱"牛来"模型算力谜底:全部国产卡承载,价格仅为Opus 4.8的1/40
- 钛媒体:GLM-5.3-Flash发布,多模态终于来了
- Wccftech:Zhipu Unmasks The Mystery Ox Alpha Model as GLM-5.3-Flash
- vLLM Recipes:zai-org/GLM-5.3-Flash 部署配置
- HuggingFace:zai-org/GLM-5.3-Flash 模型卡
- Z.ai 官方博客:GLM-5.3-Flash
- 智谱官方文档:GLM-5.3-Flash API
- CSDN:GLM-5.3 技术解析:不换基座,Coding 能力为何暴涨 50%?(744B/40B、78 层、256 专家选 8 等规格口径)
- 站长之家/AIbase:国产大模型打出王炸!智谱GLM-5.3-Flash原生多模态颠覆行业价格战(Visual Coding 闭环与 Blender 16 小时案例)
- 华尔街见闻/大象银行:智谱认领"牛来":SemiAnalysis 评"英伟达护城河再受考验"(参数约旗舰 40%、DeepSeek 提价后需求外溢)
- DataLearner:GLM-5.3-Flash:架构、视觉编程能力、官方评测与价格(前代 GLM-4.7-Flash、5 折期至 9 月 9 日、第三方评测)
- 新浪科技:Sebastian Raschka 绘制的 GLM-5.3-Flash 架构图(34 层 KDA + 11 层 MLA 的 3:1 混合构成)
本页是这篇文章的静态镜像。在互动版中打开,可使用附件下载、作者署名与目录导航。