AI 开发者日报 2026-08-27
Z.ai发布GLM-5.3-Flash,3200亿参数MoE架构,激活180亿,MIT开源,完全运行于国产AI芯片,日承载100T tokens推理流量。独立测试智能指数57分,与GPT-5.6持平,单任务成本仅0.09美元,性价比突出。代码和智能体任务表现强,但知识准确率28%,幻觉率28%,银行领域基准得分偏低,属“偏科生”。架构精简至45层,引入混合注意力机制,体现中国开源社区“效率优先”范式。发布后获开发者生态快速整合,Cline流量贡献11%,但视觉能力受质疑。总体代表国产芯片推理基础设施重要进展,开发者应关注底层机制而非榜单。
Z.ai 正式发布 GLM-5.3-Flash,此前预览的"Ox Alpha"模型身份揭晓
- Z.ai 宣布推出 GLM-5.3-Flash,这是一款原生多模态模型,拥有 100万 token 的上下文窗口、3200亿总参数 / 180亿激活参数,采用 MIT 许可证 发布,可通过权重、API、聊天、编程方案和 AutoClaw 等多种方式获取。
- Z.ai 同时将其定位为 GLM-5.2 的高性价比继任者,声称在其内部基准测试中,该模型在每个努力水平上都优于 GLM-5.2,且在编程能力上与 Claude Opus 4.8 持平。
- 此次发布也揭开了长期悬而未决的 Ox Alpha 之谜:多位博主明确将 Ox Alpha 与 GLM-5.3-Flash 联系起来,包括 SemiAnalysis、rasbt、theo 和 Cline。
- 第三方模型基础设施的早期支持几乎立即出现:CoreWeave、Baseten 以及 Cline 在 VS Code / JetBrains / CLI 中的免费集成。
- 发布后不久,Z.ai 工程师 Zixuan Li 表示聊天模板已更新,早期下载者应重新下载模型,暗示存在发布首日的打包或提示词格式修正。
- Artificial Analysis 最初发布了一篇概述,其中包含错误的 40万 token 上下文窗口,随后发布更正为 100万 上下文,与 Z.ai 最初的公告保持一致。
- 社区对这次开源权重发布的反应异常强烈,从简短的震惊反应如 “HOLY”,到更实质性的说法——该模型可能是目前每美元智能性价比最高的选择,例如 Artificial Analysis 和 zainhas。
- 此次发布也被纳入关于中国前沿开源模型的更广泛叙事中,有帖子指出中国开源实验室正在围绕线性注意力、稀疏注意力、残差路径设计和 Muon 等相似的架构选择趋同。
- 至少在一个模态能力声明上出现了独立的质疑:skalskip92 认为,尽管该模型号称"原生视觉",但在多个视觉/目标检测任务上表现偏弱。
官方声明与发布详情
Z.ai 的官方发布推文是事实锚点:GLM-5.3-Flash 被描述为:
- 320B 总参数 / 18B 激活参数
- 100万 token 上下文窗口
- 原生多模态
- MIT 开源许可
- 此前以 Ox Alpha 代号预览
- "完全运行在中国 AI 芯片上"
发布时的分发/可用渠道:
- Hugging Face 上的权重
- Z.ai API
- Chat
- ZCode
- Coding 计划
- AutoClaw
最有力的厂商自报性能声明来自 Z.ai 的编程相关推文:在 Z.ai Code Bench 上,GLM-5.3-Flash "在每个努力水平上都明显优于 GLM-5.2,并且与 Claude Opus 4.8 表现相当"。由于这是第一方基准测试,虽然有用,但相比独立评测应持更谨慎的态度来解读。
AutoClaw 随后发布的发布支持帖将该模型定位为适用于视觉语言理解、代码生成和长周期智能体任务,并配套提供了积分/返利优惠,但这主要是上线信息而非新的技术证据:AutoClaw 发布帖。
独立基准测试与成本/性能定位
在这组推文中,最实质性的独立评估来自 Artificial Analysis。他们的总结是:GLM-5.3-Flash 在 Artificial Analysis 智能指数上得分 57。
Artificial Analysis 引用的指标
- AA 智能指数得分: 57
- 与 GLM-5.3 的差距: 落后 GLM-5.3 3 分(后者为 60)
- 单任务成本: $0.09
- API 价格: $0.15 / 1M 输入,$0.50 / 1M 输出
- 缓存输入: 约 $0.026–$0.03 / 1M,被描述为 80% 折扣
- 模型规模: 320B 总参数 / 18B 激活参数
- 许可证: MIT
- 上下文长度: 最初标注为 400k,后来更正为 1M
Artificial Analysis 引用的对比数据
- 与 GPT-5.6 Terra 和 Muse Spark 1.2 在 57 分上持平,但单任务成本远低于它们。
- $0.09/任务 vs GLM-5.3 max 的 $0.68/任务。
- 声称单任务成本比 GLM-5.3 max 低约 7.5 倍。
- 声称单任务成本比 GPT-5.6 Terra 便宜约 5.7 倍,比 Muse Spark 1.2 便宜约 4.4 倍。
Token 效率与推理混合
Artificial Analysis 指出了一个有趣的权衡:
- GLM-5.3-Flash 运行智能指数测试消耗了 149M 输出 token
- 相比之下 GLM-5.3 消耗了 168M
- 但高于在相近智能指数得分下的 Kimi K3(133M) 和 Qwen3.8 2.4T A95B(136M)
- 149M token 中有 134M(约 90%) 是推理 token
这是一个重要的细微差别:该模型的经济性看起来出色,主要是因为 token 定价极低,而非因为它特别节省 token。
Artificial Analysis 的智能体/工作流评估
Artificial Analysis 还报告称,GLM-5.3-Flash 在智能体任务上的表现强于其原始知识指标所暗示的水平:
- GDPval-AA v2 Elo:1770
与 GLM-5.3 和 Grok 4.6 在误差范围内持平
- 仅落后于 Claude Opus 5 xhigh/max
Terminal-Bench v2.1: 84.3% vs GLM-5.3 的 83.9%
τ³-Banking:**47.2%**,落后 GLM-5.3 **3.1 个百分点**
知识/幻觉统计
- AA-Omniscience 得分: +7
- 准确率: 28%
- 幻觉率: 28%
- 与 GLM-5.3 对比:
GLM-5.3 准确率 34%
- GLM-5.3 幻觉率 30%
与 GPT-5.6 Terra 对比:
- Terra 准确率 47%
这揭示了一个反复出现的主题:GLM-5.3-Flash 在实际代码/智能体工作流上的表现可能远强于其在广泛真实世界事实知识上的表现。
架构与系统细节
一些技术层面的反应试图对 GLM-5.2 / GLM-5.x 的变化进行逆向工程或总结。
在推文中,最详细的公开架构分析来自 rasbt,他指出 GLM-5.3-Flash 从 GLM-5.2 的 744B-A40B 主干网络转向了 320B-A18B,并采用了以下技术:
- Kimi Linear 风格的 3:1 混合注意力机制
- 34 个 KDA 层(Kimi Delta Attention)
- 11 个 MLA/DSA 层
其中:
- MLA = Multi-head Latent Attention(多头潜在注意力)
- DSA = DeepSeek Sparse Attention(DeepSeek 稀疏注意力)
四条并行流
外加一个原生视觉编码器
同一条推文将其描述为“超级混合”架构,因为两个主要的注意力组件都已经是“高效”变体,而非简单的高效/全注意力混合方案。
来自 thealexker 的另一份实用的系统视角总结,将这次发布定位为一个效率故事,重点指出:
- 与 GLM-5.2 相比:
成本约为其 1/10
- 激活参数 32B → 18B
- 层数 92 → 45
每层更小的平均 KV 缓存
标题:每层更小的平均 KV 缓存
内容:在长上下文场景下,降低注意力计算量的复合效应显著。
声称视觉智能受益于编码/强化学习风格的改进。
指出 GLM-5.3 基础设施智能体 通过协助优化内核、瓶颈问题以及服务栈,共同参与了部分工作。
来自 eliebakouch 的这篇更广泛的背景帖子虽然带有主观色彩,但在技术层面值得关注,因为它将 GLM 置于中国开源模型趋势的语境中:
- 几乎所有中国前沿模型现在都采用 线性注意力
- 几乎所有模型都采用 稀疏注意力 / 索引器压缩设计
- 许多模型使用 花式残差连接,如 mHC、注意力残差、门控残差
- 许多模型使用 Muon
该帖子并非 GLM 论文的直接摘要,但它有助于解释为什么这些架构细节能立即引起模型工程师的共鸣:GLM-5.3-Flash 似乎是快速收敛的 效率优先的中国前沿开源设计空间 中的又一个数据点。
中国芯片角度与推理服务的影响
硬件/推理服务端是本次发布中最受关注的部分之一。
Z.ai 官方表示该模型“完全运行在中国 AI 芯片上”。最强有力的放大来自 SemiAnalysis,其聚焦于每天 100T tokens 在中国芯片上推理服务的说法。该推文并未提供完整的推导过程,但将这一基础设施壮举定位为本次发布中最令人震惊的部分。
各方反应都强调了其重要性:
此外,teortaxesTex 还给出了明确的粗略容量估算推理:
- 如果推理经济性与 V4-Flash 相当,
- 每 NPU 10K tokens/秒是“现实的”
- 每芯片每天 864M tokens
- 每天 100T tokens 大约需要 116K 块芯片
- 这意味着 10 万+ 芯片的规模,“可行”但将消耗总计算资源的极大比例
该估算属于推测而非确认,但它展示了工程师们如何解读这一推理服务声明:不仅仅是营销话术,更是一项基础设施宣言,暗示着庞大的国产加速器集群和成熟的推理优化能力。
采用与分发反应
整个反应周期中一个值得注意的部分是使用帖子的出现速度之快。
Cline 表示 GLM-5.3 Flash 已经成为其 Cline 历史上增长最快的模型,在不到一周的时间内驱动了 11% 的全部流量,同时还在 Cline 中将其宣传为 免费使用。这虽然带有一定的推广性质,但也是一个实实在在的需求信号。
基础设施提供商也迅速跟进:
- CoreWeave:"即将在 CoreWeave Serverless Inference 上线"
- Baseten:首日即可用,强调 通用智能 + 智能体编码、原生视觉能力 以及 100 万上下文窗口
- Dell(通过 Jeff Boudier):将 GLM 5.3 Flash 和 Qwen 3.8 Flash 定位为可立即用于 本地部署 的开源模型
这些反应之所以重要,是因为它们印证了 GLM-5.3-Flash 并非被当作一个新鲜事物来对待,而是迅速被纳入真实的推理/开发者技术栈中。
事实 / 外部可归因声明
- Z.ai 发布了 GLM-5.3-Flash,规格为 320B 总参数 / 18B 激活参数,支持 1M 上下文窗口,采用 MIT 开源协议,具备多模态能力,此前以 Ox Alpha 代号预览。
- Z.ai 声称该模型运行在国产 AI 芯片上。
- Artificial Analysis 报告显示 AA 智能指数为 57,每任务成本 $0.09,同时提供了多项基准测试细节和定价信息。
- Artificial Analysis 随后将上下文长度从 400k 修正为 1M。
- Zixuan Li 表示聊天模板已更新,模型用户需要重新下载。
- Cline 表示该模型在不到一周内贡献了全部流量的 11%。
- Baseten、CoreWeave、AutoClaw 等公司宣布了支持/分发计划。
观点与解读
- theo、zephyr_z9 和 nicdunz 表达了强烈的正面惊喜。
- thealexker 将这次发布主要解读为一个效率工程的故事。
- eliebakouch 将其视为中国前沿开放架构令人振奋的融合趋势的证据。
- zainhas 认为它现在是性价比最高的智能选择。
- skalskip92 认为该模型视觉能力不佳,对发布时强调多模态的定位提出了反驳。
- scaling01 声称"显而易见"Ox Alpha 就是 GLM 模型,并进一步指控 ZAI 使用了炒作账号;该说法在推文集中未得到证实。
支持的声音
大部分反应都非常积极,尤其是在成本、开放性和基础设施成就方面。
- matvelloso:称赞了 MIT 许可证
- theo:称输出价格"离谱",发布"令人难以置信"
- zainhas:称其为按任务成本计算的最佳性价比
- Cline:看到了强烈的真实世界采用信号
- Baseten:强调比 GLM-5.2 便宜 90%
- omarsar0:推荐在 agent 游乐场中用于视觉讲解场景
支持的理由基本上可以概括为:接近前沿水平的开放权重、宽松的许可证、超低定价、长上下文,以及出色的编码/agent 性能表现。
中立/分析视角
这些帖子更侧重于技术机制本身,而非炒作。
- Artificial Analysis:对性能、成本、幻觉率和 token 用量进行了基准测试,并清晰呈现了各项指标之间的权衡取舍
- rasbt:深入剖析了模型架构
- SemiAnalysis:聚焦于服务规模和芯片来源
- teortaxesTex:基于吞吐量假设估算芯片数量
这种视角将模型视为一件工程产物:其价值不仅在于基准排名,更在于设计、基础设施和经济性层面的考量。
批判性/怀疑性观点
批判性的反应虽然较少,但同样值得关注。
- skalskip92 表示该模型"在视觉方面表现相当糟糕",并引用了 Roboflow 风格的任务作为例证,包括航拍/卫星图像、农作物识别、技术图纸以及目标检测排行榜上的表现。
- dejavucoder 质疑此前宣称的"领先于 OpenAI/Anthropic"是否真的站得住脚。
- suchenzang 认为 Ox Alpha 的发布让此前那些类似联盟营销式的炒作显得十分明显。
- scaling01 更进一步,声称围绕 Ox Alpha 身份存在有组织的炒作行为;不过同样,在所提供的推文中并没有证据支持这一说法。
怀疑论者的核心观点是:厂商自报的基准测试结果可能美化了模型表现,某些模态能力的主张可能无法泛化到实际场景,而神秘模型的炒作可能在正式发布前就扭曲了舆论走向。
技术影响
从各方的反应中可以提炼出几个值得关注的影响。
1. 高效开源 MoE 模型正在压缩闭源模型在编程/智能体任务上的优势
如果 Artificial Analysis 和 Cline 的信号可靠,GLM-5.3-Flash 再次印证了一个趋势:开源权重模型在实用智能体任务上已经足够接近闭源水平,同时成本却大幅降低。
2. 对于部署经济性而言,活跃参数趋势比总参数量更重要
发布宣传和各方反应反复聚焦在 18B 活跃参数上,而非 320B 的总规模数字。来自 thealexker 和 rasbt 的对比分析表明,模型在以下方面进行了大幅削减:
- 活跃参数
- 层数
- KV 缓存负担
- 每层注意力计算成本
这正是降低延迟和成本、同时保留足够智能体/编程能力的配方。
3. 长上下文开源模型已与服务栈创新密不可分
100 万上下文这个卖点单独看意义有限,关键在于它与以下要素的组合:
- 混合线性/稀疏注意力
- 更低的平均 KV 缓存
- 针对特定芯片的服务优化
- 可能由基础设施智能体辅助的内核/服务栈调优
发布后的讨论中,系统工程执行受到的关注程度不亚于模型本身的原始质量。
4. 中国芯片生态成熟度正在成为模型竞争的一部分
"在中国芯片上运行"这一点并非偶然提及。它被解读为:
- 供应链韧性的体现
- 国产加速器能够支撑大规模前沿推理的证明
- 一个地缘政治信号,表明开源前沿算力正在何处积累
5. "多模态"在任务层面仍然脆弱
该发布声称原生支持多模态,部分用户也确实发现它在视觉解释类场景中很有用,但 skalskip92 的反例表明,原生视觉支持并不意味着在目标检测或技术图像等专业视觉感知任务上拥有顶级表现。对于评估"多模态"是否足以支撑生产级 CV 类工作负载的从业者来说,这一区别至关重要。
