谜底揭晓:神秘模型 Ox Alpha 原来是 GLM-5.3-Flash,现已上线 Bitdeer AI Model Studio

谜底揭晓:神秘模型 Ox Alpha 原来是 GLM-5.3-Flash,现已上线 Bitdeer AI Model Studio

2026年 8 月 20 日,OpenRouter 上出现了一个神秘模型。

模型列表里只有一行标识:stealth/ox-alpha,它唯一公开的信息是:100 万 token 上下文窗口,原生支持文本、图像与视频输入,预览期内免费且不限量。

结果是 OpenRouter 历史上规模最大的一次模型上线。短短几天内,Ox Alpha 冲上该平台使用量榜首。工程师们发现这个来历不明的模型能完成本应需要前沿模型才能完成的任务。

来源:OpenRouter

随后,社区开始“指纹比对”,猜测持续了整整一周,最终锁定了一个“怀疑对象”。

8 月 26 日, 谜底浮现。Z.ai 宣布 Ox Alpha 是 GLM 系列的全新迭代版本:GLM-5.3-Flash,一个总参数 320B、激活参数 18B 的混合专家(MoE)模型, GLM-5 系列首个原生多模态成员。

今天,GLM-5.3-Flash 正式上线 Bitdeer AI Model Studio,我们面向企业级安全与弹性扩展而构建的 Serverless 推理平台,可以立即调用,无需管理底层基础设施或通过匿名供应商中转。

GLM-5.3-Flash 是什么?

GLM-5.3-Flash 是一个混合专家(MoE)模型,总参数 320B,每 token 激活参数 18B。据 Z.ai 介绍,它是 GLM-5 系列中首个原生多模态模型,并非从 GLM-5.3 旗舰版本蒸馏或后训练而来,而是基于全新训练的基座模型,其架构与训练配方围绕“单位算力可获得的能力”重新设计。

根据 Z.ai 公布的结果,它在基准测试与真实工作负载上全面超越 GLM-5.2,而价格约为后者的十分之一;在编码与 Agentic 基准上接近 Claude Opus 4.8。模型权重已以 MIT 许可证发布至 Hugging Face。

其中三项架构改动值得理解,因为它们正是这次隐身预览能扛住真实生产压力的原因:

  • 稀疏注意力与线性注意力混合架构。 这是 GLM 系列首次将两者结合:线性注意力高效处理局部依赖,稀疏注意力负责检索全局相关上下文。该设计大幅降低长上下文的服务成本,同时保留精确的长上下文能力。
  • IndexPool。 在百万 token 量级下,检索本身会成为瓶颈。IndexPool 通过加权池化压缩索引器 key 向量组,以控制延迟与显存占用。Z.ai 报告称,相比 GLM-5.3,注意力计算量减少约 3 倍,KV 缓存缩小 4.4 倍。
  • 流形约束超连接(mHC)。 用于进一步提升扩展效率,让模型在单位激活算力下交付更强能力。

配合最新的 30 万亿 token 多模态预训练语料,这些改动使一个仅激活 18B 参数的模型,得以逼近前沿模型的编码分数。

关键规格

Property

Details

Model

GLM-5.3-Flash (Z.ai)

Architecture

Mixture-of-Experts with hybrid sparse + linear attention and Manifold-Constrained Hyper-Connections (mHC)

Model size

320B total parameters · 18B active parameters

Pre-training

30T-token multimodal corpus

Context length

1,048,576 tokens

Max output length

131,072 tokens

Modalities

Text, image, and video input · text output

Reasoning

Reasoning model with extended chain-of-thought

Precision

Native FP8

Openness

Open weights under MIT license, published on Hugging Face

Serving frameworks

SGLang, vLLM, TokenSpeed, KTransformers

官方公布的性能表现

据 Z.ai ,在六项编码与 Agentic 基准测试中,GLM-5.3-Flash 超越了 GLM-5.2,且通常以较大优势胜出:在 DeepSWE v1.1 上为 63.4 对 46.2,在 AutomationBench 上为 48.8 对 26.2,同时整体表现接近 Claude Opus 4.8。

来源:https://z.ai/blog/glm-5.3-flash

第三方机构 Artificial Analysis 在其 Intelligence Index v4.1.1 中给出 57 分,使其成为当前开放权重模型中“单位成本智能水平”最强的选项之一。

来源:Artificial Analysis

为什么这对 Agent 经济性至关重要

当企业把 Agentic 系统推向生产环境时,需权衡多种条件。GLM-5.3-Flash 能很好地解决它们:

上下文成本 vs. 上下文长度。 多数号称大窗口的模型,在远未触及上限时就已不具经济性,因为注意力成本的增长方向对你不利。混合注意力设计直接针对这一点:注意力计算量减少约 3 倍、KV 缓存缩小 4.4 倍,意味着百万级窗口在生产环境中真正可用,而不只是规格表上的数字。

多模态 vs. 管道复杂度。 构建“读仪表盘、验证 UI 回归、处理扫描件”类 Agent 的团队,通常要在推理模型之前拼接一个 OCR 或视觉转文本环节。原生图像与视频输入直接去掉这一层,连同它带来的精度损失和延迟一起去掉。

能力 vs. 成本。 当大多数步骤是高频重复性工作时,把每一步都路由到前沿模型代价高昂。一个以极低单 token 成本逼近前沿编码水平的模型,会改变哪些步骤“值得跑”,以及 Agent 在完成任务前能负担多少次迭代。

开放性 vs. 生产就绪度。 MIT 许可权重意味着模型可被自主掌控、审计与自建部署。但即便激活参数仅 18B,320B 规模的模型仍是一项严肃的部署工程:FP8 权重本身约 306 GiB(尚未计入 KV 缓存),此外还需处理张量并行、显存容量与服务栈选型等一系列决策。

企业应用场景

仓库级编码与工程 Agent。 将整个代码库一次性纳入上下文,而无需切块处理;运行需要跨多轮保持连续性的长周期终端与重构任务。

浏览器与计算机操作 Agent。 原生视觉输入让 Agent 能直接理解屏幕上的真实内容,完成界面导航并验证执行结果,无需额外的视觉处理环节。

百万 token 级文档与日志分析。 合同审阅、合规检查、故障溯源与事后复盘。这类语料若走传统路径,必须依赖检索管道,也就要承受它固有的失效模式。

视觉 QA 与 UI 回归检查。 将截图与预期状态比对,描述视觉缺陷,并输出结构化结论。

中后台与知识工作自动化。 表格、演示文稿与仪表盘的推理任务。源材料是视觉化的,而结果需要结构化输出。

通过 API 在 Bitdeer AI Model Studio 上运行 GLM-5.3-Flash

你可以在 Bitdeer AI Model Studio 上运行 GLM-5.3-Flash。这是我们的 Serverless 推理平台,旨在让先进基础模型的调用变得简单且可弹性扩展。通过统一的、兼容 OpenAI 规范的 API,开发者与企业可以快速开始使用模型,无需管理底层基础设施,从而降低部署复杂度、缩短价值实现时间。

MIT 许可开放权重模型的一项实际优势在于可移植性:权重本身并不绑定于任何单一的服务环境。Bitdeer AI 在自主运营的数据中心中,基于 NVIDIA 算力基础设施提供 MaaS 服务。作为 NVIDIA 优选云服务合作伙伴(Preferred NVIDIA Cloud Partner),并通过 ISO/IEC 27001:2022 与 SOC 2 Type I & Type II 认证,我们为生产级 Agentic 部署提供所需的安全、合规与高性能底座。

快速开始

  1. 登录 Bitdeer AI Model Studio
  2. 在模型列表中找到 zai-org/GLM-5.3-Flash
  3. 生成 API Key, 即可开始调用。
curl -v --location 'https://api-inference.bitdeer.ai/v1/chat/completions' --data '{"model":"zai-org/GLM-5.3-Flash","messages":[{"role":"system","content":"You are a knowledgeable assistant. Provide concise and clear explanations to scientific questions."},{"role":"user","content":"Can you explain the theory of evolution in simple terms?"}],"max_tokens":512,"top_p":1.0,"temperature":1.0,"frequency_penalty":0.0,"presence_penalty":0.0,"seed":42,"stream":false}' --header 'Authorization: Bearer <API_KEY>'

结语

Agentic 工作负载的瓶颈已不在智能水平,而在于一个团队能负担多少上下文成本,以及 Agent 与“它需要看到的东西”之间还隔着多少层管道。GLM-5.3-Flash 同时解决了这两点:总参数 320B、激活参数 18B,混合注意力架构让百万 token 窗口在经济上真正可用,原生图像与视频输入,以及可自主掌控的 MIT 许可权重。

随着 GLM-5.3-Flash 上线 Bitdeer AI Model Studio,你可以立即在安全、企业级的基础设施上开始构建,并在需要扩张生产规模时,平滑扩展至 Bitdeer AI 的专属 GPU 算力。