易君召
发布于 2026-08-27 / 作者:易君召 / 30 阅读
0

🐮 「牛来」认主记:匿名 6 天用掉数十万亿 Token,Ox Alpha 真身竟是智谱 GLM-5.3-Flash

#AI

2026-08-26 · 智谱官方认领匿名模型 Ox Alpha · 当晚开源权重 · 全球开发者 6 天消耗数十万亿 Token · 全部由国产芯片支撑

🔥 一、新闻速览:一头"牛"吃掉了整个排行榜

8 月 26 日,据彭博社报道,智谱 AI 正式确认:8 月 20 日匿名上线、被中文社区昵称"牛来"的神秘模型 Ox Alpha,正是其 GLM 系列新一代模型,并于当晚发布模型权重。Ox 意为"牛",代号受电影《牛来》启发——而在认领之前,这头"牛"已经在全球开发者眼皮底下狂奔了整整六天。

时间

事件

8/14

智谱发布 GLM-5.3(编程最强开源模型),预告两周后开源权重

8/20

Ox Alpha 以"stealth model"身份匿名上线 OpenRouter + OpenCode

8/20-25

六天匿名期:登顶 OpenRouter,刷新单日调用纪录

8/26

彭博报道智谱认领;当晚开源 GLM-5.3-Flash(320B-A18B)权重

匿名期规格:104.86 万 Token 上下文窗口、单次最大输出 13.1 万 Token、支持文本/图片/视频输入、工具调用与结构化输出——一次可读完大型代码仓库与长程 Agent 运行记录。

认领的底气来自生态:智谱 API 用户已接近 700 万,启用超 5 万块国产算力芯片,并建成 1GW 级国产芯片 AI 数据中心;GLM Coding Plan 订阅(118 元/月起)与 ZCode、AutoClaw 等工具链构成完整商业闭环——这头"牛"并非横空出世,而是蓄力已久的正式亮相。

🐂 二、匿名六天:一场全球级的压力测试

数据震撼:截至 8/25,Ox Alpha 在 OpenRouter 近七天窗口处理约 23.2 万亿 Token 排名第一——同期 DeepSeek V4 Flash 0731 约 11.6 万亿,上线不到一周即达后者的两倍。OpenCode 同步免费开放并宣称准备了每天 100 万亿 Token 的服务容量(理论峰值,平均每秒约 11.6 亿 Token)。

口碑爆棚:大量调用发生在 Claude Code、Hermes Agent、OpenCode 等编程框架内;Stripe CEO Patrick Collison 试用后公开评价"非常令人印象深刻"。一项广泛传播的社区测试显示,Ox Alpha 在 10 个 DeepSWE 任务中拿下 80% 成功率,高于同组 Claude Fable 5、GLM-5.3 与 GPT-5.6 Sol(注:10 题小样本,非正式榜单)。

社区"侦探"破案:在多组中英文/代码/Emoji 混合文本中,Ox Alpha 与 GLM-5.3 的分词器 token 计数高度一致(差异可由隐藏系统提示词解释,仅约 75 token 包装偏差);受控视频测试的抽帧方式、时长与 Token 消耗关系也与智谱 GLM 视觉模型相似;API 错误码与措辞同样具有智谱特征。更有意思的是:今年 2 月匿名模型 Pony Alpha 就曾被揭晓为 GLM-5 早期测试版——从"小马"到"牛来",匿名发布已是智谱测试新模型的固定打法。

算力悬念:外界一度因"免费跑一周需要天量算力"猜测模型来自谷歌/微软。直到 7 月彭博披露智谱已建成1GW 级国产芯片 AI 数据中心(部分运营)并收购异构算力软件公司中科加禾,谜底才逐渐清晰。

🧩 三、真身揭晓:GLM-5.3-Flash 主要功能特性

1️⃣ 低成本多模态旗舰:320B-A18B
总参数 3200 亿、激活仅 180 亿,是 GLM-5 系列首个原生多模态模型。对比 GLM-4.5(355B/激活32B/92层),激活参数量与层数几乎减半(18B/45 层),结合 30T Token 多模态预训练语料,以更少算力实现更强性能。

2️⃣ 前沿混合架构
首个采用"稀疏注意力 + 线性注意力"混合架构的开源前沿模型——在保持精准长上下文能力的同时大幅降低服务成本;配合流形约束超连接(mHC)提升模型 Scaling 能力。

3️⃣ 视觉原生融入 Coding 循环
模型能主动观察界面、渲染结果与交互反馈,并据此持续测试与改进——前端开发、游戏构建、Blender 3D 场景,乃至 BUA/CUA 驱动的真实环境操作,都能在代码、浏览器、图形界面间协同完成。

4️⃣ 端到端办公工作流
拓展至 Office、金融研究、专业文档场景:自主拆解复杂目标、调用工具、检查并优化输出,完成从研究分析到 PPTX/PDF/DOCX/XLSX 成品交付的完整闭环。

5️⃣ 性能与定价
AA 综合智能指数 57 分,进入全球前沿模型区间、与 Claude Opus 4.8 持平;自研 Code Bench 体感评估中编程表现与 Opus 4.8 相当。定价为 GLM-5.3 的 1/10(限时折扣 1/20),仅为 Opus 4.8 的 1/40

📈 四、相比之前开源版本的增强

维度

GLM-5.2

GLM-5.3(8/14)

GLM-5.3-Flash(8/26)

定位

前代旗舰

编程最强开源模型

低成本多模态旗舰

提升方式

后训练 Scaling(体感 +50%)

全新架构(激活/层数近减半)

Terminal-Bench 3.0

4.6

28.3

同系能力

DeepSWE v1.1

46.2

66.9

社区 80%(10 题样本)

原生多模态

✅ 文本+图像+视频

AA 智能指数

57(= Opus 4.8)

定价

基准

1/10(限时 1/20)

核心逻辑:GLM-5.3 用"同一基座、后训练 Scaling"把智能上界顶上去;GLM-5.3-Flash 则用"全新极低成本架构 + 原生多模态"把能力密度打下来——一高一低,双线卡位。

⚔️ 五、对比国内外顶级大模型

维度

GLM-5.3-Flash

Claude Opus 4.8

Claude Fable 5

DeepSeek V4 Flash 0731

参数量

320B(激活18B)

数千亿级

数千亿级

284B(激活13B)

AA 智能指数

57

57

编程(Code Bench)

≈ Opus 4.8

基准

更强

多模态

✅ 原生

❌ 纯文本

匿名期 Token 流量

23.2 万亿(第一)

11.6 万亿

定价(相对)

Opus 4.8 的 1/40

基准

低价

开源

✅ 权重已开源

竞争优势:① 激活 18B 却打出前沿分数——"性价比密度"无出其右;② 原生多模态 + Coding 视觉闭环是纯文本竞品难以追赶的差异化;③ 国产芯片全栈支撑,供应链自主可控;④ 匿名实测证明"免费 + 大额度"能真实转化为全球开发者口碑(含 Stripe CEO 背书)。

🏆 六、特色亮点与不足

亮点:

  • 🎭 教科书级匿名发布营销:拿掉品牌预期让能力说话,免费流量换来全球实测数据与社区自传播——"身份悬念"本身就是传播引擎;

  • 🖥️ 国产算力顶住全球洪峰:匿名期全部请求由国产芯片集群承载,是国产算力最大规模的真实世界压力测试;

  • 💰 极致性价比:Opus 4.8 的 1/40 价格、GLM-5.3 的 1/10,多模态+编程全都要;

  • 🌍 开源承诺兑现:认领当晚即开源权重(HuggingFace zai-org/GLM-5.3-Flash),延续 Pony Alpha 以来的"匿名测试→公开"传统。

不足:

  • ⚠️ 评测数据来源需甄别:AA 57 分、Code Bench 对比为官方数据;社区 80% DeepSWE 为 10 题小样本,非统一正式榜单;

  • ⚠️ 匿名期评价有杂音:部分开发者反馈复杂后端与部分视觉任务表现一般;

  • ⚠️ 免费流量≠付费留存:免费期结束后的留存率与正式定价仍是未知数;

  • ⚠️ 算力声明待验证:1GW 数据中心"部分运营"、每天 100 万亿 Token 为理论容量,实际部署规模未披露;

  • ⚠️ Flash 定位局限:激活 18B 在极端复杂长程任务上仍可能不如全量旗舰。

🔮 七、未来演进方向

阶段

方向

短期

Ox Alpha 正式定名与 GLM-5.3 关系官宣;GLM Coding Plan 放量(每日 1 万张体验券);ZCode/AutoClaw 等工具链全量接入

中期

1GW 国产数据中心满负荷运转,Flash 系模型规模化服务;更多"匿名测试→开源"新品(Pony 2.0 式操作或成常态);多模态 Coding 生态(BUA/CUA/Blender)向全行业渗透

长期

智谱"开源模型 + 国产芯片 + 自研编译器/推理栈(中科加禾)"全栈闭环成型;以 1/40 定价冲击全球开发者市场,争夺"开源智能体基座"地位

📌 八、总结:三个核心信号

  1. 🏆 "匿名发布"正在成为大模型新品的标准打法——先匿名测能力、再揭面纱引爆话题,智谱用"小马"到"牛来"两次验证了这套玩法;

  2. 🏆 国产芯片第一次扛住了全球级流量洪峰——23.2 万亿 Token 的真实负载,为"国产算力+国产模型"组合写下了最有说服力的注脚;

  3. 🏆 性价比战争进入"1/40 时代"——前沿能力 + 1/40 价格 + 开源权重,智谱正在把"模型即服务"的定价锚点狠狠下压。

📌 一句话总结:牛来不是一夜成名,是智谱在国产算力上蓄力多年的公开亮相——接下来要看的是,免费期结束后还有多少人愿意为这头"牛"买单。


本文原创作者:易君召,详见:https://www.yijunzhao.cn/authors/yijunzhao,转载请注明出处。

原文链接 https://www.yijunzhao.cn/archives/niulai-ox-alpha-identity-zhipu-glm-5-3-flash-trillions-tokens

欢迎访问 小易撩挨踢

https://www.yijunzhao.cn/