2026-08-26 · 智谱官方认领匿名模型 Ox Alpha · 当晚开源权重 · 全球开发者 6 天消耗数十万亿 Token · 全部由国产芯片支撑
🔥 一、新闻速览:一头"牛"吃掉了整个排行榜
8 月 26 日,据彭博社报道,智谱 AI 正式确认:8 月 20 日匿名上线、被中文社区昵称"牛来"的神秘模型 Ox Alpha,正是其 GLM 系列新一代模型,并于当晚发布模型权重。Ox 意为"牛",代号受电影《牛来》启发——而在认领之前,这头"牛"已经在全球开发者眼皮底下狂奔了整整六天。
匿名期规格:104.86 万 Token 上下文窗口、单次最大输出 13.1 万 Token、支持文本/图片/视频输入、工具调用与结构化输出——一次可读完大型代码仓库与长程 Agent 运行记录。
认领的底气来自生态:智谱 API 用户已接近 700 万,启用超 5 万块国产算力芯片,并建成 1GW 级国产芯片 AI 数据中心;GLM Coding Plan 订阅(118 元/月起)与 ZCode、AutoClaw 等工具链构成完整商业闭环——这头"牛"并非横空出世,而是蓄力已久的正式亮相。

🐂 二、匿名六天:一场全球级的压力测试
数据震撼:截至 8/25,Ox Alpha 在 OpenRouter 近七天窗口处理约 23.2 万亿 Token 排名第一——同期 DeepSeek V4 Flash 0731 约 11.6 万亿,上线不到一周即达后者的两倍。OpenCode 同步免费开放并宣称准备了每天 100 万亿 Token 的服务容量(理论峰值,平均每秒约 11.6 亿 Token)。
口碑爆棚:大量调用发生在 Claude Code、Hermes Agent、OpenCode 等编程框架内;Stripe CEO Patrick Collison 试用后公开评价"非常令人印象深刻"。一项广泛传播的社区测试显示,Ox Alpha 在 10 个 DeepSWE 任务中拿下 80% 成功率,高于同组 Claude Fable 5、GLM-5.3 与 GPT-5.6 Sol(注:10 题小样本,非正式榜单)。
社区"侦探"破案:在多组中英文/代码/Emoji 混合文本中,Ox Alpha 与 GLM-5.3 的分词器 token 计数高度一致(差异可由隐藏系统提示词解释,仅约 75 token 包装偏差);受控视频测试的抽帧方式、时长与 Token 消耗关系也与智谱 GLM 视觉模型相似;API 错误码与措辞同样具有智谱特征。更有意思的是:今年 2 月匿名模型 Pony Alpha 就曾被揭晓为 GLM-5 早期测试版——从"小马"到"牛来",匿名发布已是智谱测试新模型的固定打法。
算力悬念:外界一度因"免费跑一周需要天量算力"猜测模型来自谷歌/微软。直到 7 月彭博披露智谱已建成1GW 级国产芯片 AI 数据中心(部分运营)并收购异构算力软件公司中科加禾,谜底才逐渐清晰。
🧩 三、真身揭晓:GLM-5.3-Flash 主要功能特性
1️⃣ 低成本多模态旗舰:320B-A18B
总参数 3200 亿、激活仅 180 亿,是 GLM-5 系列首个原生多模态模型。对比 GLM-4.5(355B/激活32B/92层),激活参数量与层数几乎减半(18B/45 层),结合 30T Token 多模态预训练语料,以更少算力实现更强性能。
2️⃣ 前沿混合架构
首个采用"稀疏注意力 + 线性注意力"混合架构的开源前沿模型——在保持精准长上下文能力的同时大幅降低服务成本;配合流形约束超连接(mHC)提升模型 Scaling 能力。
3️⃣ 视觉原生融入 Coding 循环
模型能主动观察界面、渲染结果与交互反馈,并据此持续测试与改进——前端开发、游戏构建、Blender 3D 场景,乃至 BUA/CUA 驱动的真实环境操作,都能在代码、浏览器、图形界面间协同完成。
4️⃣ 端到端办公工作流
拓展至 Office、金融研究、专业文档场景:自主拆解复杂目标、调用工具、检查并优化输出,完成从研究分析到 PPTX/PDF/DOCX/XLSX 成品交付的完整闭环。
5️⃣ 性能与定价
AA 综合智能指数 57 分,进入全球前沿模型区间、与 Claude Opus 4.8 持平;自研 Code Bench 体感评估中编程表现与 Opus 4.8 相当。定价为 GLM-5.3 的 1/10(限时折扣 1/20),仅为 Opus 4.8 的 1/40。
📈 四、相比之前开源版本的增强
核心逻辑:GLM-5.3 用"同一基座、后训练 Scaling"把智能上界顶上去;GLM-5.3-Flash 则用"全新极低成本架构 + 原生多模态"把能力密度打下来——一高一低,双线卡位。
⚔️ 五、对比国内外顶级大模型
竞争优势:① 激活 18B 却打出前沿分数——"性价比密度"无出其右;② 原生多模态 + Coding 视觉闭环是纯文本竞品难以追赶的差异化;③ 国产芯片全栈支撑,供应链自主可控;④ 匿名实测证明"免费 + 大额度"能真实转化为全球开发者口碑(含 Stripe CEO 背书)。
🏆 六、特色亮点与不足
亮点:
🎭 教科书级匿名发布营销:拿掉品牌预期让能力说话,免费流量换来全球实测数据与社区自传播——"身份悬念"本身就是传播引擎;
🖥️ 国产算力顶住全球洪峰:匿名期全部请求由国产芯片集群承载,是国产算力最大规模的真实世界压力测试;
💰 极致性价比:Opus 4.8 的 1/40 价格、GLM-5.3 的 1/10,多模态+编程全都要;
🌍 开源承诺兑现:认领当晚即开源权重(HuggingFace zai-org/GLM-5.3-Flash),延续 Pony Alpha 以来的"匿名测试→公开"传统。
不足:
⚠️ 评测数据来源需甄别:AA 57 分、Code Bench 对比为官方数据;社区 80% DeepSWE 为 10 题小样本,非统一正式榜单;
⚠️ 匿名期评价有杂音:部分开发者反馈复杂后端与部分视觉任务表现一般;
⚠️ 免费流量≠付费留存:免费期结束后的留存率与正式定价仍是未知数;
⚠️ 算力声明待验证:1GW 数据中心"部分运营"、每天 100 万亿 Token 为理论容量,实际部署规模未披露;
⚠️ Flash 定位局限:激活 18B 在极端复杂长程任务上仍可能不如全量旗舰。

🔮 七、未来演进方向
📌 八、总结:三个核心信号
🏆 "匿名发布"正在成为大模型新品的标准打法——先匿名测能力、再揭面纱引爆话题,智谱用"小马"到"牛来"两次验证了这套玩法;
🏆 国产芯片第一次扛住了全球级流量洪峰——23.2 万亿 Token 的真实负载,为"国产算力+国产模型"组合写下了最有说服力的注脚;
🏆 性价比战争进入"1/40 时代"——前沿能力 + 1/40 价格 + 开源权重,智谱正在把"模型即服务"的定价锚点狠狠下压。
📌 一句话总结:牛来不是一夜成名,是智谱在国产算力上蓄力多年的公开亮相——接下来要看的是,免费期结束后还有多少人愿意为这头"牛"买单。
本文原创作者:易君召,详见:https://www.yijunzhao.cn/authors/yijunzhao,转载请注明出处。
原文链接
欢迎访问 小易撩挨踢