易君召
发布于 2026-08-27 / 作者:易君召 / 31 阅读
0

AI Agents & 开源 LLM 简报 (2026年8月26日)

#AI

🔥1. 神秘「牛来」真身曝光:智谱 GLM-5.3 Flash,320B 原生多模态、全程国产卡跑完 62T Tokens — 热度 🔥🔥🔥🔥🔥

炒了一周的匿名模型「牛来」(Ox Alpha)终于被智谱官方认领:它正是刚刚发布即开源的 GLM-5.3 Flash——5 系列首个原生多模态模型。OpenRouter 首日登顶并刷新单日 token 用量历史纪录,OpenCode 上则终结了 DeepSeek 连续 56 天霸榜。

在模型尺寸上,GLM-5.3 Flash 总参数仅 320B、激活参数只有 18B,层数从 GLM-4.5 时代的 92 层压到 45 层,能力却全面超越 753B 的 GLM-5.2。架构上采用「线性注意力 + 稀疏注意力」混合设计:线性注意力抓局部信息,稀疏注意力通过轻量级索引器捞回全局上下文,配合 IndexPool 把索引器缓存向量从 4 个压到 1 个,注意力计算量降低 3.01 倍、KV Cache 缩小 4.44 倍。智谱还为 Visual Coding 专门做了数据合成流水线,模型可以自己看页面、看 3D 场景再继续修改。AA 榜单上它拿到 57 分、与 Claude Opus 4.8 持平,价格却只有 5.3 的 1/10(限时 1/20)、Opus 4.8 的 1/40,低于 DS-V4-Flash。最值得骄傲的是:匿名测试期间 OpenRouter、OpenCode 双平台的真实流量约 62T Tokens,全部跑在国产芯片上——通过 Encode-Prefill-Decode 分离式架构与混合缓存量化等优化,端到端服务性能较基线提升 3 倍,单 Token 成本与主流英伟达 GPU 相当。模型已全球开源,接入 ZCode、开放 API,支持 1M 超长上下文。

https://www.qbitai.com/2026/08/479919.html

🔥2. OpenAI 自研芯片「小辣椒」跑分碾压英伟达 Blackwell:每瓦吞吐最高 1.9 倍,老黄股价反涨 2.19% — 热度 🔥🔥🔥🔥🔥

OpenAI 与博通合作的自研推理芯片「小辣椒」在 Hot Chips 2026 大会公开,半导体深度研究机构 SemiAnalysis 受邀实测后给出惊人结论:这颗第一代芯片在几乎所有场景下都能击败 Blackwell。

小辣椒设计于 2024 年年中启动,从组队到流片仅约 16 个月,700W 功耗下最高达到 1.9 倍每瓦吞吐、最低低出 3.6 倍推理时延,低延迟、高吞吐、低并发全部达到 SOTA 级别。值得注意的是,Codex 在芯片设计中扮演了重要角色——部分由 AI 写出的内核,性能甚至优于人类写的版本,被视为自进化的一种体现。有意思的是英伟达股价当天不仅没跳水反而涨了 2.19%:一方面英伟达同日发布了 Jetson Orin Nano 2 机器人电脑,另一方面 OpenAI 明确表态不会弃用英伟达——训练仍大量依赖英伟达,双方还有融资担保层面的合作。这意味着「小辣椒」的战略定位是补齐推理侧成本与能效短板,而非全面替代训练生态。

https://www.qbitai.com/2026/08/479320.html

🔥3. 机器人基础模型迎来「GPT 时刻」:Skild AI S1 看一遍演示就能干 10 分钟长程任务,成功率 66% 碾压 VLA — 热度 🔥🔥🔥🔥

继上周 Generalist 发布能学习 3-12 秒动作的具身大脑 Gen 1.5 后,北美具身初创 Skild AI 发布全新机器人基础模型 S1,把机器人上下文学习的任务长度直接拉到 10 分钟以上。

S1 主打上下文学习(ICL):无需在后训练阶段专门学习新操作数据,只需看一段人类示范视频就能「照猫画虎」完成一整套从未见过的复杂操作流程。官方演示中,机器人完成了煎饼、冲泡咖啡、给植物换盆以及设备组装等长程任务,在未见过的任务上成功率干到 66%,而基于语言提示的 VLA 只有 9%。更夸张的对比是:传统后训练微调路线想追平 S1 只看一次演示的效果,大约要喂进去 380 次任务演示。从 Rhoda、Generalist Gen 1.5 再到 Skild S1,网友感慨「通用机器人可能两年后就会出现,而不是七年」——一旦这种能力真正泛化,以后开发机器人技能会像给 ChatGPT 写 Prompt 一样简单,机器人领域的「GPT 时刻」正在出现。

https://www.qbitai.com/2026/08/479834.html

🔥4. 宇树智元共用一个大脑!神秘模型 10 分钟一镜到底:跨本体协作、自主踢箱子、学会「偷懒」,来源至今成谜 — 热度 🔥🔥🔥🔥

一段 10 分钟一镜到底、无剪辑、无场外遥控的 Demo 在业内炸开:宇树与智元两款硬件架构、运动自由度、传感系统完全迥异的「竞品」机器人,共用同一个大脑互相配合、密切协作——这是全球罕见的跨本体通用大脑样本。

视频中名场面不断:够不到高处时机器人知道自己搬箱子踩上去;长程任务中途被打断还能精准恢复;智元给宇树戴围巾、宇树弯腰配合的跨本体协作默契十足;机器人甚至学会「偷懒」——挂毛巾时尝试三次后选择挂在肩头省力、拎拖鞋专拎挂绳。最震撼的一幕是身高 1.3 米的宇树 G1 够不到第三层柜子时,没有卡住也没有放弃,而是推理出要找箱子垫高,弯不下腰就一脚把箱子踹到柜子边——自主使用工具被视为人类的标志性能力。知情人士透露,这套模型跳出了主流 VLA、WAM 和传统世界模型的框架,采用物理约束动力学学习 + 跨本体统一建模 + 长时序鲁棒闭环三大内核,且据说只用了几十个小时的视频数据训练。目前文章作者与业界都还不知道这个神秘团队是谁——「到底是谁!!!」

https://www.qbitai.com/2026/08/479634.html

🔥5. IBM Granite 4.2 开源:首个稠密推理模型家族,15T Tokens 预训练 + Agentic RL 真环境学工具,Apache 2.0 — 热度 🔥🔥🔥🔥

Hugging Face 官方博客发布 IBM Granite 4.2 技术详解:这是 IBM 首个稠密 decoder-only 推理模型家族,3B/8B/30B 三档尺寸,从头用约 15T tokens 预训练,上下文窗口扩展到 512K,全部 Apache 2.0 开源。

Granite 4.2 的亮点在后训练管线:五阶段策略完成预训练后,用思维链、推理与 agentic 轨迹数据做监督微调,再进入多阶段强化学习管线——其中 8B 和 30B 模型在真实沙箱环境中通过 Agentic RL 学习使用工具,覆盖工具调用、多轮对话与长历史截断等能力。每个模型都内置 thinking / non-thinking 开关和低强度思考模式(对简单问题只花少量推理预算),并原生支持工具调用,可直接对接 OpenCode、Pi、OpenHands 等主流 Agentic Coding Harness。发布还附带了 FP8、FP4 与 GGUF 等多种量化方案和完整硬件软件栈说明。这是继 Meta Muse Glimmer、GLM-5.3 Flash 之后又一家把「推理 + Agent 能力」打包开源的大厂,开源模型在 Agent 场景的可用性正被快速拉平。

https://hf-mirror.com/blog/ibm-granite/granite-4-2

🔥6. 字节「豆包工作」正式发布:深度打通飞书,企业上下文成为办公 Agent 的下一场比赛 — 热度 🔥🔥🔥🔥

字节跳动面向生产力场景的 Agent 产品「豆包工作」正式发布,采用全新 Logo 独立应用,现在下载即可免费领取 30 天订阅权益。深度实测后最直白的结论是:它与飞书的深度打通,给出了目前 Agent 进入组织的一份最佳答案。

当主流办公 Agent 都会处理文件、调用工具、生成网页,基础能力越来越接近时,真正拉开差距的在于谁更了解一家公司的真实工作:项目群里聊过什么、会议上定了什么、多维表格记录到哪一步,以及每个人能查看和操作哪些数据。飞书恰好沉淀了这些信息——豆包工作接入飞书后不再需要每次从头认识一遍公司,可以沿着团队已有的讨论、数据和工作流继续往下干。界面采用经典三栏布局(左侧管理任务、中间查看执行过程、右侧预览编辑成果),支持飞书账号一键登录,用过 Codex、Claude Cowork 的用户基本没有上手门槛。字节此次把「企业上下文」作为卖点正面开打,办公 Agent 的竞争焦点正从「会不会用工具」转向「懂不懂你的公司」。

https://www.qbitai.com/2026/08/479348.html

🔥7. 蚂蚁国际「鹰序 TST 2.0」登顶时间序列基准:MASE 0.666 创 SOTA,巴克莱、花旗、德银、渣打已投产 — 热度 🔥🔥🔥

蚂蚁国际正式发布自研时序 AI 预测大模型「鹰序 TST」(FalconTST)2.0 版,在全球权威基准测试中取得最优成绩(SOTA),平均绝对比例误差 MASE 降至 0.666,超越多家全球顶尖科技公司的时间序列预测模型。

鹰序 TST 2.0 专为跨境支付外汇风险管理打造,预测准确率已稳定超过 93%,目前巴克莱银行、花旗银行、德意志银行、渣打银行等大型金融机构已将其应用于现金流预测与外汇管理,提升流动性风险敞口的预测能力。2025 年以来,Amazon Chronos-2、Google TimesFM 2.5、Salesforce Moirai 2.0 和 IBM FlowState 相继把多变量、长上下文、概率预测、跨采样率适配推向前台,但金融市场的低信噪比、机制切换、厚尾风险和跨市场联动,使通用榜单优势很难直接转化为稳定的金融预测收益。蚂蚁国际的路径是:2025 年先在外汇敞口和资金管理中完成业务验证,2026 年以 Falcon-2.0 强化单变量预测效率、Falcon-X 补足异构多变量关系建模,鹰序 TST 2.0 正是「通用时序基础能力 + 金融流程验证」的专用化尝试,并已具备向物流、航空、电商等行业拓展的能力。

https://www.qbitai.com/2026/08/479631.html

🔥8. Claude 插件生态进入「官方治理」时代:Anthropic 官方插件目录 34K Star,社区市场同步上线 — 热度 🔥🔥🔥

GitHub Trending 上 Anthropic 官方仓库 anthropics/claude-plugins-official 与 claude-plugins-community 同时上榜——前者是 Anthropic 官方管理的 Claude Code 高质量插件目录(★34,360),后者是 Claude Cowork 与 Claude Code 的社区插件市场(★2,198),Claude 插件生态从「野生技能」走向「官方治理」。

同日上榜的还有 tt-a1i/archify(★17,941,面向架构图、工作流、时序图的 Agent skill)、ConardLi/garden-skills(★10,924,前端知识类 Skills 合集)、AgriciDaniel/claude-obsidian(★13,432,Obsidian 第二大脑 + Claude Code 自组织)等。插件/skill 化正在成为 Agent 能力扩展的主流形态:从 DeepSeek Harness 的 dsh-plugin 生态一夜 700+ 仓库,到 Anthropic 亲自下场建立官方目录与社区市场,「插件市场 + 官方审核」的双轨治理模式开始成型。对开发者而言,这意味着 Agent 能力的获取将像 npm/pip 一样标准化,也为企业评估与选型提供了可信依据。

https://github.com/anthropics/claude-plugins-official

🔥9. Top 级视频 AI 免费了!Agnes Video 2.5 Flash 零积分可用,AA 榜单达主流水平 — 热度 🔥🔥🔥

明星 AI 实验室 Agnes 发布 Agnes Video 2.5 系列并上线 Pavo 创作平台:Flash 版无需消耗积分完全免费,适合 AI 短剧创作者大量生成和前期尝试;标准版每天送 200 积分,最高可生成 100 秒 2K 视频,支持多图 + 音视频参考。

量子位用 Flash 版复刻了抖音爆火的《云上天宫》,仙气飘飘、效果绝非五毛特效。从 Artificial Analysis 榜单成绩看,Agnes Video 2.5 已达到全球主流玩家水平,相比自家 2.0 版本名次大幅前进;换算成人民币,2.5 标准版每秒成本仅 0.15 元。视频 AI 赛道的竞争已从「模型能力比拼」进入「价格与工作流比拼」阶段:Higgsfield、Flova、LibTV、Adobe Firefly、美图开拍等玩家同台竞争,把模型能力编排成工作流、以 Agent 与无限画布形态构建创作平台,视频应用正在迎来残酷的淘汰赛。

https://www.qbitai.com/2026/08/479670.html

🔥10. 小宇宙《2026 AI 趋势报告》:AI 内容创作者增长 187%,「协作型 AI」搜索量暴涨 227% — 热度 🔥🔥🔥

小宇宙播客平台发布《2026 AI 趋势报告》:2025 年 AI 相关内容创作者数量同比增长 187%、相关节目数量同比增长 239%,AI 内容已成为平台增长最快、占比最高的新品类之一。

报告梳理了 AI 讨论的演变:从 2023 年至今,AI 正加速走出技术前沿,进入产品、创业与真实工作现场。进入 2026 年,AI 讨论重心再次转移——AI 不再只回答问题,而是更多直接参与完成工作,人们关心的问题从「AI 能做什么」转向「AI 如何做事、人何以自处」。数据显示,2026 年以来小宇宙上「协作型 AI」相关搜索量同比增长 227%、单集数量增长 290%、播放量增长 207%;报告观察到 Coding 是 Agent 能力最先显现的场景,如今这一能力正从代码走向 Work,工作场景成为各家追逐的新方向。AI 的生成能力也延伸至文字、图像、音乐和视频,「AI 与创作关系」相关单集数量同比增长 375.8%。报告指出,现实经验、品味、个人选择与责任,正在成为创作者重新确认自身价值的锚点。

https://www.qbitai.com/2026/08/479811.html

📌 今日趋势总览

趋势

热度

匿名模型「牛来」揭晓 = 智谱 GLM-5.3 Flash,国产卡承接全球流量

🔥🔥🔥🔥🔥

OpenAI 自研芯片「小辣椒」实测碾压 Blackwell

🔥🔥🔥🔥🔥

机器人上下文学习:Skild S1 看一遍就会、跨本体通用大脑

🔥🔥🔥🔥

IBM Granite 4.2 开源,推理 + Agentic RL 打包入 Apache 2.0

🔥🔥🔥🔥

办公 Agent 转向企业上下文:字节豆包工作发布

🔥🔥🔥🔥

Claude 插件生态官方化,Agent 能力进入「插件市场」时代

🔥🔥🔥

开源推理成本战:GLM-5.3 Flash 价格仅为 Opus 4.8 的 1/40

🔥🔥🔥

视频 AI 免费化与金融时序大模型落地

🔥🔥🔥


本文原创作者:易君召,详见:https://www.yijunzhao.cn/authors/yijunzhao,转载请注明出处。

原文链接 https://www.yijunzhao.cn/archives/ai-agents-kai-yuan-llm-jian-bao-2026nian-8yue-26ri

欢迎访问 小易撩挨踢

https://www.yijunzhao.cn/