🔥1. GLM-5.3 发布:Coding 更接近 Fable 5,顺手拿下"最强开源安全模型" — 热度 🔥🔥🔥🔥🔥
智谱今日发布 GLM-5.3,一出手便杀回"开源一哥、国模一哥":在多项主流基准中成为排名最高的开源模型,编程与智能体能力接近 Claude Fable 5;CyberGym 白盒代码审查 84.5%,一举成为最强开源安全模型。
量子位实测显示:随着 Token 预算增加,GLM-5.3 的 Coding 准确率持续走高,在 High 档位下能以明显更低的 Token 消耗做到超过 Claude Opus 4.8 最高档位的准确率。安全维度是这次升级的另一关键词——发布前两周,智谱联合清华、南开及众多企业实验室开展密集红队测试,累计发现漏洞 2404 个(初筛去重后),其中 1088 个中高危,覆盖系统内核、操作系统、浏览器引擎、开源基础组件等 220 个项目,最早的一个 Bug 可追溯到 40 年前。OSCHINA 同步以"编程能力最强的开源模型"为题报道。在智谱自家 Harness ZCode 中,量子位实测 GLM-5.3 用 28 分钟完成了 Karpathy 最新抛出的"指环王基准"(长时自主规划、写代码、摆放 3D 资产、编排动画并产出可运行作品,还按提示改编成约 90 秒中文旁白)——全程无人工干预。网友已在 X 上称其为"Fable 5 级"。
→ https://www.qbitai.com/2026/08/473038.html
→ https://www.oschina.net/news/501931
🔥2. 刚刚,Qwen3.8-27B 开源了!家用显卡也能跑,Apache 2.0 可商用 — 热度 🔥🔥🔥🔥🔥
阿里千问今日正式开源 Qwen3.8 系列模型,打头阵的 Qwen3.8-27B(270 亿参数)是"全球 AI 社区呼声最高的模型尺寸"——原生多模态稠密模型,支持 262K 原生上下文(YaRN 可外推至 1M Tokens),部署便捷、快且实用,所有人都可免费下载、部署及商用。
相比 Qwen3.6-27B,新模型在编程和办公场景性能大幅提升,表现甚至超越 Qwen3.7-Plus;新增 reasoning_effort 功能,可根据任务难度控制思考深度、更省资源;与 Qwen3.8 系列共性一致,可端到端完成复杂任务、直接交付可靠成果。协议为宽松的 Apache 2.0,Hugging Face 与魔搭社区同步上线。此前旗舰 Qwen3.8-Max 权重也已开源(2.4T MoE),至此千问累计开源 460 余个模型,全球下载总量超 30 亿次、衍生模型数超 30 万个。AINEWS 开发者日报今日也聚焦"Qwen 3.8 开源发布与本地推理",但同时提示"Qwen 3.8 本地运行不现实"(指 2.4T Max 版)——27B 恰好补齐了"家用显卡可跑"的空档。从 Max 顶配到 27B 家用,Qwen 正在用"全尺寸覆盖"巩固其全球最受欢迎开源模型家族的地位。
→ https://www.qbitai.com/2026/08/473379.html
🔥3. Gemini 3.7 Flash 发布:编码基准提升超 70%,限时五折抢市场 — 热度 🔥🔥🔥🔥
Google 在 3.6 Flash 发布仅三周后便推出 Gemini 3.7 Flash,定位面向编码、Web 开发、知识工作和智能体工作流的新主力模型,并推出持续至年底的限时 50% 折扣——每百万输入/输出 token 仅 $0.75/$3.75。
公布的性能提升数据包括:DeepSWE 65.3% vs 3.6 Flash 的 49.0%、FrontierCode 43.6% vs 34.4%、AutomationBench 30.4% vs 17.0%,以及 Code Arena Elo 1588 vs 1506/1538——编码与自主性基准实现实质性跃升。3.7 Flash 同步登陆 Gemini API、AI Studio、Android Studio、Antigravity 等生态入口。这一节奏意味深长:在谷歌旗舰 Gemini 3.5 Pro 疑似被取消、布林紧急接管 Gemini 团队的动荡背景下,Flash 系列正以"三周一迭代"的高速战术在主流价位段持续施压——用性价比对冲旗舰缺位的劣势。AINEWS 将其称为"中端价位性能/成本新前沿",而 DeepSeek V4 Pro(3 元/百万输入)、Grok 4.6(2 美元/百万输入)同期的激进定价,说明 2026 年下半年的模型竞争正全面进入"价格战 + 快速迭代"阶段。
→ https://ainews.liduos.com/post/2026-08-14
🔥4. 谷歌开始肢解 DeepMind:数个团队被划归总部,布林重新进入 AI 权力中心 — 热度 🔥🔥🔥🔥
DeepMind 换帅一周后震荡持续:路透社消息称,8 月 6 日全员会上管理层宣布数个非技术团队将从 DeepMind 迁出、改向谷歌公司汇报;与此同时,联合创始人谢尔盖·布林虽无正式头衔,却已重新介入 Gemini 的模型训练与资源分配。
被拆出去的是研究之外的支持团队,研究团队仍留在 DeepMind,但整场重组的目标指向同一件事:减少 DeepMind 与谷歌产品部门之间的中间环节,让 Gemini 更快进入搜索、Cloud 和其他产品。自 2014 年被收购以来,DeepMind 一直保留相当程度的自主权,如今正越来越接近"谷歌内部的模型研发部门"。权力天平也在倾斜:原 CTO Koray Kavukcuoglu 逐渐成为塑造 Gemini 方向的核心人物,谷歌发言人已确认他对 DeepMind 重大决策拥有最终决定权;且据知情人士透露,真正担任 DeepMind 与谷歌云(主要 AI 收入来源)主要对接人的一直是 Koray 而非哈萨比斯。布林的介入也超出精神鼓励范畴——他推动资源向"递归自我改进"(AI 自进化)方向集中,让 AI 更多参与自身研发、逐步减少对人类研究人员的依赖。谷歌正在用一场组织手术,回答"DeepMind 到底属于实验室还是产品部门"这个纠结了 12 年的问题。
→ https://www.qbitai.com/2026/08/473153.html
🔥5. 7 亿年薪留不住!余家辉离职 Meta 创业:刚交完 Muse 全家桶,人走了 — 热度 🔥🔥🔥🔥
Meta 多模态研究负责人余家辉官宣离开 Meta 创业——从 2025 年 6 月底加入到 2026 年 8 月 14 日宣布离开,满打满算一年零一个多月。就在离职前几天,Meta 刚推出 Muse Spark 1.2。
余家辉是 Meta Superintelligence Labs(MSL)核心团队 TBD Lab 的创始成员与多模态方向负责人,去年扎克伯格亲自下场挖他,传出"1 亿美元年薪"刷新 AI 人才市场纪录。这一年他带领团队接连交出 Muse Spark、Voice Mode、Muse Image 和 Muse Video——Meta 前沿模型从 Llama 转向 Muse 系列的关键功臣,Muse Spark 1.2 还把重点推向编程、长程 Agent 任务。官宣中他表示与扎克伯格、Meta 首席 AI 官亚历山大王共建 TBD Lab 的经历"非常鼓舞人心且充实",并称自己越来越被一个"对人类未来非常重要、但尚未被充分探索"的问题吸引——至于新公司叫什么、研究什么、有哪些合伙人,一个字没多说。Meta 研究员 Zhiqing Sun 透露,正是余家辉在旧金山一家餐厅说服自己加入 TBD Lab;一年后,轮到余家辉自己招进来的人把他送走。连续挖来的顶级人才一年就流失,Meta 的"超级智能豪赌"正面临留人难题。
→ https://www.qbitai.com/2026/08/473261.html
🔥6. HF 发布《开源模型现状:2026 夏季观察》:中国模型天花板碾压美国,Qwen 已成社区基座 — 热度 🔥🔥🔥🔥
Hugging Face 发布半年一度的开源生态分析报告:2026 年 1-8 月,公共模型仓库从 243 万增长到 296 万、数据集从 71.1 万到 100 万、Spaces 从 100 万到 144 万;但分布依旧极端——85.6% 的模型终身下载量不足 200 次,1.5% 的仓库包揽 99.2% 的下载。
报告最重磅的发现是"中国实验室跳过了渐进路线":2026 年几乎每个月,中国实验室发布的最大最强开源模型都大于美国实验室当月发布的最大模型——中国月度天花板在 754B 到 2.78T 参数之间,而美国在七个月中的五个月里天花板低于 130B(例外是 NVIDIA 5-6 月的 Nemotron 3 Ultra 561B 和 Thinking Machines 的 Inkling)。报告还指出:Moonshot、MiniMax、小米和 Z.ai 几乎不发布 70B 以下模型,开发者第一次接触它们就是一个自己任何设备都跑不动的庞然大物;而腾讯和阿里 Qwen 则覆盖从 1B 以下的完整范围——"Qwen 已经成为社区的基础模型"。其他观察包括"注意力≠采用率""开源权重正在改变价值沉淀位置""小模型仍是实用层""Agent 是新的用户"。这份报告为理解 2026 年开源格局提供了最权威的数据坐标。
→ https://hf-mirror.com/blog/state-of-open-models-summer-2026
🔥7. DeepSeek Harness 生态爆发:发布 24 小时逼近 10 万 star,桌面端与 UI 皮肤社区火速跟上 — 热度 🔥🔥🔥🔥
DeepSeek Harness 开源仅一天,GitHub star 已达 97,137 并持续飙升;社区生态火速成型——anywhere-labs/deepseek-harness-desktop(现代化桌面端,2135 star)与 zhu1090093659/dsh-web-ui(插件与皮肤合集,1984 star)同日涌现。
量子位深度体验文章进一步披露:DSH 基于 Cordis 驱动(参考《A Programming Paradigm for Spatiotemporal Composability》),定位"一切皆插件"——模型、工具、策略、存储、上下文管理全部可插拔,官方内置一百多个插件,四类 Agent 预设(标准/PTC/极简/创造),"轨迹"功能可事件级回放 Agent 行为、看清每个环节烧了多少钱。AINEWS 补充了社区视角:该项目明确标注"不稳定,将会有破坏兼容性的变更",尚未提供基准测试与完整实现细节,并引导开发者加入官方 Discord。生态的快速跟进(桌面端、UI 皮肤、插件市场)说明"Agent 时代的安卓"叙事正在兑现——一个开源 Harness 的第三方生态能在 24 小时内成型,这在闭源 Agent 工具时代是不可想象的。量子位同时提醒:DeepSeek 8 月 17 日 API 大涨价(尤其缓存),开源 Harness + 商业化 API 的组合正在重构开发者工作流。
→ https://github.com/deepseek-ai/deepseek-harness
→ https://github.com/anywhere-labs/deepseek-harness-desktop
🔥8. DeepSeek V4 Pro 发布波折:HF 权重一度 404,config 与权重层数不匹配引社区热议 — 热度 🔥🔥🔥
AINEWS 开发者日报披露 DeepSeek V4 Pro 发布过程中的插曲:Hugging Face 权重仓库一度返回 404/私有状态,社区发现 config.json 声明 43 个隐藏层(类似 Flash 变体),而下载的权重分片包含 61 层——疑似打包/配置不匹配导致撤回修正后重新发布。
社区评论同时指出:DeepSeek-V4-Pro-0813 作为 1.7T 参数模型,相比 Kimi 的 2.8T 模型表现异常强劲,DeepSWE 从 V4-Pro Preview 的 12.8 跃升至 62.7,据报道超越了 GLM-5.2 和 Opus-4.8;评论者对速度和基准提升印象深刻,但也有人敦促谨慎——最初的 HF 产物内部不一致,可能需要修复。这一事件折射出 2026 年开源发布的常态与风险:一方面,中国开源模型以周为单位刷新基准(DeepSeek、GLM、Qwen 三线并进),"发布即巅峰"成为标配;另一方面,超大模型(1.7T-2.4T)的打包、配置与验证流程复杂,仓促发布容易出岔子。DeepSeek V4 Pro 的最终版本性能是否如社区实测所示,仍需等待官方博客与稳定权重确认。
→ https://ainews.liduos.com/post/2026-08-14
🔥9. 机器人疯狂"吃算力":研发算力需求两年涨 10 倍,具身智能逼出"第三朵云" — 热度 🔥🔥🔥
逐际动力联合创始人兼 CTO 谌骅透露,过去两年公司研发团队对算力的需求增长了 5 到 10 倍,"有多少卡就能吃掉多少卡"。从会聊天到会干活,机器人要经历遥操作数据采集、算法调试、仿真训练、真机部署的全流程,每个环节都离不开计算资源。
量子位报道指出,机器人的具身智能研发正从单点实验走向复杂工程协作:一个完整团队需要同时处理仿真训练、数据处理、模型迭代、多人协作和真机验证,研发资源从"一台机器"变成"一整套持续运行的基础设施"。尤其在人形机器人研发中,3D 仿真需要同时处理复杂场景、机器人运动和物理交互,对图形算力要求极高。阿里云智能集团副总裁张献涛提出"第三朵云"论断:第一朵云支撑互联网、第二朵云支撑移动互联网,而机器人时代需要第三朵云——让算力、开发环境和 3D 交互能力一起进入机器人研发流程。逐际动力在"创学营 2026"中借助阿里云无影灵构云上工作站,选手浏览器登录云端即可跑 Isaac Sim 仿真评测,无需提前采购固定设备——这场演练的隐藏副本,是"如何让研发机器人的公司变得更高效"。
→ https://www.qbitai.com/2026/08/472722.html
🔥10. 百度「库库AI」定名:AI 办公 MAU 超 2500 万行业第一,新推独立端进军专业级 — 热度 🔥🔥🔥
百度 AI Day 开放日上,百度文库网盘通用智能体 GenFlow 官宣中文名「库库AI」:目前 AI 办公 MAU 已超 2500 万、位居通用 AI 办公赛道行业第一,并同步上线独立端(PC 客户端、网页端、小程序及企业版)。
库库AI 三年前即布局通用 AI 办公:2023 年百度文库、网盘进行大模型重构推出智能 PPT、AI 研究报告;2024 年全面融合,打通文库 18 亿专业文档、学术 7 亿专业内容和网盘私域知识构建数据飞轮;2025 年 4 月上线 1.0 版本,一年迭代到 4.0。能力上可自由调用 Office Agent 等子 Agent,一句指令并行调用 PPT、Excel、Word Agent 完成复杂办公任务,全模态生成与编辑。技术底座包括 MoE 架构、工具与全模态编辑器、Skill 与专业子 Agent、长期记忆与端云协同。全新"办公模式"首期面向金融场景:内置全球上市公司资料、股票行情、财报、研报等数据,可生成专业 Word 研报、金融分析 PPT、财务模型 Excel;行业首创全天候自动化任务执行(如长时间股票盯盘)+ 端云任务接力。此前国家工信安全中心《Office Agent 工作流测评报告》中百度文库得分排名第一。
→ https://www.qbitai.com/2026/08/473144.html
📌 今日趋势总览(AI Agents & 开源 LLM)
本文原创作者:易君召,详见:https://www.yijunzhao.cn/authors/yijunzhao,转载请注明出处。
原文链接
欢迎访问 小易撩挨踢