易君召
发布于 2026-08-15 / 作者:易君召 / 3 阅读
0

AI Agents & 开源 LLM 简报 (2026年8月15日)

#AI

🔥1. DeepSeek Harness 插件一夜燃爆 GitHub:700+ 仓库,电子宠物、4399 小游戏全来了 — 热度 🔥🔥🔥🔥🔥

"Everything is a Plugin"的号召力超出想象:DeepSeek Harness 上线不到两天,GitHub 上打着 dsh-plugin 标签的公开仓库已冲到 700+ 个。有人给它装浏览器、长期记忆、数据库和任务管理,有人嫌它不会看图现场接了个视觉模型,还有人做出电子宠物、像素鲸鱼、18 款小游戏,甚至 2005 年中文网站风格广告 UI。

量子位盘点了几个代表性插件:dsh-agent-teams 可在 Harness 里现场拉起一支多 Agent 团队——一句话让当前 Agent 升职当队长、拉子 Agent 进组拆任务设依赖,Web 界面右上角还能实时围观"谁在干活、谁空闲、谁摸鱼",被网友戏称"赛博钉钉";DSH Better Sidebar 把文件管理、代码编辑、终端、Git 面板、后台任务、子 Agent 全塞进同一块侧边栏,让 Harness 长成迷你 IDE 工作台,少切窗口;dsh-at-file 给 DSH 补上类似 Codex 的 @file 能力,直接搜索并引用工作区文件。这些插件的爆发印证了"开源 Harness + 可插拔架构"的生态威力——DeepSeek 前脚喊出万物皆插件,网友后脚就把小黑鲸"插成万物",Agent 基础设施的社区活力正在呈现爆发式增长。

https://www.qbitai.com/2026/08/473597.html

🔥2. Qwen3.8-27B 实测:一张消费级显卡跑"Opus 级"Agent,多项榜单反超 Claude — 热度 🔥🔥🔥🔥🔥

Qwen3.8-27B 开源后社区实测数据陆续出炉:Agent 编程评测 SWE-bench Pro 上以 8.3 分优势超过 Claude Opus 4.6 Max,更考验真实软件工程能力的 QwenSWEBench 领先扩大到 15.2 分;多模态 Agent 能力甚至更突出——电脑操作评测 OSWorld-Verified 84.3 分对 72.7 分,手机操作评测 AndroidWorld 同样领先。

270 亿参数、原生多模态、262K 原生上下文(可扩至 100 万 Token)——量化后 24GB 显存的 RTX 3090/4090 都有机会整卡装下,"以后可以在本地跑 Opus 级模型"成为社区热评。专业长任务 Agent 评测 CoWorkBench(计算机、金融、法律、医疗)达 70.7 分,同样超过 Opus 4.6 Max 的 68.2。网友实测还包括:用 3.8-27B 生成像素风宝塔效果、俄罗斯方块(连空格键掉落屏幕抖动、消除行奖励倍增器都是模型自己加的)。官方 Benchmark 显示,这代 27B 重点强化编程、专业工作、研究及长程 Agent 任务,同时保留多模态读图、读 PDF、理解图表甚至视频的能力。从"家用显卡也能跑"到"跑 Opus 级 Agent",开源模型的性价比标杆又被抬高一截。

https://www.qbitai.com/2026/08/473669.html

🔥3. 至知研究院提出大模型可解释性新路线:稀疏权重分解,数据成本不到 1% — 热度 🔥🔥🔥🔥

至知创新研究院(IQuest Research)与 Safe AI Forum、牛津、斯坦福、清华的合作者提出稀疏权重分解(Sparse Weight Decomposition,SWD):不再训练一套独立的替代网络,而是直接从预训练权重中"拆"出可独立干预的单元——在匹配替换保真度的单矩阵实验中,SWD 使用的数据不到 Transcoder 等训练型基线的 1%。

传统机制可解释性研究存在一个反差:为了理解已训练好的模型,研究者往往要先训练一套新的稀疏表示(如 Transcoder、稀疏特征模块),相当于"为了打开黑箱先造一个更小的黑箱",且替代模块未充分复现时,后续分析会同时混入模型行为与替换误差。SWD 的做法是把稠密权重矩阵 W 分解为两个稀疏矩阵 A 和 B(W ≈ AB),二者共享的中间维度成为可独立评分、选择和消融的"瓶颈单元"——就像在密集交通网络中加一组只连接少量出入口的"中转站",研究者可以看到路径从哪里读取、向哪里写入,还能单独关闭它观察行为变化。实验覆盖 GPT-2、Qwen2.5 和 Qwen3.5-27B 的任务回路,通常以更少瓶颈单元达到相同充分性与必要性目标,还提供了完全不需要校准文本的 zero-data 版本。论文已发布(arxiv 2608.03913),为大规模系统性回路分析提供了低成本新路径。

https://www.qbitai.com/2026/08/473876.html

🔥4. 国产音乐模型正面挑战 SUNO:音潮 V4.0 上线,主打"读懂情绪" — 热度 🔥🔥🔥

连续两年打造 WAIC 世界人工智能大会官方主题曲的国产团队音潮,正式官宣音乐大模型 V4.0 于 8 月 14 日全平台上线——基于 V3.5 的底层全方位重构,精准直击 AI 音乐行业最大痛点"只会读文字指令、读不懂人类情绪与碎片化灵感",并宣布正面挑战全球标杆 SUNO。

音潮 V4.0 的核心升级在"人性化语义解读"与"音乐场景精准适配"两大维度。盲测对比中,面对"温暖、律动感十足且轻快愉悦的世界音乐,温暖男声 + 合成器贝斯 + 打击乐"这类海外通用专业 Prompt,V3.5 只能勉强识别"欢快"基础基调、作品平铺直叙"差一口气";V4.0 则精准锁定 warm、groovy、happy 三大情绪关键词,顺势落地轻快的拉丁舞曲曲风,情绪统一、风格精准、演绎完整。此前行业共识是"谁能解决 AI 读懂人类感性表达,谁就能主导下一阶段 AI 音乐赛道"——音潮以全栈自研姿态挑战 SUNO,标志着国产 AI 音乐从长期跟随转向正面突围。API 限时免费开放,试图以生态策略快速抢占创作者心智。

https://www.qbitai.com/2026/08/473866.html

🔥5. 郎咸朋 1.9 万字访谈实录:具身智能真正要解决的是"理解",最终拼的是量产和自我造血 — 热度 🔥🔥🔥

作为理想智能驾驶从 0 到 1、做到 150 万辆车量产的核心负责人,郎咸朋与华为出身的任庚联手创办昆仑行,成立三个月拿下数十亿人民币融资跻身独角兽。在这篇 1.9 万字访谈中,他反复强调两件事:具身智能真正要解决的是"理解",最终拼的是量产和自我造血。

郎咸朋回顾三段关键经历:读博期间在机器人国家重点实验室打下科研基础;在百度做街景隐私模糊处理时,把准召率从 70% 多提到 85% 后,发现"从技术先进到工程落地还有很大 gap",并领悟"模型不动、只改数据就能再提 5 个点"——数据对 AI 落地有决定性价值;在理想用 8 年把自动驾驶从 Demo 打磨成 150 万辆量产产品。他判断今天的具身智能很像 2015、2016 年的自动驾驶:路线未定、Demo 满天飞,真正的洗牌要等规模交付开始;只靠融资,大家都做不到具身智能实现那一天。昆仑行因此选择物理因果世界模型与"数据编译"路线,希望机器人学到的是背后的物理规律而非模仿套路。这场"百机大战"何时洗牌、因何洗牌,是他给出的行业最重要的观察坐标。

https://www.qbitai.com/2026/08/473407.html

🔥6. GitHub Trending:cordis 元框架登顶、Cursor 官方插件规范、CLI-Anything 要让所有软件"Agent 原生" — 热度 🔥🔥🔥

GitHub Trending 今日出现三个与 Agent 基础设施强相关的项目:cordiverse/cordis(DeepSeek Harness 底层驱动的"时空可组合性元框架")、cursor/plugins(Cursor 插件规范与官方插件)、HKUDS/CLI-Anything("让所有软件 Agent 原生"的 CLI-Hub)。

cordis 正是 DeepSeek Harness 所引用的《A Programming Paradigm for Spatiotemporal Composability》对应的开源实现——Harness 的"万物皆插件"架构正是建立在这套可组合范式之上,其登顶 Trending 标志着底层框架开始被社区研究。cursor/plugins 则是 Cursor 首次发布插件规范与官方插件仓库,头部 AI 编程 IDE 也正式拥抱"插件生态"路线,与 DeepSeek Harness、anthropics/skills(官方 Agent Skills 仓库)形成三方呼应——2026 年下半年的 Agent 竞争,正从"模型能力"全面转向"生态与插件体系"。CLI-Anything 则从另一角度切入:把软件的命令行接口变成 Agent 可直接调用的原生能力(CLI-Hub),让"所有软件 Agent 原生"成为可落地的工程路径。三个项目共同指向同一个趋势:Agent 时代的"操作系统层"正在成型。

https://github.com/cordiverse/cordis
https://github.com/cursor/plugins
https://github.com/HKUDS/CLI-Anything

🔥7. 周回顾·中国开源模型周:GLM-5.3、Qwen3.8 全尺寸、DeepSeek V4 Pro/Harness 三线并进 — 热度 🔥🔥🔥🔥🔥

本周是中国开源模型的"超级发布周":8 月 12-14 日三天内,GLM-5.3(Coding 逼近 Fable 5、CyberGym 84.5% 最强开源安全模型)、Qwen3.8-2.4T 与 27B(Max 级首次开源 + 家用显卡可跑)、DeepSeek V4 Pro 正式版(Agent 榜单对标 Fable 5、DeepSWE 12.8→62.7)与 Harness 相继亮相,开源阵营以前所未有的密度冲击闭源前沿。

这条线的意义远超单个模型:GLM-5.3 在开源一哥争夺中打出"编程 + 安全"双王牌,红队测试揪出潜伏 40 年的 bug;Qwen 用"2.4T 顶配 + 27B 家用"双尺寸覆盖,HF 夏季报告确认"Qwen 已成为社区的基础模型";DeepSeek 则用 V4 Pro 证明后训练威力、用 Harness 重构 Agent 开发范式(24 小时破 10 万 star)。Hugging Face《State of Open Models》报告给出数据坐标:2026 年中国实验室月度最大开源模型在 754B-2.78T 之间,而美国七个月中五个月低于 130B。当"中国开源三线并进"成为常态,闭源厂商的定价与迭代压力正被系统性放大——本周 Gemini 3.7 Flash 限时五折、Claude 系列持续调整,都是这场冲击的直接反应。

https://www.qbitai.com/2026/08/473038.html
https://www.qbitai.com/2026/08/471642.html

🔥8. 周回顾·xAI 双发:Grok 4.6 反超 Fable 5 + Grok Bot"AI 同事"正式官宣 — 热度 🔥🔥🔥🔥

本周 xAI 用两天完成"产品 + 模型"组合拳:8 月 12 日 Grok Bot 正式官宣(SpaceXAI 下场做"AI 同事"),8 月 13 日 Grok 4.6 发布——智能指数 61 追平 GPT-5.6 Sol,GDPVal-AA v2 得分 1753 反超 Fable 5 Max(1741),价格却只要每百万 token 输入 2 美元、输出 6 美元。

Grok 4.6 的差异化定位在"真实工作能力":GDPVal-AA v2、AA-Briefcase、Harvey LAB 三项测试全部登顶,但 Terminal-Bench v3.0 仅 26%(GPT-5.6 Sol 为 34.6%),说明纯命令行长链路 Agent 仍是短板。价格策略激进:单次请求上下文超 20 万 token 时价格翻倍,即便如此仍远低于 GPT-5.6 Sol Max(5/30 美元)与 Claude Opus 5(5/25 美元)。新模型同步接入 Grok Build、Cursor(首周双倍用量)、Grok Bot 与开放 API——Bot 已可直接调用 4.6,马斯克阵营的"模型 + 产品 + 编辑器"闭环初步成型。加上前脚发布的 Harness、后脚跟进的开源叙事,xAI 正在用"性价比 + Agent 化"的组合重新回到大模型牌桌的核心位置。

https://www.qbitai.com/2026/08/472067.html
https://www.oschina.net/news/501897/x-ai-grok-bot

🔥9. 周回顾·AI 科研双突破:Claude 扫清哈达玛矩阵 + Ilya 押注 TTT 测试时训练 — 热度 🔥🔥🔥🔥

本周 AI 在科学与范式两个方向同时推进:Claude 研究模型做出 668 阶哈达玛矩阵、扫清 2000 阶以下所有悬而未决的阶数(FrontierMath 第四个被 AI 解决的开放问题);Ilya Sutskever 的 SSI 首个模型曝光——基于 TTT(测试时训练)的小型推理引擎,最快 8 月露面。

哈达玛矩阵方向:Anthropic 研究员 Levent Alpöge 与两名人类伙伴 + Claude 合作,共构造 12 张矩阵,直接扫清 2000 阶以下全部悬案;此前该题难倒所有"深度推理"大模型,也收录于陶哲轩等菲尔兹奖得主联合出题的 FrontierMath 基准——AI 开始系统性地"清空数学待解列表"。TTT 方向:SSI 探索的模型会在解决问题过程中更新部分权重,小模型也能与大规模训练模型掰手腕,当前版本已就绪、下一代规模扩展 10 倍;英伟达 7 月底与 SSI 战略合作并投资(路透称 50 亿美元)、提供 Vera Rubin 系统,算力将增约 10 倍。若"部署后持续学习"路线跑通,将与预训练范式形成完全不同的竞争维度——"AI 创造下一代 AI"从口号走向工程。

https://www.qbitai.com/2026/08/472016.html
https://www.qbitai.com/2026/08/471701.html

🔥10. 周回顾·大厂组织剧变:谷歌肢解 DeepMind、余家辉离职 Meta、Jeff Dean 创业落地 — 热度 🔥🔥🔥🔥

本周全球 AI 大厂组织架构进入剧烈调整期:谷歌将 DeepMind 数个团队划归总部、布林重新介入 Gemini 训练;Meta 多模态负责人余家辉在交出 Muse 全家桶后离职创业;Jeff Dean 在 KDD 2026 自曝离职现场,转身成为 Discovery Loop 联创兼 CEO。

谷歌方面,DeepMind 正从"半独立实验室"变成"谷歌内部模型研发部门",Koray Kavukcuoglu 对重大决策拥有最终决定权,布林推动资源向"递归自我改进"集中;Meta 方面,余家辉(去年传闻 1 亿美元年薪)一年零一个月即离开,TBD Lab 创始成员流失引发"留人难题"讨论;Jeff Dean 则完成从谷歌到 Discovery Loop 的无缝切换,与 Sanjay Ghemawat、Oriol Vinyals、Quoc Le 共同探索 AI 自动化科学研究。三条线共同指向一个信号:2026 年的 AI 竞争已进入"组织力竞争"阶段——人才流动加速、实验室与产品部门边界重构、创始人重新下场督战。谁能在组织层面更快把研究转化为产品,谁就握有下一轮竞赛的主动权。

https://www.qbitai.com/2026/08/473153.html
https://www.qbitai.com/2026/08/473261.html
https://www.qbitai.com/2026/08/471254.html

📌 今日趋势总览(AI Agents & 开源 LLM)

趋势

热度

Agent Harness 插件生态爆发(DeepSeek 700+ 插件仓库)

🔥🔥🔥🔥🔥

家用级开源模型逼近闭源(Qwen3.8-27B 反超 Opus 4.6 Max)

🔥🔥🔥🔥🔥

中国开源模型周(GLM-5.3、Qwen、DeepSeek 三线并进)

🔥🔥🔥🔥🔥

Agent 生态标准战(cordis、Cursor 插件、Agent Skills)

🔥🔥🔥🔥

大厂组织剧变(谷歌肢解 DeepMind、Meta 人才流失)

🔥🔥🔥🔥

AI 科研突破(哈达玛矩阵、TTT 测试时训练)

🔥🔥🔥🔥

可解释性降本(SWD 稀疏权重分解)

🔥🔥🔥🔥

垂直领域国产模型突围(音潮挑战 SUNO)

🔥🔥🔥

具身智能量产论(郎咸朋:拼的是自我造血)

🔥🔥🔥

价格战持续(Grok 4.6、Gemini 五折、DeepSeek 涨价)

🔥🔥🔥


本文原创作者:易君召,详见:https://www.yijunzhao.cn/authors/yijunzhao,转载请注明出处。

原文链接 https://www.yijunzhao.cn/archives/ai-agents-kai-yuan-llm-jian-bao-2026nian-8yue-15ri

欢迎访问 小易撩挨踢

https://www.yijunzhao.cn/