易君召
发布于 2026-08-14 / 作者:易君召 / 3 阅读
0

AI Agents & 开源 LLM 简报 (2026年8月13日)

#AI

🔥1. 马斯克 Grok 4.6 重回一梯队:更低价格反超 Fable 5,AI 指数追平 GPT-5.6 Sol — 热度 🔥🔥🔥🔥🔥

xAI 发布 Grok 4.6,官方称其为 4.5 的重大升级且价格保持不变——每百万 token 输入 2 美元、输出 6 美元。Artificial Analysis 智能指数 61,与 GPT-5.6 Sol 打平;GDPVal-AA v2 得分 1753,反超 GPT-5.6 Sol(1728)和 Fable 5 Max(1741)。

Grok 4.6 的亮点集中在"真实工作能力":在衡量智能体实际工作表现的 GDPVal-AA v2、AA-Briefcase 和 Harvey LAB 三项测试中全部登顶。但短板同样明显——Terminal-Bench v3.0 仅 26%(GPT-5.6 Sol 为 34.6%),说明纯命令行环境下的长链路 Agent 操作仍是弱项,知识工作类任务则更擅长。价格策略激进:报价单小字显示,单次请求上下文超 20 万 token 时输入输出价格翻倍(4/12 美元)且整条请求按高价结算,但即便如此仍比 GPT-5.6 Sol Max(5/30 美元)和 Claude Opus 5(5/25 美元)便宜。新模型已同步接入 Grok Build、Cursor(首周双倍用量)、Grok Bot 和开放 API——就在前一天 SpaceXAI 刚发布 Grok Bot"AI 同事",如今 Bot 已可直接调用 Grok 4.6。xAI 前脚发 Harness、后脚出模型的组合拳,正在重塑大模型竞争格局。

https://www.qbitai.com/2026/08/472067.html
https://www.oschina.net/news/501917/grok-4-6

🔥2. 刚刚!Ilya 首个模型曝光:SSI 押注 TTT 测试时训练,"8 月可能出鞘" — 热度 🔥🔥🔥🔥🔥

前 OpenAI 首席科学家 Ilya Sutskever 创办的 SSI(Safe Superintelligence)首个模型曝光:X 上网友爆料,SSI 正在探索基于 TTT(Test-Time Training,测试时训练)的小型推理引擎——模型会用专门整理的数据学习"如何学习",再在解决问题过程中更新部分权重,小模型也能和大规模训练的模型掰手腕。

据爆料,SSI 当前版本已经准备就绪,团队正把下一代版本规模直接扩展 10 倍,且当前版本最快 8 月就可能露面、早期向少数用户开放。这条爆料与多条公开线索吻合:其一,Ilya 去年 11 月在 Dwarkesh Patel 播客中表示"AGI 和预训练两个词把行业带偏了",他设想中的超级智能更像一个极其聪明、求知欲旺盛的 15 岁少年——懂得不多,却能在部署后学习编程、医学和各种工作,在试错中成长,这正是"部署后持续学习"的元学习路线;其二,英伟达 7 月 27 日宣布与 SSI 长期战略合作并投资(路透社称金额高达 50 亿美元),提供下一代 Vera Rubin 系统,SSI 算力将增加约 10 倍,且英伟达罕见地表示"接触 SSI 严密保密的研究后决定推动它进入下一阶段"——老黄验过牌了。若 TTT 路线能顺利扩大规模,SSI 将撕开与预训练范式完全不同的竞争维度。

https://www.qbitai.com/2026/08/471701.html

🔥3. Claude 一举扫清 2000 阶以下哈达玛矩阵:FrontierMath 第四个被 AI 解决的开放问题 — 热度 🔥🔥🔥🔥🔥

Anthropic 研究员、数学家 Levent Alpöge 报告称,由三名人类和 Claude 组成的团队找到了 668 阶哈达玛矩阵的构造方案——共藏了 12 张矩阵,直接扫清 2000 阶以下所有悬而未决的哈达玛矩阵阶数。EpochAI 已将这道题暂时标注为"由 AI 解决",这是 FrontierMath 50 个开放问题中被 AI 解决的第四个。

哈达玛矩阵是方阵内只能填 +1 和 -1、任意两行对应元素乘积之和必须为 0 的正交矩阵,串联线性代数、有限域、数论与组合设计,其构造性证明具备极强的长链条推理考察价值,并关联至今未被证明的哈达玛猜想("所有 4 的正整数倍阶数都存在哈达玛矩阵")。668 阶之所以关键:2005 年数学家构造出 428 阶矩阵后,668 成为最小未知阶数,此后二十多年人类能造出尺寸大得多的矩阵,却偏偏卡在 668。此前这道题还难倒了所有具备"深度推理"能力的大模型,也被收录进陶哲轩等 3 位菲尔兹奖得主、IMO 顶级教练等 60 余人联合出题的 FrontierMath 基准。Alpöge 是此前用 Fable 5 推翻雅可比猜想的同一研究者,这次与 Claude 合作又下一城——"好数学家不挑 AI 模型",AI 开始系统性地清空数学待解列表。

https://www.qbitai.com/2026/08/472016.html

🔥4. Qwen 团队开源 Qwen3.8-2.4T:首次将 Max 级模型开放给社区,512 专家 MoE — 热度 🔥🔥🔥🔥🔥

阿里 Qwen 团队开源 Qwen3.8-2.4T(HF 模型 ID:Qwen/Qwen3.8-2.4T-A95B),首次将 Max 级模型权重开放给社区——2.4T 总参数、512-expert MoE 架构(激活约 95B),一举刷新开源模型规模上限。

这一发布被 AINEWS 开发者日报列为"超级发布日"五款前沿模型之一,并指出其"获得主流生态支持,但消费级显卡难部署"。模型在 HF 上线后迅速获得生态跟进:unsloth 推出 GGUF 量化版、amd 提供 Quark-MXFP4 版、RadixArk 提供 NVFP4 版、社区已出现 MLX 移植(PipeNetwork/qwen38-mlx,流式量化支持)。2.4T 参数对应约 4.9TB 原始权重(AINEWS 提到 LLM Compressor 与 Unsloth 可将 4.9TB 模型压缩至 397GB),推理部署依赖大规模集群或激进量化。Qwen3.8-Max 此前刚在 Artificial Analysis Agentic 榜单以 55.4 分登顶全球第一,如今权重全面开放,意味着社区可以自行部署、微调、蒸馏这颗"开源最强 Agent 模型"——开源阵营的"顶配"门槛,被阿里又一次抬高了。

https://www.oschina.net/news/501918
https://hf-mirror.com/models/Qwen/Qwen3.8-2.4T-A95B

🔥5. DeepSeek Harness 正式开源:Everything is a Plugin,Agent 时代的"安卓"来了 — 热度 🔥🔥🔥🔥

DeepSeek Harness 终于发布并将源代码开源(GitHub:deepseek-ai/deepseek-harness,发布当日即获 5.2 万 star),定位"Everything is a Plugin"——模型、工具、策略、存储、上下文管理全部可插拔,官方已内置一百多个插件,被称为 Agent 时代的安卓。

量子位深度体验文章披露了大量细节:安装可一条命令 npx @deepseek-ai/dsh web 启动 Web UI,或 git clone 源码。DSH 提供四类 Agent 预设:标准模式(完整编码 Agent:文件编辑、Shell、检索、Skills、计划模式、目标追踪、子代理、工作流)、PTC 模式(额外提供 Code Mode SDK,允许模型写 TypeScript 组合多步操作)、极简模式(仅 bash 和 str_replace_editor 两个工具,用于基准测试)、创造模式(自定义 Agent 预设)。最惊艳的设计是"轨迹"(Trajectory)功能——一个能随时监控 Agent 回放的事件级窗口,可直观看到模型在哪个环节栽跟头、每个环节烧了多少钱。另有 dsh-code-review、dsh-find-simplifications 等开发向 Skill 内置。多轮交互上,DSH 在指令不明确时会主动拉提问、开启头脑风暴并给建议选项。量子位特别提示:梁圣 8 月 17 日要大涨价,尤其是缓存价格——开源 Harness 与商业化 API 的组合拳,正在重构 Agent 开发者的工作流。

https://www.qbitai.com/2026/08/472208.html
https://github.com/deepseek-ai/deepseek-harness

🔥6. 研究者发现可从商业 LLM API 中窃取推理轨迹:隐藏思维链提取引发蒸馏争议 — 热度 🔥🔥🔥🔥

OSCHINA 报道一项新研究:研究者发现可以从商业 LLM API 中窃取推理轨迹(stolen-thoughts)——即通过特定手段提取模型隐藏的思维链(CoT)内容,引发关于模型蒸馏与知识产权的激烈争论。

(注:OSCHINA 提供标题级信息,正文为 JS 渲染不可抓取,以下结合 AINEWS 与行业背景整理。)AINEWS 开发者日报将此事列为今日安全热点:"研究人员声称提取了模型隐藏思维链,引发蒸馏争议。"其背景是:主流闭源模型(GPT-5.6、Claude 等)普遍隐藏思维链——Anthropic 此前明确表示 CoT 涉及安全与商业机密,DeepSeek V4 Pro 甚至把思维链压缩成"山顶洞语"来防提取并降 Token 消耗。若能通过 API 窃取完整推理轨迹,攻击者一方面可以"蒸馏"闭源模型的推理能力用于训练开源替代品,另一方面可能逆向出模型的安全对齐细节。这与此前"加密思维链提取论文"方向呼应,也让"隐藏思维链"这一防御策略的有效性受到质疑。对开源社区而言,这既是新的安全攻防前线,也再次凸显"开源权重"在透明度上的根本优势——闭源模型藏着掖着的推理过程,开源模型本就一览无余。

https://www.oschina.net/news/501916/stolen-thoughts

🔥7. 4.8 亿美元砸向端侧算力:Agent 芯片新贵 Acrab 首颗 AI 芯片进入量产 — 热度 🔥🔥🔥🔥

总部位于新加坡的 AI 计算基础设施公司 Acrab 完成 1.3 亿美元 B 轮融资(Vertex Growth 等参与),累计融资超 4.8 亿美元。成立不到三年,其第一代端侧 AI 芯片 GΞLIX 1 已进入量产准备阶段,并搭载于"个人 AI 中心"Agent Box。

Acrab 成立于 2024 年,不到一个月前刚发布首颗端侧 AI 芯片 GΞLIX 1 及 Agent Box,如今已开始客户导入、进入规模化生产。量子位分析指出其战略判断:过去两年 AI 基础设施最确定的故事都在云端(微软、谷歌、Meta、亚马逊加码数据中心,英伟达站在核心),但"AI 不会永远只待在数据中心"——模型量化压缩推进 + 终端内存带宽提升 + Agent 全天候运行需求,正在把高频、隐私敏感、需要低延迟和长期保持状态的任务推向终端。一个长期工作的 Agent,若每读文件、调工具、更新状态都要往返云端,不仅累积延迟、推高 Token 账单,还意味着大量个人数据持续上传。AMD 提出 Agent Computer,高通、NVIDIA 也开始把本地 AI 能力放进 PC 和边缘平台——下一轮 AI 基础设施竞争,正在从"训练更大的模型"转向"让智能真正进入每一台设备",而 Agent 芯片正是这条新赛道的入场券。

https://www.qbitai.com/2026/08/472059.html

🔥8. Zed 推出多人协作 AI 编程环境 "Delta" — 热度 🔥🔥🔥

知名代码编辑器厂商 Zed 推出多人协作 AI 编程环境 "Delta"——把 AI 编程助手从"单人终端工具"推向"多人实时协作"形态,开发者可以共享同一个 AI 编程会话协同工作。

(注:OSCHINA 提供标题级信息,正文为 JS 渲染不可抓取,以下结合 Zed 产品背景整理。)Zed 是近年来以性能与多人协作(collaborative editing)著称的代码编辑器,由 Atom 原班人马打造。此次推出 Delta 意味着把 AI 编程能力(类似 Claude Code、Codex 的 Agent 编码)与 Zed 的实时协作基因结合——团队成员可同时接入同一 Agent 工作流,共享上下文、共同审查 AI 生成的代码。这一方向直击当前 AI 编程 Agent 的痛点:现有工具大多是"一个人 + 一个终端",而真实团队开发需要多人围绕同一任务协作、对 Agent 的行为进行集体审查与把控。Delta 若成功,将把"AI 同事"从个人生产力工具升级为团队基础设施。这也与今日 Grok Bot(SpaceXAI 的 AI 同事)、Manus 独立运营等事件形成呼应——AI Agent 应用层正在从"单兵作战"走向"组织协作"。

https://www.oschina.net/news/501922

🔥9. 具身数据实战派:元点科技 40 天 2 轮融资数千万,瞄准物理 AI 数据基础设施 — 热度 🔥🔥🔥

具身智能数据基础设施公司元点科技(SCALEFORCE)完成数千万元人民币融资(国内顶级具身产业方、恒旭资本、凯联资本投资),本轮距上一轮仅 40 天。其物理 AI 操作系统 MatrixOS 的核心目标,是填补"千万小时级高质量真实交互数据"与"全球仅约 50 万小时可用数据"之间超 99% 的缺口。

创始人郭江亮判断"具身智能的竞争,本质上是数据的竞争":2026 上半年国内具身智能赛道融资总额达 935 亿元、较去年同期暴涨 5 倍,但行业面临数据质量不可控、规模不足、泛化差三重困境——与大模型可爬取互联网数据不同,具身数据必须在真实世界采集,且需视觉、触觉、关节轨迹、物体力学、环境时序对齐的多模态。MatrixOS 三大引擎:ADA 数据泛化引擎(Latent Action Representation + JEPA 无监督范式,同一数据资产可在不同机器人本体复用,真机成功率从 65% 跃至 92%)、GDP 数据质量引擎(信息熵 + 贝叶斯主动学习,数据可用转化率 80%)、以及全球规模化数据生产网络(支持数十万级数采节点统一纳管,自动化程度超 95%,全球率先实现亚毫秒级多传感器时间同步)。数据飞轮闭环已打通从采集到应用的全价值链,并与北大、北航建立合作。

https://www.qbitai.com/2026/08/472060.html

🔥10. GitHub Trending:Anthropic 官方 Skills 仓库上线,14MB 微型基础模型 needle 引爆"万物 Agent" — 热度 🔥🔥🔥

GitHub Trending 今日迎来两个标志性项目:Anthropic 官方开设 anthropics/skills 公共仓库(Agent Skills 的官方版本库),以及 cactus-compute/needle——仅 14MB 的微型基础模型,专为手机、可穿戴等微型设备设计。

anthropics/skills 是 Anthropic 首次以官方仓库形式发布 Agent Skills,标志着"技能包"成为 Agent 生态的标准分发单元——继 Addy Osmani 的 agent-skills(8.5 万 star)之后,官方下场确立规范,与 Prime Agent 把技能做成可导入 Python 包、DeepSeek Harness 内置一百多个可插拔插件的设计哲学同频。cactus-compute/needle 则以 14MB 体量挑战"模型必须大"的惯性思维,目标是在手机、可穿戴、传感器等微型设备上直接运行 AI——与今日 Acrab 端侧 Agent 芯片、荣耀 Robot Phone 的具身交互形成完整链条:端侧算力 + 微型模型 + 专用芯片,正在让"万物皆可 Agent"从口号变为工程现实。另有 NVIDIA NeMo Switchyard(跨模型路由)、holaOS(开源 All-in-One Agent 工作区)等上榜,Agent 基础设施生态持续井喷。

https://github.com/anthropics/skills
https://github.com/cactus-compute/needle

📌 今日趋势总览(AI Agents & 开源 LLM)

趋势

热度

前沿模型价格战(Grok 4.6 反超、DeepSeek 便宜 57 倍)

🔥🔥🔥🔥🔥

超级发布日(五款模型同日亮相)

🔥🔥🔥🔥🔥

AI 解决数学难题(哈达玛矩阵、FrontierMath)

🔥🔥🔥🔥🔥

开源 Max 级模型开放(Qwen3.8-2.4T)

🔥🔥🔥🔥🔥

Agent 基础设施开源化(DeepSeek Harness、Skills 仓库)

🔥🔥🔥🔥

后预训练范式探索(Ilya TTT 测试时训练)

🔥🔥🔥🔥

思维链安全攻防(API 窃取推理轨迹)

🔥🔥🔥🔥

端侧算力与 Agent 芯片(Acrab、needle 14MB)

🔥🔥🔥🔥

AI 编程协作化(Zed Delta、Grok Bot)

🔥🔥🔥

物理 AI 数据基础设施(元点科技、数据缺口 99%)

🔥🔥🔥