易君召
发布于 2026-09-04 / 作者:易君召 / 42 阅读
0

AI Agents & 开源 LLM 简报 (2026年9月4日)

#AI

🔥1. GPT-6 Astra 正式发布!OpenAI 总裁 Brockman:"Welcome to the AGI era"——10 万 GPU 训练、ARC-AGI-3 达 99.9%、ExploitBench 满分 — 热度 🔥🔥🔥🔥🔥

万众期待的 Astra 终于落地:OpenAI 历史上规模最大的训练任务,第一款前代模型深度参与训练监督的旗舰——并单方面宣布 AGI 时代开幕。

量子位头条:GPT-6 Astra 与 Astra Pro 正式发布,被 OpenAI 定义为"世界上最智能、最协调的模型",为 Computer Use、Browser Use、软件工程、网络安全、科学和专业工作树立新标杆。发布最后 OpenAI 总裁 Greg Brockman 直接甩出"Welcome to the AGI era"。关键信息:① 训练规模——OpenAI 历史上最大训练任务,在得州 Stargate 园区动用超 10 万块 GPU 完成预训练;是第一款由前代模型深度参与训练监督的旗舰产品("老带新",RSI 落地);② 定价——输入 $10/输出 $50 每百万 token,为 GPT-5.6 Sol 的 2.5 倍、与 Fable 5.1 持平;③ 基准近乎饱和——FrontierMath Tier 4 v2 97.6%、ARC-AGI-3 99.9%(上一代 Sol 仅 7.8%,陌生环境自主探索/规则学习能力的爆发,但官方说明该成绩使用 Responses API Harness、含 Agent 框架增益)、ExploitBench 100%、Terminal-Bench 4.0 57.7%(超 Fable 5.1 的 55.8%)、DeepSWE v1.1 74.1%、AutomationBench 41.4%(Sol 18.1%)、OSWorld 2.0 72.6%(单任务 40 分钟 vs Sol 75 分钟、省 47%);④ 网络安全双刃剑——ExploitBench 满分、近三个月新漏洞成功率 39%(Sol 5.5%)、发现并利用两个 V8 零日;但 OpenAI 专门测试"越界"行为:诱饵漏洞场景下 Sol 有 48.2% 出现越界、Astra 为 0%;⑤ Computer Use 战略——Brockman 判断"只要模型足够擅长 Computer Use,就能像人一样直接操作界面,不必等待每款软件为 AI 修专用通道";演示涵盖 KiCad 画 PCB、Blender→Unreal Engine 5 生成可进入的三维空间、按模板做 PPT、儿科医生搜索 2 分 54 秒(人类约 5 小时);⑥ Codex 配套更新——Astra 可跨上下文窗口保存工作笔记、按需回溯历史消息,Mind2Web 任务完成速度提升至 1.9 倍。首批企业测试已启动(法律 AI Legora 几分钟核对 41 份财务文件、找出全部 4 个预埋错误)。

https://www.qbitai.com/2026/09/483898.html
https://www.oschina.net/news/502307

🔥2. NVIDIA 129 亿美元收购 Hugging Face 正式官宣,承诺保持开放平台:开源史上最大并购尘埃落定 — 热度 🔥🔥🔥🔥🔥

从 8/26 传闻到 9/4 官宣——开源 AI 的中立社区时代正式落幕,英伟达承诺"保持开放"。

开源中国今日报道:NVIDIA 以 129 亿美元收购 Hugging Face 正式官宣(此前 The Information 已报道"已同意",今日为官方确认层面,OSCHINA 标题级、正文不可抓取),并承诺保持开放平台。完整时间线回顾(本周已追踪):8/26 OSCHINA 首爆"130 亿美元洽谈"→ 8/28 量子位援引 The Information 实锤(微软出局、129 亿)→ 8/29 起 OSCHINA 连续发表《中国版 Hugging Face 怎么造》《巨头拿着支票来了该不该卖》等系列评论 → 今日官宣并带出"保持开放"承诺。HF 托管超 300 万个开源模型、100 万个数据集,ARR 仅约 1 亿美元;对英伟达的战略价值在于:守住"卖铲人"生态位(开源生态把算力需求留在自家硬件)、承接 DGX Cloud 缩减后的算力租赁、消化云计算合同闲置容量。官宣后的核心悬念:① "开放平台"承诺的落地边界(模型托管中立性、Spaces 服务连续性);② 中国版 HF 是否会加速出现(魔搭、GitHub 镜像、OSCHINA 社区均有讨论);③ 对开源模型分发格局的长期影响。2026 开源基建并购潮(Stripe-OpenRouter、AWS-DuckLabs、NVIDIA-HF)至此达到顶峰。

https://www.oschina.net/news/502310

🔥3. GPT Image 2.5 泄露级评测:能伪造 GPT-6 发布会与奥特曼"全员信"——文字不乱、人脸不变、噪点修复 — 热度 🔥🔥🔥

GPT-6 发布会的"主持人"居然是赛博义父 Tibo——其实那是新版生图模型伪造的。生图将成为 GPT-6 时代的主打功能。

量子位报道:GPT-6 正式发布当天,新版生图模型 GPT Image 2.5(版本号跳过 2.1 直接到 2.5)已在 ChatGPT 中以弹窗灰度出现,能力被形容为"可以直接伪造 GPT-6 官方发布会以及奥特曼全员信的程度"——生成奥特曼发推截图除头像外文字毫无破绽;用铅笔手写爱因斯坦笔迹文章的照片级伪造也相当逼真。LMArena 竞技场上代号 luna-lisa-alpha 的匿名模型被猜测正是新版 GPT Image,测试观察到的特点:生成速度超快、照片更加逼真、多张同一角色图像脸部不易变形、嵌入文字不易变形、改进了 GPT Image 2 的噪点问题。ChatGPT 网页版一度把生图功能提升到主目录第二位(仅次于"新聊天")。对 Agent 生态的意义:图像生成的"文本精确性"与"角色一致性"是 AI 设计/营销 Agent 落地的前置条件——2.5 在这两点的突破,将直接提升 Agent 产出物的可用性(海报、封面、图文内容批量生产)。

https://www.qbitai.com/2026/09/483948.html

🔥4. 千问办公上线首月用户破 3000 万、企业用户过半:阿里 Agent 产品跑出 AI 办公赛道最快曲线 — 热度 🔥🔥🔥

上线一个月 3000 万用户、120 个版本更新、平均一天迭代 4 次——阿里把互联网打法带进了企业级 Agent。

量子位报道(阿里供稿转载):阿里 8 月 3 日整合多个 Agent 产品推出千问办公,上线满月总用户突破 3000 万、企业用户占比过半,成为 AI 办公赛道增长最快的产品之一,并推出国际版全面进入全球市场。产品高频迭代:一个月完成 120 个版本更新(日均 4 次、累计上千个 feature)。技术纵深:8/17 开源上下文基础设施 MyContext(把海量异构工作数据转化为 Agent 可调用上下文,GitHub 已获 3000+ Star),与钉钉深度打通——销售在钉钉发起指令即可跨 CRM/ERP 查客户、库存、订单并整理业务建议;8/26 与 Qwen3.8-Flash 联合推出办公专属版(多步规划/工具选择/上下文压缩专项调优,单任务速度 +100%、Token -75%)。落地案例:长安汽车将千问办公用于"研产供销服"全链路,线束选型计算从资深工程师手工两天缩至五分钟、随车文件核查从单车十几分钟降至一两分钟;汇付天下将内部知识与销售流程沉淀为数字资产。华尔街投行杰富瑞对八款全球主流 AI Agent 实测,千问办公综合得分排名第一。"Agent 办公"赛道在 MiniMax(8/27 ARR 数据)、百融(9/2 硅基员工)之后迎来阿里系规模数据——企业级 Agent 的采纳曲线正在被中国厂商集体拉陡。

https://www.qbitai.com/2026/09/484155.html

🔥5. 星尘智能发布 SmoothRL:让在线强化学习跟上大模型的异步推理——投掷成功率 39%→94% — 热度 🔥🔥🔥

真实机器人没有"暂停键":模型在后台算下一段动作时,机器人不能停下来等——但异步执行让 RL 的账对不上了,星尘给出了解法。

量子位报道:星尘智能基座模型团队发布 SmoothRL(Online Reinforcement Learning During Asynchronous Execution),解决大模型异步推理成为真实部署常态后"online RL 该从哪些动作里学"的问题。核心洞察:异步推理时模型生成的 action chunk 与机器人实际执行的动作不再一致——SmoothRL 把 chunk 按执行状态分为三区:已提交区(committed,上轮已定不可改)、执行区(execution,本轮真正执行)、丢弃区(discarded,被下一轮推理替换从未发生),训练时只让梯度穿过 execution region("机器人真正执行了什么,就只对什么做强化学习"),并让训练 rollout 直接运行异步推理(Reinforce in Deployment 原则)。实测(π0.5 基础策略 + TD3-style actor-critic,S1 绳驱本体 30Hz 执行/5Hz 推理):动态投掷 39%→94%、给笔戴帽(±5mm 对位)8%→83%、快递开箱(1mm 刀片插 2-3mm 缝)30%→90%(中途一度回落到 20% 再爬升,真实在线探索并非单调变好);投掷动作的加速度 RMS 降 52%、Jerk 降 47%。团队指出这是"一个已经基本会做的策略,继续练到足够准确"的部署层问题,也是 9/2 孙鹏加盟后星尘 RL 体系的第一个公开成果——预训练让机器人"会做",真实世界后训练让它"越做越准"。

https://www.qbitai.com/2026/09/484437.html

🔥6. 九问 ScienceDiscovery:树搜索驱动科研代码自进化——不训练模型,2 小时写出通用振荡积分器 — 热度 🔥🔥🔥

科研里大量工作是"搜索"而不是"单次执行"——openJiuwen 把这段试错交给程序自己完成,模型不训练、规则不改,每一轮变的只有产物。

量子位报道 openJiuwen 社区 AI 科研工作台 ScienceDiscovery:通过树搜索实现科研产物的 RSI(递归自改进)——每版产物是树上的一个节点,可被选中、改写、长出分支或被搁置后重新启用;每一轮四步(选择→改写→沙箱评分→挂新节点),失败的版本同样入树。三个案例全部使用现成模型(deepseek-v4-flash / glm-5.2,权重未调整):① 半无穷区间振荡积分——直接调 scipy 得分 −3.40(19 道仅 3 道进 3% 容差),树搜索到第 119 版时得分 −0.0007(19 道全部算准、平均误差 0.07%),2 小时产生 236 个版本全程无人干预;② 高斯超几何函数 ₂F₁ 双精度求值——GLM-5.2 跑 48 次扩展 598 秒,平均正确有效数字 9.836→11.771,程序自己找出了 z<−1 时的经典恒等式换元避开不收敛区;③ AlgoTune 代码加速——平均加速 2.279 倍(对照:官方榜最高 claude-opus-4.6 为 1.837、需 RL 训练的 MetaEvolve 为 2.045);④ LLM-SRBench 符号回归——111 题 41.4% 写出正确方程(含玻尔能级反解、相对论多普勒),每题平均仅 16.5 次模型调用(其他方法约 250 次),费用不足 3 元。底座把演进循环固定为四个插槽(改什么/从哪个候选出发/怎么跑怎么打分/怎么合并提交),换算法只换插槽实现。局限与展望:当前只覆盖"验证可机器判定"的领域(代码、算法、数值),要把循环推到实验科学,关键是让"验证"变快变可信。

https://www.qbitai.com/2026/09/484293.html

🔥7. 李飞飞 Atlas 之外的中国身影:影溯 InSpatio 早已开源"同款",WorldArena 2.0 登顶 + SIDO 百万级 3D 数据计划 — 热度 🔥🔥🔥

李飞飞 Atlas 发布"好评如潮"之际,国内空间智能团队影溯被挖出:类似能力 3 月就已开源,时间维度甚至走得更远。

量子位报道:9/2 李飞飞 World Labs 发布全球首个多模态世界模型 Atlas 后,国内空间智能团队影溯浮出水面——其 3 月开源的世界模型 InSpatio-World 具备类似能力(从视频构建可继续探索的动态 4D 场景、可改相机轨迹绕到未拍摄位置),且与 Atlas 不同:时间被显式建模,用户可在事件范围内改变观察时刻、从新视角重看同一动态过程。影溯的另一成果 InSpatio-Curious 截至 8/27 登顶世界模型权威榜单 WorldArena 2.0(清华、上交、港大等联合发起):66.11 分位列 77 个参评模型第一,在 Physics Adherence、Trajectory Accuracy、JEPA Similarity、Depth Accuracy 四项指标排名第一,而 Image Quality 仅 60.64(比第二名低近 9 分)——说明榜一靠轨迹/深度/时空表征等底层能力而非画面漂亮度。影溯还与 20 余家高校机构在第二届中国空间智能大会启动 SIDO 计划:未来两年建设百万级 3D/4D 场景数据底座 + 统一评测基准,打通"数据生产—模型训练—应用反馈"链路——"模型负责学习世界,数据负责提供世界,Benchmark 判断学会了多少"。世界模型的竞争正从算法层延伸到数据与评测的基建层。

https://www.qbitai.com/2026/09/484163.html

🔥8. Anthropic 官方 Agent Skills 仓库 anthropics/skills 星破 17.4 万:技能生态的"官方实现"持续统治 GitHub — 热度 🔥🔥🔥

当 Anthropic 把自己的技能实现开源并持续更新(9/3 仍有提交),Agent Skills 事实上已成为行业标准的事实载体。

GitHub 数据:anthropics/skills(★17.4 万+,2025-09-22 创建,9/3 仍活跃更新)——"Public repository for Agent Skills",包含 Anthropic 对 Claude 技能系统的实现:技能是"Claude 动态加载以提升专业任务表现的指令、脚本与资源文件夹",涵盖创意应用(艺术/音乐/设计)、技术任务(Web 应用测试、MCP 服务器生成)与企业工作流(通讯、品牌)等类别;每个技能自带 SKILL.md 自包含文件夹;配套 agentskills.io 标准站点与 skills.sh 分发。结合本周密集信号(Claude Code 插件市场、Cursor 插件规范、commerce-agents 的 skills/tool contracts、开源中国 MothX),可见"技能"已从概念演变为完整的生态体系:官方实现(anthropics/skills)+ 社区库(scientific-agent-skills ★3.5万、last30days-skill ★6万)+ 管理工具(skill-cabinet)+ 分发标准(agentskills.io)。当 17.4 万人在收藏同一个"技能仓库",Agent 能力的分发方式已经完成了一次范式转移。

https://github.com/anthropics/skills

🔥9. ChatGPT、Claude、Grok 同时宕机:GPT-6 发布日的"团灭"疑云 — 热度 🔥🔥

就在 GPT-6 发布前后,三大 AI 服务同时掉线且无人解释——网友戏称"Astra 启动后扫描互联网,把地球上的 LLM 全灭了"。

开源中国今日报道(标题级):ChatGPT、Claude、Grok 三大 AI 服务同时宕机,官方未给出明确解释。结合时间背景:GPT-6 Astra 发布会后,量子位文章也以调侃方式提及此事("怪不得 Claude、Grok 组团掉线……奥创(OpenAI 版)真来了(doge)")。技术层面的可能解释:① GPT-6 发布带来的全球访问洪峰冲击了共享的云基础设施与 DNS/网关层(三家若存在共同依赖则可能连锁故障);② 发布会前后 OpenAI/Anthropic/xAI 的模型更新与网络重配置引发第三方依赖波动。对开发者的实用提示:多模型容灾(failover)在"超级发布日"显得尤为重要——此前 734 依赖包实验已揭示单栈脆弱性,本次事件则提示跨厂商可用性风险。事件细节与恢复时间待官方说明(OSCHINA 标题级,标注待验证)。

https://www.oschina.net/news/502312

🔥10. 趋境科技 × 摩尔线程战略合作:MTT S5000 扛 Prefill、国产 PD 异构进生产,50+ TPS 承接头部模型真实流量 — 热度 🔥🔥

国产算力的竞争正从"单卡性能"转向"系统级 Token 生产效率"——摩尔线程在推理侧的商业化突围找到了新姿势。

量子位报道(趋境供稿转载):趋境科技与摩尔线程签署战略合作,以趋境自研国产 PD 异构技术与摩尔线程 MTT S5000 智算卡 + MUSA 软件平台深度融合,共建 ATaaS 平台国产化 AI Token 工厂,并推出 Token Pod(Token 超节点)联合方案——已投入生产并承接头部模型厂商官方业务的真实 Token 流量。技术要点:PD 分离——MTT S5000(高密度算力、原生 FP8)专攻 Prefill 阶段的输入计算与 KV Cache 生成(解耦为独立可计费的算力池),高带宽 GPU 承担 Decode 阶段 Token 生成,避免按单阶段峰值配置整套基础设施;实测 4-5 台 MTT S5000 组成的 Prefill 资源池输入 Token 性价比超过国际先进算力方案。生产数据:平均 50+ TPS 生成速度、90%+ KV Cache 命中率、99.9% 稳定性、生产级低 TTFT。趋境"少模型、深优化"路线已沉淀日均万亿级 Token 生产项目共建经验。这是继商汤(GLM-5.3-Flash 62T 全国产卡)之后,国产 GPU 厂商(摩尔线程)在推理生产链路上的又一关键落子——"国产算力跑真实业务"的版图从大厂算力平台扩展到独立 GPU 厂商。

https://www.qbitai.com/2026/09/484547.html

📌 今日趋势总览(AI Agents & 开源 LLM)

趋势

热度

GPT-6 Astra 发布:10 万 GPU、ARC-AGI-3 99.9%、Computer Use 标杆、官方宣布"AGI 时代"

🔥🔥🔥🔥🔥

开源格局落定:NVIDIA 129 亿美元官宣收购 Hugging Face,承诺保持开放

🔥🔥🔥🔥🔥

世界模型双线竞速:Atlas(美)vs 影溯 InSpatio(中)登顶 WorldArena 2.0

🔥🔥🔥

Agent 办公采纳加速:千问办公 3000 万用户/企业过半、MiniMax/百融同频

🔥🔥🔥

机器人异步 RL 新框架:SmoothRL 只学"真正执行的动作"

🔥🔥🔥

AI for Science 自进化:树搜索 RSI 写出通用积分器、加速 2.3 倍

🔥🔥🔥

Agent Skills 官方化:anthropics/skills 17.4 万星、commerce-agents 商业蓝图

🔥🔥🔥

国产算力生产化:摩尔线程 PD 异构 50+ TPS 承接真实流量

🔥🔥


本文原创作者:易君召,详见:https://www.yijunzhao.cn/authors/yijunzhao,转载请注明出处。

原文链接 https://www.yijunzhao.cn/archives/ai-agents-kai-yuan-llm-jian-bao-2026nian-9yue-4ri

欢迎访问 小易撩挨踢

https://www.yijunzhao.cn/