易君召
发布于 2026-09-06 / 作者:易君召 / 15 阅读
0

AI Agents & 开源 LLM 简报 (2026年9月6日)

#AI

🔥1. 具身 ICL 来了创业玩家:可可矩阵押注"上下文成 Scaling 新赛道",把后训练 ICL 前置到预训练 — 热度 🔥🔥🔥🔥

2020 年 GPT-3 靠"看几个示例就会新任务"震动 NLP;六年后的今天,同样的故事正在具身智能上演——一家中国创业公司决定把这条路做成底层范式。

量子位深度对话可可矩阵(COCO Matrix):2026 年 4 月成立的具身 ICL 创业公司,CEO 高宇翔(30 岁、西安交大少年班、JHU 博士辍学,此前在傅利叶带队打通全尺寸人形机器人遥操作-采集-部署全链路,2025 年用一百多万成本训练出全尺寸双足世界模型)。背景是具身 ICL 的密集爆发:8 月中 Skild AI 发布机器人基础模型 S1(看一遍演示视频即可完成未训练过的新任务,可到 10 分钟、几十步,ICL 视频 prompt 对未见任务比纯语言提升约 7 倍);一周前 Generalist AI 发布 GEN-1.5(One-Shot 数秒学新任务、支持 Sim-to-Real);7/16 李飞飞、Jim Fan、Yuke Zhu 等合著 RoboTTT 首次系统把"上下文 scaling"搬到机器人视觉运动策略。高宇翔的核心判断:① 老路难走——过去靠叠数据/叠视觉模块,约 200 条数据就能拟合单任务(新任务 18 小时适配),但继续加数据始终没出现通用泛化,且遥操数据质量不齐、场景有限;② 具身 Scaling 维度扩展——除了 Scale 模型/数据/任务覆盖,还应 Scale"部署后持续学习/适应能力";③ 三大硬骨头——视觉理解(不同任务需要高层语义与精细空间信息的混合层级)、多模态(触觉/听觉/本体数据量远低于视觉语言)、Long Context 与 Memory(需压缩/筛选/提取历史信息)。与 Generalist/Skild 的差异:可可矩阵把后训练的 ICL 前置到预训练阶段。"机器人能不能基于当前 Context 快速学会新任务"正成为继数据覆盖之后的第二条 Scaling 主线——上下文,正在成为具身智能的新矿脉。

https://www.qbitai.com/2026/09/484897.html

🔥2. B站首届 AI 创造公开赛收官:143 万奖金池、非专业开发者超六成、一人团队超八成——AI 降低的是创作门槛 — 热度 🔥🔥🔥

13.4 万创作者、3 万+ 投稿、1.9 亿月观看 AI 内容用户——《猫娘计划》独领 100 万奖金,一个注册 14 年零粉的账号靠两个视频拿了 10 万。

量子位报道(B站供稿转载):哔哩哔哩首届"build in bilibili · AI 创造公开赛"9/5 落幕,总奖金池 143 万元,UP主 W博士与AI猫娘凭《猫娘计划 Project N.E.K.O.》获一等奖独享 100 万;《元气骑士3D版》《世界之门》分获二三奖。大赛于 6/5 启动、8/20 截止,收到 3 万+ 投稿、1.34 万创作者参与、100 万+ 用户互动、内容播放时长超 3.5 亿分钟;参赛者可把产品发布在 B站 Toy 平台,活动期间作品被用户使用近 5000 万次。最关键的数据是参赛结构:非专业开发者占比超六成、一人团队超八成、万粉以下创作者占 88%、前 10 名中约半数赛前粉丝不足 1 万——三等奖得主电烤皇带鱼注册 B 站 14 年、此前零粉丝零履历,靠两个视频拿 10 万奖金。产品形态高度多元(二次元、游戏 3D 化、鬼畜、弹幕互动世界),获奖者称"产品不是想出来的,是和用户一起长出来的"。生态侧:英伟达、智谱、vivo、红杉中国、真格基金等以工具/算力/流量支持,已有《破壳机器人》《AI 时空电话》获外部投资、26% 参赛者赛后考虑创业,第二届即将开启(十亿流量扶持)。B站已成国内 AI 内容发酵主阵地:Q2 AI 知识内容消费时长同比 +72%、月观看 AI 内容用户超 1.9 亿、AI 广告收入同比 +100%。"当工具越来越强,普通人也能创造自己的产品"——这是 AI 创作普惠最直观的样本。

https://www.qbitai.com/2026/09/484890.html

🔥3. GitHub 当日观察:openai/skills 实为已弃用仓库(已迁至 openai/plugins);ruflo 与 wechat-intelligence-hub 等社区项目受关注 — 热度 🔥🔥

一个容易被误读的信号:今天 Trending 上的 openai/skills 并非 OpenAI 的新动作,而是标注 deprecated 的旧仓库——真正的技能生态已迁往 openai/plugins。

GitHub Trending 今日需要澄清一点:openai/skills(★2.5 万)上榜,但其 README 首行即标注 "This repository is deprecated"——已迁移至 openai/plugins 仓库(技能/插件开发指引见 developers.openai.com),因此它不是新的生态消息,而是旧仓库被重新推上热榜(可能与本周 Skills 话题升温有关)。值得注意的真实信号:① Anthropic 与 OpenAI 的技能生态路线分化——anthropics/skills(★17.5 万,9/3 仍有提交)持续活跃,而 OpenAI 已把技能并入 plugins 体系,两者共同指向 agentskills.io 这个开放标准;② ruvnet/ruflo(agent meta-harness,多智能体 swarm 编排)、magnitudedev/magnitude(本地推理服务器)等社区项目持续上榜;③ 中文开发者新项目 Rion-Wu-tech/wechat-intelligence-hub(★621,9/4 创建)——本地优先的微信智能系统(只读 CLI + Codex skills + 可搜索聊天历史 + 每日简报),把个人微信数据变成 Agent 可调用的智能资源。Skills 生态的"双雄 + 开放标准"格局正在固化,而微创新仍源源不断。

https://github.com/openai/skills
https://github.com/ruvnet/ruflo
https://github.com/Rion-Wu-tech/wechat-intelligence-hub

🔥4. 周回顾·GPT-6 发布后的首个周末:AGI 官宣的涟漪仍在扩散 — 热度 🔥🔥🔥🔥

从"欢迎来到 AGI 时代"到开源社区实测——GPT-6 正式发布后的第一个周末,话题热度不减,争议与实测齐飞。

本周 GPT-6 完整风暴(9/1-9/6)回顾:9/4 正式发布(10 万+ GPU、ARC-AGI-3 99.9%、ExploitBench 满分、AutomationBench 41.4%、OSWorld 2.0 72.6%、单任务耗时较 Sol 减 47%、定价 $10/$50 与 Fable 5.1 持平、Brockman 宣布 AGI 时代)→ 9/5 架构揭秘(The Information 爆料 recurrent depth 循环 Transformer,引发安全监测争议)与数学争议(孪生素数上界 186 引发陶哲轩"污染论")→ 9/6 生态继续发酵(Astra 向 ChatGPT 付费用户开放、GPT Image 2.5 灰度、Codex 跨上下文笔记)。周末的主线是"争议与落地并存":一面是循环架构的安全可解释性质疑、数学黑盒的学术担忧,另一面是 Astra 进入企业/Pro 用户、GPT Image 2.5 被实际使用。对行业的长期影响正在显现:Computer Use/长链路 Agent 成为旗舰共识、"完成任务总成本"取代"每百万 token 单价"成为新标尺、循环 Transformer 成为下一代高效架构候选。OpenAI、Anthropic 一周内的"发布对轰"把 2026 年的模型竞争推向白热化。

https://www.qbitai.com/2026/09/483898.html
https://www.qbitai.com/2026/09/484726.html

🔥5. 周回顾·AI 数学与形式化突破周:Claude 11 天形式化费马大定理、AI 三方竞赛缩窄孪生素数上界 — 热度 🔥🔥🔥🔥

本周是"AI 数学"爆发的一周:1300 万行 Lean 走完费马大定理,三家实验室把孪生素数上界从 246 卷到 186——而陶哲轩的警告让这场胜利带上反思。

本周 AI for Math 三项里程碑(已报内容整合,新角度):① 9/5 Claude 完成首个可由计算机完整检查的费马大定理形式化证明——约 1300 万行 Lean、超 3 万个中间定理、规模超 Mathlib 五倍,11 天跑完(人类社区项目原按多年筹备),靠 Prove2Me 多 Agent Harness 协调"几十个 Claude"攻关,消耗约 60 亿输出 Token,Kevin Buzzard 称"非凡的自动形式化成果"——数学文献形式化首次具备规模化提速条件;② 9/5 孪生素数猜想上界竞赛——OpenAI/Anthropic/Axiom 一周内分别把连续素数间距上界从 246 缩至 186/188/212,牛津数学家 Julia Stadlmann 8/31 刚缩到 240;③ 9/4 九问 ScienceDiscovery——树搜索驱动科研代码 RSI,不训练模型、2 小时写出通用振荡积分器(scipy −3.40 → −0.0007)、AlgoTune 加速 2.3 倍、符号回归 41.4% 找到正确方程。但陶哲轩的警告(9/5)构成这周最重要的一记警钟:AI 黑盒解题可能"污染"数学发展的源泉——失败的探索过程本身产出的思想(如纳维-斯托克斯催生的各类定理)才是数学真正的财富。AI 数学双刃剑:能规模化的不止是解答,还有对"理解"本身的稀释。

https://www.qbitai.com/2026/09/484551.html
https://www.qbitai.com/2026/09/484649.html

🔥6. 周回顾·Agent Skills 生态双雄格局:anthropics/skills 17.5 万星 vs OpenAI 迁移到 plugins,agentskills.io 成开放标准 — 热度 🔥🔥🔥

当 Anthropic 的技能仓库冲到 17.5 万星仍持续更新、而 OpenAI 把技能并进插件体系——Agent 能力分发的事实标准正在收敛为"技能即文件夹"。

本周 Agent Skills 生态成型(已报内容整合):① anthropics/skills(★17.5 万,9/3 仍有提交)——官方技能实现,覆盖创意/技术/企业工作流,每个技能自带 SKILL.md 自包含文件夹;② openai/skills 已弃用迁往 openai/plugins(今日澄清),OpenAI 把技能纳入插件生态;③ 两者共同指向 agentskills.io 开放标准("Write once, use everywhere");④ 社区库爆发——scientific-agent-skills(19 万科学家用、165 技能)、last30days-skill(6 万星)、patent-disclosure-skill(中国专利)、sepia(去 AI 味)、headcount(15+ 部门 Agent 组织);⑤ 方法论官方化——9/1 Anthropic commerce-agents 把"双 Agent 结构 + 工具契约 + 人类审批闸门"标准化;⑥ 管理工具层——skill-cabinet、skills.sh 分发。信号明确:当模型能力趋同,"招式化"的专业技能成为 Agent 生态的差异化壁垒,而"技能作为可分发软件资产"的标准正在被两大厂共同确立——这对开发者是一张清晰的地图:往技能(Skill)里沉淀可复用能力,是当前最确定的杠杆

https://github.com/anthropics/skills
https://github.com/openai/plugins

🔥7. 周回顾·中国空间智能派系成型:影溯(WorldArena 登顶)、飞渡(HICOOL 一等奖)、光象(ActEffect)三线并进 — 热度 🔥🔥🔥

世界模型不只是李飞飞的——中国空间智能的三股力量,分别在世界模型评测、灾害决策、落地产线上占据身位。

本周中国空间智能叙事(已报内容整合,新角度):① 研究侧——影溯(3 月开源 InSpatio-World、时间维度显式建模;InSpatio-Curious 登顶 WorldArena 2.0,66.11 分/77 模型第一,靠轨迹/深度/时空表征而非画面漂亮度;联合 20 余家机构启动 SIDO 百万级 3D/4D 数据底座);② 资本与产业侧——飞渡科技获 HICOOL 2026 一等奖(空间智能"峥嵘大模型",城市防洪"从生成到决策",比尔·赖克特押注实体 AI);③ 落地侧——光象科技 Phi-WM ActEffect("训练完就退场"的世界模型,LIBERO 98.8%、蔚来焊接上下料 21.5 小时零失误)。三家各占一环:影溯在上游算法与评测、飞渡在中游决策与信创、光象在下游产线落地,与李飞飞 Atlas 形成"中国路线"的完整拼图。共性判断清晰:世界模型的竞争已从"生成画面漂不漂亮"转向"能不能用于决策/训练"——渲染与生成只是上半场,可推演的"世界模拟器"才是下半场;而数据底座(SIDO)与评测基准(WorldArena)正成为兵家必争之地。

https://www.qbitai.com/2026/09/484163.html
https://www.qbitai.com/2026/09/484683.html

🔥8. 周回顾·国产算力进入生产级:商汤(62T 全国产卡)、摩尔线程+趋境(PD 异构 50+ TPS)、范式×华为(昇腾 950) — 热度 🔥🔥🔥

"国产算力只适合 demo"的说法正在被证伪——本周三场合作,全部指向同一件事:国产卡跑真实业务流量。

本周国产算力商用化三连(已报内容整合):① 8/28 商汤为 GLM-5.3-Flash 提供国产算力("牛来"62T Token 全部国产卡承载、端到端性能提升 3 倍、异构混推性价比达 NVIDIA H 系列 1.25 倍、Token Factory 日均 2.42 万亿);② 9/4 趋境科技×摩尔线程战略合作——MTT S5000 专攻 Prefill + 高带宽 GPU 做 Decode 的 PD 分离异构,4-5 台 S5000 Prefill 池性价比超国际先进,实测平均 50+ TPS、90%+ KV 命中、99.9% 稳定,承接头部模型真实流量,推 Token Pod 标准化交付;③ 8/31 范式×华为昇腾 950 重磅算力战略合作(首批拥抱国产最高端算力,采购规模"重磅级别")。三家映射出国产算力的三个进阶方向:从"模型适配"到"系统级 Token 生产效率"、从"实验环境验证"到"规模化生产落地"、从"打单卡性能"到"打整机性价比"。国产算力的竞赛正从"能不能跑"转向"每枚 Token 的生产成本够不够低"——在开源模型 Flash 化(更小激活参数)的配合下,中国 AI 的推理成本曲线正在出现系统性下移。

https://www.qbitai.com/2026/09/484547.html
https://www.qbitai.com/2026/09/484223.html

🔥9. 周回顾·企业级 Agent 与 AI 应用铺开:千问办公 3000 万、百融 RaaS、WorkBuddy、B站大赛 — 热度 🔥🔥🔥

本周的 Agent 新闻重心,从"模型多强"转向"有多少人真在用"——办公、客服、创作者三个场景交出了规模答卷。

本周 Agent 应用规模化(已报内容整合):① 办公——9/4 千问办公上线首月 3000 万用户、企业过半、120 版本/日均迭代 4 次、杰富瑞八款 Agent 实测第一、长安汽车线束选型两天缩至五分钟;9/3 WorkBuddy 联名硬件(100+ 伙伴)并在 9/4 上架 openKylin(Agent 进驻国产 OS);② 客服——9/2 百融 AICC 同比 +52%、新场景 +195%,物流 AI 客服日扛 1.5 万通、券商 30 席扩至 210 席,RaaS 按结果收费;③ 创作——9/6 B站 AI 公开赛(13.4 万创作者、非专业六成/一人团队八成,AI 普惠实证)。加上 MiniMax(ARR 半年 5.3 倍)、云知声(Agent 占营收 85%),信号已经强烈而具体:企业级 Agent 正在从"尝鲜"进入"核心业务流程",且按结果计费的模式让投入产出可被清晰核算。当 1.5 万通电话、3000 万用户、85% 营收这些数字进入财报,Agent 的商业化叙事完成了从概念到科目的转变。

https://www.qbitai.com/2026/09/484155.html
https://www.qbitai.com/2026/09/484890.html

🔥10. 周回顾·具身数据与强化学习范式革命:零遥操、异步 RL、"训练完就退场" — 热度 🔥🔥🔥

本周具身智能的不约而同:绕开"堆数据+改权重"的旧路,用更聪明的数据用法与 RL 方式,把机器人练得又准又省成本。

本周具身技术范式(已报内容整合):① 自变量 TwinDex(9/3)——无本体数据 100% 替代真机遥操(数采执行同构、采集效率 5.3 倍),"遥操可能真的危险了";② 星尘 SmoothRL(9/4)——异步执行下只对"真正执行动作"做 RL(投掷 39%→94%、加速度 RMS −52%);③ 光象 ActEffect(9/5)——受控世界模型训练完就退场(LIBERO 98.8%,把"多想一会儿"留给训练、把短链路留给执行);④ 清华 Zeva(9/1)——权重冻结的 ICCL(26%→73%);⑤ 神秘 MVP(9/3)——能量驱动物理理解(zero-shot 80%)。共同点:预训练让机器人"会做",真实世界的后训练/自进化让它"越做越准",而工业部署成本(时延/算力/产线账本)成为技术选型硬约束。模型、数据、Harness、RL 被整合进同一套"越用越强"的工程体系——"能不能连续运行 21.5 小时零失误"开始取代 demo 成为新标尺。具身智能的"GPT 时刻"叙事,正在变成可复现、可验收的技术路线。

https://www.qbitai.com/2026/09/484611.html
https://www.qbitai.com/2026/09/484437.html

📌 今日趋势总览(AI Agents & 开源 LLM)

趋势

热度

具身"上下文 Scaling"新赛道:可可矩阵等押注 ICL 为底层范式

🔥🔥🔥🔥

GPT-6 发布周余波:AGI 官宣、循环 Transformer 架构、陶哲轩式争议持续

🔥🔥🔥🔥

AI 数学爆发周:Claude 形式化费马大定理 + AI 三方竞赛孪生素数

🔥🔥🔥🔥

Agent Skills 双雄格局:anthropics/skills vs openai/plugins,agentskills.io 成标准

🔥🔥🔥

中国空间智能派系成型:影溯/飞渡/光象三线并进

🔥🔥🔥

国产算力进入生产级:商汤/摩尔线程+趋境/范式×华为

🔥🔥🔥

Agent 商业化数据周:千问办公 3000 万、百融 RaaS、B站 AI 大赛

🔥🔥🔥

AI 创作普惠实证:B站大赛非专业六成/一人团队八成

🔥🔥🔥


本文原创作者:易君召,详见:https://www.yijunzhao.cn/authors/yijunzhao,转载请注明出处。

原文链接 https://www.yijunzhao.cn/archives/ai-agents-kai-yuan-llm-jian-bao-2026nian-9yue-6ri

欢迎访问 小易撩挨踢

https://www.yijunzhao.cn/