易君召
发布于 2026-09-11 / 作者:易君召 / 3 阅读
0

AI Agents & 开源 LLM 简报 (2026年9月11日)

#AI

主题:Agent 从"客户端功能"变成"一等公民基础设施"
OpenAI 把 Codex 的 harness(会话、沙箱、工具编排、上下文压缩)抽出来做成 REST API;Cognition 用 2.8T 的 Kimi K3 靠纯 RL 后训练追平 Fable 5.1 且便宜 64%。Agent 能力在被标准化,也在被武器化。

🔥 1. OpenAI 把 Codex 做成 API:Agents API 开放托管会话与沙箱 — 986 pts

Codex 的价值从来不只是模型,而是外面那一圈 harness——现在它被做成了 API。

OpenAI 上线 Agents API,把 Codex 的 harness 通过托管的 REST API 暴露出来,核心端点只有一个:POST https://api.openai.com/v1/agents/sessions(带 OpenAI-Beta: agents=v1 头)。语义划分很干净:OpenAI 负责会话、编排、上下文压缩与恢复,应用负责提供工具、决定执行环境。概念拆成四块:Agent(模型+指令+工具+MCP)、Environment(沙箱或计算机,Agent 在此读写文件、加载 skills、跑命令)、Session(持久 Agent 实例)、Events/items。托管能力清单值得逐条看:沙箱内执行命令与代码、应用 skills、通过工具或 MCP 连外部数据、过程中随时干预、压缩历史上下文、把子任务委派给 subagent、断点续跑;多智能体通过 agent.multi_agent 打开并可设 max_concurrent_subagents。两个必须留意的限制:数据驻留仅限美国,且不支持 ZDR(即使选自托管沙箱也不会变为合规)。社区争议集中在"值不值得把会话状态交给 OpenAI"——有人直言"这更像是加强 vendor lock-in",也有人认为省掉自建沙箱 VM 很值。实质是把 Codex 客户端里的 harness 服务端化:以前绑在 CLI/IDE 插件里,现在成了任何后端都能调用的一等公民。

https://www.oschina.net/news/502418 | 文档:https://platform.openai.com/docs/guides/agents

🔥 2. Cognition 发布 SWE-2:Kimi K3(2.8T)做基座,RL 追平 Fable 5.1 — 961 pts

第一次有人把 RL 后训练扩展到"多万亿参数"量级。更值得注意的是基座选型。

SWE-2 在 FrontierCode 1.1 Main 拿到 50.0%,距 Fable 5.1(50.9%)不到 1 个百分点,而便宜 64%;对比 Grok 4.6 48.0%、GPT-5.6 Sol 47.5%、Kimi K3 44.2%、SWE-1.7 42.0%、Astra 53.3%。DeepSWE 1.1 达 73.0%Terminal-Bench 2.1 冲到 92.8%。但落差扎眼:Terminal-Bench 4 只有 27.3%(Opus 5 为 51.8%、Astra 57.9%),成了"benchmaxxing"讨论的靶子。技术亮点是一个训练任务同时覆盖所有推理努力级别,从而整体推进成本—性能前沿;奖励函数 R = S − λₑC,λₑ 取基座在该努力级别的帕累托前沿斜率(推导在 Appendix B)。行为指标:medium 档平均 53 步(SWE-1.7 为 127 步),首次真实编辑中位步数从 48 降到 18,成本降 81%。基座是 Kimi K3(2.8T,已经历大量 agentic coding RL),官方称这是首次把 RL 扩展到多万亿参数区间。

https://cognition.ai/blog/swe-2https://www.oschina.net/news/502413https://hf-mirror.com/moonshotai/Kimi-K3

🔥 3. 小米开源 CocktailASR-1:不改降噪,改任务定义 — 938 pts

思路比指标更值得记:不问"怎么去掉噪音",而问"能不能先告诉模型该听谁"。

小米开源 CocktailASR-1,切入多人同时讲话(鸡尾酒会问题)。做法不是做更好的降噪,而是改变任务输入——给一段参考音频,模型用声纹嵌入定位目标说话人,在混合音频里只转录他一个人的话。架构是端到端 LLM:D2V2 音频编码器 → Adapter → LLM 解码,所有权重打包在一个 checkpoint,输入为参考音频 + 1 秒静音 + 目标音频(16kHz 单声道),单人多人同一模型通吃。数据很硬:LibriMix 2mix WER 4.11%、LibriSpeechMix 2mix 2.90%LibriMix 3mix 上 Qwen3-ASR/Gemini/StepAudio 分别是 106.04%、76.10%、121.08%,它是 12.29%——不是"比它们好",是"它们做不了"。两个特性值得单独提:负样本拒识(参考人未参与对话时输出空文本,LibriSpeech 拒识率 79.59%,而 Qwen3-ASR 与 StepAudio 是零)与 `` 思维链推理(几乎不损精度)。Apache-2.0,依赖极简。

https://github.com/xiaomi-research/xiaomi-cocktailasr-1https://www.oschina.net/news/502427/xiaomi-cocktailasr-1

🔥 4. OpenAI 的第二道千禧年难题:纳维-斯托克斯争议细节曝光,传闻是霍奇猜想 — 917 pts

第一道题的论文还在接受审查,第二道题已经要交卷了。争议的核心不是数学,是功劳与数据的归属。

《纽约时报》追访补出关键细节:OpenAI 更新用户数据口径,称 Buckmaster 过去两个月的 Codex 提示词不可能影响内部模型,7 月 3 日之后的用户输入也不可能进入该系统(仍为单方面说法,无公开材料可核查)。同时 OpenAI 称已在另一道千禧年难题上取得"实质性进展",传闻指向霍奇猜想。谈判条件被完整披露:先发欧拉方程、次日发纳维-斯托克斯;Buckmaster 任主要作者;提供算力;公开建议 100 万美元大奖荣誉归其与合作者(并非直接付钱)。症结在合作者 Levent Alpöge 任职 Anthropic——Bubeck 确认OpenAI 不希望他出现在论文中:"怎么能让一名 Anthropic 员工参与 OpenAI 内部项目?"普林斯顿 Sarnak 评价:"这种讨价还价,我从来没有听说过。"配套动作:Lean 4 形式化证书已开源openai/NavierStokesAndEuler,★1,766,Apache-2.0)。

https://www.qbitai.com/2026/09/487092.htmlhttps://github.com/openai/NavierStokesAndEuler

🔥 5. Anthropic 开出 320 万年薪的销售岗,客户只有一家:Meta — 896 pts

Claude Code 已打进 Meta 内部,以至于为这一家客户单配百万级销售是划算的。

岗位名为 「Mega Account Executive, Meta」年收入 38–45 万美元(最高约 320 万人民币),9 月 3 日上线、9 月 9 日关闭,只存在一周。要求 10 年以上企业销售经验、打通 Meta 从一线工程师到 C-suite 的完整关系网,还要把需求反馈回 Anthropic 影响产品路线——与流行的 FDE 角色高度相似,薪酬采用 OTE 机制(并非入职即稳拿)。背景是 Claude Code 早已进入 Meta:据《纽约时报》Meta 在 Anthropic 的潜在年支出可能达 100 亿美元;截至 7 月底 Anthropic 年化收入超 650 亿美元,Meta 一家上限即占约 15%。企业侧画像:年消费超 10 万美元客户一年增长 7 倍,超 100 万美元客户从 12 家增至 500 多家,财富 10 强中 8 家已是 Claude 客户;Claude Code 从 2025 年 5 月开放,半年到 10 亿美元年化,2026 年 2 月超 25 亿美元,企业订阅增至 4 倍、贡献超一半收入。

https://www.qbitai.com/2026/09/487573.html

🔥 6. Shopify 用 AI 在 12 周内重写原生 App:从 React Native 迁回 Swift/Kotlin — 874 pts

"现在对 Shopify 来说原生是正确的选择,但在 2020 年,React Native 是正确的选择。"前提变了,结论就变了。

首款应用 Shop 已在 AI 辅助下 12 周从概念验证走到发布;旗舰应用(300+ 屏幕、小组件、Apple Watch、Siri 捷径)重写中,计划年内发布。作者 Mustafa Ali 坦言自己去年 1 月还在写"React Native 的未来光明",但编码模型的能力提升彻底动摇了 2020 年那套假设——用 Swift 和 Kotlin 构建相同功能不再那么昂贵。更值得注意的是选择从头重建而非渐进迁移,官方明确警告"直接把 LLM 指向 RN 代码库要求一次性生成等价原生代码看似诱人,实则行不通"。为此构建了 Helix 系统:不指望一次写对,而是建立检查点链——读 RN 代码 → 生成小段可审查的工作切片 → 每个切片须通过测试证明行为 + 视觉审查匹配运行中的应用 + 两名对抗性代码审查者 + 人类批准,反馈被记住使循环越来越自主。架构上把业务逻辑与 UI 完全解耦,桌面端无头运行、通过 CLI 暴露给 AI Agent,迭代时间从分钟级降到毫秒级

https://www.oschina.net/news/502416/shopify-engineering-back-to-native

🔥 7. 开源把 MiniMax H3 提速 12 倍:RunningHub 方案已上 GitHub — 855 pts

"AI 加速不等于质量劣化"——不降精度、只砍等待时间。而它选择开源。

RunningHub 为 MiniMax 开源视频模型 H3 做了多 GPU 加速并整套开源。核心数据:5 秒 1344×768 视频,4 张 RTX 6000D 上原始 BF16 50 步耗时 348.8 秒,加速后只需 28.7 秒——约 12 倍提速、耗时减少约 92%,且全程保留 BF16 精度。长视频同样受益:8 张卡生成 15 秒 768×1344,纯文字约 48 秒、双参考图约 73 秒,15 秒图生视频已打进"1 分钟出结果"。技术栈经仓库确认:step distillation + SageAttention2 + Cache-DiT + torch.compile,在 sglang 上采用 TP2 + Ulysses4 并行RH-RunningHub/MiniMax-H3-MultiGPU-Lightning,Apache-2.0)。意义有两层:开源视频模型的推理侧工程快速成熟,且优化本身也开源——创作者创意试错的时间成本被直接砍掉一个量级。

https://www.qbitai.com/2026/09/487055.htmlhttps://github.com/RH-RunningHub/MiniMax-H3-MultiGPU-Lightning

🔥 8. 首个跨平台微信 zero-click 蠕虫:AI 用两天挖出漏洞,一通电话接管账号 — 837 pts

漏洞一直存在,变的是发现漏洞的速度。这才是不安之处。

安全团队 Calif 公布 WeWorm,声称是首个无需点击即可在 iOS 与 Android 上通过微信通话传播的蠕虫。三部真机演示:Pixel 10a 呼叫 iPhone 17e,响铃期间接管其微信;被攻陷的 iPhone 再呼叫第三部设备继续传播——"Attacker calls victim, victim becomes attacker, victim calls the next victim." 无需接听、无需任何交互,数秒即可拿下账号;拒接只能阻止当次,攻击者可稍后重试。唯一前提是攻击者已在受害者好友列表中,而这正是 IM 信任模型的薄弱点。漏洞是微信 VoIP 协议栈的内存破坏,暂未给 CVE。最刺眼的是 AI 的角色:团队借助 AI 约两天找到漏洞并写出第一个 RCE,一周完成完整蠕虫——这种规模以往需更大团队数月。时间线完整:7/24 报腾讯 → 8/2 完成 iOS RCE → 8/11 跨平台蠕虫演示 → 8/21 腾讯发布 Android 8.0.77 / iOS 8.0.76 缓解,8/28 确认服务端已对全体用户缓解

https://www.oschina.net/news/502420/wechat-worm-ai-calif-tencent-zero-click

🔥 9. 百度秒哒企业版:87% 创造者此前不写代码 — 819 pts

自然语言开发已跨过尝鲜期,问题从"能不能生成"变成"能不能跑在核心业务上"。

两个几乎没有技术人力的样本:近 30 人的服装品牌辽丝锦没有 IT 部门,却搭起商品企划、供应链跟单、付款、库存完整链路;新材料企业福建蓝海黑石做出"全序智管"办公系统并接入企业微信供数百员工使用。搭建者是创始人与一线业务团队,此前没写过一行代码。规模已过临界点:一年用户增长 200 倍、创造 500 万个有商业价值的应用、每天近 20 万人在线使用,其中 87% 的创造者不会写代码;按 2026 上半年 MAU 口径以 33.4% 市场份额居中国 AI 原生无代码平台第一。企业版拆出"企业、团队、成员"三级架构与岗位级权限——辽丝锦按权责划界(供应链只管跟单排期、财务只对接对账、合作工厂看不到全盘数据),累计迭代 1500 多轮

https://www.qbitai.com/2026/09/487415.html

🔥 10. 开源生态周动态:Agent 的"编排层"正在被架起来 — 798 pts

本周最清晰的信号:Agent 竞争面正从"模型能力"下移到"编排与治理"。

① meta-harness 站上趋势榜omnigent-ai/omnigent★9,853,Apache-2.0)统一编排 Claude Code、Codex、Cursor、Pi 与自定义 Agent不重写代码即可更换 harness,并强制策略与沙箱隔离。② 空间智能开源热度惊人bilawalsidhu/gods-eye-view★26,152)"浏览器里的间谍卫星模拟器,只不过数据是真的"——基于 Cesium/WebGL 的写实 3D 地球,与高德 ABot-Earth 形成有趣对照。③ 工具链向"可寻址、可治理"演进:Windows 多 Agent 工作台 Termexo v0.8.6 本版刷新后不再误杀运行中的 Agent 进程、终端改为按屏幕状态重放;github/spec-kit 继续高位。④ 开源协作平台进入政府级替代瑞士联邦政府试点把 3,000 台工作站的 Microsoft 365 换成开源 openDesk(投入 900 万瑞郎,目标 2027 年底),军方 Cyber Command 更不等试点,2026 年 10 月前先行全面替换

https://github.com/omnigent-ai/omnigenthttps://github.com/bilawalsidhu/gods-eye-viewhttps://www.oschina.net/news/502424/switzerland-gov-replace-microssoft-pilot

📌 今日趋势总览

趋势方向

代表事件

热度

Agent 运行环境被平台化

OpenAI Agents API;omnigent meta-harness ★9,853

🔥🔥🔥🔥🔥

RL 后训练进入万亿参数区

SWE-2 基于 Kimi K3(2.8T),50.0% 且便宜 64%

🔥🔥🔥🔥🔥

开源模型切入"任务重定义"

小米 CocktailASR-1:3mix WER 12.29% vs 竞品 76–121%

🔥🔥🔥🔥🔥

大模型能力外溢到工程决策

Shopify 12 周用 AI 重写原生 App(Helix 检查点链)

🔥🔥🔥🔥

AI 双用途风险具象化

微信 zero-click 蠕虫:AI 两天挖洞、一周造蠕虫

🔥🔥🔥🔥

推理侧开源优化成熟

RunningHub 开源 H3 加速,12× 提速且保 BF16

🔥🔥🔥🔥

AI 做数学的"功劳归属"难题

纳维-斯托克斯争议 + 传闻中的霍奇猜想

🔥🔥🔥🔥

数字主权驱动开源替代

瑞士政府 3,000 台 openDesk 试点

🔥🔥🔥

自然语言开发进入核心业务

百度秒哒企业版,33.4% 市场份额

🔥🔥🔥


本文原创作者:易君召,详见:https://www.yijunzhao.cn/authors/yijunzhao,转载请注明出处。

原文链接 https://www.yijunzhao.cn/archives/ai-agents-kai-yuan-llm-jian-bao-2026nian-9yue-11ri

欢迎访问 小易撩挨踢

https://www.yijunzhao.cn/