主题:Agent 从"客户端功能"变成"一等公民基础设施"
OpenAI 把 Codex 的 harness(会话、沙箱、工具编排、上下文压缩)抽出来做成 REST API;Cognition 用 2.8T 的 Kimi K3 靠纯 RL 后训练追平 Fable 5.1 且便宜 64%。Agent 能力在被标准化,也在被武器化。
🔥 1. OpenAI 把 Codex 做成 API:Agents API 开放托管会话与沙箱 — 986 pts
Codex 的价值从来不只是模型,而是外面那一圈 harness——现在它被做成了 API。
OpenAI 上线 Agents API,把 Codex 的 harness 通过托管的 REST API 暴露出来,核心端点只有一个:POST https://api.openai.com/v1/agents/sessions(带 OpenAI-Beta: agents=v1 头)。语义划分很干净:OpenAI 负责会话、编排、上下文压缩与恢复,应用负责提供工具、决定执行环境。概念拆成四块:Agent(模型+指令+工具+MCP)、Environment(沙箱或计算机,Agent 在此读写文件、加载 skills、跑命令)、Session(持久 Agent 实例)、Events/items。托管能力清单值得逐条看:沙箱内执行命令与代码、应用 skills、通过工具或 MCP 连外部数据、过程中随时干预、压缩历史上下文、把子任务委派给 subagent、断点续跑;多智能体通过 agent.multi_agent 打开并可设 max_concurrent_subagents。两个必须留意的限制:数据驻留仅限美国,且不支持 ZDR(即使选自托管沙箱也不会变为合规)。社区争议集中在"值不值得把会话状态交给 OpenAI"——有人直言"这更像是加强 vendor lock-in",也有人认为省掉自建沙箱 VM 很值。实质是把 Codex 客户端里的 harness 服务端化:以前绑在 CLI/IDE 插件里,现在成了任何后端都能调用的一等公民。
→ https://www.oschina.net/news/502418 | 文档:https://platform.openai.com/docs/guides/agents
🔥 2. Cognition 发布 SWE-2:Kimi K3(2.8T)做基座,RL 追平 Fable 5.1 — 961 pts
第一次有人把 RL 后训练扩展到"多万亿参数"量级。更值得注意的是基座选型。
SWE-2 在 FrontierCode 1.1 Main 拿到 50.0%,距 Fable 5.1(50.9%)不到 1 个百分点,而便宜 64%;对比 Grok 4.6 48.0%、GPT-5.6 Sol 47.5%、Kimi K3 44.2%、SWE-1.7 42.0%、Astra 53.3%。DeepSWE 1.1 达 73.0%,Terminal-Bench 2.1 冲到 92.8%。但落差扎眼:Terminal-Bench 4 只有 27.3%(Opus 5 为 51.8%、Astra 57.9%),成了"benchmaxxing"讨论的靶子。技术亮点是一个训练任务同时覆盖所有推理努力级别,从而整体推进成本—性能前沿;奖励函数 R = S − λₑC,λₑ 取基座在该努力级别的帕累托前沿斜率(推导在 Appendix B)。行为指标:medium 档平均 53 步(SWE-1.7 为 127 步),首次真实编辑中位步数从 48 降到 18,成本降 81%。基座是 Kimi K3(2.8T,已经历大量 agentic coding RL),官方称这是首次把 RL 扩展到多万亿参数区间。
→ https://cognition.ai/blog/swe-2 | https://www.oschina.net/news/502413 | https://hf-mirror.com/moonshotai/Kimi-K3
🔥 3. 小米开源 CocktailASR-1:不改降噪,改任务定义 — 938 pts
思路比指标更值得记:不问"怎么去掉噪音",而问"能不能先告诉模型该听谁"。
小米开源 CocktailASR-1,切入多人同时讲话(鸡尾酒会问题)。做法不是做更好的降噪,而是改变任务输入——给一段参考音频,模型用声纹嵌入定位目标说话人,在混合音频里只转录他一个人的话。架构是端到端 LLM:D2V2 音频编码器 → Adapter → LLM 解码,所有权重打包在一个 checkpoint,输入为参考音频 + 1 秒静音 + 目标音频(16kHz 单声道),单人多人同一模型通吃。数据很硬:LibriMix 2mix WER 4.11%、LibriSpeechMix 2mix 2.90%;LibriMix 3mix 上 Qwen3-ASR/Gemini/StepAudio 分别是 106.04%、76.10%、121.08%,它是 12.29%——不是"比它们好",是"它们做不了"。两个特性值得单独提:负样本拒识(参考人未参与对话时输出空文本,LibriSpeech 拒识率 79.59%,而 Qwen3-ASR 与 StepAudio 是零)与 `` 思维链推理(几乎不损精度)。Apache-2.0,依赖极简。
→ https://github.com/xiaomi-research/xiaomi-cocktailasr-1 | https://www.oschina.net/news/502427/xiaomi-cocktailasr-1
🔥 4. OpenAI 的第二道千禧年难题:纳维-斯托克斯争议细节曝光,传闻是霍奇猜想 — 917 pts
第一道题的论文还在接受审查,第二道题已经要交卷了。争议的核心不是数学,是功劳与数据的归属。
《纽约时报》追访补出关键细节:OpenAI 更新用户数据口径,称 Buckmaster 过去两个月的 Codex 提示词不可能影响内部模型,7 月 3 日之后的用户输入也不可能进入该系统(仍为单方面说法,无公开材料可核查)。同时 OpenAI 称已在另一道千禧年难题上取得"实质性进展",传闻指向霍奇猜想。谈判条件被完整披露:先发欧拉方程、次日发纳维-斯托克斯;Buckmaster 任主要作者;提供算力;公开建议 100 万美元大奖荣誉归其与合作者(并非直接付钱)。症结在合作者 Levent Alpöge 任职 Anthropic——Bubeck 确认OpenAI 不希望他出现在论文中:"怎么能让一名 Anthropic 员工参与 OpenAI 内部项目?"普林斯顿 Sarnak 评价:"这种讨价还价,我从来没有听说过。"配套动作:Lean 4 形式化证书已开源(openai/NavierStokesAndEuler,★1,766,Apache-2.0)。
→ https://www.qbitai.com/2026/09/487092.html | https://github.com/openai/NavierStokesAndEuler
🔥 5. Anthropic 开出 320 万年薪的销售岗,客户只有一家:Meta — 896 pts
Claude Code 已打进 Meta 内部,以至于为这一家客户单配百万级销售是划算的。
岗位名为 「Mega Account Executive, Meta」,年收入 38–45 万美元(最高约 320 万人民币),9 月 3 日上线、9 月 9 日关闭,只存在一周。要求 10 年以上企业销售经验、打通 Meta 从一线工程师到 C-suite 的完整关系网,还要把需求反馈回 Anthropic 影响产品路线——与流行的 FDE 角色高度相似,薪酬采用 OTE 机制(并非入职即稳拿)。背景是 Claude Code 早已进入 Meta:据《纽约时报》Meta 在 Anthropic 的潜在年支出可能达 100 亿美元;截至 7 月底 Anthropic 年化收入超 650 亿美元,Meta 一家上限即占约 15%。企业侧画像:年消费超 10 万美元客户一年增长 7 倍,超 100 万美元客户从 12 家增至 500 多家,财富 10 强中 8 家已是 Claude 客户;Claude Code 从 2025 年 5 月开放,半年到 10 亿美元年化,2026 年 2 月超 25 亿美元,企业订阅增至 4 倍、贡献超一半收入。
→ https://www.qbitai.com/2026/09/487573.html
🔥 6. Shopify 用 AI 在 12 周内重写原生 App:从 React Native 迁回 Swift/Kotlin — 874 pts
"现在对 Shopify 来说原生是正确的选择,但在 2020 年,React Native 是正确的选择。"前提变了,结论就变了。
首款应用 Shop 已在 AI 辅助下 12 周从概念验证走到发布;旗舰应用(300+ 屏幕、小组件、Apple Watch、Siri 捷径)重写中,计划年内发布。作者 Mustafa Ali 坦言自己去年 1 月还在写"React Native 的未来光明",但编码模型的能力提升彻底动摇了 2020 年那套假设——用 Swift 和 Kotlin 构建相同功能不再那么昂贵。更值得注意的是选择从头重建而非渐进迁移,官方明确警告"直接把 LLM 指向 RN 代码库要求一次性生成等价原生代码看似诱人,实则行不通"。为此构建了 Helix 系统:不指望一次写对,而是建立检查点链——读 RN 代码 → 生成小段可审查的工作切片 → 每个切片须通过测试证明行为 + 视觉审查匹配运行中的应用 + 两名对抗性代码审查者 + 人类批准,反馈被记住使循环越来越自主。架构上把业务逻辑与 UI 完全解耦,桌面端无头运行、通过 CLI 暴露给 AI Agent,迭代时间从分钟级降到毫秒级。
→ https://www.oschina.net/news/502416/shopify-engineering-back-to-native
🔥 7. 开源把 MiniMax H3 提速 12 倍:RunningHub 方案已上 GitHub — 855 pts
"AI 加速不等于质量劣化"——不降精度、只砍等待时间。而它选择开源。
RunningHub 为 MiniMax 开源视频模型 H3 做了多 GPU 加速并整套开源。核心数据:5 秒 1344×768 视频,4 张 RTX 6000D 上原始 BF16 50 步耗时 348.8 秒,加速后只需 28.7 秒——约 12 倍提速、耗时减少约 92%,且全程保留 BF16 精度。长视频同样受益:8 张卡生成 15 秒 768×1344,纯文字约 48 秒、双参考图约 73 秒,15 秒图生视频已打进"1 分钟出结果"。技术栈经仓库确认:step distillation + SageAttention2 + Cache-DiT + torch.compile,在 sglang 上采用 TP2 + Ulysses4 并行(RH-RunningHub/MiniMax-H3-MultiGPU-Lightning,Apache-2.0)。意义有两层:开源视频模型的推理侧工程快速成熟,且优化本身也开源——创作者创意试错的时间成本被直接砍掉一个量级。
→ https://www.qbitai.com/2026/09/487055.html | https://github.com/RH-RunningHub/MiniMax-H3-MultiGPU-Lightning
🔥 8. 首个跨平台微信 zero-click 蠕虫:AI 用两天挖出漏洞,一通电话接管账号 — 837 pts
漏洞一直存在,变的是发现漏洞的速度。这才是不安之处。
安全团队 Calif 公布 WeWorm,声称是首个无需点击即可在 iOS 与 Android 上通过微信通话传播的蠕虫。三部真机演示:Pixel 10a 呼叫 iPhone 17e,响铃期间接管其微信;被攻陷的 iPhone 再呼叫第三部设备继续传播——"Attacker calls victim, victim becomes attacker, victim calls the next victim." 无需接听、无需任何交互,数秒即可拿下账号;拒接只能阻止当次,攻击者可稍后重试。唯一前提是攻击者已在受害者好友列表中,而这正是 IM 信任模型的薄弱点。漏洞是微信 VoIP 协议栈的内存破坏,暂未给 CVE。最刺眼的是 AI 的角色:团队借助 AI 约两天找到漏洞并写出第一个 RCE,一周完成完整蠕虫——这种规模以往需更大团队数月。时间线完整:7/24 报腾讯 → 8/2 完成 iOS RCE → 8/11 跨平台蠕虫演示 → 8/21 腾讯发布 Android 8.0.77 / iOS 8.0.76 缓解,8/28 确认服务端已对全体用户缓解。
→ https://www.oschina.net/news/502420/wechat-worm-ai-calif-tencent-zero-click
🔥 9. 百度秒哒企业版:87% 创造者此前不写代码 — 819 pts
自然语言开发已跨过尝鲜期,问题从"能不能生成"变成"能不能跑在核心业务上"。
两个几乎没有技术人力的样本:近 30 人的服装品牌辽丝锦没有 IT 部门,却搭起商品企划、供应链跟单、付款、库存完整链路;新材料企业福建蓝海黑石做出"全序智管"办公系统并接入企业微信供数百员工使用。搭建者是创始人与一线业务团队,此前没写过一行代码。规模已过临界点:一年用户增长 200 倍、创造 500 万个有商业价值的应用、每天近 20 万人在线使用,其中 87% 的创造者不会写代码;按 2026 上半年 MAU 口径以 33.4% 市场份额居中国 AI 原生无代码平台第一。企业版拆出"企业、团队、成员"三级架构与岗位级权限——辽丝锦按权责划界(供应链只管跟单排期、财务只对接对账、合作工厂看不到全盘数据),累计迭代 1500 多轮。
→ https://www.qbitai.com/2026/09/487415.html
🔥 10. 开源生态周动态:Agent 的"编排层"正在被架起来 — 798 pts
本周最清晰的信号:Agent 竞争面正从"模型能力"下移到"编排与治理"。
① meta-harness 站上趋势榜:omnigent-ai/omnigent(★9,853,Apache-2.0)统一编排 Claude Code、Codex、Cursor、Pi 与自定义 Agent,不重写代码即可更换 harness,并强制策略与沙箱隔离。② 空间智能开源热度惊人:bilawalsidhu/gods-eye-view(★26,152)"浏览器里的间谍卫星模拟器,只不过数据是真的"——基于 Cesium/WebGL 的写实 3D 地球,与高德 ABot-Earth 形成有趣对照。③ 工具链向"可寻址、可治理"演进:Windows 多 Agent 工作台 Termexo v0.8.6 本版刷新后不再误杀运行中的 Agent 进程、终端改为按屏幕状态重放;github/spec-kit 继续高位。④ 开源协作平台进入政府级替代:瑞士联邦政府试点把 3,000 台工作站的 Microsoft 365 换成开源 openDesk(投入 900 万瑞郎,目标 2027 年底),军方 Cyber Command 更不等试点,2026 年 10 月前先行全面替换。
→ https://github.com/omnigent-ai/omnigent | https://github.com/bilawalsidhu/gods-eye-view | https://www.oschina.net/news/502424/switzerland-gov-replace-microssoft-pilot
📌 今日趋势总览
本文原创作者:易君召,详见:https://www.yijunzhao.cn/authors/yijunzhao,转载请注明出处。
原文链接
欢迎访问 小易撩挨踢