易君召
发布于 2026-09-01 / 作者:易君召 / 10 阅读
0

AI Agents & 开源 LLM 简报 (2026年9月1日)

#AI

🔥1. Claude Fable 5.1 + Mythos 5.1 发布:8 项基准屠榜、最高降价 45%、反蒸馏机制上线 — 热度 🔥🔥🔥🔥🔥

无论你此前让 Claude 处理什么任务,Fable 5.1 都能做更多——科研实战直接秀出蛋白质设计、金星地形图和 GPU 加速三项硬核成果。

量子位报道(9/1 深夜发布):Anthropic 发布 Fable 5.1 与 Mythos 5.1,8 项公开基准测试全部第一,在科学研究和代码两项上明显甩开 Fable 5 与 GPT-5.6 Sol;中低推理程度跑 Fable 5.1 表现已基本相当于老版 Mythos 5 开到极高推理程度。价格上,缓存读取价格降至每百万 token 0.25 美元(降幅 75%),由于智能体任务中缓存读取占成本大头,典型工作负载成本比 Fable 5 降约 25%,高度智能体化任务最多省 45%。科研实战亮点:Mythos 5.1 用开源工具设计的结合蛋白亲和力是 Adaptyv Bio 竞赛最佳方案 10 倍,12 个靶标命中率接近 50%(行业典型 10-15%);Fable 5.1 基于 NASA 麦哲伦号雷达图像训练神经网络,为金星三分之一表面生成 2-3 公里分辨率地形图(此前仅 10-20 公里),已 CC 协议开源;Mythos 5.1 通过编写自定义 GPU 内核将 7 个开源深度学习模型提速最高 2.5 倍。安全侧:网络安全误报率降 60%、基础生物学误报率降 85%,双重用途任务仍路由到 Opus/Mythos 受信计划。最具行业冲击力的是反蒸馏机制:新注册 API 账户无法在多轮对话中手动编辑 Claude 上下文的同时保留思维链记录——每个思维链区块增加签名,校验对话前缀是否与生成时完全一致,任何编辑/重排/删改都会触发 400 错误或静默丢块,直接堵死"篡改上下文重放思维链"的蒸馏手法。

https://www.qbitai.com/2026/09/482652.html

🔥2. 李飞飞 World Labs 发布 Atlas:全球首个多模态世界模型,"建模世界、移动相机、模拟空间和时间" — 热度 🔥🔥🔥🔥🔥

从视觉特效到机器人,一张图补全 3D 世界,还能给机器人造训练场——世界模型赛道迎来"里程碑式"玩家。

量子位报道(9/1 深夜发布):李飞飞 World Labs 正式发布新一代世界模型 Atlas,自称"全球首个多模态世界模型",slogan 明确"建模世界,移动相机,模拟空间和时间"。Atlas 是一个多模态自回归扩散 Transformer(全能模型):文本、图像、视频、3D 数据全部锚定在三维空间形成空间上下文,再按需生成多模态输出。四大能力:① 相机控制生成——仅一张图片即可生成具有像素级相机控制的图片和视频,最高 1 分钟、1440p;② 空间重建——基于 1 到数十张输入图像重建真实场景,可输出新视角图像帧或显式 3D 表示,效果超过专门训练的 SOTA 3D 重建模型;③ 时空模拟——根据输入视频同时建模空间与时间,可转换观察视角,支持机器人 Real-to-Sim 工作流;④ 图像生成——文本生图与 360° 全景图,复杂 Prompt 与文字渲染准确。对机器人领域,仅需几张照片即可生成逼真 RGB 和深度数据,让机器人在更多模拟空间训练测试——英伟达机器人主管 Jim Fan 评价"这是机器人领域 Real-to-Sim 的一大步"。李飞飞 6 月曾定义世界模型为渲染器/模拟器/规划器并强调"最关键的是模拟器",7 月收购 SceniX、发布 Real-to-Sim-to-Real 系统,如今 Atlas 打通"真实照片/视频→3D 空间→机器人传感器视图"全路径,并已为 Scaling 做好设计。Atlas 正面向部分合作伙伴开放早期访问,将成为未来版 Marble 及其他产品的底层模型。

https://www.qbitai.com/2026/09/482586.html
https://www.worldlabs.ai/blog/atlas

🔥3. MiniMax H3 Max:不到 3 秒生成 5 秒视频,AI 实时直播与"AI 版抖音"一周引爆——视频生成的 OpenClaw 时刻 — 热度 🔥🔥🔥🔥

上一段视频还没播完,下一段已经生成好——生成速度快过播放速度之后,一种之前根本不存在的玩法冒了出来。

量子位报道:MiniMax 与推理加速公司 fal 联合开发 H3 Max(基于 7 月底开源、三周 2400 万下载的 H3 做实时场景后训练与推理优化):生成一段 5 秒 768p 视频不到 3 秒,吞吐量约为原版 H3 的 35 倍,在 Artificial Analysis 与 Design Arena 双榜图生视频第一。速度质变催生新玩法:fal 工程师 Rehan Sheikh 做了"跨维度电视"AI 直播间(无节目单、全实时生成,X 观看 540 万);独立开发者 Pieter Levels 做了观众随意点播的 AI 直播站;fal 工程师 Alex Koumpas 开了观众可用文字指令改写剧情的互动故事直播——一周内三人不约而同做出三个 AI 直播间。另有开发者用 Codex 搓出"AI 版抖音",内容实时生成无缝衔接,可延长至 30 秒。量子位称这是"视频生成的 OpenClaw 时刻":把高不可攀的技术变得人人可触及;且视频赛道与代码赛道不同——没有唯一正确答案、审美各花入各眼,不会收敛到一两个赢家,开源生态(FastH3、H3 480p、H3 Max 等 300+ 衍生模型)还会不断叠加迁移成本壁垒。资本市场已用真金白银投票:摩根士丹利维持增持评级、目标价 900 港元,今日 MiniMax 港股收涨 16.18%(300.4→349 港元)。

https://www.qbitai.com/2026/09/482512.html

🔥4. Claude"永久提额 25%"实际到手少 17%,OpenAI 义父 Tibo 连夜重置 Codex 额度:AI 订阅大战的公关攻防 — 热度 🔥🔥🔥🔥

官方说"好消息!永久给你涨 25%",算完发现"等等,我怎么实际少了 17%?"——然后 OpenAI 连夜重置额度还修了一堆偷吃额度的 bug。

量子位报道:Anthropic 宣布 9 月 14 日起永久提高 Claude Code 25% 标准周额度(覆盖 Pro/Max/Team/Enterprise),但真相是当前正执行一轮临时 50% 加量——9/14 临时加量结束后换成永久 +25%,总额度实际从 150 降到 125,到手反而少约 17%,被网友戏称"A 社化身 A 割"。评论区骂声一片,有人直接拉中国模型对比"大家都在降价加量卷性价比,怎么到了你这里画风突变"。几个小时后 OpenAI 的"赛博义父"Tibo 出手:重置 Codex 额度,并披露修掉了一大批后台偷吃额度的问题——Compaction 压缩 bug、Memory 死循环(极端案例一个线程检查 15000 次能否停止)、/goal 完成后继续跑(个案白吃周额度 15%-70%)、Automations 超频执行、Subagents 偷偷调用更贵模型、Computer History 反复总结(一周白吃 20%)、MCP 工具结果编码两遍等,预计同样额度可多用 10%-50%。量子位点评:两件事性质不完全相同(Claude 是取消临时增量换永久基础增量,OpenAI 是修 bug 恢复本该有的额度),但从观感上"一个在往回收、一个在猛猛送",已有多位开发者表示编程主力从 Claude Code 转向 Codex。此事折射的深层信号:AI 订阅经济的用户信任管理,正在成为头部厂商的新战场。

https://www.qbitai.com/2026/09/482406.html

🔥5. DeepSeek 开源首个多模态模型 V4-Flash-Vision:不是拿来"看图说话"的,直指 Agent 工具使用场景 — 热度 🔥🔥🔥🔥

开源多模态大模型又添重磅玩家——DeepSeek 的第一个多模态模型,重点却不是传统视觉问答。

开源中国今日报道(标题级,正文 JS 渲染不可抓取;AINEWS 9/1 日报同步印证"DeepSeek V4 Flash Vision 开源对标竞品"):DeepSeek 开源其第一个多模态模型 DeepSeek-V4-Flash-Vision(实验版,AINEWS 标签 deepseek-v4-flash-vision-exp),标题《DeepSeek 开源的第一个多模态模型,不是拿来「看图说话」的》暗示其设计定位并非常规图文理解,而是面向 Agent 场景——多模态输入为智能体提供"看懂界面/图像后执行任务"的能力,与本周 Claude MHS(物理世界)、browser-use/video-use(视频编辑 Agent)等"多模态作为 Agent 感知层"的潮流同频。DeepSeek 此前以 V4-Flash 的极致性价比(开源价格战主角)著称,此次补上多模态维度,意味着其开源矩阵从纯文本走向全模态,也延续了本周"中国开源模型周更"的节奏(GLM-5.3-Flash、Qwen3.8-Flash、混元 Hy4 之后第四个)。具体参数、基准成绩与许可证细节待官方完整披露,建议保持跟踪(双源:OSCHINA 标题级 + AINEWS 印证)。

https://www.oschina.net/news/502240
https://ainews.liduos.com/post/2026-09-01

🔥6. 清华 AIR × 域变换发布 Zeva:首个具身 In-Context Causal Learning,权重冻结累计成功率 26%→73% — 热度 🔥🔥🔥

模型不更新,能力却持续增长——一次人类演示就能让机械臂"学会"新操作,具身智能的自进化终于不靠改权重了。

量子位报道(Zeva 团队投稿):清华 AIR 与域变换联合发布 Zeva,论文《Zeva: In-Context Causal Learning for Generalizable Embodied Manipulation》,实现首个具身 WAM(World Action Model)的 ICCL(In-Context Causal Learning)——模型在权重完全冻结的情况下,从自己的交互经验中持续学习。核心设计三件套:Causal Transition Encoder(显式学习"动作→状态变化"的物理因果)、Dual-timescale Causal Memory(Brief Interaction Trace 管当前尝试连贯执行 + Persistent Interaction Memory 跨尝试累积可复用经验)、In-Context Policy Injection(通过 Causal Prompt 把任务/阶段/交互证据注入冻结的 Cosmos3 动作模型,零梯度更新)。数据说话:RoboCasa365-Atomic5 平均成功率 76.8%,部署后累计成功率从 Evolve 1 的 26% 提升到 Evolve 4 的 73%;真实化学实验室 ChemLab-Evo 三个原子任务单调增长(Pick Up Test Tube 65%→100%、Place Beaker 25%→70%、Pour Water 30%→80%);一次人类演示 warm-up 可带来最高 20 个百分点提升。深层意义是把具身 scaling 从"参数空间"延伸到"上下文空间":每一次交互都成为隐式系统辨识的证据,模型越用越懂当前物理环境。团队称这是具身智能迈向"GPT 时刻"的基础设施——ICCL 将成为继 VLA(任务理解)、世界模型(经验想象)之后的"现场因果学习"第三极。

https://www.qbitai.com/2026/09/482337.html
https://air-embodied-brain.github.io/Zeva/

🔥7. Archify 登顶 GitHub 热榜第一:一句话生成可交互架构图,开发者"专升本逆袭"故事刷屏 — 热度 🔥🔥🔥

分析这个代码仓库,生成一张高层运行时架构图——一个 Agent Skill 让"画图"变成一句话的事,也让一个被背调卡住的开发者等到了春天。

量子位报道:开源项目 Archify(tt-a1i/archify)冲上 GitHub 热榜第一,狂揽 3.14 万 Star、1.9k Fork,X 上收获多条 10 万赞正向测评。它面向 Claude Code、Codex、Cursor、OpenCode 等 AI 智能体:理解代码或系统描述后生成结构化 JSON IR,再经 Schema/布局/渲染检查输出独立 HTML 文件,支持架构图、工作流图、时序图、数据流图、生命周期图五类,可搜索节点、追踪调用路径、切换主题、导出 PNG/SVG/WebM;还能对比两个架构快照(Before/Delta/After),让架构图参与代码评审跟着项目迭代。与 Mermaid 的本质区别:把绘图能力嵌入编程 Agent 工作流,Agent 负责理解代码,Archify 负责验证渲染,"模型可以画得快,但不一定画得对"——交付前它会检查节点布局与连线冲突。更动人的是开发者故事:作者"也无风雨也雾晴"(晴天老师)专升本出身,多次在大厂背调时因专科学历被卡,在 Manus COO Cz Chen 鼓励下选择用开源作品自证实力,最终靠 Archify 拿到上海大厂 Offer——"开源没有让我从专升本变成 985,但至少 Archify 确实有人在用"。这条新闻同时是 Agent 工具生态与开发者叙事的双重热点。

https://www.qbitai.com/2026/09/482469.html
https://github.com/tt-a1i/archify

🔥8. Manus 恢复独立运营;OpenClaw 2.0 意外归来:"16,000 个 PR 之后,谁还在用 OpenClaw?" — 热度 🔥🔥🔥

一边是国产 Agent 明星项目重新单飞,一边是"时代的眼泪"悄悄发了个大版本——开源 Agent 江湖永远不缺续集。

开源中国今日两条标题级新闻(正文 JS 渲染不可抓取,以下结合标题与本周报道整理):①《Manus 恢复独立运营》——此前在资本整合中身份几经变化的国产 Agent 明星(Manus 曾是 2025 年爆火的通用 Agent 产品),如今宣布恢复独立运营,对关注中国 Agent 商业化的用户来说是重要节点;②《16,000 个 PR 之后,谁还在用 OpenClaw?》(URL slug: openclaw-2-accidentally)——OpenClaw 在"被全网悼念"一周后居然发了个 OpenClaw 2.0("accidentally"暗示是意外流出或社区接力),16000 个 PR 说明这个 38 万星项目实际上仍在密集演进。两者共同提示:Agent 开源生态的"死亡"与"重生"往往同时发生——OpenClaw 的名字淡出视野,但它的 30+ 衍生品与 Harness 遗产仍在生长;Manus 的独立则意味着国产 Agent 产品在资本整合之外仍有单飞空间。结合 OSCHINA 同日《Omarchy:一个把 AI Agent 写进内核的 Linux》《每周一天,关掉 AI 写代码》等话题,开源社区的 Agent 争论正在从"要不要用"走向"怎么治理"。

https://www.oschina.net/news/502250
https://www.oschina.net/news/502255

🔥9. 世界模型与 Agent 训练场:Runway 推出 Solaris 界面世界模型,fal.live 上线观众可操控的连续视频生成 — 热度 🔥🔥🔥

当"世界模型"成为 Agent 的动态训练环境:图像本身就是界面、整个画面都被模拟出来——这可能是 UI Agent 的下一个训练场。

AINEWS 9/1 日报(恢复发布)带来两条世界模型动态:① Runway 推出 Solaris——"界面世界模型",实时逐帧生成交互式界面、无需编写代码,声称在结构相似性和信息保留上超越前沿大模型;其更广泛的意义在于生成的 UI 可作为智能体的动态训练环境("图像本身就是界面,整个画面都被模拟出来")——这与李飞飞 Atlas 的 Real-to-Sim 思路同构,只不过模拟的是数字界面而非物理世界;② fal.live 由 H3 Max Director(H3 Max 的自回归连续版本,支持最长两分钟上下文)驱动,支持观众通过大模型生成提示词并点赞投票操控直播内容,短暂暂停后已重新上线,同时为 MiniMax H3 Max 推出 Reference-to-Video 参考图生视频(768p 最高实时 1 倍速)。世界模型赛道本周密集爆发(Atlas、Solaris、LeVJEPA),核心叙事高度一致:生成式模型正在从"出片工具"升级为"Agent 训练场"——无论是物理机器人还是 UI 智能体,都需要廉价、可控、可规模化的模拟环境。

https://ainews.liduos.com/post/2026-09-01

🔥10. GitHub Agent 工具新星:video-use(视频编辑 Agent)、patent-disclosure-skill(中国专利技能)、academic-research-skills(学术研究流水线) — 热度 🔥🔥

视频编辑、专利申请、学术写作——Agent Skills 正在侵入每一个专业工种,而中文技能生态开始成建制出现。

GitHub Trending 与 API 今日动态:① browser-use/video-use(★2.3 万,浏览器自动化团队出品)——"Edit videos with coding agents":让编程 Agent 直接剪辑视频,把 browser-use 的"浏览器操作"范式延伸到视频编辑工具链;② handsomestWei/patent-disclosure-skill(★6782,今日更新)——中国专利技能包:专利点挖掘与交底书(发明/实用/外观)编写、通俗解读专利、嗅探政策动向、辅助审查答复,是中文 Agent 技能生态成建制出现的标志性项目之一;③ Imbad0202/academic-research-skills(★4.5 万,今日更新)——面向 Claude Code 的学术研究技能流水线:research → write → review → revise → finalize,把论文写作流程封装为可复用技能。三者与本周持续井喷的 Skills 生态(scientific-agent-skills 19 万科学家使用、last30days-skill、sepia、headcount 等)同频:当模型能力趋同,"专业技能资产化"成为 Agent 生态的主战场,且中文技能(专利、公文、法规等)正在快速补位。

https://github.com/browser-use/video-use
https://github.com/handsomestWei/patent-disclosure-skill
https://github.com/Imbad0202/academic-research-skills

📌 今日趋势总览(AI Agents & 开源 LLM)

趋势

热度

旗舰模型军备竞赛:Fable 5.1 屠榜 + 反蒸馏,GPT-6/Astra 周四发布在即

🔥🔥🔥🔥🔥

世界模型元年加速:李飞飞 Atlas 全球首个多模态世界模型、Runway Solaris

🔥🔥🔥🔥🔥

视频生成实时化:H3 Max 3 秒出片,AI 直播与实时商业化路径打开

🔥🔥🔥🔥

开源多模态补位:DeepSeek 首个多模态 V4-Flash-Vision(Agent 场景导向)

🔥🔥🔥🔥

订阅经济信任战:Claude 明升暗降 vs OpenAI 重置额度+修 Bug

🔥🔥🔥🔥

具身自进化新范式:Zeva 权重冻结 26%→73%,ICCL 开启上下文空间 scaling

🔥🔥🔥

Agent 技能中文化:专利/学术/合规技能包成建制涌现

🔥🔥🔥

世界模型即 Agent 训练场:Solaris/fal.live 让 UI 与视频变成可交互模拟环境

🔥🔥🔥


本文原创作者:易君召,详见:https://www.yijunzhao.cn/authors/yijunzhao,转载请注明出处。

原文链接 https://www.yijunzhao.cn/archives/ai-agents-kai-yuan-llm-jian-bao-2026nian-9yue-1ri

欢迎访问 小易撩挨踢

https://www.yijunzhao.cn/