🔥1. Claude 用 11 天形式化费马大定理:1300 万行 Lean 代码、3 万个中间定理——规模超 Mathlib 五倍,靠 Prove2Me 多 Agent Harness 救回 — 热度 🔥🔥🔥🔥🔥
人类和费马大定理纠缠了三个半世纪,Kevin Buzzard 的社区项目原按"多年工程"准备——Claude 用了 11 天,把整份证明翻译成计算机能逐行检查的形式化语言。
量子位报道:Anthropic 宣布 Claude 完成首个端到端、可由计算机完整检查的费马大定理证明——约 1300 万行 Lean 代码、超 3 万个中间定理(最终证明使用约 29500 个),工程规模超过 Lean 核心数学库 Mathlib 的 5 倍。Claude 没有发现新证明,而是完成了一件同样惊人的事:把人类数学家能读懂的证明(Wiles 1994 年版本)彻底翻译成 Lean 可逐行验证的形式化证明("没有任何'这里显然'")。整个过程多 Agent 并行(补数学定义、攻中间引理、沿已有成果推进、拼装回整体);早期 Agent 协作很快撞上大型 Agent 系统的通病——"项目一乱就失忆",失败代码约占成品非模板代码 7%。真正的转折点是 Prove2Me 平台(姚班校友、哥大助理教授、Anthropic 研究员 Tianyi Peng 与哥大合作者搭建):把证明拆成由定理节点组成的 DAG,谁已证明、缺什么前置、下一步攻哪一目了然,并分离定理陈述与证明、加速 Lean 编译、保留自然语言描述供 Agent 搜索复用——最后用"Prove2Me + 基于 Claude Code 的 multi-agent harness"跑完全程,消耗约 60 亿输出 Token(内部模型能力大致相当于 Fable 5.1),人类只给了少量高层方向提示。完整证明仅依赖 Lean 三个标准公理,且与 Mathlib 中的费马大定理陈述完全一致。Buzzard 评价为"非凡的自动形式化成果"——数学文献形式化首次具备了大规模提速条件。GitHub 仓库 anthropics/fermats-last-theorem(★755,9/4 创建)已同步公开。同日,GPT-6 Astra 开始向 ChatGPT 付费用户开放(Pro/Business/Enterprise)。
→ https://www.qbitai.com/2026/09/484551.html
→ https://github.com/anthropics/fermats-last-theorem
🔥2. GPT-6 带火循环 Transformer:同一组层反复跑、参数不涨算力翻倍——阿里 11 个月前已用 MeSH/SpiralFormer 解决"循环空转" — 热度 🔥🔥🔥🔥
模型不必继续疯狂"长肉",也能让现有参数多干几轮活——Astra 的架构秘密揭晓,安全争议与学术预研同时涌来。
量子位报道:The Information 爆料 GPT-6 Astra 使用了 recurrent depth(循环深度)技术——让同一组 Transformer 层反复运行,在不增加同等规模参数的情况下把计算做得更深。争议随之而来:循环发生在 hidden state 里,中间过程未必写成人类可读思维链,模型会不会更难监测?AI 安全专家集体讨伐,首席科学家 Jakub Pachocki 亲自下场回应并预告将发文解释。但"多循环几圈真的更强吗"——学界早已踩坑:同等算力下循环模型常打不过普通 Transformer,卡点是计算冗余(后续循环的增量信息越来越少)。阿里与合作高校 11 个月前就发了论文直指此问题:MeSH(ICLR 2026 接收)——先钻进模型内部找到三个"摸鱼证据"(后面循环不爱动、相邻轮次表示高度相似(CKA)、hidden state 越算越挤进低维空间),再给循环加"资料柜":Memory Buffer 记忆槽 + Write/Read Router 动态读写,让每轮分工明确——Pythia-1.4B 级实验减少约 33% 非嵌入参数,零样本准确率反而从 49.50% 提到 50.56%,路由器额外开销仅约 0.005%;SpiralFormer(EMNLP 2026 接收)——让每轮循环的序列长度可调(1/8→1/4→1/2→完整,从粗到细),计算量从 14.08T 降到 13.13T FLOPs,5-shot 准确率 51.93%→54.37%。此前 Claude Mythos 已带火一轮循环架构(GraphWalks BFS 1M 上下文 80.0% vs GPT-5.4 21.4%)。"用计算深度换参数规模"若跑通,将改写 Scaling 的账本——中国团队在下一代架构预研上已占先机。
→ https://www.qbitai.com/2026/09/484726.html
🔥3. 陶哲轩吐槽 AI 数学竞赛:"令人无语的一幕"——GPT-6/Claude/Axiom 一周内把孪生素数上界从 246 卷到 186/188/212 — 热度 🔥🔥🔥🔥
一向积极拥抱 AI 的陶哲轩发出 AI 告警:AI 抢答数学难题、过程又太黑盒,可能反而"污染"数学发展的源泉。
量子位报道:GPT-6 Astra 发布后 OpenAI 宣布用 Lean 形式化证明把孪生素数猜想的连续素数间距上界从 246 推到 186——但 Anthropic 与 Axiom 也同期宣布把该间隔缩到 188 和 212,而牛津数学家 Julia Stadlmann 恰在 8/31 把上界缩到 240。陶哲轩随即吐槽"这可真是令人无语的一幕",并发出更深层的警告:以纳维-斯托克斯方程全局正则性问题为例——答案可能主要由 AI 生成,但其出现方式会"污染"这个问题,使其不再能像过去那样成为推动数学后续进展的源泉。他的核心论点:① AI 解题太快 + 过程黑盒,会掩盖数学研究过程中宝贵的"失败"——历史上 Leray-Hopf 弱解、Gagliardo-Nirenberg 不等式、Prodi-Serrin 定理等最基础的思想,恰恰都诞生于人类试图解决(而非直接解决)该问题的过程中;② 一个自主运行的 AI Harness 在内部完成"尝试-失败-调整-再尝试"的完整迭代后直接吐出答案,公司却把通往答案的整个过程隔绝在公众视野之外——"从技术意义上问题确实被解决了,但数学本身几乎没有获得任何新增价值";③ 严重时,AI 对整个数学发展的影响可能从正面变成净负面。陶哲轩并非反对 AI for Math——他建议把 AI 拟设 + 机器学习模拟 + 形式化验证 + 人类专家指导组合成可监督的流水线。这场争论的本质:当 AI 把"数学研究的副产品价值"也一并自动化,人类该如何保留理解与探索的空间。
→ https://www.qbitai.com/2026/09/484649.html
🔥4. HICOOL 一等奖颁给世界模型:飞渡科技"峥嵘大模型"夺冠,押中 SpaceX 的硅谷老将 Bill Reichert 把票投给"实体 AI" — 热度 🔥🔥🔥
当 AI 开始"预演"一场暴雨:HICOOL 2026 全球创业峰会(141 国、10209 个项目)把最重的票投给了"补上大模型通向物理世界短板"的路线。
量子位报道:HICOOL 2026 全球创业者峰会(8/26-29 北京)一等奖颁给空间智能与世界模型方向——国家级专精特新"小巨人"飞渡科技及其自研空间智能"峥嵘大模型"。资本侧同频:路演评委 Bill Reichert(天马科创投合伙人,其基金参投 OpenAI 400 亿美元融资轮、组合含 SpaceX/Airbnb)在 WAIC 已表示"大模型热潮后,风投标准已变,看好 AI 与物理世界结合的实体 AI"。飞渡的答卷是全栈空间智能基础设施:3DT 统一数据标准(兼容百余种异构空间数据、支撑 PB 级三维场景实时渲染)+ 峥嵘大模型(国内首个通过国家备案的工业级空间智能大模型,"外观层-几何层-语义层-物理层-模拟层"五层技术栈)+ 元尊 S800 空间智能一体机(全栈国产信创)。落地场景以城市防洪为例:气象、地形、管网数据在统一平台汇成城市"可计算副本",模型在数字空间把暴雨预演一遍——推演哪座立交桥先积水、多深、影响哪些道路、哪个泵站该提前开动——动态边界控制(溃口后秒级重构计算域续接推演)、真实世界 1:1 验证(偏差超阈值在线修正)、智能体化调度(智水 AI + 灵枢 SAGE 灾害推演智能体,目标输入到方案输出全自动)。背景铺垫:2026 年 7 月中国南北洪涝(南宁 18.7 万人转移、沈阳单街道 10 小时降雨 310.6mm)让"大模型看不懂物理世界"的代价变得具体——世界模型的竞赛正从"生成好看的世界"走向"生成能决策的世界"。
→ https://www.qbitai.com/2026/09/484683.html
🔥5. "反骨"世界模型 Phi-WM ActEffect:训练完就退场,机器人反而更能干了——LIBERO 98.8%、部署链路保持轻量 — 热度 🔥🔥🔥
以前的世界模型是机器人的"脑内沙盘",执行时边预测边行动;ActEffect 偏偏只在训练场里用世界模型,练完就把它从部署链路里撤掉。
量子位报道:光象科技联合清华李升波教授课题组发布第一代物理原生世界模型 Phi-WM 1.0 ActEffect:让策略先交出三版动作提案(前馈分支的"第一反应"、MIP 动作头粗提案、精修后的最终动作),受控世界模型拿到当前视觉状态 + 动作提案后预测场景变化,把三次预测与真实未来比较,要求精提案比粗提案更接近、粗提案优于第一版(排序损失 + 梯度截断防钻空子)——"后果"反馈被写进策略权重。训练完成,受控世界模型与未来观测分支一起退出部署链路,机器人执行时无需展开未来、搜索候选动作,把"多想一会儿"留给训练、把更短链路留给执行(工业场景每多跑一层模型都是产线账本上的时延与算力)。效果:LIBERO 98.8%、加入七类分布偏移的 LIBERO-PLUS 80.3%(Fast-WAM 为 51.5%)、29 维动作空间的 RoboCasa-GR1 67.5%(比 ABot-M0 高 9.2 个百分点)。设计细节:语言指令留在 VLA 侧、受控世界模型只看画面与动作(物理变化与任务语义解耦);未来状态放进冻结的 DINOv3 特征空间(不生成逼真未来画面,只抓物体位置/姿态/结构变化)。公司背景:光象科技 2025 年 4 月成立,清华车辆与运载学院+AI 学院联合孵化,CEO 张涛(前高德技术总监/空间感知引擎负责人),Phi-Bot X1 已在蔚来汽车焊接上下料场景连续运行 3 天、累计 21.5 小时零失误零中断——世界模型从"学术 demo"走向"产线验收"的又一步。
→ https://www.qbitai.com/2026/09/484611.html
🔥6. 周回顾·GPT-6 Astra 发布周全景:10 万 GPU、ARC-AGI-3 99.9%、"AGI 时代"官宣 + 循环 Transformer 架构与陶哲轩式争议 — 热度 🔥🔥🔥🔥🔥
从灰测刷屏到正式发布只用三天,从"发布即巅峰"到架构揭秘与数学争议只用两天——GPT-6 的完整一周浓缩了 2026 年旗舰发布的所有戏剧性。
本周 GPT-6 完整链回顾:8/31 灰测 demo 刷屏(3D 资产生成"降维打击")→ 9/3 发布窗口未官宣 → 9/4 正式发布(德州 Stargate 园区 10 万+ GPU 预训练、ARC-AGI-3 99.9%、ExploitBench 满分、AutomationBench 41.4%、OSWorld 2.0 72.6%、单任务耗时较 Sol 减 47%,Brockman 宣布"Welcome to the AGI era";定价 $10/$50 每百万 token 与 Fable 5.1 持平)→ 9/5 架构揭秘(The Information 爆料 recurrent depth 循环 Transformer,引发安全监测争议,阿里 MeSH/SpiralFormer 论文被翻出)与能力争议(孪生素数上界 186 引发陶哲轩"污染论")。同时 Astra 开始向 ChatGPT 付费用户开放。一周内,Anthropic(Fable 5.1 屠榜 + 反蒸馏 + 费马大定理形式化)与 OpenAI(GPT-6 + GPT Image 2.5 + Codex 更新)完成了一次"发布对轰";加上 ChatGPT/Claude/Grok 同日宕机事件,"超级发布日"的多模型容灾需求被凸显。对开发者的信号:Computer Use/长链路 Agent 成为旗舰模型的必争之地,"完成任务的总成本"取代"每百万 token 单价"成为新标尺。
→ https://www.qbitai.com/2026/09/483898.html
→ https://www.qbitai.com/2026/09/484726.html
🔥7. 周回顾·世界模型三线并进:Atlas(美)、开源同款抢跑(中)与"下半场"资本投票 — 热度 🔥🔥🔥🔥
李飞飞 Atlas、影溯 InSpatio、飞渡峥嵘——本周世界模型的发布密度与资本密度,把这个赛道从"讲故事"推向"拼基建"。
本周世界模型叙事三线并进:① 9/1 李飞飞 World Labs 发布 Atlas——全球首个多模态世界模型(多模态自回归扩散 Transformer,一张图生成 1 分钟 1440p 像素级相机控制视频、1-数十张图重建显式 3D),Jim Fan 称"机器人 Real-to-Sim 一大步";② 9/4 量子位挖出中国"同款"——影溯 3 月开源 InSpatio-World(时间维度显式建模,可改变观察时刻重看动态过程),InSpatio-Curious 登顶 WorldArena 2.0(66.11 分/77 模型第一,轨迹/深度/时空表征四项第一),并联合 20 余家机构启动 SIDO 百万级 3D/4D 数据底座计划;③ 9/5 HICOOL 一等奖颁给飞渡科技峥嵘大模型(城市防洪推演、"从生成到决策"的下半场叙事),硅谷老将 Bill Reichert 押注实体 AI。三条线共同指向:世界模型的竞争正从"生成画面漂不漂亮"转向"能不能用于决策/训练"——渲染与生成只是上半场,可推演的"世界模拟器"才是下半场;而数据底座(SIDO)、评测基准(WorldArena/TriWorldBench)正在成为新的兵家必争之地。
→ https://www.qbitai.com/2026/09/484163.html
→ https://www.qbitai.com/2026/09/484683.html
🔥8. 周回顾·HF 卖身英伟达正式官宣:从传闻到"承诺保持开放",开源社区的中立时代落幕 — 热度 🔥🔥🔥🔥
8/26 传 130 亿、8/28 The Information 实锤 129 亿、9/4 官方层面确认并承诺保持开放——一场横跨十天的开源最大并购,本周走到终点。
本周 HF 收购的收官:9/4 OSCHINA 报道 NVIDIA 以 129 亿美元收购 Hugging Face 正式官宣并承诺保持开放平台。完整链条回顾(8/26-9/4 连续追踪):OSCHINA 首爆 → 量子位实锤(微软出局、估值三年翻近 3 倍、HF ARR 仅约 1 亿美元但托管 300 万模型)→ OSCHINA 评论系列(中国版 HF 怎么造、开源创业者该不该卖、开源为什么越来越值钱、全球开源平台都逃不过被收购)→ 9/4 官宣。行业震荡仍在继续:本周 Git 生态观察(git.kernel.org 98% 流量来自非人类)、LibreOffice 26.8 首周 103 万下载("没有一个 AI 功能"成为卖点)、开源中国自己开源 MothX Agent harness——都在回应同一个问题:在被巨头收购与 AI 消耗的双重压力下,开源的"独立叙事"还剩多少空间。2026 开源基建并购潮(Stripe-OpenRouter、AWS-DuckLabs、NVIDIA-HF)宣告一个时代的句点。
→ https://www.oschina.net/news/502310
→ https://www.qbitai.com/2026/08/480186.html
🔥9. 周回顾·企业级 Agent 商业化提速:千问办公 3000 万用户、百融 RaaS 硅基员工、云知声 Agent 占营收 85% — 热度 🔥🔥🔥
本周中国厂商用三组硬数据回答了"Agent 到底能不能赚钱":3000 万用户、日扛 1.5 万通电话、85% 营收占比。
本周 Agent 商业化三连证:① 9/4 千问办公上线首月用户破 3000 万、企业用户占比过半,120 个版本/日均迭代 4 次,杰富瑞实测八款 AI Agent 综合第一,长安汽车线束选型两天缩至五分钟;② 9/2 百融 AICC 收入同比 +52%、新场景 +195%,物流 AI 客服日处理量超 1.5 万通、券商部署 30 席扩至 210 席,RaaS(按结果收费)模式让处理量直接转化为收入;③ 8/28 云知声智能体业务 4.78 亿元、占营收 85.1%,Token 业务 Q2 环比 +500%。加上 MiniMax(8/27 ARR 半年 5.3 倍、B 端占比 80%)与 WorkBuddy 联名硬件(9/3,100+ 伙伴),模式已经清晰:To B 场景按结果计费 + 办公赛道规模圈地 + Agent 进入核心业务流程——"Agent 是卖产能不是卖模型"正在成为行业共识,落地速度由中国厂商集体拉陡。
→ https://www.qbitai.com/2026/09/484155.html
→ https://www.qbitai.com/2026/09/482967.html
🔥10. 周回顾·具身自进化与数据范式革命:从权重冻结、零遥操到"训练完就退场" — 热度 🔥🔥🔥
本周具身智能的四个发布,不约而同绕开"堆数据 + 改权重"的旧路线——自进化与数据效率成为新主轴。
本周具身技术路线全景(已报内容整合):① 清华 Zeva(9/1)——权重冻结的 In-Context Causal Learning,26%→73%;② 神秘 MVP"做个人吧"(9/3)——物理理解 + 能量驱动行为,zero-shot 80%;③ 自变量 TwinDex(9/3)——无本体数据 100% 替代真机遥操("数采执行同构"),采集效率 5.3 倍;④ 星尘 SmoothRL(9/4)——异步执行下只对"真正执行的动作"做 RL(投掷 39%→94%);⑤ 光象 ActEffect(9/5)——受控世界模型"训练完就退场"(LIBERO 98.8%)。共同信号:预训练让机器人"会做",真实世界的后训练/自进化让它"越做越准";模型、数据、Harness、RL 被整合为同一套"越用越强"的工程体系,同时工业部署成本(时延/算力/产线账本)成为技术选型的硬约束。具身智能的"GPT 时刻"叙事,正从口号变成可复现、可验收的技术路线——"能不能连续运行 21.5 小时零失误"开始取代 demo 成为新标尺。
→ https://www.qbitai.com/2026/09/484611.html
→ https://www.qbitai.com/2026/09/484437.html
📌 今日趋势总览(AI Agents & 开源 LLM)
本文原创作者:易君召,详见:https://www.yijunzhao.cn/authors/yijunzhao,转载请注明出处。
原文链接
欢迎访问 小易撩挨踢