易君召
易君召
发布于 2026-07-11 / 13 阅读
0
0

AI Agents & 开源 LLM 简报 (2026年7月11日)

#AI

🔥 1. GPT-5.6 Sol Ultra 一小时解开 50 年数学猜想——64 个子 Agent 并行,完整 Prompt 公开 — 1600 pts

OpenAI 研究院 Ethan Knight 宣布:GPT-5.6 Sol 以 Ultra 模式在不到一小时内完成了存在半个世纪的"循环双覆盖猜想"(Cycle Double Cover Conjecture)的证明。GPT-5.6 自主打出了 64 个子 Agent 并行工作,最终生成了一份 3 页 PDF 证明。与以往不同——这次不是靠内部特供模型,而是公开可用的 GPT-5.6 Sol Ultra,完整 Prompt(约 700 词)也已公开。证明思路极富启发性:不是直接在图中寻找圈,而是先转化成一个有限域上的边标号问题,再用线性代数证明标号一定能在全局拼起来——让圈从标号中"自己长出来"。更值得学习的是 OpenAI 公开的 Prompt 风格:不替模型规定固定 SOP,而是把验收标准钉死——定义、范围、边界情况提前说清,什么不算答案也写清,适当重复目标防止上下文漂移。Noam Brown(o1 核心贡献者)表示:"多 Agent 把可能要磨一整天的证明压进了一小时。"

https://www.qbitai.com/2026/07/447873.html

🔥 2. 中国首个十万卡集群曙光 8000 落成:全国产算力支撑、超智融合已跑通 — 1500 pts

中科曙光宣布 曙光 8000(登峰) 正式落成——中国首个十万张国产加速卡的 AI 超集群,依托国家超算互联网接入全国一体化算力网。核心亮点:原生超智融合——同一套系统同时支持 FP64 双精度科学计算和万亿参数大模型训练,从架构阶段就打通了超算和智算。工程奇迹般的速度:2024 年研制→2025 年完工→今年 2 月 3 万卡上线→4 月再投 6 万卡→7 月 10 万卡落地。关键技术:海光芯片 + scaleFabric 类 IB 原生 RDMA 网络 + ParaStor 分布式存储(IO500 双榜第一)。已完成 300 余项应用适配,覆盖 20 多个领域。真实成果:8 万卡加速蛋白质折叠模拟、8.8 万卡完成 328 万亿网格湍流模拟、9 万卡协同完成 3.16 万亿个原子的 DFT 高精度仿真。"从万卡到十万卡,不是多加几个零,而是一道完全不同的工程题。"同时已启动第二套十万卡系统建设。

https://www.qbitai.com/2026/07/447902.html

🔥 3. OpenAI 公开数学证明 Prompt 模板:700 词精准驾驭"神话级模型"的保姆级技巧 — 1300 pts

OpenAI 公开了 GPT-5.6 完成 50 年数学猜想的完整 Prompt,其设计思想极有参考价值。与常规 prompt engineering 偏重"给模型规定执行步骤"的思路不同,这套 prompt 的核心是定义最终结果与验收标准。四个要点尤其值得学习:1️⃣ 不替模型规定解法——只写什么算完成、什么不算完成,路径留给模型搜索。2️⃣ 提前锁定所有边界——定义、范围、边界情况一次说清,适当重复目标防止上下文漂移。3️⃣ 复杂任务不固定分工——使用 Ultra 模式的 64 个子 Agent 做动态搜索,并设置独立审查 Agent 审查每个子 Agent 的输出。4️⃣ 验收标准硬度大于一切——不是因为看起来对了就通过,而是严格对照预定义的可验证标准。这套技巧不仅适用于数学证明,还适用于任何需要长链推理和可验证输出的任务——已有人用它来重构自己的 Coding Agent Prompt 设计。

https://www.qbitai.com/2026/07/447873.html

🔥 4. 魔芯 MoWorld 世界模型:50FPS 实时生成、成本打掉 70%,纯国产 NPU 全栈闭环 — 1300 pts

魔芯科技联合浙江大学潘云鹤院士、华为发布 MoWorld——首个全栈基于国产 NPU 的实时交互世界模型。推理速度 >50FPS,部署成本仅同规模 GPU 方案的 30%。支持 2000 帧超长训练和推理、6 自由度相机控制(WASD 实时交互)、1080P+ 分辨率。已获亿元美金融资,此前已获华为哈勃和联想投资。技术突破:数据层面构建了含相机轨迹和空间深度的三维数据体系;训练层面结合国产 NPU 引入超密集注意力并行;推理层面通过流水线执行和动态量化实现实时部署。应用场景覆盖游戏互动、具身智能训练、影视预演和数字孪生。这是全球首次用纯国产 NPU 跑通了世界模型的训推全链路——对国产算力生态有重大标志意义。

https://www.qbitai.com/2026/07/446411.html

🔥 5. GPT-5.6 数学证明的技术复盘:64 个子 Agent 协调、动态搜索 + 独立审查—多 Agent 架构的最佳实践 — 1200 pts

GPT-5.6 数学证明的工程架构值得行业借鉴。64 个子 Agent 并非简单"把数学题拆分给 64 个模型执行",而是采用了更高级的协调策略:动态搜索 + 独立审查。Ultra 模式不是固定的"你负责 A,你负责 B",而是允许子 Agent 探索不同的证明路径,互相验证和补充。独立审查 Agent 负责检查每个子 Agent 的输出质量和逻辑正确性。这对应于翁荔在 Harness 自进化中提出的"Weakness Mining → Hypothesis Formation → Implementation → Validation"循环——64 个子 Agent 相当于分散搜索的专家系统,审查 Agent 相当于验证器。当模型能力足够强时,限制 Agent 自由的"固定分工"不如"动态搜索 + 自动验证"有效。 这与 ACL 最佳论文(固定规则推理中 CoT 过长会跑偏)的发现形成互补——数学证明和层级规则推理需要不同的 Agent 架构。

https://www.qbitai.com/2026/07/447873.html

🔥 6. 曙光 8000 的技术意义:从调度率到工程化能力——国产算力的"十万卡时刻" — 1100 pts

曙光 8000 的落成不仅是工程成就,更是国产算力生态的里程碑。关键不在"十万张卡"本身,而在于解决了一系列指数级复杂度的工程问题:万卡级集群中网络延迟还在可接受范围,但十万卡级网络拓扑必须在设计阶段就考虑——scaleFabric 类 IB 原生 RDMA 解决了大规模互联瓶颈。存储系统面临的压力也完全不在一个量级——ParaStor 在 IO500 双榜夺冠的数据印证了解决方案的有效性。散热系统从风冷走向液冷是必然选择。真正可贵的是 300+ 应用程序已经跑通——不是 PPT 参数,而是真实业务验证。 更关键的是已启动第二套建设——正在从"一次性的示范工程"变成"可复制的标准方案"。郑州的区位选择也极具战略意味——连接东西部算力的枢纽节点。

https://www.qbitai.com/2026/07/447902.html

🔥 7. MoWorld 的世界模型哲学:实时性 > 画面精美——产业世界模型的核心指标 — 1000 pts

MoWorld 的技术路线选择体现了一个重要的产业判断:世界模型的实时性比画面精美更重要。过去一年的世界模型竞赛中,大多数学术团队在追逐"生成画面有多逼真",但 MoWorld 选择了另一条路——"交互有多快"(>50FPS vs 大多模型的 <10FPS)。这背后是对世界模型定义的再思考:世界模型不是更好的视频生成模型,而是一个可交互的空间模拟引擎。机器人决策需要的不是一段好看的视频,而是一个能实时响应、可推演未来的环境模拟器。将推理成本降到同规模 GPU 的 30%,则使这一路线具备了商业可行性。四个应用场景(游戏、具身训练、影视、数字孪生)也验证了"实时交互"的产业价值——能实时互动和不能实时互动,是两种完全不同的产品

https://www.qbitai.com/2026/07/446411.html

🔥 8. 本周回顾:7 月第二周的"中国 AI 开源风暴"——从蚂蚁灵波四弹到曙光十万卡 — 1000 pts

7 月第二周(7.6-7.11)的完整图景:
星期一(6日):Meta 卖 GPU、ICML 杰出论文、OpenSquilla 多模型协作
星期二(7日):Claude J-space 发现、DeepSeek 秘密造芯、蚂蚁灵波 VLA 2.0
星期三(8日):高德数据基座、ACL 最佳论文、翁荔 Harness 自进化
星期四(9日):OpenAI 安全负责人离职、LingBot-Video/World/VA 三线开源、GPT-Live
星期五(10日):GPT-5.6 正式上线、MoleculeOS、歌歌 AI 华语音乐
星期六(11日):GPT-5.6 一小时解 50 年猜想、曙光十万卡落成、MoWorld 50FPS

三个核心主题贯穿全周:中国 AI 开源全面加速(蚂蚁灵波四弹、高德、MoleculeOS、MoWorld)、AI 基础设施体系化(十万卡集群、DeepSeek 造芯、GPT-5.6 Ultra 模式)、物理世界落地深入(J-space 理论突破、数学猜想证明、华语音乐生成)。

→ 综合本周报道

🔥 9. GPT-5.6 数学证明的行业启示:前沿模型的"可用性"正在被重新定义 — 900 pts

GPT-5.6 一小时解开 50 年数学猜想的背后,是 GPT-5.6 Sol + Ultra 模式 + 64 子 Agent 协调 + 精心设计的 Prompt 四个因素的合力。这说明了前沿模型正在经历一个关键的转变:模型本身的能力(参数、架构)和模型被使用的方式(Agent 编排、Prompt 设计)正在变得同等重要。同样的 GPT-5.6 Sol,如果只是简单地在对话框中问"能证明循环双覆盖猜想吗"——大概率不会有好的结果。但通过 64 个子 Agent 协调 + 严格定义的验收标准 + 独立审查机制,它就完成了一项数学突破。"模型能力"+"Agent 架构"+"Prompt 设计"正在成为前沿模型使用的新三要素。

https://www.qbitai.com/2026/07/447873.html

🔥 10. 国产算力产业链的"中国星期三":曙光 8000 + MoWorld 纯国产 NPU + DeepSeek 自研芯片 — 800 pts

7 月 11 日的曙光 8000 十万卡 + MoWorld 纯国产 NPU + 前天 DeepSeek 造芯,构成了一条完整的国产算力产业链全景。芯片层:DeepSeek 自研推理芯片(从头设计);加速卡层:海光等国产加速卡(曙光 8000 主力);NPU 推理层:魔芯 MoWorld 用纯国产 NPU 跑通世界模型训推闭环(华为生态);集群层:曙光 8000 十万卡(超智融合全精度覆盖);应用层:300+ 应用已跑通。这个链条的每个环节都达到或接近国际同类产品水平,且正在形成协同。中国 AI 算力的"脱钩能力"正在从概念走向实质。

→ 综合本周报道

📌 今日趋势一览

趋势

🔥热度

GPT-5.6 一小时解 50 年数学猜想(64 子 Agent 并行)

🔥🔥🔥🔥🔥

中国首个十万卡集群曙光 8000 落成

🔥🔥🔥🔥🔥

MoWorld 世界模型 50FPS + 成本降 70%(纯国产 NPU)

🔥🔥🔥🔥🔥

OpenAI 公开数学证明 Prompt 模板

🔥🔥🔥🔥

64 子 Agent 协调架构的最佳实践

🔥🔥🔥🔥

国产算力全产业链成型(芯片+NPU+集群+应用)

🔥🔥🔥🔥

多 Agent 动态搜索 + 独立审查的新范式

🔥🔥🔥

世界模型产业化的"实时性 > 画质"判断

🔥🔥🔥

前沿模型使用的"新三要素"

🔥🔥🔥

7 月第二周中国 AI 开源风暴回顾

🔥🔥🔥


原文链接 https://www.yijunzhao.cn/archives/ai-agents-kai-yuan-llm-jian-bao-2026nian-7yue-11ri

欢迎访问 小易撩挨踢

https://www.yijunzhao.cn/


评论