易君召
易君召
发布于 2026-07-09 / 30 阅读
0
0

AI Agents & 开源 LLM 简报 (2026年7月9日)

#AI

🔥 1. OpenAI 首席未来学家 Joshua Achiam 宣布离职:安全路线上又一个核心人物离开 — 1500 pts

OpenAI 首席未来学家 Joshua Achiam 在 X 上宣布离职,7 月 24 日正式离开这家工作了 9 年的公司。他是 OpenAI 安全与使命线的核心人物之一,2017 年以实习生身份加入,早期做 AI 安全研究,后领导 Mission Alignment 团队负责"确保 AGI 造福全人类"的使命。今年 2 月该团队解散后转任首席未来学家,仅 5 个月后即宣布离开。离职原因未公开,但他表示"不是因某个具体事件,而是思考了很长时间"。他最有戏剧性的一幕是 2018 年当面打断马斯克指出"在特斯拉开发 AGI 可能会牺牲安全",马斯克当场骂他"蠢驴"——后来 Anthropic CEO Dario Amodei 送了他一个刻着"永远不要停止当那个 jackass"的金色奖杯。这是 OpenAI 安全离职链上的最新名字——此前 Ilya Sutskever、Jan Leike、Miles Brundage 等安全负责人已先后离开。

https://www.qbitai.com/2026/07/446658.html

🔥 2. 蚂蚁灵波开源全球首个面向具身的 MoE 视频基模 LingBot-Video:30B 参数仅激活 3B — 1300 pts

蚂蚁灵波开源 LingBot-Video,全球首个面向具身智能的 MoE 视频基础模型。30B 总参数但仅激活 3B,7 万小时具身相关视频数据训练。与通用视频模型的本质区别在于评价体系完全不同——通用模型追求画质和运镜,而具身视频模型的核心是是否符合物理规律。机械臂抓零件时末端执行器与工件的相对关系必须在连续帧里稳定保持。团队引入 MoE 架构和多维奖励系统优化物理合理性和任务完成度,在 RBench 上超越通用标杆模型。这是一个关键判断:机器人训练需要自己的"物理视频"而非"好看视频"——通用视频模型里的穿模和物体凭空消失对短视频是瑕疵,对机器人训练则是教错误的世界规律。

https://www.qbitai.com/2026/07/446568.html

🔥 3. 蚂蚁灵波 LingBot-World 2.0 发布:世界模型首次实现小时级实时生成,720p/60fps 无限交互 — 1300 pts

蚂蚁灵波发布 LingBot-World 2.0(又名 LingBot-World-Infinity),世界模型首次实现小时级实时生成。支持 720p/60fps 高清实时输出、攻击/射箭/施法/跳跃/滑翔等多类交互动作——不是生成一段视频,是生成一个可实时交互的世界。引入 Agent 机制:Pilot Agent 负责规划执行角色行为,Director Agent 在场景推进中实时提出新事件——让世界从"可观看"走向"可持续互动"。多位用户可同时进入同一个持续运行的世界共同探索互动。一小时不间断压力测试中画面始终保持清晰。这对游戏、影视预演、数字孪生和机器人训练场景有重大意义。加上同一日发布的 LingBot-Video,蚂蚁灵波在同一天开源了 VLA + 世界模型 + 视频物理引擎三条产品线——形成了具身智能的全栈大脑布局。

https://www.qbitai.com/2026/07/446548.html

🔥 4. GPT-Live 发布:全双工语音交互,同声传译一夜失业 — 1200 pts

OpenAI 发布 GPT-Live,语音交互质的飞跃。核心改进:全双工架构——边说边听,在一秒内多次判断互动策略,天然支持实时翻译等极低延迟场景;接入 GPT-5.5 推理能力;支持深度任务委托——前台 GPT-Live 负责连续语音交互,后台委托 GPT-5.5 处理联网搜索和复杂推理。实时翻译 demo 中老太太现场抬杠的交互效果看傻全网。目前每周有 1.5 亿人在用 ChatGPT 对话,GPT-Live 将语音从"阉割模式"变成了全套能力的统一交互入口同声传译领域可能因此被彻底重塑——一句话说完、瞬间翻译、几乎没有延迟。这标志着语音交互从"三个模型接力跑"(ASR→LLM→TTS)正式进入了端到端全双工时代

https://www.qbitai.com/2026/07/446425.html

🔥 5. RoboDojo 具身智能"高考":人类 100 分,最强模型仅 12.8 分 — 1200 pts

RoboDojo 发布统一的仿真+真实世界机器人操作评测基准,被称作具身评测界的"珠峰"。42 个仿真任务 + 18 个真实机器人任务 + 30 个主流机器人策略同台竞技。结果极为严峻:仿真平均成功率仅 8.80%,真实世界最好模型仅 12.8%。而人类专家:仿真 76.03%,真实世界 100%。RoboDojo 将能力拆为五维:泛化、记忆、精细操作、长程执行、开放语义理解。精细操作任务中稍微偏一点就会失败;长程任务中每一步都引入误差且累积到最后。这不仅是一个 benchmark,更是对"机器人基础模型已经很强"的集体幻觉的一记清醒剂——机器人从"能做 Demo"到"能做稳定可靠的工作",还有漫长距离。

https://www.qbitai.com/2026/07/446363.html

🔥 6. 原力灵机 DM0.5 发布:15 万小时数据 + Zero-Shot 提升 31%,定位"开放世界通用具身基础模型" — 1200 pts

原力灵机开发者大会发布新一代具身基础模型 DM0.5,定位为"面向开放世界的通用具身基础模型"。4B 参数(DM0 翻倍),数据量 15 万小时(增加 400%):5 万小时真机操作数据 + 10 万小时 Ego(第一视角)数据 + 100 万平米场景重建数据。三大架构创新:上下文抽象层(原生支持最长 60 秒记忆)、具身思维链(先规划再执行,内部拆解大目标为子任务)、轨迹对齐层(从"对点"走向"对齐")。结果:Zero-Shot 导航成功率提升 31%、Few-shot 提升 45%、微调后提升 20%。H100 推理延迟仅 50ms,4090 上 90ms。在四大公开评测中全面超越 SOTA

https://www.qbitai.com/2026/07/447508.html

🔥 7. Ant Group 同日三线开源:VLA + 世界模型 + 视频引擎——具身智能的"全栈开源"策略 — 1100 pts

7 月 9 日蚂蚁灵波密集发布三款开源模型:LingBot-VLA 2.0(跨 20 种机器人构型的通用大脑)、LingBot-World 2.0(小时级实时交互世界模型)、LingBot-Video(全球首个面向具身的 MoE 视频基模)。三款模型的组合拳形成了清晰的逻辑:用 VLA 做执行(机械臂实际干活)→用世界模型做预测(在虚拟世界中预演和训练)→用视频引擎做物理规律学习(生成符合物理规律的训练数据)。这三者构成了机器人从学习、训练到执行的全链路闭环。同日开源意味着蚂蚁灵波正在构建的不仅是单点技术能力,而是具身智能的完整基础设施层。结合高德 Phys AI Data(数据基座)和通用模型生态,一个围绕具身智能的中国开源生态正在快速成型。

https://www.qbitai.com/2026/07/446548.html

🔥 8. 具身智能"高考"启示:数据飞轮转不起来是行业最大阻碍——但规模 + 架构 + 场景可破局 — 1000 pts

DM0.5 和 RoboDojo 同日发布可以提供交叉验证。RoboDojo 的数据说明当前差距仍然巨大(12.8% vs 100%),DM0.5 的 31% Zero-Shot 提升则说明架构和数据升级正在逐步弥合差距。原力灵机与物流机器人公司 Atomix 合并补上了"真实场景"侧的关键拼图——"把采具身数据这件事,从被动采集型数据,变成真实业务里持续产生的场景型数据"。DM0.5 的关键差异化在于数据飞轮设计:不是一次性训练完就结束,而是部署后在真实场景中产生的操作数据自动回流到训练管线中持续优化模型。翁荔提出的"自进化从 Harness 开始"和 AReaL 2.0 的"Agent 越用越强"在这里以具身智能的形式得到了验证。

https://www.qbitai.com/2026/07/447508.html

🔥 9. HF Mirror 发布《Data for Agents》与 Native-speed vLLM 后端:Agent 数据工程走入主流 — 800 pts

HF Mirror 发布两篇重要博文。《Data for Agents》 系统讨论了 Agent 的数据需求与通用模型的不同——Agent 需要轨迹数据(工具调用、中间步骤、错误恢复)而非单纯的问答对,高质量 Agent 数据需要包含成功和失败两种轨迹Native-speed vLLM transformers modeling backend 则是将 vLLM 推理引擎与 HuggingFace Transformers 模型定义层深度融合——让开发者可以用 transformers API 获得 vLLM 级别的推理速度。这两篇博文标志着 HF Mirror 正在将 Agent 数据工程从"手工活"变成标准化流程,并进一步降低 Agent 部署的推理成本。

https://hf-mirror.com/blog/...

🔥 10. 具身智能的"中国星期三"——同一个中国科技公司在同一天开源全球首个面向具身的 MoE 视频模型和小时级世界模型 — 900 pts

7 月 9 日值得被标记为"具身智能的中国星期三"。蚂蚁灵波在同一天开源了三款全球首个级别的模型(VLA 2.0、World 2.0、Video),原力灵机发布了 DM0.5(15 万小时数据全面超越 SOTA),RoboDojo 发布了具身智能参考基准(人类 100 分 vs 模型 12.8 分),三件事共同指向一个信号:具身智能正在从"单点突破"进入"系统性竞赛"阶段。数据、模型、评测、场景——所有环节都开始有标准化方案。这对于行业的意义可能比任何单一模型发布都更重要:当基础设施层足够成熟,应用层才能真正繁荣

→ 综合

📌 今日趋势一览

趋势

🔥热度

OpenAI 首席未来学家离职(安全线核心再出走)

🔥🔥🔥🔥🔥

蚂蚁灵波同日三线开源(VLA+World+Video)

🔥🔥🔥🔥🔥

GPT-Live 全双工语音(同传一夜失业)

🔥🔥🔥🔥🔥

RoboDojo:人类 100 分 vs 最强模型 12.8 分

🔥🔥🔥🔥

原力灵机 DM0.5(15 万小时数据,Zero-Shot+31%)

🔥🔥🔥🔥

全球首个面向具身的 MoE 视频基模(LingBot-Video)

🔥🔥🔥🔥

世界模型首次小时级实时生成(LingBot-World 2.0)

🔥🔥🔥

具身智能全栈开源策略正在形成

🔥🔥🔥

HF Mirror Data for Agents + vLLM 原生后端

🔥🔥🔥

具身智能系统性竞赛时代到来

🔥🔥🔥


原文链接 https://www.yijunzhao.cn/archives/ai-agents-kai-yuan-llm-jian-bao-2026nian-7yue-9ri

欢迎访问 小易撩挨踢

https://www.yijunzhao.cn/


评论