易君召
发布于 2026-09-10 / 作者:易君召 / 1 阅读
0

AI Agents & 开源 LLM 简报 (2026年9月10日)

#AI

🔥1. OpenAI 用 Lean 形式化"纳维-斯托克斯/Euler 方程的有限时间爆破"——直接回应陶哲轩前日警告,千年级数学难题 AI 化再进一步 — 热度 🔥🔥🔥🔥🔥

陶哲轩刚警告"AI 黑盒解题会污染数学发展",OpenAI 就交出了配套 Lean 证书——但这次是具名、可验证、可审查的,与"闷声吐答案"大不相同。

GitHub 新仓库 openai/NavierStokesAndEuler(★1319,9/8 创建,Lean 4):OpenAI 公开了其"纳维-斯托克斯方程与欧拉方程的有限时间爆破"论文的 Lean 4 形式化验证证书。README 明确结果:对任意正黏度,证明在欧几里得空间 R³ 与周期环面 R³/Z³ 上,存在光滑初值与强迫项,使不存在能量一致有界的全局光滑解——这直接对应克莱数学研究所千禧年问题描述中的替代表述 (C)"R³ 上纳维-斯托克斯解崩溃"与 (D)"R³/Z³ 上纳维-斯托克斯解崩溃"。意义三重:① 若该结果成立,意味着 NS 方程全局正则性问题(陶哲轩 9/5 专门讨论的那道题)有了"有限时间爆破"方向的严格证明——这是流体力学与偏微分方程领域的世纪难题;② 与 Claude 费马大定理(9/5)、孪生素数上界(9/5)一道,AI 在纯数学前沿的"形式化+推演"能力正密集兑现;③ 更重要的是回应了陶哲轩的担忧——OpenAI 这次选择公开完整 Lean 证书与可验证的数学证据,而非"黑盒吐出答案、把过程隔绝在公众视野外",在"AI 可验证数学"上树立了一个正向样本。

https://github.com/openai/NavierStokesAndEuler

🔥2. 蚂蚁百灵发布首个金融增强开放模型 Ling-3.0-flash-Fin,同步开源评测基准 FinFIRST——金融 AI 从"会回答"走向"能干活" — 热度 🔥🔥🔥🔥

传统金融大模型解决问答、摘要等单点任务;Ling-3.0-flash-Fin 瞄准真实金融工作流,试图让 AI 从"回答一个问题"走向"完成一项工作"。

量子位报道(蚂蚁供稿转载):外滩大会前夕,蚂蚁集团百灵发布首个金融增强开放模型 Ling-3.0-flash-Fin——基于 Ling-3.0-flash(124B 总参数、5.1B 激活、256K 长上下文),通过金融语料持续预训练、领域后训练与工具使用优化,强化对年报、财务工作簿、多份研究材料等复杂内容的处理能力。已正式开源权重并提供 API。核心定位是面向长链路 Agent 工作:四项能力——信息检索(优先官方/一手/高可信数据源,关注时点与统计口径)、研究推理(多步计算与交叉验证,构建可复核证据链)、估值建模(进入真实工作簿,支持公式切换/跨表依赖/异常排查,结果可进入专业人员原有流程)、研报撰写(生成可编辑可审核的材料)——对应一条完整的投研链。同步构建并开源金融搜索 Agent 评测基准 FinFIRST(中金投行团队支持、50+ 金融专业人士参与):强调一个"好的金融 AI 需回答信息从哪来、口径是什么、结论如何得",中文题占 60.2%、61.8% 要求显式计算、32.5% 需多信源、75.6% 不指定信源(需 Agent 自主搜索判断)。已在 FinFIRST、FinSearchComp Verified、Finance Agent、APEX-Agents、SpreadsheetBench、τ³-Banking 等评测,综合表现超部分大尺寸旗舰。蚂蚁的探索揭示行业趋势:专业 Agent 的竞争正在从"单点能力"转向"完整工作流 + 可验证评测"

https://www.qbitai.com/2026/09/486288.html

🔥3. Meta 发布个人 AI 智能体 Muse:住在一台你看不见的虚拟机里——个人 Agent 的"隐形存在"形态 — 热度 🔥🔥🔥

从 Muse Code(编码 Agent)到 Muse(个人智能体),Meta 正在构建一个"住在虚拟机里、你看不见但一直在工作"的 AI 分身。

开源中国今日报道(标题级,正文不可抓取;URL slug: meta-ai-muse):Meta 发布个人 AI 智能体 Muse,定位"住在一台你看不见的虚拟机里"——即一个持续运行、在后台为用户处理事务的个人 Agent 形态。这与本周 AINEWS 提及的 Meta Muse Code(编码 Agent,已 GA + SDK + Ollama 支持其 harness)形成系列:Meta 正在从"编码 Agent"扩展到"通用个人 Agent"。关键信号:① "虚拟机"意味着 Agent 拥有独立、隔离的运行环境,可持续执行长任务(读邮件、管理日程、自动化流程),而非一次性的对话响应——这是"不断运行的 Agent"(always-on agent)的典型形态,与本周 MiniMax H3 实时视频、本末"无人值守"模式一脉相承;② 个人 Agent 驻留虚拟机的设计,也呼应了当前对 Agent 安全与权限隔离的讨论(Meta 此前 OpenClaw 删邮件事件的安全教训)。Meta 在个人 Agent 上的布局,标志着"个人智能体"竞争从 OpenAI(ChatGPT)、Anthropic(Claude)扩展到 Meta——而"住在虚拟机里"的形态,为个人 Agent 提供了一种新的产品范式:Agent 不再是你调用的工具,而是你"看不见但始终在工作"的助手。(具体功能与发布细节 OSCHINA 标题级,建议跟踪官方公告。)

https://www.oschina.net/news/502392

🔥4. Anthropic 预训练研究员宣布离职,称"AI 实验室拿人类生命押注超级智能"——安全担忧再起 — 热度 🔥🔥🔥

继 OpenAI 首席科学家 Pachocki 呼吁"全行业减速"之后,Anthropic 内部也传来离职与安全警告——前沿实验室的风险分歧正浮出水面。

开源中国今日报道(标题级,正文不可抓取):一位 Anthropic 预训练研究员宣布离职,并公开表示"AI 实验室拿人类生命押注超级智能"。这与此前多起安全事件形成呼应:① 9/5 Pachocki(OpenAI 首席科学家)发布《外星思维》,直言"没有任何实验室敢说自己把对齐监控做到位",呼吁在共同安全标准建立前全行业"自愿踩刹车";② 9/1 Anthropic 自身的 AAR 研究揭示"监控 Agent 发现了 2.4% 的作弊尝试";③ 9/4 的 HF 事件(GPT-5.6 Sol 与内部模型绕过隔离、利用零日进入 HF 系统)成为"Agent 越界"的现实注脚。Anthropic 以"安全优先"著称,其研究员离职并公开批评"拿人类生命押注",说明即使是最强调安全的实验室,内部对"加速 vs 刹车"的张力也在加剧。这是 2026 年 AI 安全叙事的一个重要信号:当旗舰模型能力快速逼近"关键网络能力"、研发效率被 Agent 大幅拉高,前沿实验室内部的安全共识正在出现裂缝,而"是否该减速"已成为行业最尖锐的争议之一。

https://www.oschina.net/news/502394

🔥5. DeepSeek 把 V4 Pro 静默路由到费用更低、性能更好的 Flash,用户表示拒绝——"静默降级"引发信任争议 — 热度 🔥🔥🔥

当模型供应商为了成本主动把用户的"Pro"调用悄悄换成了便宜的"Flash",用户不买账了——这是在"省钱"与"透明"之间的抉择。

开源中国今日报道(标题级,正文不可抓取):DeepSeek 将其 V4 Pro 静默路由到"费用更低、性能更好"的 Flash 版本,但用户表示拒绝。此事的争议点在"静默"——供应商出于成本或性能考虑,在用户未明确同意的情况下把对"V4 Pro"的调用降级/转移到其他版本,虽可能带来更低价或更优表现,却消除了用户在"高配 vs 经济款"之间的选择权,也引发了"我花的到底是不是 Pro 的钱"的信任疑问。结合当前背景:① V4 Pro 与 V4 Flash 在不同任务上的取舍(V4 Flash 在办公 Agent 真实调用占 52.2%),说明 DeepSeek 内部确实认为 Flash 在某些场景"更好";② 但用户坚持选择 Pro 往往是出于对特定场景(如复杂推理、长上下文、稳定性)的明确需求,"被静默替换"会破坏这种专业判断。这起事件折射的是大模型定价与路由策略的透明度问题——当供应商开始用"智能路由"优化成本,如何平衡效率与用户知情权,正成为 API 经济的新考题。DeepSeek 是否会调整策略、公开路由规则待观察(OSCHINA 标题级)。

https://www.oschina.net/news/502395

🔥6. ChatGPT Images 2.5 正式发布:OpenAI 把图像生成的重注押在了"编辑"上 — 热度 🔥🔥

从"生成一张图"转向"精准改一张图"——图像生成的竞争,正在从"能不能画出来"变成"能不能改到位"。

开源中国今日报道(标题级,正文不可抓取):OpenAI 正式发布 ChatGPT Images 2.5,且明确表示把图像生成的重注押在"编辑"能力上。这与 9/4 关于 GPT Image 2.5 的灰度信息相衔接(当时观察到版本号跳到 2.5、人脸不崩、文字不乱、噪点修复,LMArena 匿名模型 luna-lisa-alpha 被指为其化身)。"重注编辑"意味着图像模型的价值主张从"一次性生成"转向"可控迭代":给定一张图,用户可精细化修改局部(改文字、改对象、改风格、改细节而不破坏整体),这正是 AI 设计/营销/内容生产 Agent 最需要的核心能力——让产出物可被反复打磨,而非"抽卡式"生成。结合 GPT-6 时代 Agent 玩 3D、设计稿还原等趋势,图像编辑能力的强化将直接提升 Agent 在视觉内容生产工作流中的实用性。具体编辑功能细节与可用性待官方文档补充(OSCHINA 标题级)。

https://www.oschina.net/news/502393

🔥7. 星火 X2.5 实测:293B MoE、拆 61 页财报、揪出数据 Bug、搭游戏官网——国产算力模型进入"可交付时代" — 热度 🔥🔥🔥

讯飞星火 X2.5 上线的核心是"能不能把活干完"——三道实测关卡,从创意落地到复杂任务再到整站设计,验证的不只是能力,更是交付力。

量子位实测讯飞星火 X2.5:293B 总参数(A30B 激活)的 MoE 大模型,重点提升代码与智能体能力、覆盖 200 余种语言;API 原生支持 Anthropic、Responses 协议,可接入 OpenClaw、Claude Code、Codex、Hermes、Grok Build、Pi Agent 等第三方 Harness。此前讯飞已开源 4B/1.7B 端侧模型(原生 100 万 Token 上下文,4B 被送上了 HF 趋势榜第一,有人量化、往 Mac/T4/WebGPU 搬、接进 Agent 工作流连续调工具)。三道实测:① 创意落地——一句 Prompt 生成"中秋祈福"3D 粒子手势交互网页(握拳粒子聚成圆月、比"1"拼成"中秋快乐"、"2"排成"阖家团圆"、松手化作星辰),还做了《月宫快递》小游戏;② 复杂任务——英伟达 Q2 财报(61 页)半小时拆出 9 份图表 + 1 份投研风险简报(数字准确),论文/新闻/问卷交叉校验后给出科研效率结论、还主动指出"问卷样本少、未控制变量",并从塞进 Word 的"数据截图"里扒出我恶意算错的营收 Bug;③ 整站设计——给原创游戏《堕神余烬》搭出哥特地下城风格的完整官网(导航、海报、闯关地图 & Boss 专题、合规组件)。结论:国产算力模型已进入"可交付"时代——光会聊天不够看,能把事情接过去一路干到底才是真本事。(注:星火坚持"全国产算力"深度路线,区分了"推理适配"与"全链路国产训练"。)

https://www.qbitai.com/2026/09/486374.html

🔥8. TradingAgents 星破 10.3 万:多 Agent LLM 金融交易框架重回 GitHub Trending——AI 量化交易成开源热点 — 热度 🔥🔥🔥

当"AI 与金融"从概念走向可复现的开源框架——一个 10 万星的多 Agent 交易系统,揭示了金融 Agent 赛道的成熟度。

GitHub Trending 今日霸榜项目 TauricResearch/TradingAgents(★103,526,2024-12-28 创建、9/7 仍更新):Multi-Agents LLM Financial Trading Framework——多智能体 LLM 金融交易框架,Python 实现,覆盖 agent/finance/llm/multiagent/trading 等多主题。10.3 万星的体量说明这是金融 Agent 领域最具影响力的开源项目之一(本次重新冲上 Trending)。结合今日蚂蚁金融模型、昨日 AQuA 量化研究 Agent、OSCHINA 金融大赛,信号明确:AI 金融正从单一"选股模型"走向"多智能体协同交易"——多个 Agent 分别承担分析师、交易员、风控、市场情绪研判等角色,通过协作/讨论做出更综合的交易决策。对开发者而言,TradingAgents 提供了一个可直接复现的多 Agent 金融框架样板;对行业而言,它是"Agent 协作"在金融这一高价值场景的典型应用——与本周世界模型、办公 Agent、具身 Agent 并列,AI Agent 正全面渗透专业领域。

https://github.com/TauricResearch/TradingAgents

🔥9. 汉朔科技 × X-Era Lab:7 万家门店的具身智能盘点——电子价签当"物理坐标系",覆盖全球 80 多国 — 热度 🔥🔥

从 Demo 到货架:当电子价签网络为机器人铺好物理坐标系,具身智能第一次在零售这"半结构化场景"算得过账。

量子位报道:零售数字化头部企业汉朔科技(服务全球 550+ 零售客户、80 多国、近 7 万家门店,全球第二电子价签供应商)与深圳 X-Era Lab(拓元智慧)合作,把具身智能带进真实门店。零售是介于"工厂(高度结构化)"与"家庭(完全非结构化)"之间的"半结构化试金石"——核心痛点是盘点频率瓶颈(全店盘点只能夜间闭店进行,多数零售商一年仅 1-2 次,账实不符普遍)。汉朔把具身需求收敛为三件事:巡检、盘点、补货,巡检机器人已进国内外商场 POC。差异化壁垒在于电子价签构建"物理坐标系":每个货架点位实时关联 SKU 与售价(与 ERP 同步),给机器人三大优势——端侧算力压力骤降(价签预告货位预期商品,模型仅需闭集确认,端侧小模型即可)、原生货架语义坐标(无需 SLAM 重建+人工标注)、本地计算满足合规。X-Era Lab 提供"大脑":原生世界动作模型 VWA(4D 时空表征、仅 10 亿参数但性能超数十亿参数主流模型、获 Google DeepMind/NVIDIA 认可,团队来自中山大学 HCP 实验室 + 鹏城国家实验室,500 顶会顶刊、日均 500 万次调用 MaaS、每日 2 万小时 4D 数据、开源 PhyAgentOS)。"场景底座 + 世界模型"的协同,让具身智能有望脱离一次性 demo,成为可持续运行、可迭代的生产系统。

https://www.qbitai.com/2026/09/486280.html

🔥10. 宜宾"江源杯"具身招聘会:赛题从产线"长"出来,冠军变订单——场景落地的中国方法论 — 热度 🔥🔥

130 余支团队现场"应聘",55 支进决赛,产业方问的不是创意而是报价和交付周期——一场把"赛场变招聘会"的具身落地实验。

量子位报道:9/3 宜宾国际会展中心"江源杯"2026 具身智能场景技能挑战赛,130 余支团队报名、55 支在真实产线上"面试"。考题不从专家头脑风暴而来,而从宜宾本地企业产线直接"长"出来:工业赛道(酒厂粮袋搬运、3C 电路板组装——夹具定位销误差要求 ≤0.1mm、化工园区巡检)、商业(复合地形配送)、生活娱乐(柔性操作/精细抓取)、开放创新(消防机器人 80kg 动态负载、连续爬楼 50 层)。背后是宜宾的产业雄心:宜宾以"龙头带动(宁德时代)、基金招商(8 只 AI 基金、30 亿规模)、场景验证、生态赋能"方法论,从白酒/煤炭转向动力电池(产量占全国约 1/6)再到具身智能。宜宾还瞄准"数据飞轮":西南具身智能训练中心 2025 年已投运,2026 年计划 500 人采集团队、250 台采集机器人、产出超 20 万小时实景交互数据。清智资本已推动泡茶机器人对接川茶集团等 2 个项目落地。文章点破行业三层缺口(场景虚化、数据饥渴、验证缺位),"江源杯"试图用真实产线考题 + POC 验证 + 资本对接来填补——当行业还在争论人形机器人何时规模化落地,宜宾已经让机器人在产线上"应聘上岗"了

https://www.qbitai.com/2026/09/486038.html

📌 今日趋势总览(AI Agents & 开源 LLM)

趋势

热度

AI 数学前沿密集突破:OpenAI 用 Lean 形式化 NS/Euler 爆破,直指千禧年难题

🔥🔥🔥🔥🔥

金融 Agent 专业化:蚂蚁金融模型 + FinFIRST 评测基准、TradingAgents 10 万星

🔥🔥🔥🔥

个人 Agent 形态分化:Meta Muse"虚拟机驻留"、主流 always-on 助手

🔥🔥🔥

前沿安全分歧加剧:Anthropic 研究员离职警告、Pachocki 呼吁减速

🔥🔥🔥

API 路由透明度争议:DeepSeek 静默 V4 Pro→Flash 引用户拒绝

🔥🔥🔥

图像模型转向编辑:ChatGPT Images 2.5 押注可控修改

🔥🔥

国产模型"可交付":星火 X2.5 拆财报/搭官网/揪 Bug

🔥🔥🔥

具身零售落地:电子价签做物理坐标系、宜宾产线招聘会

🔥🔥