易君召
发布于 2026-08-09 / 作者:易君召 / 3 阅读
0

AI Agents & 开源 LLM 简报 (2026年8月9日)

#AI

🔥1. Prime Agent 开源发布:能自我改进的编程 Agent,ARC-AGI 3 超越人类专家基线 — 热度 🔥🔥🔥🔥🔥

Prime Intellect 正式开源 Prime Agent——一款基于"递归语言模型(RLM)"范式的编码与研究智能体,今日登上 GitHub Trending 榜首,star 已逼近 1 万。

Prime Agent 的核心是两个抽象:其一,把上下文当作"变量"(prompt-as-a-variable),把递归子 Agent 当作可编程函数调用,全部运行在持久化 REPL 环境里;其二,引入"持续化 Harness",把补充提示、记忆、技能描述作为持久状态保存,Agent 可通过 /refine 指令用有证据支撑的小更新不断改进自身,且不触碰不可变的基础系统提示词,快照可回滚。技术上内置持久化 IPython 作为模型工具,rlm(...) 可派生真实子 Agent 并行/后台工作;daemon 模式让会话在终端断开后继续运行并可重新挂接;Agent 之间还能直接通信、互相编排。安装只需一行命令。它与 PRIME-RL、Verifiers 等开源组件联动,被视为"Agent 学会自己改进自己"路线上最完整的开源实现之一。官方同时警告:它能以你的权限执行模型生成的代码,并非安全沙箱。

https://github.com/PrimeIntellect-ai/prime-agent

🔥2. 亚马逊也烧不起 Claude:一个页面填充任务花了 180 万美元,超预算 860% — 热度 🔥🔥🔥🔥🔥

Agent 用量爆炸正在成为科技公司的噩梦。年收入超 7000 亿美元的亚马逊,用 Claude Sonnet 给网站填充作者信息,竟烧掉 180 万美元、超出预算 860%,且 5 个月后才被发现,最终还没部署成功。

据亚马逊员工透露,失控的原因是 Agent 在深夜日夜不休地反复重试——没有任何人警告它"Please wait before trying again"。按 Claude Sonnet 公开价估算,180 万美元最多可能烧掉 6000 亿 token,相当于 GPT-3 整个训练语料的两倍。这暴露出普遍困境:AI 相关成本几乎无法透明核算。讽刺的是,亚马逊仍在豪赌 AI:CEO 宣布 2026 年资本开支约 2200 亿美元,Q2 财报显示 AWS 净销售额 422 亿美元、同比增长 37%,贡献约 60% 的营业利润;同时已裁员约 3 万人,并计划 2033 年实现 75% 仓储自动化。当"多用 AI"变成 KPI,失控就只是时间问题。

https://www.qbitai.com/2026/08/469010.html

🔥3. GPT-5.6 与 Claude Fable 5 联手,解决悬置 25 年的数学难题 — 热度 🔥🔥🔥🔥

微软研究院首席研究员 Dimitris Papailiopoulos 借助 GPT-5.6 与 Claude Fable 5,证明了一个多项式时间算法能让 MIMO 检测精确命中最大似然阈值,堵上无线通信领域困扰学界 25 年的理论鸿沟。

MIMO 检测是无线通信的经典问题:接收端要从被噪声搅乱的信号中完整还原信息。理论上最大似然检测总能找到答案,但需穷举 2 的 N 次方种组合;1989 年 Verdú 证明最坏情况是 NP-hard。学界此后 25 年试图证明:随机信道下存在无需穷举的快速算法,且能在信噪比达到 2logN(最大似然阈值)时精确恢复。2001 年 Hassibi 声称球形译码是多项式时间,2005 年被推翻;此后多种方法轮番上阵,最佳结果也只能停在 4logN。Papailiopoulos 与两个模型合作,证明了一个两步简单算法能在 2logN 时以 O(N³) 精确恢复全部比特。作者表示花了整整七天,17 年前读博时就在研究这个问题。这是"AI 辅助数学研究"在工程数学领域最具说服力的落地案例之一。

https://www.qbitai.com/2026/08/468913.html

🔥4. 中国团队跑通"数据层 RSI":BigBang-V1 用 100% AI 合成数据训练,35B 跑赢 1T 大模型 — 热度 🔥🔥🔥🔥

由上海交大人工智能学院、深势科技、上海算法创新研究院组成的"无尽前沿团队"发布 BigBang-V1——首个基于 RSI(recursive self-improving)原生方式训练的基座模型,出题、解题、验证全程交给 AI,后训练数据 100% 由 AI 自主合成。

BigBang-V1 参数规模 35B,推理时仅激活约 3B 参数,支持 262K 长上下文,在长程搜索、代码、科学研究等评测中拿下 10 项第一,在 FrontierScience Research、PaperBench 上甚至超过 1T 级 DeepSeek V4 Pro Preview。具体案例上,它能在全基因组数据里正确定位 47bp 转座子插入位点;也能在论文复现任务中自我纠错——发现实现违反论文核心主张后连续否决三个候选方案,最终改用二进制掩码翻转解决,复现评分 0.7657。能力还迁移到通用场景:BrowseComp 76.5、SWE-Bench Pro 54.2。团队的核心洞见:把"训练数据生产"本身变成 AI 可优化的对象,让 AI 闭环迭代自身数据以突破高质量数据瓶颈。模型与技术报告均已开源。

https://www.qbitai.com/2026/08/468782.html

🔥5. Opus 5 狂烧 6.9 亿 token 做游戏,GPT-5.6 用 5 美元复刻:Agent 成本差距 85 倍 — 热度 🔥🔥🔥🔥

网友用一条(长达 2000 字的)提示词让 Opus 5 一次性生成精美美式卡通快艇竞速游戏《INK TIDE》,烧掉 6.9 亿 token、花费 423 美元;另一位网友用 Codex + GPT-5.6 Sol/Luna 组成 Agent 小队,5 小时、2 条提示词、仅 5 美元就复刻了同类游戏。

这组对比成为今天最直观的"Agent 架构课":Opus 5 版采用多子 Agent 分工——提示词给水面、卡通渲染、赛艇物理、AI 对手、音频各分配独立子 Agent,并配一名"视觉评审质检员"循环迭代,为对抗"注意力稀释";产物质量高,但代价惊人。GPT-5.6 版用 Sol Ultra 当主 Agent 统筹、Luna Max 当子 Agent 干活,5 美元搞定相似效果。作者还故意放水:NPC 参数写死,最快的对手也只比理论最佳快 0.5%。这则新闻的意义在于:多 Agent 协作 + 视觉反馈闭环成为主流范式后,模型定价与推理效率差异正把 Agent 开发成本拉开一个数量级——选对模型组合可能便宜 85 倍,与亚马逊 180 万美元账单形成呼应。

https://www.qbitai.com/2026/08/468766.html

🔥6. 爆料:哈萨比斯原本计划和 Jeff Dean 同期离开谷歌,升任董事长只是"缓兵之计" — 热度 🔥🔥🔥🔥

据 Pathfounders 援引行业消息人士称,Google DeepMind 创始人哈萨比斯原本打算与 Jeff Dean 等人同期离职,因谷歌管理层担心股价崩盘而苦苦挽留,最终以"卸任 CEO、升任董事长"的方式留下——但这很可能只是过渡安排。

接任实际管理权的是原 CTO Koray Kavukcuoglu,他升任高级副总裁并直接向皮查伊汇报;过去一年哈萨比斯已逐步移交 Gemini 的日常管理。与此同时谷歌把 AI 大权收回加州:Koray 已从英国搬到加州,关键 AI 编程项目负责人 Sebastian Borgeaud 也搬去加州,AlphaFold 团队被拆分。哈萨比斯的下一站大概率是他在 Alphabet 体系内创立的 Isomorphic Labs(AI 药物发现),他本人也表示换岗后会更深入参与。Pathfounders 甚至预测他一年内彻底离开谷歌。这则消息与 Jeff Dean 创办 Discovery Loop 前后脚出现,说明顶级 AI 人才流动进入高潮期——巨头一边用"高头衔"留人,一边默默把权力和人才物理性收归总部。

https://www.qbitai.com/2026/08/468715.html

🔥7. OpenAI 为 GPT-5.6 Sol 调优、免费用户无限用 Luna,ChatGPT 免费版史诗级升级 — 热度 🔥🔥🔥🔥

OpenAI 宣布对 GPT-5.6 Sol 专门调优,同时让免费用户无限量使用 Luna 模型,叠加此前"免费版史诗升级"的消息,OpenAI 正用"免费无限"策略加速抢占用户。

在 AI 圈"功能狂卷、付费寥寥"的背景下,这轮升级被视为 OpenAI 的防守反击:GPT-5.6 系列此前已因 Claude Opus 5 等竞品冲击承压,如今免费档直接开放 Luna 无限用量,意图明显——先用免费流量锁死用户习惯,再靠 Sol 等高阶模型做付费转化。结合 OpenAI 招聘"家庭产品经理"、ChatGPT 用户中 35 岁以上人群占比一年内从 26% 升至 31% 等信号,其产品定位正从"个人生产力工具"转向"全家数字管家"。不过,免费无限用背后是更高推理成本与滥用风险,token 失控在免费档放开后是否加剧值得关注。

https://www.oschina.net/news/490735

🔥8. AMD 收购 AI 芯片创企 Taalas:把模型权重直接刻进芯片 — 热度 🔥🔥🔥

AMD 收购 AI 芯片初创公司 Taalas,目标是将其"模型权重刻进硅片"的技术路线收入囊中,以大幅提升大模型推理性能与能效。

Taalas 走的是与主流 GPU 完全不同的路线:把神经网络权重直接"烧录"进芯片逻辑,针对特定模型做硬编码加速,消除访存与指令开销,在推理吞吐和每 token 功耗上获得数量级优势。缺点也很明显——专用化程度高、灵活性差,模型迭代后芯片可能需要重新设计。对 AMD 而言,这笔收购的战略意图清晰:在英伟达主导的通用 AI 算力市场之外,为推理侧规模化部署储备差异化武器。社区热议两极:有人看好"专用推理芯片+开源模型"组合的未来,也有人质疑模型快速迭代会让"硬刻权重"路线快速过时。

https://www.oschina.net/news/489989

🔥9. Agent Skills 生态大爆发:addyosmani/agent-skills 逼近 8.5 万 star,google/skills 上榜 — 热度 🔥🔥🔥🔥

GitHub Trending 今日被"Agent Skills"霸榜:Google Chrome 团队负责人 Addy Osmani 的 agent-skills 仓库 star 已达 8.5 万,谷歌官方 google/skills 也有近 1.7 万 star。

agent-skills 定位"面向 AI 编码 Agent 的生产级工程技能",收录大量可直接注入 Agent 的工程实践——从代码审查、测试策略到安全规范,把资深工程师的隐性经验结构化、可执行化;google/skills 聚焦 Google 产品与技术栈,让 Agent 能调用谷歌系产品官方能力。两者共同指向一个趋势:2026 年开源 LLM 竞争焦点正从"模型本身"转向"模型之上的技能与工具生态"——同样的模型装上不同技能包,产出质量天差地别。这也与 Prime Agent 把"技能"做成可导入 Python 包、可自我迭代的设计哲学一脉相承。

https://github.com/addyosmani/agent-skills

🔥10. harvey-labs 开源:专为法律场景打造 Agent 能力的评测基准 — 热度 🔥🔥🔥

法律 AI 公司 Harvey 开源 harvey-labs——专门用于评测和提升 Agent 支撑法律工作能力的基准,今日冲上 GitHub Trending。

法律工作是 Agent 落地的典型高价值场景:文档密集、流程严格、错误代价高昂。harvey-labs 试图系统化回答"Agent 在法律场景下能干什么、干到什么程度",据此设计评测集与能力分层,让开发者针对性地改进 Agent 在法律检索、文书起草、合规审查等环节的表现。Harvey 本身就是法律 AI 领域估值最高的独角兽之一,开源基准被视为向社区输出行业 Know-how:既建立标准话语权,也借社区之力完善基准。这类垂直行业基准(法律、医疗、金融)正在填补通用基准之外的空白,标志 Agent 评测进入"行业化"阶段。

https://github.com/harveyai/harvey-labs

📌 今日趋势总览(AI Agents & 开源 LLM)

趋势

热度

自我改进型 Agent(RSI / RLM)开源化

🔥🔥🔥🔥🔥

Agent 成本失控(token 用量爆炸)

🔥🔥🔥🔥🔥

AI 辅助数学/科学研究突破

🔥🔥🔥🔥

Agent Skills 技能生态爆发

🔥🔥🔥🔥

AI 顶尖人才大迁徙(DeepMind/谷歌)

🔥🔥🔥🔥

开源小模型对标旗舰(35B 跑赢 1T)

🔥🔥🔥🔥

模型权重专用推理芯片(AMD 收购 Taalas)

🔥🔥🔥

垂直行业 Agent 评测基准

🔥🔥🔥

ChatGPT 免费化与家庭场景渗透

🔥🔥🔥


本文原创作者:易君召,详见:https://www.yijunzhao.cn/authors/yijunzhao,转载请注明出处。

原文链接 https://www.yijunzhao.cn/archives/ai-agents-kai-yuan-llm-jian-bao-2026nian-8yue-9ri

欢迎访问 小易撩挨踢

https://www.yijunzhao.cn/