易君召
发布于 2026-09-16 / 作者:易君召 / 0 阅读
0

AI Agents & 开源 LLM 简报 (2026年9月15日)

#AI

🔥 1. 荣耀 MagicOS 11 重做 Agent 底座:YOYO Harness 让任务链拉到 100 步以上

— 986 pts

去年的上限是 14 步,今年是 100 步以上——这不是模型变强了一点,是架构被整个重做了一遍。

荣耀在 MagicOS 11 发布中把 AI 助手 YOYO 的底层架构整个重做,新增一套叫 YOYO Harness 的系统级智能体框架,把模型与手机的感知、规划、工具调用拧成了一根绳。能力数字的变化相当陡峭:YOYO 现在能够执行的步骤已经拉到 100 步以上,任务闭环率高达 90%综合意图理解能力达到 91.8%长链任务执行从去年(MagicOS 10 时期)的 14 步跳到超过 100 步,能调用的工具也从 400 个提升到 700 个。官方给的典型场景很能说明落差:看到粉丝群消息后说一句"帮我查一下这场什么时候开票,提前五分钟定个抢票闹钟",再补一句"把他最近十首热门歌整理到备忘录里"——放在过去要手工完成五六步大操作、每步里又有四五个小操作(查票务 App → 切闹钟 → 开浏览器搜歌单 → 打开日历一首首敲进去),现在一句话就能闭环,而且事后打开备忘录,歌单已码好、抢票闹钟已定好、场馆地址也塞进了日程。

更值得注意的是长程执行跳出了手机。发布会演示的智能家居场景直击真实痛点:灯是 A 牌、风扇是 B 牌、扫地机器人是 C 牌、净化器又是 D 牌,"万国造"设备意味着即使有智能家居,用户仍得挨个打开多个 App 操作;YOYO 打破品牌藩篱后,一句"出门"就能一次性完成关灯、关风扇、净化器切模式、启动扫地等一串动作,智能汽车同样可以交给它控制。此外新增的 「YOYO 任务」把"被动执行"推进到"半主动":设好任务后由 YOYO 拆解编排,触发条件支持定时、地点、应用状态、消息、网络、电池、设备状态乃至外部信息,还可多条件组合(例如"每个工作日八点半查天气,如果我在家且外面气温低于 10℃,就打开空调制热"),并预置了一批高频任务(打开读书 App 自动开护眼、刷短视频超 30 分钟提醒、下雨天提醒带雨具)。主动服务侧,「YOYO 建议」已覆盖超过 1000 个服务场景,本次重点推「YOYO 码上宇宙」——把取餐码、取件码、乘车码、付款码、医保码这些散落在各 App 里的"码"主动弹出,并对快递场景做了细化(自动识别快递信息、给商品做归类标识,区分生鲜当天必取、贵重不能拖、大件需摇人)。

→ 量子位报道:https://www.qbitai.com/2026/09/489466.html


🔥 2. 无问芯穹联合清华、上交开源 APXInf:具身端侧推理延迟从 278ms 压到 26ms 以内

— 962 pts

对聊天机器人来说,几百毫秒只是体验差异;对需要持续感知、连续决策和实时控制的机器人来说,几百毫秒可能是动作迟滞、轨迹不连贯甚至任务失败。

无问芯穹联合清华大学、上海交通大学正式开源具身智能端侧推理引擎 APXInf,支持 RTX 4090、Jetson Orin、Jetson Thor 等主流计算平台,覆盖从模型开发、效果验证到机器人本体部署的完整链路。核心指标:Pi 0.5 FP8 在 Jetson Thor 上实现端到端推理延迟从 278ms 降低至 26ms 以内,FP8 下达到 38.46Hz 推理频率——10.7 倍的延迟下降,完全满足机器人多场景实时控制对频率与响应的要求。它把具身规模化落地的核心矛盾拆成两类需求:一端是机器人本体对推理系统的苛刻要求(极致性能、低延迟、低功耗、高稳定性),另一端是开发者越来越强的工程诉求(快速接入、敏捷验证、持续扩展);而现有方案往往只能二选一——跑得快的需要大量底层适配与工程集成,运行稳的难以满足实时控制低延迟,接口简单的面对不同模型/硬件/不断变化的 VLA 架构时扩展成本又很高。

APXInf 的三条设计线索值得记录。"快"不是追求单个算子的峰值性能,而是围绕机器人真实执行链路做端到端优化——通过 Pipeline、Graph、Kernel 及量化等多层优化降低端到端延迟,用冗余特性的系统设计为模型定制运行时,并搭配 Agent4Kernel 技术做极限优化的融合算子,从而实现性能 SOTA。"稳"强调真实部署环境的可预测性与持续运行能力:真正难以接受的不是偶尔慢一点,而是持续运行中出现抖动、异常、中断,甚至因内存、并发或资源管理问题导致整个系统失稳;因此采用创新架构——用 Rust 系统语言构建极简运行时 + Python 易用接口,借 Rust 的内存安全特性提升稳定性、降低易错面,同时通过 Python 封装保留开发者熟悉的调用方式。"敏捷"则面向 Agentic Engineering 研发流程重新设计系统:用冗余特性、功能隔离、工具箱模型等方法,让新模型(含用户自研模型)的接入与优化变得简单敏捷——"让推理引擎不再只是被动执行模型的 Runtime,而是连接模型、硬件、机器人与开发者"。开源清单显示:首发支持 Pi 0.5 与 WALL-OSS 两款具身模型,Roadmap 包括 Qwen、Groot 的适配,nvfp4 性能优化、国产芯片算力后端与国产机器人操作系统支持、AMD 等主流芯片适配。它也是无问芯穹 2025 年 9 月开源的全球首个面向具身智能的大规模强化学习训练框架 RLinf 生态中的端侧推理项目,构成"训练—评测—端侧部署"的同一条工程链路。

→ 量子位报道:https://www.qbitai.com/2026/09/489460.html
→ 开源仓库:https://github.com/RLinf/APXinf-robo


🔥 3. Meta FAIR 新研究:字节级蒸馏突破 Token 天花板,预测上限高出 4 个百分点

— 938 pts

学习的基本单位反而更小了,模型最终能学到的能力上限却更高——这是这篇论文最反直觉的地方。

来自 Meta FAIR 和华盛顿大学的论文《突破 Token 天花板:蒸馏出更小、更强的字节模型》提出了一个有趣的想法:蒸馏时能不能把学习单位从词元(Token)换成字节(byte),让学生模型直接从字节级别的概率分布学起。答案是肯定的。背景是传统蒸馏的老问题——以 Llama 3-8B 为例,教师词表包含 128,256 个 Token,每个预测位置对应十几万个候选概率;离线蒸馏若保存完整分布,存储成本极高,实际操作只能保留概率最高的一部分(top-k 截断)。而一个字节由 8 比特组成、只有 256 种取值,即使加上少量特殊符号,每个位置需要保存的概率也不过两百多个,完整分布自然更容易保留下来。难点在于教师预测整个 Token、学生预测单个字节,要让两者对上,必须把教师的概率分布一起转换过去——这正是论文首先解决的问题。

团队提出两种方案:Marginalize-It 直接把教师对不同 Token 的概率逐步分解到对应字节位置(沿真实字节序列不断重复,就能把 Token 分布拆成逐字节训练目标),做法是已经结束的候选不再往后追、把剩余候选概率重新归一化——只需一次教师前向计算、效率很高,但代价是丢掉一部分已结束 Token 的概率信息,本质上是近似;End-Of-Token 则在每个 Token 末尾加入一个特殊符号,给"Token 结束"本身一个明确的预测位置,从而在保留 Token 边界的同时更完整地把教师分布映射到字节空间。两种方法都只需教师做一次前向计算,不必为不同分词路径反复调用教师。实验设置很完整:Token / 普通字节 / 带结束符的字节三种表示,各分监督训练与蒸馏训练共六组;教师统一 Llama 3-8B;三类学生的 Transformer 层参数量相同(约 12.8 亿),计入词表后 Token 学生约 18.1 亿、字节学生约 12.8 亿。结果表明 Token 模型赢在前期效率,字节模型则表现出更好的 Scaling 潜力;用"训练计算量 → BPB → 下游任务成绩"的拟合关系预测能力上限后,Token 蒸馏 48.4%、Marginalize-It 蒸馏 50.5%、End-Of-Token 蒸馏 52.4%——比传统 Token 蒸馏高出 4 个百分点,是六种方案里预测上限最高的。代价也要说清:End-Of-Token 约在 6.33×10²² FLOPs 时才能追平 Token 蒸馏的 48.4% 上限,处理相同文本量的训练计算量比普通字节模型高约 30.94%,且论文尚未完成等推理成本下的公平比较。它在存储与数据上的优势则是实打实的:处理的实际文本量约为 Token 方案的六分之一,存储量约为五分之一。论文一作 Kalyani Marathe 是华盛顿大学博士生,师从 Luke Zettlemoyer。

→ 量子位报道:https://www.qbitai.com/2026/09/489337.html


🔥 4. 7 名博士生 3 个月从零训练 7B 模型 ZGCM-1:几百个 Agent 组成"研发团队",并把 AI 自主性评了级

— 915 pts

"AI 到底已经能独立做多少事情"?光凭"帮了很大忙"的印象不够——他们把研发过程拆成 11 类任务,按 L1 到 L5 逐项打分。

北京中关村学院 7 名博士生用一个暑假从零训练出 7B 大模型 ZGCM-1,并把各阶段训练数据与配方、模型权重、训练代码、中间 checkpoint 和日志全部开放,让任何研究者都能追溯、复现整个流程。在多项通用评测中 ZGCM-1 与 Qwen3-8B 等同规模模型表现相近,在部分数学推理和搜索评测中还能与 Qwen3-235B-A22B、GLM-5.1 等更大规模模型比较——但比分数更有意思的问题是:数据、训练、集群、评测这一整套工程在大厂通常需要几百人协作,七个人怎么做过来? 答案是给自己组建了一支几百个 Agent 的团队,分头处理数据、跑实验、看日志、做评测,亲手实践 "AI4AI" 研发范式。这个起点很朴素:七人最初因兴趣凑到一起(两人 AI 方向、两人网络方向,另三人分别来自化学、生物和网安),平时只在现成模型上做微调,看技术报告总有些地方想不明白——"一句'我们进行了数据清洗',落到实际工程中究竟意味着多少工作?"于是决定自己从头训练一次。真正开始后才发现在要改代码、解释实验现象时会卡住,于是让 Agent 从基本原理开始调研讲解,讲完再回到代码和实验里验证

工程细节的密度很高。Agent 子团队负责数据(依据人给定的质量要求编写清洗脚本、检查分布是否达标、根据结果自动调整规则与阈值形成闭环)、实验(从提交任务、监控日志到定位故障、调整配置,甚至主动发现存储与数据传输瓶颈、优化训练框架 I/O 流程)与评测;团队自研 ZGent 平台把会议讨论、研发决策和计划积累成共享上下文,再把验证过的脚本、工作流和 debug 经验沉淀为可复用的 Skill,后来加入的 Agent 可以接着此前经验做事。最关键的产出是一份"AI 自主性评级":团队把研发过程拆成 11 类任务,请核心参与者按 L1 到 L5 的自主性框架逐项评级,结果是——实验监控和部署到了 L4(人给定目标与约束后,Agent 可以独立规划、执行并根据反馈继续调整),而模型架构和学习算法设计仍在 L2(更多是帮助实现已有方案、运行预设实验),"研究什么、关键设计怎么选还需要人来主导"。此外还有几个难得的实战发现:一次训练 loss 仍在下降、模型能力却突然明显退步,最后追到底层数据分片与 shuffle 环节(实际送进训练的数据比例发生波动),此后团队建立了 ACE 原子能力评测体系(把能力拆成 18 类、183 项,用 2503 个探针检查);架构上用局部注意力与全局注意力结合,上下文从 16K 逐步扩展到 64K、256K,256K 下相较全注意力方案带来约 3.94 倍吞吐提升、KV Cache 占用降至约六分之一;结合 Muon 与 FP8、用延迟缩放与 TWEO 抑制极端激活值,16K 预训练达到相同 loss 的效率相比标准 BF16/AdamW 基线提高约 4.2 倍;SFT 阶段更严格的质量筛选让样本减少约 44.9%,整体评测表现反而有所提升,但长思维链数据比例过高会损害指令遵循

→ 量子位报道:https://www.qbitai.com/2026/09/489227.html
→ 仓库:https://github.com/zgcagi/ZGCM-1


🔥 5. HF 博客复更:你的 Agent 通过了任务,它下次还会吗?——24.4 分的一致性缺口

— 891 pts

大多数基准把这个变异性藏在平均值后面。这篇博文的贡献是:造了一把尺子去量它,并且让它变小。

HF 博客在连续四日无新文后复更,9 月 15 日刊出 IBM Research 的《Your Agent Aced the Task. Will It Do It Again?》。它指出了一个几乎无人报告的指标:在 AppWorld 上,使用 GPT-4.1 的 ReAct Agent 在五次重复中单次成功率为 77.4%,但"五次全部成功"的任务只有 53.0%——一致性缺口高达 24.4 个百分点;而"大多数基准只报第一个数字"。这个差异在演示现场是尴尬,在生产环境就是可靠性问题:一次成功的工作流,可能在下一位用户发出同样请求时失败;对账金融交易、核查合同义务这类关键任务更可能是 showstopper。作者进一步把 Agent"翻车"的原因区分为 Sharp Decisions vs. Flat Ones(尖锐决策与平坦决策)——即当模型在同一状态下对不同轨迹给出接近的概率分布时,采样带来的随机性更容易让它走上不同路径。解决方案沿用团队此前的 ALTK-Evolve把 Agent 自己的历史轨迹自动蒸馏成可复用指南(guidelines),并在推理时注入,从而"先诊断、再修复",在不牺牲准确率的前提下缩小一致性缺口。文章还特别强调一条重要性质:这些指南具有泛化性——它们不是在给某一条轨迹打补丁

这篇文章的价值在于它把 Agent 工程的评价坐标系往前推了一格:当大家还在比"单次成功率"时,"可重复成功率"才是生产部署真正的门槛。这也与今日 #4 中 ZGCM-1 团队的做法形成呼应——他们同样不满足于"帮了很大忙"的印象,而是建立 11 类任务的自主性评级与 2503 个探针的原子能力评测;以及 #1 中荣耀公布"任务闭环率 90%"而非"单步成功率",都指向同一个行业趋势:Agent 的评测正在从"能不能做对一次"转向"能不能稳定做对"

→ 博文:https://hf-mirror.com/blog/ibm-research/altk-evolve-consistency
→ 另一篇新文(9/10):https://hf-mirror.com/blog/asyncgrpo-lora-hfjobs


🔥 6. 阶跃星辰一次放出 StepAudio 3 五款语音模型,多款登顶全球第一

— 868 pts

语音大模型的竞争,正在从"能不能把文字念出来"换成"能不能真正理解声音、组织声音"。

阶跃星辰发布 StepAudio 3 系列,一次全发五款模型:Realtime、ASR、TTS、Gen、Music。最出挑的是 StepAudio 3 Realtime在 Artificial Analysis 的 Conversational Dynamics 榜单上以 98.9% 的综合得分排全球第一,语音推理准确率 99.7% 也在 Speech Reasoning 榜单登顶。它强调的重点不是"能听能说能打断"的全双工,而是模型在一场持续对话里判断节奏的能力——什么时候接话、什么时候等待,以及处理打断和连续反馈;工程上推理与语音生成可以并行,工具调用和长任务异步执行、不阻塞当前会话ASR 走"从听清到听懂":在高精度识别之外接入 LLM 的上下文理解,能处理方言、中英混说、专业术语,并在医疗、法律这类领域提升专业表达识别,非流式准确性榜单 WER(词错误率)1.7%,并列全球第一TTS 追求"像真人表达":除生成对应语音外,还能还原笑声、迟疑、结巴、重复、改口这些副语言表现(官方示例是一段"要不要换工作"的独白,纠结、犹豫、改口全在)。Gen 的价值在于把原来分散的声音链路整个吞进去——角色配音、环境音、音效、背景音乐不再需要分头制作,靠自然语言描述和参考音频一次生成,还能控制多个角色的音色、语气、情绪和时间顺序;对影视、游戏、有声书创作者来说,原本需要素材搜集与多工具协作的流程可能被压缩成"一次生成加持续迭代"。Music 则明确打"不止生成,更参与创作":支持 ABC 记谱法控制的多轮交互创作,用户给一段歌词、清唱或 Demo,模型接着完成编曲、改编和制作;基于清唱配乐时能理解旋律、节奏与情绪,再补上和声与完整编曲。五款模型都已上线阶跃星辰开放平台,并放出各模型的 API 接入文档。

→ OSCHINA 报道:https://www.oschina.net/news/502502/step-audio-3


🔥 7. 6500 美元的双臂人形机械臂 OpenArm:把硬件开源做到"能被复现"

— 846 pts

物理 AI 研究一直卡在一个尴尬的地方:软件栈开源得热火朝天,硬件却始终是实验室里那台没法复现的定制臂。

OpenArm 是一台 7 自由度的全开源人形臂,整套 bimanual(双臂)系统售价 6500 美元——这个价格在同类里算激进,但更激进的是它的定位:不是给你一台能拿东西的机械臂,而是给物理 AI 一个能全球复现实验条件的标准平台。仓库已验证:enactic/openarm(★3,339,Apache-2.0,9 月 14 日仍在推送),自我描述为"面向接触密集型环境的物理 AI 研究与部署的全开源人形臂",官网 openarm.dev;配套子仓库分层很清楚——openarm_hardware(★516)走 CERN-OHL-S-2.0 开源硬件协议(CAD 与制造信息)、openarm_ros2(★114)、openarm_can(★64)、openarm_teleop(★45)。设计取舍直指研究需求:高反向驱动性(backdrivability)与柔顺性,这是人机交互安全的硬件前提——机械臂碰到人就该顺势让步而不是硬顶回去;同时保证真实世界的有效负载能力,不是只能做演示的玩具。

真正有意思的是 OpenArm Cell 这个设计:它是一个标准化环境——统一背景、统一灯光、统一相机位置。研究者在世界各地用 OpenArm 做的实验,能在一致的评测条件下被复现,这就把"某某实验室训练出了一个会 X 的机器人"从口头声明,变成了一组可以跨实验室对比的基准数据。软件侧铺得很全:URDF/xacro 描述文件、CAN 底层电机控制库、ROS2 集成、遥操作(单边与双边控制)、Isaac Lab 与 MuJoCo 两个仿真环境、数据集格式与录制工具,甚至还有 Dora 数据流节点,把数据采集、推理和遥操串起来——从仿真训练到真机部署的链路基本没有断点。项目文档里一句话点明了野心:为遥操作、模仿学习、仿真和真实世界接触密集型任务的数据采集提供灵活平台——盯的是那批想在抓握、装配、双手协作场景里做研究的团队,这类任务恰恰是现在具身智能最缺数据、最难标准化评测的地带。一个开源硬件项目能不能活,最终看社区愿不愿意真金白银下单然后一起踩坑,6500 美元的门槛就是它给自己设的第一道考试

→ OSCHINA 报道:https://www.oschina.net/news/502506
→ 仓库:https://github.com/enactic/openarm
→ 硬件仓(CERN-OHL-S-2.0):https://github.com/enactic/openarm_hardware


🔥 8. 华为发布全球首个 3D 数据中心,开放《概要设计图库》

— 823 pts

"把数据中心当成一件标准产品来做,可以批量复制,而不是一项定制工程来建。"

9 月 15 日,2026 AIDC 产业发展大会暨 3D 数据中心现场会在安徽芜湖举行,华为正式发布全球首个 3D 数据中心,同时发行《3D 数据中心》专著,并开放《3D 数据中心概要设计图库》。技术路线是借芯片工厂"动力层"与"生产层"严格分离的理念,把传统数据中心水平部署的各个功能空间垂直叠加,形成从下往上的供冷层、IT 设备层、供电层、备电层四层架构。华为副董事长、轮值董事长汪涛给出的判断是:"十万亿参数大模型和高速增长的 Token 需求对 AI 基础设施提出更高要求,十万卡以上的昇腾超节点集群将成为基础配置"——3D 数据中心通过分层解耦、立体堆叠支撑"昇腾超节点集群的超级算力工厂",并可作为全行业建设超节点集群的参考架构。华为高级副总裁任树录则点出了驱动因素:AI 时代高密算力让传统数据中心在空间、供电、散热上面临严峻挑战,机柜功率已从风冷时代的几千瓦、十几千瓦急剧攀升至 100 千瓦、200 千瓦,未来还将持续上升,极致能量密度需要供电、散热、运维、交付周期进行系统性范式革新。

3D 数据中心宣称的能力包括:分区隔离、故障不蔓延的高可靠能力;分区散热、高效节能;垂直供电供冷、极短路由;通过工厂产品化模式实现标准化、预制化,机电交付时间减半;以及分域分权管理与智能运维。落地方面,华为云已在贵州贵安、内蒙古和林格尔、安徽芜湖部署三大云核心枢纽,都在规模化建设 3D 数据中心。开放图库涵盖建筑、结构、给排水、暖通动力、强电、弱电等专业,为产业共建奠定基础;面向未来,全球计算联盟 GCC 发起共建新一代 AIDC 新范式倡议,联合华为等数十家产业链伙伴共同完善指标定义、建设参考架构、开展标杆验证、推进标准与认证。这条新闻与今日 #2、#7 共享同一个底层逻辑:当 AI 能力要落到物理世界,决定上限的往往不是模型,而是供电、散热、交付周期与可复现的硬件标准

→ OSCHINA 报道:https://www.oschina.net/news/502507


🔥 9. 前 OpenAI 后训练 VP 回应陶哲轩,AMS / LMS / CMI 三方接连表态

— 802 pts

"说 AI 毁了数学,可能还是太小瞧 AI 了"——但真正重要的也许不是未来,而是现在。

OpenAI 前后训练 VP Liam Fedus 公开回应了陶哲轩等数学家关于"AI 不应只追求解题、更应推动数学理解"的观点。他赞同陶哲轩对概念理解的重视,但认为不能用今天 AI 的能力边界框定未来的可能性——在 Liam 看来,未来的 AI 不仅能解决问题,还能提出有价值的洞见、建立新的概念框架,让数学家在此基础上继续探索;如果训练目标从"把题做对"扩展到解释为什么、提炼方法、帮助人类理解,它最终可能成为既能给答案、也能创造新思路的数学研究伙伴。双方既有共识也有分歧:都认同"数学不能只剩下答案";区别在于数学家更担心眼下的解题竞赛损害知识积累与传承,而身处行业的 Liam 更乐观地认为未来 AI 本身也能参与创造这些知识。网友把这个争论类比到围棋——AlphaGo 虽不解释自己的走法,人类棋手仍通过研究其落子与胜率获益;Liam 赞同这个类比,并引用 Noam Brown 此前的判断:AlphaGo 出现后人类棋手水平明显提高,数学领域或许也会出现类似变化

更有分量的是三家重要数学机构接连表态,分别回应了不同层面的问题美国数学学会(AMS)强调,这次围绕 Navier–Stokes 方程奇点问题的最新进展并不是 AI 凭空完成的突破,它建立在 Navier、Stokes、Leray,以及近年的 Córdoba、Martínez-Zoroa、Buckmaster、Alpöge 等几代数学家的长期积累之上,并明确提出:数学的目的,是人类的理解伦敦数学会(LMS)进一步明确了 AI 的位置:把它定位成一种强大的新工具——可以加速探索和发现,但提出问题、创造新概念和形成真正的数学理解,仍然是人的工作。而真正负责千禧年大奖认定的克雷数学研究所(CMI)回应的是最现实的问题:AI 给出的结果究竟怎样才能正式进入数学知识体系——对 NS 新证明,CMI 没有直接确认其成立,而是保持谨慎:结果仍需公开、经过同行检验,并接受长期验证;同时再次强调,重大数学难题的价值从来不只是最后那个答案,还包括解题过程中产生的新思想、新方法和新理论工具。文章最后给出的落点很扎实:真正值得探讨的并不是"AI 毁了数学",而是当 AI 开始参与知识创造后,人类数学共同体该如何让这些由机器产生的新知识被理解、验证,并真正成为数学的一部分

→ 量子位报道:https://www.qbitai.com/2026/09/489288.html


🔥 10. 国产操作系统的 Agent 化:AutoClaw 上架 openKylin,"智能体记忆"被出成赛题

— 781 pts

"什么该记、什么不该记,没有统一答案,却直接决定智能体好不好用。"——openKylin 干脆把这个问题变成了一道赛题。

国产开源操作系统侧的 Agent 化今天有两条互相印证的进展。其一是智谱的桌面端 AI 工作助手 AutoClaw 完成 openKylin 适配并正式上架软件商店:用户可从商店直接安装,让 AI "从理解工作目标、规划任务到调用工具、推进执行,最终交付可直接使用的工作成果"。AutoClaw 深度适配 GLM 模型,融合法律、金融、设计等领域的专属知识库与工作流,强调"区别于只提供问答和建议的传统 AI 助手,更强调对真实工作任务的执行与交付";目前已提供 50+ Skills,覆盖内容创作、网站开发、邮件与飞书办公、营销 SEO、代码开发、金融投研、学术研究等场景。值得注意的是它的两个执行模式:集群模式把任务拆分给多个 Agent 并行执行并对产出复核Goal 模式则围绕目标持续进行"计划—行动—验证—迭代",补齐交付成果与验证依据,直至任务完成或用户终止。

其二是 openKylin 把"智能体长期记忆"直接出成了一道官方赛题,全称《面向 openKylin 操作系统的智能体长期记忆自动化评测 Benchmark 设计》。命题背景来自三个真实痛点:目前的评测往往依赖人工检查、难以规模化;简单问答式验证项覆盖不到真实使用中的冲突更新、相似干扰和行动复用;自动评分容易出现语义偏移,很难稳定判断模型到底是记住了、误记了,还是不该记却记了。赛题要求把对话、记忆记录、行动轨迹、文件统一组织为证据,自动评估六项能力:长期保持、记忆调用、动态更新、相近区分、边界识别、任务复用,并封装成一键运行的 CLI 工具(建议产出 .deb 包),在 openKylin 桌面环境下至少对两款智能体跑完评测。这条新闻的背景信息很有价值:openKylin 里已经跑着 KylinBot、kylin-agent、OpenClaw、Hermes Agent 等多个智能体框架——"框架不缺,缺一套系统级的自动化工具,把不同智能体在记忆能力上的表现量化出来"。同日另一条同源进展是麒麟100 发布 AI 交互功能"灵触(Magic Touch)&灵萃(Magic Extract)",把 AI 能力直接放进鼠标操作里——双击 Alt 激活灵触模式后,按住左键圈选文本/截图/文件/链接即可识别、解析、翻译、摘要与提取,结果以轻量化悬浮卡片呈现。把这三件事放在一起看:Agent 正从"应用"下沉为操作系统的一等公民,随之而来的是记忆、权限与评测这些系统级问题——而这恰恰是 #5 那条"一致性缺口"在端侧的同构版本。

→ AutoClaw 上架:https://www.oschina.net/news/502476
→ 智能体记忆评测赛题:https://www.oschina.net/news/502494
→ 麒麟100 灵触&灵萃:https://www.oschina.net/news/502484

📌 今日趋势总览

趋势方向

代表事件

热度

Agent 下沉为系统级框架

荣耀 YOYO Harness:100+ 步、闭环率 90%、700 个工具

🔥🔥🔥🔥🔥

具身端侧推理被"端到端重写"

APXInf:Pi 0.5 延迟 278ms→26ms(10.7×),Rust 运行时

🔥🔥🔥🔥🔥

评测从"能不能做对"转向"能否稳定做对"

IBM:AppWorld 一致性缺口 24.4 分;荣耀报"闭环率"

🔥🔥🔥🔥

训练范式继续被挑战

Meta 字节级蒸馏预测上限 +4 分;ZGCM-1 的 AI4AI 评级

🔥🔥🔥🔥

中文开源 Agent 生态扩大

StepAudio 3 五模型;AutoClaw 上架 openKylin

🔥🔥🔥🔥

开源硬件补上物理 AI 的可复现性

OpenArm:6500 美元双臂、CERN-OHL-S-2.0 硬件仓

🔥🔥🔥

物理基建决定 AI 上限

华为 3D 数据中心;机柜功率升至 100–200kW

🔥🔥🔥

AI 与数学之争进入机构表态期

Fedus 回应陶哲轩;AMS / LMS / CMI 三方接连发声

🔥🔥🔥

Agent 记忆成为系统级命题

openKylin 出题考"什么该记什么不该记"

🔥🔥