主题:Agent 开始要求"基础设施级待遇"
字节把 Agent 放进协同办公底座(飞书 8.0 系统性"for Agent"改造 + 豆包工作伙伴,中国首个团队智能体产品);华为 GTS 把"可交互视觉拓扑"做成 Agent 的外部工作记忆以治"拓扑失忆";Cloudflare 为"被收录"与"被训练"划出可分别授权的新边界。
🔥 1. 飞书 8.0 + 豆包工作伙伴:协同办公全面"for Agent"改造 — 986 pts
"Agent 进入组织,就像新员工入职。如果没有工位、没有系统权限、没人告诉它怎么和同事配合,那处处碰壁是必然的。"
飞书 8.0 的核心是系统性的"适 Agent 化改造"——拉群、写文档、操作表格、走审批,人能干的事官方全给 Agent 配齐了。逻辑是:过去所有协同软件都是为人设计的,但在人与 AI 协作的新工作方式下,协同软件也需要为 Agent 设计。三个升级:① 人和 Agent 协作像人和人一样自然(把 Agent 拉进群、@一下就能干活,多个 Agent 之间也能互相 @ 协同完成任务、不需人类传话,AI 产出的 Markdown/HTML 可直接在飞书内编辑);② Agent 可像人一样使用飞书全量能力(消息、文档、多维表格、日程、审批全覆盖;飞书画板场景下 Agent 能绘制结构高度复杂、每个元素都可编辑的信息图);③ 全生命周期安全管控(Agent 权限始终与使用者一致,员工看不到的信息 Agent 也拿不到,管理员可统一管理、追溯使用、设定用量上限)。豆包工作伙伴是中国首个团队智能体产品,明确对标 Claude Tag:拥有独立组织身份,可被拉进群聊、看团队讨论、参加会议、读文档查代码,还会主动跟进推动工作。数据分量:2026 上半年飞书 ARR 增速是去年同期 2.5 倍,新增客户超九成同步采购 AI 产品,超 40% 新客户把"Agent 原生支持能力"作为选型核心考量;上汽、星巴克、古茗、国航等都在转向飞书。字节 CEO 梁汝波给出判断:"Agent 不是孤立存在的,需要和人、工作环境以及其他 Agent 协作"——字节已完成组织架构调整,把豆包、飞书、火山引擎整合到一起。
→ https://www.qbitai.com/2026/09/490686.html
🔥 2. Cloudflare 让站长"两者兼得":保留搜索收录,同时拒绝 AI 训练 — 962 pts
不到 1% 的站选择屏蔽搜索爬虫,但有 17% 的站选择屏蔽训练——说明大多数人欢迎被抓取,只是不愿意被白嫖去训练。
Cloudflare 拆开了一个长期别扭的二选一。根源在于互联网最大的那些组织用的是"混合用途爬虫"——同一个爬虫既做搜索索引又做 AI 训练,拒绝一个等于两个都拒绝。新的 Disallow AI Training 让站长在保留搜索收录的同时拒绝同一爬虫拿内容训练,Apple、Google、Microsoft 已被认定会尊重该设置。路径分四层:robots.txt 发布 no-training 偏好 → 网络层识别谁在爬 → 判断意图 → 对无视偏好的爬虫直接拦截,并在 Radar 公开每个操作方的实际行为;Cloudflare 还给达标者造了 "Accountable"(负责)一词,四条标准:提供 AI 训练 opt-out、提供 AI 摘要 opt-out、URL 级可见性、承诺拒绝训练不影响搜索排名。关键后果是"Block"含义变了:过去对混合用途爬虫不生效(拦了搜索连坐),现在 Block 会对所有训练爬虫生效——包括 Amazon、Anthropic、Meta、OpenAI 这些只做训练不碰搜索的爬虫,拦掉对搜索毫无影响。另两个数据点:超一半消费者会读搜索里的 AI 摘要,其中 40% 以上读完就不再往下逛;但 AI 搜索引流的用户转化率是传统搜索的 3–5 倍。下一步是 AI 摘要——"你的内容在摘要里出现多少,和出不出现在摘要一样重要",目标是明年初让站长一次设置"内容有多少可被摘要包含"。
→ https://www.oschina.net/news/502510/cloudflare-accountable-mixed-use-ai-crawlers | https://blog.cloudflare.com/accountable-mixed-use-ai-crawlers/
🔥 3. 华为 GTS 让 Agent 学会"看着网络排障":用可交互视觉拓扑治"拓扑失忆" — 938 pts
Agent 已锁定出问题的防火墙,却在这台设备上换了几十种查法、原地打转三百多步——因为它不知道这台防火墙卡在整个图的哪条路径的第几跳。
华为 GTS 发现一个反直觉痛点:AI 推理能力再强、读得懂海量日志,却偏偏"记不住"这张网长什么样——命名为 "拓扑失忆"(Topology Amnesia):排障越深入,局部观测越多,整体空间关系却逐渐丢失。根因是表征错配:资深网工脑中始终悬着"活图",而纯文本 Agent 面对的是一维滚动的 CLI,每推进一步都要从碎片日志重新脑补网络结构,上下文越长空间关系越易"坍塌"。破解方案 NetCanvas 借自"认知卸载":不为模型硬写专家 Prompt,而是把专家的工作方式写进 Agent 系统——模型负责思考决策,NetCanvas 负责记路与画图。三招:① 边查边长(摒弃"开局给全景",每完成一次 CLI 探查,新发现的设备/链路/路径证据实时合并进当前图状态,拓扑图跟着排障进度"动态生长");② 按需取景与推理交互(可随时切换全局/局部视图、高亮焦点);③ 交互结果反馈回推理,形成"看图—推演—再探查"闭环。这条与 #1 及上周"Agent 一致性缺口"共享同一判断:限制落地的不再是模型智力,而是它与真实环境之间的"表征接口"。
→ https://www.qbitai.com/2026/09/490098.html
🔥 4. 紫东太初 ZDTaichu5.0-9B 国产开源:九大空间理解基准八项断层第一 — 915 pts
过去多模态能把一张图片理解得头头是道,但一走进真实物理世界,空间理解与行动能力往往就跟不上;而一些模型为补足空间能力,又不得不牺牲通用能力。
紫东太初开源 ZDTaichu5.0-9B:九大国际权威空间理解基准中八项断档第一,且通用能力不打折。对比最能说明"断层":MindCube-tiny 上得分 78.27,而 Gemma4 8B-E4B、Gemini 3 Pro、Grok 4 分别为 48.85、70.87、63.56。通用侧:AI2D 91.48(仅次于 Gemini 3 Pro、高于其它所有对照模型)、WeMath 75.9 领先、MathVista Mini 84.5。三个实测任务覆盖具身关键要素:"找东西"(挤满杂物的台面上找"从左至右第二个银色盒子",归一化坐标 (237,226) 最精准——目标选择)、"看位置"(同一房间三视角,设想移动到绿框窗帘位置面向蓝框沙发,判断红框柜子方位,答"右前方"完全正确——参照系转换)、"找空位"(在最右侧杯子杯柄方向找空闲区域,需先认杯、再定朝向、再查占用——交互条件判断);还完成了美工刀具收纳等复杂空间理解与高层任务规划。
→ https://www.qbitai.com/2026/09/490839.html
🔥 5. IEEE 特稿:推理硬件革命已到来,H100 跑开源 LLM 时有 50%–80% 时间在等数据 — 891 pts
"你可以在组织里塞进一百万个 agent,它们一天工作 24 小时,不像我们下午五点到点就下班。"
黄仁勋在 GTC 2026 把这一年叫做"推理的拐点"。需求爆炸有两个原因:推理模型一遍遍自我追问,高推理强度下产出文本可达无推理时的 20 倍;agentic AI 让推理变成 24 小时不停歇的自主干活。结果是巨头"乱点鸳鸯谱":OpenAI 和 Amazon 用上 Cerebras 的 Wafer-Scale 芯片、Nvidia 花 200 亿美元买回 Groq 的人才与 IP、Anthropic 每月付 SpaceXAI 超十亿美元租闲置算力。技术核心矛盾:推理分两段——prefill 并行度高是 GPU 强项;decode 逐 token 生成,每个新 token 都要把整个模型权重从头读一遍(几十到几百 GB 参数 + 能膨胀到几十 GB 的 KV cache)。实测结论即标题:H100 跑开源 LLM 时有 50% 到 80% 的时间在等数据,计算单元闲着。于是内存带宽成焦点:d-Matrix 把计算 die 叠在 DRAM 上(毫米级→微米级);Majestic Labs 用铜连接与 memory-aggregator 把内存接口从 HBM 的 2–3 毫米"海岸线"延长到约一米,单机架挂 128TB 便宜 DRAM(对比 GB300 NVL72 约 20TB HBM3E,HBM 贵 2–3 倍)。大厂组合拳:Nvidia 用 Rubin 干 prefill + Groq 3 LPU(500MB 片内 SRAM、带宽为 GPU 的 7 倍)专攻 decode;AWS 用 Trainium prefill + Cerebras WSE-3 decode(片上 44GB SRAM,OpenAI 用它跑 GPT-5.3-Codex-Spark 每秒 1000+ token,标准部署只有 50–125)。精度上 NVFP4 vs MXFP4:Nvidia 称 DeepSeek-R1 从 FP8 量化到 NVFP4 后七项主流基准下降不到 1%、性能提升 3 倍。
→ https://www.oschina.net/news/502511/ieee-inference-hardware-revolution
🔥 6. 把记忆交给 CPU:KV Cache 的账本与"记忆分层" — 868 pts
模型还是那个模型,服务器也还是那个服务器,问题的根儿其实出在"记忆"。
文章把 Agent 时代一个过去藏在推理内部、用户几乎感知不到的东西推上台面:KV Cache。逻辑链:每生成一个新 Token 都要用到前文,为免重算系统会缓存中间结果;会话越长这份"记忆"越厚——一旦显存装不下、部分缓存被清走,Agent 下一轮又需要历史时就得重做 Prefill,明明算过的又花一遍 GPU 时间。Agent 时代放大了它(反复思考、规划、行动,不断积累会话历史、检索证据、工具结果)。容量推演:以 Qwen3-8B 为例,BF16/FP16 下每 Token KV 数据为 147,456 字节(约 147KB),算法是 2×36 层×8 个 KV 头×128 维×2 字节;缓存 100 万 Token 约 147GB;300 万日活 × 每人 10 请求 × 每请求 1M 上下文(3000 万请求/天),按每请求 147GB 全量累加约 4410PB,日活 3 亿则达 441EB。原文两条限定必须保留:① "请求累计涉及多少 KV"与"数据中心需同时存多少 KV"不是一回事,不能当存储采购清单(实际取决于并发、缓存时长、前缀共享、压缩淘汰策略);② 1M 是测算假设,不代表 Qwen3-8B 实际支持(官方为原生 32768、YaRN 可扩至 131072)。破局指向反直觉答案:不是加 GPU,而是 CPU 与存储的分层。
→ https://www.qbitai.com/2026/09/489724.html
🔥 7. DeepSeek V4.1 算子作者的告别式长文:《我不得不把才华埋葬在昨天》 — 846 pts
"我当然希望自己不要被革命,但如果非被革命不可的话,我希望革我自己命的人是我自己。"
DeepSeek 系统工程师刘胜与写下长文刷屏并被译为多语言。身份让文章有具体重量:他是 DeepSeek V4.1 主 Attention 算子作者——head dim = 512 的 MQA attention 由他独立实现并交付。但他给出冷静判断:再过半年到一年,AI 写的算子大概率跟他写得一样好甚至超过他——因为 AI 已从"查文档、读代码、找 bug 的小助手"变成能独立读 CUDA、PTX、SASS 汇编,用专业工具分析每条指令停顿时间并自己优化算子的"算子大师"。他不认为会失业,而是"转业":从逐行手写底层指令的工程师,变成 Agent 的"机甲驾驶员"——人类退后一步,负责下达指令、设定边界、评估方案。扎心的比喻:你织了一辈子毛衣,手艺公认地好,也享受临窗织一下午的意趣,可自动织机出现了,质量不输你、速度远快于你,你不得不去用它——饭碗保得住,但那份手工的乐趣被机器的轰鸣碾碎了。他抛出的两个大问题:教育("一个工程能力很差的人,配上 AI,产出屎山的效率可以达到先前的数倍,进而让这个世界变得更加草台")与权力("在未来,权力是不是会比技术或智商更重要?")。落点是他为何留在 DeepSeek:他相信最前沿智能应以开放、廉价方式供应给所有人,"或许能把世界从 2077 那端拉回来一些"。
→ https://www.oschina.net/news/502509
🔥 8. 官方下场做 Agent 技能与插件:Cloudflare 安全审计技能、Anthropic 知识工作插件库 — 823 pts
当技能层成为主战场,官方机构开始把自己的专业能力封装成 Agent 可以直接加载的资产。
GitHub Trending 恢复后最值得记的现象:官方组织正在把领域能力做成"技能/插件"开源。cloudflare/security-audit-skill(★7,402,JavaScript,MIT):"面向多阶段安全审计的编码 Agent 技能,产出可独立验证、机器可读的发现结果"——强调 independently verified 与 machine-readable:安全审计对可信度要求极高,解法是让发现结果可被外部独立核验,而非只给一段自然语言结论。anthropics/knowledge-work-plugins(★24,308,Python,Apache-2.0):"面向知识工作者在 Claude Cowork 中使用的开源插件库"——Anthropic 官方为自家 Agent 产品建立的插件分发入口。同榜还有体量更大的社区项目:addyosmani/agent-skills(★95,482,MIT)提供"面向 AI 编码 Agent 的生产级工程技能"(覆盖 Antigravity、Claude Code、Codex、Cursor);rlaope/oh-my-hermes(★2,571)是 Hermes Agent 一体化插件,含长期记忆系统与模型优化工作流包。模型层趋于同质,真正在快速生长的是"谁能把专业能力封装成可验证、可分发、可审计的技能与插件"这一层——Cloudflare 与 Anthropic 入场说明,这已不只是社区项目之间的事。
→ https://github.com/cloudflare/security-audit-skill | https://github.com/anthropics/knowledge-work-plugins
🔥 9. 清华稳准智能 LimiX-2:400M 结构化数据基础模型同时登顶三大国际榜单 — 802 pts
结构化数据大量存在于企业内部系统,很难像互联网文本一样被大规模公开获取——这决定了它的路线注定与 LLM 不同。
稳准智能联合清华大学计算机系崔鹏教授发布 LimiX-2,参数提升至 400M。在 TabArena、BCCO、TALENT 三大国际主流结构化数据 Benchmark 中,总体 Elo 分数分别为 1935、1432、1506,均列第一,超过 Google、SAP、Amazon 等同类模型(TabArena 上回归、二分类、多分类 Elo 均为最优)。三条技术路线:① 上下文机制网络 CMNs——把建模重点从"预先指定的目标变量"转向"变量之间的相互关联";② 升级自动化合成数据生成引擎;③ 进一步 Scaling 到 400M。CMNs 的范式转变在于:传统 PFNs 以指定目标的预测分布为核心,CMNs 把上下文数据的全变量联合依赖作为建模对象——不仅关注变量取什么值,更着眼于发现变量如何相互关联、共同构成怎样的内在结构;配套 CCMM 上下文条件掩码建模把变量关系推断确立为明确的预训练目标。架构采用单元格级建模,保留列身份、具体取值与缺失状态,把分类、回归、缺失值填充统一为对同一数据模型的不同查询;更深一层,联合关系建模为结合因果假设开展因果骨架发现提供统计基础——在 Sachs、UF、Causal Chamber 等标准数据集上显著领先传统方法。落地侧,上一代 LimiX 已完成 800 余个场景验证、与 60 多个客户战略合作。
→ https://www.qbitai.com/2026/09/490400.html
🔥 10. 力文所开源 Lévin™ Harness:把蛋白设计做成 Agent 工作台 — 781 pts
"AI 不再只负责模型本身的计算环节,也开始参与模型前后的研究工作。"
杭州 AI 蛋白质设计公司力文所发布 Lévin™ Harness,把数据、模型、插件工具、算力和工作流放进同一个 Agent 工作区:研究人员定义目标、方法和关键决策,Agent 据此推进计算、分析结果、再根据反馈调整下一轮方案。三个关键选择:① 不绑定特定模型——Agent 依靠通用大模型(文中列出 DeepSeek、Kimi、GLM、Qwen、小米 MiMo 等开放模型)理解需求与规划步骤,专门训练的科学模型承担结构预测、序列设计等计算,通用模型层保持开放;② 插件化扩展——任何人都可以为自己的模型制作专属插件;③ 工作流沉淀——跑通的方法可沉淀为 Workflow 复用。痛点描述很具体:蛋白模型虽越来越强,但研究人员设计一个分子仍要找文献、查结构、下载权重、配环境、送算力;模型给出结果后还要换工具看结构、筛选候选——一次计算跑完,下一步从哪里开始往往仍靠人工把环节接起来。行业坐标清晰:今年 4 月 OpenAI 推出 GPT-Rosalind、6 月 Anthropic 发布 Claude Science、8 月又公布 Agent 参与蛋白质设计并衔接外部实验验证。一个设计细节尤其值得记:它内置三维分子可视化工具,屏幕上的分子结构信息与操作可直接转化为 Agent 的上下文——因为序列中相距很远的残基可能在空间中彼此靠近,binder 能否形成合适结合界面与这些空间关系直接相关。这与 #3 的 NetCanvas 高度同构:当 Agent 处理本质上是空间/结构的信息时,给它可操作的视觉表征比给它更多文字都有效。
→ https://www.qbitai.com/2026/09/490185.html
📌 今日趋势总览
本文原创作者:易君召,详见:https://www.yijunzhao.cn/authors/yijunzhao,转载请注明出处。
原文链接
欢迎访问 小易撩挨踢