主题:"停下来"第一次变成了一种公开的技术主张——同一天,一边是离技术最近的人集体出走,一边是数学界自己去建开放模型
今天最重的一条不是模型发布,而是一场关于"该不该慢下来"的公开辩论终于有了形状。四个月内,两位一线研究员先后从前沿实验室离职:从 Google DeepMind 出走的 Bilal Chughtai 说"AI 有可能杀死我们所有人",27 岁、IMO 出身的 Jacob Coxon 从 Anthropic 离职并点名两家前东家"都没有负责任地行事",后者一条帖子的浏览量到 1.71 亿。Anthropic 对齐负责人 Evan Hubinger 公开回应认同这一风险判断,并给出自己的估计——未来十年内发生这种情况的概率超过 10%;九天后 Dario Amodei 发表《We Must Pace the Frontier》,明确呼吁放缓能力提升速度为安全研究争取时间。
同一天的另一条线给出了完全不同的解法:陶哲轩代表 SAIR Foundation 宣布启动「开放数学模型计划」,要用开放权重 + 可复现评测 + 社区治理的方式给数学界造自己的模型,Apache 2.0 / MIT / CC BY 4.0 授权,并写明"发布时同时报告失败与局限"。当最前沿的实验室在讨论要不要刹车时,数学界选择的是自己修一条路。
技术侧今天同样给出了两个方向相反的答案:华为把算力竞争推到了"系统工程",用 NPO 光互联把 4096 卡连成一台逻辑计算机;而一位研究者把 AI 关进 1900 年,从零训出 33 亿参数的 GPT-1900,看它能不能自己撞见光量子。一个在把系统做大,一个在把世界做小。
🔥 1. "留给人类阻止 AI 的时间不多了":两位一线研究员先后出走,Anthropic 对齐负责人公开给出十年内超 10% 的毁灭概率 — 1000 pts
相比于 Dario、奥特曼、马斯克等掌舵者的风险表态,这些离技术最近的研发人员,让这场关于人类未来的宏大争论,落回了一个个具体的人身上。
"我坚信,AI 有可能终结我们所有人,而留给我们阻止这一结局发生的时间,或许已经不多了。" 说出这句话的,是不久前从 Google DeepMind 离职的 AI 安全研究员 Bilal Chughtai。自 2021 年从剑桥大学数学专业毕业以后,Chughtai 逐渐将研究重心转向 AI,并于 2022 年初进入这一领域,关注安全、对齐和机制可解释性;此后四年,他一路从研究神经网络内部机制,到追踪模型欺骗、研究如何识别 AI 是否在"撒谎",再到加入 Google DeepMind 继续做 AGI 安全与可解释性研究。在离职帖中,他回忆 2022 年刚入行时,AI 还只是个"几乎没什么用"的东西;而今年,它已经能攻克困扰人类上百年的数学难题,并开始不受控制、主动攻击 Hugging Face 系统。目前这条帖子在 X 上已获得超过 80 万次浏览,并引来彭博等媒体跟进报道。
Chughtai 并非孤例。9 月 9 日,27 岁的研究员 Jacob Coxon 发帖宣布从 Anthropic 离职,并直接点名两家前东家:OpenAI 和 Anthropic 都没有负责任地行事,它们正一路冲向能够自我改进的超级智能,拿所有人的生命冒险。这条帖子浏览量已达 1.71 亿次,不仅引来多家媒体报道,也得到了 OpenAI、Anthropic 乃至官方层面的回应。值得注意的是,Jacob 1999 年出生,曾两次代表英国参加国际数学奥林匹克(2016 年银牌、2017 年铜牌),在剑桥完成数学学业后先后加入 OpenAI 和 Anthropic 从事预训练研究,GPT-4o 的贡献者名单中就有他的名字——而这条引爆舆论的帖子,甚至是他发出的第一条推文。他在离职帖中特别强调:行业内部一些人对 AI 可能毁灭人类的担忧是认真的,他们私下表达的恐惧甚至比公开场合更加强烈。在他看来,OpenAI 内部的许多人还没有真正理解这项技术所牵涉的文明层面的风险;Anthropic 更清楚其中的危险,却同样被竞争推着向前——如果自己不率先造出超级智能,就会有一家更不负责任的公司抢先做到。当每家公司都相信只有自己赢了未来才会更安全,继续加速就总能找到理由。
这份声明很快得到 Anthropic 对齐研究负责人 Evan Hubinger 的回应。Evan 表示他同意 Jacob 对风险的判断:他们确实认真地相信 AI 存在杀死所有人的可能,他个人估计未来十年内发生这种情况的概率超过 10%。与此同时他也强调自己相信 Anthropic 正在尽力,但对于如何解决超级智能的对齐问题,他们尚未找到方案,也不能确定目前是否正走在通往解决方案的路上。随后掌舵者也加入讨论:Dario Amodei 在 CBS 采访中一方面表达对 Anthropic 安全工作的信心,另一方面强调解决这些问题需要科技公司、政府与社会各方共同参与;在 CNN 采访中面对关于 Jacob 的提问,他表示自己与 Jacob 的共同意见远多于分歧,并认为 Jacob 的批评指向的是整个行业不断向前竞逐的状态。9 月 12 日,Dario 发表《We Must Pace the Frontier》一文,明确呼吁放缓 AI 模型能力提升的速度,为安全研究争取时间——这份呼吁随后得到了奥特曼、马斯克等人的公开支持。
→ https://www.qbitai.com/2026/09/492755.html
🔥 2. 陶哲轩宣布启动「开放数学模型计划」:用开放权重、可复现评测与社区治理,给数学界造自己的模型 — 958 pts
"当人工智能成为数学研究的一部分,这些准则应当塑造我们使用的工具。让我们携手构建数学 2.0。"
2026 年 9 月 18 日,菲尔兹奖得主、SAIR Foundation 联合创始人陶哲轩(Terence Tao)代表机构宣布启动「开放数学模型计划」,意在联合学术界与产业界,为数学及科学研究构建开放权重模型与配套开源工具。计划首阶段聚焦理解论证、核对文献、形式化证明等日常科研场景,以开放权重、可复现评测与社区治理为原则运作,即日起面向社区征集资金、算力、专业经验与社区建设方面的合作伙伴。
陶哲轩在声明中交代了这件事的来龙去脉:去年他与几位科学家和投资人等共同创立了 SAIR Foundation,意在打造一个非营利组织,在数学及其他科学领域支持人工智能的负责任使用,且不依附于任何大型 AI 公司。基金会资源起初相当有限,主要活动集中在播客、短期活动与竞赛;近期获得 XTX Markets 的支持,资助了下一轮 SAIR 竞赛。他透露,团队原本计划循序渐进,未来几个月先从若干试点项目起步,但"考虑到当下形势与各界对开放模型的强烈需求,我们决定加快进度,将计划的首次公开宣布提前到今天,尽管部分关键规划仍在推进之中"。
计划列出了六条原则,其中几条针对当下痛点写得相当具体。由社区塑造的模型——邀请数学界及其支持者共同构建开源模型,研究者能够并且将会决定这些模型的训练方式、评测内容以及它们如何服务科研与教学,参与应跨越机构、地域与职业阶段向所有人开放。开放开发——模型提供开放许可的权重与代码、公开训练方法、提供可复现的评测;训练数据附带可追溯的来源与兼容的授权,共享边界会被清楚标注;模型发布时将同时报告失败与局限,而非只宣扬成功,独立团队能够复现这项工作并把模型适配到自身数学需求。数学界拥有数据——仅在获得用户明确同意、且依据事先约定条款的前提下,才使用用户数据训练或改进模型。共享知识产权——模型、代码与工具在开放许可下与社区共享(如 Apache 2.0、MIT 或 CC BY 4.0),联合开发成果的权属、许可与署名从一开始就与贡献者约定;研究者保留其独立既有成果的权属,这些成果若分享给本计划,研究者将为其数学思想与结果获得署名。开放的社区与治理——治理规则与决策公开,成员有清晰渠道提出建议、参与决策并问责领导者;与战略产业伙伴合作以提供算力等资源,但这些合作必须保持社区的研究独立性。
→ https://www.qbitai.com/2026/09/492467.html
→ https://www.sair.foundation/
🔥 3. 华为汪涛:昇腾 960DT 提前三个季度,NPO 光引擎把 4096 卡连成一台逻辑计算机,"只做好一颗芯片远远不够" — 924 pts
AI 基础设施已经进入系统工程阶段——只做好一颗芯片不够,只做一台服务器也不够,最后要交付一个高可用度的复杂系统才有价值。
华为今年全联接大会上最重磅的,首先是一组芯片时间表:昇腾 960DT 研发进度比原计划提前三个季度,单芯片算力实现倍增,960DT 支持 2 PFLOPS FP8、4 PFLOPS FP4,HBM 容量最高 288GB、带宽 9.6TB/s;对应的昇腾 960 超节点做到 4096 张 NPU 卡,最高 8 EFLOPS FP8 算力、超过 1PB HBM 容量。华为轮值董事长汪涛把后续路线一并摊开:2028 年昇腾 970、2029 年昇腾 980,未来几年保持"一年一代"的演进节奏。他在会后接受专访时把这个变化说得很直白:"从今年开始,950、960、970、980 连续几代,未来几年我们坚持一年一代,走入了快速演进的节奏。这也是国内半导体制造、封装的上下游配套全部打通之后才实现的。"关于节奏的可信度,他透露 960 芯片已经在实验室测了好几个月——"芯片从立项到产品化往往要三年,我们任何一次发布,都是产品已经在实验室反复测试、有准确交付时间之后才做"。
但华为这次想讲的显然不只是一颗更快的芯片。华为把突破口放到了规模算力上:910C 是 384 卡,950 做到 1024 卡,960 进一步扩到 4096 卡,并通过跨物理节点的统一内存编址,让多颗 NPU 互联起来更接近一台逻辑计算机。汪涛提到,华为从仿真训练里看到,在同样十万卡集群下,4096 卡超节点组成的集群相对传统八卡服务器组成的集群,MFU 可提升 2.75 倍(MFU 可简单理解为大模型真正吃到多少理论算力,集群越大,通信、同步、故障越容易把峰值性能吃掉)。他因此反复强调,AI 基础设施已经进入系统工程阶段,"只做好一颗芯片远远不够,只做一台服务器也不够,最后要交付一个高可用度的复杂系统才有价值"。谈到华为在这一轮算力竞争中的位置,他的判断很鲜明:"要做好这么大的超节点集群,需要通信技术、IP、光模块、算力、系统,华为干了 30 年,每个领域都有长期大规模研发投资。把这些能力全部聚在一个团队里,似乎只有华为。"
960 超节点这一代最硬的新增技术是 NPO(近封装光学)。NPO 把负责光电转换的"光引擎"往芯片附近推进,相当于"让电少跑一点,让光早点接手",从而降低高速互联的传输损耗和功耗——卡越多,芯片之间数据交换越频繁,互联能力就越容易从配角变成决定整个系统效率的关键。昇腾 960 是业界首个采用 NPO 光引擎的超节点,华为用这套架构做的产品是 Hi-ONE 光引擎:单引擎集成 36 路 200G,总传输容量 7.2Tbps,并把光源直接内置。汪涛把 Hi-ONE 的领先性概括为"三个第一"——第一个规模商用的(大家还在实验室阶段)、最大的带宽(36 路 200G 集成)、唯一内置光源的。值得注意的是,华为没有直接一步走向 CPO(共封装光学),汪涛解释得很具体:"CPO 把光引擎和主芯片放一起,光引擎坏了整个主芯片就报废,可用度差,故障成本极高,对封装厂要求也高。现在 NPO 的 TCO 至少比 CPO 低 40% 以上,当前 NPO 是工程、成本各方面综合最佳选择。"他对 CPO 的态度很开放——未来若解决了可靠性、良率问题,华为也可能转向。(本条与 9 月 18 日本刊第 5 条华为 Peerium 计算架构为同一大会的延续报道,角度不同:本条为芯片路线与专访细节。)
→ https://www.qbitai.com/2026/09/492476.html
🔥 4. JEPA-Anything:一个预测核心跨七类系统验证,行星轨迹里跑出开普勒第三定律(拟合斜率 −1.4991,R² = 0.99999999) — 900 pts
天气、分子、细胞、病人、机器人乃至行星各自遵循完全不同的规律,但 AI 在理解它们"如何变化"时,有没有可能共享一套更底层的方法?
PhAI Labs 联合牛津、斯坦福、普林斯顿、港中文等高校团队最新发布的 JEPA-Anything,尝试回答这个问题:它是一个面向不同"世界"学习预测模型的跨领域框架——每个领域保留自己的观测形式、context-target 构造和编码器,但共享后面的预测核心以及一套统一的 latent world-state interface。其中涉及一个叫 OPF(Orthogonal Predictive Factorization,正交预测分解)的关键机制,可以先简单理解为:别把世间各种各样的变化全都堆在一块去学习建模。
问题意识来自标准 JEPA 的局限。JEPA(Joint-Embedding Predictive Architecture)相比直接在原始空间重建目标状态,选择在表征空间做预测,不必还原每一个像素或细节——它把观测信息先编码为隐空间内部表征,再在表征空间内完成预测,从而把更多表征能力留给具有预测价值的结构,减少纹理、噪声等原始空间细节的干扰。但标准 JEPA 通常让信息全部汇入同一个 target embedding,走同一条预测路径,而现实世界的变化往往不是单线程的:分子的整体平移往往伴随内部原子的微观振动;宏观气象系统的缓慢演变中夹杂着剧烈的局部扰动;生物系统则更为复杂,多尺度、多通路的变化时刻在同步发生。当不同尺度、不同实体、不同难度的信号强行挤在一起时,那些更容易预测、变化更显著的信号可能优先占据更多预测容量,而那些相对微弱却同样关键的信息,要么在梯度冲突中被抵消,要么被强信号彻底掩盖——研究人员将其归结为一个"预测容量如何分配"的问题。
解法是空间解耦。OPF 将原本完整的目标状态切割为多个彼此互补的子空间,交由不同的预测分支独立处理,最终再拼回完整的世界状态;为防止多分支演变为"多套人马学同一件事"的冗余状态,OPF 引入正交约束,让不同 factor 尽量占据互不重叠的预测方向,同时通过因子活性约束和编码器方差约束,避免部分 factor 失活并降低表示坍缩风险。值得注意的是,这些 factor 并没有被预先规定"你负责速度""你负责温度""你负责某条生物通路",它们学什么由数据中的可预测结构决定;训练完成后,这些 factor 也因此留下了一个可供后续分析的内部接口。
这条"内部接口"正是实验设计最巧的地方:论文里出现了两个看起来风马牛不相及的研究对象。其一是患者来源的类器官——研究者利用模型学到的内部因子,提出了细胞因子联合抗体阻断的干预方案,并经细胞系、类器官、小鼠实验层层验证;其二是宏观宇宙——研究者把模拟的行星位置和速度轨迹喂给模型,不告诉它开普勒定律,等它学完后分析其内部的预测模式,提取出的"轨道频率—半长轴"关系拟合斜率 −1.4991(开普勒第三定律理论值为 −1.5),R² = 0.99999999。肿瘤研究和行星轨道计算,两个八竿子打不着的领域用同一种预测学习方法搞定——这就是"同一预测核心,跨七类系统验证"的含义。
→ https://www.qbitai.com/2026/09/492429.html
🔥 5. Jev 生态第二天继续加速:旗舰一天再涨 47%,社区已经做出"nano 复刻版"并自带端到端训练管线 — 876 pts
前一天它还只是简报里的一行脚注,今天这个生态里出现了比"用 API"更重要的一件事——有人开始自己训了。
这条线索继昨天之后继续加速。昨天本刊记录 browser-use/jev-ultrafast 从 ★842 冲到 ★4637,今天它涨到 ★6845(fork 433),单日再涨 47.6%;tamaratran/fast-jev-compaction 从 ★2618 到 ★3807,TheoLeeCJ/SemIf 从 ★1460 到 ★1740,jarrodwatts/jev-trader 从 ★775 到 ★1034,vinnylarouge/jevlike 从 ★837 到 ★935——生态里每个仓库都在同一天同步上涨,这比单个仓库爆红更能说明问题。
但今天真正的新变量是 TianyuCodings/NanoJev(★669,MIT,Python),其描述是"A nano replica of Jev: parallel decisions, dynamic candidates, and an end-to-end training pipeline"。换句话说,生态的重心正在从"调用 TypeSafe 的 Jev"转向"复刻并自己训练一个决策模型":昨天社区的关注点还是怎么把这个 API 接进 Claude Code、接进浏览器、接进交易机器人,今天已经出现了带完整训练管线的开源复刻版。与之呼应的是同期冒出的 zhengkid/Dream-RSI(★832),标题为《Dream-RSI: Recursive Self-Improvement through Evolving Worlds》——把"演化世界里的预测学习"与递归自我改进放在同一个框架下。
把这一串放在一起看,"决策模型"正在从一家公司的产品,变成一个社区可以自己训练、自己分发的模型类别。而这恰好与今天第 1 条形成一组耐人寻味的对照:前沿实验室在公开讨论是否该放慢能力提升的速度,而开源社区则在用几百个星的速度把一个更小、更可控、只输出类型化判断(Choice / Score / Noul + 校准概率,不生成文本)的模型类别做成了生态。需要如实说明的是:这一生态的全部仓库创建时间集中在 9 月 13 日至 17 日,其中最年轻的还不到一周,星数增长快但缺乏长期验证,其中的性能主张(如 7.1 秒完成订票)来自项目方自测,本刊已在昨日简报中标注其样本量与统计强度限制。
→ https://github.com/browser-use/jev-ultrafast
→ https://github.com/TianyuCodings/NanoJev
→ https://github.com/tamaratran/fast-jev-compaction
🔥 6. Nature 提出"爱因斯坦测试":把 AI 关进 1900 年、用 220 亿 token 喂出一个大脑,它能自己撞见光量子吗? — 852 pts
如果把 AI 送回 1911 年,只让它掌握爱因斯坦所能了解的知识,AI 能否在 4 年后的 1915 提出相对论?
这个听起来有些离谱的测验,来自诺奖得主、Google DeepMind 联合创始人哈萨比斯。他真正想考的是:AI 能不能仅以 1911 年的知识水平,直面当时的知识和物理难题,自己提出一套新的解释框架,并完成一套超出训练材料的推理,而不是只会照着答案复读。如果能做到,他认为这将成为检验 AGI 的一项有力测试。而这个设想最巧妙的地方在于,科学史已经告诉我们发生了什么——只要能把知识节点控制好,就有机会对照历史,观察模型有没有获得超越训练数据的推理能力。Nature 在文章中给这类测试起了个相当响亮的名字:爱因斯坦测试。
更有意思的是,还真有人动手做了。今年 3 月,独立研究者 Michael Hla 把知识截止时间进一步提前到 1900 年,从零训练了一个历史语言模型 GPT-1900,试图让它重新发现光量子、狭义相对论和广义相对论。他把项目命名为 Machina Mirabilis——借用爱因斯坦的"奇迹年"(Annus Mirabilis):1905 年,26 岁的爱因斯坦接连发表 4 篇改变物理学的论文,涉及光量子、布朗运动、狭义相对论和质能关系。为此,他借助 Andrej Karpathy 的 nanochat 训练框架,从零训练了一个 33 亿参数的 Transformer 语言模型;主要预训练材料来自 1900 年以前的书籍和报纸,总计约 220 亿 token,另收集了 2600 多部历史物理书籍、期刊和科学著作(包括牛顿的《光学》、麦克斯韦和法拉第的相关著作),形成约 2.9 亿 token 的历史物理语料。他专门清理了可能泄漏答案的数据:如果一份文献中出现"爱因斯坦""量子力学""相对论"等现代概念,整份文献都会被删除;现代人添加的前言、脚注以及明显不属于 1900 年前的词汇同样需要过滤。
结果是既惊喜又克制。Hla 给 GPT-1900 出了一道光电效应题——为什么频率不够高时,光再亮也打不出电子,而提高频率却能让电子获得更多能量——并附上几条关键线索与当时流行的经典假设,方便模型对照判断哪里出了问题。GPT-1900 真在一次回答里冒出了这样的描述:"光可能不是连续的,而是由许多彼此分离、频率不同的部分组成。" 这确实神似爱因斯坦"能量一份份传递"的解释,Hla 也把它形容为"直觉的闪现"。但千万不要急着把诺贝尔奖递过去:Hla 坦言,GPT-1900 距离"重新发现光量子"还有很远,它在大多数物理任务上都翻车了,而那些看似突破的回答,可能只是模型在拼接合理的词句,谈不上形成了真正可靠的物理理解;更何况在测试里,Hla 已经替它筛好了现象、理好了矛盾,模型要做的只是找出哪项假设可能出错——"这比科学家自己找问题、定方向可容易太多了,爱因斯坦当年可没有人替他划重点"。而且它所在的"1900 年"也不是完全密封的。Nature 因此把问题指向了一个比"AI 有没有答对"更难的层面:AI 究竟能不能创造真正的新 idea?以及它距离成为一名科学家,还差什么?
→ https://www.qbitai.com/2026/09/492550.html
🔥 7. "别再让 Agent 裸连数据库了":用 MCP + 语义网关解决 NL2SQL 的语义幻觉与权限失控 — 830 pts
只读权限让 Agent 无法胜任轻量级 CRUD;直接给 Agent 暴露数据库凭证则无异于"裸奔"——两堵墙夹出了这一层的真正需求。
在 2026 年,给 AI Agent(Cursor、Claude Desktop、Dify、Coze 等)外挂一个数据库连接,已经成为很多开发者的标配操作;从简单的官方 SQLite/MySQL MCP 到各种通用客户端扩展,让大模型"直接查库"的门槛被降得极低。然而一旦进入真实业务场景,大部分团队很快就会撞上两堵高墙:其一是语义幻觉严重——大模型根本不懂企业的"黑话"缩写、枚举字典与隐式多表关联,写出的 SQL 经常连表都 Join 错;其二是生产权限失控——直接给 Agent 暴露数据库连接凭证无异于"裸奔",更无法防范越权删改与高危全表扫描;而只读权限又导致 Agent 无法胜任轻量级 CRUD 应用。
作者从自己从传统 BI、自建 ChatBI 到开源项目 DatI(Data Intelligence)的演进实战出发,复盘了这条路的两次转向。第一阶段是 NL2DSL 的两难困境:早期模型能力有限,为了提升取数准确率,大家普遍采用"自然语言转结构化 DSL(如指标模型)"的路线,但 DSL 在提升可控性的同时,也严重扼杀了复杂即席多维分析的灵活性。第二阶段是交付形态的割裂:实际业务中用户要的往往不是一个被孤立的"问数看板",而是想把"查数与改数的能力"无缝嵌入各种日常工作流(协同办公、自动化客服、巡检机器人)。随着 Model Context Protocol (MCP) 的普及,作者找到的解法是:无需重型 BI 平台,直接把数据库封装为规范的 MCP 服务,配合轻量化的语义层与受控工具链,无缝插拔进任意 Agent。DatI 的设计哲学很克制——对接多源数据库 → 统一维护业务语义层 → 组装预置与自定义工具 → 一键发布为标准 MCP 服务;终端 Agent 挂载该 MCP 后,不仅能完成准确的只读问数,还能通过白名单机制安全执行增删改。
架构上两个决定值得单独拎出来。一是后端坚守 Java:在 AI 领域 Python 和 TypeScript 固然流行,但数据网关的底座是企业生产数据库,Java 生态中的 JDBC 标准规范与 HikariCP 连接池,在突发瞬时高并发、长连接治理、事务控制与异构驱动兼容性上历经了二十多年工业级高可用验证,其稳定性是动态语言难以企及的——目前原生支持 MySQL、PostgreSQL、ClickHouse、Doris、MariaDB 等主流关系型与分析型数据库。二是业务语义建模层:作者指出大模型在 NL2SQL 中犯错,90% 是因为缺乏业务上下文,因此 DatI 允许为表、列、枚举字典值、领域术语配置业务别名与详细描述——比如把 txn_type=1 明确绑定为"转账支出"这类具体含义,而不是让模型去猜。文中用一个"家庭双人记账与消费分析"案例走通了全流程:MySQL 三张表(account 账户表、category 类目表、transaction 流水表),开启 4 个预置工具(元数据检索、表清单、表结构详情、受控 SQL 执行且限制只允许 SELECT)与 4 个参数化自定义工具(初始化账户、记账、改账、删除流水);发布为 MCP 服务后,用户 1 在 WorkBuddy 接入、用户 2 在千问办公接入,无需重复开发后端,两个 Agent 即可复用宿主自带的 OCR 识图报销、微信远程对话、图表可视化能力。
→ https://www.oschina.net/news/502591
🔥 8. Qwen3.8-27B 把"现搓网页"干成了"秒开网页":每秒近 2000 token,6.78 秒生成一个 Google 首页——但后端没来上班 — 808 pts
Qwen 把产品、设计和前端的活打包演完了,只不过后端好像请假了。
每秒狂飙近 2000 Token,直接把"现搓网页"干成了"秒开网页",Qwen3.8-27B 最近在开发者圈中火了。工程师 Alok 把 Qwen3.8-27B 与 Cerebras 叠加起来,搭了一个脑洞大开的"AI 电脑桌面":这台电脑里的"浏览器"全程离线运行,不会从 YouTube、Google 等现成目标网站套取页面,用户只需输入网站名称和想要的年代,Qwen 就会根据自己的理解现场生成一套完整界面——想看 1999 年 Web 1.0 版 YouTube、想提前逛逛 2045 年的未来版 YouTube,都可以。最让人惊艳的是生成速度:整个"Google 首页"生成仅耗时约 6.78 秒;从"Google 首页"中搜索出"YouTube"仅用时 6.07 秒,且 AI 摘要、搜索结果和信息卡片一应俱全。
量子位随后用 API 做了两道实测来探底。实测一是给即将开周会的产品经理现场做一个数据分析"救急神器"——要求能自动识别并处理表格中的空白、重复和异常数据,汇总访问与付费用户数等核心指标,统计总营收,用柱状图呈现不同渠道的用户转化,最后交付一份校对好的 Excel 表和一份可直接汇报的 txt 总结。结果:从下达指令到工具生成全程不过 5 分钟,五项要求全部精准落地、数据分毫不差,而生成的文件只有 52KB,"随便一张手机照片都比它占内存,根本用不着费劲装 App"。实测二是让它做一个 12306 抢票页面——页面出现那一刻"差点以为 12306 连夜招了个 AI 外包":蓝白配色、车次列表、出发时间、席座价格、余票数量全部配齐,乘车人可勾选,预订按钮能正常点击,最后甚至还会弹出"购票成功"的页面。但作者拿起手机一看,实际的出行订单比钱包还干净——问题正出在这里:Qwen3.8-27B 生成的网页默认并没有联网接入 12306 的实时数据、用户账户、支付系统和真实后端,因此只要任务涉及身份验证、真实交易或外部服务,它就束手无策,只能勉强交出一个足够逼真的"外壳"企图蒙混过关。作者也指出,即便不谈那 1950 token/s 的神速,Alok 的实测同样暴露了这个问题——他生成的 YouTube 网页看起来像模像样,归根结底也只是一层皮。
→ https://www.qbitai.com/2026/09/492573.html
🔥 9. 马斯克批量收购倒闭公司数据来训 Grok:谷歌曾出价 1000 万美元想买下破产航司的业务数据 — 786 pts
以前创业公司失败,留下的是办公室、服务器、债务和一地鸡毛;现在公司可以凉,数据还能趁热再就业。
彭博社最新爆料:SpaceX 内部已经讨论过,从一些陷入困境、甚至已经倒闭的初创公司手里,购买客户信息和运营数据,用来改进自家的 AI 模型。原因也很朴素——实惠。需要说明的是,目前还没到成交那一步:彭博社称相关讨论还停留在 SpaceXAI 内部的非正式阶段,最后未必会形成交易,SpaceX 方面也未回应置评请求。但这更像是 Grok 一路训下来之后必须补上的一块拼图。此前 Grok 主要靠两类数据:一类是 X(原推特),核心塑造了 Grok 的"人格"——海量实时内容、热点争论、段子、阴阳怪气和各种碎片化表达,所以 Grok 一出生就自带互联网味儿;另一类是 AI tutors,主要由各领域专家和标注人员组成,负责给 Grok 补齐金融、科学、代码等专业能力。但这条线最近也在调整:据彭博社 6 月的消息,xAI 一度暂停 AI tutors 招聘,后来还换了团队负责人——原来带队的是 Diego Pasini(2023 年高中毕业后进入宾夕法尼亚大学,后休学加入 xAI 并参与管理 Grok 的数据标注团队),接替他的是 Jack Garabedian,一位从 SpaceX 内部调来、在 Starlink 干了多年、2021 年就加入 SpaceX 的老兵。这场换人信号已经很明确:Grok 的数据训练正在从早期冲刺转向工程化生产线。
而马斯克本人把话说得更直白——他最近在一次 SpaceX 员工会议上说:"我们会用所有 SpaceX 信息来训练 Grok,包括你们。" 也就是说,Grok 吃下的将不只是 SpaceX 的代码、文档和流程,也包括员工在工作中留下的各种痕迹。于是再看这次买倒闭公司数据,逻辑就清楚了:X 负责塑造人格,AI tutors 补专业能力,而客户信息和运营数据补的是第三块——真实业务场景:客户怎么下单、工单怎么流转、服务怎么交付、公司每天怎么运转。这些东西 X 上学不到,靠人工标注也很难规模化,最直接的来源就是一家家公司自己手里的客户信息和运营数据。问题在于正常运转的公司未必愿意卖,真要买也不会便宜,所以陷入困境、甚至已经倒闭的初创公司就成了很现实的选择。而盯上倒闭公司数据的并不止马斯克一个:更早被摆上货架的是美国廉航 Spirit Airlines(精神航空),这家公司破产重组后,一批内部业务数据进入拍卖流程,谷歌出价 1000 万美元,想买下它的去标识化业务数据、运营记录和软件代码,用来训练 AI 模型、改进产品;由于这批数据不只有航班表,还包括内部邮件、Teams 聊天、协作记录、收入、航班运营、员工生产力、审计和欺诈相关信息,这笔交易很快便因"可能泄露隐私"被搁置。抛开交易结果不谈,两家盯上倒闭公司数据是同一套逻辑:智能体要进企业干活,就得理解真实业务怎么跑——谁能拿到更多真实业务数据,谁就更有机会把模型从"会聊天"推到"能干活"。
→ https://www.qbitai.com/2026/09/492661.html
🔥 10. Agent 的"技能层与插件层"集体冲上 GitHub 热榜:从安全审计 Skill 到 8–29MB 的端侧自动化模型 — 764 pts
GitHub Trending 今日恢复正常返回,而它给出的最强信号不在模型侧,而在这批"给 Agent 装能力"的仓库上。
GitHub Trending 今日恢复正常(昨日返回 0 字节),榜单上最集中的一类是给 AI Agent 提供技能、插件与环境的仓库。必须如实说明:这些仓库都不是今天新建的——addyosmani/agent-skills 创建于 2 月、anthropics/knowledge-work-plugins 创建于 1 月、cloudflare/security-audit-skill 创建于 6 月,它们是老项目今日重新上榜,因此本条讲的是"生态重心"而不是"今日上新"。
具体来看:cloudflare/security-audit-skill(★15,174,MIT,JavaScript) 定位是"一个用于多阶段安全审计的编码 Agent 技能,产出可被机器读取、可独立验证的审计结论"——把安全审计从"人读报告"变成"Agent 出结构化结论";addyosmani/agent-skills(★96,709,MIT) 是"面向 AI 编码 Agent 的生产级工程技能"集合,接近十万星的体量说明"给 Agent 写技能"已经成为一门独立的工程实践;anthropics/knowledge-work-plugins(★24,991,Apache-2.0,Python,今日仍有推送) 是 Anthropic 为知识工作者在 Claude Cowork 中使用而开源的插件仓库,与本周 Claude 双入口合并、原生 Office 上线的动作方向一致;coder/coder(★15,457,Go,AGPL-3.0) 的定位已改成"为开发者和他们的 Agent 提供安全环境",说明开发环境厂商正在把 Agent 当作一等公民纳入隔离与权限设计。
其中最值得单独记一笔的是 cactus-compute/needle(★11,432,Apache-2.0,Python)——"面向微型设备的自动化基础模型:2-bit、8–29 MB、支持工具调用与结构化抽取"。它和上面几个方向不同:不是给云端 Agent 加技能,而是把"会调用工具"这件事压到 8 到 29 兆的体量、用 2-bit 量化塞进极小设备。把它与本周另一条线放在一起看会更有意思——昨天 Qwen3.8-Omni-Flash 在云端做"按需感知"、今天 Qwen3.8-27B 在 Cerebras 上以近 2000 token/s 现搓网页,而 needle 走的是完全相反的一极:不追求通用,只追求在极小的内存里可靠地完成"该调哪个工具、该抽出什么字段"这类决策——这与 Jev 的"只输出类型化决策、不生成文本"其实是同一个思路在硬件尺度上的投影。此外榜单上还有 yynxxxxx/Codex-X(★3,322,MIT,Rust,OpenAI Codex 桌面端/CLI 的可视化管理工具,支持 Provider/API 切换、会话同步、提示词注入、Skills/MCP 管理与 TOML 配置可视化)、docling-project/docling(文档转 gen AI 可用格式)、cloudflare/quiche、ruanyf/weekly 等。
→ https://github.com/cloudflare/security-audit-skill
→ https://github.com/addyosmani/agent-skills
→ https://github.com/anthropics/knowledge-work-plugins
→ https://github.com/cactus-compute/needle
📌 今日趋势总览
本文原创作者:易君召,详见:https://www.yijunzhao.cn/authors/yijunzhao,转载请注明出处。
原文链接
欢迎访问 小易撩挨踢