🔥 1. 百度文心助手任务Agent登顶PinchBench v2全球第一,超越Claude/GPT拿下智能体冠军 — 980 pts
7月22日,百度文心助手任务Agent以最高分94.6%、平均分94.4%的成绩登顶全球工程向AI智能体评测榜单PinchBench v2,成为首个以正式产品身份获得该榜第一的国产智能体系统。在59个参评模型中,文心助手任务Agent领先Anthropic Claude Opus 4.8-fast(93.5%)、阿里通义千问Qwen3.7-max(92.5%)、Anthropic Claude Opus 4.8(90.5%)、OpenAI GPT-5.6-luna(88.7%)。PinchBench与传统基准(如MMLU、GPQA)的最大区别在于:传统基准考"模型知不知道",PinchBench考"智能体能不能把整件事做完并交付可验证的结果"。当前版本包含23个真实工作场景、147项任务,覆盖数据分析、代码开发、安全工程、法律合同分析等七大类别。这是一次模型能力与系统工程协同的综合比拼,标志着Agent框架工程能力的重要性正在超越单纯的模型参数比拼。
→ https://www.qbitai.com/2026/07/457117.html
🔥 2. 小红书大模型dots-note-3.0在IMO 2026满分夺金,中国大模型首次获此认证 — 960 pts
IMO 2026成绩出炉,小红书大模型dots-note-3.0六道题全部答对,以满分42分的成绩斩获金牌。这是中国大模型首次获得IMO官方金牌水平认证,也是继谷歌Gemini模型之后全球第二个达到该成绩的大模型。更令人惊讶的是,谷歌当年也只答对了5/6,小红书是满分。dots-note-3.0仅用自然语言就完成了从读题、解析到写证明的全过程,并在第三题上创新地提出了非常规解法——双CMO金牌得主评价"简洁明了直击本质"。IMO考的是"未知"——赛题在比赛前严格保密、实时参与、官方第三方评审,因此是对大模型真正通用推理能力的硬核考验。此外dots-note-3.0采用智能体方式,使用自然语言结合Python代码执行来推理解题,并借助递归自我批判能力审视论证,这代表了可迁移的通用推理能力。
→ https://www.qbitai.com/2026/07/456061.html
🔥 3. WAIC 2026十大趋势:AI Chat已平常,"Show me the Agent"才是新王道 — 940 pts
量子位在WAIC 2026现场总结出十大核心趋势。最核心的信号是:AI Chat已平常,能干活能交付才是新王道。70%展商将Agent作为默认展示主题——百度将通用智能体"百度搭子"带到现场,腾讯集中展示出行、办公等多类智能体,金山办公推出灵犀专业版,阶跃星辰将智能体操作系统引入手机与汽车。十大趋势还包括:WAIC变成中国AI世界杯(Kimi K3、商汤SenseNova-U1 Pro集中发布);AI软硬件底子都硬了,展台从单向演示变为互动体验;基座模型进入半决赛"基模生六虎,虎虎已不同";世界模型成为物理AI风口第一赛道;国产算力告别单芯片主角、超节点和算网生态定胜负;40万人次涌入WAIC现场,用户生态优势独一无二。中国AI从此有了自己的年度排片表。
→ https://www.qbitai.com/2026/07/456974.html
🔥 4. 物理AI闭环跑通:日冕开物+远图宣布万台级具身智能部署计划 — 920 pts
在WAIC上,专注物理世界基础模型的日冕开物公司与全球服务器制造龙头远图宣布超级工站战略合作,目标直指万台级部署。日冕的LaMPA世界模型基础架构可在半小时内让机器人适配全新环境——展馆现场仅训练30分钟即完成全部适配。LaMPA与传统WAM的三个核心差异化在于:增加更丰富的物理表征、统一跨模态隐空间学习物理规律、强化学习所需奖励函数和专家策略全部由模型直接生成。日冕团队成立仅4个月,但创始人均为清华博士,曾任蔚来、华为、智元机器人等企业。双方规划2027年完成百台级部署,未来实现万台级具身智能产品部署,目标是从替代单个工序到让机器人完成工艺理解、任务规划、执行反馈、持续优化的完整闭环。具身智能不再是Demo阶段,正在迈入真实的工业生产。
→ https://www.qbitai.com/2026/07/456728.html
🔥 5. 联影智能发布"元医院"战略:不是替代医生,而是给医院装上超强buff — 890 pts
联影智能在WAIC 2026上首次发布"元医院"战略。这不是建虚拟医院或替代医生,而是以多模态大模型、数智孪生、具身智能、云平台等技术重构医院的运营模式,把零散AI工具整合为全院协同的智能体系。元医院与元宇宙完全不同——后者构建虚拟空间,前者增强现实医疗体系。"元技术"包括多模态大模型、数智孪生、智能可穿戴、云平台等。元医院的四大核心能力:数据底座(整合影像、病历、检验等多源数据)、模型能力(医疗大模型理解医疗流程)、智能体调度(多Agent协同完成诊疗任务)、临床验证。联影智能此前已开源uAI Nexus MedVLM多模态医疗大模型。这一战略标志着AI医疗从"单点工具"进入了"系统化运营重构"的新阶段。
→ https://www.qbitai.com/2026/07/456555.html
🔥 6. 太初元碁发布T2 Ultra芯片:业内首款超算+智算融合计算底座 — 870 pts
太初元碁在WAIC上发布新一代国产AI自研芯片T2 Ultra和超智融合计算系统HyperIntelliX。T2 Ultra采用HCU异构融合计算架构,将CPU和AI算力核放在同一条高速总线上,支持M:N可重构配比,既可作为独立算力节点部署在边缘场景,也能作为加速卡插进大型集群。性能参数方面:HPC算力(FP64)38 TFLOPS可满足科学计算需求,FP4算力高达4800 TFLOPS(稀疏)。值得注意的是,T2 Ultra的设计响应了Agentic AI时代的算力需求变化——AMD CEO苏姿丰此前指出CPU与GPU数量正从一对多趋近一比一。HyperIntelliX同时支撑AI推理和AI4S(AI for Science),已在气象预测、量子经典模拟、虚拟药物筛选三个方向落地。
→ https://www.qbitai.com/2026/07/457054.html
🔥 7. 酷哇科技发布COOWAM行业首个双层智能体世界模型,机器狗X0首秀 — 850 pts
酷哇科技在WAIC上披露行业首个双层智能体世界模型架构COOWAM(Co-Optimized World Action Model)。其核心洞见是:Physical Agent面对的是两个耦合的世界——遵循物理规律的自然世界和遵循社会规则的人类世界。COOWAM架构包含两层:CooWAIM(交互式世界动作模型)处理物理规律,聚焦0~4秒短时未来窗口;Urban VLM(人类社会世界模型)负责理解任务语义、行业SOP和生产力价值。酷哇CTO廖文龙指出,机器人至少需要三种能力:理解自然规律、在行动前推演结果、认知人类社会规则。现场由COOWAM驱动的机械臂自主完成了"夏日特调"饮品制作(西瓜切块、拧瓶盖、调比例等长程操作)。同时首款重载型四足机器狗X0亮相,68kg负重、全地形行走,已进入城市运维场景部署阶段。
→ https://www.qbitai.com/2026/07/456178.html
🔥 8. 天立启鸣发布《世界模型驱动的教育AGI白皮书》,已落地107所学校 — 820 pts
天立国际、启鸣达人联合AIII人工智能国际研究院、北航等机构在WAIC上联合发布《世界模型驱动的教育AGI白皮书——从认知仿真到教育智能体的范式跃迁》。白皮书提出以认知世界模型(CWM)为底座,以LAM(学习评估建模)闭环为范式的教育AGI技术路线。核心创新在于教育仿真器、教育规划器、教育渲染器三位一体融合架构——仿真器模拟知识习得和认知负荷波动,规划器推演上万条教学路径,渲染器生成多模态教学体验。白皮书还提出"认知共生"的人机关系主张以及教育行业专属"智价比(Edu-TokenROI)"指标。截至目前,天立启鸣AI学伴大模型已落地107所学校、服务25万+师生,教育世界模型的工程验证建立在真实教学场景与数据之上。
→ https://www.qbitai.com/2026/07/457040.html
🔥 9. Halliday发布第二代AI眼镜G2:从"记录会议"走向"实时辅助会议" — 800 pts
7月21日,AI眼镜品牌Halliday正式发布第二代产品Halliday G2,核心围绕全新的Meeting Flow体验打造。G2采用无摄像头设计,双目光波导显示(峰值亮度1600nits),将实时字幕、翻译、话题追踪、决策确认等能力直接呈现在用户视野中。关键突破在于AI会议工具从"记录和总结过去"转向"在会议进行中实时辅助"——配备了4麦克风阵列支持2米范围语音拾取并区分说话者,支持超过45种语言实时翻译,续航超过12小时。Halliday G2订金10美元,预计2026年9月发货。这一产品定位代表了AI可穿戴设备从"智能设备"回归"日常眼镜"的重要趋势。
→ https://www.qbitai.com/2026/07/457049.html
🔥 10. "香港"NVIDIA发布Physical AI仿真综述,昆仑万维黎曼动力首秀登顶RoboCasa — 780 pts
NVIDIA在HuggingFace官方博客发表《The State of Simulation for Physical AI: An Overview》,系统梳理了物理AI仿真的最新进展。与此同时,昆仑万维旗下黎曼动力发布Riemann-1.0,在机器人"家务大考"RoboCasa-365上以62.6%登顶,比之前的SOTA高出8.4个百分点。其秘诀在于训练数据中占大头的不是机器人数据,而是23.2万小时的人类第一视角视频(人做饭、叠衣服、整理房间)。这背后是具身智能领域正在形成的共识:先用大规模人类视频做预训练让模型"攒够物理直觉",再用少量真实机器人数据做动作对齐。英伟达西雅图实验室此前发表的综述指出,World Action Model已迅速成长为基础模型第二条主路线,下一代机器人大模型大概率是VLA和世界模型的混合体。
→ https://hf-mirror.com/blog/nvidia/state-of-simulation-for-physical-ai
→ https://www.qbitai.com/2026/07/454592.html
📌 今日趋势一览