今天 AI coding 侧出现两条方向相反的信号:一边是 Anthropic 把 Claude Code Projects 重做成云端多智能体编排中心,一边是四款主流编程代理被曝共享同一类"技能更新"供应链漏洞。具身智能侧同样热闹,Figure 用 Helix 2.5 把人形机器人零样本扔进 30 个陌生家庭,小米则开源了 38B 具身世界模型 Robotics-U0。此外,智谱披露了国内首个跑进生产环境的递归自我改进(RSI)工程实践,值得单独留意。
Figure 发布 Helix 2.5:人形机器人零样本进入 30 个陌生家庭
Figure 于 9 月 17 日发布新一代神经网络 Helix 2.5,将训练好的同一份模型权重直接带进旧金山湾区 30 个此前从未采集过数据的真实家庭,在不微调、不采集、不自适应的前提下,完成整理客厅、叠毛巾、铺床三类长程全身任务。官方数据显示,在保持任务数据、架构、训练与评测完全固定的条件下,仅靠 Figure 的人类行为数据集 Index 做预训练,零样本成功率就从 9% 提升到 56%。同时,任务特定数据用量只有上一代代表行为的一半,却把泛化范围扩大了 30 倍,即"行为指定成本降低 2 倍"。
值得关注:这条结果把人形机器人泛化能力的来源从"任务数据量"转移到了"人类行为数据预训练"。官方还给出了人类→人形迁移的缩放律:Index 预训练数据每翻一倍,下游机器人动作预测损失平滑下降,甚至能在训练前预测到小数点后四位。这意味着行业路线正从"每个场景定制"转向"基础模型 + 少量行为指定",感知、移动、操作不再能分开解耦求解。官方同时明确表示通用人形机器人尚未解决。
来源:https://www.figure.ai/news/helix-2-5-zero-shot-30-home-generalization
Claude Code 重启 Projects:从代码仓库到云端多智能体指挥中心
Anthropic 重新推出 Claude Code Projects(public beta),把原先偏静态的项目管理改造成云端多智能体编排中心。用户可以在同一个项目下同时运行多个 AI 智能体,彼此共享记忆、目标、文件与产物库;每个项目下设多条 thread 并行处理不同任务,由 coordinator 统一调度,每条 thread 本质是一个独立的 Claude Code 云端会话,在各自的 Git 分支上工作。这被看作 Anthropic 把 Managed Agents 下的多智能体编排能力向 Claude Code 侧产品化收口的动作。目前官方尚未公布并发上限、配额与定价细节。
值得关注:这是多智能体协作从"本地脚本拼装"走向"平台化编排"的标志。对需要同时推进多条工作流的工程团队来说,价值不在"更多 Agent",而在于共享记忆与产物库解决了并行 Agent 之间上下文割裂的老问题——之前多个 Agent 各干各的,合并冲突和重复劳动是主要成本。风险点同样明确:并行度上去后,权限边界、产物冲突和成本控制会比单 Agent 场景复杂一个量级。
来源:https://news.qq.com/rain/a/20260918A01NV500
四款主流 AI 编程代理曝相同供应链漏洞,技能更新机制可被劫持
网络安全初创公司 Air 独家披露,Anthropic Claude Code、OpenAI Codex、Google Gemini CLI 与 GitHub Copilot 四款主流 AI 编程代理存在相同逻辑缺陷:它们的"技能(Skills)"自动更新机制未校验内容变更,攻击者可伪装同名恶意更新绕过扫描,进而静默窃取企业代码或知识产权。该漏洞源于各厂商验证机制设计雷同,属于行业共性盲区而非某家实现失误。目前除 GitHub 外其余三家已完成修复,GitHub 称其平台机制可阻断此类攻击,但未确认补丁状态。
值得关注:这是 Agent 生态从"提示词注入"向"供应链攻击"迁移的明确信号。当 Skills / 插件成为 Agent 能力的标准扩展方式,技能仓库就变成了新的 npm——而当前行业对技能内容的变更校验、签名和来源审计普遍缺位。对企业团队来说,短期动作很具体:把第三方技能纳入依赖管理、锁定版本、禁止自动更新,并对 Agent 的出站访问做白名单。
来源:https://www.163.com/dy/article/L72S7A0D0519QIKK.html
智谱 GLM 披露国内首个 RSI 工程化实践:AI 在十万卡国产集群上自建推理系统
智谱 GLM 团队披露递归自我改进(Recursive Self-Improvement, RSI)方向的首个工程化实践:由 GLM-5.3 驱动的 Infra Agent 完成了 GLM-5.3-Flash 推理基础设施的设计、调试与优化。该 Agent 在超 10 万张国产芯片组成的集群上从零完成生产级推理服务搭建,不到两周将端到端吞吐提升至初始基线的 3 倍,硬件利用效率与单 Token 成本达到主流 NVIDIA GPU 相当水平,并支持 1M 上下文窗口与多模态请求。该系统已投入真实使用,GLM-5.3-Flash 以匿名模型 Ox-Alpha 在 OpenCode、OpenRouter 上线,6 天 Token 调用量超过 62 万亿。
值得关注:这是国内大模型厂商首次公开将"AI 自我改进"用于生产环境。真正的变化不在性能数字,而在 Agent 的能力边界——它已能围绕推理系统完成完整工程闭环:自主分析性能瓶颈、定位精度缺陷、修改底层代码、执行分层测试、根据反馈迭代。智谱首席科学家唐杰的表述很克制:距真正的 RSI 仍远,但"模型优化系统,系统服务模型"的最小循环已经出现。对做数据基础设施的人来说,这条路的终局是模型研发效率本身成为竞争对象。
来源:https://www.ithome.com/1/003/705.htm
小米开源具身世界模型 Robotics-U0,38B 权重与训练推理工具全开放
小米开源了 Xiaomi-Robotics-U0,一个自回归具身世界基础模型,提供约 4B 与 38B 两条参数线,连同训练与推理工具一并开放。模型在单一 next-token 框架下统一了文生图、任意图编辑、多视角具身场景生成、可控具身迁移与具身视频 rollout,架构基于 Qwen3-32B 与 EMU3.5 血统组件,采用 IBQ 图像分词。效率方面,FlashAR+ 用反对角线并行生成替代逐 token 串行解码,配合 vLLM 批处理,1024×1024 生成延迟从约 450.8 秒压缩到 5.44 秒(约 83 倍加速)。它以 EWMScore_P 73.64 在 WorldArena 的 100 多个模型中排名第一;下游用合成的风格迁移数据混入真机示范集做策略后训练,把 π₀.₅ 在未见背景与光照下的任务完成度从 36.9% 提到 63.2%。
值得关注:具身智能的核心瓶颈之一是数据——真机示范采集慢、贵、覆盖窄。小米这套模型的定位不是"更强的机器人策略",而是可扩展的下游策略数据引擎:用世界模型批量合成 OOD 场景数据,再反哺真机策略。83 倍加速把迭代周期从天压到小时级,对高校和小团队尤其关键。需要注意的是,视频生成 checkpoint 仍落后于图像与迁移版本,且用于生产前应先核实许可条款与第三方 WorldArena 结果的可复现性。
来源:https://pandaily.com/xiaomi-robotics-u0-open-source-embodied-world-model
本页的评论功能已关闭