今天 AI coding 赛道的主线是「成本」二字:Anthropic 与 OpenAI 同日发新模型并同步降价,Grok 4.7 用极低单价冲击价格带,而两份工程报告则指出真正被 Agent 拖垮的其实是验证环节。具身智能这边,行业注意力正式从「本体」转向「大脑」,模型密集上新;与此同时 NVIDIA 与 Google 在同一周用开源争夺机器人软件栈的定义权。
Claude Opus 5.5 与 GPT-6 Sol/Luna 同日发布,前沿模型价格战开打
美西时间 9 月 22 日,Anthropic 发布 Claude Opus 5.5,OpenAI 同日推出 GPT-6 Sol 与 GPT-6 Luna,两家正面交锋。Opus 5.5 是「5.5 系列」首款产品,定价每百万输入 Token 4 美元、输出 20 美元,较 Opus 5 下调 20%,缓存读取低至 0.2 美元;Anthropic 称其在大多数任务上追平自家最强模型 Fable 5.1,而默认设置下典型负载成本比 Opus 5 低 40%(单价降 + 单任务 Token 更少),输出速度提升 30% 以上。编程基准方面,官方数据在 CursorBench 4.0 上以默认推理强度得到 52.5% 至 57.8%,领先 GPT-5.6 Sol 的 41.7% 约 11 分,而单任务成本仅为其约三分之一;Terminal-Bench 4.0 达 66.4%,FrontierCode v1.1 主集 54.4%。OpenAI 一侧,GPT-6 Sol 定价 2 美元/10 美元,较 GPT-5.6 Sol 促销价再降 50%,出错率约为前代一半;GPT-6 Luna 低至 0.1 美元/0.5 美元,官方称在较高推理强度下可达 GPT-5.6 Sol 水平而成本仅约百分之一。Sonnet 5.5 与 Haiku 5.5 将在未来数周推出。
值得关注:这场发布真正的信号不是「又一个更强模型」,而是前沿能力的定价基准被系统性下移——$4/$20 拿到一年前旗舰级表现,意味着 Agent 长时程任务的经济性发生了结构性变化。对做 Agent 编排的人来说,Opus 5.5 的「每任务 Token 更少」比单价下调更关键:它把成本优化从「换便宜模型」转向「单位任务消耗」,这与昨天 Jev 决策型模型的思路是同一条脉络。内部测试里 Opus 5.5 与 Fable 5.1 各自把 HAProxy 从 C 翻译成 Rust,两者几乎通过全部回归测试,Opus 5.5 用时 9.5 小时对 12 小时、成本低 51%,这类「同等质量下时间与成本双降」的数据比榜单分数更有参考价值。需要注意的是:基准分数多为厂商自测,CursorBench 4.0 的 52.5%(默认强度)与 57.8%(最大强度)两个数字并存说明分数对推理强度高度敏感;另外 Opus 5.5 强制开启思考、不支持停用,旧版 computer_20251124 工具不再被接受,升级时存在破坏性变更。
来源:Anthropic 官方 Claude Opus 5.5 | 财联社(经腾讯新闻转载) | AI/TLDR 模型页 | LLM Stats 分析
Grok 4.7 上市:$2/$6 的低价标签背后是翻倍的 Token 消耗
SpaceXAI 于 9 月 21 日发布 Grok 4.7,定价与 Grok 4.6 持平,为每百万输入 Token 2 美元、输出 6 美元,Fast 变体为 4 美元/12 美元(输出速度翻倍),上下文窗口 50 万 Token。官方称其基于更大的基座模型,并做了更长、更偏向「需要数小时完成」的难题的强化学习训练,重点提升自我校验与长上下文处理能力。编程相关成绩:CursorBench 4.0 从 40.4% 升至 46.3%,Terminal-Bench 4.0 从 20.3% 近乎翻倍至 38.0%,DeepSWE v1.1 高推理强度下 71.0%,均优于 Grok 4.6;但在 SpaceXAI 自己的对比表中,CursorBench 与 Terminal-Bench 两项仍落后于 Fable 5.1(51.8% / 57.9%),Harvey 法律 Agent 基准仅 19.6%。关键的反面数据来自 Artificial Analysis:Grok 4.7 在 xHigh 推理强度下,Intelligence Index 单个任务消耗约 8.1 万输出 Token,而 Grok 4.6 High 模式仅约 3.6 万,增幅 125%;换算下来同一任务在 Grok 4.7 上约 3.74 美元,反而高于 GPT-5.6 Sol 的约 1.99 美元。
值得关注:这条新闻的价值在于它戳破了「单价即成本」的直觉误区。Agentic 编码工作负载以输出 Token 为主,一个每次调用多吐一倍 Token 的模型,即便单价只有对手的五分之一,最终账单也可能更贵。对团队选型而言,正确的度量单位是「每完成一次任务/每合并一个 PR 的成本」,而不是每百万 Token 价格——这与 Opus 5.5 主打「单任务 Token 更少」恰好构成对照,两种截然不同的成本优化路线在同一周摆到了台面上。此外要留意 Grok 4.7 的能力分布很不均匀:DeepSWE 71% 说明它在有界的代码修复任务上很强,Terminal-Bench 38% 说明它驱动长时程终端会话仍不可靠,19.6% 的法律 Agent 分数则明确表示不能用于合规审查类场景。厂商自测榜单未注明对比数据来源与测试 harness,落地前务必用自己的仓库跑一轮。
来源:TechRepublic | DataNorth AI | World Programming | All Things Elon
两份工程报告同时指向同一件事:Agent 的瓶颈已经从「生成」转向「验证」
Linear 于 9 月 21 日发布工程博客《AI coding has made CI a bottleneck》,披露其测试套件自年初以来近乎翻了四倍,代码库每周净增约 2000 个测试,Agent 产出代码的速度超过了验证系统能承受的速度。他们的改造是一系列可复用的工程细节:从 GitHub 托管 runner 换成更强的第三方机器,作业平均快 34%;切换到原生 tsgo 编译器,tsc 检查的周中位数下降 73%;把依赖 TypeScript 类型信息的自定义 lint 规则改写为纯 AST 检查,使 ESLint 完全剥离 TypeScript,API lint 时间下降 68%;限深 checkout 把最慢的变更检测门禁从 94 秒压到 20 秒;把缓存标记写入移出合并关键路径,每个 API PR 省 42 秒;数据库初始化从重放迁移改为加载 schema 快照,单容器 12 秒降到 1-2 秒。最反直觉的一项:Vitest 默认 isolate: true 会在每个测试分片里重建实体、GraphQL 与装饰器图,改为按文件 opt-in 的 isolate: false 后,最慢分片从约 300-380 秒降到约 195 秒,贡献了约 17% 的月度节省。Salesforce 工程师 Appajodu 与 Boyapati 则从另一端报告:代码量增长约 30% 后,PR 经常超过 20 个文件、1000 行改动,评审延迟逐季度攀升,而最危险的信号是——最大型 PR 的评审耗时出现平台期甚至下降,他们将其解读为评审者已不再真正参与审阅。
值得关注:两份报告从相反方向撞到了同一堵墙——Linear 的瓶颈是机械性的、可以用钱和工程手段解决;Salesforce 的瓶颈是认知性的、必须重构评审系统本身(围绕「重建意图」、把上下文当作一等依赖、按风险渐进式披露)。对任何正在上 Agent 的团队,这是一个可以直接自查的诊断框架:如果 PR 卡在等绿灯、runner 费用飙升,你遇到的是 Linear 问题,答案是加速流水线;如果大改动一路畅通而评审耗时持平、资深工程师整天在切换上下文,你遇到的是 Salesforce 问题,答案是改变评审呈现方式。两者解法不可互换。更值得注意的是行业指标的选择——大多数团队在追踪周期时间和生成吞吐量,而真正该盯的是「一个变更等待被判定的时间」和「最大型 PR 的评审耗时」,后者持平不是效率提升,而是 scrutiny 下降的隐蔽信号。Linear 那句观察也值得记住:Agent 花在「收集信息」上的时间远多于「写代码」,大规模 Agent 工作更像是迭代式调查而非代码喷涌。
来源:Developers Digest Daily Brief | Web Pulse 综合报道 | ShortSingh
具身智能密集发布模型,行业焦点从「躯干」正式转向「大脑」
中国证券报 9 月 23 日报道,具身模型近期密集上新,行业关注点正从机器人本体转向「大脑」。Figure 于当地时间 9 月 17 日发布神经网络模型 Helix 2.5,搭载该模型的 Figure 03 可在陌生环境自主作业、穿过狭小空间、整理客厅与床铺,Figure 称其用更少的专用数据实现了更强泛化性。国内方面,宇树科技 9 月 10 日发布并开源新一代通用人形机器人基础模型 UnifoLM-WLA-1.0,融合以交互为中心的世界建模技术,可驱动机器人完成 64 项操作任务(收纳工具箱、叠毛巾、向洗衣机投放衣物等);松延动力 9 月 8 日发布首个自研具身模型 HERON-World Model,9 月 15 日再发 HERON-CRA。松延动力创始人姜哲源表示,公司大部分投入已流向模型研发部门,并给出「数据配方」:以第一视角无本体采集数据为底座,结合仿真数据与真机遥操作数据,模型能力达到拐点预计至少需要百万小时量级数据。训练路径上还出现了新形态——今年 9 月,北京他山科技与 2024 年图灵奖得主、「强化学习之父」Richard Sutton 团队 Openmind 联合共建的机器人强化学习实验场正式启用,让不同形态机器人在真实场地中长时间自主交互,第一阶段以「延长在线时间」「减少损伤」为目标并自主完成充电。资本侧同步印证:IT 桔子数据显示 2026 年至今国内获融资的具身模型公司超 140 家,为去年同期 1.5 倍,融资总额超 1000 亿元,为去年同期三倍多。
值得关注:姜哲源那句「本体在成本、可靠性、性能上已准备就绪,现在是补齐大脑短板的合适时机」,基本可以视作行业阶段切换的宣言——2023-2024 年具身模型技术路线分散,如今「世界模型与 VLA 路线融合」已形成阶段性共识。三个信号尤其值得数仓与数据从业者留意:一是数据被明确为瓶颈,松延动力给出「百万小时量级」的量化门槛,且强调多样性优先,这意味着采集、清洗、标注、评估这条数据基础设施链的价值正在快速抬升;二是真实世界与仿真数据的对齐问题被点名为泛化能力的根本障碍(浙江人形机器人创新中心熊蓉提出视-力-触融合统一表征),这是当前最硬的技术卡点;三是 Sutton 团队参与的真实环境强化学习实验场,代表「在物理世界中自主学习」这条路线开始有实体载体,与纯遥操数据路线形成分野。王兴兴给出的「ChatGPT 时刻」标准很具体——机器人部署到陌生家庭环境后通过语音指令可完成 80% 任务,他判断快则两三年、慢则五到十年;而极佳视界朱政的反面意见同样值得听:具身模型可能不存在某个「令人惊喜的瞬间」,只能在持续交互中演进。
NVIDIA Isaac ROS 5.0 与 Google Intrinsic 同周开源,机器人软件栈定义权之争升温
NVIDIA 于 9 月 22 日在多伦多 ROSCon 大会发布 Isaac ROS 5.0,面向全球近 130 万 ROS 用户,新增对 ROS 2 Lyrical Luth 与 Ubuntu 24.04 的支持,并把 AI Agent 直接引入机器人开发流程。技术核心是 NVIDIA 向 Open Source Robotics Alliance 上游贡献的标准数据处理接口 rosidl::buffer,其 CUDA 后端实现可在同主机、同 CUDA 设备、同 Linux 用户且 RMW 受支持的条件下,让节点间以零拷贝方式传递 GPU 常驻数据,官方示意对比中 CPU 序列化基线 11 毫秒、GPU 带主机拷贝 3 毫秒、零拷贝 CUDA buffer 后端 0.5 毫秒;不满足条件时自动回落到标准 CPU 路径。配套还发布了 FoundationStereo 微调 skill、FoundationPose 的 agent-ready 推理库(官方称物体位姿跟踪提速至 5.5 倍)、独立的 pick-and-place agent skill,以及一个让编码 Agent 把既有节点迁移到 rosidl::buffer 的结构化 skill。同期,Google 旗下 Intrinsic 开源了 Intrinsic Core 套件,包含感知、运动规划、技能学习库与仿真环境,并与 ROS 2、MoveIt 集成,其 Open Machine Tending 参考应用内置 FoundationPose 兼容。Magna、Mentee Robotics、Universal Robots 等已在其开发栈中集成 Isaac ROS。
值得关注:两条开源路线代表两种截然不同的平台战略——NVIDIA 走垂直整合,用开源软件绑定 Jetson 硬件(从 Orin Nano 到 Thor 全系支持),本质是复刻其在数据中心 AI 的打法;Intrinsic 走硬件无关的应用层开源,直接冲击 Fanuc、ABB、KUKA 等封闭专有工业生态,意在降低中小制造商的自动化门槛。谁能拿到开发者心智,将决定未来十年机器人软件栈的归属。但有一个必须当场指出的落差:NVIDIA 官方博客称 Isaac ROS 5.0「free and open source」,而 GitHub 仓库实际使用的是「NVIDIA ISAAC ROS SOFTWARE LICENSE」,其中包含「不得以任何方式使本软件受开源许可证约束」等条款,并声明不适用于某些安全关键场景——这与 OSI 认证的开源许可存在明显张力,商业和研究使用之前务必逐条审读许可文本。此外要注意零拷贝并非无条件保证:它是依赖后端能力的路径,而非普适承诺,取决于 peer 兼容性、locality、传输与内存能力等变量。对国内做具身数据基础设施的从业者,这两件事合起来看更有意思——传输层与模型服务层(同日还有 General Instinct 开源的 InstinctFlash,专为 VLA/扩散策略设计、声称 RTX 4090 上端到端推理低于 10 毫秒)正在同时被补齐,这恰恰说明行业瓶颈已经从「模型能不能做出来」转移到「能不能稳定、实时、低成本地跑在真机上」。
来源:Unite.AI | Agentic Tribune(含许可争议核查) | Robotics 24/7 | Robotics Daily 2026-09-23
本页的评论功能已关闭