今日 AI 行业的两条主线在「能力边界」与「数据基础设施」上形成对照。AI Coding 侧,谷歌向全体工程师开放 Claude Opus 5,头部云厂商的编码工具选型正式从「自研优先」转向「按能力择优」;新基准 Real-SWE 把编码 Agent 放入企业私有代码库,最强模型成功率仍只有 38.8%。具身智能侧,全球首张机器人专用 SIM 卡与「具身智能机器人应用技术员」国家新职业同期落地,数据生产与回流正在被基础设施化、职业化。
谷歌向全体工程师开放 Claude Opus 5,Antigravity 成统一入口
9 月 15 日消息,据 Business Insider 等多家媒体援引内部消息人士与官方信息报道,谷歌近期调整内部政策,通过自研的内部开发平台 Antigravity 向全体工程师开放 Anthropic 旗下编码大模型 Opus 5 的使用权限。此前谷歌长期禁止多数员工使用 Claude Code、OpenAI Codex 等外部第三方编码工具,要求内部开发优先使用自研 Gemini;Claude 的权限仅面向 DeepMind 旗下少数核心团队开放。新规下,所有谷歌工程师均可在内部版 Antigravity 中访问 Opus 5,使用行为在平台统一管控下完成,不存在数据外溢。谷歌发言人回应称,Claude 在内部体系中的定位是 Gemini 的补充而非替代,第三方模型按用户配额管控,仅用于支撑 Gemini 无法覆盖的细分场景。
值得关注:政策的实质让步来自能力差距——尽管谷歌已投入数十亿美元迭代 Gemini,近期也推出了性能升级的 Gemini Flash 3.8,但多名内部工程师仍反馈其代码编写能力与 Anthropic、OpenAI 同级别产品存在明显差距。其次,谷歌是 Anthropic 的核心投资方之一,今年早些时候已官宣计划累计投资最高达 400 亿美元,本次开放权限是投资关系向内部工程效率转化的具象动作。最后,这并非孤例:亚马逊今年早些时候同样在收到大量员工反馈后开放了 Claude 与 Codex 权限。头部云厂商的编码工具选型正在从「自研优先」转向「按能力择优」,模型层竞争由此进一步下沉到开发者工作流的入口层。
来源:https://3w.huanqiu.com/a/c36dc8/4TDZHIc3oH2
Real-SWE 基准发布:最强编码 Agent 在私有代码库上失败率仍超 60%
Y Combinator 支持的 Specific Labs 推出新基准 Real-SWE,它不采用从公开仓库抽取的题目,而是把编码 Agent 直接放进真实企业的私有代码库中执行日常工程任务,代码与解法均不公开,以降低训练数据污染的概率。结果显示,通过 Claude Code 运行的 Claude Fable 5.1 以 38.8% 的成功率居首,Codex CLI 上的 GPT-6 Astra 为 33.8%,Gemini CLI 上的 Gemini 3.8 Flash 为 31.2%,其后依次为 GLM 5.3(28.8%)、Grok 4.6 与 Muse Spark 1.3(并列 23.8%)、Kimi K3(18.8%)、GPT-5.6 Sol(16.2%),每个模型对每道题有 8 次尝试机会。任务层面的数据更低:10 道题中有 6 道成功率低于 15%,其中计费周期迁移 14.1%、API Token 计量 12.5%、S3 存储追踪 10.9%、可线性化扫描 4.7%、税务辖区 Bug 修复 3.1%;一道分析流式归约器题目在全部尝试中没有任何模型解出。
值得关注:38.8% 这个数字比「失败 60%」更值得细读。其一,Real-SWE 解决方案平均需修改 11 个文件,接近 FrontierCode、DeepSWE 等基准 6 个文件中位数的两倍,说明真实生产的难度增量主要来自跨文件理解与集成,而非单点算法能力。其二,失败归因高度集中在需求遗漏(36.7%)、集成错误(34.7%)与未经验证的假设(43.3%),这三类都指向同一个问题——代码写对了,但上下文没理解对,而这正是当下 Agent 工程最需要补的一环。其三,该基准样本仅 10 道题,尚不足以推翻公开榜单结论,但它与「企业侧约 99% 的 token 从未进入前沿模型训练数据」的判断相互印证:评估 Agent 能力时,自建私有任务集的价值正在超过公开排行榜。
来源:https://www.worldprogramming.org/posts/ais-best-coding-agent-fails-60-of-the-time-and-the-data-backs-it-up-azpjzi
云知声发布 U2-Flash:DeepSWE 得分翻倍,Agent 任务周期缩短 35%
9 月 15 日,云知声发布新一代高性能主力模型 U2-Flash。在代表编程能力的 DeepSWE v1.1 榜单中,U2-Flash 得分 64.6 分,较前代 U2 翻倍,超过 GLM5.3-Flash 与 DeepSeek-V4-Pro-0813;TerminalBench3.0 评分提升至 24.3 分,超过 K3 等万亿参数级别模型;SWE-Bench Pro 评分达 61.6 分,较前代提升 10.5 分。模型采用稀疏混合专家(MoE)架构,总参数约 266B、单次推理激活约 10B 参数,首字响应时间平均控制在 3 秒以内,峰值输出吞吐最高 300 Tokens/s。效率侧,Agent 任务迭代步数减少 20%-30%,任务执行周期缩短 35%,Token 消耗减少 20%-30%。
值得关注:这组数字的重点不在「翻倍」,而在效率项与成本项与能力项同步公布。国产模型的竞争叙事正从「参数量对标」转向「单位任务的步数、Token 与墙钟时间」,这三项恰好是 Agent 场景最真实的成本——上下文预算、推理账单与用户等待时长。对正在推进 Agent 落地的团队而言,选型的锚点也应随之从公开榜单分数,迁移到「自有任务集上的步数缩减幅度与单任务成本下降幅度」;厂商业绩沟通口径未独立复现,建议以自建小样本任务集做交叉验证。
来源:https://news.qq.com/rain/a/20260915A03LV800
全球首张具身机器人专用 SIM 卡诞生,打通「作业—数采—回流」闭环
扎根深圳龙华的乐聚机器人联合安徽电信、华为,发布全国首个 5G-A 具身智能专属套餐「具身翼联」,并同步落地业界首个 5G-A 具身人形机器人园区群体巡检应用示范,全球首张面向具身机器人的专用 SIM 卡由此诞生。该套餐针对机器人「高上行占比、低时延、多机并发」的网络特征设计,提供峰值上行 500Mbps、95% 场景下时延不超过 20 毫秒的网络能力,并对机器人业务做优先调度,分两档提供 500GB 高速上行流量及动态切片增强。应用侧,多台乐聚「夸父」机器人在园区沿 8 条主路线并行巡检,作业产生的高价值数据实时回传乐聚数采平台,经清洗、标注后反哺模型迭代。
值得关注:这张卡的价值不在连接本身,而在把「数据回流」从人工搬运变成网络原生能力。具身智能长期受困于数据:实验室搭场景、靠遥控操作采集,成本高、规模小、场景不真实,从采集到训练之间存在以月计的回路时延。当运营商第一次把机器人的网络需求当作独立品类来定义和定价,「巡检作业—实景数采—数据回流训练」就具备了可复用的基础设施通道——这正是国家人形机器人实景实训行动所倡导的路径。结合行业侧数据,2026 上半年中国人形机器人出货量已超 4 万台,全球占比达 97%,数据基础设施的成熟度将直接决定这批出货能否转化为模型能力的增量。
来源:https://local.cctv.com/2026/09/15/ARTIAWLl0Bm5aYL1JAp5bLgp260915.shtml
「具身智能机器人应用技术员」成为国家新职业,数据采集与训练岗位正式入册
在本月服贸会开幕当日,中国正式认定「具身智能机器人应用技术员」为一项新职业,其下包含机器人数据采集员与机器人训练师两个新工种。这一职业认定背后是训练场模式的规模化落地:某机器人训练中心内近 270 台机器人满负荷进行家务、护理演练与工厂任务(例如自动把电路板放置到产线)训练,每年产出近 2000 万条高质量数据。采集工具同步迭代:数据采集员不必再操纵固定实验室控制台,借助新的采集装置可直接进入真实现场记录人手作业过程;展会现场还有厂商展示第一人称视角的 360 度采集头戴设备、捕捉握持力度的触觉传感器,以及内置「大脑」模型的灵巧手。同期,服贸会上线了中国首个面向具身智能数据的行业级国际服务平台,由北京石景山科技创新集团与中国电信北京分公司共建;北京已登记国内首个面向大模型训练的三维高质量数据集,开设 4 个数据服务站、上架 200 余个数据产品,并计划到 2028 年形成 100 个高质量工业数据集。
值得关注:具身智能的数据生产正在从「实验室搭场景 + 遥控采集」转向「规模化训练场 + 职业化采集团队」,而国家职业认定是这一转变最明确的制度化信号——它意味着数据采集与训练从临时性作业变成长周期、可培养、可定价的专业岗位。更值得追踪的是能力归属问题:数据标准、采集 SOP、质量判断与数据配方应由谁掌握。当数据成为可跨境交易的商品,掌握数据标准与筛选方法的一方,会比单纯持有数据规模的一方更具定价权;这一点,从国内具身基座团队把「原始数据进入训练漏斗的可用率从早期约 15% 提升到 90% 以上」视为比预训练总时长更关键的指标,已经可以看出方向。
来源:https://en.ce.cn/main/latest/202609/t20260915_3214521.shtml
本页的评论功能已关闭