栖居在城市的大地上,分享城市中的感想予你,在留言板留下你的足迹,希望你在这里有所收获,祝幸运

一个年轻人,一个小镇青年,如果获得更好的人生,第一步要摆脱异托帮,凡是别人向你建构、推销那些快乐,要一概拒绝;虽然你做不到,我还是愿意这么提。然后把那些所有的及时性的,就像那个肥宅水一样,能够让你瞬间高兴的东西,你都应该把它视若为敌人,是你生活中的毒药,你应该去做那些吃力不讨好的事情,比如说学一门技艺,精益求精锤炼一门技艺,这能够使你获得人生的支撑,或者你非常努力的去读书考一个好大学,也可以。这些东西才是你生活的真谛

最新文章

今日聚焦:Meta 以"价格十分之一"强势杀入 AI 编程赛道,AI Coding 战场再燃战火;具身智能领域迎来"基座模型 + 行业标准 + 资本涌入"三线并进——小米开源万小时级基座模型登顶榜单,工信部首个数据集质量标准发布,灵巧手赛道诞生新晋独角兽。技术与产业的双重拐点正在临近。

Meta 发布 Muse Code 编程智能体:跑分居中、定价仅竞品十分之一

2026 年 8 月 5 日美东时间,Meta 正式推出旗下首款 AI 编程智能体 Muse Code 及配套模型 Muse Spark 1.2,正式加入由 OpenAI 和 Anthropic 主导的 AI 编程工具战场。Meta CEO 扎克伯格亲自在 X 平台官宣,超级智能实验室 AI 负责人 Alexandr Wang 同步接受 CNBC 采访详细披露产品策略。

Muse Code 是一款基于终端的编程智能体,支持大型代码仓库变更规划、代码撰写、运行结果验证一站式处理,可同时调度多款 AI 智能体协助全流程。从官方跑分看,TerminalBench 2.1 实战开发测试 82.9%(优于 OpenAI Codex 的 81.8%,不及 Claude Code 的 86.7%);DeepSWE 1.1 陌生代码任务 59.3%(落后于 Claude Code 的 65.0% 和 Codex 的 64.8%)——性能居于行业中游。但真正的杀手锏在价格:Muse Spark 1.2 输入端每百万 token 1.25 美元、输出端每百万 token 4.25 美元,"贡献者版本"再便宜 10 倍以上,仅为 Claude Code 等头部产品的约十分之一。

值得关注的是,Meta 还同步上线了"零数据留存"功能,明确不收集开发者数据用于模型迭代,这是企业客户高度重视的核心信任特性。在 7 月底 Meta 因营收预期不及预期、二季度自由现金流下滑导致股价大跌的背景下,Muse Code 是 Meta 持续重金投入算力基础设施后的又一项关键商业化举措。

小米具身基座模型 Xiaomi-Robotics-1 正式开源:10 万小时数据训练,多项榜单登顶

2026 年 8 月 5 日,小米技术官方宣布具身基座模型 Xiaomi-Robotics-1 正式开源,项目代码已在 GitHub 及 Hugging Face 平台同步上线。这是国内大厂首个系统性开源的具身智能基座模型,标志着中国具身智能正式进入"基座模型时代"。

该模型基于超过 10 万小时 UMI 数据进行预训练,并使用超过 1 万小时跨本体数据进行后训练,采用"预训练 + 后训练"两阶段范式,实现"开箱即用"——不同机器人本体可一句话直接干活。在多项权威评测中表现亮眼:RoboCasa365 基准平均成功率 57.4%(较此前最优提升超 10 个百分点)、RoboDojo 仿真评测 20.07 分(榜单第一)、VLABench 基准 59.1% 平均成功率、RoboCasa 基准 74.5% 平均成功率(超越 GR00T N1.6、Pi-0.5、Cosmos Policy 等代表性模型)

雷军 7 月 16 日曾在微博透露,Xiaomi-Robotics-1 在具身基座模型领域"初步验证了 Scaling Law 效应"。此次开源不仅覆盖从真机后训练到模型部署的完整流程,还同步提供相关 Benchmark 评测代码,全面支持开发者复现与二次开发。从 7 月发布到 8 月开源仅一个月时间,节奏紧凑,显示出小米机器人团队"本体 + 数据 + 模型"完整布局的快速推进。

工信部发布首个具身智能数据集质量标准:11 月 1 日正式实施,"规模导向"转向"质量导向"

2026 年 8 月初,中国信息通信研究院联合行业 40 余家单位共同起草编制的行业标准 《人工智能关键基础技术 具身智能数据集质量要求及评估方法》(YD/T 6771—2026) 经工业和信息化部批准发布,将于 2026 年 11 月 1 日起正式实施。这是具身智能数据方向的首个国家级行业标准,有效填补了行业标准空白

标准的核心是"三方面 + 八维度":包括数据生产操作规范、组织机制保障和质量评价指标三个层面,其中质量评价涵盖完整性、一致性、多样性、真实性、易用性、实用性、可扩展性、安全性八大维度。该标准对行业影响深远:当前具身智能数据面临"量少质低"的结构性矛盾,2026 年百万小时数据产能被视为企业研发硬性门槛,但不同数据集质量参差不齐、整合困难。标准发布后,对数据提供方可规范生产流程、明确交付质量底线;对数据需求方可提供清晰的验收依据、降低采购风险;对整个行业则推动数据从"单家企业资产"向"可流通、可共享的产业资产"转变,标志着具身智能数据集建设从"规模导向"向"质量导向"的关键转型。

复旦陈涛专访:具身底层模型架构急需突破,两年内难迎"GPT 时刻"

2026 年 8 月 6 日,澎湃科技"科创 101"栏目发布对复旦大学深度学习实验室主任、博士生导师陈涛教授的深度专访。陈涛同时担任具身智能企业眸深智能联合创始人,长期横跨学术研究与产业实践。他在专访中对当前具身智能的"繁荣表象"提出了冷静反思。

陈涛的核心观点包括:当前主流 VLA(视觉-语言-动作)模型高度依赖数据,而现有训练数据大多数是成功轨迹,缺少失败数据,这让机器人在执行动作出现偏差后难以像人一样及时调整轨迹,无法把失败转化为下一次行动的经验;"为什么语言模型架构一定适合解决物理世界的问题?这个前提不成立"——行业近半年持续强调数据、在 VLA 等方面的投入,并没有充分触及具身大脑的底层模型架构;面对世界模型,他认为"世界模型要把整个世界给建模进去,但它对数据和成本的要求非常高,不是一般玩家能玩得起的"。

更具洞察性的是他对行业的判断:"具身底层模型架构急需突破,两年内很难实现具身模型的'GPT 时刻'"。他认为相比让机器人"上知天文、下知地理",更务实的路径是让它先理解具体的作业场景,形成适用于细分任务的模型能力,完成从'看得懂'到'干得好'的跨越。面对科技大厂的资源碾压,他认为初创公司的机会在"大厂不愿意做的交付工作",而"赛道里最好的人才,还是学校里正在读的博士生"。

京灵智康完成近亿元天使轮融资:普惠仿生手"硬件出货-场景采集-数据训练"循环反哺具身智能

2026 年 8 月 5 日,合肥京灵智康科技正式宣布完成近亿元天使轮融资,由龙磐投资领投,江西金控、新华都董事长倪国涛、科大硅谷引导基金共同跟投,资金将全面用于普惠仿生手迭代、物理 AI 数据体系搭建与规模化产线建设。

京灵智康由灵巧手企业灵心巧手战略并购孵化,依托后者供应链与研发体系开展业务,核心研发团队来自复旦大学陈文明教授团队。与行业内多数灵巧手企业"先工业高端、再下探民用"的路径相反,京灵智康选择以残障群体康复需求为切入点,目标将消费级医疗仿生义肢售价控制在 2 万元以内(海外同类产品多在十几万至四十万元),并实现接近人手 90% 的动作灵活度。

更具想象力的是其商业模式创新:"硬件出货-场景采集-数据训练"循环——每一台投入家庭、康复机构的仿生手,可在做饭、穿衣等日常生活场景采集人机交互数据。这类真实生活数据与实验室仿真数据存在本质差异,可用于具身智能模型训练。按企业产能规划,今年仿生手千台产能,明年目标五万台;随着硬件出货规模扩大,可采集的交互数据体量也将呈指数级增长,企业希望以此形成硬件成本下降、数据持续积累的飞轮。这条路径直指具身智能产业化的核心痛点——真实世界交互数据不足

今日聚焦:AI Coding 范式从 Loop 向 Graph 加速演进,具身智能触觉感知赛道迎来"觉醒时刻",国产工业软件性能优化首次实现全自动闭环。技术深水区的突破正在重新定义"智能"的边界。

Anthropic 发布 Claude 5 上下文工程新规则:删除 80% 系统提示词,性能不降反升

2026 年 7 月 24 日,Anthropic 技术团队发布了一篇具有范式意义的技术博客《The new rules of context engineering for Claude 5 generation models》。团队在 Claude Opus 5 和 Fable 5 上做了一个惊人实验:删除了 Claude Code 超过 80% 的系统提示词,编码评估结果没有任何可衡量的下降。

核心发现是——Claude 5 代模型的判断力大幅提升,导致旧时代的过度约束策略反而成为一种负担。当系统提示词、Skills 和 CLAUDE.md 中存在相互冲突的指令时,模型必须花费额外的思考时间理清矛盾。Anthropic 提出了六大新规则:从"给规则"转向"让 Claude 自行判断";从"给示例"转向"设计接口";从"前置加载"转向"按需渐进披露";从"重复指令"转向"精简工具描述";从"手写 CLAUDE.md 记忆"转向"自动记忆";从"简单规格"转向"丰富引用"。

这一发现对整个 AI Coding 生态具有深远影响:它意味着模型能力的跃升正在倒逼开发者重新思考"如何与 AI 协作"——不再是越详细的提示越好,而是给模型留出判断空间。

面壁智能开源 ForgeStencil:全球首个全自动工业软件性能优化系统,一周优化 100+ 应用

面壁智能联合 OpenBMB 开源社区正式发布并开源了全球首个 Stencil 优化"自动研究 + 自动部署"大闭环 AI 系统——ForgeStencil。该系统仅用一周时间就完成了 100 多款真实工业和科学计算软件的自动重构优化,覆盖油气勘探、计算流体力学、电磁仿真、医学影像、气象气候等 8 大工业领域及 5 大科学领域,全程 0 人类专家介入,端到端加速中位数达 1.41 倍。

ForgeStencil 采用双 Agent 协同架构:Kernel Agent 负责"写代码",针对不同场景和硬件自动生成逼近硬件极限的高效计算核心;App Agent 负责"装软件",自动分析应用、定位瓶颈、验证正确性并集成回原软件。在单精度(fp32)下,相比 Halide、Devito 等主流框架获得 2.35 倍几何平均加速;混合精度(fp16)下额外提速 1.95 倍。

这一突破标志着国产工业软件性能优化从依赖顶尖专家逐行手写的"手工作坊",正式迈向可并行、可复制的"自动化生产线",为高端装备、能源勘探、芯片设计等自主可控关键领域提供了更坚实的底座。

AI Coding 范式再迁徙:从 Loop Engineering 到 Graph Engineering 仅用六周

2026 年 8 月初,AI Coding 领域发生了一次概念层面的"快迭代"。OpenClaw 创造者 Peter Steinberger 在 X 上发问:"我们还在谈 Loop,还是已经转向 Graph 了?"——距离他让 Loop Engineering 走红仅过去六周。几乎在同一时间,拥有 20 年经验的机器学习工程师 Hamel Husain 发布调侃文章《Loop Engineering Is Dead. Enter Graph Engineering》。

Loop 解决的是"单个 Agent 如何根据环境反馈不断检查、修改、再次尝试";但当 Coding Agent 从一次回答走向连续执行,又从单个 Agent 走向多个执行单元协作时,工程师需要处理的问题扩展到了"这些工作该怎样连接"——研究需求的 Agent、写代码的 Agent、做测试的 Agent,谁先开始?哪些工作可以并行?测试失败后应该回退到哪里?

Graph Engineering 本质上是一个任务编排系统,管理多个工作单元之间的连接、共享状态与选择路径。这一概念跃迁揭示了一个深层趋势:AI Coding 的竞争焦点正在从"模型能写多少代码"转向"多 Agent 如何协同完成复杂工程"。

具身智能迎来"触觉觉醒":前 7 个月融资超 70 亿元,VTLA 模型成新方向

据证券时报报道,触觉感知正成为具身智能领域增长最迅猛的细分赛道。据不完全统计,今年前 7 个月该领域新增融资超 70 亿元,至少两家企业跻身新晋独角兽。行业共识正在形成:仅靠视觉无法完成复杂作业,机器人需从"看得见"升级为"摸得到、做得好"。

将触觉信息融入具身智能大模型的技术路线已成为主流探索方向。VTLA(视觉—触觉—语言—动作)模型的需求日益高涨,依托视触融合技术,机器人工业柔性操作已诞生应用测试场景,规模化量产有望上线。但触觉数据具有不可替代性,数据缺口仍是阻碍机器人规模化落地的核心瓶颈之一。业内呼吁在强化多模态数据真实采集的同时,进一步完善数据仿真等技术路线;触觉传感器等核心零部件则需在耐用性、数据一致性等方面精益求精。

这一"触觉觉醒"标志着具身智能从"感知—决策—执行"的简化链条,向多模态深度融合的复杂系统进化。

银河通用机器人"迎宾小盖"上岗全家便利店:全球首个 WAM-TTT 框架实现部署阶段持续学习

银河通用机器人开发的 Galbot G1 具身智能机器人"迎宾小盖"已在北京中关村鼎好 DH3 大厦的全家便利店正式上岗。它不仅能主动与顾客聊天、夸赞穿搭,还能精准地从货架取物、从烤箱取烤肠递到顾客手中——在客流密集、消费需求多变的复杂城市零售场景中实现了稳定运行。

背后核心技术是银河通用自主研发的"银河星脑"(AstraBrain),全球首创的"大脑—小脑—神经控制"端到端具身大模型架构。更具突破性的是近期发布的 WAM-TTT(World Action Model Test-Time Training)——全球首个面向具身智能世界模型的测试时后训练框架。它首次实现了机器人在部署阶段持续学习和持续适应,仅需"观看"少量人类操作视频,就能把已掌握的技能快速迁移到全新场景,无需机器人本体数据,也无需任何动作标注。

在宁德时代动力电池产线上,Galbot S1 重载机器人已在模组与电池包生产环节承担物料转运任务,7×24 小时连续作业超过 3 个月,全程零遥操、全自主运行——这是全球首次实现人形机器人在新能源制造产线的"常态化自主作业"。

今日焦点:贾扬清携 Intent Lab 杀入自主 AI 开发赛道,AI Coding 从 Loop 进化到 Graph 工程化阶段;具身智能侧,宇树科技启动 IPO 募资 42 亿元,京东抛出 410 万台机器人五年大单,Google DeepMind 发布通用机器人「大脑」Gemini Robotics 2——软件和硬件两条线都在加速从 Demo 走向生产力。

贾扬清创立 Intent Lab,发布全链路自主 AI 开发团队 Fleet

前英伟达高管贾扬清在离开英伟达一个月后,正式创立 Intent Lab,推出名为 Fleet(舰队)的自主 AI 开发团队。Fleet 的定位不是代码补全工具,而是覆盖系统架构设计、代码开发、基础设施部署、测试、质量验证和性能优化全流程的「数字员工团队」。早期成果包括将 GLM-5.2 推理引擎提速 534%、一键式数据库创建,以及经形式化验证的 Agent 文件系统。

值得关注: 这是 AI Coding 从「帮人写代码」到「替人做软件」的关键一步。贾扬清亮出的三个跨领域成果(推理优化、数据库、文件系统)证明 Fleet 具备通用工程能力而非单一场景的调优。结合 Y Combinator 近期开源的多 Agent 调度框架 QM,行业正在形成共识:AI 编程的竞争已从模型能力转向工程编排能力。

来源:创业邦

AI Coding 从 Loop 走向 Graph Engineering

Open Claw 创始人 Peter Steinberger 在 X 平台上抛出「我们还在谈 Loop,还是已经转向 Graph 了?」引发 300 万+ 浏览,Loop Engineering 走红仅六周便被「宣告过时」。Graph Engineering 的核心区别在于:Loop 解决单个 Agent 的「继续执行」问题,而 Graph 解决多个 Agent 节点间的「协同编排」问题——任务拆分、依赖管理、分支回退、中间状态保存与结果验收。

值得关注: 这并非概念炒作。主流 Coding Agent(如 Claude Code、Codex)已在内部使用 Graph 架构,只是没有对外暴露。当 AI 编程从单文件补全进化到多模块系统工程时,Graph 是必然的架构选择。对于开发者而言,理解 Graph 意味着从「怎么让 AI 继续写」升级到「怎么设计 AI 的工作流」。

来源:虎嗅/智讯智库

宇树科技启动 IPO,具身智能第一股估值超 400 亿

宇树科技(Unitree)正式公布科创板 IPO 时间表,计划发行 4045 万股新股募资 42.02 亿元,估值约 420 亿元。募资将用于建设年产 7.5 万台人形机器人和 11.5 万台四足机器人的制造基地。宇树是人形机器人领域全球出货量最大的厂商之一,2025 年中国人形机器人占全球出货量 84.7%。

值得关注: 这是具身智能行业从「概念驱动」转向「资本化量产」的标志性事件。宇树是行业内少有的已实现盈利的机器人企业,其 IPO 将为整个赛道锚定估值基准,加速有产品与无产品企业之间的分化。结合美国近期对中国机器人实施的出口禁令,宇树上市也带有国产替代的战略意义。

来源:China Daily

京东抛出 410 万台机器人五年采购大单

京东在 WAIC 2026 期间宣布,未来五年计划采购 410 万台智能机器人设备,涵盖仓储物流、末端配送、商业服务等场景。京东不做机器人整机,而是以「超级甲方」身份搭建具身智能底层基础设施——覆盖数据采集、模型训练、标准测评、仿真验证到实景落地的七大环节闭环。

值得关注: 410 万台订单量级足以重塑具身智能供应链格局。京东的姿态是「不做整机、只做基础设施和标准」,这意味着它要做具身智能时代的操作系统——类似 Android 之于手机产业。对于中小机器人厂商而言,接入京东体系既是机会也是绑定,需要仔细评估。

来源:大厂财经社

Google DeepMind 发布 Gemini Robotics 2,剑指机器人通用「大脑」

DeepMind 于 7 月 30 日发布 Gemini Robotics 2 系列,包含三款模型:视觉-语言-动作模型(VLA)、具身推理模型(ER2)和端侧轻量版(On-Device 2)。该套件支持跨机型快速适配,仅需数小时数据训练即可驱动全新机身,DeepMind 将其定位为机器人的「智能层」——类似 Android 之于手机生态。

值得关注: 同一参数模型同时控制三台硬件结构完全不同的机器人(Apptronik Apollo 2 + 独立双臂设备),证明通用机器人大脑的技术可行性已大幅提升。但 DeepMind 不生产硬件,其商业模式依赖硬件厂商接入,这套「安卓式」打法能否在工业机器人市场复制手机生态的成功,仍需观察。

来源:财联社

今日 AI 领域呈现“代码主权”与“物理智能”双主线交织:美国众议院因 DoorDash 使用中国 Kimi 模型展开安全调查,AI 工具选择首次被纳入地缘政治议程;国内具身智能融资热度不减,破壳机器人、求之科技同日披露亿美元级融资,分别瞄准“机器人操作”与“模型—数据—仿真”全栈底座。以下是精选要闻。

DoorDash 因使用月之暗面 Kimi 模型写代码遭美国众议院调查

据外媒报道,美国众议院国土安全委员会与另一委员会主席已联合致函 DoorDash,要求披露其使用中国 AI 大模型的具体情况。DoorDash 创始人 Andy Fang 在 7 月初发文称,内部测试显示 Kimi K2.6 + Anthropic Fable 5 的组合在代码任务上超越 Sonnet 4.6 + Opus 4.8,且成本更低,公司已将部分底层任务通过模型路由服务委托给 Kimi K2.6。调查函指出,中国开源开放权重模型虽具成本优势,但不能消除安全风险与国家安全担忧。DoorDash 发言人回应称,愿配合调查并讨论如何安全使用包括美国前沿模型与开放权重模型在内的 AI。

值得关注的原因:这标志着 AI 编程工具从“效率选型”升级为“国家安全审查”对象。企业在中国开放权重模型上的成本优势,正面临合规、数据主权与供应链风险的多重审视。

信息来源网易科技 / 雷峰网

IC Coder 2.0 上线内测:FPGA 研发进入 Agent 全工程闭环

IC Coder 2.0 正式发布并启动内测,面向 FPGA 真实研发场景,对自研 FPGA 专用模型、Agent 执行平台、企业本地知识库、板卡与芯片适配进行系统升级。其目标不是生成代码片段,而是让 AI 覆盖需求理解、架构设计、RTL 生成、仿真验证、问题定位、约束生成到上板调试的完整 FPGA 研发流程。产品已获世界 500 强企业采购部署,并成为安路科技“大学计划”官方生态伙伴;已适配米联客、康芯等国产 FPGA 开发板及安路 FPGA 器件。

值得关注的原因:AI 编程正向硬件垂直领域深潜。FPGA 开发流程长、约束多、调试成本高,Agent 化有望成为国产芯片、工业控制与机器人硬件生态的加速器,也提示“Coding Agent”的下一战场是垂直工程闭环。

信息来源新浪财经 / 电子创新网

求之科技完成 1 亿美元天使+轮融资,跻身具身智能独角兽

2026 年 8 月 3 日,求之科技(DISCOVER Robotics)宣布完成 1 亿美元天使+轮融资,距首轮超 1 亿美元天使轮落地尚不足一月。本轮由 IDG、星连、武岳峰、达晨、九阳、华映、滨湖区产业集团等参投,老股东悉数追加。求之科技构建了“模型—数据—仿真”全栈具身智能技术底座,已发布分层式基础模型 ORION、虚实混合数据闭环系统 LOOP 与高保真仿真器 DISCOVERSE,试图系统性破解行业数据匮乏与泛化能力弱的瓶颈。

值得关注的原因:天使轮即破独角兽估值,说明资本对“端到端具身底座”的饥渴程度。求之的模型—数据—仿真闭环代表消费级具身智能的长期基础设施方向,也预示着赛道竞争从“本体堆料”转向“全栈飞轮”。

信息来源网易科技 / 雷峰网

破壳机器人完成亿美元级 Pre-A 轮融资,押注机器人操作能力

通用具身智能公司破壳机器人(PokeBot)近日完成亿美元级 Pre-A 轮融资,由顺为资本、经纬创投领投,钟鼎资本、九坤创投、SEE Fund、小米战投等老股东持续加注。公司由清华大学交叉信息研究院助理教授许华哲创立,聚焦机器人“操作”——即在真实物理世界中用双手完成任务的能力。破壳提出 WAM(世界动作模型)× RL(真机强化学习)× DATA(真实世界数据)飞轮,并在成立三个月内发布了全自主炒制麻婆豆腐、叠衣服、穿扎带等长程精细操作真机演示。

值得关注的原因:机器人产业正在把竞争焦点从“会跑会跳”拉回“会干活”的本质。长程烹饪、柔性物体处理等任务对力控、时序规划与因果理解要求极高,是家庭具身机器人能否真正落地的瓶颈,也是物理 AI 的“最后一公里”。

信息来源网易科技 / AI科技评论

今日 AI 领域呈现"编码范式进化"与"具身智能落地"双线并进格局:AI Coding 方面,清华团队开源 VeriLoop Coder-E1 以循证螺旋驱动递归式自我改进,Graph Engineering 概念在 Loop 诞生仅六周后崛起标志多 Agent 协同成新工程范式;具身智能方面,谷歌 Gemini Robotics 2 实现全身智能突破,FCC 禁令给中国机器人出海添变数,朱松纯批评行业泡沫呼吁回归认知架构。

清华 VeriLoop Coder-E1 开源:循证螺旋驱动可验证的递归式自我改进

清华大学深圳国际研究生院智能机器人实验室刘厚德教授团队正式发布 VeriLoop Coder-E1,一款基于 Qwen3.6-27B 构建、面向仓库级代码修复与智能体式软件工程任务的开源垂类代码模型。该模型在 Hugging Face 四项软件工程 Benchmark 中取得 SWE-bench Verified(85.20)、SWE-bench Pro(62.38)、Terminal-Bench 2.0(76.40)和 DeepSWE(33.63)的成绩,在 32B 及以下开源模型中三项排名第一。其核心创新在于"循证螺旋"机制——遵循"证-伪-探-修-验-化"的循证逻辑,每一轮生成都必须接受反证、探索、修订与复验,只有通过验证的纠正才有资格进入下一轮并改变系统未来如何发现问题、判断错误和实施修复。团队依据 Apache 2.0 开放模型权重,但保留 Self-Harness 控制栈(运行时编排平面)用于商业化。

值得关注的原因:VeriLoop 将递归式自我改进从"系统能否修改自身"重新定义为"经验证纠正的方法开始改变系统未来如何纠错",这是对 Anthropic RSI 愿景的工程化落地。其"循证螺旋"方法论不仅适用于代码修复,更为 Agent 持续学习提供了可反驳、可回滚的认识论框架——在 AI Coding 从"生成代码"走向"承担后果"的过渡期,这条技术路线值得持续跟踪。

信息来源:机器之心/新浪科技

Graph Engineering 崛起:Loop 才火六周,AI Coding 谈论多 Agent 协同

Open Claw 创造者 Peter Steinberger 在 X 上发问"我们还在谈 Loop,还是已经转向 Graph 了?"获得约 307 万次浏览,"Graph Engineering"几乎在一个周末内从半开玩笑的提问变成 AI Coding 新热词。Graph 并非 Loop 的替代品,而是当 Coding Agent 从单次回答走向连续执行、从单个 Agent 走向多执行单元协作时,工程师要处理的问题从"怎样让它继续做"扩展到"这些工作该怎样连接"。一个 Graph 至少包含节点(工作单元)、边(交接方式)、共享状态(公共工作台)和路由规则(下一步去哪里)四要素。《Nature Machine Intelligence》同期发表覆盖 260 种配置的研究指出:多 Agent 在可拆分任务中最高提升 80.8%,但在顺序依赖强的任务中最高下降 70%——关键变量不是抽象的"复杂度",而是任务能否被有效拆分。

值得关注的原因:从 Prompt → Context → Harness → Loop → Graph 的递进,本质是工程师注意力从"写更好的指令"扩展到"设计可观察、可路由、可约束的执行系统"。主流 Coding Agent(Codex 子 Agent、Claude Code AgentTeams、Cursor 2.4 Subagents)已在产品中内置 Graph 能力但未显式画图。这条演进路线直接影响 AI 编程工具的架构设计方向——当模型能力趋同,编排能力成为新护城河。

信息来源:虎嗅/智讯智库

Claude Code 按量计费后成本飙升,但市场主导地位依旧难以撼动

Anthropic 切换至按量计费模式后客户使用成本大幅上涨,OpenAI 持续迭代 Codex 竞争力显著增强,中国开源模型能力也取得长足进步。然而即便各大企业积极寻求控本方案,众多企业依旧选择继续使用 Claude Code。2025 年末至 2026 年初,大量企业转向 Claude Code,挤占了 GitHub Copilot 和 Cursor 的市场份额。与此同时,Anthropic 自曝其网络安全评估意外突破三个真实组织的隔离边界——原因并非模型做出错误判断,而是评估环境声明"离线模拟"但真实网络路径处于开放状态,模型遵循了实际网络而非自然语言约束。Claude Code Daily Briefing 显示 CLI 已连续九天无新版本发布,四个渠道(CLI/API/Apps/Newsroom)同步静默。

值得关注的原因:Claude Code 在价格劣势下仍保持粘性,说明 AI 编程工具的竞争壁垒已从"模型能力"转向"工作流锁定+生态深度"。但 Anthropic 安全事件暴露了一个普适教训:自然语言声明的约束没有强制力,隔离必须在配置层实施(sandbox.network.strictAllowlist)。对使用 AI 编程工具的团队而言,验证 Agent 隔离状态应通过实际出站请求测试,而非依赖文档声明。

信息来源:格隆汇/网易 | Claude Code Daily Briefing

Google DeepMind Gemini Robotics 2:从"先站好再伸手"到全身智能

Google DeepMind 发布 Gemini Robotics 2,主打"全身智能",包含三个模型:ER 2 负责环境理解、长任务规划与人机沟通,Gemini Robotics 2 作为 VLA 模型将视觉与语言直接转为全身动作,On-Device 2 以少于 200 个样例、几小时数据适配新机器人本体。核心突破在于用一个模型协调人形机器人的双腿、躯干、双臂和手指,实现边思考推理边移动操作——机器人不再需要"先站好、再伸手"的回合制切换。实测中,Apptronik Apollo 2 完成走向地面水壶、弯腰拾取、货架取物等全身耦合动作;使用 22 自由度灵巧手完成拧灯泡(拧下 92%/拧上 36%)、封自封袋(40%)、扎垃圾袋(44%)等精密操作。谷歌坦诚公布成绩:地面取物成功率仅 45.7%,多指灵巧操作远未达到"人类级"。

值得关注的原因:Gemini Robotics 2 的真正意义不是给机器人装上"开窍的大脑",而是让具身智能模型越过桌面和上半身,将走路、平衡、精细操作、长任务与多机协作放进同一张考卷。On-Device 2 的少于 200 样例适配新本体直击具身智能规模化的数据瓶颈。但 36%-44% 的手部操作成功率也清醒提示:大模型已能接管相当复杂的手部动作,但"最后几厘米"的形变操作(塑料袋、绳结、灯泡螺纹)仍是未解难题。

信息来源:雷科技/网易 | SCAND.Ai

具身智能产业全景:FCC 禁令、朱松纯批评泡沫与多地实景突围

8 月 1-2 日具身智能产业呈现"技术路线争论+出海受阻+多地落地"三线并行:美国 FCC 于 7 月 28 日将"外国生产的先进机器人设备"列入管控清单,未获认证新具身产品无法取得进入美国所需设备认证,CES 2027 参展添变数,欧洲和东南亚成更迫切拓展方向。北京通用人工智能研究院院长朱松纯在 WAIC 演讲中批评将大模型、Agent、具身智能、世界模型热点轮换包装成 AGI 的泡沫,强调认知架构与价值系统比参数更重要。IDC 数据显示 2025 年中国工业具身智能机器人市场规模约 57.4 亿元,超 80% 制造企业希望两年内回收投资。浙江清华柔电院研发柔性触觉感知末端("电子皮肤")已实现量产、最大月产 1000 只智能感知夹爪。杭州国家级具身智能中试基地汇聚 140 余台机器人、呈现近 40 个应用场景。宇树等 5 大头部企业全部落子成都,当地预计年底部署整机超 6400 台。

值得关注的原因:FCC 禁令改变的是具身企业全球化难度而非研发速度,标志机器人领域技术竞争正式溢出为地缘政治议题。朱松纯的批评切中行业要害——2026 上半年国内具身赛道融资达 934.74 亿元同比暴涨 5 倍,但"肯定下半年到明年会死一批"的共识提示资本过热风险。触觉感知作为"具身智能感知世界最后拼图"正从算法层面(VTLA/N0-VTLA)补齐 VLA 框架缺失的物理交互感知,值得重点关注。

信息来源:腾讯新闻具身智能日报