栖居在城市的大地上,分享城市中的感想予你,在留言板留下你的足迹,希望你在这里有所收获,祝幸运

具身智能

今天的 AI coding 赛道同时出现了三种方向:编程 Agent 从命令行走向桌面图形界面,模型形态从"生成式"分化出"决策型",而数据安全则从隐性默认变成了必须公开审计的硬门槛。具身智能这边,消费级个人机器人正式开售、万元级定价落地,行业评价维度正从"技术能不能做出来"转向"能不能稳定交付几万台"。

月之暗面发布 Kimi Code Desktop,编程 Agent 正式搬上桌面

9 月 21 日,月之暗面推出 Kimi Code Desktop,macOS(Apple 芯片与 Intel)与 Windows 版本同步上线,用户可通过 kimi.com/code 安装。作为 Kimi Code 的官方桌面客户端,它把原本只在 CLI 中的 Agent 能力带进图形化工作区:可以对话驱动 Agent 读写代码、运行命令,也能集中管理所有项目、逐步查看 Agent 每一步的执行过程。桌面端内置终端、浏览器与 Git 状态查看,支持审阅代码差异、关联 PR 状态跟踪评审进度,浏览器面板还允许开发者直接框选页面元素加批注来指导修改。执行模式上提供 Plan(先出方案后动手)、Goal(围绕长程目标持续推进)、以及实验性的 Tower 多 Agent 并行模式;权限分 Always Ask / Ask When Needed / Never Ask 三档。底层由 K3 旗舰模型驱动,参数规模 2.8T,上下文窗口最高 100 万 Token。

值得关注:这条新闻的意义不在"又多了一个 GUI",而在编程 Agent 的产品形态正在从"终端里的副驾驶"迁移为"独立工作台"。内置浏览器 + 可视化批注解决了纯文本描述 UI 问题的低效环节,权限三档则是把 Agent 自主权做成了可调旋钮——这恰好回应了业界对"Agent 越权"的普遍焦虑。对国内开发者而言,K3 的 100 万 Token 上下文和桌面端与 CLI 共存共享配置的设计,意味着本地既有工作流不必推倒重来。需要注意的是,Tower 多 Agent 并行默认关闭、需显式执行 /tower 命令开启,这个设计本身就说明并行编辑相关文件仍存在冲突风险,实际收益有待验证。

来源:上海证券报·中国证券网IT之家AlphaSignal 深度解析

智谱 ZCode 数据上传风波收尾:客户端全面开源,信通院与绿盟完成审计

此前有开发者爆料,智谱旗下 AI 编程工具 ZCode 会在登录后默认将整个项目工作区打包加密上传至云端,即便在设置中手动关闭上传开关,后台进程仍持续上传;有技术博主称打包文件中包含核心资产。9 月 18 日智谱回应称争议源于默认开启的"代码库索引"功能,数据仅用于生成 RepoWiki 页面随后即销毁;9 月 19 日太原承明科技向智谱发函,要求就数据删除、私钥保管及是否跨境传输作出书面说明并保留诉讼权利。9 月 21 日,智谱宣布 ZCode 正式开源至 GitHub 交由社区监督,并建立常态化漏洞反馈与奖励机制。安全整改已经完成:v3.14.0 客户端已移除 Repo Wiki 功能,切断本地仓库快照生成与上传链路;中国信通院与绿盟科技审计确认,zcode-prod 阿里云 OSS 存储桶内全部数据及存储桶本身均已删除,未发现可触发文件外发的功能路径。

值得关注:这是国内 AI 编程工具第一次因为"默认开启的代码采集"被推到合规审判席上。争议核心并不是恶意收集,而是产品团队把"索引数据"当成普通功能特性,没有按"数据出域"的规格走安全评审流程——这是整个行业的通病,而非某一家公司的疏漏。对企业开发者来说,真正的教训很具体:AI 编程工具会读走的不只是代码片段,还可能包含数据库口令、云凭证、Git 全量历史和员工个人信息。在选择工具时,"是否默认开启上传""能否彻底关闭""有没有第三方审计"应当前置为准入门槛。开源 + 外部审计这个收尾方式,大概率会成为同类事件的行业标配处置模板。

来源:澎湃新闻(经网易转载)腾讯研究院 AI 速递

TypeSafe 推出决策型模型 Jev:不生成散文,只返回带置信度的类型化判断

OpenAI 前工程师 Diogo Almeida(曾参与 ChatGPT 核心训练方法设计)创立的 TypeSafe AI 推出首款"System One"类型模型 Jev,主要面向编程场景。与常规大语言模型不同,Jev 不负责对话聊天,而是专为陈述评估与决策判断而生:它接收代码传入的"状态"——某个具体情境及其相关数据——并评估特定陈述,每次请求都携带状态,没有全局知识库也不保留记忆。输出按 Choice、Score、Null 三类形态返回带置信度的类型化答案,而非生成完整句子。官方数据显示端到端延迟 70—500 毫秒,比同类大模型快 20—200 倍,输入每百万 Token 仅 0.042 美元、输出不收费,注册用户获赠约 1.2 亿 Token 额度。目前已被用于浏览器代理、上下文压缩、模型路由与安全分类,Vercel 替换原分类器后提速 5—18 倍。

值得关注:这条指向一个容易被忽略的结构性变化——Agent 系统里大量调用其实不需要"生成",只需要"判断"。用大语言模型做路由、分类、安全过滤,本质上是用散文生成能力去做选择题,成本和延迟都被白白放大。Jev 用面向校准决策的强化学习(RLCD)训练,又因为不维护上下文而支持同一请求内多问题并行处理,从而在速度和成本上拉开数量级差距。官方宣称的"最高 194 倍更快、445 倍更便宜"属于极限值、需落地检验,但 Vercel 实测 5—18 倍提速是可信的中间证据。对做 Agent 编排的人来说,未来的成本优化方向可能不是换更便宜的通用模型,而是把判断环节拆给专用决策模型。

来源:IT时代网(经腾讯新闻转载)腾讯研究院 AI 速递

启元机器人 Q1、T1 正式发售,个人机器人下探至 19999 元

9 月 20 日,上纬新材旗下消费级具身智能品牌启元机器人在上海举办"我和我的个人机器人"发布会,正式发售启元 Q1 与启元 T1 两款个人机器人,10 月 1 日起按订单顺序陆续发货。定价方面,Q1 与 T1 起售价均为 19999 元,开放全栈二次开发的 Q1 探索版 26999 元,新增英伟达 Orin Nano 芯片、支持双形态 360° 全向避障与低电量自动回充的 T1 Pro 为 29999 元,首批授权体验店覆盖上海、广州、深圳、杭州、厦门、武汉、西安 7 城。技术侧公布 PrimeMotion 柔顺安全小脑运控、PrimeGo 多模态感知跟随(支持人形与四足双形态)、PrimeVista 多模态交互三类模型,本体采用自研 QDD 准直驱关节(体积约鸡蛋大小)与轻量高刚性复合材料,并开放 SDK、HDK 与硬件拓展接口。品牌由上纬新材董事长、智元机器人联合创始人彭志辉(稚晖君)主导,2026 年预计投入 5 亿元研发费用。

值得关注:2 万元价位把人形/可变形机器人拉进了"高端消费电子"而不是"科研设备"的价格带,这是 C 端具身智能第一次有了可对照的锚点——此前宇树 G1+ 降至 9.5 万元已被视为大幅下探,如今直接再降一个数量级。更关键的是"发售即发货"和制造节拍:每 2.5 分钟下线一台、执行汽车工业质量管理体系、测试按手机 3C 认证标准,说明竞争焦点已经从算法演示转向批次一致性。开放 SDK/HDK + 技能商店 + 外观创造平台的组合,本质是在复制"手机 + App Store"的生态路径,稚晖君那句"最有意思的不是出厂时什么样子,而是还能被你变成什么样子"直接点明了定位。风险在于:家庭场景的真实有用性尚未被验证,"先从有趣起步,逐步走向有用"这个说法本身也承认了当前的局限。

来源:中国经济新闻网上海证券报·中国证券网中国工信新闻网中国青年报

从拼技术到拼规模:高盛大幅上调人形机器人出货预期至 2030 年 89 万台

行业竞争的评价维度正从技术突破延伸至规模量产与稳定交付。高盛在最新全球物理 AI 报告中大幅上调预期:全球人形机器人出货量将从 2026 年约 7.5 万台增至 2030 年约 89 万台,而此前预测 2030 年仅 25.6 万台;德意志银行将 2026 年全球出货预期从 1.75 万台上调至约 5 万台,预计 2030 年达 70 万台,并认为中国是全球增长的核心引擎。产业侧的量化注脚同步出现:智身科技具身智能机器人累计量产突破 1.5 万台,单月产能较去年月均提升超 10 倍,形成三大基地、四大工厂布局,产品进入电力、石化、消防、安防、应急、教育等行业;2026 年上半年中国人形机器人出货量已超 4 万台,全球占比进一步提升至 97%。泛化能力方面,中建科工通过内置上千套工艺数据库配合 3D 视觉自适应补偿,将同系列标准衍生件换产调试时间从数小时缩减至 3—8 分钟,全新跨品类非标件也只需 40—70 分钟。

值得关注:高盛把 2030 年预测一次性上调 3.5 倍(25.6 万 → 89 万台),这种量级的修正通常意味着卖方研究框架发生了切换——从"技术可行性折价"转为"制造业爬坡曲线"。真正值得盯的不是出货数字本身,而是换产调试时间这个指标:从"一景一调试、停机几小时手动示教"压缩到 3—8 分钟,是具身智能能否进入非标制造场景的分水岭,比任何 Demo 视频都更能说明泛化能力的商业化程度。同时也要看到边界:97% 的全球占比高度依赖中国供应链成本优势,一旦海外补贴与本地化采购政策落地,这个比例大概率回落;而机构研报所称"市场对遥控玩具阶段的担忧过于悲观",本身就是一种需要被后续交付数据证伪的乐观假设。

来源:中国经济网人民网中国工信新闻网中财网

今日 AI coding 一侧出现两条"降温"信号:四大编码 Agent 集体暴露供应链零点击漏洞,最强组合在真实客户模拟中只过 23.9%,而专家方案是 82.2%。具身智能一侧则是规模化的另一面——全国训练场与数据采集中心已破百家,智元与长隆把 300 多台机器人一次性推进千万人次客流的高交互公开场景。能力天花板与落地密度,是今天这组新闻的共同主题。

四大编码 Agent 曝 Plugin4Shell 零点击供应链漏洞

企业 AI 安全公司 Air 披露名为 Plugin4Shell 的漏洞:攻击者可绕过主流编码 Agent 的插件 SHA pinning 机制,在插件后台自动更新时注入恶意代码,全程无需用户交互即可实现远程代码执行。受影响产品包括 Claude Code、OpenAI Codex、Google Gemini CLI 以及微软 GitHub Copilot。Air 于今年 6 月向四家厂商通报,Anthropic 与 OpenAI 已在 Claude Code 2.1.179、Codex 0.146.0 中修复;Google 选择弃用 Gemini CLI 而非修补,建议用户迁移至 Antigravity;微软未回应也未修复,Copilot 仍处于暴露状态。微软数据显示近九成财富 500 强企业在使用 Copilot,影响面不容低估。

值得关注: 这是首例针对"可信插件市场"而非模型或 Agent 本体的 AI 供应链攻击。SHA pinning 本是用于锁定已审计提交哈希的防线,漏洞在于 Agent 检出提交后从不校验落点——攻击者控制仓库即可让 pin 表面上仍然生效。对企业而言,"Agent 能触达的资产"就是攻击者的可达边界,插件市场审核不再是充分信任依据;对个人开发者,唯一完整缓解手段是把 Agent 升级到已修补版本。

来源:AI and Tech News

ττ-bench:最强编码智能体只过 23.9%,专家方案 82.2%

新基准 ττ-bench 把"搭建智能体"包装成一份真实客户外包工单:模型拿到零散的公司记录、一位客户、一个 API、一份已有代码和一笔预算,需交付能应对未见客户请求的智能体。表现最好的组合(Claude Opus 5 搭配 Claude Code)在 53 项任务的留出客户模拟中通过率仅 23.9%,而专家手工撰写的参考方案在同一批任务上达到 82.2%。失败集中在编码之外:搜索记录而非理解记录、几乎不向客户提问、复用自己熟悉的设计、写的测试经常漏掉自身错误。

值得关注: 最具启发性的是提问的量化价值——允许提问的任务中,提问数为 0 的方案平均得分 0.16,提问 4 次以上的方案升至 0.50。瓶颈已从"能不能写出代码"迁移到"能不能搞懂要写什么",即需求工程与验证流程。这与近月多份企业调查中"瓶颈转向代码验证"的结论相互印证,也提示 Agent 产品的差异化方向:强化澄清式对话与自检测试,比单纯堆模型参数更能拉高交付率。

来源:网易 · 算力游侠

微软用 Agent 把 Copilot 运行时从 TypeScript 迁到 Rust

支撑 GitHub Copilot(CLI、桌面端、SDK 与云端 Agent,内嵌于 VS Code、Excel、Outlook 等)的运行时已被整体从 TypeScript/Node.js 重写为 Rust,其中大部分移植工作由编码 Agent 完成。据 The Register 报道,约 43 万行 TypeScript 转为约 80 万行生产级 Rust,历时 14.5 周、135 个发布版本(约每天 1.3 个移植 PR),AI token 成本约 12 万美元,外加约三周人力。成果是 1000 会话基准下吞吐 7.55 → 120 生命周期/秒(15.9 倍),10 客户端 Agent 批处理的内存从 1383 MB 降至 126 MB。微软的 Stephen Toub 也坦承存在数十处回归,且"这绝非主张所有大型 TypeScript 项目都该变成 Rust"。

值得关注: 这是迄今公开的最完整的大规模 Agentic 工程实证——不是 demo,而是 135 个可审查的小步发布组成的传送带式交付,成本与收益都可核算。它同时划出了边界:Agent 已在长周期、可机械验证的迁移类任务上具备工程可用性,但对 Rust 语义的深层理解仍有缺口。对团队决策的参考价值在于,可把"大范围重写"从不敢碰的债务转为可预算的工程项目。

来源:The Register(经 Evy's Nook 日报转述)

具身智能训练场破百家,数据采集价格带首次成形

中国信通院《具身智能训练场研究报告(2026年)》显示,截至今年 6 月底全国已建成启用超 70 家训练场,另有 40 余家在建或规划中,形成长三角、京津冀、珠三角三大集群(浙江 14 个居首,江苏、北京、广东、山东各 8 个),并开始向三四五线城市延伸。第三方统计进一步给出:截至 2026 年 8 月全国累计建成集中式具身智能数据采集中心 106 座、在运营 84 座,披露部署量的 52 座合计约 3972 台,全国在采集中心运行的机器人估计超 5000 台;55.8% 的中心部署不超过 50 台,最大的两座各 300 台。遥操仍是主流采集方式(83 座,79.05%)。价格带首次成形:真机数据约 500–1000 元/小时,UMI 数据 300–400 元/小时,仿真/合成数据 200–500 元/小时。

值得关注: 具身智能的瓶颈正从硬件能力转向训练数据质量,"机器人学校"成为公共底座型新型基础设施。价格带的意义在于数据开始被当作可计价的标准化商品,这对做具身数据基础设施(采集、清洗、标注、评估)的人是明确的信号:竞争维度将从"有没有数据"转为"单位成本与数据有效性"。同时也需留意争议——近期已有厂商公开质疑部分采集中心通过关联交易虚增营收,数据资产的真实需求仍需时间验证。

来源:中国经济网FutureX · Physical AI Daily Issue 126

智元 × 长隆:全球首个具身智能主题乐园 9 月 24 日启幕

智元(AGIBOT)与长隆集团联合打造的具身智能主题乐园将于 9 月 24 日在横琴长隆飞船乐园启幕,开园当日超 300 台智元全系机器人集体"上岗",园区设超 100 个机器人交互体验点,覆盖文娱商演、科普研学、导览导购、服务零售、智能伴游、酒店场景、体育竞技七类场景,数百个拥有独立姓名与性格设定的机器人角色参与互动。开园当天双方共建的具身智能文旅联合研究院揭牌,全球首个文旅场景大规模 5G-A 具身智能应用等成果同步亮相。智元 2026 年上半年人形机器人出货量达 8400 台,约占全球市场 44%。

值得关注: 与展会短时演示不同,主题乐园具备客流密集、运行时间长、游客需求多样的特征,是一次覆盖多机协同、连续运维、异常处理与真实数据闭环的大规模压力测试。判断其价值的关键不在开园爆点,而在三个指标:单机日均有效服务时长、故障与人工接管率、以及复购带来的体验差异化。若跑通,这将是具身智能从封闭工业场景走向公共服务场景的可复制模板。

来源:上海证券报(经网易转载)新华财经

今天的 AI Coding 领域有一盆冷水:微软把 26 个真实 Web 应用蒸馏成 4063 个编码任务,九个顶级编码智能体没有一个跨过 50% 的及格线。具身智能这边则是热火朝天的另一面——中国机器人峰会抛出上半年超 900 亿元融资的成绩单,同时行业开始把注意力从"纸面参数"转向评测标尺、真实工况数据和国家标准。

微软 ProgramDistill 基准:九个顶级编码智能体无一过半

微软研究院于 9 月 17 日发布 ProgramDistill,其做法是从 26 个参考 Web 应用中提取 1975 条可回放验证的行为,自动生成 4063 个编码任务,全程无需人工标注。任务形式与常见基准不同:智能体拿到一个可运行的参考应用和一个被挖空的不完整副本,必须先通过与完整版交互推断缺失行为,再动手实现——更接近真实的"接手遗留项目"场景。九个前沿编码智能体参测,GPT-6 Astra 以 49.2% 领先,Claude Opus 5 得分 28.8%,落后 20.4 个百分点,没有任何模型突破 50%。

值得关注: 比排名更有信息量的是随深度衰减的曲线——有智能体从单层重建的 100% 掉到八层的 64%,另一个从 96% 掉到 32%。这说明浅层复现已接近解决,而分层、有依赖关系的重建仍是硬骨头。对团队的现实含义是:编码智能体现在适合做局部、边界清晰的改动,把它当成"整仓重构执行者"来规划排期仍然危险。另一个反差点同样值得记下:FrogNano 这个 40 亿参数模型在无教师模型、无人工标注的条件下靠 1500 个合成 SWE 环境训练,就在 SWE-bench Verified 上拿到 61.5%,单张 RTX 4090 即可运行——把评测脚手架从 R2E-Gym 换成 Leaf,同一模型分数从 8.3% 跳到 37.2%,幅度比再训一轮 RL 还大。

来源:arXiv:2609.18805 · AI Daily Digest 9.20

AI Coding 工程化:Cloudflare 与阿里同日开源 Agent 审计/评审能力

GitHub Trending 上同时出现三个指向明确的项目:Cloudflare 的 security-audit-skill 把编码智能体编排成多阶段安全审计员,用彼此隔离的子智能体分别做侦察与复核,以对抗幻觉和确认偏误,并输出机器可读的审计结论;阿里巴巴开源 open-code-review,采用"确定性流水线 + LLM 智能体"的混合架构,内置多语言规则集覆盖空指针、线程安全、XSS 与 SQL 注入等常见问题,兼容 OpenAI 与 Anthropic 后端,已在阿里内部大规模研发流程中验证;另有 agent-skills 项目试图把面向编程智能体的工程技能打包成规范,推动从"能生成代码"走向"能产出符合工程标准的代码"。

值得关注: 这三个项目指向同一个转折——AI Coding 的竞争焦点正从"模型能不能写"转向"产出能不能进流水线"。隔离子智能体 + 独立验证 + 结构化输出,本质是把传统 CI 的确定性检查与 LLM 的语义理解做分层拼接,而不是让模型端到端包办。对工程团队来说,这类确定性规则打底、LLM 补充语义判断的混合架构,比单纯换更强的模型更容易通过安全与合规评审,也更接近可落地形态。

来源:AIToolly · AI News 2026-09-20 · Cloudflare security-audit-skill · Alibaba open-code-review

第九届中国机器人峰会:上半年融资破 900 亿,行业呼唤统一评测标尺

9 月 16 日至 18 日举办的第九届中国机器人峰会上,中国机电一体化技术应用协会会长曲道奎披露,2026 年上半年具身智能赛道融资总额已突破 900 亿元,人形机器人量产进程加速,2026 年被视为人形机器人"量产元年"。峰会同时发布多项成果:启动聚合高校、院所、医院与产业链龙头的康养机器人协同创新平台,发布《2026 中国具身智能产业出海研究报告》,并正式推出机器人具身智能能力评测框架,为产业建立统一评测标尺。曲道奎同时提醒,核心部件"卡脖子"、真实场景应用占比偏低、标准体系尚未统一仍是必须跨越的关口。

值得关注: 900 亿元融资与"评测框架发布"放在同一场合出现,本身就是信号:行业从资本驱动的规模扩张,转向需要可比较、可验收的能力度量。对处于数据基础设施层(采集、清洗、标注、评估)的从业者尤其关键——统一评测标尺一旦形成,评测数据集的口径、质量与真机覆盖率就会成为刚需,这恰恰是当前最稀缺的一环。浙江大学机器人研究院院长朱世强提出的"场景派 vs 技术派"分野也值得留意:前者短期能形成商业闭环但跨场景泛化差,后者泛化强却周期长、落地慢,两条路径都还没有跑通。

来源:证券时报 · 中国经营报

中国具身智能从舞台走向工厂:千台级部署与零部件成本塌缩

环球时报的报道给出一个具体切面:杭州"机器人学校"最近有四台机器毕业,分别去做美术馆导览、学校讲解、天津雀巢工厂的质检,以及韩国的娱乐演出。更硬的落地数据来自产线——在宁德时代的产线上,银河通用的重载人形机器人 Galbot S1 搬运数十公斤的料箱,该公司已在博世、丰田、上汽等工厂部署超过一千台;南昌一家工厂里,八台智元 Genie G2 承担平板电脑的完整质检流程,效率达到人工的 80%–90%,累计连续运行超 3000 小时。成本侧的塌陷同样惊人:2018 年售价 5–6 万元的电机,2026 年约 500–600 元;曾经售价 10 万元的高精度触觉传感器已降至几百元。

值得关注: "从能表演到能干活"是这条新闻真正的分水岭——表演打动观众,干活必须让生产经理满意。快速思考研究院院长田丰的判断是中肯的:中国的优势不在某个更强的算法或芯片,而在于把硬件、真实工厂需求、供应商快速响应和耐心资本拧成一个闭环,且这个闭环正在工业条件下接受检验。零部件成本两个数量级的下降,意味着过去因硬件成本被压制的本体创新和数据采集规模都有望放开。但中国工业经济学会人工智能系统建设委员会副主任盘和林也点出核心难题:具身智能面临的是与大模型不同的数据稀缺——互联网文本近乎免费,真实工况数据必须一寸一寸去采。

来源:Global Times

北京大学计算机学院前沿计算研究中心长聘副教授董豪出任启元机器人首席科学家后,北大与启元机器人联合发布 NavSpace 研究成果,被机器人领域国际顶级会议 ICRA 2026 收录。基于该研究,团队为机器人构建了"空间大脑",赋予其方位语义理解能力,可在真实环境中听懂并执行"去二楼最近的沙发旁"这类复杂空间指令。与此同时,启元机器人协同华东师范大学软件工程学院等机构参与《机器人智能控制系统总体架构》(GB/T 47245-2026)的研制,该国标填补了国内机器人智能控制系统架构领域的关键空白,意在破解控制系统碎片化的行业痛点。

值得关注: 空间语义理解是 VLA(Vision-Language-Action)类模型走向实用的关键一环——自然语言指令里大量隐含相对方位与层级空间关系,模型若只会识别物体而不会推理空间结构,就无法真正听懂人类指令。这条成果的价值还在于落地路径:学术团队依托产业方的硬件自研能力、实验室测试环境与量产验证平台,把算法直接放到真机上迭代,避免了"论文指标漂亮、真机一跑就废"的常见困境。国标层面的推进同样值得跟踪,控制系统架构一旦标准化,上层应用与底层本体的解耦才有基础,开发者生态才可能真正长起来。

来源:中国经济新闻网