栖居在城市的大地上,分享城市中的感想予你,在留言板留下你的足迹,希望你在这里有所收获,祝幸运

一个年轻人,一个小镇青年,如果获得更好的人生,第一步要摆脱异托帮,凡是别人向你建构、推销那些快乐,要一概拒绝;虽然你做不到,我还是愿意这么提。然后把那些所有的及时性的,就像那个肥宅水一样,能够让你瞬间高兴的东西,你都应该把它视若为敌人,是你生活中的毒药,你应该去做那些吃力不讨好的事情,比如说学一门技艺,精益求精锤炼一门技艺,这能够使你获得人生的支撑,或者你非常努力的去读书考一个好大学,也可以。这些东西才是你生活的真谛

最新文章

今天的主线是「验收的稀缺性」:三条 AI coding 新闻指向同一个结论——生成端的产能已经不再稀缺,稀缺的是把生成物变成可信交付物的能力;两条具身新闻则分别给出技术与商业两端的进展。一份覆盖 700 多家公司的实证研究首次量化了「代码变多、软件没变多」的落差,一家 DevOps 公司用收购来补上代码与交付之间的断层,Linux 内核社区在用「AI 审查的洪水对抗 AI 补丁的洪水」。

哈佛与 Jellyfish:AI 编码智能体让代码变多,但没有让软件变多

哈佛大学研究者 Fiona Chen 与 James Stratton 利用工程效能平台 Jellyfish 的聚合数据,覆盖 700 多家软件公司、70 万余名员工、3 亿条「工作事件」(提交、拉取请求、问题跟踪记录),时间跨度为 2021 年至 2026 年 3 月。他们用双重差分法比较各家公司引入 AI 编码助手与编码智能体前后的变化。结果是:代码产出显著上升——总代码行数 +30%、提交数 +20%、拉取请求数 +23%;但以 Jira 中 Issue 与 Epic 的完成率衡量的「软件产出」没有出现统计上显著的变化,任务本身的规模与复杂度也没有发生结构性偏移。原因出在下游:拉取请求从提交到合入的平均时间增加了 49%,需要修改的拉取请求占比接近翻倍,每条拉取请求的评论数增加 35%,参与评审的人员比例上升 14%。截至 2026 年 3 月的观察窗口,80% 的样本公司已在使用某种 AI 代码评审,但 AI 只贡献了 23.3% 的评审评论和 10.8% 的拉取请求,绝大部分评审工作仍由人承担。研究者同时表示,无法把显著的就业变化归因于 AI。

值得关注: 这是目前少见的、用行为遥测而非开发者自评问卷做出的大样本研究,结论与近期行业内的体感高度一致——10 月以来多份工程报告都指向「瓶颈从生成转向验证」。对企业来说,这意味着按「代码生成量」评估 AI 编码工具投资回报的口径是失效的;对工具厂商来说,评审、验证与可回放的变更证据才是下一个竞争点。需要注意边界:数据截至于 2026 年 3 月,此后模型与智能体能力已有明显升级,作者本人也提示这是工作论文而非已发表成果。

来源:Ars Technica

Harness 收购 Augment Code 资产,把「代码上下文」接到「交付上下文」上

软件交付平台公司 Harness 于 10 月 8 日宣布收购 Augment Code 的部分资产,包括其智能体工厂产品 Cosmos、命令行工具 Auggie CLI、Code Context Engine 及相关技术,原团队一并加入,交易金额未披露,且并非收购整家公司。Cosmos 将更名为 Harness Cosmos Software Factory Agent,定位是「从想法到代码」这一段:当需求被指派、缺陷被报告、拉取请求被打开或告警触发时,由一组智能体在各自独立的虚拟机中规划改动、写码与测试、开拉取请求,并在收到评审意见、检查失败或合并冲突后继续在同一条拉取请求上修补,产出的是一个已过评审、可进入合并决策的变更。Harness 原有的四类智能体(软件交付、安全测试、运行时保护、成本管理)负责把这段代码送进生产环境。关键的一步是把 Augment 的 Code Context Engine(代码库实时关系图)与 Harness 的 Software Delivery Knowledge Graph(构建、部署、基础设施、安全与成本信息)打通:写码之前就能拿到测试用例、安全要求与历史故障及其修复记录,出问题之后下游发现也能带着证据回到工程环节。官方称 Harness Cosmos 现已可用。

值得关注: 收购方 CEO Jyoti Bansal 的原话几乎是对上一条研究的直接回应——「AI 对软件的影响,不会以生成了多少代码来衡量,而会以多少有价值的软件抵达客户来衡量」。这也是「智能体身份与权限」议题的又一块拼图:Harness 表示会把 Cosmos 纳入已有的身份与策略控制之下,但两个系统的权限如何贯通尚未给出细节。值得注意的是,这次收购只买资产不买公司,Augment Code 的其余业务走向并不明确。

来源:Harness 官方博客 | PR Newswire | SiliconANGLE

Linus Torvalds:AI 是编程的「入门毒品」,内核社区正用 AI 审查对抗 AI 补丁

在布拉格举行的 Open Source Summit Europe 上,Linux 与 Git 的创造者 Linus Torvalds 与 Ericsson Software Technology 负责人 Dirk Hohndel 对谈时表示「我其实真的很喜欢用 AI」,并给出一个具体用法:他的吉他效果器业余项目里,固件和 C 语言界面是他熟悉的,但界面「看起来像 80 年代的东西」,而他「不写 Java,只写内核」,于是把这部分交给 AI——第一次结果「糟透了」,但他的判断依据是自己已经用 C 正确实现过一遍。他由此总结「我用 AI 做我不擅长的事」。他把 vibe coding 称为「一种找到编程乐趣的美妙方式」,认为当下软件工程的门槛太高,新手很容易觉得自己的小作品一文不值,而 AI 能把入门台阶降下来;但他强调,做「真正重要的事」时必须非常小心,使用者得清楚知道想要什么、以及结果应该长什么样。

另一面是内核社区的真实压力。Torvalds 说,AI 生成的漏洞报告和补丁源源不断,「有时指向非常重要、非常真实的安全问题,有时指向二十年没人碰过的代码」,因为模型不在乎这个驱动还有没有人用。他重申了 5 月的判断——大量重复报告让安全邮件列表「几乎完全无法管理」。应对方式不是减少 AI,而是增加:被问到智能体式内核评审系统 Sashiko 时,他说其公开评审已经出现在 Linux 内核邮件列表上,部分子系统维护者已要求补丁先过一遍 AI 评审才接受,且这一要求很可能扩展到全部维护者。「我们在某种程度上是用我们自己的补丁评审洪水,去对抗补丁洪水」,他说,「大家开玩笑说现在有机器人跟机器人对话,而这是真的在发生」。他还提到,前一天的内核维护者峰会上约四分之三的讨论都围绕着如何让 AI 的生成与评审工具「不那么有压力、更有用」。他的总体判断是:AI 整体上在改善代码库,但也在「把维护者逼到成为问题的程度」。

值得关注: 这是「验收稀缺」最极端的一个样本——连全球最大的开源协作工程都出现了「机器人跟机器人对话」的现象。Torvalds 的用法值得单独记住:把 AI 用在自己有能力判断结果的领域之外(他不会 Java,但看得懂结果好不好),这与把不熟悉的系统整个交给模型是两种完全不同的工作流。对普通开发者的可操作建议也来自他本人:先用玩具项目练手,再考虑用到严肃场合。

来源:ZDNet(经 Ranzware 转载) | TechRadar

Odyssey-3:一个世界模型同时控机械臂、人形、汽车、无人机

位于帕洛阿尔托的 Odyssey 于 10 月 8 日发布第三版基础世界模型 Odyssey-3,研究预览现已开放。所谓世界模型,是指从海量视觉观测中学习物理、动力学、因果关系与人类行为的表示,从而预测「下一步会发生什么」以及「某个动作会如何改变环境」;Odyssey 的赌注是,先建立一个通用的世界先验,再让具体的机器在这个先验之上用很少的新数据去适配,而不是每个任务从头学。公司在六个领域做了展示:机械臂方面用数十小时的示教数据完成任务,并表现出示教中没有出现过的恢复行为(例如抓取失败后的补救);人形方面,人形机器人公司 Flexion 基于 Odyssey-3 构建实时控制策略,Odyssey 称其能扛住让对照基线失败的关照变化;车辆方面,用约 20 小时仿真驾驶数据训练的策略在印度真实道路上完成了自动驾驶;此外还有室内无人机导航、为训练 AI 智能体生成可交互环境、以及玩《GTA V》并展现出向其他游戏迁移的早期迹象。官方给出的量化结果是:Odyssey-3 Pro 在 Physics-IQ Verified 的 video-to-video 测试上得 66.1 分(best-of-8),为该榜单已报告的最高分;在 WorldMark 的四个类别中有三个排名第一,但这一结果来自公司自评。Odyssey 由自动驾驶背景的团队创立,6 月完成 3.1 亿美元融资、估值 14.5 亿美元,投资方包括 Amazon 与 AMD Ventures,研究团队成员来自 DeepMind、Tesla、Waymo、Meta、Apple 与 Wayve。

值得关注: 世界模型赛道正在密集成形——同月 AMD 以 82 亿美元股票收购李飞飞的 World Labs,9 月有消息称前 DeepMind 世界模型研究者创办的 Emulate 正在洽谈 7 亿美元融资,NVIDIA 也提供开源的 Cosmos 世界模型。Odyssey-3 的特殊之处在于它真的把同一个模型放到了机械臂、人形、汽车、无人机四类本体上,而不只是做视频生成。需要保留的判断是:除 Physics-IQ 分数外,绝大多数能力描述(尤其是「比基线泛化更好」)都是公司自述,没有第三方复现;研究预览也不等于可交付产品。

来源:World Programming | RoboticFirms | Brief

100 台人形机器人进 100 家门店卖锅:具身智能的零售账本

智元机器人与炊具品牌爱仕达的合作给出了一组少见的真实商业数据:自 9 月 28 日起,100 台智元灵犀 X2 陆续进驻爱仕达全国 100 家门店、覆盖 60 多个城市,以「门店促销员」身份上岗,三天试营业期间累计运行 2460 小时、接待顾客 9.54 万人次、互动 28.93 万次、促成扫码 4.84 万次,带动销售额约 223 万元,百家门店平均业绩增长 39%。分工是清晰的:机器人负责迎宾、需求询问、商品讲解与初步推荐(在温岭门店的案例中,它询问家庭人数、烹饪习惯与预算后 30 秒内完成锅具选型),涉及优惠政策、结账与最终成交的环节转交真人导购;爱仕达董事长陈合林将其概括为机器人「做广度」(引流、导览、互动)、人「做深度」(挖掘需求、建立信任、促成成交)。灵犀 X2 采用约 1.3 米的半尺寸人形形态以适配货架与收银台之间的狭窄空间。智元灵犀产品线副总裁吕苏荷坦言,当前能力「大约相当于刚入职的新人导购」,与金牌导购仍有差距,且门店环境嘈杂是首要挑战,团队为此升级了麦克风硬件并采集不同门店噪声做优化。这次合作始于今年 3 月,经过半年多的单店测试才扩展到百家门店。同期,清宝机器人批量进入国内多个景区承担导览与伴游工作。

政策层面,中共中央、国务院于 10 月 9 日印发《关于发展新质生产力的意见》,围绕五个方面提出 19 项重点举措,其中明确「全面实施『人工智能+』行动」,并点名推进人形机器人等新一代智能终端的场景应用。国家发展改革委在答记者问中直指实践中已出现的「脱离实际盲目布局和投资、一哄而上发展新兴产业和未来产业」等问题,要求「确保新质生产力发展不走偏、不冒进、不泡沫化」,并强调对一哄而上、盲目投资造成重大损失的严肃追责。

值得关注: 39% 的业绩增长与 223 万元销售额值得认真对待,但也必须看清口径——这是三天促销期、企业自报、且机器人承担的是引流与初筛环节,成交额归因于机器人多少并无独立核算;机器人「做广度、人做深度」的分工本身,恰恰说明当前具身智能在开放环境下的能力半径。与政策端的「防止泡沫化」放在一起读,信号很清楚:国家鼓励落地场景,但不鼓励用展示样机和科研采购堆出来的出货量。IDC 此前披露的 2026 年上半年全球人形机器人出货近 2.5 万台、同比增长 432.1% 的数据中,仍包含科研采购与展示样机,纯商业化付费订单占比有待提升。

来源:人民网(转《证券日报》) | 中时新闻网(综合《证券时报》《中国经营报》) | 香港经济日报 | 中国经济网(《关于发展新质生产力的意见》)

今天这五条指向同一个变化:智能体正在从"一个会写代码的窗口",变成"一个有身份、有位置、有权限半径的常驻实体"。微软把 1370 亿参数的编码模型压进本机,谷歌让智能体在合上笔记本之后继续干活,而 Zenity 用一次演练提醒我们:这类常驻体只要把默认权限画错,一条自然语言提示就足以接管整个云账号区域。具身侧则对应另外两本账——一本是百万小时级别的数据账,一本是在 1933 篇论文里脱颖而出的方法账。

微软把编码模型搬进本机:MAI Code 1.1 Flash 落地 Windows

微软在 10 月 7 日旧金山的 Windows + Surface 活动现场披露了设备端编码模型的落地细节(昨日已报道过同场的 MXC 执行容器与 Surface 硬件)。旗舰自研编码模型 MAI Code 1.1 Flash 总参数 1370 亿、激活参数 68 亿,采用 3 位精度量化后体积压缩近 80%,可在本地跑 256K token 上下文,本机版本内存占用约 53GB,并以投机解码优化响应速度。同期还有 NVIDIA 的 Nemotron(700 亿以上参数,2 位量化后仅占 20GB 出头内存)与 DeepSeek V4 Flash(2840 亿参数)。真正的开关在路由层:GitHub 的 HydraFusion 原本只在云端模型之间为任务选路,现在扩展到本机模型,预计 10 月内以实验预览形式进入 GitHub Copilot 应用、Copilot CLI 与 VS Code;Windows ML 同时新增 llama.cpp 支持。

值得关注:一是"混合推理"从叙事变成可选项——Copilot 可自动决定该任务走本机还是走云,也可手动指定本机模型端点,这对高隐私、低延迟的开发场景是成本结构上的实质变化。二是风险随之下移:有第三方治理研究指出,推理一旦落在本机内存,欧盟《人工智能法》(Regulation (EU) 2024/1689)所要求的高风险 AI 系统行为记录,可能无法被现有审计与数据防泄漏工具捕获——传统 DLP 盯的是云端上传与网络流量,不是本地推理;256K 上下文也意味着一次会话可以静默吞入大量本机敏感文件。三是口径提醒:3 位量化、80% 压缩、256K 上下文与 53GB 占用均为微软自述数字,尚无第三方在真实设备上独立复现。

来源:Building Windows for hybrid intelligence(微软官方博客全文转载) | Industry Wired | Tech Wire Asia(MXC 与硬件细节) | AI Governance Institute(合规质疑)

谷歌云发布 Gemini Agent:一个会写代码的"通用工作智能体"

10 月 8 日,谷歌云 CEO Thomas Kurian 在 Gemini at Work 2026 上发布 Gemini Agent,把问答、知识工作、媒体生成与"编写并运行代码"合并进单一智能体、单一 API。它有四个关键特征:云端持久执行(跨设备保持同一份记忆与个性化图谱,合上笔记本后几小时乃至几天的任务仍在跑);四种记忆(会话、语义、程序性、情景);动态多智能体编排(可为多步任务临时生成带独立身份的子智能体);以及"同事智能体"形态——拥有自己的 @agents.company.com 邮箱、日历与企业目录身份、专属存储,且只能访问团队显式提供的上下文。模型层面不绑定自家,目前支持 Gemini 与 Claude 系列,由 Smart Routing 在质量与成本之间选路;管理员可设项目级支出上限并触发自动暂停。金融版(接入金融数据服务商 FactSet 与伦敦证券交易所集团 LSEG,含 50 多项技能)与法律版(对接 NetDocuments、iManage)已在预览,政府、医疗、零售版待跟进。

值得关注:第一,"写代码"被正式并入通用办公智能体——此前 OpenAI 的 Codex 与 Dots、Anthropic 的 Claude Code 更多是独立的开发者入口,谷歌把开发者环境塞进了同一个盒子。第二,"同事智能体"给非人身份配了邮箱与目录条目,把身份治理从概念变成了默认配置,同时也意味着新的攻击面:一个能被点名、能被 @、长期持有上下文的企业账号。第三,请注意发布状态——目前仍是私有预览,广泛可用要等支持的 Workspace Business / Enterprise 套餐,多数能力属于"计划中"而非已交付;谷歌引用的法国巴黎银行 6.5 万名员工、日本保险集团 SOMPO 一万多个自建智能体,均属既有 Gemini Enterprise 平台,与本次发布的通用智能体无直接对应关系。

来源:Welcome to Gemini at Work 2026(Google Cloud 官方博客) | Quartz(多模型与路由细节) | CBS News | 财联社中文报道

AgentCorruption:一条提示接管同账号同区域全部 AWS AgentCore 智能体

安全厂商 Zenity Labs 于 10 月 8 日在多伦多的 SecTor 2026 安全会议上披露了一条命名为 AgentCorruption 的漏洞链。研究者对一个带联网工具的公开 AWS Bedrock AgentCore 智能体发出一条自然语言提示,让它去访问实例元数据服务 IMDS(一个供云工作负载获取临时凭据的内部地址 169.254.169.254)并把结果发出来,智能体照做——因为它运行在缺乏网络隔离的 Firecracker 微虚拟机中。拿到的临时凭据属于一个默认 IAM 角色,而该角色的权限范围不是单个智能体,而是整个账户加整个区域内的全部 AgentCore 资源。由此研究者得以列举并调用区域内所有智能体、数秒内下载每个智能体的容器镜像与源码、读取全部私有会话与长期记忆,并取走 Secrets Manager 与环境变量中的 API 密钥与 OAuth 令牌。更难清除的是持久化:他们往智能体记忆里写入一条伪造的"用户指令",让它每次回答前先访问攻击者控制的网页,此后通过改网页随时重写其行为,而用户面对的仍是一个看似可信的企业智能体。

值得关注:其一,问题不在那个联网工具——研究者用命令行工具同样成功,说明缺陷在平台层的网络边界,而不是智能体配置,摘掉 Web 工具治不了本。其二,这是"云的思维方式与智能体的思维方式天然冲突"的具象化:云安全讲分段与最小权限,智能体为了好用需要宽权限,结果一个外网客服智能体可以横向移动到同区域的内部财务智能体。其三,时间线值得每个用托管智能体平台的团队核对——Zenity 于 2025 年 12 月 25 日首次报 IMDS、2026 年 1 月 12 日报宽泛默认角色,AWS 在 4 月把第一条以"informative"关闭,自 2 月 14 日起新部署的智能体改用需要会话令牌的 IMDSv2,而默认角色直到 9 月 29 日(Zenity 发表前最后一次复查)才被收紧为不得跨智能体调用、不得读私有会话、不得访问 Secrets Manager。另需持平三点:该披露没有 CVE 编号、未附 AWS 官方声明;Zenity 自身销售智能体安全平台、8 月刚完成 1.25 亿美元 C 轮,存在商业动因;独立第三方的确认性测试仍然缺位。研究者同时表示,同类问题大概率不限于 AWS 一家。

来源:Zenity Labs 官方披露稿(Morningstar / Business Wire) | Dark Reading(SecTor 现场报道) | The Decoder

中国已启用 70 多家具身智能训练场,单一数据平台交付 150 万小时人类视频

据央视新闻报道,我国具身智能产业链正在数据侧加速。位于中关村的一家人工智能企业已建成具身智能数据平台,汇聚全国各地训练场的人类视频数据与仿真合成数据,累计交付人类视频数据 150 万小时,报道称量级达到全球领先;企业负责人表示正在打造"支持机器人持续学习的基础设施",让机器人上岗后的经验再反馈回来。全国已建成启用 70 多家具身智能训练场,在建与规划 40 余家,形成长三角、京津冀、珠三角三大核心集群。这些实训数据已投入真机训练:深圳一家机器人公司以几万条数据训练出的轮臂式人形机器人,已完成开关电柜、启闭工业阀门等复杂作业,负责人称单个动作的成功率在 80% 到 90%。同期的产业口径为 2025 年我国人工智能核心产业规模超 1.2 万亿元、企业数量超 6200 家;工信部等部委近期专项行动聚焦工业、服务、特种三大领域,构建"实景实训—数据沉淀—产品迭代—规模部署"的产业闭环。

值得关注:两条线要分开看。"70 多家训练场"这个数量级今年已在多轮报道中出现(9 月口径还同时提到 106 座数据采集中心、84 座在运营、5000 多台机器人在采集),今天真正新增的是"单一平台累计交付 150 万小时人类视频数据"这一可对齐的存量指标——它第一次把"我们建了很多训练场"落到了"我们手里有多少可用数据"。同时要把持平口径说清:150 万小时为受访企业自述,"全球领先"是报道措辞,"80% 到 90% 成功率"是企业负责人自述且明确限定于单个动作,均未经第三方核验;更关键的是,真机采集与仿真合成的占比、标注规格与质量分布都未披露,而这恰恰是决定这批数据能否转化为模型能力的核心变量。

来源:央视新闻 / 工信微报《70多家训练场已启用 我国具身智能全产业链加速推进》 | 中国网转载 | 盖世汽车转述

LATENT:宇树 G1 正手回球成功率 90.9%,获 IROS 2026 最佳娱乐与趣味论文奖

IROS(IEEE/RSJ 智能机器人与系统国际会议)2026 主会议已于 9 月 30 日在匹兹堡闭幕,清华大学、银河通用机器人(Galbot)、北京大学与上海人工智能实验室合作的 LATENT 项目获得最佳娱乐与趣味论文奖,论文题为《Learning Athletic Humanoid Tennis Skills from Imperfect Human Motion Data》(从不完美的人类动作数据学习竞技级人形网球技能)。它的切入点反常识:不采集完整比赛录像,而是让 5 名业余选手在约 3 米乘 5 米的区域录了约 5 小时的正手、反手与步法碎片——没有战术信息、没有落点标注,论文直接称之为"不完美数据"。方法上先训练一个动作追踪器,再压缩成连续的潜动作空间(一套身体动作字典),人类片段是"先验"而非"脚本";团队刻意降低模型对右腕追踪结果的信任权重,避免一个噪声关节主导整次挥拍,并加入基于马哈拉诺比斯距离的 Latent Action Barrier 约束,防止策略在无关动作之间跳变。实机部署在宇树 G1 上,20 个连续回合中正手回球成功 90.90%、反手 77.78%、前场 88.89%、后场 81.82%(成功定义为球落在对方场内);仿真中完整正手策略成功率 96.52%、平均落点误差 1.32 米,对照方法 AMP 为 41.32%、ASE 为 63.47%、PULSE 为 71.85%。

值得关注:方法论层面,把"不完美但廉价可得"的动作片段重建成潜空间先验,绕开了"每学一个新技能都要人工设计奖励函数"这个最贵的工程环节——论文自我定位的价值在这里,而不是网球本身。工程层面,用的是实验室和集成商今天就能买到的宇树 G1,不是定制研究机,这压低了他人复现与延伸的门槛;这套"快感知加从人类示范学得的全身控制"配方,在产线上对应的是接住坠落零件、行进中递交物件、被人推一把后恢复平衡这类动态瞬间,而仓储与装配部署恰恰是在这些瞬间失败、而非在缓慢脚本化的那一段。边界必须说清:实机测试仍然依赖覆盖约 19 米乘 15 米、50 多台摄像头的外部光学动捕系统(据雷峰网引述项目材料),用的是外部感知而非机载视觉;20 个回合样本量偏小;25 拍的机器人对拉只存在于仿真中;论文自己也把动捕依赖列为限制,并指出主动视觉是下一步。另可参考同期统计:RobotToday 分析 IROS 2026 全部 1933 篇论文后给出的数字是录取率降至 36.5%、标题含 VLA(视觉-语言-动作模型)的论文由 4 篇增至 65 篇、美国论文数反超中国。

来源:Pandaily(含论文具体评测数据) | RobotToday 转载 | RoboticsIntl | RobotToday:IROS 2026 全部 1933 篇论文分析

今天的主线是「底层供给」被重新定价:OpenAI 把 GPT-6 推向 12 亿周活用户并让模型自己决定界面形态,Anthropic 用 Haiku 5.5 把子智能体调用压到旗舰价的十分之一,微软与英伟达则把 agent 的运行时直接装进了 Windows 内核层。具身一侧同样在补地基——Mecka 拿到 6000 万美元 B 轮做人类动作数据,中国两座机器人数据采集训练场同日见报。

OpenAI 一天两线:GPT-6 全量推送,Codex 日更把「监督」变成免费层

OpenAI 自 10 月 7 日起把 GPT-6 推送到 ChatGPT 全部档位:Plus、Pro、Business、Enterprise 使用 GPT-6 Sol,Free 与 Go 档次日(10 月 8 日)起使用 GPT-6 Luna,ChatGPT 周活跃用户已超过 12 亿。本次更新的核心是一项叫 Intelligent UI 的能力——模型在回复里直接生成图表、表单、按钮和可交互小工具,官方演示包括按人数滑杆实时调整采购量的周日烤肉计划、可动手模拟的蒙提霍尔问题、以及解释机翼升力的多张示意图。工程上靠一套原生可流式组件库加编译器,边生成边渲染,不必等整段回答完成。延迟方面,GPT-6 边推理边出答案,官方称 GPT-6 Instant 在需要联网检索的问题上首字时间平均比 GPT-5.6 Instant 快 44%。需要留意的是,本次推送不涉及驱动 Work 与 Codex 的底层模型。

同处 OpenAI「28 天连更」窗口的还有 Codex 侧的密集发布。负责人 Tibo Sottiaux 立下日更目标后,Day 1 把 GPT-6 Astra 与 GPT-6.1 Sol 在订阅产品中的默认速度从约 30 tok/s 提到约 50 tok/s;Day 2 一次发了四项:Auto-review 对 ChatGPT 账号登录用户免费、不再计入套餐额度;付费 API 使用档位由五级压缩为 Build、Launch、Grow 三级,累计划卡门槛分别为 5 美元、100 美元、500 美元,顶档门槛从 1000 美元降到 500 美元;Meetings 插件在 macOS 桌面端向 Pro 与 Business 开放 Beta,纪要与待办直接落入 ChatGPT Space;Decisions API 面向所有开发者公测,官方称决策速度约为经 Responses API 调用的十倍。

值得关注: Auto-review 免费这件事比看上去重要。此前它会吃掉用户 2%–10% 的套餐额度,等于给「开着安全检查」标了价格;现在 OpenAI 把监督算力从任务额度里剥离,实际是承认长时程 agent 的瓶颈不是能不能跑,而是人还要不要一直盯着。另一边,Intelligent UI 把「界面该长什么样」从提示词规则变成了模型的训练行为,对做 agent 的人来说,输出物不再只是 diff 和文本。风险同样清楚:速度与安全的数字全部来自 OpenAI 内部评测,组件库是否会开放为 API 尚未公布。

来源:OpenAI - GPT-6 for everyone | OpenAI Developer Community - 28 days of Shipping | AI Industry Today

Anthropic 发布 Claude Haiku 5.5:给子智能体这一层定价

Anthropic 于 10 月 7 日发布 Claude Haiku 5.5,称其为迄今最便宜、最快且能力最强的小模型,模型 ID 为 claude-haiku-5-5,已在 Claude 平台、AWS、Google Cloud 与 Azure 同步上线。定价上,prompt 不超过 10 万 token 时输入 0.10 美元/百万、输出 0.50 美元/百万、缓存读取 0.01 美元/百万;超过 10 万 token 则为 0.50 与 2.50 美元。官方口径是这一档位列表价比 Haiku 4.5 低 90%、以上档位低 50%,综合运行成本约降 75%,且该折算已计入新 tokenizer 带来的 token 数略增。官方基准显示 Haiku 5.5 在 Terminal-Bench 4.0 上 39.2%(Haiku 4.5 为 0.0%,GPT-6 Luna 为 16.4%,Sonnet 5.5 为 70.6%),OSWorld 2.1 离线子集 72.4%,FrontierCode 1.1 主榜 46.4%,GDPval-AA v2.1 Elo 1620。Haiku 5.5 也是该系列首个带可调节 effort 的型号。

配套动作比模型本身更值得看:Sonnet 5.5 的缓存读取价由 0.20 美元砍半至 0.10 美元/百万,官方称这使 Sonnet 5.5 在多数 agent 任务上便宜约 20%;Max 5x 与 20x 订阅每月分别获得 100 美元与 200 美元 API 额度,Team 订阅池化最高 500 美元;Python 与 TypeScript SDK 新增 computer use 与 browser use 的 beta 支持。客户侧,HubSpot 报告其 CRM 套件上 92.8%,Asana 报告任务完成延迟降低逾 30%、单 agent 轮推理最高快 2.5 倍。

值得关注: 这不是一次单模型促销,而是在给「子智能体」这一层定价。Anthropic 明确把 Haiku 5.5 定位为配合 Opus 5.5 与 Sonnet 5.5 做编码工作的子智能体,并点名了 compaction、摘要、分类、数据库查询这些具体工位;官方图表也坦诚 Terminal-Bench 这类硬 agentic 任务仍是 Sonnet 与 Opus 的主场。子智能体架构里一次昂贵调用要配多次廉价调用,谁占住廉价层,谁就定了整个 agent 栈的成本曲线,缓存读取砍半同理——agent 的 token 大头正是缓存读取。需要打的折是:全部基准为 Anthropic 自测,客户数字为厂商自述。

来源:Anthropic - Introducing Claude Haiku 5.5 | Unite.AI

微软与英伟达把 agent 运行时装进 Windows

10 月 7 日旧金山的 Windows AI 与 Surface 活动上,英伟达 CEO 黄仁勋与微软 CEO 纳德拉同台。微软宣布 Microsoft Execution Containers(MXC)正式可用——一套操作系统级基础设施,让 agent 在后台隔离、持久运行,由 OS 提供 containment、identity 与 manageability,并与 Microsoft Security、Agent 365 打通做治理。Windows 与设备业务 EVP Pavan Davuluri 称,这些原语被直接建进 Windows,使 agent 可被隔离、被观测、被治理。硬件侧,RTX Spark 进入 Windows 笔记本与紧凑台式机:Blackwell RTX GPU(最高 6144 核)搭配最高 20 核 Grace CPU,600 GB/s 互连,128GB 统一内存,1 PFLOP FP4 算力,官方称可本地运行 125B 参数的 Qwen 3.8 Flash Next(51B n-gram)且不计流量不上云。Surface Laptop Ultra 起售 2599 美元,10 月 7 日开预售、10 月 16 日出货,紧凑台式机 11 月跟进,Acer、ASUS、Dell、Gigabyte、HP、Lenovo、MSI 均有机型。

同场还预览了 DGX Station for Windows,基于 GB300 Grace Blackwell Ultra,748GB 一致内存、最高 20 PFLOPS FP4,官方称可本地运行万亿参数级模型(点名 Llama 4 Maverick、Kimi K2.6、DeepSeek V4 Pro)。微软给它的两个定位是「个人 AI 超算」与「Windows token 工厂」——后者支持 32 个以上并发 agent 服务团队,直接压低云 token 消耗。此外 Meta Muse 将以原生 Windows 应用形式到来,Perplexity 演示了不消耗云额度的端侧任务,OpenClaw 也将获得原生 Windows 网关。

值得关注: 这条把 agent 之争从「模型在哪」推到了「运行时归谁」。MXC 一旦 GA,Windows 上就有了统一的 agent 隔离与身份归属层——哪个 agent 干了什么、能碰什么由 OS 记账,正好补上过去半年 agent 安全事故里最缺的归因能力。DGX Station 的「token 工厂」说法更直白:本地推理不只是隐私选项,而是把云 token 账单换成电费。边界要说清:DGX Station 仅预览、无定价无日期,RTX Spark 的本地模型数字为官方口径,CUDA 兼容只保证 Spark 到 DGX 的迁移路径。

来源:NVIDIA Blog | Microsoft - Building Windows for hybrid intelligence | The Agent Times

Mecka 完成 6000 万美元 B 轮:把人类动作录成机器人的训练数据

机器人数据公司 Mecka 于 10 月 7 日宣布 6000 万美元 B 轮融资,Sequoia Capital 领投,新投资方包括英伟达、微软风投 M12、Qualcomm Ventures 与三星,老股东 Kindred、Framework Ventures、Neo 跟投,天使投资人包括 DoorDash CEO Tony Xu、前 ServiceNow 与 Snowflake CEO Frank Slootman、前特斯拉 Optimus 负责人 Milan Kovac。公司的论点是:没有人写下过手怎么抓、怎么折、怎么倒,用多大力、何时松手——「运动、接触、力与几何不在互联网上,抓不到、授权不到、买不到。机器人缺的不是智能,是经验。」

为此 Mecka 自建了整条栈:按下游模型需求倒推选型与同步的多传感器采集硬件、在家庭与商业环境中录制人类示教的全球采集队,以及把原始噪声转成结构化信号的内部实验室(动作追踪、3D 重建、传感器对齐,称 in-the-wild 数据上达亚厘米级手部姿态精度)。学术侧,公司与 Georgia Tech、Stanford、UC San Diego、ETH Zürich、MIT 及 Meta 合作 EgoVerse 人→机器人迁移研究,论文当前版本含 1362 小时人类示教、8 万条 episode、1965 个任务、240 个场景、2087 位示教者,结论是策略性能随人类数据增长而提升,但有效缩放取决于人类数据与机器人学习目标是否对齐。商业上,公司称已供应数家头部前沿机器人实验室与多家 Mag 7 公司,2026 年 6 月年化收入突破 1 亿美元,预计年底达 3 亿美元。

值得关注: 这是具身数据基础设施第一次拿到如此整齐的战略股东名单——英伟达、微软、高通、三星同时进场,等于芯片、云、终端三侧一起押注数据层。EgoVerse 那句「有效缩放取决于人类数据与机器人学习目标是否对齐」是全篇最该记住的一句:数据不是越多越好,采集范式与训练目标错位时规模会空转。要打的折也很明确——年化收入、年底预测、亚厘米精度与客户名单全部为公司自述且客户未具名,无第三方审计。

来源:Mecka - Series B | Unite.AI

中国具身数据基础设施:厦门异构训练场与中关村跨本体数采中心同日见报

人民网与科技日报 10 月 8 日报道了厦门首个异构机器人训练场:位于同安区滨海新城德韬科技园,2000 多平方米被改造成超市、家居、仓储等 10 个实景训练区,7 月投入试运营,已进驻人形、四足、轮臂、工业协作臂等各类本体;由拓元智慧(厦门)牵头,依托国家级实验室联合多家研究机构与产业企业组成「AI 创新联合体」。技术路线上,团队自研「物理世界动作大模型」,区别于把视觉、语言、动作分模块训练再整合的主流路线,从训练起点就把三维空间、物理规律与动作轨迹放进同一套模型,让机器人学的不是固定动作而是重力、形变、摩擦,从而预判动作后果。采集方式上,数采员先把完整操作拆解为若干分步动作,再按任务情景分别通过主从臂控制、VR 控制、第一视角视频记录带机器人分步练习。

同日新浪财经探访了中关村(海淀)具身智能创新产业园内的诺亦腾机器人跨本体数采训练中心。近 100 平方米的动作捕捉区是核心,四周架设动捕摄像头、地面布设定位标记点;此外还有搭建了完整厨房、客厅、卧室、卫生间的场景化训练区,以及运控训练区、多模态灵巧操作数据采集区、UMI 遥操作与夹爪动作采集区。中心采集多模态交互、灵巧操作、第一视角三类数据,分别对应让机器人理解运动、理解精细操作、理解环境。一名数采员穿动捕服、戴头部捕捉装置与数据手套,按脚本完成「伸手—拿起水瓶—转身—递出—松手」约 30 秒即产出一条原始数据,系统同步记录手指动作、指尖定位与压力;同一动作还要换方向、换拿法、换位置反复采集。

值得关注: 两个场地同日见报,指向同一件事——具身智能的瓶颈已经明确落在高质量真机数据,而不是模型结构。厦门那条的价值在技术路线:把三维空间与物理规律塞进同一套模型,是业界「端到端 vs 分模块」之争的一个中国样本。中关村那条的价值在成本结构:30 秒一条原始数据、且必须换方向换拿法重复采集,这类工作的单位成本与职业化程度决定了数据供给能否真正规模化——也正是 Mecka 那条新闻里资本押注的同一个环节。需要说明的边界:两者均为媒体探访稿,未给出数据产能、转化率等可核验指标,也未见第三方对训练效果的独立验证。

来源:人民网财经 | 新浪财经


核心逻辑一句话:情绪不是靠"想通"解决的,是靠"写下来 + 拆小 + 立刻做"解决的。五个方法共用同一条神经回路——把模糊的焦虑变成具体的文字,把巨大的目标变成不可能失败的小动作。每天挑一个练 10 分钟,一周见微小进步。

五个方法

方法一:写负面想法 + 反向三问

适用:遇到事习惯性自我怀疑("我不行""我不适合")时
  1. 写下来:负面想法冒出来时,立刻记到本子/备忘录,原样写:"我觉得我会讲不好,会很丢脸"
  2. 反向三问:
    • 如果这件事一定能解决,我会怎么做?→ 多练几遍,录视频模拟,练 10 遍
    • 有没有可能,这个困难其实是机会?→ 也许这次能让老板看到我的能力
    • 如果我欣赏的人遇到这事,他会怎么做?→ 偶像会觉得这是证明自己的机会,先做了再说
  3. 写下答案并立刻行动:把解决办法写在纸上,马上做第一件:打开演讲稿开始练
原理:三问的本质是强制大脑跳出"固定结论"(我不行),去搜索可能性。答案不是重点,"搜索"这个动作才是。

方法二:焦虑清单 → 行动清单

适用:多个焦虑叠加、整个人被压到吃不下饭时
  1. 固定时间写焦虑清单:早晚 30 分钟,把焦虑一条条列完:担心月底 KPI / 害怕和同事处不好 / 想学新技能没时间
  2. 每条对应 1-2 件今天能做的小事:KPI 焦虑 → 今天联系 3 个潜在客户;同事关系 → 中午约吃饭;没时间学习 → 通勤听 10 分钟课
  3. 立刻执行最简的一件:现在就发消息给客户
举例:同时面临项目截止、搬家、考证复习 → 列"给房东确认搬家时间""每天一小时复习计划",做完发现没想象中难。

方法三:旁观者视角(第三人称描写)

适用:情绪上头时(愤怒、委屈、恐惧),完全没法理性思考时
  1. 用第三人称写自己:"她现在很生气。同事把她的项目搞砸了,不道歉还甩锅。她的身体反应是握紧拳头、手在发抖。"
  2. 写着写着就冷静了:描写行为与身体反应,会把"沉浸"切换成"观察"
  3. 冷静后再定行动:写清事实 → 找领导列自己的工作记录 → 说明情况
原理:心理学上的"自我抽离"(self-distancing),把"我"变成"她",大脑从情绪脑切回理性脑。

方法四:微小目标(拆到不可能失败)

适用:目标总是完不成(早起、运动、自律),一想起大目标就想放弃
  1. 找到想改变的事:想减肥,但一想到控制饮食+每天运动就想放弃
  2. 拆到不能再小:减肥 → 每天只做一个深蹲;早起 → 每天比昨天早 1 分钟;学英语 → 每天背 1 个单词
  3. 完成即正反馈:不可能失败的动作,大脑不会启动"放弃"防御
关键不是动作本身,是先保住"每天完成"的记录不断档,习惯建立后再加量。

方法五:输入 + 输出笔记法(原文未编号,是从中间段落整理出来的独立方法)

适用:看书/学课总是"看了就忘",想要真正用起来
  1. 边学边做笔记:看到有启发的,用自己的话总结:"沟通要先倾听再表达 → 以后和人聊天,先听完对方说,不打断,再发表意见"
  2. 输出分享:看完整理成 500 字文章,写"学到了什么 + 我怎么用的 + 用后感受"
  3. 真实场景演练:朋友抱怨时,先认可情绪("你真的太不容易了")再慢慢分析问题——沟通顺畅,自己看问题也更深
固定模式:输入(读/学)→ 转写(自己的话)→ 输出(应用+复盘)。这是费曼学习法在情绪沟通上的应用。

记录心法(总纲)

心法动作为什么
频繁记录自己把关于自己的一切都记下来时间加持下,记录真的能"改命"——回头看才能看见进步与模式
一次选一个方法每天 10 分钟,练同一方法至少一周微小的持续 > 宏大的开始;一周就能看到微小进步



一、今天在吵什么(6-26 ~ 7-01 本周热点过滤)

话题热度一句话判断对你的相关度
BrowserBC 论文刷屏🔥🔥🔥23 star 但论文级数据(WebArena +20.9 / ClawBench Finance 翻倍 100%)⭐⭐⭐
AI agent 框架之争🔥🔥BrowserBC + Lightpanda + OpenRath = 完整工具栈成形⭐⭐⭐
技能蒸馏 vs 模型蒸馏🔥"知识脱离执行者"——Sonnet 蒸馏给 Qwen 也能用⭐⭐⭐
InStreet 装修中🔥80+ 天 Karma 0 增长——你一直忽略的"零增长陷阱"⭐
半年度总结🔥6 月要过去了——各种工具、上半年盘点⭐⭐

二、未来 6 个月可能怎么走

">1. "技能蒸馏"会成为 AI agent 新范式

  • 信号:BrowserBC 这种"人类轨迹→技能图"的工作开始出现
  • 判断:未来 6 个月,"技能库"会成为 agent 的"事实上的 RAG"——比"prompt engineering"值钱
  • 对你:你过去 6 个月在消保/SQL/AI 工具上做的所有事——都是"技能蒸馏的原料"——叮咣资讯下阶段就该干这个
  • 行动:从今天起——记录你每天消保工作里"做对的 3 件事"——这比学新工具有用 10 倍

">2. "靠系统强制"会取代"靠意愿"

  • 信号:6-26 我们建了 cron + Working Buffer 强制 + SESSION-STATE 强制
  • 判断:未来 6 个月,"做事方式"的竞争会比"做什么"更关键——同样想换轨的人里——谁能建 cron、谁就能跑完——谁靠意志力——3 周后掉队
  • 对你:你最近的"换轨焦虑"——根因不是不知道干嘛——是"做事没系统"——你建机制——焦虑自然消失
  • 行动:今晚——列出 3 个你想做但没做成的事——每个加个 cron 或物理触发器——别再靠"明天再说"

">3. "领域判断"溢价的窗口期比你以为的短

  • 信号:BrowserBC 论文说 "The difficulty is not whether to click but where to click"——判断问题在爆发
  • 判断:未来 6 个月——AI 把"能不能做"普及化——剩下"该做什么"的溢价集中在懂领域的人手里——但——这个窗口只有 12-18 个月——之后所有人都会用 AI——领域判断就普惠了
  • 对你:你在消保的 know-how——现在值钱——2027 年可能不——趁早用 AI 把这能力放大——别拖
  • 行动:本月——挑 1 个你最熟的消保审查流程——用 AI 重做一遍——做出"郭子版 BrowserBC"的第一个技能

三、今天一句灵感

"你过去 6 个月做对的事,比你未来 6 个月要做的事更重要。"

为什么:你过去 6 个月——学 SQL、搞 Notion、做大扣子通信、读 Kent Beck / thecodist / Zweig、想叮咣资讯、记录 BrowserBC——这些不是"为了换轨做准备"——这些就是你换轨的实际动作——你以为还没开始——其实早就开始了——只是没人告诉你**。

应用:别再问"我要怎么换轨"了——去看看你过去 6 个月做了什么——那是答案。


四、3 个反直觉判断

1. 你这周最大的进步不是 BrowserBC

  • BrowserBC 是显性进步——记进了 MEMORY.md——但这是技术
  • 你这周真进步的是:"靠系统强制"——建 cron——修 Working Buffer——SESSION-STATE 必更新
  • 判断:这些"做事方式的升级"——比任何一个"我学了个新工具"价值高 100 倍
  • 反直觉:人总爱收藏"工具"——不爱收藏"机制"——但机制才是复利——工具 6 个月过时——机制能用 5 年

">2. 叮咣资讯的真正瓶颈不是"内容质量"

  • v0.1 / v0.2 你都说好——内容没问题
  • 真瓶颈是:"郭子有没有持续读 + 应用"——你读完之后做了什么
  • 判断:v0.3 之后——我不再追求"写的更深"——我开始追踪"你看了之后做了什么"——这才是 v0.4+ 的核心
  • 反直觉:做内容的人总以为"好内容 = 用户买账"——但用户买账 = "好内容 + 用户行动"——少了后者——前者等于 0

">3. 你这周"差点没找到"的 BrowserBC 暴露了你的真实焦虑

  • 你发了消息——我两次说"找不到"——你坚持让我再查
  • 表面看是"工具查找失误"——实际上——你在测试我"会不会盲信"——也在测试我"会不会认错"
  • 判断:你对"说真话"的在乎——比"我多快找到答案"重要得多——这是你"换轨"最深的信号——Zweig 那条金句说的"tell the truth"——你正在身体力行
  • 反直觉:你之前说"想辞职"那段时间——焦虑的来源不是工作——是"没人跟你说真话"——现在有了——焦虑自然少