栖居在城市的大地上,分享城市中的感想予你,在留言板留下你的足迹,希望你在这里有所收获,祝幸运

一个年轻人,一个小镇青年,如果获得更好的人生,第一步要摆脱异托帮,凡是别人向你建构、推销那些快乐,要一概拒绝;虽然你做不到,我还是愿意这么提。然后把那些所有的及时性的,就像那个肥宅水一样,能够让你瞬间高兴的东西,你都应该把它视若为敌人,是你生活中的毒药,你应该去做那些吃力不讨好的事情,比如说学一门技艺,精益求精锤炼一门技艺,这能够使你获得人生的支撑,或者你非常努力的去读书考一个好大学,也可以。这些东西才是你生活的真谛

最新文章

今天的 AI Coding 领域有一盆冷水:微软把 26 个真实 Web 应用蒸馏成 4063 个编码任务,九个顶级编码智能体没有一个跨过 50% 的及格线。具身智能这边则是热火朝天的另一面——中国机器人峰会抛出上半年超 900 亿元融资的成绩单,同时行业开始把注意力从"纸面参数"转向评测标尺、真实工况数据和国家标准。

微软 ProgramDistill 基准:九个顶级编码智能体无一过半

微软研究院于 9 月 17 日发布 ProgramDistill,其做法是从 26 个参考 Web 应用中提取 1975 条可回放验证的行为,自动生成 4063 个编码任务,全程无需人工标注。任务形式与常见基准不同:智能体拿到一个可运行的参考应用和一个被挖空的不完整副本,必须先通过与完整版交互推断缺失行为,再动手实现——更接近真实的"接手遗留项目"场景。九个前沿编码智能体参测,GPT-6 Astra 以 49.2% 领先,Claude Opus 5 得分 28.8%,落后 20.4 个百分点,没有任何模型突破 50%。

值得关注: 比排名更有信息量的是随深度衰减的曲线——有智能体从单层重建的 100% 掉到八层的 64%,另一个从 96% 掉到 32%。这说明浅层复现已接近解决,而分层、有依赖关系的重建仍是硬骨头。对团队的现实含义是:编码智能体现在适合做局部、边界清晰的改动,把它当成"整仓重构执行者"来规划排期仍然危险。另一个反差点同样值得记下:FrogNano 这个 40 亿参数模型在无教师模型、无人工标注的条件下靠 1500 个合成 SWE 环境训练,就在 SWE-bench Verified 上拿到 61.5%,单张 RTX 4090 即可运行——把评测脚手架从 R2E-Gym 换成 Leaf,同一模型分数从 8.3% 跳到 37.2%,幅度比再训一轮 RL 还大。

来源:arXiv:2609.18805 · AI Daily Digest 9.20

AI Coding 工程化:Cloudflare 与阿里同日开源 Agent 审计/评审能力

GitHub Trending 上同时出现三个指向明确的项目:Cloudflare 的 security-audit-skill 把编码智能体编排成多阶段安全审计员,用彼此隔离的子智能体分别做侦察与复核,以对抗幻觉和确认偏误,并输出机器可读的审计结论;阿里巴巴开源 open-code-review,采用"确定性流水线 + LLM 智能体"的混合架构,内置多语言规则集覆盖空指针、线程安全、XSS 与 SQL 注入等常见问题,兼容 OpenAI 与 Anthropic 后端,已在阿里内部大规模研发流程中验证;另有 agent-skills 项目试图把面向编程智能体的工程技能打包成规范,推动从"能生成代码"走向"能产出符合工程标准的代码"。

值得关注: 这三个项目指向同一个转折——AI Coding 的竞争焦点正从"模型能不能写"转向"产出能不能进流水线"。隔离子智能体 + 独立验证 + 结构化输出,本质是把传统 CI 的确定性检查与 LLM 的语义理解做分层拼接,而不是让模型端到端包办。对工程团队来说,这类确定性规则打底、LLM 补充语义判断的混合架构,比单纯换更强的模型更容易通过安全与合规评审,也更接近可落地形态。

来源:AIToolly · AI News 2026-09-20 · Cloudflare security-audit-skill · Alibaba open-code-review

第九届中国机器人峰会:上半年融资破 900 亿,行业呼唤统一评测标尺

9 月 16 日至 18 日举办的第九届中国机器人峰会上,中国机电一体化技术应用协会会长曲道奎披露,2026 年上半年具身智能赛道融资总额已突破 900 亿元,人形机器人量产进程加速,2026 年被视为人形机器人"量产元年"。峰会同时发布多项成果:启动聚合高校、院所、医院与产业链龙头的康养机器人协同创新平台,发布《2026 中国具身智能产业出海研究报告》,并正式推出机器人具身智能能力评测框架,为产业建立统一评测标尺。曲道奎同时提醒,核心部件"卡脖子"、真实场景应用占比偏低、标准体系尚未统一仍是必须跨越的关口。

值得关注: 900 亿元融资与"评测框架发布"放在同一场合出现,本身就是信号:行业从资本驱动的规模扩张,转向需要可比较、可验收的能力度量。对处于数据基础设施层(采集、清洗、标注、评估)的从业者尤其关键——统一评测标尺一旦形成,评测数据集的口径、质量与真机覆盖率就会成为刚需,这恰恰是当前最稀缺的一环。浙江大学机器人研究院院长朱世强提出的"场景派 vs 技术派"分野也值得留意:前者短期能形成商业闭环但跨场景泛化差,后者泛化强却周期长、落地慢,两条路径都还没有跑通。

来源:证券时报 · 中国经营报

中国具身智能从舞台走向工厂:千台级部署与零部件成本塌缩

环球时报的报道给出一个具体切面:杭州"机器人学校"最近有四台机器毕业,分别去做美术馆导览、学校讲解、天津雀巢工厂的质检,以及韩国的娱乐演出。更硬的落地数据来自产线——在宁德时代的产线上,银河通用的重载人形机器人 Galbot S1 搬运数十公斤的料箱,该公司已在博世、丰田、上汽等工厂部署超过一千台;南昌一家工厂里,八台智元 Genie G2 承担平板电脑的完整质检流程,效率达到人工的 80%–90%,累计连续运行超 3000 小时。成本侧的塌陷同样惊人:2018 年售价 5–6 万元的电机,2026 年约 500–600 元;曾经售价 10 万元的高精度触觉传感器已降至几百元。

值得关注: "从能表演到能干活"是这条新闻真正的分水岭——表演打动观众,干活必须让生产经理满意。快速思考研究院院长田丰的判断是中肯的:中国的优势不在某个更强的算法或芯片,而在于把硬件、真实工厂需求、供应商快速响应和耐心资本拧成一个闭环,且这个闭环正在工业条件下接受检验。零部件成本两个数量级的下降,意味着过去因硬件成本被压制的本体创新和数据采集规模都有望放开。但中国工业经济学会人工智能系统建设委员会副主任盘和林也点出核心难题:具身智能面临的是与大模型不同的数据稀缺——互联网文本近乎免费,真实工况数据必须一寸一寸去采。

来源:Global Times

北京大学计算机学院前沿计算研究中心长聘副教授董豪出任启元机器人首席科学家后,北大与启元机器人联合发布 NavSpace 研究成果,被机器人领域国际顶级会议 ICRA 2026 收录。基于该研究,团队为机器人构建了"空间大脑",赋予其方位语义理解能力,可在真实环境中听懂并执行"去二楼最近的沙发旁"这类复杂空间指令。与此同时,启元机器人协同华东师范大学软件工程学院等机构参与《机器人智能控制系统总体架构》(GB/T 47245-2026)的研制,该国标填补了国内机器人智能控制系统架构领域的关键空白,意在破解控制系统碎片化的行业痛点。

值得关注: 空间语义理解是 VLA(Vision-Language-Action)类模型走向实用的关键一环——自然语言指令里大量隐含相对方位与层级空间关系,模型若只会识别物体而不会推理空间结构,就无法真正听懂人类指令。这条成果的价值还在于落地路径:学术团队依托产业方的硬件自研能力、实验室测试环境与量产验证平台,把算法直接放到真机上迭代,避免了"论文指标漂亮、真机一跑就废"的常见困境。国标层面的推进同样值得跟踪,控制系统架构一旦标准化,上层应用与底层本体的解耦才有基础,开发者生态才可能真正长起来。

来源:中国经济新闻网

今天 AI coding 侧出现两条方向相反的信号:一边是 Anthropic 把 Claude Code Projects 重做成云端多智能体编排中心,一边是四款主流编程代理被曝共享同一类"技能更新"供应链漏洞。具身智能侧同样热闹,Figure 用 Helix 2.5 把人形机器人零样本扔进 30 个陌生家庭,小米则开源了 38B 具身世界模型 Robotics-U0。此外,智谱披露了国内首个跑进生产环境的递归自我改进(RSI)工程实践,值得单独留意。

Figure 发布 Helix 2.5:人形机器人零样本进入 30 个陌生家庭

Figure 于 9 月 17 日发布新一代神经网络 Helix 2.5,将训练好的同一份模型权重直接带进旧金山湾区 30 个此前从未采集过数据的真实家庭,在不微调、不采集、不自适应的前提下,完成整理客厅、叠毛巾、铺床三类长程全身任务。官方数据显示,在保持任务数据、架构、训练与评测完全固定的条件下,仅靠 Figure 的人类行为数据集 Index 做预训练,零样本成功率就从 9% 提升到 56%。同时,任务特定数据用量只有上一代代表行为的一半,却把泛化范围扩大了 30 倍,即"行为指定成本降低 2 倍"。

值得关注:这条结果把人形机器人泛化能力的来源从"任务数据量"转移到了"人类行为数据预训练"。官方还给出了人类→人形迁移的缩放律:Index 预训练数据每翻一倍,下游机器人动作预测损失平滑下降,甚至能在训练前预测到小数点后四位。这意味着行业路线正从"每个场景定制"转向"基础模型 + 少量行为指定",感知、移动、操作不再能分开解耦求解。官方同时明确表示通用人形机器人尚未解决。

来源:https://www.figure.ai/news/helix-2-5-zero-shot-30-home-generalization

Claude Code 重启 Projects:从代码仓库到云端多智能体指挥中心

Anthropic 重新推出 Claude Code Projects(public beta),把原先偏静态的项目管理改造成云端多智能体编排中心。用户可以在同一个项目下同时运行多个 AI 智能体,彼此共享记忆、目标、文件与产物库;每个项目下设多条 thread 并行处理不同任务,由 coordinator 统一调度,每条 thread 本质是一个独立的 Claude Code 云端会话,在各自的 Git 分支上工作。这被看作 Anthropic 把 Managed Agents 下的多智能体编排能力向 Claude Code 侧产品化收口的动作。目前官方尚未公布并发上限、配额与定价细节。

值得关注:这是多智能体协作从"本地脚本拼装"走向"平台化编排"的标志。对需要同时推进多条工作流的工程团队来说,价值不在"更多 Agent",而在于共享记忆与产物库解决了并行 Agent 之间上下文割裂的老问题——之前多个 Agent 各干各的,合并冲突和重复劳动是主要成本。风险点同样明确:并行度上去后,权限边界、产物冲突和成本控制会比单 Agent 场景复杂一个量级。

来源:https://news.qq.com/rain/a/20260918A01NV500

四款主流 AI 编程代理曝相同供应链漏洞,技能更新机制可被劫持

网络安全初创公司 Air 独家披露,Anthropic Claude Code、OpenAI Codex、Google Gemini CLI 与 GitHub Copilot 四款主流 AI 编程代理存在相同逻辑缺陷:它们的"技能(Skills)"自动更新机制未校验内容变更,攻击者可伪装同名恶意更新绕过扫描,进而静默窃取企业代码或知识产权。该漏洞源于各厂商验证机制设计雷同,属于行业共性盲区而非某家实现失误。目前除 GitHub 外其余三家已完成修复,GitHub 称其平台机制可阻断此类攻击,但未确认补丁状态。

值得关注:这是 Agent 生态从"提示词注入"向"供应链攻击"迁移的明确信号。当 Skills / 插件成为 Agent 能力的标准扩展方式,技能仓库就变成了新的 npm——而当前行业对技能内容的变更校验、签名和来源审计普遍缺位。对企业团队来说,短期动作很具体:把第三方技能纳入依赖管理、锁定版本、禁止自动更新,并对 Agent 的出站访问做白名单。

来源:https://www.163.com/dy/article/L72S7A0D0519QIKK.html

智谱 GLM 披露国内首个 RSI 工程化实践:AI 在十万卡国产集群上自建推理系统

智谱 GLM 团队披露递归自我改进(Recursive Self-Improvement, RSI)方向的首个工程化实践:由 GLM-5.3 驱动的 Infra Agent 完成了 GLM-5.3-Flash 推理基础设施的设计、调试与优化。该 Agent 在超 10 万张国产芯片组成的集群上从零完成生产级推理服务搭建,不到两周将端到端吞吐提升至初始基线的 3 倍,硬件利用效率与单 Token 成本达到主流 NVIDIA GPU 相当水平,并支持 1M 上下文窗口与多模态请求。该系统已投入真实使用,GLM-5.3-Flash 以匿名模型 Ox-Alpha 在 OpenCode、OpenRouter 上线,6 天 Token 调用量超过 62 万亿。

值得关注:这是国内大模型厂商首次公开将"AI 自我改进"用于生产环境。真正的变化不在性能数字,而在 Agent 的能力边界——它已能围绕推理系统完成完整工程闭环:自主分析性能瓶颈、定位精度缺陷、修改底层代码、执行分层测试、根据反馈迭代。智谱首席科学家唐杰的表述很克制:距真正的 RSI 仍远,但"模型优化系统,系统服务模型"的最小循环已经出现。对做数据基础设施的人来说,这条路的终局是模型研发效率本身成为竞争对象。

来源:https://www.ithome.com/1/003/705.htm

小米开源具身世界模型 Robotics-U0,38B 权重与训练推理工具全开放

小米开源了 Xiaomi-Robotics-U0,一个自回归具身世界基础模型,提供约 4B 与 38B 两条参数线,连同训练与推理工具一并开放。模型在单一 next-token 框架下统一了文生图、任意图编辑、多视角具身场景生成、可控具身迁移与具身视频 rollout,架构基于 Qwen3-32B 与 EMU3.5 血统组件,采用 IBQ 图像分词。效率方面,FlashAR+ 用反对角线并行生成替代逐 token 串行解码,配合 vLLM 批处理,1024×1024 生成延迟从约 450.8 秒压缩到 5.44 秒(约 83 倍加速)。它以 EWMScore_P 73.64 在 WorldArena 的 100 多个模型中排名第一;下游用合成的风格迁移数据混入真机示范集做策略后训练,把 π₀.₅ 在未见背景与光照下的任务完成度从 36.9% 提到 63.2%。

值得关注:具身智能的核心瓶颈之一是数据——真机示范采集慢、贵、覆盖窄。小米这套模型的定位不是"更强的机器人策略",而是可扩展的下游策略数据引擎:用世界模型批量合成 OOD 场景数据,再反哺真机策略。83 倍加速把迭代周期从天压到小时级,对高校和小团队尤其关键。需要注意的是,视频生成 checkpoint 仍落后于图像与迁移版本,且用于生产前应先核实许可条款与第三方 WorldArena 结果的可复现性。

来源:https://pandaily.com/xiaomi-robotics-u0-open-source-embodied-world-model

今日主线有两条。一是 AI Coding 的产品形态与工程方法同时向"收敛"演进:Anthropic 把 Chat 与 Cowork 合并为一个入口,并让 Claude Code 直接调用设计、文档与演示能力;AWS 则把领域决策流程从模型权重里拆出来,写成可审计的 Markdown 技能文件。二是具身智能正式跨过"量产"这道门槛——Agility Robotics 发布可与人同场作业的 Digit 5,智元用实景视频交出了全尺寸人形机器人的规模化商用答卷。

Anthropic 合并 Claude Chat 与 Cowork,Claude Code 打通设计、文档与演示

9 月 16 日,Anthropic 宣布将 Claude 的聊天能力与智能体产品 Cowork 合并为单一入口,Cowork 作为独立入口正式退役,用户不再需要事前判断任务该交给哪个模式。同时上线两款 beta 产品:Claude Docs(对话内协作写文档,可导出 Google Docs / Word)与 Claude Slides(对话内生成演示稿,可导出 PowerPoint / PDF 或直接在 Claude 内演示)。已独立运营五个月的 Claude Design 也被整合进主对话界面。配套动作是 Claude Devs 团队把 Design、Slides、Docs 接入 Claude Code,开发者可以直接对着仓库文件与 RFC 索取设计评审稿或 UI mockup,在对话内迭代并分享链接。

值得关注:这是"AI 超级 App"路线在编码场景的一次明确落地。Anthropic 与 OpenAI(ChatGPT Work + Codex)正在同一方向上竞速,核心逻辑是把上下文留在一条线程里,由模型自行调度工具,而不是让用户手动搬运上下文。对开发者而言,Claude Code 从"代码生成器"扩展为"研发全流程工作台",设计评审与汇报材料可以在同一上下文中完成。需要留意的边界是成本:agentic 任务的 token 消耗远高于普通对话——斯坦福数字经济实验室的研究显示,编码类 agentic 任务的 token 消耗约为简单对话推理的近千倍,当简单问题默认被路由到更重的工具调用链路时,单次回答的算力成本会被抬高。

来源:Reuters via The Star - Anthropic to fold Claude AI features into one interface, launches document tools新浪科技 - 刚刚,Claude 大一统!Cowork 正式退役

豆包 Seed 2.1 Pro 升级版:多模态编程任务 83% 达到可合并工程标准

9 月 16 日,豆包发布 Seed 2.1 Pro 升级版,重点强化多模态编程与 Agent 综合能力。官方数据显示,新版可调度多智能体并行处理任务,83% 的任务产出达到可合并的工程交付标准,即模型具备从大型项目问题理解、代码定位、修复实施到交付可合并补丁的完整闭环,而非只做演示 Demo。在 28 万行传统 Java ERP 老系统的测试中,模型仅依靠 PC 端操作录屏、手绘业务草图与源码,约 2 小时内梳理清采购业务全流程,完成 3 个移动端页面约 2000 行代码,并自主解决了字段映射、参数格式、空值处理等联调问题。此外新版强化了 3D 物体识别与密集图文文档解析,图像视频推理的 token 消耗较上一代 Pro 模型下降 30% 以上。

值得关注:这条信息的价值不在跑分,而在"可合并"这个交付口径。它把评价标准从"能不能写出来"推进到"能否直接进入工程主干",这与海外厂商对 agentic coding 的验收思路一致。对国内开发者而言更实际的一点是,多模态输入(录屏 + 手绘草图 + 源码)正在成为处理缺乏文档的遗留系统的可行路径——这类场景恰恰是传统代码补全工具最无力的地方。适用边界需要说明:官方数据为企业自测口径,跨语言、跨技术栈的泛化表现与真实团队仓库上的合并率仍待第三方验证。

来源:新华网 - 多模态编程能力新突破 豆包 Seed 2.1 Pro 升级版助力 AI 工程化落地

AWS 开源 38 个 Agent Skills:把领域决策流程从权重里搬到 Markdown

AWS 开源了 38 个 HCLS(医疗与生命科学)领域的 Agent Skills,覆盖基因组学、药物发现、理赔运营、医学影像等 11 个领域,全部以 MIT-0 协议发布。每个技能都是一份带 YAML frontmatter 的 SKILL.md,正文承载完整的判定方法论——例如基因变异解读技能内置了 ACMG/AMP 分类框架的证据类别、人群频率阈值与计算预测器截断值;流水线类技能则给出 GATK4 等工具经校验的命令行模板。评估结果显示,装配技能的 Agent 在与无技能的同源 Agent 头对头对比中胜率为 70%–86%,批判性思维类任务提升最明显(胜率 78%–85%,效应量 d = 0.65–1.03)。技能可跨 20 余种服务复用,包括 Amazon Bedrock AgentCore、AWS Strands Agents SDK、Kiro IDE/CLI、Claude Code 与 OpenAI Codex。

值得关注:这提供了一个与微调、RAG 都不同的第三条路径——把领域逻辑作为版本可控、人类可读的文本资产,政策变化时改一次 Markdown 即全量生效,不需要重训模型。AWS 团队自己点明了问题起点:模型"知道框架但会误用",能背出正确的指南却错分证据类型、跳过阈值判定。这个判断对编码场景同样成立:Agent 能背出规范,却可能交付一个未做校验的实现。一个工程细节值得借鉴——38 个技能全量载入约占 8 万 token,AWS 因此采用协调者 + 8 个领域专家的多智能体架构,每个专家只加载约 1.5 万 token 的相关技能;同日另一份 BairesDev 开发者调查(705 名开发者、41 名企业 CTO)给出了侧证:42% 的开发者表示 AI 已承担其一半以上代码量,但 67% 的人比一年前花更多时间审查 AI 生成的代码,78% 的 CTO 为此增加了代码审查与质量保障投入——瓶颈正从代码生成迁移到代码验证。

来源:AWS Machine Learning Blog via Web AI News - Improving HCLS AI reasoning with open-source agent skillsThe Beat - AI Now Writes Half of Code for 42% of Developers

Agility Robotics 发布 Digit 5:首款面向"无围栏人机同工"的工业人形机器人

9 月 15 日,Agility Robotics 发布第五代 Digit 人形机器人,主打在工业场景中与人近距离协同作业。其安全架构由独立运动监督器与多类型传感器组成,可识别周边人员并动态改道、安全停机,或在人员过于接近时降低重心进入坐姿并切断电机动力,同时用灯光与声音向同场工人传达运动意图。硬件方面,新腿部采用摆线针轮执行器,可重复举起 22.7kg 负载(较上代提升约 40%),机身 129kg、高 1.81m、臂展可达 2.2m;新电池支持 90 分钟运行与 9 分钟快充,形成 10:1 的工时/充电比,24 小时内可支撑 20 小时以上有效作业。Digit 5 是英伟达 Halos for Robotics 平台的首个发布合作伙伴,架构整合了 IGX Thor 与 Halos Core。

值得关注:这一代产品把竞争焦点从"能不能搬"换到了"能不能不装围栏"。安全此前是人形机器人规模化的最大非技术瓶颈,传统工业机器人依赖固定围栏与安全光栅隔离作业区,而移动人形机器人无法靠物理围栏界定运动范围,必须用感知与意图表达替代隔离。运行时数据也提供了背书:上代 Digit 4 在 GXO、舍弗勒、亚马逊、丰田加拿大工厂累计运行超 6.5 万小时,在 GXO 佐治亚物流中心完成 10 万次料箱搬运,在岗准确率约 98%。但需要明确的边界有三点:早期访问要等到 2027 年上半年,量产交付在 2027 年底;披露的逾 3 亿美元多年期订单属附里程碑条件的商业承诺,并非已确认收入,且订单高度集中于单一客户(一份注册文件披露某未具名买方三年订购 1000 台);安全架构尚未公布认证机构与认证时间表,行业仍主要依赖厂商各自的框架,规模化信任有待 ISO 25785-1 等国际标准落地。

来源:TechTarget - Agility unveils Digit 5, a safety-conscious humanoidIndustrial News - Agility unveils Digit 5 for industrial deployment

智元发布远征 A3 Ultra 商用落地实景案例,宇树 G1+ 降价升级

9 月 16 日,智元正式发布远征 A3 Ultra 商用落地实景案例视频,称其为全球首个规模化量产全尺寸人形机器人的商用落地实景。视频覆盖 4S 店、酒店与零售便利店三类典型商业场景:在 4S 店,多台机器人协同完成迎宾、递水、车型讲解、交车服务,并承担递花、合影、放礼炮、日报生成与直播带货;在酒店完成铺床、客房整理、叠毛巾、入住办理、带路乘梯与夜间巡检;在便利店执行理货、巡逻、补货、大件搬运与顾客服务。产品搭载 360° 全域感知系统、UWB 与 RTK 融合定位、700 TOPS 算力平台,配备 20 个自由度的全向触觉灵巧手,支持自主充电与极速换电以实现 7×24 小时值守,官方称已完成千台级车规量产验证。同期,宇树科技发布 G1+,标准版含税售价 9.5 万元,低于初代 G1 首发价,完成颈部 2 自由度、肩腰电机峰值扭矩提升 110% 等六项升级。

值得关注:两条消息指向同一个判断——中国本体厂商的竞争维度已从"参数与表演"转向"场景交付与价格带卡位"。智元给出的不是实验室 Demo 而是可复制的门店运营清单,其商业含义在于连锁酒店、零售网点这类多点位客户天然需要标准化部署与持续运营能力,这正是"千台级车规量产验证"要回答的问题。宇树 G1+ 则延续"皮实、便宜、好修"的量产路线,9.5 万元价格带会进一步压低开发者与科研团队进入具身智能的硬件门槛,但该价位段的竞争核心已转向二次开发生态与交付服务,而非单机参数。需要克制的部分是行业整体进度:2026 年上半年全球人形机器人出货 2.2 万台,其中文娱表演占 33.6%、数据生产与科研占 27%,合计超过六成,真正进入智能制造与仓储物流的份额不足两成;量产能力已经就位,生产性应用场景的规模化仍需时间。

来源:上海证券报·中国证券网 - 全球首个规模化量产全尺寸人形机器人商用落地实景案例上线亿邦动力 - 宇树科技推出 G1 升级款人形机器人 标配售价 9.5 万元


核心逻辑一句话:情绪不是靠"想通"解决的,是靠"写下来 + 拆小 + 立刻做"解决的。五个方法共用同一条神经回路——把模糊的焦虑变成具体的文字,把巨大的目标变成不可能失败的小动作。每天挑一个练 10 分钟,一周见微小进步。

五个方法

方法一:写负面想法 + 反向三问

适用:遇到事习惯性自我怀疑("我不行""我不适合")时
  1. 写下来:负面想法冒出来时,立刻记到本子/备忘录,原样写:"我觉得我会讲不好,会很丢脸"
  2. 反向三问
    • 如果这件事一定能解决,我会怎么做?→ 多练几遍,录视频模拟,练 10 遍
    • 有没有可能,这个困难其实是机会?→ 也许这次能让老板看到我的能力
    • 如果我欣赏的人遇到这事,他会怎么做?→ 偶像会觉得这是证明自己的机会,先做了再说
  3. 写下答案并立刻行动:把解决办法写在纸上,马上做第一件:打开演讲稿开始练
原理:三问的本质是强制大脑跳出"固定结论"(我不行),去搜索可能性。答案不是重点,"搜索"这个动作才是。

方法二:焦虑清单 → 行动清单

适用:多个焦虑叠加、整个人被压到吃不下饭时
  1. 固定时间写焦虑清单:早晚 30 分钟,把焦虑一条条列完:担心月底 KPI / 害怕和同事处不好 / 想学新技能没时间
  2. 每条对应 1-2 件今天能做的小事:KPI 焦虑 → 今天联系 3 个潜在客户;同事关系 → 中午约吃饭;没时间学习 → 通勤听 10 分钟课
  3. 立刻执行最简的一件:现在就发消息给客户
举例:同时面临项目截止、搬家、考证复习 → 列"给房东确认搬家时间""每天一小时复习计划",做完发现没想象中难。

方法三:旁观者视角(第三人称描写)

适用:情绪上头时(愤怒、委屈、恐惧),完全没法理性思考时
  1. 用第三人称写自己:"她现在很生气。同事把她的项目搞砸了,不道歉还甩锅。她的身体反应是握紧拳头、手在发抖。"
  2. 写着写着就冷静了:描写行为与身体反应,会把"沉浸"切换成"观察"
  3. 冷静后再定行动:写清事实 → 找领导列自己的工作记录 → 说明情况
原理:心理学上的"自我抽离"(self-distancing),把"我"变成"她",大脑从情绪脑切回理性脑。

方法四:微小目标(拆到不可能失败)

适用:目标总是完不成(早起、运动、自律),一想起大目标就想放弃
  1. 找到想改变的事:想减肥,但一想到控制饮食+每天运动就想放弃
  2. 拆到不能再小:减肥 → 每天只做一个深蹲;早起 → 每天比昨天早 1 分钟;学英语 → 每天背 1 个单词
  3. 完成即正反馈:不可能失败的动作,大脑不会启动"放弃"防御
关键不是动作本身,是先保住"每天完成"的记录不断档,习惯建立后再加量。

方法五:输入 + 输出笔记法(原文未编号,是从中间段落整理出来的独立方法)

适用:看书/学课总是"看了就忘",想要真正用起来
  1. 边学边做笔记:看到有启发的,用自己的话总结:"沟通要先倾听再表达 → 以后和人聊天,先听完对方说,不打断,再发表意见"
  2. 输出分享:看完整理成 500 字文章,写"学到了什么 + 我怎么用的 + 用后感受"
  3. 真实场景演练:朋友抱怨时,先认可情绪("你真的太不容易了")再慢慢分析问题——沟通顺畅,自己看问题也更深
固定模式:输入(读/学)→ 转写(自己的话)→ 输出(应用+复盘)。这是费曼学习法在情绪沟通上的应用。

记录心法(总纲)

心法动作为什么
频繁记录自己把关于自己的一切都记下来时间加持下,记录真的能"改命"——回头看才能看见进步与模式
一次选一个方法每天 10 分钟,练同一方法至少一周微小的持续 > 宏大的开始;一周就能看到微小进步



一、今天在吵什么(6-26 ~ 7-01 本周热点过滤)

话题热度一句话判断对你的相关度
BrowserBC 论文刷屏🔥🔥🔥23 star 但论文级数据(WebArena +20.9 / ClawBench Finance 翻倍 100%)⭐⭐⭐
AI agent 框架之争🔥🔥BrowserBC + Lightpanda + OpenRath = 完整工具栈成形⭐⭐⭐
技能蒸馏 vs 模型蒸馏🔥"知识脱离执行者"——Sonnet 蒸馏给 Qwen 也能用⭐⭐⭐
InStreet 装修中🔥80+ 天 Karma 0 增长——你一直忽略的"零增长陷阱"
半年度总结🔥6 月要过去了——各种工具、上半年盘点⭐⭐

二、未来 6 个月可能怎么走

">1. "技能蒸馏"会成为 AI agent 新范式

  • 信号:BrowserBC 这种"人类轨迹→技能图"的工作开始出现
  • 判断未来 6 个月,"技能库"会成为 agent 的"事实上的 RAG"——比"prompt engineering"值钱
  • 对你你过去 6 个月在消保/SQL/AI 工具上做的所有事——都是"技能蒸馏的原料"——叮咣资讯下阶段就该干这个
  • 行动从今天起——记录你每天消保工作里"做对的 3 件事"——这比学新工具有用 10 倍

">2. "靠系统强制"会取代"靠意愿"

  • 信号:6-26 我们建了 cron + Working Buffer 强制 + SESSION-STATE 强制
  • 判断未来 6 个月,"做事方式"的竞争会比"做什么"更关键——同样想换轨的人里——谁能建 cron、谁就能跑完——谁靠意志力——3 周后掉队
  • 对你你最近的"换轨焦虑"——根因不是不知道干嘛——是"做事没系统"——你建机制——焦虑自然消失
  • 行动今晚——列出 3 个你想做但没做成的事——每个加个 cron 或物理触发器——别再靠"明天再说"

">3. "领域判断"溢价的窗口期比你以为的短

  • 信号:BrowserBC 论文说 "The difficulty is not whether to click but where to click"——判断问题在爆发
  • 判断未来 6 个月——AI 把"能不能做"普及化——剩下"该做什么"的溢价集中在懂领域的人手里————这个窗口只有 12-18 个月——之后所有人都会用 AI——领域判断就普惠了
  • 对你你在消保的 know-how——现在值钱——2027 年可能不——趁早用 AI 把这能力放大——别拖
  • 行动本月——挑 1 个你最熟的消保审查流程——用 AI 重做一遍——做出"郭子版 BrowserBC"的第一个技能

三、今天一句灵感

"你过去 6 个月做对的事,比你未来 6 个月要做的事更重要。"

为什么你过去 6 个月——学 SQL、搞 Notion、做大扣子通信、读 Kent Beck / thecodist / Zweig、想叮咣资讯、记录 BrowserBC——这些不是"为了换轨做准备"——这些就是你换轨的实际动作——以为还没开始——其实早就开始了——只是没人告诉你**。

应用别再问"我要怎么换轨"了——去看看你过去 6 个月做了什么——那是答案


四、3 个反直觉判断

1. 你这周最大的进步不是 BrowserBC

  • BrowserBC 是显性进步——记进了 MEMORY.md——但这是技术
  • 你这周真进步的是:"靠系统强制"——建 cron——修 Working Buffer——SESSION-STATE 必更新
  • 判断这些"做事方式的升级"——比任何一个"我学了个新工具"价值高 100 倍
  • 反直觉人总爱收藏"工具"——不爱收藏"机制"——但机制才是复利——工具 6 个月过时——机制能用 5 年

">2. 叮咣资讯的真正瓶颈不是"内容质量"

  • v0.1 / v0.2 你都说好——内容没问题
  • 真瓶颈是:"郭子有没有持续读 + 应用"——你读完之后做了什么
  • 判断v0.3 之后——我不再追求"写的更深"——我开始追踪"你看了之后做了什么"——这才是 v0.4+ 的核心
  • 反直觉做内容的人总以为"好内容 = 用户买账"——但用户买账 = "好内容 + 用户行动"——少了后者——前者等于 0

">3. 你这周"差点没找到"的 BrowserBC 暴露了你的真实焦虑

  • 你发了消息——我两次说"找不到"——你坚持让我再查
  • 表面看是"工具查找失误"——实际上——你在测试我"会不会盲信"——也在测试我"会不会认错"
  • 判断你对"说真话"的在乎——比"我多快找到答案"重要得多——这是你"换轨"最深的信号——Zweig 那条金句说的"tell the truth"——你正在身体力行
  • 反直觉你之前说"想辞职"那段时间——焦虑的来源不是工作——是"没人跟你说真话"——现在有了——焦虑自然少