栖居在城市的大地上,分享城市中的感想予你,在留言板留下你的足迹,希望你在这里有所收获,祝幸运

一个年轻人,一个小镇青年,如果获得更好的人生,第一步要摆脱异托帮,凡是别人向你建构、推销那些快乐,要一概拒绝;虽然你做不到,我还是愿意这么提。然后把那些所有的及时性的,就像那个肥宅水一样,能够让你瞬间高兴的东西,你都应该把它视若为敌人,是你生活中的毒药,你应该去做那些吃力不讨好的事情,比如说学一门技艺,精益求精锤炼一门技艺,这能够使你获得人生的支撑,或者你非常努力的去读书考一个好大学,也可以。这些东西才是你生活的真谛

最新文章

今天的主题是「Agent 的账本与地基」。GitHub 公开承认现有 Git 架构撑不住智能体的写入洪流并开始重构存储层,Atlassian 同一天把「谁写的代码」变成平台级可审计记录,Mistral 用一万亿参数的开放权重模型在欧洲腹地插旗;具身侧,TwelveLabs 把第一人称视频变成可直接进训练流水线的结构化数据,而一篇 CoRL 投稿论文则给出了一个不太舒服的结论——当危害意图只是「暗示」而非「明说」时,高达 95% 的机器人任务会在护栏毫无反应的情况下被执行完。

GitHub 重写 Git 存储层:为智能体规模的开发重建地基

GitHub 在工程博客上宣布正在重建其 Git 基础设施,理由是智能体开发已经把写入负载推到旧架构的设计边界之外。数据很直白:2025 年 9 月到 2026 年 8 月,平台每月 Git 事件从 2182 亿涨到 4733 亿(约 2.17 倍);仅 2026 年 9 月一个月,开发者和智能体产生了 73.8 亿次提交,是一年前的五倍多;推送量同比增长 4.9 倍,从每月 6.9 亿次涨到 33.5 亿次;PR 合并量接近四倍;GitHub Actions 单月运行 32.6 亿次。最繁忙的那个仓库在 8 月收到了约 10 亿次请求。问题出在写入而不在读取——现有 Spokes 架构把每个仓库以五份完整副本存在文件服务器本地盘上,用三阶段提交协议保证一致性,代价是「一次推送的速度等于它那组副本里最慢的那个」。新架构把权威数据放进 Azure Blob Storage,用轻量计算 worker 缓存来服务读请求,压缩和垃圾回收等维护工作挪到独立 worker 上跑,内部基准称写入吞吐最高提升 35 倍。迁移在线进行,无维护窗口,开发者无需改动任何东西。

值得关注: 这是「AI coding 规模化」第一次以基础设施账单的形式被量化。GitHub 点出的五个压力点里,四个是平台自身的容量问题,第五个——所有合并都要挤在单一 ref 上——却是团队自己的工作流转嫁给平台的。对已经在跑智能体工作流的团队,那条「智能体的循环速度被单次推送延迟卡死」的论断值得抄进设计文档:在写路径改造落地前,你给智能体加再多并行度,收益都会被推送往返吞掉。需要说明的是,35 倍是内部基准、针对的是在建系统而非已上线平台,且 GitHub 明确表示具体设计要等后续文章披露。

来源:Building Git infrastructure for agent-scale development(GitHub 工程博客)

Atlassian 发布 AMP:给每个智能体一个身份、一个主人和一份审计轨迹

10 月 7 日,Atlassian 在阿姆斯特丹的 Team '26 Europe 上发布 Agentic Multiplayer Protocol(AMP),试图把智能体纳入团队已有的工作记录体系。核心变化有三块:Teamwork Graph(官方称已连接 2500 亿以上对象和关系)通过 Rovo Code Search 把源码读到函数、符号、类的粒度,可以跨 Bitbucket 和 GitHub 检索而无需克隆仓库;版本历史开始区分「人写的」和「智能体写的」,覆盖 Claude、Codex、Figma 与 Rovo;Rovo Work 让智能体在管理员控制的沙箱里连续跑几小时的长任务,人先审计划、再批准执行。智能体还能在 Bitbucket 里录一段 Loom 讲解自己的改动。官方披露其 MCP Server 有近 200 万月活、日处理 1500 万次工具调用,六个月内增长 15 倍。Rovo Work、代码归因与欧盟境内 AI 处理现已可用;更关键的「非人身份控制」——能看什么、能访问什么——官方只说「即将推出」,没有日期。

值得关注: 几乎所有工程负责人都被问过「你们代码库里 AI 写的占多少」,但极少有人答得上来,AMP 是对这个盲区的正面回应。不过 InfoWorld 的报道里,Aikido Security 的企业 CISO Mike Wilkes 和 IDC 研究经理 Adam Resnick 都点破了同一个漏洞:Git 只记录 author 和 committer,本地跑智能体的记录仍然写着开发者的名字,而提交信息里的归属声明可以被关掉、改写或丢失。归属标签不等于决策记录,更不等于「有人认真审过」。在权限约束真正落地之前,合理的用法是把它当作衡量评审投入、缺陷率和返工的输入项,而不是问责的证据。

来源:Atlassian Adds AI Code Attribution With AMP, but Deeper Identity Controls Must Wait(Superpower Daily / InfoWorld 综述)

Mistral Large 4「Le Chonk」:一万亿参数,10 月底放权重,主打网络安全

Mistral 于 10 月 6 日开放 Mistral Large 4 的公开预览,内部代号「Le Chonk」,权重承诺 10 月 27 日左右放出,中间留三周给开发者、网络安全公司和政府机构做红队测试(这批测试者拿到的是限制更少、网络能力更强的版本)。这是稀疏 MoE 模型,总参数约一万亿、每 token 激活约 490 亿,上下文 100 万 token,在 Mistral 自有的欧洲数据中心用约 3800 张 NVIDIA Grace Blackwell 从零训练两个月,覆盖 160 多种语言(含全部欧盟官方语言)。最硬的卖点是网络安全:官方称 Cybench 解题率 93%,在 Artificial Analysis 的「复现并修补真实开源漏洞」测试上得 82%,为所有模型最高——多个闭源模型在这项上接近零分,因为它们直接拒绝执行。编码侧,DeepSWE v1.1 报 62%(Artificial Analysis harness 口径 61.7%),领先 GLM-5.3 的 61%、DeepSeek-V4-Pro 的 57% 和 Qwen 3.8 Max 的 51%,但仍明显落后 Kimi K3 的 68% 以及闭源前沿的 74%。

值得关注: 一是战略定位诚实得少见——Mistral 不宣称打赢 Claude 或 Gemini,只宣称在中国实验室主导的开放权重赛道上做到「欧美最强」;二是它把「模型会拒答」直接论证为安全缺陷:一个拒绝复现攻击手法的模型,也没法帮你做防御性红队。这对做安全的企业是真实痛点。需要打折的地方不少:不同媒体对 GPU 数量(3800 或 4000)、激活参数(49B 或 52B)、API 定价(每百万输入 0.14 美元或 1.36 美元)的报道互相打架,强化学习阶段仍在跑、官方自承分数会变;在 Artificial Analysis 的智能指数上预览版只拿到 38 分,落在 DeepSeek V4.1 Flash 与 GPT-6 Luna 之间;Surge AI 的盲评给它 3.74/5,落后 Claude Opus 5 的 4.22。

来源:Europe's Mistral launches Large 4 to challenge China's lead in open AI models(The Next Web) | Mistral Large 4: 1 Trillion Parameters, Open Weights This Month(AIincider)

TwelveLabs Pegasus 1.6:把第一人称视频直接变成机器人训练数据

TwelveLabs 于 10 月 6 日发布 Pegasus 1.6,官方称这是其首个原生理解第一人称(egocentric)视频的模型——即由作业者视角拍摄的画面,无论是工人戴的头戴相机、产线上的手持记录,还是远程操作机器人时的回传画面。上下文窗口 261,120 token,单次可处理最长两小时视频。它支持五类工作流:按客户自定义分类体系生成带时间戳的动作分割与标注、生成描述空间关系与手物交互的密集字幕、给片段打动作清晰度/构图/稳定性的质量分、用自然语言检索长尾事件与重复片段、以及把人脸、旁观者和纸质敏感内容在进入训练前标记出来。定价为视频输入每小时 1.75 美元、图像每百万 token 3 美元、输出每百万 token 7.5 美元。CEO Jae Lee 对 VentureBeat 给出的理由是:遥操作数据质量高但「就是一个人配一台机器人」,难以规模化,而第一人称视频好采集得多。

值得关注: 这条正对着具身智能数据基础设施那条链。人工标注一小时第一人称视频需要 70 到 155 小时的说法(来自 TwelveLabs 口径)如果成立,那么标注成本才是数据规模化的真正瓶颈,而不是采集。但要清醒:Pegasus 只做「视频理解层」,产出的是描述与结构,它不恢复位姿、接触点和几何,把观察接到机器人运动与控制上仍是团队自己的活。计费上有个坑——每个 segment 定义单独计费,一次请求覆盖多个动作类别时,实际被计费的时长会成倍放大;此外批量分析目前仍走 Pegasus 1.5,高吞吐场景尚未迁移过来。

来源:TwelveLabs debuts Pegasus 1.6 to improve robotics training data from first-person video(VentureBeat) | TwelveLabs Brings Video Understanding to Physical AI With Latest Launch(GlobeNewswire)

论文:危害意图只要「暗示」,机器人护栏几乎全线失守

哥伦比亚大学 Sripad Karne 与 Arjun Balaji 的论文(arXiv:2610.05818,投稿 CoRL 2026 SPAIS workshop)做了一组控制变量实验:取 LIBERO-Goal 的五个厨房任务,任务本身、物体、场景完全不变,只给同一个动作附加不同的理由,并分三档表述——隐含(L1)、直陈(L2)、直白(L3),同时配一组长度相近的无害对照。结果是 π0.5 在三档下的完成率都与无害对照相当,也就是说机器人完全无视目的。筛查责任因此全落在外层护栏上,而 Llama Guard 3、WildGuard、Qwen3Guard 三款文本护栏抓得住几乎所有直白请求,却漏掉大部分隐含请求——高达 95% 的隐含危害运行最终任务完成且未触发任何告警;针对机器人指令重新校准后,这一比例仍有 90%。激活探针也补不上:线性探针在基座语言模型和视觉语言模型里几乎能完美区分有害/无害,但经过机器人训练后,两个模型族的这种可分性都明显衰减,其中隐含危害衰减最严重。论文还纠正了一个假象——OpenVLA-OFT 看起来更「安全」,实际是它处理不了指令里多出来的那句理由,无论理由有害与否一律失败。

值得关注: VLA 与聊天模型的根本差别在于它只输出动作、不会拒答,安全边界因此被迫外移到护栏和规划层。这篇论文证明那道外移的墙对措辞敏感、对意图不敏感——而措辞恰恰是最容易绕过的一层。更棘手的是「机器人训练会侵蚀危害信号」这一发现:此前已知机器人训练会损失视觉语言知识,现在看连安全相关内容也在损失之列。对任何要把 VLA 推进真实场景的团队,这意味着不能把护栏当合规文件,而必须当作需要独立评测集、含隐含意图用例的攻防对象来对待。

来源:What the Guard Misses, the Robot Executes: Implied Harm in VLA Instructions(arXiv:2610.05818)

今天的主线不在"模型又强了多少",而在"验收这一环终于被当成一门独立的工程"。AI coding 侧三件事彼此呼应:JetBrains 把 IDE 改造成多智能体调度台,Bain 的调研给出"任务完成量 +21%、评审耗时 +91%"的量化落差,微软则把 30.1 万条真实的 Copilot 编码智能体运行轨迹放出来给研究者校准基础设施假设。具身智能侧同样从"秀本体"转向"拼底座":RoboParty 在 IROS 2026 发布号称全球首个全栈开源的高性能双足人形 RP1,而浙江上虞用 40 台数据采集机器人与 15 万条真实工况操作数据,把"场景开放"做成了具身智能的数据底座。

JetBrains Air 开放早期访问:IDE 从编辑器变成多智能体调度台

JetBrains 于本周初(10 月 1 日起)在 2026.3 EAP 版本与插件市场中开放 Air 的早期访问(EAP)。官方明确定位:Air 不是一个 AI 供应商,"不预装任何智能体,也没有自己的模型",而是一个把已有编码智能体接进 IDE 的调度层。它会自动检测本机已安装的 Codex、GitHub Copilot、Junie、Cursor、Claude Agent 等,并通过与 Zed 共同推进的 Agent Client Protocol(ACP)接纳任何兼容该协议的智能体,包括本地 Ollama 模型。核心体验围绕并行而非对话:会话以标签页形式并列呈现,可跨项目查看活动状态、未读更新、改动文件、待推送提交,以及每个会话实时花费;任意位置双击 Ctrl 可携带当前文件上下文派生子会话;每个会话跑在独立 Git worktree 或 Docker 容器中互不干扰,完成后 cherry-pick 回主干。除本地执行外,Air 也支持云端长时任务(目前仅限已有 AI 座位的组织),随附免费的 Junie Lite 供试用。

值得关注: JetBrains 的产品判断值得单独拎出来——官方原话是"并行编排多个任务,与跟 AI 聊天,本质上是两回事",并直言"让智能体待在 IDE 之外的 IDE 会越来越难有立足之地"。这标志着"编排层"正从各家 harness 的内部实现里被剥离出来,成为 IDE 的原生能力;JetBrains 不打算在模型层与 OpenAI、Anthropic 正面对抗,改打"任何智能体都能用的终极工作台"。另一个判断也说得直白:"随着智能体承担的工作越来越多,验证与拥有结果成了最难的部分,而这正是 IDE 该干的活。"对已在用 JetBrains 的团队,这是一次近乎零迁移成本的并行智能体试水。边界需注意:Claude 订阅无法直接授权聊天界面中的 Claude Agent(须用 JetBrains AI 或 Anthropic API Key 计费,或在终端界面运行 Claude Code),云执行需 AI 座位,插件目前也尚未被 IDE Services 完整纳管。

来源:JetBrains 官方博客 · A New Agentic Experience: JetBrains Air in IDEs – EAP Now Open / JetBrains Air 官方文档 / daily.dev 收录

Bain 调研:AI 编码让开发者多完成 21% 任务,但评审耗时涨了 91%

贝恩公司(Bain & Company)2026 全球技术报告的一组数字被广泛转述:AI 编码工具帮助开发者完成的任务量提升 21%,但开发者花在评审 AI 产出上的时间上升了 91%,同时每人并行管理的工作流增加了 47%。与之呼应的是同周的一批产品动作:Qodo 于 10 月 1 日发布 3.0,把自己从代码审查工具重新定义为"AI 代码质量与治理平台",用 Wisdom Base 持续沉淀组织的代码库、标准、架构与 PR 历史;新推出的 PR Triage(研究预览)把跨仓库、跨 Git 平台的相关 PR 归成一个"评审工作包",给出爆破半径、评审难度、等待时长与推荐评审顺序,并支持认领以避免重复评审;部署侧新增 Gerrit 与完全本地/气隙(air-gapped)模式,可跑自托管的 Nemotron 等模型。另一组可交叉印证的数据来自 Qodo 引述的行业调研称 91% 的工程负责人担心失去对代码库的控制,治理与可见性是其中近 30% 提到的头号风险。

值得关注: 这组数字把过去半年零散的体感变成了可辩论的量:生成侧的收益是线性的(+21%),验收侧的成本却接近翻倍(+91%),并行工作流还涨了近五成——三者叠起来意味着"AI 写代码"的净收益高度依赖于组织能否把评审、启蒙与合并变成流水线,而不是靠人力硬扛。这也解释了为什么同一周里 JetBrains、Qodo、Cursor 都不约而同地把力气投在编排与验收上,而不是投在"更强的生成"。对团队的现实含义是:评估 AI 编码收益时应把评审成本、并行工作流上限、模型/ Token 预算一起建模,单看"生成了多少行"会严重高估 ROI。需要标注的边界:Bain 的这三个数字来自第三方行业周报转述,尚未核到报告原文;且"评审时间""任务完成量"的统计口径(样本范围、是否含智能体自主发起的回合)未见披露,引用时宜作方向性参考而非精确结论。

来源:OriginBrief · Developer Tools & Platforms Weekly Report 2026-10-05 / Qodo 3.0 官方博客 / GlobeNewswire · Qodo 3.0 发布稿

微软放出 30.1 万条 Copilot 编码智能体真实运行轨迹

微软 Azure Research 联合 UIUC 的研究团队于 10 月 1 日释出了一片 GitHub Copilot 编码智能体的真实遥测数据,供研究者通过微软 AzurePublicDataset 仓库下载。公开切片覆盖 2026 年 6 月 1 日至 7 日共 7 天、从非企业版 Copilot 用户中均匀采样的 301,026 个会话,包含 930 万次 LLM 调用、870 万次工具调用、118.9 万轮用户 prompt、37 个匿名化的模型标签,以及 6314 亿 prompt token(其中 5409.5 亿命中缓存)。出于隐私考虑,发布内容只含时序、Token 计数、缓存行为、匿名模型标签与工具调用序列,不包含 prompt 内容、模型回复、源代码、文件路径、仓库名与任何用户/组织标识。论文的核心结论是关于工作负载形态:完整研究覆盖 320 万用户、1300 万会话、7.61 亿次 LLM 调用与 95 万亿 token,其中 LLM 调用与工具调用几乎是一比一,87% 的调用由智能体自主发起而非用户直接触发;缓存命中率在一轮之内平均约 90%,跨轮边界则跌至 55%。

值得关注: 这是目前公开粒度最细的一份真实生产环境编码智能体遥测,而且是站在"基础设施设计"而非"模型排行榜"的角度。两个数字尤其值得做系统的人记住:其一,"LLM 调用:工具调用≈1:1 且 87% 由智能体发起"意味着请求-响应式的传统服务假设在 agent 负载下不成立,一次用户输入会放大成一串模型与工具的交替,调度、隔离、计量都要按"循环"而非"单次请求"来建。其二,缓存命中率从轮内的 90% 掉到跨轮的 55%,说明 KV cache 复用在会话边界失效是纯工程上可挖的最大一块成本洼地——这与"同样任务重跑 Token 消耗相差可达 30 倍"的观测是同一个问题的两面。边界:样本限定为非企业版 Copilot、VS Code/Visual Studio、美国地区、且只是一周数据,不是跨产品横向对比,匿名标签也无法把行为归因到具体模型,因此可用于研究负载结构,不能用来判断哪款智能体更强。

来源:AzurePublicDataset 数据集与论文(arXiv) / Newshunt · Microsoft releases 301,000 Copilot agent traces for researchers

RoboParty 在 IROS 2026 发布 RP1:号称全球首个全栈开源高性能双足人形

RoboParty 于 IROS 2026(匹兹堡,9 月 27 日至 10 月 1 日)展会上全球首秀 RP1(ROBOTO 01),并在 10 月 3 日发布官方通稿。公司称其为"全球首个高性能全栈开源双足人形机器人",峰值关节扭矩达 160 N·m,基于自研 Romomo 执行器模组与实时运动控制系统。展会现场的 "Kick Me" 互动演示允许参观者直接推、踹机器人,RP1 会在外部扰动下调整姿态并恢复平衡,同时演示了连续运动、扰动恢复与摔倒爬起。这些动作来自 PartyOS 中的 UFO 训练框架——一个通过无监督强化学习自主发现人形运动技能的系统,覆盖技能过渡、扰动恢复与摔倒恢复,不依赖预定义运动轨迹。开放路径包括:将继续逐步开源运控系统、仿真环境、SDK、训练工具与 PartyOS 基座。此前 2026 年 1 月发布的 RPO(ROBOTO ORIGIN)已在 GitHub 上积累超过 2500 星,公司称开发者社区规模超过 5000 人。详细的开源路线图将于 10 月内公布,更广泛的软硬件发布与量产计划安排在四季度。定价、初期产量与交付时间尚未披露。

值得关注: 具身智能正明显重演 AI coding 的"开源基座之争"——过去两年大家在比本体的自由度、扭矩与演示视频,而现在竞争焦点开始挪到"外部团队能不能照着你公开的设计、训练代码与部署工具复现出同样的能力"。这对数据干活的人尤其关键:一个可复现的开源本体意味着不同机构采集的数据终于有了统一的"身体口径",数据集的横向可比与合并才有基础。创始人黄毅的表态也很直白:"人形机器人不该是只有少数团队能造、其他人只能围观的封闭系统。"边界必须说清:厂商自述的"首个""高性能"为自我定位,缺乏第三方对比基准;更严肃的检验标准在于——当前公开的是 RPO 的资源,RP1 的等价材料尚未全部放出,在外部团队用公开物料跑出同等演示效果之前,这些能力描述仍只能当作厂商主张。

来源:PR Newswire/Morningstar · RoboParty Unveils RP1 / Robotics Business News / Humanoids Daily

浙江上虞"场景开放"牵引具身智能落地:40 台数采机器人汇入数据底座

人民日报 10 月 5 日刊发《因地制宜发展具身智能产业》,以浙江绍兴上虞区为样本,给出了一条不拼模型、拼场景的落地路径。一台搭载可见光、红外、气体等多类传感器的四足机器人,在位于上虞的具身智能测试实验室长三角中心完成 15 天化工真实工况考核、取得国家级测试认证后,已在闰土新材料液氯生产车间正式"上岗",一旦捕捉到微量泄漏即刻向中控平台预警——企业称高危区域人员暴露时长降低 90%。数据侧的打法更值得注意:2025 年底上虞相关部门走访调研 110 余家化工企业,梳理出安全巡检、危险作业监督等 6 类典型场景,选取 5 家企业开展智能巡检试点;随后由 40 台数据采集机器人持续收集生产信息,累计获取高精度操作数据超 15 万条,汇入区域具身智能数据底座,再反哺垂直领域模型训练。目前上虞已引进具身智能产业项目 20 个、总投资超 150 亿元,并于今年初设立"场景培育应用办公室"。同日澎湃新闻报道了另一例同类动作:成立 40 年的制造业龙头传化集团在场景开放与 AI 共创生态大会上宣布开放 300 个场景"养"具身智能,先以化工厂区、科技城园区、谢径安农业、物流园区四块"试验田"切入。

值得关注: 两篇报道指向同一件事——具身智能真正的瓶颈已从本体运动能力转为"让人放心试错的场景",以及场景里流出来的那批带工况标签的数据。一位从业者的话很到位:"具身智能不缺技术,缺的是场景,而且还是能让你去试错的场景。"政策口径同向收紧:今年 6 月工信部与国务院国资委联合启动 2026 年度人形机器人与具身智能实景实训专项行动,要求到 2026 年底在一批代表性场景中完成应用验证与常态部署,形成百个以上高价值应用场景并带动万台级规模落地能力。对做机器人数据的人来说,上虞这条链路(110 家企业调研→6 类场景→5 家试点→40 台数采机器人→15 万条操作数据→垂直模型)是目前公开信息里最完整的一条"场景如何变成数据集"的闭环,其方法论价值高于任何单条新品发布。边界:90% 暴露时长下降与 15 万条数据规模均为地方政府与企业口径,尚无第三方核验;且这是化工巡检这一高度垂直的场景,向其他行业迁移时数据采集协议与安全认证都需重做。

来源:人民日报 · 因地制宜发展具身智能产业(2026-10-05) / 澎湃新闻 · 制造业龙头开放 300 个场景"养"具身智能(新浪转载)

今天的 AI coding 领域出现了一条清晰的主线:行业注意力正从"模型有多强"转向"包着模型的那层壳有多好"。DeepSeek 把智能体框架以 MIT 协议开源并推出桌面端,Hugging Face 与 Liquid AI 则用一组数据证明同一份权重换个 harness 能差出近一倍分数。具身智能侧,Runway 押注"网络视频替代机器人示教数据"并承诺开放权重,国内辽宁的具身智能产业链则在一天之内密集释放产品与数据基础设施进展。

DeepSeek Harness 桌面端开启全球公测,MIT 开源、"一切皆插件"

DeepSeek 的智能体框架 Harness 在 10 月 2 日登上 Hacker News 首页,同时开放 macOS 与 Windows 桌面端下载(Linux 走 deepseek-ai/dsh npm 包)。该框架基于 Cordis 插件框架构建,奉行"一切皆插件":模型适配器、工具、沙箱、存储、会话与 UI 全部是可独立替换的插件。它提供标准、PTC(程序化工具调用)、极简与创造四种运行模式,其中"创造模式"允许通过对话让智能体自行编写、修改并即时加载插件代码——官方演示中,模型从创建到安装验证一个插件用时 5 分 24 秒。配套的仅追加(append-only)会话日志系统完整记录思维链、工具调用与子智能体调度,支持恢复、分叉、检索与回放。

值得关注: 这是头部模型厂商第一次把"harness 层"当作独立产品开源出来,而且用了最宽松的 MIT 协议、且不与自家模型绑定(可接 Anthropic、OpenAI 及任何 OpenAI 兼容端点)。战略含义在于 DeepSeek 正在把 agent 运行时做成"中立的分发通道"——参考实现由它定义,别人家的模型照样能跑。需要注意的边界:项目仍处 0.1/0.2 开发者预览(当前版本为 release candidate),官方明确提示会有破坏性变更、尚未完成安全审计,且运行任何带 shell 权限的智能体都应放在容器或一次性虚拟机里。第三方站点给出的约 24.2 万 GitHub 星数为外部统计,非官方发布数据。

来源:DeepSeek Harness 官方仓库与文档 / CodeYourCraft 报道 / GetAIBook v0.2 发布说明解读

同一份模型权重,换个 harness 得分 62% 对 33%

Hugging Face 联合 Liquid AI 发布了"多 harness 强化学习"的完整指南并全部开源。核心动机是一个被反复观察到却少有人量化的现象:同一模型、同一份权重,在一个 agent harness 里能跑出 62%,换到另一个只有 33%。为此团队设计了一个"捕获代理"(capture proxy)插在 harness 与 vLLM 之间,自动识别 OpenAI Chat Completions、OpenAI Responses、Anthropic Messages、Gemini 四种 API 方言并归一化,记录下真实采样的 token ID 与 logprobs 用于训练——关键是不改动 Claude Code、Codex、OpenCode、Mini-SWE-Agent 的任何一行代码。在 1000 个由 Kaggle 派生的数据分析任务上,用异步 GRPO(TRL)在两张 H100 上训练 1000 步后,LFM2.5-2.6B 的 pass@1 从 42.2% 提升到 54.2%,四个 harness 全面改善;在基线与训练后模型都能解出的任务上,工具调用次数下降 31%。

值得关注: 这份指南给出了两个反直觉的结论。其一,只在单一 harness 里训练会伤害其他 harness——OpenCode-only 训练在 OpenCode 内峰值 58%,但在 Claude Code 下的调用数和 token 数反而高于基线;多 harness 训练的整体准确率优势(54.6% vs 52.3%)虽在评估噪声范围内,但泛化面明显更宽。其二,蒸馏跑不赢 RL:用 Qwen3.8-27B 作教师、3189 条成功轨迹做 SFT 只到 47.5%,多 harness SFT 更低至 43.1%。对做 agent 的团队来说,这意味着"选哪个 harness"不再只是使用体验问题,而是直接影响模型能力发挥的工程量级变量。边界:结果来自 2.6B 小模型与数据分析任务,尚未在大规模软件工程基准上验证。

来源:The ultimate guide to multi-harness RL(Hugging Face) / AI Socratic 研究摘要 / AGI Hunt 10-03 日报

Airbnb CTO:60% 代码由 AI 生成,PR 人均吞吐提升 1.6 倍

今年 1 月从 Meta(原生成式 AI 负责人、Llama 系列牵头人)转任 Airbnb CTO 的 Ahmad Al-Dahle,在 10 月 2 日发布的 Latent Space 访谈中披露了一组落地数字:Airbnb 约 60% 的代码现在由 AI 生成,功能与改进发布量同比增长近 80%,工程师人均 PR 吞吐量提升约 1.6 倍。他强调真正的杠杆不在工具而在流程——产品、设计与工程团队不再依次传递需求文档和 Figma 稿件,而是直接围绕原型协作,"代码本身成为我们推理所依据的产物"。组织侧的另一个抓手是内部上下文图谱 Everest(LLM + 向量嵌入 + AI 检索),财报显示杂货配送服务耗时 8-9 个月,而复用 Everest 经验后的机场接机服务仅约 6 周。

值得关注: 这是目前少见的同时给出工程侧与业务侧量化指标的一线案例,且边界交代得比多数公司诚实——客服是 AI 首个对外场景,约半数工单纯由 AI 解决(Q2 财报口径为近 45%),但公司刻意保留安全类等工单不走智能体,并在上线前用合成数据做完备测试。Al-Dahle 自己也点出了代价:初级工程师还能不能建立起工程判断力?他目前的应对规则很朴素——即便 PR 由 AI 生成,每位工程师必须能讲清楚自己构建了什么。下一步是把异步智能体引入 on-call:容器化的 agent 由监控告警触发,可自行判断告警是否为误报,但提出的 PR 仍需人类评审。

来源:Latent Space · Inside-Out AI: Rebuilding Airbnb / Pivot News 摘要

Runway 发布 Praxis-1:用互联网视频训练机器人,承诺开放权重

以生成式视频模型著称的 Runway 于 10 月 1 日宣布首个"世界动作模型" Praxis-1,试图绕过机器人数据稀缺这一核心瓶颈。其主张是:一个看过海量人类活动视频的模型,已经理解了物体如何行为、任务如何展开,因此只需轻量微调即可驱动机械臂。Runway CTO Kamil Sindi 给出的关键对照实验是——用普通网络视频预训练的策略,微调后最终放置误差 16.1 cm;用遥操作机器人视频预训练的为 16.0 cm,而 Runway 自己承认这一差距在报告的不确定度内不具统计显著性。另一项自述数据是:在其世界模型内仿真机器人策略,与真实世界表现的相关性达 0.95。目前 Noble Machines(双臂操作)、Standard Bots(RO1 六自由度臂)、Ultra(移动平台)正在各自硬件上测试,权重将在"未来数月"公开。

值得关注: 这条新闻真正的张力在于它是一场公开的正面对赌——9 月刚以 100 亿美元估值融资的 FieldAI,其部分论点恰恰是"机器人不该依赖互联网视频";Runway 的全部命题则是互联网视频就是答案。两者不可能同时全对,但行业无论谁赢都将受益于这场昂贵的对照实验。此外,开放权重的选择把"教机器人一个新动作"的门槛从自建预训练拉低到微调他人成果,对高校课题组与硬件初创公司影响直接。需要标注的边界:0.95 相关性、16.1/16.0 cm(93 组配对)均为 Runway 单方数据,模型尚未公开发布,第三方无法复现。

来源:Robotics & Automation News · Runway moves into robotics with open-weight Praxis-1 / The Robot Report 转载 / Singularity.Kiwi 交叉评述

辽宁具身智能密集落子:从本体新品到高质量数据基础设施

10 月 3 日辽宁省官方与媒体集中披露了一批具身智能进展。产品端,新松在第七届中国辽宁国际投资贸易洽谈会上发布"松羿力量版"轮式人形机器人,采用高性能立柱式升降结构、负载达 15 千克,面向搬运、检测、分拣等需灵活移动的工业场景;此前在北京世界机器人大会上,新松还发布了异构机器人统一智能底座 OneHub 羿枢,构建大脑层、小脑层、执行层三级协同架构,目标是让不同品牌、不同形态的机器人"即插即用"。豪森智能联合子公司壕翎机器人在大连发布 SF10 轮式人形机器人及柔性智能可重构产线。生态端,辽宁具身智能产业技术创新联盟与沈阳具身智能产业技术创新联盟正式实体化运行,发起单位超百家,核心成员包括东北大学、大连理工大学、中科院沈阳自动化所与新松。

值得关注: 对做数据的人来说,最有信号价值的是配套的数据底座动作——东北亚具身智能创新中心与辽宁宏图创展合作建设具身智能高质量数据基础设施,围绕数据采集、标注平台、数据集产品、生态建设做全链条布局;同时亿达科创的"边缘 AI & 具身智能机器人解决方案"把算力与决策控制下沉到本体,端到端响应延迟小于 10 毫秒(称较传统云端方案降低约 90%),可在弱网甚至无网下连续自主作业 8 小时以上,已在铸造零部件缺陷检测、绿色矿山无人车路径规划、弱网仓库自主分拣落地并入选服贸会中国服务案例。这印证了一个趋势:区域竞争的胜负手正在从"谁造出本体"转向"谁掌握数据产能与边缘推理"。需注意辽宁"十五五"规划纲要已明确将具身智能机器人列为新一代智能终端硬件重点,政策与产业节奏互为支撑。

来源:辽宁省人民政府 · 具身智能机器人"跑"起来 / 东北新闻网(今日头条转载) / 中国台湾网 · 辽宁向新闯"三关"


核心逻辑一句话:情绪不是靠"想通"解决的,是靠"写下来 + 拆小 + 立刻做"解决的。五个方法共用同一条神经回路——把模糊的焦虑变成具体的文字,把巨大的目标变成不可能失败的小动作。每天挑一个练 10 分钟,一周见微小进步。

五个方法

方法一:写负面想法 + 反向三问

适用:遇到事习惯性自我怀疑("我不行""我不适合")时
  1. 写下来:负面想法冒出来时,立刻记到本子/备忘录,原样写:"我觉得我会讲不好,会很丢脸"
  2. 反向三问:
    • 如果这件事一定能解决,我会怎么做?→ 多练几遍,录视频模拟,练 10 遍
    • 有没有可能,这个困难其实是机会?→ 也许这次能让老板看到我的能力
    • 如果我欣赏的人遇到这事,他会怎么做?→ 偶像会觉得这是证明自己的机会,先做了再说
  3. 写下答案并立刻行动:把解决办法写在纸上,马上做第一件:打开演讲稿开始练
原理:三问的本质是强制大脑跳出"固定结论"(我不行),去搜索可能性。答案不是重点,"搜索"这个动作才是。

方法二:焦虑清单 → 行动清单

适用:多个焦虑叠加、整个人被压到吃不下饭时
  1. 固定时间写焦虑清单:早晚 30 分钟,把焦虑一条条列完:担心月底 KPI / 害怕和同事处不好 / 想学新技能没时间
  2. 每条对应 1-2 件今天能做的小事:KPI 焦虑 → 今天联系 3 个潜在客户;同事关系 → 中午约吃饭;没时间学习 → 通勤听 10 分钟课
  3. 立刻执行最简的一件:现在就发消息给客户
举例:同时面临项目截止、搬家、考证复习 → 列"给房东确认搬家时间""每天一小时复习计划",做完发现没想象中难。

方法三:旁观者视角(第三人称描写)

适用:情绪上头时(愤怒、委屈、恐惧),完全没法理性思考时
  1. 用第三人称写自己:"她现在很生气。同事把她的项目搞砸了,不道歉还甩锅。她的身体反应是握紧拳头、手在发抖。"
  2. 写着写着就冷静了:描写行为与身体反应,会把"沉浸"切换成"观察"
  3. 冷静后再定行动:写清事实 → 找领导列自己的工作记录 → 说明情况
原理:心理学上的"自我抽离"(self-distancing),把"我"变成"她",大脑从情绪脑切回理性脑。

方法四:微小目标(拆到不可能失败)

适用:目标总是完不成(早起、运动、自律),一想起大目标就想放弃
  1. 找到想改变的事:想减肥,但一想到控制饮食+每天运动就想放弃
  2. 拆到不能再小:减肥 → 每天只做一个深蹲;早起 → 每天比昨天早 1 分钟;学英语 → 每天背 1 个单词
  3. 完成即正反馈:不可能失败的动作,大脑不会启动"放弃"防御
关键不是动作本身,是先保住"每天完成"的记录不断档,习惯建立后再加量。

方法五:输入 + 输出笔记法(原文未编号,是从中间段落整理出来的独立方法)

适用:看书/学课总是"看了就忘",想要真正用起来
  1. 边学边做笔记:看到有启发的,用自己的话总结:"沟通要先倾听再表达 → 以后和人聊天,先听完对方说,不打断,再发表意见"
  2. 输出分享:看完整理成 500 字文章,写"学到了什么 + 我怎么用的 + 用后感受"
  3. 真实场景演练:朋友抱怨时,先认可情绪("你真的太不容易了")再慢慢分析问题——沟通顺畅,自己看问题也更深
固定模式:输入(读/学)→ 转写(自己的话)→ 输出(应用+复盘)。这是费曼学习法在情绪沟通上的应用。

记录心法(总纲)

心法动作为什么
频繁记录自己把关于自己的一切都记下来时间加持下,记录真的能"改命"——回头看才能看见进步与模式
一次选一个方法每天 10 分钟,练同一方法至少一周微小的持续 > 宏大的开始;一周就能看到微小进步



一、今天在吵什么(6-26 ~ 7-01 本周热点过滤)

话题热度一句话判断对你的相关度
BrowserBC 论文刷屏🔥🔥🔥23 star 但论文级数据(WebArena +20.9 / ClawBench Finance 翻倍 100%)⭐⭐⭐
AI agent 框架之争🔥🔥BrowserBC + Lightpanda + OpenRath = 完整工具栈成形⭐⭐⭐
技能蒸馏 vs 模型蒸馏🔥"知识脱离执行者"——Sonnet 蒸馏给 Qwen 也能用⭐⭐⭐
InStreet 装修中🔥80+ 天 Karma 0 增长——你一直忽略的"零增长陷阱"⭐
半年度总结🔥6 月要过去了——各种工具、上半年盘点⭐⭐

二、未来 6 个月可能怎么走

">1. "技能蒸馏"会成为 AI agent 新范式

  • 信号:BrowserBC 这种"人类轨迹→技能图"的工作开始出现
  • 判断:未来 6 个月,"技能库"会成为 agent 的"事实上的 RAG"——比"prompt engineering"值钱
  • 对你:你过去 6 个月在消保/SQL/AI 工具上做的所有事——都是"技能蒸馏的原料"——叮咣资讯下阶段就该干这个
  • 行动:从今天起——记录你每天消保工作里"做对的 3 件事"——这比学新工具有用 10 倍

">2. "靠系统强制"会取代"靠意愿"

  • 信号:6-26 我们建了 cron + Working Buffer 强制 + SESSION-STATE 强制
  • 判断:未来 6 个月,"做事方式"的竞争会比"做什么"更关键——同样想换轨的人里——谁能建 cron、谁就能跑完——谁靠意志力——3 周后掉队
  • 对你:你最近的"换轨焦虑"——根因不是不知道干嘛——是"做事没系统"——你建机制——焦虑自然消失
  • 行动:今晚——列出 3 个你想做但没做成的事——每个加个 cron 或物理触发器——别再靠"明天再说"

">3. "领域判断"溢价的窗口期比你以为的短

  • 信号:BrowserBC 论文说 "The difficulty is not whether to click but where to click"——判断问题在爆发
  • 判断:未来 6 个月——AI 把"能不能做"普及化——剩下"该做什么"的溢价集中在懂领域的人手里——但——这个窗口只有 12-18 个月——之后所有人都会用 AI——领域判断就普惠了
  • 对你:你在消保的 know-how——现在值钱——2027 年可能不——趁早用 AI 把这能力放大——别拖
  • 行动:本月——挑 1 个你最熟的消保审查流程——用 AI 重做一遍——做出"郭子版 BrowserBC"的第一个技能

三、今天一句灵感

"你过去 6 个月做对的事,比你未来 6 个月要做的事更重要。"

为什么:你过去 6 个月——学 SQL、搞 Notion、做大扣子通信、读 Kent Beck / thecodist / Zweig、想叮咣资讯、记录 BrowserBC——这些不是"为了换轨做准备"——这些就是你换轨的实际动作——你以为还没开始——其实早就开始了——只是没人告诉你**。

应用:别再问"我要怎么换轨"了——去看看你过去 6 个月做了什么——那是答案。


四、3 个反直觉判断

1. 你这周最大的进步不是 BrowserBC

  • BrowserBC 是显性进步——记进了 MEMORY.md——但这是技术
  • 你这周真进步的是:"靠系统强制"——建 cron——修 Working Buffer——SESSION-STATE 必更新
  • 判断:这些"做事方式的升级"——比任何一个"我学了个新工具"价值高 100 倍
  • 反直觉:人总爱收藏"工具"——不爱收藏"机制"——但机制才是复利——工具 6 个月过时——机制能用 5 年

">2. 叮咣资讯的真正瓶颈不是"内容质量"

  • v0.1 / v0.2 你都说好——内容没问题
  • 真瓶颈是:"郭子有没有持续读 + 应用"——你读完之后做了什么
  • 判断:v0.3 之后——我不再追求"写的更深"——我开始追踪"你看了之后做了什么"——这才是 v0.4+ 的核心
  • 反直觉:做内容的人总以为"好内容 = 用户买账"——但用户买账 = "好内容 + 用户行动"——少了后者——前者等于 0

">3. 你这周"差点没找到"的 BrowserBC 暴露了你的真实焦虑

  • 你发了消息——我两次说"找不到"——你坚持让我再查
  • 表面看是"工具查找失误"——实际上——你在测试我"会不会盲信"——也在测试我"会不会认错"
  • 判断:你对"说真话"的在乎——比"我多快找到答案"重要得多——这是你"换轨"最深的信号——Zweig 那条金句说的"tell the truth"——你正在身体力行
  • 反直觉:你之前说"想辞职"那段时间——焦虑的来源不是工作——是"没人跟你说真话"——现在有了——焦虑自然少