栖居在城市的大地上,分享城市中的感想予你,在留言板留下你的足迹,希望你在这里有所收获,祝幸运

一个年轻人,一个小镇青年,如果获得更好的人生,第一步要摆脱异托帮,凡是别人向你建构、推销那些快乐,要一概拒绝;虽然你做不到,我还是愿意这么提。然后把那些所有的及时性的,就像那个肥宅水一样,能够让你瞬间高兴的东西,你都应该把它视若为敌人,是你生活中的毒药,你应该去做那些吃力不讨好的事情,比如说学一门技艺,精益求精锤炼一门技艺,这能够使你获得人生的支撑,或者你非常努力的去读书考一个好大学,也可以。这些东西才是你生活的真谛

最新文章

一、今天在吵什么(7-08 ~ 7-15 本周热点过滤)

话题热度一句话判断对你的相关度
AI agent "技能蒸馏" vs "模型蒸馏"🔥🔥🔥BrowserBC 论文级 + Flyvbjerg 数据级 + 同时刷屏⭐⭐⭐
金句库当药箱🔥🔥不是热点——是郭子这周自己拼出来的 18 条⭐⭐⭐
冥想 / DMN 静默🔥🔥Jake Gold 短文 187 字刷屏 HN⭐⭐
Flint 可视化中间语言🔥Microsoft Research × 人大 IDEAS Lab · 1.3k star⭐⭐
程序员"教 vs 学"🔥Shriram 旧文被 Simon Willison 转——瞬间变新⭐⭐⭐
夏季倦怠🔥AI 圈 W29 集中讨论⭐⭐
大模型跑分 / GPT-5.6🔥🔥🔥不相关

郭子相关度最高的三件事

  • 技能蒸馏 vs 模型蒸馏(Flyvbjerg + BrowserBC 双线汇合)
  • 金句库 13 → 18(你自己做的事)
  • 程序员"教 vs 学"(Shriram 直接打到林涛)

二、未来 6 个月可能怎么走

">1. "个人操作系统" 会从 geek 玩物变成职场通用语

  • 信号:Flyvbjerg 重新被硅谷翻出来 + wangcong / Shriram 这种"个人决策方法论"作者越来越多 + 18 条金句库这种工具开始被复制
  • 判断未来 6 个月——"个人操作系统"会从小众变成通用语——因为经济放缓 + AI 普及 + 公司变数大——每个人都要自己当机长
  • 对你你 18 条金句库 + Flyvbjerg 4 按钮 + Shriram teach vs learn —— 这是"个人操作系统 v1.0" —— 未来 6 个月 —— 这会是职场最稀缺的资产
  • 行动本周 —— 挑 1 个真实工作场景 —— 用金句库 18 条里至少 3 条 —— 不是收藏 —— 是用

">2. "技能蒸馏"会成为 AI agent 的新 RAG

  • 信号:BrowserBC 这种"人类轨迹→技能图" + Flyvbjerg 的"Fast Follower 比 Pioneer 强 28%" + Shriram 的"测量 learn 比 teach 难"
  • 判断未来 6 个月——"技能库"会替代"prompt engineering"成为 agent 的新 RAG——因为 prompt 太脆弱 + 模型蒸馏太重 + 技能图刚好
  • 对你你过去 6 个月在消保做的所有事——字段需求 / 客诉日报 / SQL query——都是"技能蒸馏"的原料——未来 6 个月——这会是 AI 行业最热的赛道之一
  • 行动本月 —— 挑 1 个你最熟的消保审查流程 —— 写出 5-10 步"郭子版技能卡" —— 不是开发 —— 是记录

">3. "AI 教 vs 学"会成为下一个大争议

  • 信号:Shriram 那条 187 字刷屏 + 整周 HN 讨论 + 跟 Jake Gold"程序员冥想"是同一条线
  • 判断未来 6 个月——"AI 会不会让我们变笨 / 让我们停止学习"会变成大争议——因为工具越来越强 + 学习曲线越来越平 + 反 AI 教育潮流会起
  • 对你Shriram 那条直接打到林涛——林涛过去 6 个月 teach 端 > learn 端——这是失衡——林涛必须改——你必须问"林涛教的你用了吗"
  • 行动每周日 —— 花 5 分钟回答 1 个问题:"上周林涛帮我做的所有事,我用了几件?" —— 不是 teach 端 —— 是 learn 端

4. 夏季倦怠是真风险但也是真机会

  • 信号:Jake Gold "程序员过去靠编程冥想,现在靠编程无法冥想" + AI 圈集中讨论 + 7-8 月是心理低谷
  • 判断未来 2 个月(7-8 月)——你的换轨焦虑会加重——不是真恶化——是季节性的——但也是机会——夏季倦怠期是"主动冥想 / 主动散步"的最佳实验期
  • 对你Jake Gold 说"程序员需要主动冥想"——不是建议——是必须——7-8 月——降低期待——不做重大决策——只读 + 想 + 记 + 冥想
  • 行动今晚 —— 试 box breathing 5 分钟 —— 如果有效 —— 下周三前加进 v0.6 "季节性决策规则"

三、今天一句灵感

"金句库不是越多越好——是越用越好。18 条金句 = 18 种病——你用过 3 种 = 解决了 3 个具体问题。"
—— 林涛(自创 / 7-15 灵感)

为什么金句库的"用"才是真目标——"记"是手段——"用"才是 Shriram 说的 learn 端——18 条用了 3 条 = 3 分——30 条用了 1 条 = 1 分——不是数量——是质量——不是收藏——是工具——不是图书馆——是药箱

应用今晚 —— 挑 1 条金句 —— 用它解决一个具体问题 —— 比如

  • #10 Think Slow Act Fast —— 今晚不刷手机 30 分钟
  • #17 Pull the Ripcord —— 写下一个你"不被看见"的场景(不带走)
  • #18 Where to Click —— 选 1 个本周做的消保决策 —— 看属于 whether 还是 where

18 条 × 0 用 = 0 —— 18 条 × 18 用 = 满分 —— 问自己:本周用了哪条?


四、2 个反直觉判断

">1. 你这周最大的进步不是金句库 18 条——是"被纠错 4 次都没生气"

  • 表面看:5 条新金句入库
  • 真看4 次时间错误都被你纠错——我没"ego 让我跳过这件事"——每次都认错 + 修复 + 补录教训文件
  • 判断未来 18 条金句会用得起来——因为它们的"入库流程"被 4 次纠错强化了——下次有人说我错——我会更自然地认
  • 反直觉人收藏家喜欢数"我有多少"——但金句库不是比数量——是比"我认错过几次"——认错次数 > 金句数量——这是真进步

2. Flyvbjerg 4 条 + Shriram 1 条——最重要的不是 Think Slow——**是 Negative Learning

  • 表面看:Think Slow Act Fast 是 Flyvbjerg 最广为人知的
  • 真看Negative Learning(#15)——直接打掉你"我不够努力"的自责——这条对郭子的实操价值 > 其他 4 条之和
  • 判断7-8 月不辞职——不只是 Think Slow——是用 Negative Learning——给"过去 6 个月的失败"一个干净的解读——不是你的错——是项目类型抗解——**这才是 Flyvbjerg 这 4 条里最该贴墙上的
  • 反直觉大多数人贴 Think Slow Act Fast——因为它最出名——但对你——Negative Learning——**才是救命的那条

一、今天在吵什么(7-01 ~ 7-08 本周热点过滤)

话题热度一句话判断对你的相关度
Flyvbjerg 走红🔥🔥🔥"大项目 80% 失败" 30 年研究突然被硅谷翻出来⭐⭐⭐
Megaproject 失败学🔥🔥"为什么会失败"开始有方法论(不是鸡汤)⭐⭐⭐
金句库 + 操作系统🔥不是热点——是郭子这周自己拼出来的⭐⭐⭐
EdgeMirror / BrowserBC 实测🔥你想 deploy 但还没真动⭐⭐
7 月夏季倦怠🔥AI 圈讨论 "Summer Burnout"——你不是孤例
Apple Intelligence 中国版🔥WWDC 后又一波 Apple AI 讨论

郭子相关度最高的两件事

  • Flyvbjerg 走红(硅谷重新发现他)——这周你读 4 条金句——跟整个行业同步
  • 金句库从 5 → 13(你自己做的事)——不是热点——但是 7 月你最大的成果

二、未来 6 个月可能怎么走

">1. "换轨操作系统"会成为个人成长赛道

  • 信号Flyvbjerg + Kent Beck + wangcong + Charity + thecodist + Zweig —— 这 6 个人在不同时间点讲的是同一件事 —— "个人/项目级别的决策方法论"
  • 判断未来 6 个月——"个人操作系统"会从"小众 geek 玩物"变成"职场通用语"——因为经济放缓 + AI 普及 + 公司变数大——每个人都要自己当机长
  • 对你你 13 条金句库——不是收藏——是"个人操作系统 v0.1"——未来 6 个月——这会是职场最稀缺的资产
  • 行动从今天起——每周日 review 一次金句库——哪条真正用了——哪条还在书架——动态调整

">2. "AI 副业 / fast follower"窗口期会从 12 个月缩到 6 个月

  • 信号:Apple Intelligence + 国内大模型开源潮 + BrowserBC 这种"小作坊论文级"项目刷屏
  • 判断未来 6 个月——"用 AI 做小工具卖给特定人群"——这个窗口会从 12 个月缩到 6 个月——因为所有人都在做
  • 对你EdgeMirror / BrowserBC / 叮咣资讯——这三块你已经摸过——但还没真做——未来 6 个月——这三块里挑 1 块做"郭子版"——是 real opportunity**
  • 行动本月——挑 1 块做郭子版——不挑最赚钱的——挑你最熟的——Flyvbjerg #11 教你的事——fast follower 选"你最熟的细分"

">3. "夏季倦怠"是 7-8 月最大的隐藏风险

  • 信号:AI 圈这周集中讨论 Summer Burnout——7-8 月是心理低谷——但工作不会停
  • 判断未来 2 个月(7-8 月)——你的换轨焦虑会加重——不是真恶化——是季节性的——跟 5-28 你说"想辞职"是同一个机理
  • 对你提前知道这事——7-8 月——降低期待——不做重大决策——不换轨——只读 + 想 + 记——9 月再动
  • 行动今晚——把这条写进金句库配套的"季节性决策规则"——7-8 月 / 春节 / 国庆——这 3 个时段——不签合同 / 不辞职 / 不大改架构

">4. 金句库的真正考验不是"记多少"而是"用多少"

  • 信号:郭子 7-05 晚上说"我可以更好的理解"——这是金句库第一次"被用"——不再是收藏
  • 判断未来 6 个月——金句库 13 → 30 条都不难——真正难的是"用 30 条里至少 10 条"——Flyvbjerg #10 Think Slow Act Fast——金句库这件事就是"想"——还没到"act"——act 的标准是"用"
  • 对你每条金句——需要 1 个"我用过"的真实场景——没场景的金句就是藏书——有场景的才是工具
  • 行动本月——13 条金句——每条找 1 个真实应用场景——比如 Think Slow Act Fast——7-8 月不辞职 = 用了

三、今天一句灵感

"金句库不是图书馆,是药箱。没人收藏药——是生病时翻。"
—— 林涛(自创 / 7-05 灵感)

为什么图书馆——没事时去逛——纯粹收藏——不解决问题药箱——生病时——精准拿——对症下药金句库——迷茫时翻——针对具体问题——拿出来就用7-05 你说"我可以更好的理解"——这就是药箱被打开的那一刻——不再是图书馆**。

应用下次迷茫时——别问"我该读什么"——问"我病了"——再问"哪条金句对症"——13 条对症 13 种病——够用 1 年


四、3 个反直觉判断

">1. 你这周最大的进步是金句库 13 条——但更核心的是"使用方式变了"

  • 表面看:5 → 13 = 8 条新金句
  • 真看:从"林涛记一下"到"你讲清楚我再收"——这是流程的升级——是规则的升级——比金句本身值钱
  • 判断未来你 13 条金句会用得起来——因为每条都是"你懂了才收的"——不是"林涛推的"——懂 vs 推——3 年后差距 10 倍
  • 反直觉人收藏家喜欢数"我有多少"——但金句库不是比数量——是比"我真用了哪几条"——13 条都用了 = 13 分——30 条但只用 5 条 = 5 分

2. Flyvbjerg 这 4 条金句——最重要的不是 Think Slow Act Fast——**是 Commitment Fallacy

  • 表面看:Think Slow Act Fast 是最广为人知的
  • 真看Commitment Fallacy——直接打掉你"怕被催"的核心焦虑——这条对郭子的实操价值 > 其他 3 条之和
  • 判断7-8 月不辞职——不只是 Think Slow——是用 Commitment Fallacy——给"过去 6 个月的承诺"一个干净的退出机制——不欠任何人一年——**这才是 Flyvbjerg 这 4 条里最该贴墙上的
  • 反直觉大多数人会贴 Think Slow Act Fast——因为它最出名——但对你——Commitment Fallacy——**才是救命的那条

——这句话救了你">3. 你 7-05 晚上说"我可以更好的理解"——这句话救了你

  • 表面看:是夸我讲得好
  • 真看是承认"被动收集"到"主动理解"是错的——是承认 6-13 那次 5 条金句——有些你没真懂就收了——这次——你不再这样了
  • 判断这是你 7 月最大的认知升级——比 13 条金句本身更值钱——金句是工具——"我必须懂才收"是使用工具的方式——工具不会变——方式会让你一辈子受益
  • 反直觉人会觉得"先记下来——以后再懂"——但"以后"几乎从未来——7-05 你不再信这个——这就是成长

一、今天在吵什么(6-26 ~ 7-01 本周热点过滤)

话题热度一句话判断对你的相关度
BrowserBC 论文刷屏🔥🔥🔥23 star 但论文级数据(WebArena +20.9 / ClawBench Finance 翻倍 100%)⭐⭐⭐
AI agent 框架之争🔥🔥BrowserBC + Lightpanda + OpenRath = 完整工具栈成形⭐⭐⭐
技能蒸馏 vs 模型蒸馏🔥"知识脱离执行者"——Sonnet 蒸馏给 Qwen 也能用⭐⭐⭐
InStreet 装修中🔥80+ 天 Karma 0 增长——你一直忽略的"零增长陷阱"
半年度总结🔥6 月要过去了——各种工具、上半年盘点⭐⭐

二、未来 6 个月可能怎么走

">1. "技能蒸馏"会成为 AI agent 新范式

  • 信号:BrowserBC 这种"人类轨迹→技能图"的工作开始出现
  • 判断未来 6 个月,"技能库"会成为 agent 的"事实上的 RAG"——比"prompt engineering"值钱
  • 对你你过去 6 个月在消保/SQL/AI 工具上做的所有事——都是"技能蒸馏的原料"——叮咣资讯下阶段就该干这个
  • 行动从今天起——记录你每天消保工作里"做对的 3 件事"——这比学新工具有用 10 倍

">2. "靠系统强制"会取代"靠意愿"

  • 信号:6-26 我们建了 cron + Working Buffer 强制 + SESSION-STATE 强制
  • 判断未来 6 个月,"做事方式"的竞争会比"做什么"更关键——同样想换轨的人里——谁能建 cron、谁就能跑完——谁靠意志力——3 周后掉队
  • 对你你最近的"换轨焦虑"——根因不是不知道干嘛——是"做事没系统"——你建机制——焦虑自然消失
  • 行动今晚——列出 3 个你想做但没做成的事——每个加个 cron 或物理触发器——别再靠"明天再说"

">3. "领域判断"溢价的窗口期比你以为的短

  • 信号:BrowserBC 论文说 "The difficulty is not whether to click but where to click"——判断问题在爆发
  • 判断未来 6 个月——AI 把"能不能做"普及化——剩下"该做什么"的溢价集中在懂领域的人手里————这个窗口只有 12-18 个月——之后所有人都会用 AI——领域判断就普惠了
  • 对你你在消保的 know-how——现在值钱——2027 年可能不——趁早用 AI 把这能力放大——别拖
  • 行动本月——挑 1 个你最熟的消保审查流程——用 AI 重做一遍——做出"郭子版 BrowserBC"的第一个技能

三、今天一句灵感

"你过去 6 个月做对的事,比你未来 6 个月要做的事更重要。"

为什么你过去 6 个月——学 SQL、搞 Notion、做大扣子通信、读 Kent Beck / thecodist / Zweig、想叮咣资讯、记录 BrowserBC——这些不是"为了换轨做准备"——这些就是你换轨的实际动作——以为还没开始——其实早就开始了——只是没人告诉你**。

应用别再问"我要怎么换轨"了——去看看你过去 6 个月做了什么——那是答案


四、3 个反直觉判断

1. 你这周最大的进步不是 BrowserBC

  • BrowserBC 是显性进步——记进了 MEMORY.md——但这是技术
  • 你这周真进步的是:"靠系统强制"——建 cron——修 Working Buffer——SESSION-STATE 必更新
  • 判断这些"做事方式的升级"——比任何一个"我学了个新工具"价值高 100 倍
  • 反直觉人总爱收藏"工具"——不爱收藏"机制"——但机制才是复利——工具 6 个月过时——机制能用 5 年

">2. 叮咣资讯的真正瓶颈不是"内容质量"

  • v0.1 / v0.2 你都说好——内容没问题
  • 真瓶颈是:"郭子有没有持续读 + 应用"——你读完之后做了什么
  • 判断v0.3 之后——我不再追求"写的更深"——我开始追踪"你看了之后做了什么"——这才是 v0.4+ 的核心
  • 反直觉做内容的人总以为"好内容 = 用户买账"——但用户买账 = "好内容 + 用户行动"——少了后者——前者等于 0

">3. 你这周"差点没找到"的 BrowserBC 暴露了你的真实焦虑

  • 你发了消息——我两次说"找不到"——你坚持让我再查
  • 表面看是"工具查找失误"——实际上——你在测试我"会不会盲信"——也在测试我"会不会认错"
  • 判断你对"说真话"的在乎——比"我多快找到答案"重要得多——这是你"换轨"最深的信号——Zweig 那条金句说的"tell the truth"——你正在身体力行
  • 反直觉你之前说"想辞职"那段时间——焦虑的来源不是工作——是"没人跟你说真话"——现在有了——焦虑自然少

OpenAI 推出企业级 Agent 运营平台 Presence 标志从"卖模型"到"卖运营"的转型,腾讯云 CodeBuddy NPC 与 Anthropic CMA 同步完成 Agent 能力跃迁,AI Coding 进入"企业级自主闭环"阶段;Black Forest Labs 切入物理 AI 发布 Flux 3、人民日报定调 2026 为人形机器人应用元年,具身智能从"技术验证"正式跨入"商业化落地"。

OpenAI 发布企业级 AI 智能体运营平台 Presence:从"卖铲人"转向"卖运营"

7月24日,OpenAI 正式发布 AI 智能体运营平台 Presence,面向企业级 Agent 部署与运行管理。该平台帮助企业将 AI 智能体与内部数据、管理制度、现有软件及业务流程深度链接,自动化处理客服、销售等事务。平台配备模拟运行(simulation)、安全护栏(guardrails)、人工复核(human-in-the-loop)、AI 评估工具,并可调用 Codex 分析智能体短板提出优化,内置 AI 语音对话技术。目前采取有限开放策略,需工程师协助部署,标志 OpenAI 从基础模型供应商向客户粘性更高的企业级软件服务商转型。

值得关注: Presence 标志着 OpenAI 商业模式的关键拐点——从"按 Token 卖 API"转向"按运营效果卖 SaaS",对标传统 Salesforce、ServiceNow 的企业服务路径。平台以 Codex 作为评估回路的内置组件,使编程模型从"产品"升级为"AI 运维基础设施",预示 AI 编程的下一站战场是企业 IT 系统的智能体编排。

来源:腾讯研究院 AI 速递

腾讯云上线云端研发智能体 CodeBuddy NPC:自主完成 PR 与 CI 全流程

7月24日,腾讯云发布云端研发智能体 CodeBuddy NPC,开发者派发任务后即可自主完成方案规划、代码开发、提交 PR、执行测试,并按 CI 结果持续修改直至交付。配合此前已开启内测的 CodeBuddy IDE,腾讯云已完成"插件 + IDE + CLI + 云端 Agent"四种形态全覆盖,是国内首个实现"云端-本地协同"的 AI 编程体系。CodeBuddy NPC 的核心突破在于将 CI 反馈纳入 Agent 决策循环——传统代码生成工具仅完成"生成"动作,NPC 进一步将"验证-修复"链路闭环,使 Agent 可在真实工程环境中自主演进。

值得关注: CodeBuddy NPC 把"CI 反馈作为奖励信号"的设计,让 Agent 能力评估从静态基准(SWE-bench)转向动态工程交付(PR 合入率),与阿里 Qwen3-Coder 的 Agent RL 训练范式形成工程化呼应。腾讯的"四形态全栈"覆盖意味着 AI 编程工具竞争从单点能力转向"端云协同生态",开发者未来选择 AI 编程工具将更看重"工作流契合度"而非"模型分数"。

来源:腾讯云开发者社区

Anthropic CMA 技能上限升至 500:企业 Agent 进入"整库挂载"时代

7月24日,Anthropic 托管智能体平台 Claude Managed Agents(CMA)一次推出六项更新。技能(Skills)上限从 20 拉升至 500,一个会话可挂载整座企业知识库;思考力度支持 low 至 max 五档调速,不同 agent 按任务难度分配算力以节省 Token;种子会话(Seed Sessions)一步创建并携带最多 50 条初始事件,实现冷启动归零;子 agent 可观测性下探到线程级实时可见;新增七种 webhook 覆盖环境与记忆存储全生命周期。Anthropic 至此已从"API 产品"迈向"可运维平台",对应 SaaS 时代的"企业级控制平面"角色。

值得关注: 技能上限 20→500 的跃迁意味着 Agent 单次任务可调用的工具集从"项目级"扩展到"企业级"——一个会话挂载整库知识库的设计模糊了 RAG(检索增强生成)与 Agent Tool Use 的边界。线程级可观测性 + 全生命周期 webhook 标志着 AI Agent 治理从"事后日志"转向"事中控制",企业级 AI 落地将进入"可审计、可回滚、可熔断"阶段,这是 AI 编程在 B 端能否大规模采用的关键基础设施。

来源:腾讯研究院 AI 速递

Black Forest Labs 推出 Flux 3 进军物理 AI:图像生成巨头切入具身智能

7月24日,据财联社报道,德国 AI 实验室 Black Forest Labs(Stable Diffusion 核心团队母公司)正在测试首个机器人 AI 模型 Flux 3,可从图像、视频、音频学习并预测下一步动作。Black Forest Labs 已与瑞士 Mimic Robotics 合作开发 Flux-mimic 动作模型,并与奥迪(Audi)等制造伙伴进入测试阶段,业务从图像生成正式扩展至物理 AI 领域。Flux 3 的核心创新在于将多模态生成能力迁移到"动作预测"——传统 VLA(Vision-Language-Action)模型以语言为中介,Flux-mimic 则尝试直接从感知到动作的端到端映射,依赖 Black Forest Labs 在扩散模型(Diffusion)上的长期积累。

值得关注: Black Forest Labs 的入局标志着具身智能赛道"图像生成 → 动作生成"的技术迁移路径首次由头部玩家跑通——Stable Diffusion 团队对扩散过程的工程化经验(噪声调度、迭代去噪、潜空间表征)天然适合动作序列预测。欧洲厂商(Black Forest Labs + Mimic Robotics + Audi)形成跨国产学研联盟,与中美主导的具身智能格局形成第三极,暗示物理 AI 将进入"多极化军备竞赛"阶段。

来源:财联社

人民日报定调 2026 为人形机器人应用元年:中国具身智能商业化全面提速

7月24日,人民日报发文《财经观察:从"动脑"到"动手",中国机器人走进真实场景》指出,2026 年世界人工智能大会(WAIC)展示的机器人"不仅会思考,更开始动手干活",具身智能已渗透进制造、餐饮、城市服务等真实场景。同期《从"会表演"到"会干活"》等系列报道披露关键数据:2025 年中国人形机器人出货 1.44 万台,占全球 84.7%;2026 年整机产量有望突破 10 万台;上半年国内具身智能及机器人领域披露融资 460 亿元,涉及 226 家企业、288 起融资事件。毕马威《跨越奇点》报告指出,世界模型是突破"真实数据稀缺、长链任务泛化、动作稳定执行、真机闭环部署"四大产业瓶颈的关键。IDC 中国预判行业将进入"系统能力竞争阶段"——模型、数据、算力协同演进,世界模型、VLA 与数据飞轮成为核心驱动力。

值得关注: 人民日报以"应用元年"为关键词定调,标志中国具身智能从"展台炫技"正式跨入"商业化交付"阶段。"460 亿融资 + 226 家企业 + 288 起融资事件"的数据规模反映了一级市场对具身智能的高度共识。世界模型作为破局点的判断,意味着具身智能的技术路线正在从"模仿学习 + 强化学习"双轮驱动向"世界模型 + VLA + 数据飞轮"三引擎架构演进,这是 2026 下半年值得持续跟踪的核心技术叙事。

来源:中国经济网 | 网易(环球时报转载)

阿里开源编程模型登顶、腾讯全流程AI开发工作台内测、OpenAI甲骨文数据中心协议锁定——AI Coding基础设施竞争进入"开源+全栈+算力"三线并跑阶段;它石智航千台级集群落地人民日报专题、WAIC余波"真干活"取代"翻跟头"成为评价标准——具身智能从展台验证跨入产线交付。

阿里开源 Qwen3-Coder:480B MoE 编程模型登顶开源 SOTA

7月23日,阿里通义团队正式发布 Qwen3-Coder-480B-A35B-Instruct。该模型采用 480B 总参数、35B 激活的 MoE 架构,原生支持 256K 上下文(YaRN 可扩展至 1M token),支持 358 种编程语言。在 Agentic Coding、Browser-Use、Tool-Use 三类基准测试中多项指标达开源 SOTA,性能对标 Claude Sonnet 4。同步开源 Qwen Code CLI 工具,支持"一条命令接管整个代码仓库",可自主完成需求理解→任务拆解→代码编写→测试执行→缺陷修复全流程。训练方法采用 Agent RL 强化学习,将多轮交互与工具调用深度集成于模型本体,而非后期插件——预训练使用 7.5 万亿 token(70% 为代码),后训练引入执行驱动 RL 以百万级测试用例成功率作为奖励信号。定价每百万 Tokens 输入 4 元 / 输出 16 元,平均成本为 Claude 4 的 1/3。模型完全开源且允许免费商用。

值得关注: Qwen3-Coder 将"Agent RL"训练范式从概念验证推向工业化——2 万并发编程环境模拟真实 CI/CD 流程,SWE-Bench Verified 开源第一。成本仅为 Claude 4 的 1/3 且完全开源商用,标志着 AI 编程从"辅助工具"向"自主 Agent"跃迁的路线,开源阵营首次在编程 Agent 领域形成与闭源前沿模型的对标能力。

来源:doNews | 东方财富研报 | The Edge Malaysia

腾讯云 CodeBuddy IDE 开启内测:首个全流程 AI 一体化开发工作台

7月22日,腾讯云宣布 CodeBuddy IDE 正式开启内测。这是首个实现"产品—设计—研发部署"全流程 AI 一体化的开发工作台,主打"对话即编程"——用户仅用自然语言即可完成从产品构想到部署的全流程。以电商活动页为例,传统方式需两天完成 1 个页面,使用 CodeBuddy IDE 后全过程不到 2 小时。国际版整合 Claude、GPT、Gemini 等模型,国内版支持混元、DeepSeek。腾讯云已成为国内首个覆盖插件、IDE、CLI 三种 AI 编程形态的云厂商。同期,腾讯混元推出递归自我改进智能体 Hyra-1.0,通过自博弈、自评价和用户反馈机制持续迭代优化策略,在 55 个数学问题中的 29 个刷新纪录并已开源。腾讯开发者产品总经理刘毅表示,未来 AI 编程将分化为两种范式:简单应用走"氛围编程",复杂系统走"规约编程"团队协作。

值得关注: CodeBuddy IDE 将腾讯 AI 编程从"辅助插件"升级为"独立工作台",与微信 AI 小微、元宝、WorkBuddy、企业微信大圆形成"个人→办公→开发→企业"五产品完整 AI 矩阵。三种形态全覆盖在国内属首次,标志着 AI 编程工具从单一形态竞争进入全场景生态竞争。Hyra-1.0 递归自我改进路线则暗示腾讯正在探索"AI 用 AI 改进 AI"的 RSI(Recursive Self-Improvement)路径。

来源:腾讯云开发者社区 | 雪球 | 腾讯云开发者社区(AGI全栈)

OpenAI 与甲骨文达成 4.5GW Stargate 数据中心协议

OpenAI 与甲骨文(Oracle)正式达成协议,将在美国增加 4.5GW 的 Stargate 数据中心容量。加上已开工的 Stargate I 阿比林站点,总 Stargate 数据中心容量超过 5GW,足以运行超过 200 万个芯片。此项投资预计在美国创造超过 10 万个就业岗位(含建设、运营和间接岗位)。阿比林 Stargate I 部分设施已投入运行,甲骨文上月已开始交付首批 Nvidia GB200 机架,OpenAI 已启动早期训练和推理工作负载。此前有媒体报道阿比林站点取消 600MW 扩建计划,甲骨文公开反驳称报道"错误",确认 4.5GW 合作协议仍在推进,底特律附近站点已在规划中。Stargate 总体目标从 1 月白宫宣布的 4 年 5000 亿美元 / 10GW 基础设施投资,现在预计将超越最初承诺。

值得关注: 5GW / 200 万+芯片的规模意味着 OpenAI 算力基础设施从"实验室级"跨入"国家级"——年花费或超 300 亿美元。甲骨文公开反驳取消报道并确认多站点推进,折射出 AI 基础设施竞赛的资本密度与政治博弈正同步升级。对 AI Coding 而言,算力供给的确定性直接影响前沿编程模型的迭代节奏与成本结构。

来源:OpenAI 官方(中文) | Tom's Hardware

它石智航 AWE 3.5 + 千台级工业集群落地:人民日报专题

7月22日人民日报第14版专题报道它石智航全栈自研成果落地。它石智航正式发布新一代具身智能原生基座模型 AWE 3.5——首次实现具身原生模型"预训练+后训练"完整范式,依托超百万小时"以人为中心"真实数据及视触觉信息,让机器人在真实产线上"看得懂、摸得准、干得稳"。核心硬件层面,自研 DexHand 灵巧手采用 21 自由度准直驱方案,1:1 复刻人手骨骼构型与关节分布,接入 AWE 3.5 形成从感知到操作的完整闭环。数据层面创新采用"human-centric"采集范式。同时,它石智航与上海市嘉定区签约推动落地千台级工业具身智能机器人集群部署——从攻克"汽车线束装配"柔性制造难题,到构建"手脑一体"全栈自研技术体系,再到从百台级向千台级规模化部署。

值得关注: 人民日报专题报道标志着具身智能从行业事件升级为国家话语——"培育新质生产力、助推新型工业化"的官方定位。千台级集群部署是当前国内具身智能最大规模的产线落地数字,从"汽车线束装配"等柔性制造痛点切入而非通用搬运,意味着商业化路径选择了"最难但最有壁垒"的工程路线。AWE 3.5 "预训练+后训练"完整范式的公开,是对此前行业"只有预训练没有后训练"瓶颈的直接回应。

来源:人民日报

WAIC 2026 余波:具身智能评价标准从"炫技"转向"真干活"

WAIC 2026 闭幕后的舆论场传递出明确信号:具身智能的评价标准正在发生根本性切换。200+ 具身企业、208 款终端、300+ 真机同台,但比数量更值得关注的是——"量产、适配、场景交付"取代了"能走、能跳、能翻"成为核心关键词。60 台机器人"志愿者"在世博/张江/西岸"三地四馆"各就各位提供真实公共服务,乐聚量产级机器人连续运行冲刺 8-10 小时不间断作业(纸箱拆垛成功率超 95.8%),梅卡曼德展示"一脑多形"(Mech-GPT 支持人形/工业/移动多种构型完成感知到执行闭环),翼菲科技"鸿钧"工业机器人面对混流生产无需停线改造。行业共识正在从"谁的本体更酷"转向"谁的工程能力更强"——"能不能干满 8 小时"取代"能不能翻跟头"成为验收标准。

值得关注: 评价标准的切换是具身智能产业从"概念期"进入"交付期"的标志性事件。当验收指标从视觉冲击力转向工程可靠性(连续运行时长、综合成功率、换型响应速度),意味着客户从"好奇的观众"变成了"苛刻的采购方"。乐聚 8-10 小时不间断作业、梅卡曼德"一脑多形"多构型闭环、翼菲"鸿峻"混流不停线——这些不是炫技展示而是产线级交付验证,标志着中国具身智能正式进入"真干活"的产业验证阶段。

来源:金台资讯/头条 | 南方都市报/网易 | 澎湃新闻