模型竞争进一步白热化:阿里 Qwen3.8-Max 前端编程能力登顶 CodeArena,Perplexity 公布 Apple Silicon 专用推理引擎 Lily。具身智能侧"温差"持续扩大——上半年国内融资 935 亿、出货 4 万台,但"刚需订单荒"已成行业共识,宇树上市次日股价便因王兴兴"效率低于人工"的判断盘中暴跌 18.7%。编码 Agent 工程范式也在分化:Claude Code 团队负责人披露 70% 工作流已 AI 化,K2 Horizon 选择把训练数据一同发布以兑现"开源"二字的承诺。
阿里 Qwen3.8-Max 前端编程登顶 CodeArena,256K 上下文 + 5 美元/百万 token
阿里巴巴 9 月 2 日更新旗舰模型 Qwen3.8-Max,前端编程能力经专项训练后在 CodeArena 拿到 1691 分,超过 Claude Opus 5 和 Kimi K3。模型总参 2.4 万亿、上下文 100 万 token,综合成本 5 美元/百万 token,定位直指 agentic coding 工程落地。
值得关注的原因:前端编程向来是 LLM 兵家必争之地——它的评测颗粒度细、产物可验证、对模型的指令遵循与 UI 还原能力要求极高。Qwen3.8-Max 用 1691 分登顶,配合量化的单位成本,意味着国产模型在前端工程化任务上已经具备替代海外旗舰的性价比,对自研编码工具的团队是直接的选型信号。
信息来源:量子位
Perplexity 开源 Apple Silicon 专用推理引擎 Lily:比 MLX-LM 快 35%
Perplexity 公布专为 Apple Silicon 设计的本地 AI 引擎 Lily,针对 Qwen3.6-35B-A3B 优化。Lily 用 Rust 运行时 + 自研 Metal 内核,执行路径完全不依赖 PyTorch 或 MLX,在 128GB 统一内存的 M5 Max MacBook Pro 上 prompt 处理比 MLX-LM 平均快 23%、token 生成快 35%,代码将以开源形式发布(尚未放出)。
值得关注的原因:当编码 Agent 让写新代码成本极低,"为每个新模型定制专用推理引擎"成为经济可行——本地推理的性能优化正从通用框架走向"模型级专用内核"。对 Apple Silicon 生态下的本地 AI 开发者而言,这意味着 MacBook Pro 不再只是体验终端,而是真正可承担的推理底座。
信息来源:Techmeme
McCoy 论文:符号方程可逼近大模型内部机制,可精准干预行为
AI Weekly 报道 McCoy 等人的最新研究:神经网络内部向量可由闭式符号方程近似,且行为基本不变。测试覆盖小网络以及算术、逻辑、代码、语言等大模型场景,还能精准干预以引导模型行为,揭示大模型隐含的符号结构。
值得关注的原因:可解释性长期是大模型落地的拦路虎,这条"符号方程逼近内部机制 + 反向干预"的路径,把"理解模型"从黑盒分析推向可量化的工程操作。对做 AI Agent 安全护栏、对齐评测或可控生成的团队来说,这条研究线索可能直接转化为工具——值得跟读后续复现工作。
信息来源:AI Weekly
具身智能上半年融资 935 亿、出货 4 万台,但"刚需订单荒"已成行业共识
2026 世界机器人大会(WRC)发布《2026 年人形机器人产业发展报告》:上半年国内具身智能融资 935 亿元(近 2025 同期 5 倍),中国人形机器人出货 4 万台(全球占比 97%)。但宇树上市次日股价盘中暴跌 18.7%、市值蒸发 600 亿,导火索是王兴兴在大会主论坛直言"效率低于人工、泛化能力不足"。京东云总裁曹鹏点出核心矛盾——真实物理交互合规数据仅 50 万小时,而商业化落地需要数千万小时,缺口超 99%。
值得关注的原因:资本市场对机器人的态度已从"赌故事"转向"验成色"。具身智能 S 曲线正处于从小批量试用向大规模落地的关键拐点,国家电网 68 亿采购计划落地后,能拿到订单的企业会迅速分化。对数据服务商、仿真平台、跨本体迁移方案提供商而言,这是回归"做实事"的窗口期。
信息来源:中国城市报
Claude Code v2.1.261 上线 /skill-doctor:可审计并裁剪多余 skills
Anthropic 发布 Claude Code v2.1.261:新增 /skill-doctor 命令可审计并清理占用上下文的未使用 skills;将内联命令与后台任务输出上限提升至 128K 字符(bashOutputMaxChars、taskOutputMaxChars);新增 --append-subagent-system-prompt-file 以支持大体量多 Agent 提示词配置。与之呼应的是 Anthropic 同步发布的"agent-first"工程手册,Claude Code 团队负责人透露团队当前 70%-80% 工作已由 AI 驱动的远程工作流承担。
值得关注的原因:上下文工程(context engineering)正在成为 AI Agent 团队的核心竞争力——/skill-doctor 这类工具直接面向"skills 越堆越多、上下文越来越脏"的真实痛点。对于复杂工作流,配套发布的 agent-first 手册比产品新功能更具参考价值:它把"如何编排 AI 团队"这件事从方法论沉淀到了可复制的工程模板。
信息来源:Anthropic 工程博客(综合)
本页的评论功能已关闭