灵砚 oraink
公开刊物索引日报 sitemap周报 sitemapLLM 索引

ORAINK PUBLIC WEEKLY

灵砚周刊·AI与智能化 2026-W29|开源模型新增实测与发布逼近闭源前沿

GLM 5.2新增真实工程测试证据,Kimi K3与Inkling本周发布或开放,开源模型继续逼近闭源前沿。

周刊2026-W29
扫描1677
信号31
线索4

SPEED READ

本周速览

THREADS

周线索

1. 【封面】开源模型新增实测与发布逼近闭源前沿

本周出现了三组新的开源模型进展,但性质并不相同。7月12日,Databricks披露以3000名程序员真实任务测试GLM 5.2的新证据,结果显示其编码能力接近顶级闭源模型;这不是GLM 5.2在本周发布。7月16日,Moonshot发布Kimi K3,以1679分登顶Frontend Code Arena,超越Fable 5,马斯克随后公开点赞。7月18日,Thinking Machines开放Inkling权重,这一975B参数原生多模态MoE模型以较少Token取得接近前沿的表现。新增工程实测与两项本周发布共同显示,开源模型正在编码、前端与多模态能力上继续逼近闭源前沿。

判断:GLM 5.2的新增工程实测,以及Kimi K3与Inkling的本周发布或开放,共同显示开源模型继续逼近闭源前沿;但基准和单次实测尚不能等同于生产环境全面追平。 置信:高

边界:GLM 5.2并非本周发布;现有证据主要覆盖编码、前端基准与多模态对比,尚未验证长程推理、生产稳定性和综合成本。

  1. 2026-07-12:Databricks用3000名程序员真实任务测试GLM 5.2,编码能力追平顶级闭源(AI寒武纪)
  2. 2026-07-16:Kimi K3发布,以1679分登顶Frontend Code Arena,超越Fable 5(AICodeKing / elvis(@omarsar0) / The Rundown AI(@TheRundownAI) / lmarena.ai(@lmarena_ai) / Paul Couvert(@itsPaulAi))
  3. 2026-07-17:Kimi K3实测反馈:能力强但定价高,马斯克公开点赞(花叔 / 硅星人Pro / 歸藏的AI工具箱 / 虚拟框架)
  4. 2026-07-18:Inkling 975B开源,美国玩家加入开源竞赛(OpenRouter(@OpenRouterAI) / Windsurf(@windsurf_ai) / 腾讯科技 / InfoQ 中文)

2. GPT-5.6降价施压迫使Fable5永久纳入Max计划

7月14日Sam Altman宣布GPT-5.6 Sol在多数场景下价格仅为Fable的一半,Token效率约两倍。这直接加剧了Anthropic的订阅压力——Fable 5此前多次续命临时额度,引发用户不满。7月18日Anthropic宣布Fable 5将永久纳入所有Max和Team Premium计划,额度为标准限制的50%。从续命到永久纳入,Anthropic在订阅博弈中退让,价格战已从API蔓延到订阅层。

  1. 2026-07-14:Sam Altman宣布GPT-5.6 Sol半价两倍效率,Fable 5再次续命到19号(AI Will(@FinanceYF5) / AGI Hunt / Sam Altman(@sama))
  2. 2026-07-18:Anthropic宣布Fable 5永久纳入Max和Team Premium计划(Claude(@claudeai) / 腾讯科技 / elvis(@omarsar0) / orange.ai(@oran_ge))

3. WAIC 2026:具身智能从单任务 Demo 转向通用基座

WAIC 2026把具身智能从零散产品发布推成了本周最集中的产业信号。7月16日,小米公开以10万小时真实数据训练的机器人大脑,首次系统验证机器人 Scaling Law;7月18日,千寻智能、有鹿、腾讯和极智嘉在WAIC集中展示通用具身方案,分别推进长程记忆、通用具身大脑、基座模型平台与泛化作业效率。两天、8个独立来源共同指向同一变化:具身智能的竞争正在从单任务Demo转向通用基座、真实数据规模与跨场景泛化能力。

  1. 2026-07-16:小米公开10万小时真实数据训练的机器人大脑,首次系统验证机器人Scaling Law(硅星人Pro / 卡尔的AI沃茨 / 智东西)
  2. 2026-07-18:WAIC上千寻、有鹿、腾讯、极智嘉展示通用具身方案(机器之心 / 腾讯技术工程 / 甲子光年 / 晚点LatePost / 极客公园)

4. Agent越过App,进入操作系统与物理终端

本周Agent的竞争边界从应用层扩展到系统级入口与物理世界。7月14日,阶跃发布原生AI智能体手机STEPX Neo,以Step AOS尝试绕开传统App入口;7月17日,WAIC现场继续展示手机端Agent与多智能体协作;7月18日,同一套端云模型矩阵进一步延伸到汽车、机器人和多设备。三天、3个独立来源共同表明,下一阶段争夺的不只是模型能力,而是谁能掌握终端入口、上下文、执行权限和跨设备协作。

  1. 2026-07-14:阶跃发布原生AI智能体手机STEPX Neo,以系统级Agent挑战传统App入口(创业邦 / 极客公园)
  2. 2026-07-17:WAIC现场进一步展示手机端Agent与多智能体协作(爱范儿)
  3. 2026-07-18:阶跃将端云模型矩阵延伸到汽车、机器人和多设备(爱范儿)

BRIEFS

本周其余要闻

SHELF

本周书架

【教程】How to Evaluate AI Agents with an LLM-as-a-Judge Harness in Python

用LLM-as-Judge搭建Agent评估流水线,解决效果凭感觉、无法量化的痛点。

查看摘要与阅读入口

【教程】驾驭AI Coding:一份面向团队的Harness Engineering落地规范

为团队AI Coding制定Harness落地规范,解决工具上马即失控的质量盲区。

查看摘要与阅读入口

【教程】Fable 5 官方实战指南:找到你的未知

Fable 5实战指南教你系统性发现未知场景,解决探索式开发缺乏方法论困境。

查看摘要与阅读入口

【案例】When your brain works differently, AI isn’t a luxury—it’s accessibility

真实案例展示AI如何成为认知差异者的无障碍工具,打开AI辅助设计的同理心视角。

查看摘要与阅读入口

【案例】用 Claude 重写 SQL 解析器,性能暴涨 70 倍:程序员做的不是写代码,而是搭建验证闭环

拆解Claude重写SQL解析器的验证闭环,解决AI生成代码'能跑但不敢信'的信任缺口。

查看摘要与阅读入口

RECALL

观察回收

NEXT WEEK

下周观察