灵砚 oraink
公开刊物索引日报 sitemap周报 sitemapLLM 索引

ORAINK PUBLIC DAILY

模型能力继续上探,今天的落地竞争转向准入、验收与治理

从模型许可、有限预览到云端智能体、安全告警和代码验收,今天的更新显示 AI 已进入生产链路,问题不再只是能不能生成,而是能否被追踪、审计并安全使用。

日期2026-06-27
Vol196
公开精要67
阅读5 分钟

ISSUE OVERVIEW

本期概览

AI与智能化

强模型设门槛,AI落地开始看制度

今天的变化不在单点性能,而在谁能使用、如何验收、怎样进入现场。模型、Agent、编程工具和机器人都在被流程化。

01最强模型正在变成受控能力

GPT-5.6 系列发布的重点不只是能力提升,而是有限预览、可信伙伴、网络安全阈值与政府要求同时出现。Anthropic 的 Mythos 5 也先回到关键基础设施防御场景。前沿模型越来越像一种需要许可、分级和审计的能力。

  • #模型
  • #安全
  • #治理

02Agent落地拼的是运行制度

Stripe 的合规智能体把处理时间降了 26%,monday.com 的 Sidekick 强调 94% 错误恢复率,阿里云则把云能力和实时数据改造成 Agent-Ready。生产级 Agent 的门槛不是会回答,而是能被监督、能恢复、能控权、能算账。

  • #Agent
  • #企业
  • #基础设施

03AI编程开始从提示走向循环

Loop Engineering、Hook、Skills、Design 模式和游戏开发基准同时升温,说明 AI 编程工具正在离开一次性生成代码的阶段。新的竞争点是把需求、设计、校验、重试和团队约定封装成流程。提示词在退后,工作循环在上前。

  • #AI编程
  • #流程
  • #开发工具

04物理AI的筹码回到现场

物理AI不再只靠机器人演示讲故事:HIW-500 把真实家庭人形机器人数据开源,宁德时代让具身智能进入产线常态作业,防爆机器人拿到资质,AI 3D 也在逼近可用资产生产。现场数据、行业认证和任务闭环正在变成硬壁垒。

  • #物理AI
  • #机器人
  • #数据

GPT-5.6 没有直接全量开放,而是先给可信伙伴;Mythos 5 也先回到关键基础设施防御场景。

当最强模型先成为被许可能力,普通开发者还能靠什么保持实验权?

灵砚视角:能力开放不再只是商业节奏,也会被安全评估、国家利益和责任边界共同塑形。模型越前沿,入口越像制度设计。

Stripe 把合规审核时间降了 26%,monday.com 把生产环境错误恢复率做到 94%。

你的业务如果引入 Agent,第一项指标该看效率、错误恢复,还是可追责性?

灵砚视角:企业 Agent 的价值不该只用省时衡量。更关键的是出错后如何定位、权限如何隔离、人工监督何时介入。可运营性比聪明更稀缺。

网络安全

当攻击不再按人工节奏发生

今天的网络安全更像工程考题:一边是自主Agent改写攻防节奏,一边是插件、设备与旧代码继续提供入口。模型能力之外,运行底座、补丁链和岗位治理都在承压。

01AI攻击开始脱离手工节奏

多篇威胁情报把同一件事推到台前:攻击不只是借用生成式文案,而是在让Agent自主侦察、决策、调用工具。朝鲜APT甚至把提示注入写进恶意样本,诱导安全模型误判。攻防的最小单位,正从脚本变成任务。

  • #AI安全
  • #攻防
  • #威胁情报

02安全智能体的胜负在工程底座

Cloudflare的漏洞发现复盘、Prompt到Context再到Harness的工程演进、Memfit的网页自动化实践,以及长亭、腾讯、斗象的开源与测试套件,指向同一判断:安全智能体不是模型采购题,而是运行时治理题。

  • #智能体
  • #工程化
  • #开源

03旧漏洞仍在决定新风险

今天的高危通告并不显眼,却很现实:Cisco零日被潜伏利用,Chrome热门插件暗藏后门,Lantronix与UniFi漏洞链被滥用,cURL修复25年旧洞。AI让攻击更快,入口仍常常是补丁、插件和令牌。

  • #漏洞
  • #供应链
  • #资产管理

04AI治理正在向岗位和底座下沉

金融AI安全指导、可信数据空间经验、美国国防部后量子密码战略、AI芯片安全与智能体人才认证共同说明:治理正在离开口号层,进入行业规则、硬件架构、岗位能力和迁移时间表。

  • #治理
  • #金融
  • #基础设施

腾讯云捕获到由Agent自主规划的真实攻击,APT样本也开始反向注入安全分析模型。

当攻击者不再逐步敲命令,防守方的日志、告警和取证是否还按人工攻击的时间尺度设计?

灵砚视角:自动化攻击最难防的不是速度,而是它会反复试错并隐藏操作者节奏。检测规则若只捕捉人工序列,可能漏掉机器生成的异常组合。

Cloudflare把漏洞发现做成模型无关的harness,国内厂商也在开源Agent安全演习和生产接入层。

企业该优先买更强模型,还是先建设可替换、可审计、可回滚的智能体运行底座?

灵砚视角:模型能力会波动,工程外壳决定可控性。真正的护城河不是单次发现漏洞,而是把发现、复核、处置变成可度量流水线。

前沿科技

能力在涨,入口也在收

新模型先有限预览,企业把预算投向更便宜的开源选择;智能体和AI视频则把前沿能力拉进协作、开发与连续创作。

01前沿模型仍在加速,也在被门控

OpenAI 预告 GPT-5.6,研究负责人又强调预训练未死、模型正接近能自主产出创新;Qwen 与高校的研究则把注意力拉到最后一层的对齐税。前沿竞争不只是谁训得更大,也是谁能少付推理与管制成本。

  • #AI
  • #模型
  • #研究
  • #治理

02开源模型成了产业与政治的交界面

瑞银调研所称 60% 企业 AI 预算转向低成本与中国开源模型;同时,限制中国模型进入西方市场的预期升温,开源倡议者把它视为公共领域之争。便宜模型正在从技术选项变成产业筹码和政策对象。

  • #开源
  • #成本
  • #管制
  • #产业

03智能体先上工位,再过长任务考试

Notion 把 Claude、Cursor 请进协作空间,TRAE、Browser Use、dao-code 把需求、测试、修复接成链;但 OSWorld 2.0 与 AA-Briefcase 提醒,长周期真实任务仍会暴露断点。智能体先进入流程,再接受流程的严苛考核。

  • #智能体
  • #协作
  • #开发工具
  • #评测

04AI 视频的重点从惊艳转向连续生产

天界扫云工式 AI vlog、Pika MCP 黑客松项目、Runway 电影节与 Recraft 的视觉点评,说明生成内容正在长出稳定题材、工具接口和评奖机制。AI 视频的拐点不是单条惊艳,而是连续生产被组织起来。

  • #AI视频
  • #创作
  • #AIGC
  • #媒介

OpenAI 的新模型先做有限预览,而不是一次性完全开放。

当模型能力越接近基础设施,发布权会更像产品节奏,还是更像许可证制度?

灵砚视角:有限预览不是单纯保守,它把安全、商业与国家要求压进同一个开关。谁能先用,正在成为能力本身的一部分。

企业预算从 token 最大化转向低成本模型与中国开源模型。

若多数业务只需要足够好,闭源顶级模型的溢价还能靠什么维持?

灵砚视角:成本下降会把模型从稀缺资源变成可替换部件,护城河也会从参数迁到数据、集成、合规与账单结构。价格战之后,比拼的是切换成本。

软件与开发者

开发平台不只托管网页了

智能体正在进入开发平台、业务决策和推荐供给,软件系统的关键问题从生成能力转向追踪、审计、验收与信任定价。

01智能体正在逼开发平台重写默认栈

Vercel 在柏林把 AI SDK 7、Services、eve Agent Runs、CLI 数据查询和 shadcn 聊天组件放进同一叙事:开发平台不只托管网页,而要托管智能体的调用、成本、错误、审计和界面。智能体越像产品,平台越要像运行时操作台。

  • #智能体
  • #开发平台
  • #可观测

02智能体从问答层下沉到业务决策层

火山引擎把 AI 搜索从 ReAct 三节点推进到 Unified Policy,目标是降首字延迟并统一决策;PhoneBuddy 瞄准手机界面操作,ZCode 接入 Computer Use,家庭智能体开始主动处理日程冲突。竞争点正在从会回答迁移到会调度、会操作、会承担流程。

  • #智能体
  • #架构
  • #产品

03推荐系统开始直接生产供给

快手 RaG 把推荐从检索已有视频推进到按兴趣生成视频,这比排序模型升级更激进:平台不再只决定谁被看见,也开始决定可被看见的内容长什么样。当分发兼具创作能力,供给侧的稀缺性会被重新定义。

  • #推荐
  • #生成视频
  • #平台

04AI编程的瓶颈转向验收能力

Claude Code 断用实验显示,长期依赖会遮蔽肌肉记忆;GLM5.2+ZCode 复刻游戏能跑 50 万帧却仍有关键功能缺口;Anthropic 代码交付量被称达 8 倍。生成速度越快,人的价值越集中到规格、调试和验收。

  • #AI编程
  • #工程能力
  • #调试

Vercel把智能体的追踪、审计、用量和前端组件一起发布。

当智能体成为应用默认形态,团队最先该补的是模型能力,还是运行时治理能力?

灵砚视角:智能体基础设施的价值不在又多一个控制台,而在把非确定性变成可追责的运行记录。谁掌握追踪,谁更接近产品事实。

快手提出让推荐系统直接生成视频,而不是只从库存里找视频。

当分发系统也能制造供给,创作者、平台和用户之间的价值边界会怎样重画?

灵砚视角:推荐生成化会把平台从媒介推向共同作者。效率收益明显,但内容责任也随之上移,平台不能再只说自己负责排序。

云计算与企业服务

云平台把AI应用拉进生产链路

今天的云计算与企业服务更新不只在扩功能:智能体要被安全治理,告警要能描述复杂异常,AI应用底座正在无服务器化。

01智能体正在变成受控工作负载

Google一边让Firebase深度接入智能体生态,把全栈应用构建贴近Google Cloud;一边用VPC Service Controls补上智能体工作流的网络边界。平台不再只卖模型能力,而是在把智能体纳入原有云治理框架,这决定企业能否上生产。

  • #智能体
  • #云安全
  • #平台

03AI应用把数据底座推向无服务器

Databricks同时用两条线定义AI应用底座:一边把Serverless PostgreSQL和无服务器数据库说成新基线,另一边把视频变成可搜索、可行动的情报。数据平台的竞争点正在从存储数据,转为让应用直接调用状态、语义和动作线索。

  • #数据库
  • #AI应用
  • #数据平台

Google把智能体安全、全栈开发和云边界放在同一条生产化链路。

当智能体成为云工作负载,安全边界应该跟着用户、数据、工具,还是网络走?

灵砚视角:智能体最大的变化不是会说话,而是能跨系统行动。边界若仍只按应用或网络画,可能会漏掉授权链与工具调用链。

SQL告警进入Cloud Monitoring预览。

告警语言变强后,团队会减少误报,还是把过多业务逻辑塞进观测层?

灵砚视角:SQL降低了复杂信号表达成本,也会诱使团队用查询逻辑替代系统设计。关键不在能不能写出异常,而在谁为这条异常负责。