灵砚 oraink
公开刊物索引日报 sitemap周报 sitemapLLM 索引

ORAINK PUBLIC DAILY

今天,智能体拿到执行权后,AI行业开始补上流程与边界课

今天的重点不在谁又发布了更强模型,而是智能体进入用户触点、开发流程、云平台和安全链路后,工作流、身份权限与数据治理如何被重新校准。

日期2026-06-25
Vol194
公开精要71
阅读5 分钟

ISSUE OVERVIEW

本期概览

AI与智能化

AI不只回答,开始改流程

今天的AI新闻落在更硬的环节:Agent进入用户触点和企业流程,AI编程被工作流重塑,模型则把行动前的预测能力摆到台前。

01Agent 正从演示走向流程改造

今天的Agent新闻不再只是聊天框:AWS用语音Agent处理医疗预约,得物把活动搭建改成两阶段Agent工作台,Clay每月跑3.5亿个GTM Agent,微信小微把AI接入国民级入口。真正变量是模型被嵌进既有流程后,责任、权限和失败处理开始显形。

  • #Agent
  • #流程
  • #基础设施

02AI 编程的胜负手变成工作流

从PingCAP用AI写数据库,到淘宝让Agent自己看设计稿,再到Cursor从Notion接任务、GLM与Kimi进入Devin,AI Coding的焦点不只是哪个模型更强。更难迁移的是harness:上下文、验证、权限和交付闭环。

  • #AI编程
  • #开发者工具
  • #工作流

03模型竞争转向行动前的预判

通义让Agent先预测再行动,Aether押注因果世界模型,京东把多模态模型推向物理交互,NEO-ov尝试从像素直接到语言,斯坦福SPIRAL则校正测试时计算扩展。模型竞争正在从生成答案,转向理解行动前的环境变化。

  • #模型
  • #世界模型
  • #多模态

04开放与成本成了企业 AI 的硬门槛

Databricks为开放前沿生态辩护,蚂蚁谈GPU池化,亨廷顿银行用AWS数月脱敏4亿份文档,Netflix开源工具砍掉冗余词元。企业AI的瓶颈不是再多一个原型,而是成本、数据一致性、合规和可替换性同时过关。

  • #企业AI
  • #开源
  • #成本

Clay每月运行3.5亿个GTM智能体,微信小微把Agent接入微信原生能力。

当Agent能接触真实用户和账户权限时,产品经理应该把哪一类失败当成第一等设计对象?

灵砚视角:规模化Agent的关键不在会不会调用工具,而在失败是否可定位、可回滚、可解释。权限边界会比提示词更早决定用户信任。

Fireworks说换模型比换harness容易,Cursor把Notion变成任务入口。

开发团队的护城河究竟是模型选择,还是自己的测试、上下文和发布流水线?

灵砚视角:模型会轮换,工作流沉淀不容易迁走。真正值得积累的是任务切分、验收基准、项目记忆和人工介入点。

网络安全

可信边界的旧假设,正在被身份和行为重新校准

今天的网络安全议题不再只盯漏洞本身:有效凭证、可信服务、智能体连续动作,都在放大身份与行为链的缺口。后量子迁移也从预研进入组织约束。

01边界设备正从屏障变成入口

FortiBleed 把企业安全的老问题放大:防火墙和 VPN 并不是天然可信的边界,而是长期在线、权限很高、补丁滞后的身份仓库。口径虽有差异,但有效管理员凭证被规模化窃取,意味着 攻击不再需要突破边界,只要像管理员一样登录。

  • #边界安全
  • #凭证
  • #漏洞

02AI安全正在被做成攻防基础设施

ISC.AI 上「中国版 Mythos」话语密集出现,同时 PentestEval 开始把 LLM 渗透测试能力拆成阶段级基准。值得注意的是,NSA 使用 Mythos 的传闻又被澄清。真实信号不是某个神话模型,而是漏洞挖掘、评测、协作计划正在被产品化。

  • #AI
  • #攻防
  • #评测

03智能体治理必须盯住行为而非文本

从「人在回路」失效,到中国智能体治理框架强调行为治理,再到 AI 爬虫指纹与智能电视代理事件,线索很一致:智能体的问题不只在输出内容,而在它代表谁、调用什么、以何种节奏行动。可审计的行为边界,比单次回复审查更接近治理核心。

  • #智能体
  • #治理
  • #爬虫

04可信服务被借道时,认证会给攻击背书

Amazon SES 被滥用后,钓鱼邮件能通过常规认证;LastPass 的外部伙伴令牌被窃,塔塔电子泄露牵出苹果、特斯拉,代码仓库又遇到供应链污染。攻击者越来越少伪装成可信方,而是直接站在可信链路里,这让合同、令牌、日志同样成为安全边界。

  • #供应链
  • #云安全
  • #身份

FortiBleed 的关键动作,是用有效管理员凭证登录边界设备。

如果边界设备被当成身份仓库,资产管理该优先问补丁状态,还是凭证生命周期?

灵砚视角:这类事件的重点不是又一个漏洞,而是「合法登录」绕开了很多检测假设。把边界设备纳入特权身份治理,比只催促升级更能降低复发率。

Amazon SES 被武器化后,钓鱼邮件仍能通过常规安全认证。

当认证机制只能证明邮件来自真实服务,却不能证明意图,企业该把哪些行为信号补进判断?

灵砚视角:邮件安全常把认证当成强信号,但云服务被借道时,认证反而抬高可信度。需要把密钥来源、发送模板突变、收件关系图放进同一套异常判断。

前沿科技

前沿AI从模型发布走向工作编排

今天的前沿科技不只看谁的模型更强。开放生态、智能体协作、机器人任务编排和评测治理,正在决定AI被谁用、怎么用、在哪儿结账。

01开源正在改写前沿模型的默认入口

Meta把405B级Llama 3.1推向开源,Qwen同步开源AgentWorld与基准,GLM被放进追赶Fable的公共叙事,Databricks则强调开放前沿生态。今天的开源不是尾随版本,而是在争夺默认接口与产业信任。

  • #开源
  • #大模型
  • #平台

02智能体已经被塞进真实工作台

Notion把Claude、Cursor变成可被@分配任务的外部智能体,Devin在PR前先自测并交出测试计划,还把Kimi、GLM接入桌面与CLI。智能体的产品化重点,正从会聊天转到能接任务、留痕迹、可复核。

  • #智能体
  • #协作
  • #开发工具

03具身智能开始竞争生产语法

英伟达开源人形机器人基础模型GR00T N1,工业论文用LLM生成多机器人程序,ENPIRE让智能体参与机器人研究,资本继续押注具身大脑。赛道热词背后,核心战场是把世界模型翻译成可执行的物理动作。

  • #机器人
  • #具身智能
  • #世界模型

04评测正在从答案转向过程

TRM尝试给推理过程打分,越狱挑战在数十万消息后攻破八关却未找到通用法,Notion数据显示成熟组织仍被工具泛滥困住。能力增长之后,真正稀缺的是可观测、可比较、可追责的使用边界。

  • #评测
  • #安全
  • #治理

Meta、Qwen、智谱与Databricks都在把前沿能力讲成开放生态。

如果模型越来越开放,真正能长期收费的是参数、入口,还是围绕模型的运行环境与数据位置?

灵砚视角:开放会压低单个模型的神秘溢价,但不会自动带来平权。默认接口、评测基准、云端分发和企业数据栈,可能成为新的收费闸门。

Notion让Claude、Cursor进看板,Devin先提交测试计划再等人审。

当智能体成为同事列表里可@的对象,管理问题会更像模型选择,还是更像流程设计?

灵砚视角:可用的智能体不只要聪明,还要知道任务边界、交付格式和责任链。谁批准计划、谁验收结果,会比谁调用了哪个模型更关键。

软件与开发者

软件开发进入交付校准期

今天的软件与开发者议题,不只在模型能力更新。更关键的是,模型接入、智能体流程、代码评审和推理成本,正在被写进工程组织的日常决策。

01模型供给正在从参数竞赛转向交付竞赛

豆包2.1把视频、图像、音频和Agent能力一起推新,DeepSeek开放识图,GLM 5.2 Fast进入Vercel网关,Qwen3.6也用免费调用抢开发者入口。同一天的信号不是某个模型胜出,而是模型能力被包装成可切换、可计价、可路由的供给。

  • #模型
  • #多模态
  • #平台

02智能体落地首先是流程问题

阿里的验数Skill、Spec-First编程流、Codex Remote实践和MongoDB的生产信任框架都指向同一件事:智能体不是把提示词写聪明就能上线。可复核的中间产物、权限边界、证据链与异常回退,正在成为Agent工程的主语。

  • #Agent
  • #工程化
  • #流程

03代码产能越高,验证债越快显形

AI每天生成十万行代码后,人工Code Review变成组织瓶颈,阿里开源Open Code Review也在回应同一压力。前端基础和被裁复盘的讨论则提醒:开发者价值会更多落在定义规格、识别风险、设计验证,而不是单纯提交代码。

  • #AI编程
  • #代码评审
  • #职业

04成本优势开始写进架构深处

Lindy用9个月迁移到DeepSeek以换取数百万美元年省成本,OpenAI把推理优化推进自研芯片,Engram尝试把企业记忆写入权重,端侧小模型加云端大模型也成常见分层。ROI不再是采购表格,而是产品架构本身。

  • #推理成本
  • #架构
  • #基础设施

豆包2.1、DeepSeek识图、GLM 5.2 Fast和Qwen3.6免费调用在同一天构成了模型货架感。

如果模型都能被网关、活动和接口包装成可替换资源,你的系统最不该绑定在哪里?

灵砚视角:模型上新密度很高,但真正影响产品的常常是可用性、价格、延迟和迁移成本。把模型当库存管理,比把模型当信仰更接近工程现实。

阿里验数Skill把一句话变成评审级证据,Spec-First要求先审方案再写代码。

你的团队该先规范任务入口,还是先补全结果验收?

灵砚视角:智能体上线前最缺的不是更长提示词,而是人能审、系统能追、事故能收束的工作面。先定义证据,再定义自动化,风险会小很多。

云计算与企业服务

智能体拿到执行权,云平台开始补上边界课

今天的云计算叙事不只在模型能力:提示生成应用和管道之后,权限边界、数据治理、备份恢复都被推到台前。

01智能体正在从建议层进入执行层

微软把云运营叙事推进到从洞察到实时行动,谷歌则让一句提示生成原生 Android 应用,Databricks 展示用 Genie Code 规模化生成数据管道。共同信号不是更会聊天,而是软件生产与运维链条开始给智能体分配动作权限。

  • #AI
  • #智能体
  • #开发工具

02数据基础设施仍决定智能应用上限

Databricks 连续推送 RAG、向量搜索、DataOps 与湖仓案例,表面是概念普及,底层是在反复强调同一件事:生成式应用的质量取决于数据如何被组织、检索、治理和复用。智能层越像入口,数据层越像护城河。

  • #数据工程
  • #RAG
  • #湖仓

03云韧性要同时面对入侵和区域故障

Cisco SD-WAN Manager 零日被利用,攻击者提权到 root 并清除痕迹;Google Cloud 同日强调跨区域备份的合规与恢复能力。两件事合看,云基础设施的风险不只来自故障,也来自控制平面被接管后的不可见损伤。

  • #安全
  • #云基础设施
  • #备份

微软把云运营智能体描述为从洞察到实时行动的闭环,并称已有 79% 企业在生产环境部署智能体 AI

当智能体开始拥有处置权限,企业应该先验证模型能力,还是先重画权限、审计与回滚边界?

灵砚视角:真正的门槛不在能否自动执行,而在执行后是否可解释、可撤销、可追责。智能体运维若没有权限分层,效率提升会直接转化为事故放大器。

谷歌让 AI Studio 用单条提示生成 Kotlin 原生 Android 应用,Databricks 则展示智能体生成数据管道

当代码和管道都可由提示生成,工程团队的核心产出会从写实现转向定义约束吗?

灵砚视角:提示生成降低了起步成本,却没有消除架构、测试、观测和安全责任。未来更稀缺的可能不是会写代码的人,而是能把模糊需求变成可验证边界的人。