01Agent 正从演示走向流程改造
今天的Agent新闻不再只是聊天框:AWS用语音Agent处理医疗预约,得物把活动搭建改成两阶段Agent工作台,Clay每月跑3.5亿个GTM Agent,微信小微把AI接入国民级入口。真正变量是模型被嵌进既有流程后,责任、权限和失败处理开始显形。
ORAINK PUBLIC DAILY
今天的重点不在谁又发布了更强模型,而是智能体进入用户触点、开发流程、云平台和安全链路后,工作流、身份权限与数据治理如何被重新校准。
ISSUE OVERVIEW
AI与智能化
今天的AI新闻落在更硬的环节:Agent进入用户触点和企业流程,AI编程被工作流重塑,模型则把行动前的预测能力摆到台前。
今天的Agent新闻不再只是聊天框:AWS用语音Agent处理医疗预约,得物把活动搭建改成两阶段Agent工作台,Clay每月跑3.5亿个GTM Agent,微信小微把AI接入国民级入口。真正变量是模型被嵌进既有流程后,责任、权限和失败处理开始显形。
从PingCAP用AI写数据库,到淘宝让Agent自己看设计稿,再到Cursor从Notion接任务、GLM与Kimi进入Devin,AI Coding的焦点不只是哪个模型更强。更难迁移的是harness:上下文、验证、权限和交付闭环。
通义让Agent先预测再行动,Aether押注因果世界模型,京东把多模态模型推向物理交互,NEO-ov尝试从像素直接到语言,斯坦福SPIRAL则校正测试时计算扩展。模型竞争正在从生成答案,转向理解行动前的环境变化。
Databricks为开放前沿生态辩护,蚂蚁谈GPU池化,亨廷顿银行用AWS数月脱敏4亿份文档,Netflix开源工具砍掉冗余词元。企业AI的瓶颈不是再多一个原型,而是成本、数据一致性、合规和可替换性同时过关。
Clay每月运行3.5亿个GTM智能体,微信小微把Agent接入微信原生能力。
灵砚视角:规模化Agent的关键不在会不会调用工具,而在失败是否可定位、可回滚、可解释。权限边界会比提示词更早决定用户信任。
Fireworks说换模型比换harness容易,Cursor把Notion变成任务入口。
灵砚视角:模型会轮换,工作流沉淀不容易迁走。真正值得积累的是任务切分、验收基准、项目记忆和人工介入点。
网络安全
今天的网络安全议题不再只盯漏洞本身:有效凭证、可信服务、智能体连续动作,都在放大身份与行为链的缺口。后量子迁移也从预研进入组织约束。
FortiBleed 把企业安全的老问题放大:防火墙和 VPN 并不是天然可信的边界,而是长期在线、权限很高、补丁滞后的身份仓库。口径虽有差异,但有效管理员凭证被规模化窃取,意味着 攻击不再需要突破边界,只要像管理员一样登录。
ISC.AI 上「中国版 Mythos」话语密集出现,同时 PentestEval 开始把 LLM 渗透测试能力拆成阶段级基准。值得注意的是,NSA 使用 Mythos 的传闻又被澄清。真实信号不是某个神话模型,而是漏洞挖掘、评测、协作计划正在被产品化。
从「人在回路」失效,到中国智能体治理框架强调行为治理,再到 AI 爬虫指纹与智能电视代理事件,线索很一致:智能体的问题不只在输出内容,而在它代表谁、调用什么、以何种节奏行动。可审计的行为边界,比单次回复审查更接近治理核心。
Amazon SES 被滥用后,钓鱼邮件能通过常规认证;LastPass 的外部伙伴令牌被窃,塔塔电子泄露牵出苹果、特斯拉,代码仓库又遇到供应链污染。攻击者越来越少伪装成可信方,而是直接站在可信链路里,这让合同、令牌、日志同样成为安全边界。
FortiBleed 的关键动作,是用有效管理员凭证登录边界设备。
灵砚视角:这类事件的重点不是又一个漏洞,而是「合法登录」绕开了很多检测假设。把边界设备纳入特权身份治理,比只催促升级更能降低复发率。
Amazon SES 被武器化后,钓鱼邮件仍能通过常规安全认证。
灵砚视角:邮件安全常把认证当成强信号,但云服务被借道时,认证反而抬高可信度。需要把密钥来源、发送模板突变、收件关系图放进同一套异常判断。
前沿科技
今天的前沿科技不只看谁的模型更强。开放生态、智能体协作、机器人任务编排和评测治理,正在决定AI被谁用、怎么用、在哪儿结账。
Meta把405B级Llama 3.1推向开源,Qwen同步开源AgentWorld与基准,GLM被放进追赶Fable的公共叙事,Databricks则强调开放前沿生态。今天的开源不是尾随版本,而是在争夺默认接口与产业信任。
Notion把Claude、Cursor变成可被@分配任务的外部智能体,Devin在PR前先自测并交出测试计划,还把Kimi、GLM接入桌面与CLI。智能体的产品化重点,正从会聊天转到能接任务、留痕迹、可复核。
英伟达开源人形机器人基础模型GR00T N1,工业论文用LLM生成多机器人程序,ENPIRE让智能体参与机器人研究,资本继续押注具身大脑。赛道热词背后,核心战场是把世界模型翻译成可执行的物理动作。
TRM尝试给推理过程打分,越狱挑战在数十万消息后攻破八关却未找到通用法,Notion数据显示成熟组织仍被工具泛滥困住。能力增长之后,真正稀缺的是可观测、可比较、可追责的使用边界。
Meta、Qwen、智谱与Databricks都在把前沿能力讲成开放生态。
灵砚视角:开放会压低单个模型的神秘溢价,但不会自动带来平权。默认接口、评测基准、云端分发和企业数据栈,可能成为新的收费闸门。
Notion让Claude、Cursor进看板,Devin先提交测试计划再等人审。
灵砚视角:可用的智能体不只要聪明,还要知道任务边界、交付格式和责任链。谁批准计划、谁验收结果,会比谁调用了哪个模型更关键。
软件与开发者
今天的软件与开发者议题,不只在模型能力更新。更关键的是,模型接入、智能体流程、代码评审和推理成本,正在被写进工程组织的日常决策。
豆包2.1把视频、图像、音频和Agent能力一起推新,DeepSeek开放识图,GLM 5.2 Fast进入Vercel网关,Qwen3.6也用免费调用抢开发者入口。同一天的信号不是某个模型胜出,而是模型能力被包装成可切换、可计价、可路由的供给。
阿里的验数Skill、Spec-First编程流、Codex Remote实践和MongoDB的生产信任框架都指向同一件事:智能体不是把提示词写聪明就能上线。可复核的中间产物、权限边界、证据链与异常回退,正在成为Agent工程的主语。
AI每天生成十万行代码后,人工Code Review变成组织瓶颈,阿里开源Open Code Review也在回应同一压力。前端基础和被裁复盘的讨论则提醒:开发者价值会更多落在定义规格、识别风险、设计验证,而不是单纯提交代码。
Lindy用9个月迁移到DeepSeek以换取数百万美元年省成本,OpenAI把推理优化推进自研芯片,Engram尝试把企业记忆写入权重,端侧小模型加云端大模型也成常见分层。ROI不再是采购表格,而是产品架构本身。
豆包2.1、DeepSeek识图、GLM 5.2 Fast和Qwen3.6免费调用在同一天构成了模型货架感。
灵砚视角:模型上新密度很高,但真正影响产品的常常是可用性、价格、延迟和迁移成本。把模型当库存管理,比把模型当信仰更接近工程现实。
阿里验数Skill把一句话变成评审级证据,Spec-First要求先审方案再写代码。
灵砚视角:智能体上线前最缺的不是更长提示词,而是人能审、系统能追、事故能收束的工作面。先定义证据,再定义自动化,风险会小很多。
云计算与企业服务
今天的云计算叙事不只在模型能力:提示生成应用和管道之后,权限边界、数据治理、备份恢复都被推到台前。
微软把云运营叙事推进到从洞察到实时行动,谷歌则让一句提示生成原生 Android 应用,Databricks 展示用 Genie Code 规模化生成数据管道。共同信号不是更会聊天,而是软件生产与运维链条开始给智能体分配动作权限。
Databricks 连续推送 RAG、向量搜索、DataOps 与湖仓案例,表面是概念普及,底层是在反复强调同一件事:生成式应用的质量取决于数据如何被组织、检索、治理和复用。智能层越像入口,数据层越像护城河。
Cisco SD-WAN Manager 零日被利用,攻击者提权到 root 并清除痕迹;Google Cloud 同日强调跨区域备份的合规与恢复能力。两件事合看,云基础设施的风险不只来自故障,也来自控制平面被接管后的不可见损伤。
微软把云运营智能体描述为从洞察到实时行动的闭环,并称已有 79% 企业在生产环境部署智能体 AI
灵砚视角:真正的门槛不在能否自动执行,而在执行后是否可解释、可撤销、可追责。智能体运维若没有权限分层,效率提升会直接转化为事故放大器。
谷歌让 AI Studio 用单条提示生成 Kotlin 原生 Android 应用,Databricks 则展示智能体生成数据管道
灵砚视角:提示生成降低了起步成本,却没有消除架构、测试、观测和安全责任。未来更稀缺的可能不是会写代码的人,而是能把模糊需求变成可验证边界的人。