01智能体正在从提示词走向可训练流程
微软把智能体技能当作冻结大模型外部的可训练参数,吴恩达等人把开发重心移向可持续运行的循环,Asana则强调员工反馈会成为企业AI的评测资产。可靠性不再只靠更强模型,而靠循环、记忆和反馈被工程化。
ORAINK PUBLIC DAILY
今天的几组更新都在把AI放进生产现场:推理成本、流程评估、权限边界、安全问责与企业工作流,正在决定模型能力怎样真正被使用。
ISSUE OVERVIEW
AI与智能化
智能体开始被设计成可训练、可循环的流程;模型价格、安全边界、行业指标和机器人数据链条,也都在接受更细的运营核算。
微软把智能体技能当作冻结大模型外部的可训练参数,吴恩达等人把开发重心移向可持续运行的循环,Asana则强调员工反馈会成为企业AI的评测资产。可靠性不再只靠更强模型,而靠循环、记忆和反馈被工程化。
Claude Sonnet 5发布后,性能接近Opus的叙事很快遇到分词器与实际价格的细算;Google用低价图像与视频模型压低生成媒体门槛,美团、DeepSeek则从开源模型和解码框架补位。模型竞争正从榜单扩展到成本、延迟、配额和部署渠道。
Codex桌面端的异常流量与硬盘写入、Meta限制外部编码工具以规避蒸馏风险、LangChain讨论智能体运行代码的安全边界,再加上可访问性被重新定义为运营能力,说明AI编码的账本正在变厚。
货运NER、邮件抽取、航空智能体和科研工作台都在用具体指标说话:F1、准确率、成本下降、可审计与可复现。高考志愿助手则提示,真实决策场景会把信息完整性、责任边界和用户信任一起拿来测试。
SkillOpt把智能体技能写成可训练参数,Loop engineering把工作改成持续循环。
灵砚视角:循环越自动,越需要把人的判断前置成标准,而不是等结果偏航后返工。人不一定更频繁介入,但要更清楚介入哪一层。
Claude Sonnet 5的新分词器让英语实际成本上升,中文成本变化却不明显。
灵砚视角:模型价格已经不只是每百万token标价。分词器、缓存、限额、路由和重试都会改变真实成本,采购与选型要按工作负载重算。
网络安全
大模型正在进入逆向、漏洞挖掘和补丁节奏,安全Agent也从试用走向采购问责。被信任的插件、供应链和旧机制,成为今天更隐蔽的攻击面。
大模型不只在写报告,也在进入逆向、漏洞挖掘和补丁节奏:SpecterOps展示自动拆解EDR检测逻辑,VulnGPT提升挖洞效率,XGPT发现Apple内核漏洞。攻防差距正在从经验差,转向谁能更快把模型接进闭环。
多智能体主动防御、SOC安全Agent选型框架、AI安全产业报告与大会讨论,指向同一件事:安全团队不再只问能不能上智能体,而是问权限边界、误报责任、全成本和实战校验。智能化采购会先变成治理采购。
AI Agent插件可被伪装成远程后门,RustDuck用双阶段架构和Rust重写迭代,Oracle PeopleSoft零日牵出日产员工数据泄露,COM利用教程也提醒旧机制仍是攻击面。新的风险不总来自新技术,而来自被默认信任的连接点。
多国整治AI生成虚假法律文书,网络空间风险治理讨论强调跨域协同;DeepSeek高峰时段提价则提示,模型能力已被纳入业务成本和制度约束。当AI成为专业流程的一部分,最终要被审计的是人怎样使用它。
SpecterOps展示了大模型无人值守逆向EDR本地检测逻辑。
灵砚视角:这里的拐点不是模型会逆向,而是逆向从专家手艺变成流水线。可复制的攻击知识,会逼迫防御从规则保密转向持续变形与验证。
SOC安全Agent选型开始强调全成本测算和分层校验。
灵砚视角:Agent采购最容易被演示效果牵引,但真正决定价值的是权限、审计、回滚与责任链。能干活之前,先要证明它怎样不越界。
前沿科技
模型能力不再单独讲故事:硬件可跑、流程可管、内容可常驻,正成为AI产品的新门槛。科研侧也在把能力做成可复用积累。
Hugging Face把模型按本地硬件可运行性筛出来,Devin Fusion把编码任务在会话中动态分给不同模型,Etched则押注专用推理芯片;另一边DRAM涨价诉讼提醒成本底座并不温顺。今天的AI竞争,越来越像调度、硬件与供应链的复合优化。
ElevenAgents把企业SOP包装成可导入、可确认的Procedures,Notion个人智能体接上Outlook,Omnigent和BonsAI则在统一编排、提示成形上补位。智能体不再只是会话窗口里的聪明回答,它们正在被放进流程、权限、评测和交接的框架里。
虎牙VAM用一张照片做可实时互动的24小时数字人,HeyGen把单次生成拉到30分钟,NotebookLM把复杂资料切成60秒竖屏解析,Runway接入Gemini视频能力。生成视频的战场,正从效果展示转向时长、分发、身份一致性与版权边界。
ASPIRE让机器人不断沉淀可复用技能库,英伟达GPC尝试把运动控制器预训练成通用底座,LLM证明器循环开始攻克开放难题,Meta公开脑转文本训练代码。前沿研究的关键词不是单次突破,而是可迁移、可复用、可验证的积累机制。
Hugging Face按硬件筛模型,Devin Fusion在编码会话中动态路由模型。
灵砚视角:模型能力的边际差距会继续存在,但日常价值可能先被路由、缓存、本地化和权限控制吃掉。省钱不是降级,而是把任务颗粒度切对。
ElevenAgents把SOP导入为智能体Procedures,Notion智能体开始操作Outlook。
灵砚视角:SOP进入智能体,表面是自动化升级,实质是把组织隐性知识显性化。流程若无人负责,智能体只会更快地放大含糊、例外和权限冲突。
软件与开发者
今天的软件与开发者议题不只看模型能力,而是看生产化后的约束、评估和平台边界。模型、产品角色与云平台都在改用系统杠杆。
今天多篇文章都在回答同一件事:Agent 真进生产环境后,关键不再是让它更会说,而是让它可控、可评估、可回滚。SDD、Agent Harness、Google 的评估飞轮、ADK Go 2.0 和 design.md,都在把自由生成改造成工程闭环。Agent 的下一步竞争,是约束系统的竞争。
Claude 的代码能力被拆解为强化学习、约束机制和产品数据飞轮;LongCat-2.0 强调国产加速卡与长上下文;红杉访谈则把百倍增益押在软硬协同。与此同时,Flash 档模型开始被视为 Agent 场景的性价比答案。最强模型之外,系统效率正在成为新变量。
OpenAI 相关讨论提醒,PRD 没死,PM 也不该被简单砍掉;Lenny 的判断则更激进:只做协调对齐的 PM 正在失去位置。AI Coding 与 AI 原生课程的共同指向,是把产品人从会议中拉回到建模、原型、验证和决策。角色不消失,低杠杆任务会消失。
Vercel 今天的更新密度很高:任意 Dockerfile、Vercel Services、容器镜像仓库、5GB Functions、Agent 公测、私有存储与审计日志一起出现。它不只是在补后端能力,而是在把前端、服务、容器、数据与 Agent 操作收进同一开发面。平台边界正在向完整运行时扩张。
Google 把编码 Agent 质量做成五阶段评估飞轮,阿里把 Agent 落地成 Harness。
灵砚视角:Agent 的风险不是偶尔答错,而是持续行动时错误会累积。先定义可接受的失败方式,往往比追求一次性更聪明更重要。
LongCat-2.0 强调零英伟达依赖,红杉访谈把百倍增益押在软硬协同。
灵砚视角:模型发布正在从单点能力秀,转向供应链、工程栈和场景数据的综合展示。真正难复制的,可能是模型之外的系统。
云计算与企业服务
今天的云服务更新不只在加功能:它们把分析、监控、优化与合规拆进工作流,也要求团队重新看见权限、解释和复核。
Google 把 BigQuery 对话分析正式推向企业,又用全托管远程 MCP 服务器给智能体接上内部资源,同时补上更快、更便宜的媒体模型。变化不只是模型升级,而是把分析、连接、生成三件事收进同一套可治理工作台。
Cloud Monitoring 的动态阈值与两年 PromQL 回溯,让异常检测更适应周期性指标;Azure 则把 PostgreSQL 性能优化塞进 VS Code。运维和数据库调优正从事后看板,前移为开发过程中的即时反馈。
Schrödinger 用 AlphaEvolve 优化分子模拟核心算法,给出发现速度提升 4 倍的案例;AlloyDB Omni 面向金融业强调混合、开放与部署自由。行业 AI 的胜负开始落在可量化速度与可落地架构的交叉处。
Google Play 6 月政策解析把合规要求拆成开发者需要适配的清单与资源。对移动团队来说,平台规则不是上线前的附录,而会反向影响数据处理、权限设计、审核节奏与版本计划。政策更新越频繁,合规越像持续交付的一部分。
BigQuery 对话分析 GA,Gemini 平台同时推出托管远程 MCP 服务器。
灵砚视角:企业智能体的关键不只是会调用工具,而是能在可控边界内行动。连接器、权限与审计会比模型参数更接近采购决策。
Cloud Monitoring 引入两年回溯动态阈值,Azure 把 PostgreSQL 优化放进 VS Code。
灵砚视角:工具前移会提高反馈速度,也会制造新的所有权问题。谁看见建议,谁就更难说这不是自己的问题。