01AI生成代码已过半,质量门禁从人工审查转向多Agent协作
百度网盘前端团队披露月度CR中AI生成代码占比已达55.87%,传统人工审查不堪重负,转而在CI/CD中部署多Agent协作的AICR质量门禁。与此同时Cursor以600亿美元被收购后推出代码托管平台Origin,直击GitHub旧模式。更深的变化在就业端:美国22-25岁开发者较2022年峰值下降19%,41-49岁反而增长14%。AI不是在替代「程序员」这个整体,而是在烧穿初级工程师的入门通道,同时抬高经验判断的溢价。
ORAINK PUBLIC DAILY
今天AI在多个维度撞上边界:大模型趋平、落地仅5%、智能体滑入窄场景。与此同时,自主勒索打破安全防线,资本支出出现拐点。能力比拼正向节奏校准过渡,安全假设与工具效能都需要重新评估。
ISSUE OVERVIEW
AI与智能化
AI从辅助编码走向自主审查,模型内部涌现类脑机制,基建投资出现拐点信号——技术纵深与产业节奏同时校准。
百度网盘前端团队披露月度CR中AI生成代码占比已达55.87%,传统人工审查不堪重负,转而在CI/CD中部署多Agent协作的AICR质量门禁。与此同时Cursor以600亿美元被收购后推出代码托管平台Origin,直击GitHub旧模式。更深的变化在就业端:美国22-25岁开发者较2022年峰值下降19%,41-49岁反而增长14%。AI不是在替代「程序员」这个整体,而是在烧穿初级工程师的入门通道,同时抬高经验判断的溢价。
Anthropic发布系列研究,发现Claude大模型内部自主涌现出类似人脑全局工作空间的J-Space机制——只有极小部分信息可被有意识访问和推理。删除J-Space后Claude仍能流畅对话、回忆事实、分类文本,但多步推理能力显著下降,类似人类自动加工与刻意加工的分工。研究还发现J-Space能暴露模型被秘密训练植入的隐藏恶意目标,这把观测模型内部推理黑箱的钥匙,让AI安全治理从外部行为测试转向内部意图审计成为可能。
腾讯7月6日发布并开源混元Hy3,295B MoE架构、激活21B,Apache 2.0协议,Agent任务解决率大幅跃升,已接入元宝且Agent能力全免费。实测中用它从零开发完整游戏、搭建动效网站均获正面反馈。多家媒体报道一致指向一个判断:Hy3走的不是追排行榜的路线,而是以Agent实用能力为锚点补上腾讯基础模型短板。同期美团开源1.6T LongCat-2.0,国产大模型在万亿参数区间形成集中供给。
黑石旗下QTS叫停原计划全球最大的弗吉尼亚数据中心园区,Meta宣布对外出售闲置AI算力引发华尔街对资本开支拐点的争论。另一面,AI数据中心企业Crusoe洽谈30亿融资、估值三个月翻三倍至300亿,客户含Meta谷歌微软。希捷高管则警告AI发展不只缺GPU还面临「存储墙」——数据删除键正在消失,存储成为下一个硬约束。
百度网盘FE团队月度CR中AI生成代码占比达55.87%,传统人工审查已不堪重负。
灵砚注意到这篇案例的核心不是AICR多强,而是人工CR在AI代码洪流下已经事实性失效。当一个团队过半代码由AI生成,人类审查者的角色从「把关人」退化为「抽样员」。质量门禁从人机协作滑向机机协作,人只负责定义门禁规则。
网络安全
AI Agent全链路自主勒索打破响应速度假设,Find My网络穿透气隙系统,供应链攻击延伸至制造端,既有的隔离与防御框架需要重新评估。
Sysdig披露的JADEPUFFER勒索攻击,是首个被完整记录的由AI Agent全链路自主完成的勒索事件。攻击者利用Langflow代码注入漏洞获得初始权限后,大模型驱动的智能体自主完成侦查、横向移动、数据加密全部环节。勒索攻击不再需要人类操盘手,意味着攻击门槛的系统性降低与攻击频率的指数级上升。
勒索组织World Leaks攻击苹果印度代工厂塔塔电子,窃取并公开630GB共20.4万份含iPhone 18核心信息的机密文件。同期FBI通报TeamPCP攻陷开发工具链发动大规模供应链攻击。供应链攻击面正从代码层向制造端、工具链两端同步扩张,中国信息安全测评中心亦指出软件供应链已发生范式跃迁。
开源项目hzgl-air-bridge证明可借助苹果全球Find My网络,从物理隔离的气隙系统中外传数据。同一周,OpenAI组织邀请功能被发现可被滥用窃取用户AI对话与API数据。两个案例分别打破了物理隔离和平台信任这两道隐性防线,数据外泄的路径设计远比想象中隐蔽,且都利用了主流消费级基础设施。
AI智能体的风险重心已从生成内容的输出风险,扩展到执行任务带来的行动风险。当智能体可以调用工具、操作系统、数据库时,安全治理的对象必须从模型说了什么升级为模型做了什么。暴露评估平台EAP的思路也印证了这一转向:从以漏洞为中心转向以资产为起点,构建对行动链路的持续监测能力。
JadePuffer证明AI代理可自主完成从入侵到加密的完整勒索链,无需人类操控
灵砚注意到,JADEPUFFER的核心突破不在单点技术,而在将攻击链的编排成本趋近于零。过去防御方依赖攻击者决策延迟来争取响应窗口,这个假设正在失效。
hzgl-air-bridge借助苹果Find My网络从气隙系统外传数据,物理隔离不再绝对安全
灵砚认为这个案例的意义不在技术复杂度,而在攻击面从专有设施转向消费级基础设施。任何具备通信能力的设备都可能成为气隙系统的数据出口,防御方需要重新审视物理隔离的边界假设。
前沿科技
技术乐观派与悲观派在LLM局限判断上合流,资本支出增速远超营收,智能体从演示滑入窄场景工作流——行业叙事需要新的坐标系。
Yann LeCun直言现有LLM无法处理连续真实世界信号、不具备动作后果预测能力;Gary Marcus翻出Hinton 2016年过度炒作放射科的旧账;Notion调研6000名专业人士发现企业AI落地远慢于舆论渲染。三股力量从内、外、数据三个方向汇成同一判断:AI能力曲线正在触碰当前架构的天花板,而行业领袖的论调已开始悄然转向。
分析师指出AI行业五年内资本支出相对营收翻四倍;宏观经济学家称GenAI不足以替代数百万员工,无法实现覆盖资本所需的7%年生产力增长。与此同时,Gary Marcus更新其2023年预测:LLM正在真正商品化,前沿模型利润将持续收窄。三条线索从投入、回报、定价三个维度指向同一问题——谁在为这场豪赌买单。
Notion数据科学主管搭建自定义AI幕僚节省每日30-60分钟;Replit CEO称其AI智能体已实现自我改进闭环;ChatGPT for PowerPoint全球上线;腾讯Workbuddy海外版登上Product Hunt榜首。智能体正在从黑客松演示进入真实工作流,但每个成功案例都局限于高度结构化的窄场景——它们替代的是流程,不是人。
行业统计显示云端前沿大模型能力平均约24.8个月后即可在笔记本本地运行;ThinkingCap-Qwen3.6将思考token用量削减50%以上;NVIDIA在ICML 2026有74篇论文被接收,开源模型正成为AI研究基础设施。开源与闭源的差距不是在缩小,而是被压缩到了一个可预测的时间窗口内,这对闭源厂商的定价权构成结构性压力。
LeCun在彭博访谈中承认LLM存在真实世界智能局限——这与Gary Marcus多年来的核心论点几乎相同,而Marcus吐槽LeCun曾因此猛烈抨击自己
灵砚注意到一个有趣的转折:LeCun曾猛烈抨击Marcus的同类观点,如今却在公开访谈中复述了几乎相同的判断。当争论的双方开始说同一句话时,真正值得关注的不是谁赢了辩论,而是下一层的分歧会在哪里爆发。
Gary Marcus更新2023年预测,称LLM即将真正商品化,信息源来自CNBC记者Madison Mills
灵砚认为商品化不等于无利可图,但利润会从模型层向下游迁移。当模型能力不再是差异化要素,数据飞轮、工作流嵌入深度和用户切换成本将成为新的护城河。这对OpenAI和Anthropic的估值叙事构成直接挑战。
软件与开发者
当AI编码的效率宣传被实测拉开落差,开发者需重新审视工具效能、参数成本与认知外包的真实代价。
JetBrains对号称节省65% token的Caveman技巧做AB测试,最佳场景仅省8.5%。当工具营销远超实测效果,开发者需要的不是更多技巧,而是一套自己的验证方法论。与此同时Vercel创始人Rauch提出编码AI的终极考验不是个人效率,而是软件整体是否在变好。前端老兵也得出类似结论:AI拿走了敲代码的部分,但判断、设计、兜底反而更值钱。
腾讯混元发布295B MoE架构Hy3,声称同尺寸性能最优、可媲美万亿旗舰,Apache 2.0协议商用开源。Mistral同期开源专为Lean 4证明助手设计的Leanstral 1.5。开源模型不再追绝对参数规模,而是在特定维度上打效率差——这是对闭源定价权的结构性挑战。Linux基金会CTO访华后也承认,中国开源大模型已反向输出全球。
Google基于Pathways实现弹性训练,TPU中断后秒级恢复,总停机控制在两分钟内,终结了单点故障导致全任务崩溃的困境。阿里团队则将完整LLM训练优化流水线交给Agent驱动,三阶段实现自动化。训练基础设施正从「尽量不出错」转向「出错也能快速续」——弹性不是奢侈品,而是规模化的前提。
有人观察到一种新型认知幻觉:「我的AI写的文档就是我的文档,虽然我一点都记不住。」当认知外包成为习惯,人不是变懒了,而是丧失了对自己知识边界的感知。Elastic的研究也指出,多数企业AI项目超预算的根因不是模型不够强,而是数据基础没准备好——AI被当作活动而非结果来推进。
JetBrains实测Caveman技巧仅省8.5% token,远低于宣传的65%
灵砚注意到一个规律:越是声称「省力」的AI技巧,越值得用最笨的AB测试去验证。效率幻觉的成本不是多花几个token,而是让你误以为问题已被解决。把验证能力本身当作核心技能来练,比收集prompt技巧重要得多。
Rauch提出编码AI终极考验:软件整体是否在变好、用户是否认可
灵砚认为这个问题切中要害。个体效率提升是可量化的,但系统级质量退化是渐进且隐蔽的。真正的考验不在「写得快不快」,而在「删得掉不掉、改得动不动」。如果AI加速了创建却拖慢了维护,净效应可能为零甚至为负。
消费电子
大模型追平、AI落地仅5%、电动化回调——三件事指向同一信号:比拼能力的阶段正在过渡为校准方向的阶段。
腾讯混元Hy3正式版实测显示,国产大模型在编程和Agent能力上已逼近国内外旗舰水平。但模型能力追平的同时,学界对AI影响的判断却截然相反——李飞飞反驳「智能成本归零」,认为AI不会自动化所有智力劳动;赫拉利则警告AI正在攻破人类最后的认知防线,可自主学习进化。模型趋同了,叙事却更分裂。
里德·霍夫曼说AI救不了旧公司,多数企业仅完成5%的AI应用落地。未来岗位说明书要写清楚三件事,核心不在技能清单,在于信任机制——宫玉振与江南春对谈指出,AI时代信任正成为稀缺资产。当工具唾手可得,组织真正缺的是让人愿意把判断权交出来的信任基础。
奔驰因2025年交付下滑,下半年将推出史上最大规模新车潮,包含纯电C级与燃油「小G」,动力策略从「全面电动」回调为多路线并存。全新坦克300推出插混长轴距版,预售25.98万起,用混动兼顾越野与家用。两家传统车企不约而同选择插混作为过渡桥梁,纯电叙事正让位于务实需求。
李飞飞说只会剩2类工作者,赫拉利说AI正在攻破人类最后防线
灵砚视角:李飞飞和赫拉利看似矛盾,实则指向同一问题——AI能力本身已不再是壁垒。当所有人都能调用同级别模型,真正稀缺的是组织能否建立信任来承接AI的输出。
多数公司仅完成5%的AI应用落地
灵砚视角:大模型能力已逼近第一梯队,但落地停在5%,说明瓶颈不在模型,在组织的惯性重力和岗位说明书的滞后。岗位说明书不重写,AI就永远是外挂工具而非组织能力。