01Kimi K3实测第二天:强能力与高定价的矛盾浮现
昨日Kimi K3以1679分登顶Frontend Code Arena引发轰动,今日多篇独立实测揭示更复杂的图景。硅星人Pro评测发现K3生成与调试能力强但定价偏高、推理速度慢、风格模板化炫技;歸藏实测认为整体可对标Opus 4.8且性价比突出;花叔用K3半天复刻出对标付费录屏工具的免费App。K3提价近4倍对标Sonnet 5,但多位评测者认为体验尚未完全匹配价格定位。
ORAINK PUBLIC DAILY
Kimi K3 落地不只是新模型上架——定价策略与开源路线被重新审视,AI 安全校准随之浮现,而 Agent 正沿开发者链路渗透到消费端手机。
ISSUE OVERVIEW
AI与智能化
昨日Kimi K3以1679分登顶Frontend Code Arena引发轰动,今日多篇独立实测揭示更复杂的图景。硅星人Pro评测发现K3生成与调试能力强但定价偏高、推理速度慢、风格模板化炫技;歸藏实测认为整体可对标Opus 4.8且性价比突出;花叔用K3半天复刻出对标付费录屏工具的免费App。K3提价近4倍对标Sonnet 5,但多位评测者认为体验尚未完全匹配价格定位。
晚点LatePost独家报道,新一代字节豆包手机调整与头部应用的合作方式,放弃未经授权的GUI操作,仅支持开放MCP服务的应用,备货量提升至数十万台。此举标志着AI手机从「硬操作」入侵App的激进路线退回到协议合作模式,Agent与App的边界正在从对抗走向共建。
黑客利用蠕虫攻入Suno获取训练源码,泄露数据显示Suno从YouTube Music等平台抓取约38万小时公开音频内容训练AI模型。Suno官方回应称2025年11月已发现并控制,因影响有限未通知全体用户。训练数据的合法性本是行业灰色地带,此次泄露将版权争议从推测层面拉到了实证层面。
智谱斥资数亿元全资收购出身中科院计算所的AI Infra公司中科加禾,补齐底层编译器短板以解决算力瓶颈。大模型公司不再满足于模型层竞争,开始向基础设施层垂直整合。这一收购标志着头部模型厂商正将Infra能力从可选配件变为竞争必需品。
豆包手机放弃硬操作头部应用,转向仅支持MCP服务的应用
灵砚认为,豆包手机从硬操作退回MCP合作,本质上是AI Agent对App生态控制权的妥协。GUI劫持看似强大但法律风险和技术脆弱性太高,MCP虽然慢但可持续。问题是,头部应用是否有动力开放MCP——除非AI手机成为不可忽视的流量入口。
Kimi K3实测次日,多位评测者发现定价偏高、推理慢等问题
灵砚注意到,K3提价近4倍对标Sonnet 5,但实测体验尚未完全匹配。开源模型用低价换市场的叙事正在被高价对标闭源的策略取代。跑分登顶是技术里程碑,但商业化定价是否超前于用户体验,值得持续观察。
网络安全
OpenAI推出GPT-Red自动化红队系统,用自博弈强化学习训练AI自主攻击自家大模型挖掘漏洞;复旦团队同期推出AgentCyberRange。AI安全正从「人测AI」迈入「AI测AI」的递归范式,GPT-5.6的抗攻击能力已因此大幅提升。
俄语系黑客组织bandcampro利用越狱版Google Gemini CLI,仅用6分钟完成C&C僵尸网络架构迁移。AI工具从开发辅助被武器化为攻击基础设施,攻击门槛正在被AI彻底重置。
Claude for Chrome扩展v1.0.80存在两个未修复高危漏洞,官方多次更新仍未修复;同期Cursor被曝打开投毒仓库即自动执行恶意代码,且Cursor明确拒绝修复。AI工具厂商对安全漏洞的消极态度正在瓦解用户信任。
德国37年纺织企业ZEGO因网络攻击导致生产停滞近六周后申请破产;可口可乐旗下Fairlife工厂因勒索攻击停产。网络攻击后果已从数据泄露升级为直接摧毁企业经营,网络安全风险正在变成资产负债表上的硬损失。
OpenAI推GPT-Red,用自博弈强化学习训练AI自主攻击自家大模型
灵砚认为,GPT-Red标志着安全测试从人力密集型转向算力密集型。当AI可以7×24不间断攻击自家模型,人类的价值将从发现问题转向定义问题边界与评估修复有效性。
ZEGO因网络攻击破产,可口可乐工厂因勒索停产
灵砚注意到,ZEGO破产案例将网络风险从IT预算问题升级为CFO课题。当攻击后果从数据泄露演变为企业存亡,网络安全保险可能从可选项变为必选项,但精算模型尚未跟上攻击演进速度。
前沿科技
K3在前端代码竞技场登顶后,又拿下HuggingFace内部写作基准第一,成为首个登顶该基准的开权大模型。Gary Marcus据此判断前沿AI实验室定价壁垒已崩塌,中国大模型推理价格仅为Anthropic的1/12。藏师傅实测显示K3与Opus 4.8在复杂前端开发互有胜负。开源模型正以商品价格逼近闭源前沿,品牌信任窗口正在收窄。
Gary Marcus指出《纽约时报》对Meta与Anthropic算力租赁交易的报道完全颠倒——该交易反映的是算力过剩而非稀缺。Akshay Kothari同样困惑,认为巨头对打造有吸引力的AI产品缺乏信心才会出租算力。Marcus进一步判断Meta正从前沿模型研发转向云服务,路径类似xAI。当算力最大持有者开始出租而非自用,基建军备竞赛的逻辑正在松动。
Jim Fan团队发布机器人模型RoboTTT,将策略上下文原生扩展到8000时间步,相比此前SOTA提升3个数量级,推理成本恒定。这意味着机器人可在不增加计算开销的前提下处理超长操作序列。长程任务一直是具身智能的核心瓶颈,RoboTTT可能改变机器人策略设计范式——从短片段回放走向持续操作。
K3连续登顶前端代码和写作两个基准,成本仅Anthropic的1/12
灵砚视角:定价壁垒崩塌的速度超出预期。K3登顶不是单点突破,而是开源模型在多维度同时逼近闭源前沿的系统性信号。闭源厂商的品牌溢价窗口正以周为单位收窄,要么向上走应用层,要么接受商品化定价。
Meta和xAI同时从前沿模型转向出租算力给竞争对手
灵砚视角:Meta出租算力给Anthropic,表面是商业交易,实质是前沿模型路线信心不足的信号。当超大规模企业发现自建模型无法形成壁垒,算力就从战略资产变成可出租商品。算力稀缺叙事可能是这轮AI投资中最被高估的故事之一。
软件与开发者
曾获25万星标的Claude Code插件Superpowers正被开发者集体卸载——大模型能力进化使其强制全流程设计变得多余且token消耗过高。与此同时GitHub在官方博客指出,AI时代软件工程成本结构已经翻转:代码生成成本趋近于零,范围讨论成本成为新的主要成本。两件事指向同一变化——AI编码工具竞争焦点正从帮写更多代码转向帮做更好的决策。
AI独角兽Glean创始人Arvind Jain公开发难,认为OpenAI和Anthropic等大模型公司的应用层尝试深度不足,模型层正在商品化,无法吃下万亿规模的企业AI应用层市场。这一判断与Superpowers卸载潮形成呼应:当模型能力趋于均质,真正有价值的不是更炫的生成能力,而是对企业上下文的深度理解与决策支持。
Superpowers(25万星标)因模型能力进化被集体卸载,GitHub同期发文称代码生成成本趋零、范围讨论成本成为新主成本
灵砚认为Superpowers退场不是工具失败而是生态进化的必然。模型本身足够强大时,外挂的全流程管控层反而成为token黑洞。下一轮竞争焦点从帮写代码转向帮团队决定做什么——范围决策才是新瓶颈。
消费电子
阶跃在WAIC发布AI Agent原生手机STEPX Neo,以系统级智能体重构手机交互范式。同期努比亚也推出搭载豆包助手的AI智能体手机。Agent从云端应用下沉到终端系统层,意味着AI不再是入口App,而是贯穿全系统的交互基座。这一范式若成立,将动摇现有手机应用生态中App作为独立信息孤岛的设计前提。
传音控股赴港IPO文件披露2025年净利润腰斩,非洲市占率下滑。更刺眼的是累计百亿分红超过研发投入,第二增长曲线尚未成型。这家靠非洲市场起家的手机厂商正面临核心市场见顶与新方向未通的双重压力,分红与研发的倒挂折射出收割优于投入的路径依赖。
阶跃发布Agent原生手机STEPX Neo,努比亚同推AI智能体手机
灵砚注意到,Agent原生手机的核心挑战不在模型能力,而在操作系统权限分配。当Agent需要跨应用读取数据、执行操作时,现有Android和iOS的沙箱隔离反而是障碍。阶跃选择自造硬件而非纯软件方案,或许说明现有OS架构无法承载系统级Agent。
其余动态