咕泡科技头像
关注
AI 前沿速递:OpenAI&Anthropic 前沿模型“效率战“开打!小米开源登顶、阿里亮出全栈底牌,智元长隆机器人乐园开园封面图

AI 前沿速递:OpenAI&Anthropic 前沿模型“效率战“开打!小米开源登顶、阿里亮出全栈底牌,智元长隆机器人乐园开园

本期AI动态:模型层出现罕见的密集火力:Anthropic 与 OpenAI 在约 90 分钟内相继降价发布新模型,小米以开源权重登顶 Artificial Analysis 并把单任务成本压进 0.1 美元区间,阿里在云栖大会同日亮出"芯片—模型—云"全栈底牌,xAI 则以按兵不动的定价与客服落地数据走出差异化路线。具身智能一侧,智元与长隆打造的全球首个大型具身智能主题乐园正式开园,300 余台机器人从展品变成"员工",接受真实商用的验收。

一、Claude Opus 5.5 与 GPT-6 Sol/Luna 同日登场:前沿模型"效率战"开打,48 小时后账单数据出炉

事件内容

9 月 22 日,Anthropic 与 OpenAI 在约 90 分钟内相继发布新模型,竞争焦点从绝对能力转向成本、速度与缓存效率:

  • Anthropic Claude Opus 5.5:定位 Claude 5.5 家族首款模型,官方称其在大多数任务上达到旗舰模型 Fable 5.1 水平,较上一代 Opus 5 运行成本下降约 40%,输出速度提升超 30%;API 定价为每百万输入/输出 token 4 美元/20 美元,缓存读取降至 0.20 美元/百万 token(较 Opus 5 降低 60%)。发布前经 Frontier Design、METR 等外部机构安全测试,Anthropic 称其在测试环境中突破边界的尝试次数较前代减少 85%;Claude Code v2.1.280 已将 Opus 5.5 设为默认 Opus 模型,并支持推理档位切换不再打断提示缓存。

  • OpenAI GPT-6 Sol / Luna:Sol 定价 2 美元/10 美元每百万输入/输出 token,Luna 低至 0.10 美元/0.50 美元,较 GPT-5.6 促销价下调约 50%;Sol 在 Agents' Last Exam 上得 56.4%,超过 Claude Opus 5 且成本低 60%,事实错误率约为上一代一半;缓存命中输入享 90% 折扣。两款模型已上线 ChatGPT Work、Codex 与 API,Luna 的输入价格已低于 DeepSeek-V4.1 Flash。
  • 降价 48 小时后的账单数据:第三方网关统计显示,Anthropic 最强最贵的 Fable 5.1 上线头 12 天仅占网关总支出的 3.7%;大企业账户中前沿模型的 token 消耗占比从 8 月的 53% 降至 9 月的 45%;公开网关上开源通用模型价格比闭源混合价低 86%——付费主力集中在"够用的智能"所处的中间层多步骤工作流。

影响分析

(1)前沿模型定价权从"稀缺能力"转向"规模效率"。两家都没有等待新的能力突破,而是把现有旗舰能力快速下沉到更便宜的模型层级;对开发者和企业而言,同样的预算可以运行更多 Agent 任务,模型选型需要同时评估能力、token 成本、缓存折扣与失败恢复开销。

(2)缓存机制成为成本结构的核心变量。两家在缓存读取折扣上分别给出 60% 与 90% 的让利,说明 Agentic 长任务中重复上下文的读取开销已成为主要成本;工作流设计如何复用上下文、减少无效重传,将直接决定实际账单。

(3)价格战重排了需求曲线。最强模型并非营收主力,"中间层"的多步骤任务才是生意主体——这一结构性判断将进一步挤压中端闭源模型与纯 API 转售模式的生存空间,也解释了为什么降价发生在同一天:谁先锁定中间层预算,谁就拿到下一阶段的基本盘。

二、小米开源 MiMo-V2.6 登顶全球开放权重榜:单任务成本 0.13 美元,强化学习全套技术栈一并开放

9 月 22 日,小米发布并开源新一代 MiMo-V2.6 系列大模型,包括旗舰 MiMo-V2.6-Pro 与高效推理模型 MiMo-V2.6-Flash,均以 MIT 许可开放权重。Pro 为稀疏 MoE 架构,总参数 1.02 万亿、每 token 激活 420 亿,原生支持文本、图片、视频、音频全模态输入,上下文窗口 100 万 token。在全球测评平台 Artificial Analysis 综合智能指数上,MiMo-V2.6-Pro 以 46.32 分位列开放权重模型第一,超过智谱 GLM-5.3(45 分)与 Kimi K3(44 分),成为国产模型第一;Hugging Face 联合创始人 Delangue 转发评价"Banger!"。

成本侧,AA 测得 Pro 单任务成本仅 0.13 美元,首次将前沿智能带入 0.1 美元区间;API 价格维持 V2.5 水平(Pro 每百万 token 输入 0.435/输出 0.87 美元,Flash 为 0.14/0.28 美元),小米称同等智能水平下价格仅为海外模型的二十分之一至六十分之一。

训练方法上,Pro 与 Flash 各自在一轮约 6 天的大规模强化学习后训练中完成 30 步、约 75 万条轨迹,成本分别约 262 万与 85 万美元,训练过程全程公开直播;小米同时开源了完整 RL 框架、7000 余个带自动评分器的任务环境、奖励设计与超参数,覆盖编程、通用智能体、视觉任务与网络安全(混合单轮训练,DeepSWE v1.1 上 Pro 从 58.4 提升至 71.9,Flash 达 67.9;CyberGym 上 Flash 达 95.1)。MiMo 团队负责人罗富莉称其难度超过 DeepSeek R1。差距同样明确:Terminal-Bench 4.0 上 Pro 得分 34.9,显著落后 GPT-6 Astra 的 59.6 与 Fable 5.1 的 55.1。

影响分析

(1)开源阵营正式加入第 1 条的定价权争夺。与闭源两大实验室的同日降价相呼应,小米用"开源权重 + 价格不变 + 成本斩杀线"三件套站上同一条战线,"每一美元换多少智能"从此有了闭源与开源两个可公开对比的计分板。

(2)可复现性成为开源阵营的新竞争武器。直播训练 + 全套 RL 框架 + 7000 余个任务环境的开放,把开源竞赛从"交出权重"升级到"交出训练基础设施",后来者复现门槛大幅降低,开源模型代际迭代速度可能进一步加快。

(3)编程能力呈"够用层逼近、硬仗层分层"格局。开源模型在 Code Arena 已跻身开源第三、与 Fable 5 高配版并列,日常 Agent 任务差距收窄;但 Terminal-Bench 4.0 仍落后头部闭源模型约 25 分——"最难的智能"仍在闭源手中,分层定价与分层选型将成为开发者的常态。

三、阿里云栖大会全栈发布:真武 V900、Qwen4 万亿级路线与 Agentic Cloud 同日亮相

9 月 22 日,2026 云栖大会在杭州开幕,阿里围绕"AI 模型、AI 芯片、AI 云"三大方向集中亮牌:

  • 芯片层:平头哥发布训推一体 AI 芯片真武 V900,性能达上一代真武 M890 的 3 倍,为目前算力性能最强的中国自研 AI 芯片之一;搭载 216GB 大容量显存、片间互联带宽 1200GB/s,原生支持 FP8/FP4;经自研 ICN Switch 互联芯片连接后,千卡可全带宽高速互联、如"一颗超级芯片"协同工作,单一集群可扩展至 50 万卡,计划 2027 年一季度量产。基于 M890 的超节点已跑通 Qwen3.8、Kimi K3 等超 2 万亿参数模型;真武系列已服务超 650 家企业客户;倚天 720/730 服务器 CPU 规划同步公布(2027 年,730 首次采用全自研微架构)。

  • 模型层:基于新一代架构的 Qwen4 已在训练中,Qwen4.5、Qwen5 等后续版本参数规模将扩展至 5 万亿—10 万亿(当前旗舰 Qwen3.8-Max 为 2.4 万亿)。
  • 云层:阿里云 CTO 李飞飞系统阐述 Agentic Cloud 战略,围绕模型、执行框架与上下文三大场景推出 AgentCore、Agent Sandbox、Context Engine 等新品;新一代 CPFS 存储将 AI 存储成本降低 69%、单文件系统规模提升至 100PiB,Tair KVCM 缓存系统有效命中率可达 99%、每 token 成本下降 50%。
  • 基建目标:CEO 吴泳铭宣布到 2032 年阿里云运营的全球数据中心规模将超过 20GW;首个国产十万卡云上超节点灵骏真武 M890 已运行超 2 万亿参数模型,今年四季度将在宁夏中卫新增服务。应用侧,9 月 28 日发布的荣耀 Magic9 将成为首款搭载 Qwen Intelligence 的 AI 手机(官方口径综合任务准确率 91.8%);中国平安披露与阿里合作以来日均消耗 token 超 3000 亿。发布会后阿里港股上涨 5.1%。

影响分析

(1)国产 AI 基础设施首次以"芯片—互联—存储—云—模型"全栈形态同日亮相。真武 V900 + ICN + 磐脉网卡 + 镇岳 SSD 的系统级组合,对标的是海外"芯片厂商 + 云厂商"的联盟打法;50 万卡集群与 20GW 目标,把大模型竞争从模型分数拉到基建层面。

(2)Token 经济学成为云的新利润池。KVCM 把每 token 成本砍半、CPFS 把存储成本降 69%,配合"智能将成为规模化商品"的判断——云厂商的竞争力正从算力租金转向 token 效率,这与第 1 条的降价潮、第 2 条的成本斩杀线指向同一个终点。

(3)Qwen 5—10 万亿参数路线与自研芯片绑定。国产大模型的规模天花板第一次不再受制于进口算力供给,对国内 AI Coding 与 Agent 的规模化部署是底层利好;真武 V900 明确覆盖具身智能客户,也为机器人侧的端云算力提供国产选项。

四、xAI Grok 4.7上线首周:定价按兵不动,用客服工单与"过夜 Agent"证明落地

9 月 21 日,xAI 发布 Grok 4.7:基于 2.1 万亿参数新底座(较 Grok 4.6 增加 40%),CursorBench 4.0 得分 46.3%(上代 40.4%)、DeepSWE v1.1(high effort)71.0%、Terminal-Bench 4.0 达 38.0%;在两大实验室同日降价的时间点,xAI 坚持 2 美元/6 美元的定价不变,并将模型即刻接入 GitHub Copilot。

首周的两个落地信号更值得注意。其一,客服替代的量化账本:xAI 与 Cursor 于 8 月 14 日合并后,将合并后支持体系重建在基于 Grok 4.7 的 Grok Bot 上,工单量上升 175% 而未增加人手(约合省下 200 人编制);传统 AI 客服工具每单成本 1—4 美元,Grok Bot 经优化后降至 0.20—0.30 美元/单,按用量计费。其二,"过夜 Agent"交付生产功能:有开发者披露其多个 FSD 与 Cybercab 功能由 Grok 4.7 harness 的隔夜运行 Agent 完成,该 harness 在自验证、长程监控与多模态行为上明显增强,获得马斯克转发;独立实测还显示其系统提示遵循异常严格——会主动追问哪些红色 CI 检查允许绕过、拒绝随意的"yolo"式覆盖指令。

影响分析

(1)不降价的差异化路线。在同行以 token 单价开战时,xAI 把竞争点押在 harness 能力与落地数据上——模型竞争的叙事正从"每百万 token 多少钱"转向"每单成本、每任务交付率",这对采购决策者是更接近真实成本的口径。

(2)首批公开的"Agent 替代人力"量化样本。工单量 +175%、零增员、单成本降一个数量级,Grok Bot 给出了一个可对标的客服账本;企业评估 Agent 采购时,"替代了多少人力工单"将逐渐取代跑分成为核心论据。

(3)"过夜 Agent"跑通真实功能交付。隔夜运行完成 FSD/Cybercab 功能,意味着长程自主任务正从演示走向生产排期;但自主交付也第一次把验证与回归测试的责任压进 Agent 工作流本身——与其严格追问 CI 权限的行为互为印证,安全护栏正在成为产品力的一部分。

五、智元×长隆全球首个大型具身智能主题乐园今日开园:300 余台机器人进入常态运营

9月24日,智元机器人与长隆集团联手打造的全球首个大型具身智能主题乐园在珠海横琴长隆飞船乐园正式启幕:超 300 台智元全系机器人"上岗",设置 100 余个机器人交互点,覆盖导览、演出、科普、零售、酒店、体育互动等场景,业态包括机器动物总动员、大型机器人马戏秀、赛博主题巡游与机器人服务酒店;双方同步揭牌具身智能文旅联合研究院,并现场展示 5G-A 具身应用。今年 8 月,长隆集团与智元签署战略合作协议,以"文旅+科技"融合模式共建该乐园;长隆年接待游客量超 4300 万人次。与展会 demo 不同,园区机器人以"员工"身份进入排班体系,长期承担真实服务职能——智元此前披露其上半年整机出货 8400 台、占全球约 44%,此番是其自有场景运营能力的第一次大规模公开验收。

影响分析

(1)具身智能第一次获得"高频、开放、C 端"的规模化验收场。主题乐园的客流波动、连续运维与安全要求,比封闭工厂或展会演示更接近真实商用条件;规模化调度、长期运维、交互安全能否跑通,将直接影响整机厂的商业化估值逻辑。

(2)"可复制场景"比"单园营收"更重要。若园方后续披露单机日均交互次数、故障率与替代人工成本,行业叙事将从主题炒作转向订单逻辑,并带动传感器、执行器、边缘算力与 5G-A 通信等上游环节的确定性。

(3)对模型层同样有养料价值。多机调度、人机共演与长时运维持续产生真实交互数据——这恰是具身"大脑"最稀缺的训练素材,乐园因此不只是场景出口,也是数据闭环的入口。

作者:咕泡科技——十年专注AI与IT中高端人才培育


来源备注:Anthropic 官方/OpenAI 官方、腾讯研究院 AI 速递、AGI Hunt、每日经济新闻/网易、IT之家、经济参考网/京报网、Edgen/Best AI Tools、杭州市人民政府门户网站/萧山区政府、阿里云开发者社区、GenAI Daily、AI Briefing、东方财富、经济日报,图片(含新闻配图、截图等)均来自上述媒体公开报道及网络公开渠道,如有侵权请联系处理,谢谢!

转载自 CSDN-专业IT技术社区

原文链接:https://blog.csdn.net/2401_86983677/article/details/166571624

文章来源转载

评论

赞0

评论列表

微信小程序
QQ小程序

关于作者

点赞数:0
关注数:0
粉丝:0
文章:0
关注标签:0
加入于:--