三个月价格腰斩,大模型的“聪明”正在贬值?

日期:2026-09-17 19:59:27 / 人气:4


2026年三季度,全球大模型行业进入了一场极致的肉搏战。
七、八、九三个月,海内外模型厂商密集迭代新品、更新版本,行业迭代速度空前。9月第一周,海外头部厂商轮番发力,OpenAI、Anthropic、谷歌接连推出新作,Claude Fable 5.1、Gemini Flash 3.8、GPT-6 Astra扎堆亮相;国内赛道同样内卷加剧,各类轻量化Flash模型集中上新,行业热闹空前。
智谱“牛来”GLM-5.3-Flash与阿里Qwen3.8-Flash同日发布,正面对标;9月10日,DeepSeek下架V4 Pro,推出V4.1 Flash接棒,再度拉低行业定价底线;月之暗面顺势推出Kimi K2.8 Preview,版本号看似倒退,却实现了接近旗舰K3的性能、更高的运行效率。
行业呈现出一种极具割裂感的反差:模型能力持续通胀,Token价格持续通缩。各家模型越来越聪明、功能越来越全面,但市场定价却走出了反向暴跌曲线。短短三个月,大模型行业完成了一次彻底的价格洗牌。
01 残酷数据:三个月价格腰斩,行业告别高价时代
行业降温的信号,藏在最真实的市场交易数据里。
据Silicon Data发布的LLM Token支出指数,该指数以市场实际成交价格加权计算,是衡量全球大模型推理成本的核心标尺。数据显示,8月大模型Token均价单月暴跌29%,跌至0.97美元/百万Token,首次跌破1美元关口。而仅仅三个月前的5月,这一指数还维持在2美元以上高位。
短短九十天,大模型行业均价直接腰斩。更值得警惕的是,这场降价并非局部促销、短期补贴,而是全行业结构性、永久性的价格下探。
市场均价暴跌,本质是双重趋势叠加:一方面,海内外厂商集体主动降价,拉低整体定价基准;另一方面,用户调用结构大幅迁移,市场流量批量涌向高性价比的低价Flash模型。在全球大模型用户量、Token消耗量持续暴涨的背景下,用量暴增、单价暴跌,成为行业新常态。
曾经靠“模型更聪明就能溢价”的时代彻底落幕。如今行业的核心竞争逻辑彻底反转:能力相近的前提下,谁更便宜,谁就能抢占市场。用户不再单纯为极致智能买单,而是用脚投票,优先选择性价比更高的AI模型。
02 全行业花式降价:从直接砍价到模型重构,内卷无死角
为了抢夺用户、维持增长叙事,大模型厂商用尽浑身解数,从直白降价、隐性优惠到模型架构重构,全方位压缩使用成本,行业内卷覆盖所有维度。
最直接:旗舰模型逐级降价,巨头亲自击穿底价
以往主打高端溢价的海外头部厂商,率先放下身段。OpenAI在一个月内两度降价,从外围中端模型到核心旗舰全面开刀:7月30日,GPT-5.6 Luna永久降价80%,同系列Terra降价20%;次月,刚发布的旗舰GPT-5.6 Sol再度下调价格,输入降价20%、输出降价超30%。一月两刀,层层下压行业价格天花板。
国内厂商攻势更为迅猛,DeepSeek此前将V4 Pro永久降价75%,缓存命中输入价格低至0.025元/百万tokens,直接颠覆行业定价体系。即便后续小幅回调,也足以证明,国产模型早已掌握改写行业价格规则的话语权。
最隐蔽:变相优惠让利,压低实际使用成本
除了直白降价,不少厂商采用隐性优惠策略,名义定价不变,实际使用成本大幅降低。通过API限时五折、免费额度赠送、额度重置、打包优惠等方式,吸引开发者与企业用户批量调用,变相抢占市场份额。
最根本:重构产品体系,Flash模型成行业主力
真正改变行业格局的,不是短期降价,而是厂商的产品战略重构。各大厂商纷纷剥离旗舰模型的冗余能力,推出轻量化、高效率、低成本的Flash系列模型,形成“旗舰冲高、走量盈利”的双线布局。
阿里Qwen3.8-Flash依托全新架构,训练开销仅为高端Plus版本的1/9,聚焦编码、Agent、办公高频场景,性价比拉满;月之暗面Kimi K2.8 Preview舍弃参数内卷,在接近旗舰性能的基础上,大幅提升推理效率;智谱GLM-5.3-Flash主打极致均衡,适配绝大多数日常商用场景。
这类轻量化模型的核心逻辑十分清晰:不做全能优等生,只做物美价廉的打工人。绝大多数企业、个人用户的日常需求,不需要极致顶尖的智能,“够用、便宜、高效”,才是当下市场的核心刚需。
最精细:拆解成本结构,从缓存、输出端精准节流
头部厂商的进阶打法,是深入技术底层压缩成本。Anthropic、DeepSeek等厂商不再单纯调整终端售价,而是针对推理核心环节优化。Claude Fable 5.1大幅下调缓存读取价格,降幅高达75%,从1美元降至0.25美元/百万Token。
这一调整精准击中行业痛点。大模型推理成本主要集中在预填充阶段,超长文本预处理算力消耗极大,但重复调用同一上下文时,读取KV缓存的边际成本几乎为零。当下高速增长的Agent智能体场景,需要反复读取长上下文,缓存降价相当于直接补贴核心增长赛道。
各家技术路径各有侧重:DeepSeek从架构、注意力机制、缓存精度三维度压缩缓存空间;OpenAI优化输出Token长度,实现“单价微涨、总价下降”的效果。但所有优化都存在共同瓶颈:技术迭代速度,跟不上模型智能升级带来的算力消耗膨胀,节流终有上限。
03 降价的底层逻辑:需求端花不起,供给端降得住
这场全民降价潮,绝非厂商恶意内卷,而是需求端倒逼、供给端支撑的双向必然结果。
需求端:企业AI账单失控,昂贵模型无人买单
行业早期,市场坚信“杰文斯悖论”:模型效率越高、价格越低,应用场景就越丰富,Token用量暴涨,企业营收持续增长。但2026年三季度,这套增长叙事首次失灵。
核心问题在于,AI成本增速,早已远超业务价值增速。Uber就是典型案例,今年4月其全年AI预算提前耗尽,工程师人均月均API调用成本高达500-2000美元。更尴尬的是,海量Token消耗,无法转化为可落地的用户功能,投入与产出严重失衡。
不止Uber,Meta、亚马逊等海外科技巨头,均已陆续收紧AI使用权限、设置员工月度Token上限。企业用户开始理性控本,不再盲目消耗算力,批量转向高性价比开源模型、轻量化模型,高价闭源模型的市场空间被持续压缩。
对于OpenAI、Anthropic等未上市巨头而言,Token消耗量是支撑估值的核心逻辑。市场流量持续流失、增长放缓,估值必然承压。为了守住市场份额、延续增长故事,哪怕牺牲利润、主动降价,也是唯一可行的选择。
供给端:训练成本重构,厂商拥有降价底气
如果只有需求倒逼,降价终将触碰成本底线。而本轮持久降价,核心依托于行业成本结构的颠覆性变化。
过往行业依赖“力大砖飞”的预训练模式,GPT-6 Astra十万张GPU集群的训练模式,硬件成本动辄数十亿美元,预训练门槛极高。但如今,行业能力增长的核心,正在从预训练堆规模,转向后训练提效率。
智谱AI数据显示,在参数不变的前提下,通过强化学习、长程任务反馈优化,模型任务完成率可提升超50%。行业共识已然清晰:预训练决定模型基础底子,后训练决定模型性能上限。
MiniMax进一步指出,后训练阶段的推理效率,直接决定模型研发效率,推理算力的优化空间,远大于预训练。依托合成数据、强化学习、精细化评测,厂商无需无限堆叠高端算力,就能实现模型性能跃迁,这也为持续降价提供了坚实的技术与成本支撑。
04 杰文斯效应短暂失灵:用量狂飙,收入停滞
本轮价格暴跌,彻底打破了行业奉为圭臬的Token增长神话。
依据摩根大通监测的OpenRouter数据,8月平台Token调用量环比暴涨47%,但整体营收仅微增7%。用量近乎翻倍,收入几乎停滞,成为行业最真实的写照。
流量结构更能说明问题:8月平台Token消耗前十的模型中,低价Flash模型占据半壁江山,DeepSeek V4 Flash-0731以50.7万亿Token的消耗量稳居榜首。新增市场需求,几乎全部涌向性价比模型,高价高端模型的增量空间持续萎缩。
这意味着,杰文斯效应正在阶段性失效:价格下降带来的需求增量,无法覆盖单价下跌的利润缺口,行业整体增收不增利。正如高盛One-Delta负责人Rich Privorotsky所言,需求暴涨叠加价格崩塌,若收入增长持续滞后于算力成本增长,整个AI基础设施的投资逻辑都将面临挑战。
但这并不代表行业叙事彻底破产。GPT-6 Astra的落地,让市场看到了新的可能性:通用大模型开始跨界具身智能,可直接调用专业软件、解析图片生成工程文件、操控机械臂完成实体任务。
当下的价格战与智能迭代并不冲突:低价模型承接存量通用场景,高端模型解锁增量新兴场景。杰文斯效应只是暂时滞后,当Agent、具身智能、企业工作流等新场景全面爆发,全新的用量红利终将释放。目前行业只是处于“价格坍塌速度,快于场景落地速度”的过渡期。
05 行业格局重构:智能溢价落幕,性价比定胜负
大模型行业的竞争天平,已经彻底倾斜。
过去,行业话语权掌握在技术领跑者手中,极致的智能能力,意味着绝对的定价权和高溢价。如今,中外模型能力差距持续收窄,技术壁垒逐渐弱化,工程优化能力、成本控制能力、性价比优势,成为新的核心护城河。
这也是国产模型在本轮价格战中强势突围的核心原因。相较于海外巨头,国内厂商更擅长成本优化、架构精简、场景适配,在性价比赛道拥有天然优势。当行业从“拼顶尖智能”转向“拼落地性价比”,国产开源模型顺势抢占主流市场。

作者:傲世皇朝平台




现在致电 5243865 OR 查看更多联系方式 →

傲世皇朝平台 版权所有