XM外汇官网跟单资讯:开源崛起、降价80%,大模型真的还能赚到钱吗?
北京时间7月31日,OpenAI把GPT-5.6 Luna的API价格下调80%,每百万Token输入降至0.2美元,输出降至1.2美元。
此前,在7月27日,月之暗面正式放出Kimi K3的模型权重及技术报告。Kimi K3的官方API价格并不便宜:每百万Token的缓存命中输入为0.3美元,普通输入为3美元,输出高达15美元。
开放权重之后,符合许可证要求的小型云厂商和算力中心也可以部署K3、提供推理服务,虽然条件比较严格,但是确实扩大了供给。
一边是闭源模型主动降价,一边是中国开放权重模型能力追赶头部闭源模型。
大模型的竞争在当下的时间节点上,已经不能仅仅用“价格战”来简单衡量。
从成本端来看,7月28日,摩根士丹利刚刚发布了一篇报告,按照报告提供的模型测算,一座配置41万张GB300的1GW数据中心,在75%利用率下,每百万Token至少要卖到约0.44美元,才能覆盖设备折旧、电力和基础运营成本。
沿用报告测试吞吐量时采用的8∶1输入输出比例,Luna降价后的综合价格只有0.31美元。若实际吞吐量与大摩假设相同,它需要107%的利用率才能回本;维持75%利用率,吞吐量还要提高约43%。
这无法证明OpenAI正在亏本销售Luna。小模型的实际吞吐量可能远高于大摩测试的万亿参数模型,缓存和软件优化也会降低成本。但80%的降价幅度,结合最近OpenAI频繁重置订阅制额度的动作,它显然已经开始了某种“价格攻势”。
很巧的是,就在报告发布前一天,一位国内AI创业者也分享给我一份他们团队测算的8卡B300“Token工厂盈利账”。但是,两份报告得出的回报率相差近四倍。仔细来对比,两个团队的计算都有道理,只是其中的维度不同,决定了大模型逐渐复杂的“盈利变量”。
01 从一个Token开始算账
摩根士丹利计算的是一座1GW的AI工厂:部署410256张GB300,总投资390亿美元,其中IT设备230亿美元,供电、冷却和建筑等设施160亿美元。
报告将IT设备按5年折旧,非IT设施按15年折旧,每年折旧约57亿美元,电力及其他运营成本约20亿美元。在自有模型API模式下,大摩假设65%的算力用于推理,每张GPU每秒生产2750个Token,商业利用率75%,综合售价1.75美元/百万Token。由此得到年收入304亿美元、税后经营利润179亿美元,ROIC达到46%。
国内团队算的是一台8卡B300节点:投资1500万元,每秒生产8万个Token,利用率80%,结算价格4元/百万Token。按照这组假设,每月收入约66.4万元,电费约3000元,IDC费用5万元。
最大的成本是折旧。设备按3年折旧,每月要摊掉41.7万元,最终月度经营利润约19.4万元。按照税后经营利润除以初始投资计算,ROIC约12%。但是,在这个计算模型下,“ROIC”更接近基于EBITDA的回收速度,与严格意义上的ROIC并非同一口径。
但是,毫无疑问的是两份报告的回报率相差巨大,即使口径不太相同,近四倍的差距也会引起关注。对比下来,这个差距主要来自吞吐量、利用率、Token价格和折旧年限四个变量。
这门生意可以压缩成两个公式:
收入=有效吞吐量×运行时间×商业利用率×Token净价
ROIC=税后经营利润÷投入资本
第一个变量是有效吞吐量。国内报告假设每张B300每秒生产1万个Token,大摩采用2750个。英伟达今年4月公布的MLPerf结果显示,GB300运行DeepSeek-R1时,服务器场景达到每卡8064 Token/秒,离线场景达到9821 Token/秒。8卡8万Token/秒具备技术可能性,但更接近高并发、充分优化后的水平。
模型大小、上下文长度、量化精度和延迟要求都会改变吞吐量。现实中的技术实现不同,收入可能出现数量级偏差。
第二个变量是商业利用率。GPU满载执行训练、测试和免费请求,未必产生收入。国内报告的盈亏平衡利用率约为56.5%,低于这条线,1500万元的节点便会开始亏损。
第三个变量是Token净价。大摩采用1.75美元/百万token,国内报告采用4元人民币/百万token。挂牌价格还要扣除缓存优惠、免费额度、渠道分成和平台成本。
第四个变量是设备寿命。1500万元节点按3年折旧,每月折旧41.7万元;改成5年,每月降至25万元,账面ROIC可以接近翻倍。但折旧年限拉长不会减少现金支出。财务处理方式是一方面,技术的迭代周期,在AI时代也是影响折旧周期的巨大因素,GPU在第四、第五年还能否维持租金和客户需求,才决定这笔利润是否可靠。
两份报告中,电价的占比都不大。设备折旧决定成本下限,商业利用率决定盈亏生死,Token价格决定利润空间。
02 开放权重,新的竞争变量
开放权重模型,成为大模型竞争格局中越来越重要的变量。
月之暗面公开了Kimi K3的完整模型权重和相关代码,允许开发者部署和修改,但没有同时开放完整训练数据和可复现的训练流程。
根据Kimi K3的开源协议,使用者可以复制、修改、部署、微调、分发、再许可或销售模型及其衍生版本,也可以封装成API对外提供服务。
重要限制出现在“模型即服务”业务上:如果使用者或其关联方经营API、推理或模型微调等MaaS业务,且连续12个月合计总收入超过2000万美元,在将K3或其衍生版本用于商业目的前,需要先与月之暗面签署单独协议。
若搭载K3的商业产品超过1亿月活,或者月收入超过2000万美元,还需要在产品界面显著展示“Kimi K3”。内部使用,以及通过月之暗面官方产品或认证推理伙伴调用K3,不受上述两项要求约束。
这意味着,小型算力运营商原则上可以下载K3,部署在自己的集群上,再按Token出售API;大型云厂商通常需要与月之暗面重新谈判。K3开放了供给,但月之暗面仍然保留了对大规模商业化的控制。
开放权重的竞争压力也由此产生。客户除了购买月之暗面官方API,还可以选择自行部署或寻找第三方服务商。闭源模型公司如果继续收取高价,就需要证明自己在能力、速度、稳定性和安全上拥有足够优势。
不过,权重免费不等于推理免费。K3总参数达到2.8万亿,需要昂贵的GPU集群和复杂的并行、量化、缓存与调度系统。
月之暗面披露,K3官方API在代码任务中的缓存命中率超过90%;代码Agent反复调用模型时,大量代码、历史对话和工具结果可以直接复用,减少重复计算。
这也是开放权重之后,官方API仍然有收费优势的原因。用户购买的不只是模型权重,还包括已经优化好的推理系统、稳定延迟、弹性并发和服务保障。对大多数企业而言,直接购买API可能比自建K3集群更便宜。
开源和闭源更像两种竞争策略。开源用模型权重换取开发者、适配生态和行业影响力,再通过官方API、消费者订阅、企业部署和技术服务赚钱;闭源保留模型控制权,通过领先能力和服务质量维持溢价。
03 80%的降价,和频繁的“重置”
OpenAI这轮API降价酝酿已久。外媒6月12日便有报道,OpenAI正在考虑大幅降低Token价格,以争夺被Anthropic吸引的企业和开发者客户。
7月31日,降价正式落地:Luna输入和输出价格同时下调80%,Terra下调20%;旗舰模型Sol维持原价,同时推出速度最高提升2.5倍、价格翻倍的Fast模式。
从价格策略上来看,Luna争夺高频、成本敏感的任务,Terra承接日常工作,Sol保留旗舰能力溢价,Fast模式再向延迟敏感的企业收费。
OpenAI希望用低价扩大调用量,也在按照能力和速度重新区分客户的支付意愿。
K3在7月16日上线、7月27日开放权重,加上Claude在企业市场的增长、中国其它开源模型的竞争,共同加快了OpenAI的价格调整。
另一条价格线藏在订阅制里。API客户按Token付钱,ChatGPT Work和Codex用户支付固定月费,受到五小时窗口、周度额度和Credits约束。额度决定一个月真正能使用多少算力,也构成了订阅产品的隐性价格。
从4月至7月,OpenAI多次为付费用户重置额度。有些用于庆祝用户增长或邀请活动,带有促销性质;有些则发生在后台Agent重复运行、额度消耗异常之后,属于补偿。GPT-5.6上线三天后,OpenAI暂时取消部分付费用户的五小时限制并统一重置额度;7月29日,面对Sol消耗额度过快的反馈,OpenAI又恢复了ChatGPT Work和Codex用户的额度。
频繁重置甚至形成了一种社区文化。Reddit的Codex社区出现了专门追踪重置消息的网站和提醒工具,还有用户盯着Codex负责人Thibault Sottiaux的X账号:一旦他预告即将重置,就赶在重置前把剩余额度用完,重置落地后再继续运行任务。有人把这个操作戏称为等待“Saint Tibo”发放Token。
2025年初,Sam Altman曾承认,每月200美元的Pro订阅仍然亏钱,因为用户使用量远超预期。进入Agent阶段后,一个任务会反复读取文件、搜索网页、执行代码和调用子Agent,固定月费越来越难覆盖重度使用。
明知部分订阅用户仍在亏损,OpenAI为什么还要频繁重置额度?因为对一家正在争夺开发者入口的模型公司而言,用户流失的代价可能高于一次额度赠送。重置既能补偿计费异常、修复信任,也能让用户把Codex更深地嵌入代码库和日常工作。
这些额外算力也承担着市场测试功能。OpenAI需要知道,用户拿到更多额度后会完成多少任务,什么情况下愿意购买Credits,又有多少人会升级到更贵的订阅或Fast模式。今天赠送的Token,可以被视为获客、留存和定价实验的成本。
频繁重置并不意味着OpenAI准备长期提供无限算力。部分重置会改变使用周期,Banked Reset也有有效期。OpenAI一边扩大用户使用,一边收集数据,寻找月费、额度与真实推理成本之间的新平衡。
04 盈利在望,利润不会平均分配
未来Token成本仍会快速下降。
英伟达的MLPerf结果显示,依靠TensorRT-LLM、推测解码和并行优化,同一套GB300运行DeepSeek-R1的服务器吞吐量在半年内提高2.7倍,单位Token成本下降超过60%。缓存、低精度量化和大小模型路由,还会继续压低每项任务的算力消耗。
黄仁勋把Token称为“新的货币”,把数据中心称为制造Token的“AI工厂”。工厂能否赚钱,既看产量,也看产品有没有溢价。
市场已经进入用脚投票的阶段,不再听故事,要看最终落到财报的现实。刚刚发布的财报中,微软Azure收入增长43%,Copilot付费席位超过3000万个,AI投入正在转化为合同和现金流,财报发布后股价盘后上涨超过8%,并于财报发布的第二天正式交易中,大涨15.51%。Alphabet的云业务增长更快,但资本开支再次上调、季度自由现金流转负,股价盘后下跌约3%,次日正式交易跌约7.1%。
按摩根士丹利的测算,自建算力并销售自有模型API的ROIC约为46%,出租GPU约为31%;租用第三方算力再销售API约为25%,不过这一数字更接近税后经营利润率,不能与前两项严格比较。
但是可以看出,模型、算力与客户入口越完整,越有机会把技术降本转化为投资回报。
大模型价格战的终点,肯定不仅仅是token的绝对定价。开放权重会压缩模型的独家溢价,闭源模型会继续出售能力和速度,订阅制需要反复寻找用户使用量与价格之间的平衡,并探索toC产品的更独特价值。
AI时代,商业的本质依然没有变,技术壁垒、运营效率、品牌溢价能力依然是核心竞争力。最终能够留下利润的公司,既能把Token生产得更便宜,也能让客户为Token完成的工作支付更高价格。
Token会越来越便宜,但大模型已经脱离讲故事的时代,开始接受收入、现金流和投资回报的检验。
本文来源:腾讯科技
