低成本冲击:DeepSeek 们把 AI 的成本账改写了吗
本文是「AI 低成本」系列的第 3 篇(共 8 篇)。
一次震动,和一个老问题
2025 年前后,全球 AI 圈子里最剧烈的一次震动,莫过于低成本模型的崛起。随着 DeepSeek-R1 等模型走进大众视野,外界开始重新审视一个老观点:想要拥有高端 AI 能力,是否一定得靠天量资金和顶级 GPU 集群去堆?
这个问题引发的连锁反应,远比单个产品本身要深远得多。
DeepSeek 之所以能引起这么大的关注,原因有这么几点:
- 它在推理、数学、代码等硬核任务上,已经逼近了国际顶尖水平;
- 部分模型开放了权重,让开发者和企业能直接拿来研究、部署甚至改造;
- 它的 API 调用价格明显比许多闭源竞品便宜;
- 技术报告里披露的训练成本,远低于大家对头部闭源模型的一贯估算。
先把三个概念理清楚
讨论“AI 到底贵不贵”之前,得先分清三件常被混为一谈的事:
| 概念 | 含义 | 发生时间 |
|---|---|---|
| 训练成本 | 模型从海量数据里学本领时花的计算开销 | 模型上线前 |
| 推理成本 | 用户每问一次、模型每答一回所消耗的算力 | 产品运行中 |
| API 价格 | 服务商向用户收的钱 | 与真实成本有关,但不等同于全部成本 |
完整的账单里,还得算上研发人员工资、数据采购、带宽运维、办公折旧,以及安全合规等各项支出。
557.6 万美元为什么成了焦点
DeepSeek-V3 的技术报告曾提到,其训练成本大约是 557.6 万美元。这个数字一下子成了舆论焦点,因为外界对那些头部闭源模型训练成本的估算,动辄就是几千万美元甚至更高。
与此同时,DeepSeek 对外提供的调用价格也显著低于 OpenAI、Anthropic、Google 等大厂的主力模型。官方还曾披露过,在某次 24 小时推理系统的测算中,理论收入明显高于租用 GPU 的成本。
虽然这不算一份完整的财报,但它指明了一个重要方向:模型服务的单位经济效益正在出现新的可能。
低成本到底从哪儿来
答案是算法选择、模型结构、训练流程、通信优化、显存管理以及工程调度等一系列环节优化组合后的结果。
MoE:让每次计算只激活一部分参数
稀疏混合专家模型(MoE)提供了一个非常关键的思路。传统的大模型在每次计算时,往往需要调动全身的参数,这背后的成本极其高昂。而混合专家模型则像是把任务分包给多个专家子网络,每当处理输入信息时,只挑选其中最合适的一部分专家参与工作。
这样一来,模型的总参数量虽然可以做得很大,但单次计算实际激活的参数却变少了。对用户来说,感受到的依然是大模型的强悍能力;对服务器而言,单次计算的负担却实实在在地减轻了。
MLA:让长上下文不再滚雪球
另一个不容忽视的方向是注意力机制与缓存的优化。大语言模型在生成答案时,必须时刻“盯着”上下文,上下文拉得越长,计算压力和显存占用就越像滚雪球一样增加。
像多头潜在注意力(MLA)这类架构上的优化,本质上是想方设法减少推理时对显存和计算资源的占用,让处理长文本变得更高效。对于模型公司来说,省下的每一寸显存都意味着同样的硬件能承载更多的请求,也意味着用户的等待时间会缩短,服务成本也能降下来。
工程:细节决定成本
工程层面的精雕细琢同样是胜负手。训练大模型需要在成千上万张 GPU 之间分配任务,这涉及数据并行、模型并行、流水线并行以及专家并行等复杂的协作。如果通信设计得不合理,昂贵的 GPU 就会在大量等待中虚度光阴。
此外,计算精度的选择也大有讲究:低精度计算虽然能跑得更快,但必须小心翼翼地平衡,不能让模型质量受损。从训练数据的组织方式、样本配比、去重清洗,到学习率的设置以及故障后的快速恢复,每一个细节都在左右着最终的成本。
冲击:门槛变了,行为也变了
低成本模型的出现,其意义绝不仅仅是“省钱”那么简单,它从根本上改变了 AI 竞争的心理门槛。
过去,很多创业公司、传统企业和科研机构总觉得,顶尖的 AI 能力是少数巨头才玩得起的“金钱游戏”;而当开源模型能以较低成本逼近头部水平时,更多机构开始认真考虑私有化部署、行业深度微调、本地化应用以及低成本的二次开发。模型能力不再被锁在少数闭源平台的深宅大院里,应用创新的空间被彻底打开了。
价格的变动,还会直接重塑用户的行为习惯:
- 如果调用一次模型的费用很高,企业肯定会缩手缩脚,只在那些高价值的任务里才舍得用;
- 但如果调用价格降到了“白菜价”,那么客服、办公、设计、写代码、资料检索、数据分析等各行各业的场景都会迅速接入。
AI 想要从少数人的尝鲜玩具变成日常工作的基石工具,推理成本的下降是必须跨过去的一道坎。
两种常见的误读
不过,这种低成本带来的冲击也容易产生误读。
第一,算法优化并不能凭空消除对算力的需求。 DeepSeek 的成功,归根结底依然建立在海量 GPU 资源、顶尖工程团队和高质量训练体系的基础之上。它向世人证明的是,通过更聪明的架构设计和更极致的工程手段,可以显著提升单位算力的产出效率;但它并没有证明,一个普通团队只靠几台设备就能随随便便练出世界级的模型。
第二,开源降低门槛的同时,也拉高了竞争烈度。 当模型能力变得触手可及,那些单纯靠包装模型接口生存的产品会迅速陷入同质化的泥潭。企业真正需要面对的拷问变成了:你是否掌握核心的行业数据?你是否真的理解业务流程?你是否能为最终结果负责?
当模型底座变得越来越便宜,应用端的差异化竞争反而变得比以往任何时候都更加重要。
规模、效率、速度、落地的综合博弈
低成本模型的出现,给全球 AI 产业抛出了一个更现实的命题:高端算力依然决定着能力的上限,而算法和工程水平则决定了触达这个上限的代价。
巨头们可以继续仗着资本和集群优势去探索边界,后来者也能靠效率和开源找到自己的生路。
如今的 AI 竞争,已经从单纯的规模竞赛,演变成了一场关于规模、效率、速度以及落地能力的综合博弈。
Comments
Post a Comment