推理时代:AI 成本的大头正在从训练转向推理
本文是「AI 低成本」系列的第 4 篇(共 8 篇)。
训练和推理,先分清
想要看清 AI 未来的成本走向,得先分清“训练”和“推理”:
- 训练是模型学习的过程;
- 推理是它回答问题的过程。
过去,大家的目光总盯着训练,毕竟动辄投入海量算力去练个大模型,听起来就很震撼。但现在,推理正变得愈发关键,甚至会成为许多企业账单上最沉重的那一笔。
推理模型改变了计算逻辑
传统的大语言模型在回答问题时,逻辑比较直接:根据你输入的内容,利用训练时形成的知识储备,快速预测下一个词或片段。你问它一个事实,它给你答案;你让它写段文案,它吐出文本。这个过程虽然也费算力,但单次计算的消耗相对还在掌控之中。
而现在的推理模型引入了全新的计算逻辑:面对复杂难题,模型不再急于给答案,而是在开口前先进行多步中间计算——拆解问题、尝试路径、校验结果,最后才输出。这种能力通常和链式思考、强化学习以及自我校验挂钩。
用户在界面上可能只看到最终结果,或者一段简化的思考路径,但在看不见的后台,模型其实已经疯狂计算了很久。
这种转变意义重大。以前,算力大头都花在模型“出厂”前的训练阶段,一旦练好,用户调用起来并不贵。但推理模型出现后,算力消耗的一部分转移到了用户交互的过程中。问题越复杂、推理步数越长、输出内容越多,推理成本就越高。
如果一家企业大规模用推理模型来处理合同、写代码、分析财务或者搞科学计算,那日常的运营成本会显著攀升。
一个请求,可能触发一串计算
拿办公场景举个例子。普通模型接到“总结会议纪要”的任务,可能只是压缩一下文字,列出要点。但推理型系统接到“根据纪要生成项目计划并检查风险”的任务时,它会:
- 先读懂纪要,识别出任务、负责人、时间点和依赖关系;
- 再去检索历史资料,判断资源是否冲突;
- 生成计划;
- 最后自查有没有遗漏。
这一个请求背后,可能触发了多次模型调用、检索和工具操作。每走一步,都是在烧钱。
这正是为什么 AI 智能体现在这么火。智能体不只是陪你聊天,它能根据目标自己规划步骤、调用工具、读文件、写代码、翻数据库,甚至操作软件,并根据反馈随时调整。它的能力越强,后台的计算量就越大。一个智能体忙活十分钟完成一项任务,背后可能调用了模型几十次。
当 AI 从简单的问答工具深度嵌入工作流,推理成本就不再是单次回答的小钱,而是整套任务的巨额开支。
算总账,要看哪些变量
判断一家 AI 公司的商业模式行不行,光盯着训练模型砸了多少钱是不够的,关键得看产品上线后,每个用户每天到底要烧掉多少成本。
算这笔总账,得拆开来看:用户输入的长度、模型吐出的字数、调用的频率、模型本身的大小、推理的深度,还有硬件的利用率和最终的定价。
这里头有个连锁反应:单价降下来了,大家就更爱用;用的人多了,对总算力的需求反而会被推得更高。 效率在提升,需求也在疯长,这两件事是并行的。
这正是算法和算力之间最微妙的关系:算法优化确实能让单次计算变便宜,但更聪明的推理模型会解锁更多高价值的场景,结果是总体的计算需求反而增加了。模型越便宜,企业就越敢把它接入各种业务;推理能力越强,用户抛出的任务就越复杂。到头来,算力需求未必会缩水,只是结构变了。
训练拼肌肉,推理拼性价比
训练算力拼的是大规模集群的肌肉,而推理算力更看重响应快不快、稳不稳、并发高不高,以及单位成本划不划算。
模型公司得学会“看菜下饭”:
- 简单的活儿交给小模型;
- 复杂的再请大模型出马;
- 敏感任务用专用模型;
- 长文本则交给擅长处理长上下文的模型。
未来的 AI 服务不会是一个“巨无霸”模型包打天下,而是一套由多种模型协作的复杂系统。
这种变化也在直接重塑硬件需求。训练离不开高端 GPU 集群,推理同样需要高性能设备,但推理的场景更零碎,对能耗、延迟和成本极其敏感。有些推理在云端跑,有些在企业本地服务器上,还有些直接钻进了手机、电脑、汽车和机器人里。这时候,端侧 AI 芯片、推理加速卡、低功耗模型和模型压缩技术,身价都会水涨船高。
软件工程也要跟着变
推理时代的到来,也会让软件工程变个样。企业不能只接一个聊天窗口就完事了,还得搭起权限控制、知识库、流程编排、日志审计、错误回退和人工复核这一整套体系。
一些实打实的问题必须回答:
- 模型答错了,谁来担责?
- 调用外部工具时,权限怎么锁死?
- 生成建议后,证据怎么留存?
这些问题的答案,决定了 AI 到底能在一个行业里扎多深。
Comments
Post a Comment