AI推理2026:它是什么、为什么烧钱、怎么变便宜
人人都说推理是AI开支的未来——云厂商在它上面建起整个业务。但推理到底是什么,为什么一次API调用就要花钱?这里是白话版。
💡 你将学到
人人都说推理是AI开支的未来——云厂商在它上面建起整个业务。但推理到底是什么,为什么一次API调用就要花钱?这里是白话版。
一句话讲清推理
推理就是运行训练好的模型产生输出——模型'思考'的那一刻。训练一次性构建权重、成本巨大;推理每次有人提问都用这些权重。两者都要GPU;推理需要它们全天候运行。
为什么烧钱
模型训练完不会缩小。服务70B模型光权重就要约140GB内存——大约两张A100级显卡,24/7运行,有没有人问都一样。这是固定成本。然后每个请求加算力:对全部上下文做注意力,每个生成的token都要。
三个成本驱动
内存:权重必须住在VRAM里。模型越大=GPU越多=地板成本越高。每token算力:每个生成的token都要一次完整前向传播。长答案比短答案贵。上下文窗口:注意力成本随输入长度增长,128K token的提示词比2K的贵得多。
2026怎么变便宜
量化:4-bit权重(GGUF、AWQ)省约4倍内存、质量损失可控。llama.cpp(123,466星)在48GB上跑70B级模型。批处理:多个请求一起服务摊薄内存。vLLM(88,784星)的连续批处理是开源模型单价崩盘的原因。投机解码:小草稿模型提token、大模型并行验证——最多2-3倍吞吐。更小的模型:调好的7B在多数真实任务上胜过粗糙的70B,成本只是零头。
关键数字
24GB卡(RTX 4090级)上,vLLM服务7B量化模型聚合约1500-3000 token/秒——够几十个并发用户。同一张卡根本装不下70B。这一件事驱动了2026年大部分架构决策。
实用规则
模型大小合适:通过你评估的最便宜模型就是正确模型。先量化再扩容:4-bit在买更多GPU之前就砍掉一半GPU账单。积极批处理:能容忍延迟的负载(摘要、批量任务)服务起来几乎免费。盯上下文:裁剪提示词,每个浪费的token都是付了钱的算力。
FAQ
推理和训练谁贵? 训练每小时更贵;推理总量更贵,因为它永不停止。 推理能跑CPU吗? 能,慢——llama.cpp支持CPU,适合原型不适合并发用户。 API账单为什么飙升? 先查提示词长度、模型大小和重试逻辑——多数应用的前三大原因。
