AI推理基础设施2026:GPU、内存与让模型变快的技术栈
为什么一个团队serve同一个模型比另一个快10倍?通常不是GPU——是它周围的基础设施。这里是推理栈,从硅片到调度器,以及真正的瓶颈住在哪。
💡 你将学到
为什么一个团队serve同一个模型比另一个快10倍?通常不是GPU——是它周围的基础设施。这里是推理栈,从硅片到调度器,以及真正的瓶颈住在哪。
技术栈,从上到下
推理基础设施有五层,多数优化收益来自上面三层,而不是买新硬件(星数2026-08-12获取)。
第一层:模型格式。量化权重(GGUF、AWQ、GPTQ)省2-4倍内存。llama.cpp(123,466星)和它的GGUF格式让70B级模型能跑在单台工作站上。
第二层:推理引擎。vLLM(88,784星)的PagedAttention和连续批处理是默认;SGLang(31,684星)在某些结构化负载上赢。两者都比朴素的Transformers generate()循环快5-20倍。
第三层:调度器。连续批处理——槽位空出就把请求塞上GPU——是最大的吞吐杠杆。这层在引擎里,所以别自己手写服务。
第四层:硬件。VRAM大小决定装得下什么;内存带宽决定token速度。7B-13B模型,24GB消费级GPU是性价比甜点。70B以上要2张48GB专业卡或量化加耐心。
第五层:网络。单节点服务无关紧要;多节点时NVLink/InfiniBand带宽变成约束。
真实瓶颈排序
内存带宽第一——每秒token数由权重从VRAM流出的速度决定,不是算力。这就是量化提速的原因,不只省空间。VRAM容量第二——决定哪个模型装得下。批量效率第三——决定一张GPU服务多少用户。延迟尾部第四——聊天看p99,调度器和队列深度控制它。
靠谱参考配置(2026)
7B模型一张RTX 4090(24GB)、vLLM、GGUF或AWQ 4-bit:50-200并发用户、聚合约1500-3000 tok/s。70B模型两张48GB专业卡、vLLM张量并行:几十个用户、约500-1000 tok/s。省钱方案:租不买——2026年4090约每小时0.30-0.50美元。
造成10倍差距的错误
用朴素Transformers代码而不是引擎服务(5-20倍损失)。不批处理(负载下吞吐崩盘)。上下文窗口过大(注意力成本随输入超线性增长)。量化之前先买GPU(4-bit常常砍半机群)。
FAQ
推理最重要的规格? 内存带宽第一,VRAM容量第二。生成token时算力最不重要。 CPU还是GPU? 并发一律GPU;CPU(llama.cpp)只适合单用户或离线负载。 一张GPU能服务多少用户? 24GB卡配7B 4-bit模型加vLLM,通常50-200并发,看上下文长度。
