LLM Tokenizer详解2026:为什么你的提示词比想象中贵
Token数量总是不符合直觉:一个汉字可能值1-3个token,英文单词1-2个。搞懂tokenizer就搞懂了API账单、上下文上限和模型的各种怪行为。
💡 你将学到
Token数量总是不符合直觉:一个汉字可能值1-3个token,英文单词1-2个。搞懂tokenizer就搞懂了API账单、上下文上限和模型的各种怪行为。
LLM读文本前,tokenizer会把文本切成token(1到约6个字符的块),模型预测的是token不是字词,这一件事解释了你大部分API开销。惊人的数学:英文约0.75 token/词;中文约1.5-2 token/字,100字中文段落可能和300字英文一样贵;代码和JSON分词很差,压缩后的JSON可能花掉2-3倍字符数;emoji一个3个token起。被忽略的成本倍增器:system prompt每次请求都重发,2000 token的system prompt在1万请求/天下就是每天2000万token。上下文窗口按token算:128k模型大概装9万英文词,或只有6.4万汉字,本地化团队常在这里翻车。自查工具:OpenAI官网tokenizer、tiktoken库、Hugging Face tokenizers(transformers 16.3万星的基础库)。一条省钱的铁律:别发模型不需要的东西,激进裁剪对话历史、压缩JSON、把静态指令放进缓存。
相关文章
2026-08-08
Windows 11的隐藏Bug让C盘悄悄膨胀上百G,7月14日补丁才来
2026-08-05
标题:59.5GB给了核显!Intel新驱动把共享显存上限拉到93%
2026-08-01
微软免费开源了一个 Linux 操作系统,没错!是微软出品
