Web LLM(1.9万星)浏览器端推理2026:直接在浏览器里跑Llama和Qwen
WebLLM(18,517星)借助WebGPU让大模型完全跑在浏览器里——没有服务器、不需要API Key。本文教你几分钟内在客户端加载Llama和Qwen。
💡 你将学到
WebLLM(18,517星)借助WebGPU让大模型完全跑在浏览器里——没有服务器、不需要API Key。本文教你几分钟内在客户端加载Llama和Qwen。
直接给结论
mlc-ai/web-llm(18,517星,TypeScript)是基于WebGPU的高性能浏览器端大模型推理引擎。它把你的浏览器标签页变成一台本地GPU服务器:模型跑在用户自己的硬件上,没有服务器成本、数据不出设备、也不需要API Key。
浏览器推理的价值
- 零基础设施:没有后端、不用租GPU、没有按token计费
- 天生隐私:提示词永远不出设备
- 可离线:模型下载完成后无网络也能用
- 免费扩容:每个访客自带算力
快速开始(npm)
npm install @mlc-ai/web-llm
import * as webllm from "@mlc-ai/web-llm";
const engine = await webllm.CreateEngine("Llama-3.1-8B-Instruct-q4f16_1-MLC");
const reply = await engine.chat.completions.create({
messages: [{ role: "user", content: "用一句话解释WebGPU" }]
});
console.log(reply.choices[0].message.content);
首次加载需要下载模型(8B量化版约几个GB)并用WebGPU编译,之后再次打开只需几秒。Qwen2.5-0.5B/1.5B这类小模型在笔记本上非常流畅。
实用注意事项
- 需要支持WebGPU的浏览器(Windows/Mac的Chrome/Edge,Linux需开flag)。
- 模型下载体积大——做好进度UI,并用IndexedDB缓存。
- 8B以上模型建议16GB内存;0.5B-1.5B小模型手机也能跑。
FAQ
真的免费吗? 是的——算力发生在访客设备上,你每个请求都不用花钱。
支持哪些模型? Llama、Qwen、Phi、Gemma等,都有预编译的WebGPU优化版本。
Safari能用吗? WebGPU支持在改进中;老浏览器请回退到服务端接口。
相关文章
2026-06-29
高收益主线龙头策略——不花钱的数据,也能抓到龙头
2026-06-29
你笔记本里,藏着一个AI
2026-07-14
免费AI编程助手 2026 配置指南:VS Code 5分钟装 Continue、Copilot、Windsurf
