Web LLM(1.9万星)浏览器端推理2026:直接在浏览器里跑Llama和Qwen

📘 教程 2026-08-06 约 4 分钟阅读

WebLLM(18,517星)借助WebGPU让大模型完全跑在浏览器里——没有服务器、不需要API Key。本文教你几分钟内在客户端加载Llama和Qwen。

💡 你将学到

WebLLM(18,517星)借助WebGPU让大模型完全跑在浏览器里——没有服务器、不需要API Key。本文教你几分钟内在客户端加载Llama和Qwen。

📜 目录

直接给结论

mlc-ai/web-llm(18,517星,TypeScript)是基于WebGPU的高性能浏览器端大模型推理引擎。它把你的浏览器标签页变成一台本地GPU服务器:模型跑在用户自己的硬件上,没有服务器成本、数据不出设备、也不需要API Key。

浏览器推理的价值

快速开始(npm)

npm install @mlc-ai/web-llm
import * as webllm from "@mlc-ai/web-llm";
const engine = await webllm.CreateEngine("Llama-3.1-8B-Instruct-q4f16_1-MLC");
const reply = await engine.chat.completions.create({
  messages: [{ role: "user", content: "用一句话解释WebGPU" }]
});
console.log(reply.choices[0].message.content);

首次加载需要下载模型(8B量化版约几个GB)并用WebGPU编译,之后再次打开只需几秒。Qwen2.5-0.5B/1.5B这类小模型在笔记本上非常流畅。

实用注意事项

FAQ

真的免费吗? 是的——算力发生在访客设备上,你每个请求都不用花钱。

支持哪些模型? Llama、Qwen、Phi、Gemma等,都有预编译的WebGPU优化版本。

Safari能用吗? WebGPU支持在改进中;老浏览器请回退到服务端接口。

相关文章

❓ 常见问题

Is it really free?

Yes - compute happens on the visitor device. You pay nothing per request.

Which models are supported?

Llama, Qwen, Phi, Gemma and more, with prebuilt WebGPU-optimized checkpoints.

What about Safari?

WebGPU support is improving; for older browsers, fall back to a server-side endpoint.

相关文章
2026-08-01
OpenCode安装指南2026
2026-07-19
TensorRT-LLM教程:NVIDIA官方推理加速
2026-07-14
零成本本地AI编程:Ollama + Continue.dev 从零搭建(Mac/Windows/Linux全平台)

本站文章由编辑人工撰写,收录的工具均经过实测或公开资料核验。文中链接指向工具官网或 GitHub 仓库,仅作信息参考,不构成付费推广。

💬 评论 (0)

暂无评论,来说两句吧~

登录后评论