Web LLM(1.9万星)浏览器端推理2026:直接在浏览器里跑Llama和Qwen

📘 教程 2026-08-06 约 4 分钟阅读

WebLLM(18,517星)借助WebGPU让大模型完全跑在浏览器里——没有服务器、不需要API Key。本文教你几分钟内在客户端加载Llama和Qwen。

💡 你将学到

WebLLM(18,517星)借助WebGPU让大模型完全跑在浏览器里——没有服务器、不需要API Key。本文教你几分钟内在客户端加载Llama和Qwen。

直接给结论

mlc-ai/web-llm(18,517星,TypeScript)是基于WebGPU的高性能浏览器端大模型推理引擎。它把你的浏览器标签页变成一台本地GPU服务器:模型跑在用户自己的硬件上,没有服务器成本、数据不出设备、也不需要API Key。

浏览器推理的价值

快速开始(npm)

npm install @mlc-ai/web-llm
import * as webllm from "@mlc-ai/web-llm";
const engine = await webllm.CreateEngine("Llama-3.1-8B-Instruct-q4f16_1-MLC");
const reply = await engine.chat.completions.create({
  messages: [{ role: "user", content: "用一句话解释WebGPU" }]
});
console.log(reply.choices[0].message.content);

首次加载需要下载模型(8B量化版约几个GB)并用WebGPU编译,之后再次打开只需几秒。Qwen2.5-0.5B/1.5B这类小模型在笔记本上非常流畅。

实用注意事项

FAQ

真的免费吗? 是的——算力发生在访客设备上,你每个请求都不用花钱。

支持哪些模型? Llama、Qwen、Phi、Gemma等,都有预编译的WebGPU优化版本。

Safari能用吗? WebGPU支持在改进中;老浏览器请回退到服务端接口。

相关文章
2026-06-29
高收益主线龙头策略——不花钱的数据,也能抓到龙头
2026-06-29
你笔记本里,藏着一个AI
2026-07-14
免费AI编程助手 2026 配置指南:VS Code 5分钟装 Continue、Copilot、Windsurf

💬 评论 (0)

暂无评论,来说两句吧~

登录后评论