微软FARA:7B小模型接管鼠标键盘,桌面自动化不再烧钱烧Token

📡 AI新闻 💬 发布者: leakey
微软FARA:7B小模型接管鼠标键盘,桌面自动化不再烧钱烧Token

🩺 摘要

微软FARA:7B小模型接管鼠标键盘,桌面自动化不再烧钱烧Token 这件事有多"不按套路出牌" 微软最近搞了个叫 FARA 的东西,全称 Fara-7B,今天已经在 GitHub 开源了(5,680 Stars,涨得飞快)。 它长什么样?一句话:你的屏幕截图就是它的输入,你的鼠标键盘就是它的

📝 详情

微软FARA:7B小模型接管鼠标键盘,桌面自动化不再烧钱烧Token

01. 这件事有多"不按套路出牌"

微软最近搞了个叫 FARA 的东西,全称 Fara-7B,今天已经在 GitHub 开源了(5,680 Stars,涨得飞快)。

它长什么样?一句话:你的屏幕截图就是它的输入,你的鼠标键盘就是它的输出。

你告诉它"帮我订一张从西雅图到东京、低于 800 美元的机票",它自己打开浏览器、搜索航班、填表单、比价、下单。全程不需要你动一根手指。

这不是新闻里已经说过很多遍的"AI Agent"。重点在于——它只有 7B 参数

什么概念?你家电脑的集成显卡都能带得动。不用租云 GPU,不用烧 API Token,断网了一样跑。纯本地,零延迟,数据不出你的机器。

02. 靠截图"看"屏幕,反而比 GPT-4o 更管用

FARA 的核心技术选择非常反直觉。

它完全不做传统 RPA 那套——不读 HTML 源码、不用 Accessibility Tree、不依赖 DOM 结构。它只看屏幕截图。 每次截一张当前浏览器窗口的图,自己画出坐标,决定下一步点哪里、打什么字、滚多远。

这个"像素级"的做法,在行业内属于"笨办法"。主流 CUA(Computer Use Agent)通常走混合路线——截图 + 底层解析双保险。但 FARA 硬是靠一个 7B 小模型,单凭截图就干到了一个相当高的水平:

模型 参数量 WebVoyager 成功率
Fara-7B 7B 73.5%
OpenAI comp-use-preview 70.9%
UI-TARS-1.5-7B 7B 66.4%
GPT-4o (As Agent) 65.1%
GLM-4.1V-9B-Thinking 9B 66.8%

数据不会骗人。FARA 在 7B 这个尺寸上,跑赢了 GPT-4o 充当 Agent 的表现,甚至超过了 OpenAI 专为计算机操作优化的 CUA 模型。

更狠的是效率。FARA 完成一个任务平均只需要 16 步,而同样是 7B 的 UI-TARS-1.5-7B 需要 41 步。这意味着同样的任务,FARA 的推理成本只有对手的 40%。

那它的秘密是什么?不是模型架构创新,而是数据。 微软用 Magentic-One 多 Agent 框架,自己生成了一套 14.5 万条完整任务轨迹(总共 100 万步)的合成数据集,然后蒸馏到一个 7B 模型里。大模型当老师,小模型当学生——典型的"以小博大"路线。

03. 不是"什么都能干",而是"该停的时候停"

说完了亮点,说一说它做不到的事。

FARA 不是万能的。它在购物(52.4%)、订酒店(53.8%)、订机票(37.9%)等网页任务上表现不错,但到了"对比两个商品价格"这类复合型任务,成功率就掉到 32.7%。至于复杂的跨应用联动——目前只支持浏览器内操作,不能直接操控你的原生桌面 App。

但我认为这恰恰是 FARA 聪明的设计选择。

微软明确说:FARA 定位在"试玩和概念验证",不是生产级。 它没有用强化学习(RL)做进一步优化,只用了监督微调(SFT)。这意味着这个模型有很大的上升空间,而微软故意把"半成品"放出来,让社区一起喂数据。

另外,它内置了一个叫 Critical Points 的机制——在触发不可逆操作之前(比如发邮件、付款),模型会自动停下来问你要不要继续。这不是可有可无的功能。据 VentureBeat 报道,它在一套安全测试集上做到了 82% 的拒绝率。对于一个可以动你鼠标键盘的模型,这个数字比性能数字更重要。

04. 对个人用户意味着什么

一个 7B 的桌面自动化模型能跑在本地,这件事的冲击力被很多人低估了。

说白了,过去所有"AI 自动化"的落地障碍,FARA 全部扫清了:

  • 成本障碍:不用调云 API,Token 费用归零
  • 隐私障碍:屏幕截图不出你的电脑,合规压力大减
  • 延迟障碍:本地推理,响应时间从秒级降到百毫秒级
  • 门槛障碍:一条自然语言指令启动,不需要写任何脚本

对于开发者,你可以用 fara-cli 一条命令跑起来,配合 Playwright 指定浏览器环境。做了 GGUF 版本,LM Studio 或 Ollama 都能直接加载。Windows 用户建议通过 WSL2 跑。

对于普通用户,微软还推了 Magentic-UI——一个有图形界面的交互前端,甚至有个播放按钮让你看 AI 一步步操作的"回放"。如果你实在不想折腾本地部署,Azure Foundry 上也有托管版本,一行配置直接调用。

05. 个人观点:微软这步棋下得比看起来深

很多人觉得 FARA 只是微软又发了一个小模型。我不这么看。

这是微软对"Agent 形态"的一次战略定调。

过去一年,Agent 这个词被炒得太猛了。每个厂商都在做大模型 Agent 框架——LangChain、AutoGPT、CrewAI。但它们的共同问题是:太重。 动辄套一层几十万 Token 的 CoT 链,一个 Agent 跑一个简单任务,烧的钱比人工做还贵。

微软把路走反了——不堆大模型,堆数据质量。 用多 Agent 系统生成高质量的合成轨迹,然后蒸馏到 7B 模型里。这个思路的本质是:"让推理发生在数据准备阶段,执行时只需要一个轻量级模型。"

更关键的是,FARA 基于 Qwen2.5-VL-7B,MIT 协议完全开源。这意味着任何公司都可以拿它做定制、做二次开发,甚至嵌入自己的产品里。对比字节跳动的 UI-TARS(同样是 7B,同样瞄准 CUA),FARA 在 WebVoyager 上跑赢 7 个百分点,效率还翻倍。

我对行业的判断是:2026 年下半年,"小模型本地 Agent"会成为一个明确的品类。 大模型 Agent 适合企业级复杂编排,7B 小模型 Agent 适合个人桌面自动化、隐私敏感场景、离线环境。它们不冲突,而是分层。

微软的布局更聪明的地方在于——FARA 和它的 Phi-Silica 系列一脉相承。Copilot+ PC 已经有了本地 NPU 跑 SLM 的硬件基础。下一个 Windows 大版本里塞一个 FARA 变体进系统,让你对着桌面说"帮我把这三个月的报销单整理好发邮件",这种场景可能比我们想的来得快。

06. 你怎么看?

AI 接管鼠标键盘这件事,你是兴奋还是警惕?

一个能自动帮你填表单、比价、订票的 7B 小模型,你会装到电脑上试试,还是觉得"让 AI 碰我的文件不放心"?

来评论区聊聊。这是个立场问题,没有标准答案。

微软FARA:7B小模型接管鼠标键盘,桌面自动化不再烧钱烧Token

01. 这件事有多"不按套路出牌"

微软最近搞了个叫 FARA 的东西,全称 Fara-7B,今天已经在 GitHub 开源了(5,680 Stars,涨得飞快)。

它长什么样?一句话:你的屏幕截图就是它的输入,你的鼠标键盘就是它的输出。

你告诉它"帮我订一张从西雅图到东京、低于 800 美元的机票",它自己打开浏览器、搜索航班、填表单、比价、下单。全程不需要你动一根手指。

这不是新闻里已经说过很多遍的"AI Agent"。重点在于——它只有 7B 参数

什么概念?你家电脑的集成显卡都能带得动。不用租云 GPU,不用烧 API Token,断网了一样跑。纯本地,零延迟,数据不出你的机器。

02. 靠截图"看"屏幕,反而比 GPT-4o 更管用

FARA 的核心技术选择非常反直觉。

它完全不做传统 RPA 那套——不读 HTML 源码、不用 Accessibility Tree、不依赖 DOM 结构。它只看屏幕截图。 每次截一张当前浏览器窗口的图,自己画出坐标,决定下一步点哪里、打什么字、滚多远。

这个"像素级"的做法,在行业内属于"笨办法"。主流 CUA(Computer Use Agent)通常走混合路线——截图 + 底层解析双保险。但 FARA 硬是靠一个 7B 小模型,单凭截图就干到了一个相当高的水平:

模型 参数量 WebVoyager 成功率
Fara-7B 7B 73.5%
OpenAI comp-use-preview 70.9%
UI-TARS-1.5-7B 7B 66.4%
GPT-4o (As Agent) 65.1%
GLM-4.1V-9B-Thinking 9B 66.8%

数据不会骗人。FARA 在 7B 这个尺寸上,跑赢了 GPT-4o 充当 Agent 的表现,甚至超过了 OpenAI 专为计算机操作优化的 CUA 模型。

更狠的是效率。FARA 完成一个任务平均只需要 16 步,而同样是 7B 的 UI-TARS-1.5-7B 需要 41 步。这意味着同样的任务,FARA 的推理成本只有对手的 40%。

那它的秘密是什么?不是模型架构创新,而是数据。 微软用 Magentic-One 多 Agent 框架,自己生成了一套 14.5 万条完整任务轨迹(总共 100 万步)的合成数据集,然后蒸馏到一个 7B 模型里。大模型当老师,小模型当学生——典型的"以小博大"路线。

03. 不是"什么都能干",而是"该停的时候停"

说完了亮点,说一说它做不到的事。

FARA 不是万能的。它在购物(52.4%)、订酒店(53.8%)、订机票(37.9%)等网页任务上表现不错,但到了"对比两个商品价格"这类复合型任务,成功率就掉到 32.7%。至于复杂的跨应用联动——目前只支持浏览器内操作,不能直接操控你的原生桌面 App。

但我认为这恰恰是 FARA 聪明的设计选择。

微软明确说:FARA 定位在"试玩和概念验证",不是生产级。 它没有用强化学习(RL)做进一步优化,只用了监督微调(SFT)。这意味着这个模型有很大的上升空间,而微软故意把"半成品"放出来,让社区一起喂数据。

另外,它内置了一个叫 Critical Points 的机制——在触发不可逆操作之前(比如发邮件、付款),模型会自动停下来问你要不要继续。这不是可有可无的功能。据 VentureBeat 报道,它在一套安全测试集上做到了 82% 的拒绝率。对于一个可以动你鼠标键盘的模型,这个数字比性能数字更重要。

04. 对个人用户意味着什么

一个 7B 的桌面自动化模型能跑在本地,这件事的冲击力被很多人低估了。

说白了,过去所有"AI 自动化"的落地障碍,FARA 全部扫清了:

  • 成本障碍:不用调云 API,Token 费用归零
  • 隐私障碍:屏幕截图不出你的电脑,合规压力大减
  • 延迟障碍:本地推理,响应时间从秒级降到百毫秒级
  • 门槛障碍:一条自然语言指令启动,不需要写任何脚本

对于开发者,你可以用 fara-cli 一条命令跑起来,配合 Playwright 指定浏览器环境。做了 GGUF 版本,LM Studio 或 Ollama 都能直接加载。Windows 用户建议通过 WSL2 跑。

对于普通用户,微软还推了 Magentic-UI——一个有图形界面的交互前端,甚至有个播放按钮让你看 AI 一步步操作的"回放"。如果你实在不想折腾本地部署,Azure Foundry 上也有托管版本,一行配置直接调用。

05. 个人观点:微软这步棋下得比看起来深

很多人觉得 FARA 只是微软又发了一个小模型。我不这么看。

这是微软对"Agent 形态"的一次战略定调。

过去一年,Agent 这个词被炒得太猛了。每个厂商都在做大模型 Agent 框架——LangChain、AutoGPT、CrewAI。但它们的共同问题是:太重。 动辄套一层几十万 Token 的 CoT 链,一个 Agent 跑一个简单任务,烧的钱比人工做还贵。

微软把路走反了——不堆大模型,堆数据质量。 用多 Agent 系统生成高质量的合成轨迹,然后蒸馏到 7B 模型里。这个思路的本质是:"让推理发生在数据准备阶段,执行时只需要一个轻量级模型。"

更关键的是,FARA 基于 Qwen2.5-VL-7B,MIT 协议完全开源。这意味着任何公司都可以拿它做定制、做二次开发,甚至嵌入自己的产品里。对比字节跳动的 UI-TARS(同样是 7B,同样瞄准 CUA),FARA 在 WebVoyager 上跑赢 7 个百分点,效率还翻倍。

我对行业的判断是:2026 年下半年,"小模型本地 Agent"会成为一个明确的品类。 大模型 Agent 适合企业级复杂编排,7B 小模型 Agent 适合个人桌面自动化、隐私敏感场景、离线环境。它们不冲突,而是分层。

微软的布局更聪明的地方在于——FARA 和它的 Phi-Silica 系列一脉相承。Copilot+ PC 已经有了本地 NPU 跑 SLM 的硬件基础。下一个 Windows 大版本里塞一个 FARA 变体进系统,让你对着桌面说"帮我把这三个月的报销单整理好发邮件",这种场景可能比我们想的来得快。

06. 你怎么看?

AI 接管鼠标键盘这件事,你是兴奋还是警惕?

一个能自动帮你填表单、比价、订票的 7B 小模型,你会装到电脑上试试,还是觉得"让 AI 碰我的文件不放心"?

来评论区聊聊。这是个立场问题,没有标准答案。