Ubuntu 26.10 终于有自带语音转文字了,完全本地运行

💬 发布者: leakey
Ubuntu 26.10 终于有自带语音转文字了,完全本地运行

🩺 摘要

Ubuntu 26.10 终于有自带语音转文字了,完全本地运行 macOS 有 Voice Control,Windows 有 Voice Access。Linux 桌面在这一块,一直是真空区。 我不是说 Linux 上没有语音转文字工具——Speech Note、Whisper 自己跑,都能用

📝 详情

Ubuntu 26.10 终于有自带语音转文字了,完全本地运行

macOS 有 Voice Control,Windows 有 Voice Access。Linux 桌面在这一块,一直是真空区。

我不是说 Linux 上没有语音转文字工具——Speech Note、Whisper 自己跑,都能用。但系统级的、快捷键一按就有的那种原生体验,确实没有。

现在 Canonical 出手了。


01. Myna 是什么?

项目代号 Myna,取自八哥鸟——这种鸟以模仿人类语言著称。

核心功能一句话:按个快捷键,说话,文字出现在你正在用的应用里。

Ubuntu 26.10 "Stonking Stingray"(预计 2026 年 10 月发布)将首次搭载它。

不是什么花哨的 AI 语音助手。就是老老实实的听写——语音转文字,纯本地运行。

项目负责人 jibel 在 Ubuntu Discourse 里原话:

"For Ubuntu 26.10, we're deliberately focusing on the basics: a reliable desktop dictation."

先做好听写,再谈其他。


02. 隐私优先,不是 PPT

这套东西最让我放心的一点:隐私是设计原则,不是后期打补丁。

看一下他们的做法:

  • 语音识别模型跑在本地,不用互联网
  • 只有你主动开启听写时,麦克风才工作
  • 语音在内存中处理完就丢弃,不上传任何录音
  • 不需要网络,模型装好就离线可用

跟 macOS 的本地听写、Windows 的 Voice Access 一个逻辑。你的声音不出你的机器。

这在"AI 什么都要上云"的今天,算是一股清流了。


03. 架构:模块化,先锁 GNOME

Myna 的架构分三层:语音识别引擎、听写管理器、文本注入层。

这么设计的好处是:未来升级某一块,不用动整个系统。

初期只支持 Wayland + GNOME。道理很简单——Ubuntu 默认就是 GNOME,先把这套跑稳,再支持 KDE、Budgie 等其他桌面环境。

从工程角度看,这是对的。不要一上来就想覆盖所有人,先让默认用户用上。


04. 别想多了——Myna 不是什么

官方专门列了一张"本版本不做的事":

  • ❌ 语音助手("Hey Myna" 那种)
  • ❌ 语音控制桌面(说"打开浏览器"没反应)
  • ❌ 翻译或自动语种检测
  • ❌ 复杂场景

第一版就做一件事:按下快捷键 → 说话 → 出文字。

这种克制,说实话——很欣赏。 Linux 生态里太多项目"想着要做出个大平台",结果根本做不完。Myna 先锁 Scope 的做法,反而让人觉得能落地。


05. 社区声音怎么样?

Reddit 上的反应比较积极。

Ubuntu 分论坛里,用户 CobaltOne 直接说:

"我找了几个月了。系统级的内置功能,太棒了。"

当然也有声音觉得"Canonical 之前吹的 AI 计划是不是又要烂尾"——毕竟 Ubuntu Summit 上 Canonical 高调说了 AI 布局,大家等着看落地。

GitHub 仓库 canonical/myna 目前 33 个 Star,1 个 Fork,GPL-3.0 许可证。代码还没怎么放出来,目前只有架构文档和规划笔记。但仓库是 6 月 5 号创建的,距今也就两周,早期阶段合理。


06. 这跟普通用户有什么关系?

如果你是 Linux 桌面用户,这个功能的直接价值:

  • 做笔记、写文章的时候,口述比打字快 2-3 倍
  • 残障人士、手部不便的场景,系统级听写是刚需
  • 不需要为了语音输入去装第三方软件、配 API Key
  • 一切都离线,没有订阅费,没有隐私顾虑

别小看最后一条。语音转文字的 SaaS 产品(Otter.ai 等)一个月少说十几美金。Myna 是开源 + 免费的。


07. 个人观点:这事比看起来重要

Ubuntu 语音转文字这件事,从技术层面并不惊艳——Whisper、Speech Note 社区早就能跑。但从生态层面,这是一个信号。

第一,Linux 桌面在补"存在但不好用"的短板。HiDPI 缩放搞了十年才算稳,HDR 去年才开始推,语音输入这类基础能力,Windows 和 macOS 用户早当空气了,Linux 用户得自己搭。现在 Canonical 正式投入,说明他们真的把桌面体验当回事了。

第二,本地方向的选择。现在 AI 圈子最火的词是"Agent"、"多模态"、"云端推理"。Canonical 偏偏选了一个最不起眼的——语音转文字,还强调本地运行、不上传数据。这事放在大模型热浪里看,有点老派。但对用户来说,一个不联网、不消耗 GPU、稳定工作的听写工具,比 100 个云端 AI Agent 都实在

第三,别高兴太早。坦白说,Canonical 在桌面功能上画过饼——Ubuntu Phone、Mir 显示服务器、Unity 8——最终都没走通。这次 Myna 能不能在 Ubuntu 26.10 按时交付、体验稳不稳定,我希望它成,但我会等第一个 beta 版跑起来再说。


08. 你怎么看?

Linux 桌面原生语音输入,等了这么多年终于来了。你觉得 Canonical 这次能搞定吗?还是又是一个"发布了但没什么人用"的功能?

你觉得语音转文字对 Linux 桌面普及有多重要?来评论区聊聊。

Ubuntu 26.10 终于有自带语音转文字了,完全本地运行

macOS 有 Voice Control,Windows 有 Voice Access。Linux 桌面在这一块,一直是真空区。

我不是说 Linux 上没有语音转文字工具——Speech Note、Whisper 自己跑,都能用。但系统级的、快捷键一按就有的那种原生体验,确实没有。

现在 Canonical 出手了。


01. Myna 是什么?

项目代号 Myna,取自八哥鸟——这种鸟以模仿人类语言著称。

核心功能一句话:按个快捷键,说话,文字出现在你正在用的应用里。

Ubuntu 26.10 "Stonking Stingray"(预计 2026 年 10 月发布)将首次搭载它。

不是什么花哨的 AI 语音助手。就是老老实实的听写——语音转文字,纯本地运行。

项目负责人 jibel 在 Ubuntu Discourse 里原话:

"For Ubuntu 26.10, we're deliberately focusing on the basics: a reliable desktop dictation."

先做好听写,再谈其他。


02. 隐私优先,不是 PPT

这套东西最让我放心的一点:隐私是设计原则,不是后期打补丁。

看一下他们的做法:

  • 语音识别模型跑在本地,不用互联网
  • 只有你主动开启听写时,麦克风才工作
  • 语音在内存中处理完就丢弃,不上传任何录音
  • 不需要网络,模型装好就离线可用

跟 macOS 的本地听写、Windows 的 Voice Access 一个逻辑。你的声音不出你的机器。

这在"AI 什么都要上云"的今天,算是一股清流了。


03. 架构:模块化,先锁 GNOME

Myna 的架构分三层:语音识别引擎、听写管理器、文本注入层。

这么设计的好处是:未来升级某一块,不用动整个系统。

初期只支持 Wayland + GNOME。道理很简单——Ubuntu 默认就是 GNOME,先把这套跑稳,再支持 KDE、Budgie 等其他桌面环境。

从工程角度看,这是对的。不要一上来就想覆盖所有人,先让默认用户用上。


04. 别想多了——Myna 不是什么

官方专门列了一张"本版本不做的事":

  • ❌ 语音助手("Hey Myna" 那种)
  • ❌ 语音控制桌面(说"打开浏览器"没反应)
  • ❌ 翻译或自动语种检测
  • ❌ 复杂场景

第一版就做一件事:按下快捷键 → 说话 → 出文字。

这种克制,说实话——很欣赏。 Linux 生态里太多项目"想着要做出个大平台",结果根本做不完。Myna 先锁 Scope 的做法,反而让人觉得能落地。


05. 社区声音怎么样?

Reddit 上的反应比较积极。

Ubuntu 分论坛里,用户 CobaltOne 直接说:

"我找了几个月了。系统级的内置功能,太棒了。"

当然也有声音觉得"Canonical 之前吹的 AI 计划是不是又要烂尾"——毕竟 Ubuntu Summit 上 Canonical 高调说了 AI 布局,大家等着看落地。

GitHub 仓库 canonical/myna 目前 33 个 Star,1 个 Fork,GPL-3.0 许可证。代码还没怎么放出来,目前只有架构文档和规划笔记。但仓库是 6 月 5 号创建的,距今也就两周,早期阶段合理。


06. 这跟普通用户有什么关系?

如果你是 Linux 桌面用户,这个功能的直接价值:

  • 做笔记、写文章的时候,口述比打字快 2-3 倍
  • 残障人士、手部不便的场景,系统级听写是刚需
  • 不需要为了语音输入去装第三方软件、配 API Key
  • 一切都离线,没有订阅费,没有隐私顾虑

别小看最后一条。语音转文字的 SaaS 产品(Otter.ai 等)一个月少说十几美金。Myna 是开源 + 免费的。


07. 个人观点:这事比看起来重要

Ubuntu 语音转文字这件事,从技术层面并不惊艳——Whisper、Speech Note 社区早就能跑。但从生态层面,这是一个信号。

第一,Linux 桌面在补"存在但不好用"的短板。HiDPI 缩放搞了十年才算稳,HDR 去年才开始推,语音输入这类基础能力,Windows 和 macOS 用户早当空气了,Linux 用户得自己搭。现在 Canonical 正式投入,说明他们真的把桌面体验当回事了。

第二,本地方向的选择。现在 AI 圈子最火的词是"Agent"、"多模态"、"云端推理"。Canonical 偏偏选了一个最不起眼的——语音转文字,还强调本地运行、不上传数据。这事放在大模型热浪里看,有点老派。但对用户来说,一个不联网、不消耗 GPU、稳定工作的听写工具,比 100 个云端 AI Agent 都实在

第三,别高兴太早。坦白说,Canonical 在桌面功能上画过饼——Ubuntu Phone、Mir 显示服务器、Unity 8——最终都没走通。这次 Myna 能不能在 Ubuntu 26.10 按时交付、体验稳不稳定,我希望它成,但我会等第一个 beta 版跑起来再说。


08. 你怎么看?

Linux 桌面原生语音输入,等了这么多年终于来了。你觉得 Canonical 这次能搞定吗?还是又是一个"发布了但没什么人用"的功能?

你觉得语音转文字对 Linux 桌面普及有多重要?来评论区聊聊。