Ubuntu 26.10 终于有自带语音转文字了,完全本地运行

💬 Posted by: leakey
Ubuntu 26.10 终于有自带语音转文字了,完全本地运行

🩺 Summary

Ubuntu 26.10 终于有自带语音转文字了,完全本地运行 macOS 有 Voice Control,Windows 有 Voice Access。Linux 桌面在这一块,一直是真空区。 我不是说 Linux 上没有语音转文字工具——Speech Note、Whisper 自己跑,都能用

📝 Details

Ubuntu 26.10 终于有自带语音转文字了,完全本地运行

macOS 有 Voice Control,Windows 有 Voice Access。Linux 桌面在这一块,一直是真空区。

我不是说 Linux 上没有语音转文字工具——Speech Note、Whisper 自己跑,都能用。但系统级的、快捷键一按就有的那种原生体验,确实没有。

现在 Canonical 出手了。


01. Myna 是什么?

项目代号 Myna,取自八哥鸟——这种鸟以模仿人类语言著称。

核心功能一句话:按个快捷键,说话,文字出现在你正在用的应用里。

Ubuntu 26.10 "Stonking Stingray"(预计 2026 年 10 月发布)将首次搭载它。

不是什么花哨的 AI 语音助手。就是老老实实的听写——语音转文字,纯本地运行。

项目负责人 jibel 在 Ubuntu Discourse 里原话:

"For Ubuntu 26.10, we're deliberately focusing on the basics: a reliable desktop dictation."

先做好听写,再谈其他。


02. 隐私优先,不是 PPT

这套东西最让我放心的一点:隐私是设计原则,不是后期打补丁。

看一下他们的做法:

  • 语音识别模型跑在本地,不用互联网
  • 只有你主动开启听写时,麦克风才工作
  • 语音在内存中处理完就丢弃,不上传任何录音
  • 不需要网络,模型装好就离线可用

跟 macOS 的本地听写、Windows 的 Voice Access 一个逻辑。你的声音不出你的机器。

这在"AI 什么都要上云"的今天,算是一股清流了。


03. 架构:模块化,先锁 GNOME

Myna 的架构分三层:语音识别引擎、听写管理器、文本注入层。

这么设计的好处是:未来升级某一块,不用动整个系统。

初期只支持 Wayland + GNOME。道理很简单——Ubuntu 默认就是 GNOME,先把这套跑稳,再支持 KDE、Budgie 等其他桌面环境。

从工程角度看,这是对的。不要一上来就想覆盖所有人,先让默认用户用上。


04. 别想多了——Myna 不是什么

官方专门列了一张"本版本不做的事":

  • ❌ 语音助手("Hey Myna" 那种)
  • ❌ 语音控制桌面(说"打开浏览器"没反应)
  • ❌ 翻译或自动语种检测
  • ❌ 复杂场景

第一版就做一件事:按下快捷键 → 说话 → 出文字。

这种克制,说实话——很欣赏。 Linux 生态里太多项目"想着要做出个大平台",结果根本做不完。Myna 先锁 Scope 的做法,反而让人觉得能落地。


05. 社区声音怎么样?

Reddit 上的反应比较积极。

Ubuntu 分论坛里,用户 CobaltOne 直接说:

"我找了几个月了。系统级的内置功能,太棒了。"

当然也有声音觉得"Canonical 之前吹的 AI 计划是不是又要烂尾"——毕竟 Ubuntu Summit 上 Canonical 高调说了 AI 布局,大家等着看落地。

GitHub 仓库 canonical/myna 目前 33 个 Star,1 个 Fork,GPL-3.0 许可证。代码还没怎么放出来,目前只有架构文档和规划笔记。但仓库是 6 月 5 号创建的,距今也就两周,早期阶段合理。


06. 这跟普通用户有什么关系?

如果你是 Linux 桌面用户,这个功能的直接价值:

  • 做笔记、写文章的时候,口述比打字快 2-3 倍
  • 残障人士、手部不便的场景,系统级听写是刚需
  • 不需要为了语音输入去装第三方软件、配 API Key
  • 一切都离线,没有订阅费,没有隐私顾虑

别小看最后一条。语音转文字的 SaaS 产品(Otter.ai 等)一个月少说十几美金。Myna 是开源 + 免费的。


07. 个人观点:这事比看起来重要

Ubuntu 语音转文字这件事,从技术层面并不惊艳——Whisper、Speech Note 社区早就能跑。但从生态层面,这是一个信号。

第一,Linux 桌面在补"存在但不好用"的短板。HiDPI 缩放搞了十年才算稳,HDR 去年才开始推,语音输入这类基础能力,Windows 和 macOS 用户早当空气了,Linux 用户得自己搭。现在 Canonical 正式投入,说明他们真的把桌面体验当回事了。

第二,本地方向的选择。现在 AI 圈子最火的词是"Agent"、"多模态"、"云端推理"。Canonical 偏偏选了一个最不起眼的——语音转文字,还强调本地运行、不上传数据。这事放在大模型热浪里看,有点老派。但对用户来说,一个不联网、不消耗 GPU、稳定工作的听写工具,比 100 个云端 AI Agent 都实在

第三,别高兴太早。坦白说,Canonical 在桌面功能上画过饼——Ubuntu Phone、Mir 显示服务器、Unity 8——最终都没走通。这次 Myna 能不能在 Ubuntu 26.10 按时交付、体验稳不稳定,我希望它成,但我会等第一个 beta 版跑起来再说。


08. 你怎么看?

Linux 桌面原生语音输入,等了这么多年终于来了。你觉得 Canonical 这次能搞定吗?还是又是一个"发布了但没什么人用"的功能?

你觉得语音转文字对 Linux 桌面普及有多重要?来评论区聊聊。