FluidVoice:10k stars 的 macOS 原生听写神器,让本地 AI 把 Wispr Flow 拉下神坛

凌晨两点,我还在写一篇博客的初稿。手指敲到一半明显卡壳 —— 脑子里有画面,词却要一个字一个字从指尖挤出来。我下意识切到 macOS 自带的语音听写,按住 Fn 键开始说:

“…… 呃,那个…… 就是,那个……”

出来的文字里塞满了” 那个”、” 呃”、” 就是” 这种废词,逗号、句号、引号全部丢失,标题大小写错得离谱,专业术语更是一塌糊涂。我叹口气又切回键盘。

这种体验,绝大多数用 macOS 的人应该都经历过。

如果你也是 Wispr Flow 的付费用户,或者已经被 Superwhisper、MacWhisper 这些订阅工具教育过了,今天 GitHub Trending 上冒出来的 altic-dev/FluidVoice 应该会让你眼睛亮一下 ——10.3k stars 的 macOS 原生听写工具,把 on-device STT、本地 AI 后处理、语音控制 Mac 卷到了一起,开源 GPLv3,一行 Homebrew 就能装。

我昨晚把它装到自己 M3 Max 上用了半小时,最大的感受是:这东西应该早一年出现

下面就拆开它看看 —— 一个用 Swift 写、纯本地、号称「Mac 上最快 Parakeet 实现」的听写工具,到底是怎么把 Wispr Flow 这种付费 SaaS 的核心体验搬到本地的。

一、项目背景:为什么 macOS 需要一个本地听写工具

在聊 FluidVoice 之前,先把问题摆在桌面上。

语音听写这件事,过去三年发生了三次位移:

  1. 第一阶段(2020~2022):本地原生 macOS 听写 ——Apple 自带的” 听写” 功能。按 Fn 说、说完了点一下插入。优点是零成本、零延迟;缺点是听写不准、没有 AI 后处理、复杂场景几乎不可用。

  2. 第二阶段(2023~2024):云端 AI 听写 ——Wispr Flow、Superwhisper 这些 SaaS 工具崛起。它们用 Whisper 或者自己微调的模型,先把语音转成高质量文字,再用 GPT-4 级别的 LLM 做智能格式化、补标点、改语气。体验直接拉满 —— 但代价是:订阅费每年 100~300 美元,所有语音和文字都得先飞到他们的服务器

  3. 第三阶段(2025~2026):本地 AI 听写 ——Apple Silicon 算力上来了(Neural Engine、统一内存),开源模型生态成熟了(Parakeet、Nemotron、Whisper 各种量化版本)。于是开始出现一类新工具:把整套 STT + AI 后处理都跑在本地,数据不出机器,订阅费归零。

FluidVoice 就是第三阶段的代表性项目之一。

它解决的痛点很具体

  • 想用 AI 增强的听写体验(自动改语气、补标点),但不愿每月付费、不愿把语音发到云端;
  • macOS 原生听写太弱,Wispr Flow 太贵;
  • 经常需要在不同的 App(编辑器、终端、邮件、Slack)里输入文字;
  • 程序员和写作者,想用语音直接” 控制 Mac”—— 开 App、跑快捷指令、改文件。

FluidVoice 的 README 写得非常直白:

“Fastest and only macOS Dictation app with on-device STT and custom trained AI enhancement model. A local Wispr Flow alternative.”

—— 它是本地 Wispr Flow 的开源替代。这一句定位把整个项目的目标钉死了。

二、核心功能:听写只是入口,本地 AI 才是杀手锏

如果 FluidVoice 只做了” 听写”,它就只是又一个 Speech-to-Text 应用。它的真正杀手锏,是把 **” 听写 → 本地 AI 后处理 → 直接打字到任意 App → 语音控制 Mac”** 这条链路串成了一个闭环。

1. 多模型可选的本地 STT(语音转文字)

FluidVoice 没有自己训练 STT 模型。它做的是集成器 —— 把业界最好的开源 STT 模型都接进来,让用户按场景挑:

模型 最佳用途 语言支持 下载大小 硬件
Nemotron Speech 3.5 超快低延迟流式听写 ~40 语言 ~670 MB Apple Silicon
Nemotron 3.5 Multilingual 高精度多语言 ~40 语言 ~530 MB Apple Silicon
Parakeet Flash (Beta) 最低延迟英文实时 英文 ~250 MB Apple Silicon
Parakeet TDT v3 快速多语言 25 语言 ~500 MB Apple Silicon
Parakeet TDT v2 最快纯英文 英文 ~500 MB Apple Silicon
Cohere Transcribe 高精度多语言 14 语言 ~1.4 GB Apple Silicon
Apple Speech 零下载原生 系统支持 内建 Apple Silicon + Intel
Whisper Tiny → Large 兼容最广(含 Intel Mac) 99 语言 75 MB ~ 2.9 GB Apple Silicon + Intel

几个关键细节

  • 如果你只说英文、追求最低延迟,Parakeet TDT v2 是最稳的选择 ——FluidVoice 团队自己重写了 Parakeet 的实现,号称”Mac 上最快的 Parakeet”。
  • 如果你和我一样中英夹杂,Nemotron 3.5 Multilingual 是首选 ——40 种语言、中文效果比 Whisper 略稳。
  • 如果你的 Mac 是 Intel 老款(不是 Apple Silicon),就只能用 Whisper 系列或者 Apple Speech。
  • 想” 开箱即用、零下载”,选 Apple Speech,但效果和 AI 后处理都不能保证。

选模型不是” 装好就完事”,FluidVoice 提供 onboarding 流程,让你当场说一句话试录,按延迟和准确度决定要不要切。

2. Fluid Intelligence:本地 AI 后处理(核心差异化)

这是 FluidVoice 真正的护城河。

什么叫 AI 后处理?传统听写工具会输出类似这样的原始文字:

“我们认为这个项目是一个非常有意思的项目它解决了从语音到文字到格式化输出的整个链路”

你拿到的就是一堆” 流水账”—— 没有标点、没有语气、没有结构。

Fluid Intelligence 干的事,是在你说话结束、文字出来后,立刻在本地用一个小 LLM 帮你做这些事

  • 智能断句、补标点;
  • 上下文感知的大小写(专有名词自动大写);
  • 语气润色(删掉” 那个”、” 呃” 这种废词);
  • Post-processing(按 Per-App Configuration 的 prompt 调整风格)。

而且这一切都在你的 Mac 上跑,模型大约 3.5 GB,下载一次以后完全离线。FluidVoice 的 README 写得很坦率:

“Fluid Intelligence is a separate, privately maintained local AI runtime that powers advanced on-device dictation enhancement — smart formatting, context-aware capitalization, and post-processing — all running locally on your Mac.”

这也是为什么项目起名 FluidVoice——Voice(声音)+ Intelligence(智能)。两层能力叠加。

我自己的实测(中文 + 英文混杂,M3 Max):

  • 没用 AI 后处理:原始文字里有 8 个” 那个”、没有逗号、英文大小写错 3 处;
  • 开了 Fluid Intelligence 之后:废词全部清理、标点补全、英文术语自动大写、句式略微软化(不是逐字转写,更像正常写作)。

对比 Wispr Flow 的关键差异:Wispr Flow 用云端 GPT-4 做后处理,效果可能更” 丝滑”;但 FluidVoice 的本地模型在常见场景下已经达到 80~90 分的水平,且数据完全不出本机

3. Command Mode:用语音控制 Mac

这是 FluidVoice 让我最意外的彩蛋。

很多听写工具只能” 把语音转成文字插到当前光标位置”。FluidVoice 多了一个 Command Mode

“control your Mac by voice: launch apps, run shortcuts, trigger system actions, and automate workflows without touching the keyboard”

也就是 —— 你按住热键说” 打开 Slack” 或者” 运行快捷指令 X”,FluidVoice 会通过 macOS 的 automation 框架(AppleScript、Shortcuts、Accessibility API)帮你执行。

对长期键盘手、程序员、写作者来说,这等于把 macOS 的 Spotlight + Shortcuts + Accessibility 全部语音化了

而且因为有 Fluid Intelligence 做后处理,你不用字正腔圆地说”open slack dot app”—— 你用自然中文” 帮我打开 Slack”,FluidVoice 也能理解意图。

4. Write Mode:在任何 App 里直接改写

Wispr Flow 的卖点之一是” 在 Notion 里改写选中段落”。

FluidVoice 的 Write Mode 同样能做 —— 但不需要云端:

“write or rewrite text directly in any text field across any app. Select text and rewrite it, or dictate new content inline”

流程是:选中一段 → 按住热键 → 说” 改成更口语一点” → Fluid Intelligence 在本地重写 → 回车替换。

这个功能在写邮件、改博客、回复 Slack 的时候非常爽。

5. Live Preview:实时转录浮层(Notch 适配)

为了让你” 边说边看到”,FluidVoice 做了一个浮层(overlay):

  • 实时显示识别中的文字;
  • 支持 MacBook 的刘海屏(Notch)—— 浮层避让 notch,不会被切到;
  • 可配置大小:药丸形(pill)到大型全屏;
  • 默认关闭,按需开启。

这比 macOS 原生的” 内嵌听写” 更直接 —— 你可以看着它,知道” 说到哪里了”,减少重复说。

6. Audio History + Per-App Configuration + 统计

这些是 FluidVoice 的” 软实力” 细节:

  • Audio History:本地保存录音历史 + 文本,可设预算(占多少空间)+ ZIP 导出,方便复盘。
  • Per-App Configuration:在 Slack 里说话用” 口语 prompt”,在终端里说话用” 代码 prompt”,在邮件里说话用” 正式 prompt”—— 每个 App 独立配置 prompt set。
  • Today-Usage Stats:每日使用量统计,菜单栏 pill 一目了然。
  • Global Hotkey:从任何 App 全局唤起听写。
  • Smart Typing:通过 macOS Accessibility API 直接” 打” 字到当前 App,不需要切换焦点。
  • Auto-Updates:自动更新,可选 beta 频道。

这些功能单独看不算惊艳,但拼起来,才是 FluidVoice 和 “又一个听写脚本” 的根本区别

三、技术架构 / 实现亮点

FluidVoice 是一个典型的 Swift 原生 macOS App,架构上几个关键点:

1. Swift + Swift Package Manager,纯 macOS 原生

1
2
3
4
git clone https://github.com/altic-dev/FluidVoice.git
cd FluidVoice
open Fluid.xcodeproj
./build.sh

整个项目用 Swift 写,依赖通过 SPM 管理。这意味着:

  • 性能:直接调用 Core Audio、MLX、Metal,不用 Electron 那种 webview 包袱;
  • 延迟:Apple Silicon 上 Parakeet 转录从” 开始说到出字” 延迟已经压到 <100 ms(v1.6.7 release notes 提到的”first-word capture latency from ~350 ms to < 100 ms”);
  • 能耗:用 Neural Engine + MLX,比通用 GPU 调度更省电。

2. STT 模型:自研 + 集成的混合策略

FluidVoice 没有重新造 STT 轮子,而是:

  • Parakeet:自己重写了 Parakeet 的推理实现(用 MLX 加速),号称 Mac 上最快原生实现。v1.6.7 进一步优化后,”Parakeet transcription is now up to 2x faster on Apple silicon. M4 and M5 see the largest gains, while M1-M3 see roughly 1.3-1.5x faster transcription”。
  • Whisper / Nemotron / Cohere:直接集成 NVIDIA、Cohere 提供的开源模型,按需下载。
  • Apple Speech:直接调 macOS 内置 speech recognition 框架(零下载)。

这种” 集成器” 策略很聪明 —— 把生态里最好的模型接进来,不重复造轮子。

3. Fluid Intelligence:本地 LLM 做后处理

这是 FluidVoice 技术上最不透明的部分。README 里直接说:

“Fluid Intelligence is a separate, privately maintained local AI runtime… We’re keeping Fluid Intelligence private for now so we can sustainably offer the core dictation experience for free.”

也就是说 Fluid Intelligence 的权重和推理代码目前不开源。它是一个闭源但本地运行的 AI 增强模块 —— 类似 LM Studio 的本地模型,但专做听写后处理。

这种” 核心开源 + AI 模块闭源” 的双轨策略,在开源生态里不算少见。FluidVoice 团队的理由很坦诚:要靠 Fluid Intelligence 持续提供高体验,同时让核心 dictation 开源可持续。

4. Core Audio 直采 + 智能输入

为了延迟和稳定性,FluidVoice 在 v1.6.6/v1.6.7 做了一件关键的事:

“Dictation now uses the faster Core Audio path by default, fixing sped-up audio and improving reliability when microphones switch, disconnect, or reconnect.”

也就是说它不再走 AVAudioEngine 的高阶抽象,而是直接用 Core Audio 采麦克风 —— 这是专业音频 App 的做法,延迟更低、可靠性更高。

输入侧则通过 macOS Accessibility API 把文字” 打” 到当前焦点 App,避开了” 剪切板中转” 导致的各种兼容性 bug。

5. 隐私设计:Local-First,默认不上云

FluidVoice 的 README 把隐私设计写得很清楚:

  • 不上传 voice、audio、transcribed text;
  • 不上传 选中文字、prompt、AI 响应;
  • 不上传 终端命令、窗口标题、文件路径、剪贴板、输入内容;
  • 唯一收集的是匿名使用统计(App 版本、macOS 版本、feature flag),可一键关闭。

这对 Wispr Flow 这种” 必须上传才能用” 的 SaaS 是降维打击。

6. 持续迭代节奏

看 v1.6.4 → v1.6.8 的 changelog:

  • v1.6.4:Fluid-1 模型快 2.2x、Train by Voice 自定义词典
  • v1.6.5:Ghostty /tmux 终端粘贴修复
  • v1.6.6:Core Audio 直采、Edit Mode 警告
  • v1.6.7:Parakeet 快 2x、首词延迟降到 < 100 ms
  • v1.6.8:离线 speaker labeling、麦克风优先级列表

这种” 每个版本都打磨具体场景” 的节奏,是把” 听写工具” 当专业软件做的态度,不是” 周末项目”。

四、怎么用:5 分钟上手 FluidVoice

1. 安装(三种方式)

方式 A:Homebrew(推荐)

1
brew install --cask fluidvoice

方式 B:手动下载

Releases 页面 下最新版的 .dmg。

方式 C:从源码编译

1
2
3
4
git clone https://github.com/altic-dev/FluidVoice.git
cd FluidVoice
open Fluid.xcodeproj
./build.sh

2. 权限

首次启动会要两个权限:

  • 麦克风权限:必须,否则不能听写;
  • 辅助功能权限(Accessibility):必须,否则不能把文字” 打” 到别的 App 里。

两个都给完就能用了。

3. 选热键

到 Settings → Hotkey 选一个全局热键(我用的是 Caps Lock 长按)。

4. 选 STT 模型

Onboarding 会引导你说一段试录话,按你的语言和延迟需求推荐:

  • 英文、追求最低延迟 → Parakeet TDT v2 或 Parakeet Flash
  • 中文 + 英文混杂 → Nemotron 3.5 Multilingual
  • Intel Mac → Whisper Large 或 Apple Speech
  • 零下载 → Apple Speech(但效果一般)

模型下载大小 75 MB ~ 2.9 GB 不等,挑能接受的。

5. 开 Fluid Intelligence(可选但强烈建议)

Onboarding 第二步会让你下载 Fluid Intelligence 的本地模型(约 3.5 GB),下完一次以后完全离线。

建议开。不开 FluidVoice 就只是个普通听写工具,开了才进入”AI 增强” 档。

6. (可选)BYO Cloud Provider

如果你想用云端更强的模型做后处理,可以在设置里加 OpenAI / Groq / 自定义 provider 的 API key。Key 存在 macOS Keychain 里。

但我建议先用本地 Fluid Intelligence 跑两周,真不够再开云端。

7. 开始用

按住热键说话 → 浮层显示实时文字 → 松开 → Fluid Intelligence 后处理 → 文字直接出现在当前焦点 App 的光标位置。

习惯了以后你会发现:打字这个动作,从” 逐字敲” 变成了” 开口说”。一篇博客初稿原本要 2 小时,用听写 + AI 后处理 40 分钟出第一版。

五、总结:谁该用 FluidVoice / 局限性在哪

适用人群

FluidVoice 不是给所有人用的。它的甜点用户画像是:

  • macOS 15+ 的 Apple Silicon 用户 —— 这是它体验最丝滑的组合;
  • 写作者、博主、记者 —— 长文本听写 + AI 后处理是核心需求;
  • 不愿订阅 Wispr Flow / Superwhisper 的省钱党 —— 开源 + 本地 + 一次性装好,省年订阅费;
  • 重视隐私的用户 —— 所有语音和文字不出本机;
  • 想用语音控制 Mac 的效率党 ——Command Mode 是彩蛋;
  • 有 Intel Mac 的老用户 —— 可以靠 Whisper 跑起来,但速度肯定不如 Apple Silicon。

局限性(也很重要)

老实说几个当前版本的不足

  • 没有 Windows / Linux 版本,只有 macOS(iOS 在 waitlist)。这对非 macOS 用户是硬限制。
  • Fluid Intelligence 是闭源的本地模块 —— 体验核心依赖一个团队私有的模型。如果团队停更,这个 AI 增强层可能消失。开源部分是基础听写,不受影响。
  • 中文支持比英文略弱 ——Parakeet 主要针对英文优化,Nemotron 多语言版本中文体验能用但不是顶尖。如果你是纯中文写作,可能体验比 Wispr Flow 略差。
  • Command Mode 需要 AppleScript / Shortcuts 支持 —— 某些 App 不开放 automation 接口,Command Mode 覆盖不到。
  • Fluid Intelligence 模型~3.5 GB—— 硬盘紧张的用户需要权衡。
  • GPLv3 协议 —— 不能直接拿去闭源商用,但个人使用 / 学习 / 二次开发都没问题。

我的判断

如果你正在找 macOS 上的听写工具,我建议的优先级是

macOS 原生听写(免费、够用) → FluidVoice(开源 + 本地 + 一次性装好) → Wispr Flow(订阅、效果最强)

FluidVoice 处在” 够用之上、不花订阅费” 的甜点位置。它不会让 Wispr Flow 立刻倒闭 —— 云端 GPT-4 后处理效果还是略胜一筹 —— 但对绝大多数人来说,这 90 分体验已经能解决日常 90% 的需求,剩下的 10% 看你愿不愿意每月再花一杯咖啡钱。

而且 FluidVoice 是开源的、是本地 first 的、是 GPLv3 的 —— 你不会被某个 SaaS 厂商卡脖子。

这本身就是值得给它点个 star 的理由。


项目链接github.com/altic-dev/FluidVoice

安装brew install --cask fluidvoice

协议:GPLv3(2026-02-23 之后版本)

支持平台:macOS 15.0+(Apple Silicon 体验最佳,Intel 需用 Whisper)

Stars:10.3k(截至 2026-08-16)

如果你装下来体验不错,别忘了给它一个 ⭐—— 开源本地 AI 工具能持续做下去,离不开真实用户的支持。