FluidVoice
macOS 上最快的离线语音听写应用,集成 Parakeet、Nemotron、Whisper 等多种语音模型,并通过本地 AI 实现智能格式化和后处理。亮点是全栈本地运行,零数据离机,延迟极低,支持多种模型自由切换,且开源免费。
README
FluidVoice
开源语音转文字听写应用(macOS),搭载设备端 AI 增强功能。
使用 Homebrew 安装: brew install --cask fluidvoice
手动下载: 最新版本
[!IMPORTANT] 本项目基于 GPLv3 协议免费开源。如果 FluidVoice 对你有帮助,请给仓库点个 Star —— 这有助于提高项目可见度,并推动持续开发。
支持 FluidVoice
如果 FluidVoice 让你的日常工作更轻松,你可以在 GitHub Sponsors 上支持它的持续开发。
1.6.0 新特性
- 超高速 Parakeet —— 重构了 Parakeet 实现,说话与屏幕显示文字之间几乎没有延迟
- Fluid Intelligence —— 完全本地的 AI 模型,实现设备端听写增强。无云端、无 API Key、数据绝不离开你的 Mac
- 更佳主题 —— 自适应亮/暗主题,搭配紧凑的工具栏切换器
- 焕新的首次引导 —— 语言优先的语音引擎设置、真实听写试用、AI 增强设置,一站式完成
[!WARNING] 根据早期反馈,Fluid Intelligence 可能会导致你取消其他听写应用的订阅并省钱。你已被警告。
Fluid Intelligence
FluidVoice 完全基于 GPLv3 协议开源。Fluid Intelligence 是一个独立、私有维护的本地 AI 运行时,提供先进的设备端听写增强功能 —— 智能格式化、上下文感知大写、后处理 —— 全部在本地 Mac 上运行。
应用本身配合任何支持的语音模型和可选的云端 AI 提供商就能很好地工作。Fluid Intelligence 为那些希望获得设备端增强但又不想将数据发送到任何地方的用户,提供了完全本地、私有的 AI 层。
我们暂时将 Fluid Intelligence 保持私有,以便能够持续免费提供核心听写体验。未来可能会改变。
Star 历史
Fluid Intelligence 抢先看
| 邮件模板 | 鲜花 |
| 修改时间与姓名 | Emoji |
| 连字符与数字 | |
演示
命令模式 —— 用 FluidVoice 在 Mac 上执行任意操作
https://github.com/user-attachments/assets/ffb47afd-1621-432a-bdca-baa4b8526301
写入模式 —— 在任何应用的任何文本框中写入或重写文本
https://github.com/user-attachments/assets/c57ef6d5-f0a1-4a3f-a121-637533442c24
截图
命令模式

历史记录与统计

功能特性
- Fluid Intelligence —— 设备端 AI 增强,实现智能格式化、上下文感知大写以及后处理,全部在本地 Mac 上运行,数据绝不离开你的机器
- 命令模式 —— 用语音控制你的 Mac:启动应用、运行快捷指令、触发系统操作、自动化工作流,无需触碰键盘
- 写入模式 —— 在任何应用的任何文本框中直接写入或重写文本。选中文本后进行重写,或直接听写新内容
- 实时预览 —— 支持刘海屏的实时转录浮层,说话时即可看到文字出现
- 多种语音模型 —— Nemotron Speech 3.5、Parakeet Flash、Parakeet TDT v3 和 v2、Cohere Transcribe、Apple Speech、Whisper。选择适合你的语言和延迟需求的模型
- AI 增强 —— 通过 OpenAI、Groq、自定义提供商或本地 Fluid Intelligence 进行可选的后期处理,获得更干净、更准确的转录
- 音频历史记录 —— 可选的本地录音历史记录,支持预算控制和 ZIP 导出,无需云存储即可回顾过去的听写内容
- 今日使用统计 —— 通过统计头部卡片和工具栏药丸,一目了然查看每日使用情况
- 自适应主题 —— 跟随系统亮暗模式,搭配紧凑的工具栏切换器
- 全局热键 —— 从任何位置即时启动语音捕获,无需切换应用
- 智能打字 —— 通过辅助功能 API 直接插入任何应用,实现可靠、不依赖应用的文本输入
- 菜单栏集成 —— 从菜单栏快速访问、查看状态和设置
- 自动更新 —— 无缝更新,可选 Beta 渠道提前预览
- 按应用配置 —— 为不同应用分配不同的提示集,让听写适应你正在工作的内容。完全可选
- 刘海屏感知浮层 —— 适配 MacBook 刘海屏的转录浮层,如果你的 Mac 没有刘海屏,也可以使用标准浮层
- 本地优先 —— 你的语音和文本永远不会离开你的机器,除非你主动选择使用云端 AI 提供商
- Mac 上最快的 Parakeet —— 基于原生实现的 Parakeet,近乎即时转录,延迟极低
- 可配置浮层 —— 从药丸形到大型浮层,可根据需要显示实时预览,或保持最小化。所有选项均可选
- 一切皆可选 —— AI 增强、Fluid Intelligence、音频历史记录、分析数据、Beta 版本均为自愿开启。核心听写体验零配置开箱即用,仅需授权和热键设置
支持的模型
| 模型 | 最佳场景 | 语言支持 | 下载大小 | 硬件 |
|---|---|---|---|---|
| Nemotron Speech 3.5 — 超快低延迟 | 支持流式传输的多语言听写 | ~40 种语言 | ~670 MB | Apple Silicon |
| Nemotron 3.5 多语言 | 高精度多语言听写 | ~40 种语言 | ~530 MB | Apple Silicon |
| Parakeet Flash (Beta) | 最低延迟的实时英语听写 | 英语 | ~250 MB | Apple Silicon |
| Parakeet TDT v3 | 快速默认多语言听写 | 25 种语言 | ~500 MB | Apple Silicon |
| Parakeet TDT v2 | 最快的纯英语听写 | 英语 | ~500 MB | Apple Silicon |
| Cohere Transcribe | 高精度多语言听写 | 14 种语言 | ~1.4 GB | Apple Silicon |
| Apple Speech | 零下载的原生 macOS 语音 | 系统语言 | 内置 | Apple Silicon + Intel |
| Whisper Tiny / Base / Small / Medium / Large | 广泛兼容性,包含 Intel Mac | 99 种语言 | ~75 MB 至 ~2.9 GB | Apple Silicon + Intel |
Parakeet TDT v3 语言
保加利亚语、克罗地亚语、捷克语、丹麦语、荷兰语、英语、爱沙尼亚语、芬兰语、法语、德语、希腊语、匈牙利语、意大利语、拉脱维亚语、立陶宛语、马耳他语、波兰语、葡萄牙语、罗马尼亚语、俄语、斯洛伐克语、斯洛文尼亚语、西班牙语、瑞典语、乌克兰语。
Parakeet TDT v2 语言
英语。
Cohere Transcribe 语言
英语、法语、德语、意大利语、西班牙语、葡萄牙语、希腊语、荷兰语、波兰语、普通话、日语、韩语、越南语、阿拉伯语。
Apple Speech 语言
系统语言支持取决于你 Mac 上可用的 macOS 语音识别语言。
Whisper 语言支持
Whisper 最多支持 99 种语言,具体取决于你选择的模型大小。
快速开始
安装 使用 Homebrew:
brew install --cask fluidvoice或下载 最新版本。
授予权限 —— FluidVoice 会请求麦克风和辅助功能权限。两者都需要用于听写和向其他应用输入文本。
设置热键 —— 在设置中选取一个全局热键,用于从任何位置触发语音捕获。
完成首次引导 —— 根据你的语言和延迟需求选择语音模型。模型从零下载的 Apple Speech 到高精度的 Nemotron 和 Whisper 不等。
(可选)启用 Fluid Intelligence —— 在首次引导期间下载本地 AI 模型,以获得设备端听写增强。一切运行在本地,数据不会离开你的 Mac。
(可选)使用自己的 AI 提供商 —— 添加 OpenAI、Groq 或自定义提供商的 API Key,以获得云端增强。Key 安全存储在 macOS Keychain 中。选择“始终允许”以使用 Key。
(可选)选择加入 Beta 版本 ——
设置 → 自动更新 → Beta 版本,提前体验新功能。
系统要求
- macOS 15.0 (Sequoia) 或更高版本
- Apple Silicon Mac(支持所有模型)
- Intel Mac 通过 Whisper 模型支持(1.5.1+)
- 约 1 GB 磁盘空间用于语音模型
- 约 3.5 GB 磁盘空间用于 Fluid Intelligence 模型(可选)
- 麦克风权限
- 辅助功能权限(用于输入文本)
从源码构建
git clone https://github.com/altic-dev/FluidVoice.git
cd FluidVoice
open Fluid.xcodeproj
在 Xcode 中构建并运行。所有依赖通过 Swift Package Manager 管理。
仅构建(不签名)
xcodebuild -project Fluid.xcodeproj -scheme Fluid -destination 'platform=macOS' build CODE_SIGNING_ALLOWED=NO
贡献
欢迎贡献!提交 Pull Request 前请先创建 Issue 讨论重大更改。
开发环境设置
- 如上所述克隆并在 Xcode 中打开项目。
- 签名:
FluidVoice → Signing & Capabilities → Automatically manage signing → 选择你的 Team(个人 Team 即可)。存储在xcuserdata/(已 gitignore)。 - 构建并运行 —— SPM 自动处理依赖。
- (可选)pre-commit 钩子,防止意外提交 Team ID:
cp scripts/check-team-id.sh .git/hooks/pre-commit chmod +x .git/hooks/pre-commit
Pull Request 指南
- 每个 PR 只包含一个功能或修复 —— 保持更改集中且原子化
- 先创建 Issue,确保工作可追踪
- 讨论非平凡的更改后再开 PR
- 遵循 PR 模板
- 在自己的机器上充分测试
- 永远不要提交个人的 Team ID 或 API Key
- 提交前检查
git diff
运行集成测试
xcodebuild test -project Fluid.xcodeproj -scheme Fluid -destination 'platform=macOS'
CI 使用未签名的构建:
xcodebuild test -project Fluid.xcodeproj -scheme Fluid -destination 'platform=macOS' CODE_SIGNING_REQUIRED=NO CODE_SIGNING_ALLOWED=NO
隐私与分析
FluidVoice 以本地优先为原则。你的语音、音频和转录文本永远不会离开你的机器,除非你主动选择使用云端 AI 提供商。
收集的内容(自愿)
匿名分析默认开启,用于追踪应用健康度和功能使用情况。你可以在 设置 → 分享匿名分析 中随时关闭。
收集项:
- 应用版本、构建号、macOS 版本
- 低基数的功能/配置标志(如应用模式、主要设置)
- 大致使用范围(不是精确值)
- 高层次的成功/错误结果
不收集项:
- 语音、原始音频或转录文本
- 选中的文本、提示词或 AI 响应
- 终端命令、窗口标题、文件路径、剪贴板或输入的内容
- 任何个人或私人信息
社区
加入我们的 Discord:https://discord.gg/VUPHaKSvYV
关注 X 上的开发进展:@ALTIC_DEV
许可证
自 2026 年 2 月 23 日起,本项目采用 GNU 通用公共许可证,版本 3.0 (GPLv3) 授权。
在此日期之前发布的版本采用 Apache 许可证 2.0 授权。