热门产品

Speech To Markdown

Speech To Markdown

一款利用本地大模型将语音实时转换为结构化 Markdown 的笔记应用,适合需要高效记笔记的用户,无需联网保障隐私。

热门评论

PH 用户
在我构建的所有利用本地LLM的原型中,最终我每天实际使用的是我的 Speech-to-Markdown (STMD)。你的语音经过本地 Whisper (STT) ➡️ 由本地 LLM 处理 ➡️ 最后转换为结构化规格 ✅

借助 Fable,我终于把它从 web 应用变成了原生 Mac 应用 💻,之后我就用得更频繁了。每当有新想法,我就打开应用开始说话。我的产品创意 backlog 从未这么长过;现在我只缺更多时间(和更多 tokens 🤑)。

🔗 https://voice-to-md.xajik0.workers.dev/ | https://github.com/xajik/voice-to-md

🎙️ 我通过它“说出”的第一个想法是 STMD 的 Dictation 模式——终于让我键盘上的自定义按键有了用武之地 ⌨️。只要聚焦到任意文本输入框,按下快捷键,然后开始说话。你可以选择使用或不使用 LLM 来自动修正语法和拼写错误。

📱 我还发布了利用 Apple Intelligence 的 iOS 版本,但不知为何没火起来 (https://apps.apple.com/us/app/speechtomarkdown/id6789775244 🍎)。我猜大部分想法都是在我已经坐在笔记本电脑前时才冒出来的。
PH 用户
完全本地化对于个人笔记来说是正确的权衡——这些想法正是你不希望离开机器的。

我好奇的是 markdown 这一侧而不是语音侧。口语化的思考是散乱且非线性的;markdown 是结构化的。所以必须有东西来判断这句话是标题,那三句是列表,我猜搞错这些比单纯的转录错误更烦人。它有多少结构是自主推断的,又有多少是等我明确说出来的?
PH 用户
对于这种私密的东西,设备端处理是明智的默认选择。在我切换笔记工作流之前,我想知道一件事——它能否很好地处理录音中的混合语言,或者如果你像很多双语者实际说话那样在句子中间切换语言,准确率是否会大幅下降?
PH 用户
完全本地化对于基本上是你未经筛选的个人笔记来说是正确的选择。不过好奇硬件门槛是怎样的——它是否捆绑了针对老旧/入门级 Mac 的特定小模型,还是在更高端的 Apple Silicon 芯片上质量会明显提升?问这个问题是因为“本地 LLM”的质量因设备而异,比云 API 波动大得多。
PH 用户
本地 Whisper 加上本地 LLM 生成结构化 markdown,对起草长笔记或规格书的人来说是一个强有力的隐私故事。在任意文本输入框中使用全局快捷键进行听写,这才是我日常会真正使用的功能。好奇你推荐哪个本地模型来识别标题和列表结构而不破坏技术术语,以及用户是否可以固定自己喜欢的提纲风格。
PH 用户
Whisper 本地跑起来处理干净的单人英语还不错,但听写工具真正的考验是混乱的语音——话说到一半改口、自己纠正、说“等等,刚那句不算”、中间切换语言、灵感来了不管在哪都有背景噪音。既然看你 backlog 评论里好像灵感总是不断,那 STMD 怎么处理你口头纠正自己的情况?本地 LLM 能识别出你是要替换前一句而不是追加内容吗?还是说纠正也被当作额外内容直接写进结构化规格里了?

另外,听写模式能在任意输入框里实时修正语法和错字,这个功能我其实每天都会用,比生成完整规格实用得多。那个语法纠错是等你一句话停顿后就执行,还是等你完全停止听写才执行?毕竟如果在我话说到一半时就过度纠正,可能会重写我还没说完的内容。
热门产品Igor Steblii2026-07-25原文

相关内容