Uhm 这个填充词模型是最让我眼前一亮的。我在做一个语音伴侣,每天给老年人打电话;难点从来都不是转写,而是 endpointing:82 岁老人说到一半会停四五秒,标准 VAD 会把这当成一轮说完,然后盖过他们说话。一个在设备本地运行、和 VAD 并行的微小迟疑信号,会比单靠静音时长更好地判断轮次切换。
两个问题:Uhm 能不能作为流式信号输出,让你逐帧读取,还是只能等一段音频结束后才给结果?另外,Voz 和 Clear 在老年人语音上表现如何——语速更慢、构音障碍、助听器反馈、背景电视声这些情况,你有任何了解吗?这个人群在大多数 ASR 训练数据里严重不足,而这正是我测过的云端模型会崩掉的地方。
用同一个 SDK,只要几行代码,就能在 Swift、Kotlin 或 JavaScript 里把任意一个模型接入你的 app。
Audio Models:Align(词级时间戳)、Clear(语音增强)、Clips(片段选择)、Ear(口语语种检测)、Uhm(填充词检测)、Voz(语音识别)、Who(说话人标注,beta)
Text Models:Emo(emoji 建议)、Gist(主题打标)、Redact(PII 脱敏)、Title(标题和描述)、Tongue(语言识别)、Schemer(结构化提取,beta)、Toxic(仇恨言论初筛,beta)
Vision Models:Shapes(形状识别)、Eye(beta)、Face(beta)、Moderator(内容审核,beta)
不一样在哪:一切都完全在设备本地运行,所以永远没有云账单,也永远不按 token 计费。每个平台最多 10 万台月活设备免费,之后每个用户的推理不限量。
适合谁:想加语音、文本或视觉功能,又不想增加云成本或延迟的开发者。
试用:desertant.com · SDK 在 GitHub · 模型在 Hugging Face · 文档
P.S. 我专门挖掘科技、SaaS 和 AI 领域最新最棒的发布,关注获取通知 → @rohanrecommends
两个问题:Uhm 能不能作为流式信号输出,让你逐帧读取,还是只能等一段音频结束后才给结果?另外,Voz 和 Clear 在老年人语音上表现如何——语速更慢、构音障碍、助听器反馈、背景电视声这些情况,你有任何了解吗?这个人群在大多数 ASR 训练数据里严重不足,而这正是我测过的云端模型会崩掉的地方。