热门产品

Desert Ant Labs

Desert Ant Labs

面向开发者的小型端侧 AI 模型 SDK,覆盖语音、文本与视觉,可在手机或浏览器离线运行,免联网、无按次调用成本。

热门评论

PH 用户
Desert Ant Labs 做的是小型 AI 模型,每个都专精一个任务,覆盖语音、文本和视觉,能在你的手机或浏览器上运行,无需联网,也没有按次使用成本。

用同一个 SDK,只要几行代码,就能在 Swift、Kotlin 或 JavaScript 里把任意一个模型接入你的 app。

Audio Models:Align(词级时间戳)、Clear(语音增强)、Clips(片段选择)、Ear(口语语种检测)、Uhm(填充词检测)、Voz(语音识别)、Who(说话人标注,beta)

Text Models:Emo(emoji 建议)、Gist(主题打标)、Redact(PII 脱敏)、Title(标题和描述)、Tongue(语言识别)、Schemer(结构化提取,beta)、Toxic(仇恨言论初筛,beta)

Vision Models:Shapes(形状识别)、Eye(beta)、Face(beta)、Moderator(内容审核,beta)

不一样在哪:一切都完全在设备本地运行,所以永远没有云账单,也永远不按 token 计费。每个平台最多 10 万台月活设备免费,之后每个用户的推理不限量。

适合谁:想加语音、文本或视觉功能,又不想增加云成本或延迟的开发者。

试用:desertant.com · SDK 在 GitHub · 模型在 Hugging Face · 文档

P.S. 我专门挖掘科技、SaaS 和 AI 领域最新最棒的发布,关注获取通知 → @rohanrecommends
PH 用户
每个任务一个小模型,不用联网,也没有按次使用成本。在我看来,这个方向真的很实用 🐜 目前下载量最高的是哪个?
PH 用户
Hey Rohan。如果一个 app 同时用了五六个这些模型,那到底会给下载包增加多少体积?
PH 用户
Uhm 这个填充词模型是最让我眼前一亮的。我在做一个语音伴侣,每天给老年人打电话;难点从来都不是转写,而是 endpointing:82 岁老人说到一半会停四五秒,标准 VAD 会把这当成一轮说完,然后盖过他们说话。一个在设备本地运行、和 VAD 并行的微小迟疑信号,会比单靠静音时长更好地判断轮次切换。

两个问题:Uhm 能不能作为流式信号输出,让你逐帧读取,还是只能等一段音频结束后才给结果?另外,Voz 和 Clear 在老年人语音上表现如何——语速更慢、构音障碍、助听器反馈、背景电视声这些情况,你有任何了解吗?这个人群在大多数 ASR 训练数据里严重不足,而这正是我测过的云端模型会崩掉的地方。
热门产品Paul Veugen2026-09-10原文

相关内容