ZooData ZooData 为 AI 智能体提供结构化数据抽取层,将 URL 转为 JSON,节省 LLM 令牌消耗,适合开发者与电商分析。 热门评论 PH 用户Hi PH 👋,我是 ZooData 的 Ning。简单说说我们为什么做这个。如果你用智能体做过任何东西,你就会明白数据的问题。你抓取一个页面——用 browser-use、Playwright 或者其他工具——返回的是原始 HTML 或者“干净”的 markdown。无论哪种,里面都塞满了导航栏、页脚、广告和样板代码。给人读没问题,但对 LLM 来说,你是在烧几千个 token 让模型先过滤掉这些垃圾,然后才能做有用的事。规模上来讲,这是真金白银,而且大部分都浪费了。Markdown 是常见的解决办法。但 markdown 是为人类阅读设计的,不是为需要操作数据的智能体设计的。读者不同,格式也得不同——智能体不需要散文,它需要结构。ZooData 把提取这一步做对了:任何 URL → 结构化的 JSON。无需定义 schema,无需针对每个站点写 parser,无需维护选择器胶水代码。相比同一页面的原始 markdown,token 消耗减少约 75%——大约是其他提取器成本的五分之一。而且你只需为你实际使用的字段付费;提取本身不消耗额度。支持 API、CLI 和 MCP server,所以可以直接嵌入你的智能体栈,无需重写任何东西。预分析好的电商平台情报——你的智能体可以直接查询竞争对手、市场、流量和消费者信号,而不需要自己抓取后再拼接。更多平台即将支持。我们认为 AI 智能体的下一个瓶颈不会是模型有多聪明——而是它们所依赖的数据质量。随着 AI 生成的内容充斥网络,智能体需要干净、结构化、可验证的数据才能做出可靠决策。这就是我们在构建的 layer,而且它会产生复合效应:我们每处理一个页面,下一次请求就更便宜、更快、更可信。ZooData 是其他一切运行的基础——我们不久前在这里推出了 ZooClaw(面向个人的智能体),而 ZooWork(企业版)也即将上线。1000 免费额度,无需绑定卡。只需告诉你的智能体:npx skills add SerendipityOneInc/ZooData-Skills然后就可以开始了。期待大家的反馈。我也很好奇——你抓取过的最乱的站点是哪个?🙏PH 用户只按使用的字段付费,这对数据提取来说太合理了。PH 用户很高兴看到从第一天起就提供了 MCP server。这表明对当前开发者工作流有深刻理解,也让这种 JSON 提取的集成更有吸引力。PH 用户发布得很棒!token 数量这个点尤其关键,至少对智能体来说是这样。为过滤“干净” markdown 里的样板代码付费,是一种直到账单来了才意识到的隐性成本。想问一下——当某个网站悄悄改了布局或者跑 A/B 测试时,你们学到的模板会不会仍然映射到旧字段,然后错误地返回一个看起来很置信的值?PH 用户看起来很有用!数据提取确实是 AI agent 的关键需求。PH 用户好奇它在反机器人机制面前表现如何——很多最难抓的站点之所以难,不是因为标记混乱,而是因为它们主动阻止自动化请求。如果某个站点直接给你一个验证码页面而不是 HTML,那按字段付费的定价还适用吗?还是说这种情况算作单独的错误处理? 热门产品Ning Hu2026-07-18原文 打开互动版
我是 ZooData 的 Ning。
简单说说我们为什么做这个。
如果你用智能体做过任何东西,你就会明白数据的问题。你抓取一个页面——用 browser-use、Playwright 或者其他工具——返回的是原始 HTML 或者“干净”的 markdown。无论哪种,里面都塞满了导航栏、页脚、广告和样板代码。给人读没问题,但对 LLM 来说,你是在烧几千个 token 让模型先过滤掉这些垃圾,然后才能做有用的事。规模上来讲,这是真金白银,而且大部分都浪费了。
Markdown 是常见的解决办法。但 markdown 是为人类阅读设计的,不是为需要操作数据的智能体设计的。读者不同,格式也得不同——智能体不需要散文,它需要结构。
ZooData 把提取这一步做对了:任何 URL → 结构化的 JSON。无需定义 schema,无需针对每个站点写 parser,无需维护选择器胶水代码。相比同一页面的原始 markdown,token 消耗减少约 75%——大约是其他提取器成本的五分之一。而且你只需为你实际使用的字段付费;提取本身不消耗额度。支持 API、CLI 和 MCP server,所以可以直接嵌入你的智能体栈,无需重写任何东西。预分析好的电商平台情报——你的智能体可以直接查询竞争对手、市场、流量和消费者信号,而不需要自己抓取后再拼接。更多平台即将支持。我们认为 AI 智能体的下一个瓶颈不会是模型有多聪明——而是它们所依赖的数据质量。
随着 AI 生成的内容充斥网络,智能体需要干净、结构化、可验证的数据才能做出可靠决策。这就是我们在构建的 layer,而且它会产生复合效应:我们每处理一个页面,下一次请求就更便宜、更快、更可信。
ZooData 是其他一切运行的基础——我们不久前在这里推出了 ZooClaw(面向个人的智能体),而 ZooWork(企业版)也即将上线。
1000 免费额度,无需绑定卡。只需告诉你的智能体:
npx skills add SerendipityOneInc/ZooData-Skills
然后就可以开始了。
期待大家的反馈。我也很好奇——你抓取过的最乱的站点是哪个?🙏