AI催生Web数据基础设施层
本文指出,当前AI数据瓶颈源于Web基础设施的先天不足,亟需构建专门的数据层来支持AI应用。
AI正蓬勃发展,每天都有新用例涌现。企业要释放AI潜力,需要海量数据。然而,许多关键信息被封锁或非结构化,导致AI模型难以利用。问题的根源在于,Web最初并非为AI设计。
正文摘录
AI 时代 Web 数据基础设施层的崛起 AI 正在蓬勃发展。每天都有新的应用场景涌现。为了发挥这项技术的潜力,企业需要大规模的数据。但在许多情况下,相关信息要么被屏蔽,要么是非结构化的,这限制了 AI 模型对其的使用。 要理解这一挑战,不妨先看看 Web 本身的根基。Web 最初并非为 AI 新应用所要求的自动化发现与检索而设计。克服这种固有的设计约束需要基础设施。  AI 的下一个前沿可能依赖于一个新的 Web 数据基础设施层,该层能让模型发现并映射这个不断扩张的数字领域。这一层必须能够导航数亿个现有 Web 域名以及每周新创建的数十亿个 URL,提供实时信息,并克服技术障碍。 “数据表明,外面还有多得多的数据,”Web 数据采集平台 Bright Data 的 CEO Or Lenchner 说。“想象一下宇宙:它就在那里,但你不知道你不知道什么。” 让新鲜、相关且可信的数据变得可用 虽然早期的 AI 突破是由扩展训练数据和模型规模驱动的,但组织现在遇到了一个根本瓶颈:他们需要跟上 Web 数据动态、非结构化且不断演变的特性,以便将输出基于当前且可验证的信息。AI 的性能越来越不仅仅取决于模型架构,还取决于系统的计算、网络、检索和数据工程能力——即系统快速可靠地检索新鲜、相关且可信赖的数据的能力。 传统的模型训练依赖于特定时间点收集的信息快照。在这种静态数据上训练 AI 已不再足够。为了追踪竞品定价、消费者情绪和市场趋势等波动,公司需要源源不断的新信息流,实时拉取数据并附带相关上下文。因此,它们的基础设施必须能够处理跨越不同地理位置、语言、格式和访问规则的数百万个网站的同时交互。