Dotmatics Luma 与 Databricks 推出 AI 就绪科学数据平台
通过Luma的科研数据层与Databricks的企业级基础设施,将碎片化实验数据转化为AI可直接利用的连续结构化记录。
传统科研数据分散于不同仪器与系统,难以直接用于 AI。Dotmatics 的 Luma 平台自动捕获、实时结构化实验数据,Databricks 提供可扩展的治理与存储基础设施,两者结合形成统一栈,让 AI 能直接分析全量连续的科学记录,同时保持数据可审计与 FAIR 合规。
正文摘录
从实验到洞察:Dotmatics Luma 与 Databricks 如何让 AI 就绪的科学成为现实 科学数据向来复杂。如今,基础设施首次能够对其施以真正强大的处理。打好基础是释放这一潜力的关键。 现代科研工作流程会产生海量数据。一个组织可能在湿实验室和合作伙伴网络中运行数百台仪器。每台仪器都会产出数据,而大多数情况下,这些数据分散在孤岛中,与它们本该辅助的决策脱节。 问题不在于数据量,而在于上下文(语境)。当科学数据在仪器、分析和决策之间流转时,保持其完整性和上下文至关重要。一旦上下文丢失,科学家就会花时间重建或重复结果,而不是推进研究。当 AI 模型基于碎片化、未统一的数据训练时,其输出结果不一定可靠(Figure 1)。 Figure 1 . Dotmatics Luma 和 Databricks 将碎片化的仪器输出转化为持续、连贯的管道,输出结构化、可供 AI 使用的科学数据。 弥合这一差距需要两个要素协同工作:一个专为科学数据构建的平台,以及支持其大规模运行的企业级基础设施。这正是 Luma(Dotmatics 的科学智能平台)和 Databricks 各自的使命。两者结合,实现了单独任何一方都无法提供的价值。 Luma 是现代化研发的科学操作层。Luma 持续自动捕获仪器输出,无需中断现有工作流程,并实时将数据整合到统一、结构化的科学记录中。它每天还能处理数十亿个科学数据点。 这一整合步骤使下游所有工作成为可能。非结构化的原始输出转化为结构化、符合 FAIR 原则(可发现、可访问、可互操作、可重用)的数据,刚一到达即可用于分析、建模和 AI 应用。由于科学记录是连续且结构化的,AI 可以应用于整个记录,识别跨实验的模式,建议下一步运行什么,甚至生成科学家可以立即遵循的通俗语言标准操作程序(SOP)。 Databricks 是 Luma 构建的基础。