NVIDIA 发布三种工作流,用合成数据与微调提升视觉 AI Agent 准确性
用合成数据补上罕见场景的标签缺口,再微调模型,是降低视觉 AI 落地对人工标注和运维依赖的关键路径。
视觉 AI Agent(自动分析视频、识别缺陷或异常事件的智能体)正从工厂到城市大量部署。但现实是,90% 的边缘数据未处理,模型常因罕见场景数据缺失而卡在准确率瓶颈。NVIDIA 用 OpenUSD(通用 3D 场景描述框架)生成合成数据,再配合微调,给出三条可复用的工作流来打通从数据到部署的链路。
正文摘录
编者注:本文是 [走进 Omniverse](https://www.nvidia.com/en-us/omniverse/news/) 系列的一部分,该系列聚焦开发者、3D 从业者和企业如何利用 [OpenUSD](https://www.nvidia.com/en-us/omniverse/usd/) 和 [NVIDIA Omniverse](https://www.nvidia.com/en-us/omniverse/) 的最新进展重塑工作流程。 [视觉 AI 智能体](https://www.nvidia.com/en-us/use-cases/video-analytics-ai-agents/)(能够自动将物理世界的视频数据转化为操作智能)正成为工厂、城市、仓库和交通系统中实用的解决方案。 随着更多 AI 工作负载向数据生成地迁移,这一转变正在加速。Gartner 预测,到 2028 年,超过三分之二的企业管理数据将在数据中心或云之外创建和处理;到 2029 年,全球超过三分之二的企业将部署边缘 AI,而 2025 年这一比例仅为 10%(1)。 但更多的边缘数据并不会自动产生更多智能。根据同一份 Gartner 报告,高达 90% 的现有边缘数据未得到处理。 要将这些数据转化为有用的行动,需要能够理解视频、适应真实世界条件并将洞察连接到操作工作流的视觉 AI 智能体。这些智能体通常运行在摄像头、机器和传感器附近,模型必须满足延迟、功耗、成本和连接要求,同时适应特定站点条件。 要构建这些智能体,开发者需要可重复的方法来生成训练数据、微调模型,并在边缘和云环境中部署智能体视频应用。