提出自适应奖励路由,通过前向过程 RL 实现音视频联合扩散的多奖励动态优化 AK自适应奖励路由通过前向过程 RL 实现音视频联合扩散的动态多奖励优化论文:https://t.co/HItw7DzfZ5 https://t.co/9IvhOw7A9S 动态AK2026-10-02原文 打开互动版