DreamFly:为空中视觉语言导航引入因果记忆与滚动扩散规划空中视觉语言导航要求智能体在部分可观测条件下,随时间整合视觉证据、规划未来动作,并判断是否到达导航目标。尽管近期VLA模型提供了从感知到动作的可行范式,但受限于历史上下文不足、规划视野短以及隐式终止不可靠,将其适配到空中导航仍有挑战。为此,我们提出DreamFly,一个基于Dream-VLA的扩散式空中VLN框架。DreamFly引入因果对齐的历史记忆,仅利用当前决策步骤之前的观测来增强当前视觉表征,实现时间推理且避免未来信息泄漏。我们进一步将导航建模为滚动时域扩散规划,策略预测K步动作块但仅执行第一步后重新规划。这种“规划K步、执行一步”的策略,将未来动作作为辅助规划目标,同时保留闭环视觉反馈。最后,LiteStop直接从初始全掩码状态的动作logits估计停止概率,将显式终止与动作生成解耦。在OpenFly基准上的实验表明,在可见与不可见环境中均取得一致提升。DreamFly在测试可见/不可见分割上分别达到32.04%/29.46%的SR和28.22%/23.54%的SPL,两项指标均优于所有对比方法,并取得最低导航误差。这些结果验证了联合建模历史上下文、未来动作结构与显式终止对空中VLN的有效性。
空中视觉语言导航(VLN)要求智能体在部分可观测条件下,随时间整合视觉证据、规划未来动作,并判断是否到达导航目标。尽管近期VLA模型提供了从感知到动作的可行范式,但将其适配到空中导航仍面临历史上下文有限、规划视野短、隐式终止不可靠等挑战。
针对这些问题,DreamFly框架引入三项核心设计。第一,因果对齐的历史记忆模块,仅使用当前决策步骤之前的观测来增强视觉表征,支持时间推理且避免未来信息泄漏。第二,滚动时域扩散规划策略,预测K步动作块但只执行第一步后重新规划,以未来动作作为辅助规划目标,同时保留闭环视觉反馈。第三,LiteStop模块直接从初始全掩码状态的动作logits估计停止概率,将显式终止判断与动作生成解耦。
实验在OpenFly基准上进行,DreamFly在测试可见与不可见分割上分别达到32.04%/29.46%的SR和28.22%/23.54%的SPL,两项指标均优于所有对比方法,并取得最低导航误差。结果表明,联合建模历史上下文、未来动作结构与显式终止对空中VLN任务有效。
这项工作为空中VLN提供了完整的技术方案,其因果记忆与滚动规划思路也可迁移至其他具身导航场景,对长时程决策任务具有参考价值。
#AI论文 #机器学习 #DreamFly #VLN #扩散模型 #具身智能 #导航
@AIPaperCN