BiTAgent: A Task-Aware Modular Framework for Bidirectional Coupling between Multimodal Large Lang...
BiTAgent 文章总结与翻译
一、主要内容
本文针对通用具身智能体的构建需求,提出了BiTAgent——一种任务感知的动态联合框架,实现多模态大型语言模型(MLLMs)与世界模型(WMs)的双向耦合。该框架旨在解决现有集成方案中语义意图与动态状态表示耦合松散、缺乏任务感知适应性的核心问题。
MLLMs具备强大的语义推理和跨模态泛化能力,但缺乏物理交互能力;世界模型擅长环境动态建模和决策支持,却在语义抽象和跨任务泛化上存在局限。BiTAgent通过两条互补路径实现二者深度融合:
- 前向路径:将MLLM的语义表示注入世界模型的 latent 空间,实现语义引导的轨迹想象,而非单纯基于物理规律的推演;
- 反向路径:通过世界模型生成的任务条件化想象轨迹计算密集奖励,反向传播至MLLM以优化其语义空间,确保语义与物理动态的一致性。
框架包含三个核心组件:
- 任务感知动态联合学习(Task-Aware Dynamic Joint Learning):通过模块化融合机制,在任务引导下动态平衡语义与动态表示的贡献;
- 任务感知行为学习(Task-Aware Behavior Learning):构建共享想象空间,利用文本条件化奖励引导行为生成,兼顾物理合理性与语义连贯性;
- MLLM-WM联合优化(MLLM-WM Joint Optimization):统一语义对齐、动态预测和行为优化目标,实现梯度层面的双向耦合。
