
的个人主页 http://faculty.ustc.edu.cn/hanmingfei/zh_CN/index.htm
随着视觉语言大模型不断提升机器对数字世界的理解能力,我们更关注下一阶段的核心问题:如何让多模态基础模型真正理解物理世界,并将这种理解转化为可靠、可泛化的行动能力。围绕这一目标,我们研究如何将多模态基础模型、世界模型、几何与物理先验,以及具身交互学习有机结合,使智能系统不仅能够“看懂”和“说对”,还能够预测环境变化、理解空间关系、规划长期任务,并在未知场景中持续行动和自我修正。
我们的研究总体围绕三个彼此关联的层次展开:
感知(Perception)— 推理与预测(Reasoning & Prediction)— 行动(Action)
并进一步关注智能体与人、环境及其他智能体之间的交互(Interaction),逐步构建从互联网规模视觉知识到真实物理世界行动能力的统一学习框架。
研究智能体如何基于视觉、语言和历史交互信息,在复杂环境中完成导航、操作与长期任务。
重点关注:
视觉-语言导航(Vision-and-Language Navigation)
机器人操作与视觉-语言-行动模型(VLA)
长时序任务规划与自主纠错
跨环境、跨任务与跨机器人平台泛化
开放世界中的零样本与少样本具身智能
我们的目标不是仅针对单一机器人任务进行优化,而是探索能够迁移到不同任务、不同场景和不同物理实体上的通用智能体方法。
真实世界智能不仅需要识别物体,更需要理解空间结构、物体关系、动作后果以及环境随时间发生的变化。
我们研究:
世界模型(World Models)与未来状态预测
空间智能与几何推理
面向机器人任务的结构化中间表征
动作条件下的环境动态建模
物理先验与多模态基础模型的融合
核心问题是:智能体能否在真正执行动作之前,对“接下来会发生什么”形成有效的内部预测,并利用这些预测完成规划与决策?
我们希望进一步探索从“像素级预测”走向面向行动的结构化世界模型,使预测真正服务于长期任务规划。
视频天然记录了物体、人物和环境随时间变化的规律,也是连接互联网知识与物理智能的重要数据来源。
我们长期研究复杂视频场景中的多模态理解,包括:
长视频与多镜头视频理解
视频-语言联合建模
时序推理与事件理解
在线视频理解与实时决策
多模态大模型幻觉与可靠性
高效视频表征与长上下文建模
我们尤其关注如何从互联网规模视频数据中学习可迁移的动态知识和物理常识,并进一步将这些知识迁移到具身导航与机器人操作中。
当前多模态大模型在标准数据集上已经表现出较强能力,但在开放环境中仍容易受到分布变化、空间关系变化和复杂任务组合的影响。
我们关注:
组合泛化与分布外泛化
多步视觉推理与空间推理
模型自反思与自我纠错
多模态幻觉的识别与缓解
证据驱动、过程透明的决策机制
有限监督条件下的高效学习
我们希望推动模型从依赖统计相关性的“模式匹配”,进一步走向具有结构理解、因果预测和自我验证能力的可靠推理系统。
真实环境中的智能体并非孤立存在。人类、机器人以及其他智能体共同构成动态社会环境。
我们研究:
社会导航与人机共存环境中的行为决策
多智能体协作
基于大语言模型的多智能体机器人系统
人类意图理解与交互式任务执行
长序列社会交互中的规划与适应
长期来看,我们希望智能系统不仅能够操作物体,也能够理解人的意图、遵循社会规范,并与人及其他智能体协作完成复杂任务。
近年来,我们围绕视觉智能、多模态推理与具身智能开展了一系列研究。在视频与多模态理解方面,研究成果发表于 CVPR、ICCV、ECCV、NeurIPS、ICLR、ICML、IEEE TPAMI、IEEE TIP 等国际人工智能与计算机视觉重要会议和期刊,涉及长视频理解、多镜头视频理解、视频目标感知、多模态推理以及模型可靠性等方向。在具身智能方面,我们探索利用互联网视频、几何先验、世界模型以及多智能体系统提升机器人导航与操作能力,研究覆盖视觉-语言导航、机器人操作、结构化世界模型和社会智能等问题。
部分代表性工作包括:
RoomTour3D (CVPR 2025):探索从大规模互联网室内视频中自动构建视觉-语言导航训练数据,将 Web 视频知识迁移到具身导航;
Shot2Story (ICLR 2025):面向复杂多镜头视频构建细粒度视频理解与总结框架;
LongVLM (ECCV 2024):研究大模型条件下高效的长视频理解;
GeoSense (ICML 2026):研究多模态大模型何时以及如何调用几何信息进行空间推理;
LatentPilot (ECCV 2026):通过潜空间未来预测提升视觉-语言导航中的场景理解与决策;
StructVLA / Structured World Modeling (ECCV 2026):利用任务相关的结构化未来状态连接世界模型与机器人长期规划;
MALMM (IROS 2025):探索基于多智能体大语言模型的零样本机器人操作。
相关研究获得 CVPR 2022 Oral、ECCV 2024 Oral,并在 IROS 2025 Intern Robotics Challenge 视觉-语言导航赛道及 RoboSense Social Navigation Challenge 中获得第一名。
我们欢迎对具身智能、机器人学习、多模态大模型、视频理解、世界模型与空间智能感兴趣的本科生、硕士生和博士生加入。
相比已有论文数量,我们更加重视:
对研究问题的好奇心;
独立思考与发现问题的能力;
扎实的代码与实验能力;
面对困难问题长期投入的耐心;
清晰表达和开放合作的习惯。
优秀的学生可以参与国际合作研究,并有机会围绕具有长期价值的问题形成自己的独立研究方向。
欢迎与国内外高校、科研机构及产业界开展合作。
我们尤其希望围绕通用具身智能、多模态大模型、世界模型、视频智能与空间推理等方向,与计算机视觉、机器学习、机器人学以及相关交叉领域的研究者开展长期合作。
我们的长期目标,是探索一条从“理解数字世界”走向“理解并作用于物理世界”的人工智能发展路径,并推动构建能够在真实开放环境中持续感知、推理、预测、行动与学习的通用智能系统。