
文章主要内容与创新点总结一、主要内容研究背景:空间认知是多模态大语言模型(MLLMs)与物理环境交互的核心能力,但现有基准测试存在缺陷——多简化为单维度指标,缺乏对空间认知层级结构和能力关联性的捕捉,且数据集多为合成或场景单一,难以反映真实世界的空间认知复杂度。核心框架:基于神经科学中的认知地图理论,提出五级分层空间认知框架,从低到高依次为:观察(L1):识别物体及其属性(如类别、尺寸);拓扑与关系(L2):理解实体间空间关系(如相邻、方位、连通性);符号推理(L3):将视觉符号映射为抽象含义并进行规则推理;因果推理(L4):推断动作或环境变化的时空依赖与结果;规划(L5):整合前四级能力生成目标导向的行动或导航策略。数据集构建:打造大规模基准测试集SpatialBench,包含15类空间推理任务(与五级框架一一对应),基于50个第一视角视频生成1347个问答对,覆盖室内外静态/动态场景(如城市道路、森林小径、办公区等),数据通过RGB相机与3D激光雷达同步采集,保证几何信息准确性。评估方法:提出面向高阶能力的统一评估指标,通过自适应权重整合五级任务表现,强调高阶推理能力的重要性;同时开展零样本、少样本(one-shot)及人类对比实验。