核心思想:SeeGround 的核心优势在于它能通过渲染精细的视觉特征(如纹理、颜色、形状)来理解复杂的语言描述。而户外 BEV 方法(如 NuGrounding)的优势在于高效的多视角几何感知。是否可以将两者结合,形成一个分层的、按需渲染的混合框架。利用 BEV 方法的效率和几何准确性进行粗定位和候选筛选,仅在需要精细视觉细节来解决模糊性时,才“按需”启用 SeeGround 的渲染和精细推理能力。

3D 视觉定位(3DVG)是实现高阶人机交互的关键。在室内场景中,以 SeeGround 为代表的零样本方法,通过将 3D 场景渲染为 2D 图像并利用强大的视觉语言模型(VLM),在理解精细视觉属性(如“带有花卉图案的椅子”)方面取得了显著成功。然而,这些方法依赖于静态、完整的 3D 地图,难以适应动态、多视角的户外自动驾驶场景。另一方面,专为自动驾驶设计的 NuGrounding 等框架,采用 BEV 特征和物体查询,高效地处理多视角输入并实现了基础的定位,但它们在理解需要精细纹理或细节的复杂语言描述时能力有限。目前,需要融合 BEV 感知的效率与渲染方法的细节理解能力,以应对复杂户外场景的 3DVG 挑战。

问题和挑战(Problems and Challenges)

将室内渲染式 3DVG 方法应用于户外场景,面临四大挑战:

  1. 视角不匹配:单一渲染视角与多摄像头的现实感知模式冲突。
  2. 场景表示不兼容:静态全局点云假设与流式、动态的 BEV 表示不符。
  3. 动态物体干扰:无法处理场景中的移动物体,视其为噪声。
  4. 实时性要求:高质量渲染的计算开销难以满足自动驾驶的实时性要求。

动机(Motivation)

BEV 方法擅长回答“哪里有几辆车”,但难以回答“哪辆车的车顶有行李架”。SeeGround 的方法正好相反。我们的动机是创建一个能够兼具两者优点的混合框架。该框架在大多数情况下像 BEV 方法一样高效运行,但当且仅当遇到需要精细视觉分辨的模糊指令时(例如,多个同类物体需要靠细节区分),它能“智能化地”切换到渲染模式,进行“放大观察”和精准决策。这种“由粗到精”(Coarse-to-Fine)的策略,旨在以最小的额外成本,实现对复杂人类指令的鲁棒理解。

目标和研究内容(Goals and Research Content)

目标:开发新型混合式 3DVG 框架,该框架以高效的 BEV 感知为基础,并在需要时触发一个轻量化的、查询对齐的渲染模块,以解决精细视觉模糊性,从而实现户外动态场景下的鲁棒、精准、高效的视觉定位。

具体研究内容

  1. 设计 BEV 候选筛选模块:利用 BEV 检测器生成初步的 3D 物体候选集,并通过视觉语言模型(VLM)进行第一轮基于语义的粗略筛选。
  2. 开发歧义驱动的按需渲染机制:研究一种触发机制,当粗略筛选后仍存在多个候选物体时,自动触发渲染流程。
  3. 构建轻量化查询对齐渲染器:实现一个仅渲染候选物体及其周边局部环境的渲染器,而非整个场景,以确保效率。
  4. 建立 VLM 决策融合流程:将渲染后的精细视觉特征与 BEV 提供的几何空间信息融合,交由 VLM 进行最终决策。

技术路线(Technical Route)

  1. 步骤一:BEV感知与粗筛选(BEV Perception & Coarse Filtering)

    • 采用强大的多视角3D检测器(如StreamPETR)作为骨干网络,从多视角图像中提取BEV特征和一组3D物体提案(Object Queries)QobjQ_{obj}Qobj。每个提案包含位置、尺寸和类别等几何先验。
    • 将用户文本查询QQQQobjQ_{obj}Qobj的简化描述(例如“场景中有3辆汽车,2个行人”)输入视觉语言模型(VLM)。VLM输出缩小的候选集Qcandidate⊆QobjQ_{candidate} \subseteq Q_{obj}QcandidateQobj
  2. 步骤二:歧义判断与渲染触发(Ambiguity Judgement & Rendering Trigger)

    • 系统检查候选集QcandidateQ_{candidate}Qcandidate的大小。若大小为1,则定位成功,流程结束。
    • 若大小大于1,则判定存在歧义,触发“按需渲染模块”。
  3. 步骤三:查询对齐的局部渲染(Query-Aligned Local Rendering)

    • 该模块继承SeeGround的PAM思想但大幅简化加速:
    • 渲染目标:仅渲染QcandidateQ_{candidate}Qcandidate中物体的点云及其局部上下文,而非整个场景。
    • 视角选择:以候选集几何中心为“锚点”,计算能最佳观察候选物体差异的视角,渲染包含这些物体的2D图像IrenderedI_{rendered}Irendered
  4. 步骤四:多模态融合与最终决策(Multimodal Fusion & Final Decision)

    • 借鉴SeeGround的FAM思想,在IrenderedI_{rendered}Irendered上为每个候选物体应用视觉提示(如标记点),生成带标记图像ImarkedI_{marked}Imarked
    • 将原始查询QQQ、标记图像ImarkedI_{marked}Imarked及候选物体的3D空间描述输入VLM。
    • VLM利用ImarkedI_{marked}Imarked提供的精细视觉线索(如车辆颜色/形状细节),从候选者中选出最终目标物体。

创新:首个融合高效BEV感知与精细按需渲染的混合式3DVG框架,解决户外场景效率与细节理解的矛盾

创新:设计歧义驱动的渲染机制轻量化局部渲染流程,实现高成本渲染操作的精准调用

贡献:通过构建NuGrounding-FineGrained测试集,提供贴近真实人机交互的新评估基准,推动领域向精细化语义理解发展

  • 高阶人车交互:支持乘客下达精细指令(例:“跟随顶有皮划艇的SUV”),提升自动驾驶交互能力
  • 远程遥操作与城市管理:使操作员可精准控制设备(例:“检查涂鸦电箱”),提高远程操作精度
  • 高精地图自动化标注:自动为地图添加带精细视觉属性的语义标签(例:特定样式建筑/交通标志)

GeoVLM-Ground: Fusing Geospatial Priors and Temporal Reasoning for Zero-Shot 3D Visual Grounding in Dynamic Outdoor Scenes

将SeeGround的 “视觉感知” 能力,与 “地理空间知识”“时序动态推理” 相结合,构建一个能够理解复杂动态室外场景的新框架。

地理语义增强的混合场景表示 (Geospatial-Semantic Hybrid Representation)
  • 动机: 克服室外场景的无限尺度和复杂参照系问题。纯点云不足以承载室外的丰富信息。
  • 内容: 抛弃SeeGround单一的点云表示,构建一个融合了几何信息 (LiDAR)、视觉信息 (Camera) 和地理语义信息 (HD Map) 的多层混合场景表示。
  • 技术路线:
    1. 数据对齐: 使用室外数据集(如nuScenes, Waymo)中的LiDAR序列、相机图像、以及高精地图(HD Map)。通过GPS/IMU数据,将点云、图像和地图在统一的世界坐标系下对齐。
    2. 语义注入: 将高精地图中的语义信息(如车道线、人行道、交通标志、建筑轮廓)与点云进行融合。
    3. 新一代“Object Lookup Table”: 创建一个“增强版OLT”。表中的每个物体不仅有3D坐标 ,还关联了它的地理语义属性(例如,“ID: 101, 类别: 汽车, 坐标: [x,y,z], 所在车道: 左转道, 街道: XX大道”)。
    4. VLM输入改造: 将这些丰富的地理语义信息文本化,与渲染图一起作为VLM的输入,使其具备理解“在人行道上的那个人”的能力。
时空联合的动态视角规划 (Spatio-Temporal Dynamic Viewpoint Planning)
  • 动机: SeeGround的静态视角选择(PAM)在动态场景中失效。我们需要一个能理解“过程”和“事件”的视角规划器。
  • 内容: 将PAM升级为时空视角规划模块(ST-PAM)。其输出不再是一个静态的最佳视角,而是一段最优的虚拟相机“观察轨迹”,这段轨迹能够最好地捕捉语言描述中的动态事件。
    • 技术路线:
      1. 事件解析: 使用大模型(LLM/VLM)解析查询,识别出其中的动态谓词(如“正在右转”、“即将通过路口”)和参与实体。
      2. 轨迹生成: ST-PAM的目标是在4D时空(3D空间+时间)中,规划一条能够清晰观察到这个动态事件发生过程的路径。例如,对于“正在右转的卡车”,最优观察轨迹可能是从侧方跟随,然后在交叉口前方观察其完成转弯。
      3. 多视角序列渲染: 沿规划出的最优轨迹,渲染一个短视频或一系列关键帧图像,而非单张静态图。这个图像序列送入VLM,使其能“看到”整个动态过程。
基于运动预测的动态实体定位 (Motion-aware Dynamic Entity Grounding)
  • 动机: 对户外移动物体(车辆、行人)的定位,一个静态的3D框是不够的,甚至是没有意义的。

  • 内容: 模型的最终输出应为一个动态实体,即一个带有运动状态和轨迹的目标。

  • 技术路线:

    1. 轨迹关联: 在数据预处理阶段,首先利用跟踪算法(Tracking)为场景中的所有动态物体生成轨迹(Tracklets)。增强版OLT中存储的不再是单个坐标,而是物体的历史轨迹。
    2. VLM输出改造: 改造VLM的输出格式。在最终的Prompt中,要求VLM不仅识别出目标ID,还要基于其观察到的运动序列,选择出最符合描述的轨迹ID
    3. 运动状态描述: 可以进一步要求VLM用自然语言描述其定位目标的运动状态(例如,“已定位到ID为101的蓝色汽车,它正在以20km/h的速度直行”),这可以作为一种可解释性的验证。
  • ZSVG3D的核心思想: 它使用一个LLM(如GPT-4)作为“代码生成器”或“推理引擎” 。LLM不直接看图,而是通过分析文本描述和给定的物体列表,生成一段Python代码来执行空间关系判断,最终筛选出目标物体 。

  • ZSVG3D的优点:

    • 强大的逻辑推理和规划能力: LLM擅长分解复杂任务、进行符号逻辑推理。对于“A在B和C之间”这类复杂关系,程序化方法可能比VLM的感性直觉更可靠。
  • ZSVG3D的缺点:

    • 缺乏视觉感知: 正如SeeGround所批评的,它无法利用颜色、纹理等视觉信息,是“盲人摸象” 。
  • 对我们户外课题的借鉴:

    • 采用“规划-执行”混合架构: 我们可以借鉴ZSVG3D的思路,但不完全照搬。我们可以使用一个强大的LLM(如GPT-4o)作为顶层“任务规划器”,而我们设计的GeoVLM-Ground系统作为底层“感知执行器”
    • 工作流程:
      1. 任务分解: 用户输入复杂户外指令(“找到那辆在市政厅前减速让行的白色SUV”)。
      2. LLM规划: LLM将指令分解为子任务序列:[1. 定位‘市政厅’(地理查询)。 2. 在‘市政厅’前识别所有‘SUV’(视觉+地理查询)。 3. 观察这些SUV的轨迹,找出有‘减速’行为的(时序查询)。 4. 从中筛选出‘白色’的(视觉查询)]
      3. GeoVLM执行: 我们的GeoVLM-Ground系统按顺序执行这些子任务,利用其融合了地理、视觉和时序的能力完成每一步,最终返回结果。

Clarify-and-Ground: An Interactive 3D Visual Grounding Framework via Multi-turn Dialogue and Active Viewpoint Selection

  • 整体核心研究动机:
    现实世界中,人类的指令往往是模糊、不完整或带有歧义的。例如,当房间里有多把椅子时,“把那把椅子上的书拿给我”就是一个不明确的指令。现有3DVG方法(如SeeGround)是被动式的,它们只能根据单次指令进行“一锤子买卖”式的猜测,一旦信息不足就很容易失败。而人类在遇到歧义时,会通过提问来澄清(“你是说蓝色那把还是红色那把?”)。本研究的核心动机就是赋予3D定位模型这种主动澄清歧义的能力,将3DVG从一个被动的感知任务,升级为一个主动的、可交互的协同任务

  • 核心研究目标:
    开发一个名为“Clarify-and-Ground”的交互式3D视觉定位框架。该框架能够:

    1. 在感知到指令歧义时,主动向用户生成并提出澄清性问题
    2. 理解用户的多轮对话反馈,动态更新自己对目标的“信念”
    3. 在信息依然不足时,主动选择新的、信息量更大的视点进行观察以获取决策证据。
    4. 最终,在歧义消除后,实现高精度的目标物体定位。
  • 问题与难点:

    1. 问题: 如何让模型在零样本(Zero-Shot)或少样本(Few-Shot)的设定下,实现从“被动定位”到“主动交互式定位”的跨越?
    2. 难点1:歧义感知与问题生成: 模型如何量化自身的不确定性,并判断“何时”需要提问?在确定提问后,如何生成一个高质量、有针对性的问题(例如,精准地问出两个相似物体的区别)?
    3. 难点2:对话历史的融合与信念更新: 模型如何将用户的回答(新信息)与之前的视觉观察和历史对话进行有效融合,并更新对场景中各个物体的定位概率
    4. 难点3:对话驱动的主动视觉探索: 当对话信息仍不足以做出判断时(例如,用户说“有划痕的那一个”,但划痕在物体背面),模型如何推理出自己需要移动到新的视点,并规划这个“主动看一眼”的动作?
不确定性建模与主动问询模块 (Uncertainty Modeling & Active Query Module)
  • 动机: 交互的第一步是让模型“知之为知之,不知为不知”。模型必须能感知到自己的“困惑”,才能发起对话。
  • 内容: 设计一个模块,用于评估多模态大语言模型(MLLM)在单次定位任务中的不确定性。当不确定性超过阈值时,触发问题生成器,向用户发起澄清请求。
  • 技术路线:
    1. 不确定性量化: 在MLLM完成初步定位后,分析其输出。可以采用几种方法量化不确定性:
      • 概率分布熵: 查看模型对场景中所有候选物体的打分(Logits)分布。如果多个物体的得分非常接近,说明模型很“纠结”,此时的概率分布熵较高。
      • Monte Carlo Dropout: 在模型的推理阶段多次启用Dropout,得到多个不同的定位结果。如果结果一致性差,说明不确定性高。
    2. 触发与问题生成: 当量化的不确定性 > 阈值 τ\tauτ 时,触发提问。利用MLLM强大的语言能力,通过精心设计的Prompt来生成问题。Prompt中应包含上下文信息:
      • Prompt示例: “任务:定位‘椅子’。我识别出两个高度相似的候选目标:[物体A,ID:3,颜色:蓝色] 和 [物体B,ID:5,颜色:红色]。请你扮演一个智能助手,生成一个向用户提问以区分这两个物体的自然语言问题。”
      • 模型输出: “请问您指的是蓝色的椅子还是红色的椅子呢?”
  • 创新点:
    • 首次在3DVG中引入闭环的、由不确定性驱动的主动问询机制
    • 将MLLM的角色从单纯的“识别器”扩展为“对话者”,实现了通过沟通来解决视觉定位难题的新范式。
对话驱动的信念更新与主动视角选择 (Dialogue-driven Belief Update & Active Viewpoint Selection)
  • 研究动机: 得到用户的回答后,模型需要消化新信息,并可能需要通过“亲眼看看”来最终确认。

  • 核心内容: 设计一个模块,用于处理用户的语言反馈,更新模型对目标的信念。如果信念仍无法收敛到唯一解,则进一步规划一个主动的视角变换动作。

  • 技术路线:

    1. 信念更新: 将用户的回答(例如,“我指的是蓝色的”)作为新的信息,与完整的对话历史和视觉信息一起,再次输入给MLLM。这会显著提升“蓝色椅子”的定位得分,并抑制其他物体的得分,从而更新模型的信念状态。
    2. 主动视角选择决策: 如果用户的回答引入了当前视角无法验证的新属性(例如,“靠窗户的那一个”,但当前视角背对窗户),模型需要决策去换个视角。
    3. 视角规划: 再次利用MLLM的推理能力,生成下一步的动作。
      • Prompt示例: “用户信息:‘靠窗户的那一个’。我当前视角无法看到窗户。候选物体A在坐标[x1,y1,z1],候选物体B在坐标[x2,y2,z2]。为了验证哪个物体靠窗,请规划一个最佳的下一个观察视点(以相机坐标或相对移动指令描述)。”
      • 模型输出: “移动到坐标[x3,y3,z3],朝向窗户方向进行观察。”
  • 创新点:

    • 实现了对话驱动的信念状态迭代更新,使定位过程更加动态和智能。
    • 将SeeGround中的被动视角选择,升级为由对话驱动的目标导向的主动视角选择,是“主动感知”(Active Perception)在3DVG领域的具体应用。
  • Setting与Baseline:

    • 模型设置: 采用预训练好的、具备强大视觉理解和对话能力的多模态大语言模型(如 GPT-4o, LLaVA-NeXT, Qwen-VL-Max)作为核心引擎,进行零样本或少样本的Prompting。
    • 核心Baseline:
      1. 非交互式Baseline (Ablation): 使用同一个MLLM,但只进行第一轮的被动定位,不进行任何后续的提问与交互。这是对比交互带来性能提升的最直接基线。
      2. SOTA被动式方法: 与 SeeGround, ZSVG3D 等当前最先进的非交互式3DVG方法进行比较。
  • 数据集:

    • 目前缺少标准的交互式3DVG数据集。
    • 方案:模拟交互数据集。使用现有的 ScanReferNr3D 数据集。针对其中存在多个同类干扰项的“ambiguous”样本,构建一个“用户模拟器”(可由另一个LLM如GPT-3.5扮演)。当我们的模型提问时,模拟器根据真值(Ground Truth)提供标准回答。这是在缺乏专用数据集时,领域内普遍接受的、有效的研究方法。
  • 评价指标:

    • 最终任务成功率 (Final Task Success Rate): 在对话结束后,模型是否成功定位到正确的物体。这是最重要的指标。
    • 首次尝试成功率 (First-Try Success Rate): 在任何交互发生前,模型的定位成功率。
    • 交互增益 (Interaction Gain): 最终成功率 - 首次成功率,直接衡量交互带来的好处。
    • 对话效率 (Dialogue Efficiency): 达成成功定位所需的平均对话轮次。
  • 实验设计:

    • 对比实验:
      • Clarify-and-Ground最终任务成功率与所有Baseline进行比较,证明其整体优越性。
      • 比较 Clarify-and-Ground首次尝试成功率与Baseline,确保基础定位能力没有下降。
    • 消融实验 (Ablation Study): 这是验证我们核心创新点的关键。
      1. 去掉主动问询模块: 模型能感知不确定性,但不能提问,只能靠自己“瞎猜”。用以验证“对话”的价值。
      2. 去掉主动视角选择: 模型可以提问并获得回答,但不能移动。用以验证“主动观察”的价值。
      3. 对比不同不确定性量化方法: 对比基于熵和基于MC Dropout的方法,看哪种能更有效地触发交互。

Scene-RAG: A Retrieval-Augmented Generation Framework for Decomposable 3D Visual Grounding in Complex Scenes

  • 整体核心研究动机:
    现有3DVG方法(如SeeGround)试图通过“场景压缩”的方式来解决问题:即将一个复杂的3D场景压缩成一张或几张渲染图和一段描述性文字,然后送入大模型(MLLM)进行“一次性”的理解和定位 。这种方法的核心瓶颈在于MLLM的上下文窗口(Context Window)。当3D场景变得非常大、物体数量极多时(例如整个楼层、博物馆或大型仓库),任何形式的“压缩”都会导致严重的信息损失,MLLM无法处理如此海量的信息,性能会急剧下降。
    本研究的动机是:彻底抛弃“场景压缩”的思路,将3DVG问题重新范式化为RAG问题。我们不期望模型一次性“看懂”整个场景,而是让模型扮演一个主动的推理引擎,通过迭代式地从一个结构化的3D场景知识库中检索(Retrieve)最相关的信息,来逐步推理并逼近最终答案。

  • 核心研究目标:
    开发一个名为“Scene-RAG”的全新3DVG框架。该框架将:

    1. 把3D场景预处理成一个可检索的多模态知识库,其中每个物体都是一个可查询的“文档”。
    2. 让MLLM作为推理核心,通过迭代式地分解用户查询、生成子查询、并从知识库中检索信息来构建推理链。
    3. 利用检索到的多模态信息(文本、图像、空间关系)来增强MLLM的上下文(Augmented Generation),指导其进行下一步推理或给出最终定位结果。
  • 要解决的问题与难点:

    1. 问题: 如何将一个连续、非结构化的3D空间(点云)转化为一个离散、结构化、可高效检索的多模态知识库?
    2. 难点1:3D场景的索引化 (Indexing): 如何为场景中的每个物体建立一个包含文本、视觉和空间信息的综合索引?如何设计编码器(Encoder)和向量数据库,使其能够支持对3D属性(如位置、大小)和多模态特征(如外观、类别)的联合查询?
    3. 难点2:检索器的设计 (Retriever Design): 如何设计一个能够理解自然语言子查询并从3D知识库中精确检索出相关物体信息的检索器?这个检索器需要支持混合检索(例如,基于文本相似性检索“椅子”,再基于空间关系过滤出“靠近窗户的”)。
    4. 难点3:推理-检索循环的构建 (Reasoning-Retrieval Loop): 如何设计一套有效的Prompting策略,让MLLM能够自主地进行查询分解、意图理解,并与检索器进行多轮交互,形成一个稳健的“思考 -> 检索 -> 再思考”的闭环?
  • 实际意义与应用前景:
    此框架将使3DVG技术能够扩展到前所未有的大规模和复杂场景,例如在大型商场中定位某个特定商品,在工厂仓库中找到某个零件,或在博物馆中导航到某件展品。它为大模型在需要海量空间知识的具身智能(Embodied AI)应用中落地提供了全新的、可扩展的解决方案。

面向检索的多模态3D场景知识库构建 (Constructing a Retrieval-Oriented Multi-modal 3D Scene Knowledge Base)
  • 研究动机: RAG的第一步是拥有一个高质量的知识库。原始点云无法直接被检索。
  • 核心内容: 将每个3D场景预处理为一个以物体为中心(object-centric)的结构化多模态数据库
  • 技术路线:
    1. 物体实例分割与提取: 使用现成的3D检测器(如Mask3D)从场景中分割出所有物体实例。
    2. 多模态特征提取: 对于每个物体实例,提取并存储以下信息,构成一个“物体文档”:
      • 文本信息: 物体类别标签(chair)、唯一的实例ID、3D中心坐标、尺寸、颜色等文本化描述。
      • 视觉信息: 从多个标准视角(如正面、45度角、俯视)为该物体单独渲染高清的特写图像(Close-up Images)
      • 空间关系信息: 预计算并存储该物体与邻近K个物体的空间关系图 (Spatial Relation Graph),如“位于ID:5物体之上”、“邻近ID:8物体”。
    3. 索引与存储:
      • 使用多模态编码器(如CLIP)为每个物体的文本描述和视觉特写图像生成高维特征向量。
      • 将这些向量存入一个向量数据库(如FAISS, Milvus),以支持高效的语义和视觉相似度检索。
      • 空间关系图则存入图数据库或关系型数据库中。
  • 创新点:
    • 范式革新: 将3D场景从一个整体的“感知对象”转变为一个由众多“多模态文档”组成的、可查询的知识库,这是对3DVG问题表示的根本性创新。
    • 信息解耦: 将物体的语义、视觉、空间信息解耦并分别索引,支持更灵活、更精确的检索。
基于迭代式查询分解的检索与推理循环 (Iterative Query Decomposition with a Retrieve-Then-Reason Loop)
  • 研究动机: 复杂指令(“找到离门最远的那张桌子前面的椅子”)无法通过单次检索完成,需要多步推理。

  • 核心内容: 设计一个迭代式推理框架,其中MLLM是“大脑”,检索器是“眼睛和手”。MLLM通过多轮次的“检索-推理”循环,逐步缩小目标范围。

  • 技术路线 (The Loop):

    1. 初始分解 (Decomposition): MLLM接收用户完整查询。第一步不是定位,而是生成第一个子查询。对于上述例子,第一个子查询可能是最简单的部分:retrieve("door")
    2. 检索 (Retrieval): 检索器接收retrieve("door")指令,在向量数据库中找到与“door”最匹配的物体,并返回其完整的“物体文档”(包含ID, 坐标, 特写图等)。
    3. 增强生成与推理 (Augmented Generation): 检索到的“door”的信息被整合到新的Prompt中,送回给MLLM。MLLM现在知道了门的位置。它基于这个新知识进行第二步推理,生成下一个子查询,例如:retrieve("table")
    4. 迭代与精化 (Iteration & Refinement): 重复上述过程,在检索到所有“桌子”后,MLLM会生成一个更复杂的混合查询,例如:filter(retrieved_tables, "farthest_from", retrieved_door),这一步可能需要调用一个计算距离的外部函数。在确定目标桌子后,再进行最后一次查询:retrieve("chair", "in_front_of", target_table)
    5. 最终决策: 当候选目标被缩小到唯一或极少数时,MLLM整合所有检索到的证据链,给出最终的定位答案。
  • 创新点:

    • 动态推理链: 引入了动态、多步的推理链来解决复杂的3DVG任务,相比SeeGround的单步“感知-定位”模式,在可解释性和处理复杂问题的能力上是质的飞跃。
    • 混合检索策略: 框架支持不同类型的检索,包括基于语义的向量检索、基于空间关系的图查询和基于属性的函数调用,大大增强了系统的灵活性。
  • Setting与Baseline:

    • 模型设置: 核心推理引擎采用一个强大的预训练MLLM(如GPT-4o, Gemini 1.5 Pro)。检索器部分基于CLIP等编码器和FAISS向量库构建。
    • 核心Baseline:
      1. SOTA非RAG方法: SeeGroundZSVG3D 以证明新范式的优越性。
      2. 非迭代式RAG (Ablation): 只进行一次检索(将整个用户查询编码后检索一次),而不是迭代式检索。用以证明多步分解推理的必要性。
      3. 上下文填充 (Naive Context Stuffing): 将场景中所有物体的文本描述拼接起来,强行塞入MLLM的上下文窗口,直到超出限制。这将直观地展示非RAG方法在复杂场景下的局限性。
  • 数据集:

    • 使用 ScanReferNr3D 数据集。特别关注其中被标记为“Hard”或“Multiple”的子集,因为这些样本最能体现Scene-RAG在处理复杂关系和歧义时的优势。
    • 构建挑战性测试集: 为了验证可扩展性,可以程序化地将多个ScanNet场景拼接成一个更大的“楼层”场景,人为增加物体数量和场景复杂度,以测试各方法在极限情况下的性能表现。
  • 评价指标:

    • 任务成功率 (Success Rate @0.5 IoU): 最核心的定位精度指标。
    • 可扩展性曲线 (Scalability Curve): 绘制成功率随场景中物体总数变化的曲线。预期Scene-RAG的性能下降会远比基线平缓。
    • 推理效率 (Reasoning Efficiency): 达成定位所需的平均检索轮次数。
  • 实验设计:

    • 对比实验: 在标准和自建的挑战性测试集上,全面比较Scene-RAG与所有Baseline的上述指标,尤其是在复杂场景下的成功率和可扩展性。
    • 消融实验:
      1. 检索内容消融: 分别测试只使用文本信息检索、只使用视觉信息检索、以及使用多模态联合检索的效果,验证多模态知识库的价值。
      2. 推理步骤消融: 对比迭代式推理和单步RAG的性能,验证迭代分解的有效性。
      3. 知识库结构消融: 对比使用完整知识库(含空间关系图)和不含空间关系图的简化知识库,验证预计算空间关系的必要性
研究现状

目前,零样本3DVG的研究主要分为两条路径:

  • 基于LLM的文本/程序驱动方法:如 LLM-GrounderZSVG3D 等工作,它们将3D场景信息文本化或程序化,利用LLM强大的代码生成和逻辑推理能力进行定位。这类方法的优势在于推理能力强,但往往忽略了丰富的视觉细节(如颜色、纹理、精细形状),因为文本描述本身就是一种信息损失 。
  • 基于VLM的视觉驱动方法:如 SeeGround ,它巧妙地将3D场景转换为2D VLM兼容的格式(即渲染图像+文本描述),从而利用VLM强大的2D视觉理解能力。这种方法保留了视觉信息,在室内数据集上取得了SOTA性能 。
问题与挑战

尽管 SeeGround 的思路非常新颖,但将其直接应用于室外场景会面临其在论文中未深入探讨的、更加严峻的挑战:

  1. 室外LiDAR数据的极端稀疏性:室外场景主要依赖LiDAR采集点云,其密度随距离增加而急剧下降,导致远处物体可能只有寥寥数个点,几何细节严重缺失。同时,大量的点属于地面、建筑外墙等背景区域,这些“噪声”信息会严重干扰模型对关键物体特征的提取和与语言描述的对-齐。
  2. 渲染质量与真实性的鸿沟SeeGround 依赖于从点云渲染出的2D图像。对于稀疏、带噪声的室外点云,渲染出的图像质量可能很差,充满伪影,甚至无法辨认物体。这会严重影响VLM的判断力,其在高质量2D图片上学到的知识难以迁移。
  3. 开放世界与长尾物体的挑战:室外场景包含近乎无限的物体类别和状态(各种品牌型号的汽车、不同样式的建筑、临时路障等),简单的分类标签无法覆盖。零样本方法必须具备强大的泛化能力来应对这些长尾分布。
动机

直接从稀疏、低质量的室外观测数据中进行3DVG是极其困难的。人类在面对模糊信息时,会主动联想和调用先验知识来辅助判断。例如,看到远处一个模糊的“小方块”,结合“它在路上”的上下文和“它在移动”的状态,我们会联想到它“可能是一辆汽车”。本研究的核心动机就是赋予模型这种“联想”和“调用知识”的能力,将稀疏的观测作为线索(Clue),去检索和利用外部的、密集的、高质量的“世界知识”来增强理解和推理。

目标

旨在研发一个名为 Outdoor-RAG-3DVG 的新型零样本室外3DVG框架。该框架以一个强大的VLM(如Qwen-VL-72B)为核心,通过一个**双源检索增强生成(Dual-Source RAG)**机制,解决由数据稀疏性引发的视觉信息缺失和推理困难问题。

  • 要解决的问题:如何在零样本设定下,精确地在稀疏、复杂、大规模的室外3D场景中,根据自然语言指令定位目标物体,特别是那些细节缺失的远距离、小目标或长尾物体
  • 难点
    1. 如何为一个仅由少数点云构成的稀疏物体,构建一个有效的、可供检索的表示?
    2. 如何构建一个既全面又高效的外部世界知识库?
    3. 如何设计VLM的推理过程,使其能智能地权衡来自场景的稀疏证据来自外部的密集知识,避免产生“幻觉”?
  • 实际意义:本研究若成功,将极大推动3DVG技术在自动驾驶中的实际应用,例如,实现更自然的人车对话交互(“帮我留意一下前面那辆闪着双闪的货车”),为规控模块提供更丰富的场景语义理解。同时,通过减少对昂贵3D标注的依赖,加速相关领域的研究迭代。
基于查询的动态视角生成与场景结构化
  • 研究动机:直接处理整个室外场景的点云计算成本高且信息密度低。SeeGround 证明了基于查询的动态视角是有效的 。我们需要将此思想应用于室外,为VLM和后续的RAG提供一个高质量、高相关的“第一视角”。
  • 核心内容:设计一个模块,将原始的、广阔的室外场景,根据语言指令,动态地转换成一个VLM友好的、包含“一张关键图片 + 一份结构化文本”的多模态输入。
  • 技术路线
    1. 场景预处理:使用一个开放词汇的3D检测器对场景进行初步扫描,生成一个包含所有潜在物体的3D包围框和初步类别标签,存入对象查找表(Object Lookup Table, OLT)
    2. VLM指令解析:使用VLM(如Qwen-VL)解析用户指令,识别出核心的**[目标][锚点]**。例如,指令“找到白色SUV右边的那个消防栓”,[目标]是“消防栓”,[锚点]是“白色SUV”。
    3. 动态视角选择与渲染:以[锚点](“白色SUV”)在OLT中的3D位置为中心,运用 SeeGround 提出的视角自适应模块(Perspective Adaptation Module, PAM) 的思想,计算出一个最佳的虚拟相机位姿,渲染一张既能清晰展示锚点,又能包含其周围环境(特别是“右边”区域)的2D图像。
  • 明确的创新点
    • 将室内场景验证过的动态视角选择策略,首次适配并应用于大规模、稀疏的室外3DVG任务中。
    • 为后续的RAG模块提供了一个高质量、上下文丰富的视觉入口点,解决了直接处理全局点云的难题。
用于稀疏物体增强推理的双源RAG框架
  • 研究动机:研究内容一生成的渲染图可能依然存在物体模糊、细节缺失的问题。为了做出精确判断,模型必须超越当前所见,这正是RAG的用武之地。

  • 核心内容:构建一个双源RAG系统。当VLM对渲染图中的某个稀疏物体(候选目标)感到“困惑”时,它会主动发起检索,从内部场景上下文(OLT)外部世界知识库中获取增强信息,辅助最终决策。

  • 技术路线

    1. 构建外部世界知识库(Offline):收集海量关于常见室外物体(如各种型号的汽车、交通标志、建筑风格)的高清图片、3D模型、文本描述,并用VLM将其编码为多模态嵌入,存入一个向量数据库。

    2. 设计RAG推理流程(Online)
      a. VLM接收到研究内容一生成的渲染图结构化OLT文本以及原始指令
      b. VLM在图上定位到候选目标(例如,一个模糊的物体),但无法确认它是否是“消防栓”。
      c. 触发检索:VLM提取这个模糊物体的视觉特征,形成一个查询向量
      d. 双源检索

      • 内部检索:利用该向量和空间位置,在OLT中查找其更详细的结构化文本信息(如包围框尺寸、邻近物体)。
      • 外部检索:利用该向量,在“世界知识库”中检索最相似的物体。数据库可能返回多个高清的“消防栓”图片和描述。

      e. 增强推理与决策:VLM的最终推理是基于一个增强后(Augmented)的上下文,包括:原始指令 + 关键渲染图 + OLT的精确空间关系 + 世界知识库提供的“高清范例”。基于这些丰富信息,VLM可以高置信度地判断:“图中那个模糊的红色柱状物,其位置和稀疏轮廓与知识库中的‘消防栓’高度匹配,因此我确定它就是目标。”

  • 数据集:选用大规模室外自动驾驶数据集nuScenes。由于nuScenes没有原生的3DVG标注,我们将基于其衍生的两个数据集进行改造和评估:

    1. Talk2Car:包含指向特定车辆的自然语言指令,适合用于验证基本的车辆接地能力。
    2. TOD³Cap:包含对场景中所有物体的密集文本描述。我们可以将其逆向转换为接地任务:给定描述,定位物体。这可以用来评估对各类物体的细粒度接地能力。
  • 评价指标:采用3DVG领域的标准指标:成功率 @ IoU阈值(Success Rate @ IoU Threshold)。即预测的3D包围框与真实包围框的交并比(IoU)大于某个阈值(如0.25, 0.5)的比例,记为 Acc@0.25Acc@0.5

为了验证我们方法的先进性,我们将选择以下几类SOTA方法作为基线:

  1. Zero-Shot LLM-basedLLM-Grounder , ZSVG3D 。检验纯文本推理方法在室外稀疏场景的表现。
  2. Zero-Shot VLM-basedSeeGround 。这是我们最重要的Baseline,通过将其在室外数据集上进行复现,来直接对比我们的RAG框架带来的提升。
  3. Fully-Supervised (作为参考上限):Talk2Car等数据集上的原始监督学习模型。用于展示当前零样本方法与监督学习方法之间的差距。
  • 对比实验:在Talk2Car和TOD³Cap数据集上,将我们的Outdoor-RAG-3DVG与所有Baseline进行全面的性能对比。重点分析在远距离子集小目标子集含混描述子集上的性能增益,以凸显我们方法的优势。
  • 消融实验 (Ablation Study):为了验证我们框架中每个设计的重要性,我们将进行以下消融研究:
    1. 验证动态视角(研究内容一):对比我们的“查询对齐视角”与几种静态视角(如固定的前视角、鸟瞰图视角)的性能差异。
    2. 验证RAG模块(研究内容二)
      • 完整模型:Outdoor-RAG-3DVG (动态视角 + 双源RAG)。
      • 无RAG (类SeeGround):仅使用动态视角生成的“图片+文本”,不进行任何检索增强。
      • 仅内部RAG:只使用场景内的OLT信息进行检索增强,不使用外部世界知识库。
      • 仅外部RAG:只使用外部世界知识库,不使用内部OLT。
        通过这组实验,我们可以清晰地量化动态视角内部上下文外部知识各自带来的性能贡献。
Logo

智能硬件社区聚焦AI智能硬件技术生态,汇聚嵌入式AI、物联网硬件开发者,打造交流分享平台,同步全国赛事资讯、开展 OPC 核心人才招募,助力技术落地与开发者成长。

更多推荐