Skip to content

GeoText-1652: Towards Natural Language-Guided Drones

  • 来源: https://arxiv.org/abs/2311.12751
  • 日期: 2024-11-20 (ECCV 2024)
  • 标签: text-image-retrieval, uav, drone, benchmark, spatial-relation, vision-language
  • 研究方向: Computer Vision → Vision-Language → Cross-modal Retrieval (Drone Navigation)
  • 作者: Ming Dai, Enhui Zheng, Zongxia Xie, et al. (MultimodalGeo)
  • 提交日期: 2023-11-21 (v1)
  • 会议/期刊: ECCV 2024
  • 代码: https://github.com/MultimodalGeo/GeoText-1652
  • 项目主页: (无)

摘要

问题: 自然语言引导的无人机导航缺乏高质量图文数据集,且语言与细粒度视觉表征的对齐困难。

方案: 构建 GeoText-1652 数据集(继承自 University-1652 的 query/gallery 组织),并提出 Blending Spatial Matching(融合空间关系匹配)方法,利用区域级空间关系增强图文对齐。

关键创新/贡献

  • GeoText-1652 数据集: 1,652 个 location(701 train / 951 test),每张图配多句自然语言描述(含空间关系词,如 "in the center"、"on the left"),支持 text→image 与 image→text 检索。
  • Blending Spatial Matching: 在跨模态匹配损失之外,引入 grounding loss(词→区域对齐)与 spatial loss(区域间空间关系匹配),两者融合提升检索与定位能力。
  • 验证: 在 XVLM*(Swin + BERT,16M 图像预训练)上微调,检索 Recall 显著超过 ALBEF/XVLM 等基线;消融表明 grounding loss 是检索提升主因。

1 Introduction

背景 & 动机:

  • 无人机需"听懂"自然语言指令完成导航/定位(如搜救、物流)。
  • 现有跨视角地理定位数据集(University-1652、VIGOR)只有图像级标签,无自然语言描述;而纯文本检索数据集不含无人机视角。
  • 仅有图像级 caption 不足以表达"目标在图的哪个方位"——这正是无人机场景的核心难点。

本文定位: 在 University-1652 的 1,652 个 location 基础上,为每图生成自然语言描述(含空间关系),把"跨视角 geo-localization"升级为"自然语言引导的无人机检索"。


原论文 §2 综述两条技术线,并点明本文与它们的区别:

2.1 Cross-view Geo-localization(跨视角地理定位)

  • 目标:把不同视角(无人机/卫星/地面)拍的同一地点图像关联起来,核心是提取视角不变(viewpoint-invariant)的判别性视觉表征
  • 代表工作:
    • Wang et al. 划分策略(partitioning)用图像多部位丰富特征;Lin et al. 用新注意力模块发现关键点、聚焦显著区。
    • Dai et al. 引入带 content alignment 的 transformer 结构;Yang et al. 利用自注意力与 Ground/Aerial 的位置编码特性。
    • Rodrigues et al. 双路网络融合局部区域与全局特征做部分航拍图匹配。
    • 其它增强路线:Shi et al. 融合位姿估计与几何投影做特征匹配;Hu et al. 强调街景图像朝向精度;Chen et al. 在 transformer 中引入跨无人机映射机制。
    • GeoDTR 用两种数据增广同时抓低层细节与空间配置;TransGeo 结合 transformer 灵活性与注意力引导的非均匀裁剪提升关键区分辨率;Dhakal et al. 设计对比学习框架预测地面景物的文本嵌入。
  • 本文区别:上述方法都只做图像↔图像匹配,本文聚焦两个新的「自然语言引导」无人机任务,给用户一种直控无人机的方式。

2.2 Multi-modality Alignment(多模态对齐)

  • 自然语言引导导航可视为 text-to-image retrieval 的子任务。早期工作多在结构设计:
    • 双路网络(dual-path);Wang et al. 用自适应门控处理负对与无关信息、基于融合特征算匹配分;Li et al. 用图卷积做图像区域语义推理。
    • Chen et al. 在大规模预训练中提出 word-region alignment(词-区域对齐);Li et al. 用图像中检测出的 object tags 作锚点缓解对齐学习;Yang et al. 研究属性相关关键词。
    • CLIP(Radford et al.)提出图文对对比学习;Jia et al.(ALIGN)设计简单双编码器对齐视觉与语言;Li et al.(ALBEF)用自训练从伪目标精炼 ITM 损失。
    • Zeng et al.(X-VLM)进一步对齐多区域视觉概念与对应文本;BLIP 用 caption bootstrapping 利用噪声网络数据。
  • 本文区别:不同于这些已有工作,本文引入空间感知(spatial-aware)方法,显式建模细粒度「文本-区域」的空间关系匹配——当相似元素出现在同一图中时,若模型无法辨别其空间关系差异,就会错误对齐,而本文的 grounding + spatial loss 正是为此设计。

注:原论文 §2 是 Related Works,纯文献综述、无新方法;其价值在于交代「图像级 geo-localization」与「图文对齐」两条线的来龙去脉,并据此定位本文贡献(自然语言 + 空间关系)。本 §2 严格对标原文,未掺入非论文内容。


3 Dataset: GeoText-1652(对标原论文 §3)

3.1 规模与组织(原论文 §3.1 + 本项目实测)

论文原描述:在 University-1652 基础上扩展,1,652 栋建筑 / 72 所高校,三平台(Satellite / Drone / Ground),每图标注 3 条全局描述 + 平均 2.62 个 bbox(已过滤低质量框);全局描述平均 70.23 词,区域描述平均 21.6 词

本项目实测(drone-only 过滤后,见 data/reports/train/geotext1652.md):

locations701 (train) / 951 (test,覆盖更多 location)
图像来源University-1652 的 Drone / Ground / Satellite 三平台
train drone-only 图像37,854(过滤 Ground 11,663 + Satellite 701)
train 图文对(展开后)363,816(每图 ~9.6 条)
test drone-only gallery / queries51,319 / 153,957

注:论文本身用全视角(Drone+Ground+Satellite)训练;本项目 DroneCLIP 为低空无人机专用,故 --drone-only 过滤离域平台,仅保留 37,854 张无人机图参与训练。

3.2 标注框架(原论文 §3.2,两阶段 + referee model)

数据集靠 人机交互标注策略 降本增效,分两阶段:

  1. Modality Expansion(模态扩展):对每图用两类 prompt(显著物体 / 全图描述)问 visual-LLM 生成文本;因 LLM 有幻觉/模糊,引入 referee model(LLM 作 teacher 分类正负样本 + 关键词过滤 + 人工抽检)质控,最终每图得 3 条图像级描述 + 9 条区域级描述候选
  2. Spatial Refinement(空间精修):用现成 text-based visual grounding 模型 为区域描述打 bbox;因区域描述含 left/right 等空间词,设空间规则过滤错位的框,并反过来给描述补 vertical 词(upper left / down right)。9 条候选最终平均只留 2.62 个 bbox

3.3 文本特点(关键,连接 §4 的 grounding/spatial loss)

  • 描述强调空间关系:"the white car on the left side"、"the building in the center"——这正是 §4 Blending Spatial Matching 要建模的对象。
  • 本项目实测 token 长度(open_clip SimpleTokenizer,77 token 上限):
    • train 展开后 caption:median 23 / p95 177 / max 311,31.2% 超 75 token 被 CLIP 截断
    • eval drone queries:median 41 / p95 82 / max 165,8.0% 超长
    • 对比 RefDrone(<1% 截断),GeoText-1652 文本侧有损编码明显——长句尾部空间细节在 CLIP 截断后丢失,恰是最该保留的部分(详见附录「77-token 限制」)。

4 Method(对标原论文 §4)

4.1 整体架构(XVLM 三塔)

基于 XVLM:image encoder = Swin Transformer;text encoder = BERT(无 77-token 限制);外加一个 cross-modal encoder(Transformer,做图文深度融合)。在常规图文对比/匹配损失外,新增两类空间损失。

4.2 Image-text Semantic Matching(式 1–4)

ITC(in-batch 对比,式 1–3)+ ITM(hard negative 采样 + cross-modal encoder 二分类,式 4)——传统双塔对齐。

4.3 Blending Spatial Matching(论文核心创新,式 5–6)

  • Grounding loss(式 5):region-level 文本 → 预测 bbox(cross-attention ×6 + MLP),IoU + L1 回归。将空间词(left/center/…)映射到对应区域,是检索提升主因子(见 §5.3 消融)。
  • Spatial loss(式 6):取 3 个 ROI 的 ROI-Pooling 特征,拼成 pair 过 MLP 预测 9 类相对位置(左/中/右 × 上/中/下,由 bbox 中心距定义),显式建模"区域 A 在区域 B 某方位"。

4.4 训练目标与实现细节(式 7;§5.1 实现)

  • 总损失:L_total = L_itc + L_itm + λ(L_grounding + L_spatial)λ=0.1(Table 6 实证最佳,过大反而掉点)。
  • 骨干 XVLM(16M 图预训练);图像 resize 384×384、patch 32;不用随机翻转/旋转(会丢空间信息);评测时去停用词。

5 Experiment(对标原论文 §5)

5.1 实现细节(对标原论文 §5.1)

  • 骨干:XVLM(在 16M 图像上预训练)作 backbone;text encoder = BERT,image encoder = Swin Transformer
  • 优化器:AdamW,weight decay = 0.01,learning rate = 3e-5。
  • 图像预处理:训练时所有图 resize 到 384×384,patch size = 32;仅做轻量增强(亮度调整、identity),不用随机旋转/水平翻转(会丢失空间信息)。
  • 评测:全局描述作 text query 时**去除停用词(stop words)**以保持 query 简洁。

注:原论文 §5.1 仅此实现配置,无结果表格;数据已在 §3(规模/标注)与 §4(Method)铺垫,此处只列超参与训练设置。

5.2 Geo-localization Results(原论文 Table 3:双向检索)

表 5.2|Text→Image / Image→Text 双向检索(Recall@K,%)(节选关键行;XVLM 预训练 16M 图、finetuned 即在 GeoText-1652 上微调)

Method预训练图数Text R@1Text R@5Text R@10Image R@1Image R@5Image R@10
XVLM(仅预训练)16M4.59.913.45.014.421.4
XVLM_finetuned16M13.223.729.625.052.365.1
Ours16M13.7 (+0.5)25.7 (+2.0)32.3 (+2.7)26.2 (+1.2)53.5 (+1.2)66.4 (+1.3)
  • 数据集有效性:对比 XVLM 仅预训练(Text R@1 4.5 / Image R@1 5.0)与 finetuned(13.2 / 25.0),微调后 Recall 翻数倍 → aerial-view 对通用大模型仍难,GeoText-1652 这类专域数据必要。
  • 方法优越性(Ours vs XVLM_finetuned):双向各 K 均提升,且提升集中在 R@5/R@10(把正例往前排),实际部署价值高;R@1 仅 +0.5/+1.2,说明本文主要改善"排序"而非"首位命中"。

5.3 Ablation Study(原论文 Table 4/5/6 + Fig5/6)

表 5.3a|Loss 逐项加(Table 4,baseline=XVLM_finetuned,无 grounding/spatial)

配置Text R@1Text R@5Text R@10Image R@1Image R@5Image R@10
Baseline(无 grounding/spatial)13.223.729.625.052.365.1
+ grounding only13.5 (+0.3)25.4 (+1.7)31.7 (+2.1)25.8 (+0.8)53.0 (+0.7)65.9 (+0.8)
+ spatial only13.3 (+0.1)23.9 (+0.2)29.8 (+0.2)25.1 (+0.1)52.5 (+0.2)65.3 (+0.2)
Ours(两者)13.725.732.326.253.566.4

结论(论文原话):grounding loss 是检索提升主因(单独贡献 Text/Image R@1 +0.3/+0.8);spatial loss 单独贡献极小(仅 +0.1),但两者叠加稳定更好。

表 5.3b|不同训练集(Table 5)

Training Set#imgsText R@1Text R@5Text R@10Image R@1Image R@5Image R@10
Drone only37,85413.123.629.425.451.363.2
Satellite + Ground12,36410.419.224.518.538.750.2
Satellite + Drone + Ground50,21813.725.732.326.253.566.4
  • 多平台混合 > 纯 Drone > Satellite+Ground;混合比纯 Drone 高 +0.6 Text R@1 / +0.8 Image R@1
  • 评测口径提醒(务必严谨):本表(原论文 Table 5)是训练集消融——三行分别对应"训练时用了哪种数据",但评测均在同一个全视角测试集(55,192 图)上完成。它比的是"喂不同训练数据 → 在全视角测试上的表现",并非在 drone-only 测试协议上出数字;原论文从未发布过 drone-only 测试协议的检索结果。
  • ⚠️ 与本项目 drone-only 决策的关系(不可直接比):论文结论是"训练数据多样性(混合)在全视角测试上带来 +0.6 增益",即训练侧多源有益;本项目因 DroneCLIP 专攻低空无人机,在训练与测试两侧都过滤离域平台(drone-only 协议,gallery=51,319 图),这是自定义测试协议,论文无对应项。二者一是训练集差异(同全视角测试)、一是测试协议差异(同砍离域),口径不同、不可直接比,仅可作"训练多源是否有益"的参考。需在实验中实测混合训练是否对专域模型真有益。

表 5.3c|λ 消融(Table 6)

λText R@1Text R@5Text R@10Image R@1Image R@5Image R@10
1.0010.021.227.420.647.160.2
0.5011.122.429.222.850.062.6
0.1013.725.732.326.253.566.4
0.0512.824.431.024.552.764.9
  • λ=0.1 最佳;λ 过大(1.0/0.5)空间 loss 权重过高压制 ITC/ITM,反而掉点。

  • 定性(Fig5/6):Fig5 海上建筑/船等未见场景也能按空间词定位正确 region;Fig6 提供空间描述时比 baseline 更命中"内容相似但空间不对"的干扰图(baseline 只抓 car/sports field 等物体标签,漏掉 "in the center/down side/upper left" 等空间对齐)。


6 Conclusion

GeoText-1652 是首个面向自然语言引导无人机导航的视觉-语言数据集,支持图文双向检索与目标定位;Blending Spatial Matching 通过区域级空间关系提升跨模态检索与泛化。


与我们 DroneCLIP 的关联(重点)

  1. 数据复用:本项目已本地化 GeoText-1652(drone-only 363,816 对训练 / 51,319 gallery 评测),作为比 RefDrone(21,057 对)大 ~17 倍的候选训练源。
  2. 检索协议对齐:沿用论文的 text→image / image→text 双协议;本项目额外提供 drone-only 评测(与 drone-only 训练分布一致),并保留全视角协议作 SOTA 对照。
  3. 文本质量警示:论文未处理 CLIP 77-token 截断,而 GeoText-1652 长 caption 占 31% 被截、丢失的恰是空间细节(论文方法的重点)。这提示我们:若用 GeoText-1652 训练 DroneCLIP,应先过滤/重切超长句,否则空间信号被编码截断削弱。
  4. 方法借鉴:论文证明 grounding loss 对检索最关键——但 XVLM 三塔才有 cross-modal encoder 承载该 loss,我们 DroneCLIP 是 CLIP 双塔,无法直接照搬。若未来引入区域级监督(GeoText-1652 的 bbox 字段已备),需外接 grounding head 或做区域级对比,而非原样加 XVLM 式融合 loss。

个人评价

核心价值: 把"无人机 + 自然语言空间描述"系统化成一个可训练、可评测的基准,填补了 University-1652 只有图像标签、没有语言描述的空白。

可借鉴点:

  • 空间关系词标注思路,对无人机检索("左边那辆车")极有价值。
  • grounding loss 主因子的结论,指导我们若加监督应优先区域级对齐。

实验设计亮点:

  • 同时给 train/test location 数不同(951>701),强制模型泛化到未见 location,设计干净。
  • 全视角 vs drone-only 双协议,兼顾 SOTA 对照与专域评测。

与我们的分歧点:

  • 论文主张多平台混合提升检索;本项目 drone-only 过滤离域。需在实验中实测:对 DroneCLIP 这种专域模型,混合是否真的有益,还是论文结论只适用于通用 XVLM。

疑问解答 (Q&A)

Q1: GeoText-1652 和 RefDrone 在 DroneCLIP 实验中的角色有何不同?

: RefDrone 原任务是 REC(短语→框),我们取其整图 caption 改造成小规模(21k 对)检索基准,噪声小、适合做组件剥离;GeoText-1652 原任务就是图文检索、规模大(364k 对)、含空间关系词,适合做"数据规模/质量"对比。两者都是"整图描述训练",但规模与文本特性差异大,正好构成 mini-ablation 的大小两极。

Q2: 为什么 GeoText-1652 有 31% caption 被 CLIP 截断,论文却没提?

: 论文用 XVLM(BERT 文本编码器,无 77-token 硬上限,且 384×384 图像),其 text side 不受 CLIP 限制;而我们 DroneCLIP 基于 CLIP(77 token 封顶),同样的长 caption 会被截。这是"换 backbone 后新出现的编码瓶颈",论文视角下不存在,故未讨论。我们做对比实验时须自行处理。


附录:官方榜单两个 Test Split 的区别

(来源:GeoText-1652 仓库 README 的 Primary Leaderboard / Hardware-friendly Split 两段。)

两个榜单评测的是同一批模型的检索能力,但 gallery(候选图像池)规模不同,均由官方 Method/re_bbox.py 切换 json 跑出:

Full Test (951 buildings)24GB Test
评测文件test_951_version.jsontest_24G_version.json
含义完整官方测试集,覆盖全部 951 栋建筑(全量 gallery)GPU 友好版,为小显存硬件做的精简测试集
用途主榜单(primary leaderboard),最终结论看这个方便 ≤24GB 显存设备(如 3090/4090 单卡)快速复现/对比
难度高:候选 building 多 → 指标偏低低:候选 building/图更少 → 指标明显虚高
例:NGCG Mean48.269.3
例:官方 Mean36.158.7
  • "24GB" 是硬件友好标签(指 ≤24GB 显存可跑),不是数据量 24GB,也与 77-token 截断无关——官方 LEADERBOARD.md 原话:"GPU-friendly test_24G_version.json evaluation for quick comparison on smaller hardware"。
  • 为什么小硬件能跑、指标却虚高(据 Method/re_bbox.py 评测机理):itm_evalbuilding 排名(inds[i] = img2building[...],target = 该 query 所属 building 在全量 building 列表中的名次)。R@K 的"干扰项"是全部 building——候选 building 越多,排进前 K 越难。24GB 版把参与排名的 building / 候选图规模压到单张 24GB 卡(如 3090/4090)能容纳相似度矩阵与 ITM 重排(sims_matrixscore_matrix 全量驻留半精度显存),故叫"GPU 友好";代价是候选变少 → 所有方法 R@K 都约 +20 点。
  • ⚠️ 未查实项:24GB 版具体压到多少 building / 是否减每栋图数,test_24G_version.json 不在仓库、LEADERBOARD 也未写数字;仅能确认"候选 building 规模变小"是机理必然,不能写死具体数值。
  • DroneCLIP 若上 GeoText-1652 对比:以 Full Test (951 buildings) 为主榜单口径报数;24GB 版仅用于自己快速 debug,不对外比分(高分=候选少所致,非真强)。

背景延伸:视觉塔范式与主流 VLM 调研(非论文内容,连接 §4 的 XVLM 选择)

本节非 GeoText-1652 论文内容,是为理解论文为何选 XVLM、以及我们 DroneCLIP 为何用 CLIP 系列所做的背景调研,故置于全文末尾、与论文正文章节(§1–§6)分开。

范式差异(重要):XVLM 三塔 ≠ CLIP 双塔。CLIP 为 image encoder(ViT) + text encoder(各自 transformer) + 无 cross-modal encoder,靠对比学习把两塔投影到同一空间、点积算相似度。XVLM = Swin(ViT) + BERT + 独立 cross-modal encoder,grounding/spatial loss 作用在融合表征上;CLIP 原生无此融合塔,故论文的 loss 设计不能直接套到我们 DroneCLIP 的 CLIP 双塔——最多后期外接 grounding head 或做区域级对比,而非原样加 loss。

主流 VLM 图像编码器系统调研(结论:清一色 CLIP 系列视觉塔)

模型机构/年份视觉编码器是否 CLIP 系列说明
LLaVA / LLaVA-1.5UW-Madison 2023OpenAI clip-vit-large-patch14-336✅ 原版 CLIP冻结 CLIP ViT-L/14 作视觉塔 + MLP projector + LLM
LLaVA-NeXT / OneVision2024SigLIP / CLIP 混合✅ CLIP 系列NeXT 起用 SigLIP-L 等更强视觉塔
Qwen-VL阿里 2023OpenAI CLIP ViT-bigG✅ 原版 CLIP初代沿用 CLIP 视觉塔
Qwen2-VL / Qwen2.5-VL / Qwen3-VL阿里 2024–25自研 ViT(native dynamic resolution, 2D-RoPE)⚠️ 权重非 CLIP,但仍是 ViT 架构 + 投影 + LLM 的 CLIP 范式视觉塔从头训练,但整体路线是「ViT 视觉塔 + projector + LLM」,与 XVLM 融合塔无关
InternVL / 1.5 / 2 / 2.5 / 3 / 3.5上海AI Lab 2023–25自研 InternViT(1.5 起基于 SigLIP-L 初始化/混合)✅ SigLIP(CLIP 系列)InternViT-6B 融合 CLIP/SigLIP 预训练知识;3.5 版甚至直接挂 GPT-OSS / Qwen3 作 LLM
MiniCPM-V / 2.6OpenBMB 2024SigLIP(SigLip-400M / 改进 SigLIP 架构)✅ SigLIP(CLIP 系列)分层压缩编码器基于 SigLIP,每 token 编码 1024 像素;+ Qwen2
Kimi-VL / -VL-Thinking月之暗面 2025MoonViT(基于 SigLIP-SO-400M 微调)✅ SigLIP(CLIP 系列)用 SigLIP 损失 + caption 生成交叉熵训练;+ MoE LLM (Moonlight)
MiniMax-VL-01MiniMax 2025ViT(300M 参数,ViT-MLP-LLM 架构)✅ CLIP 范式 ViT动态分辨率 336→2016;视觉塔走 ViT+投影+LLM 路线
DeepSeek-VL / VL2DeepSeek 2024SigLIP(+ SAM 训练 ViT)✅ SigLIP(CLIP 系列)VL2 用 SigLIP + 动态切片;+ DeepSeek-MoE
GLM-4V / 4V-Plus智谱 2024CLIP/SigLIP 风格 ViT✅ CLIP 范式视觉塔属 CLIP 风格双塔投影路线
GPT-4V / GPT-4oOpenAI 2023–24未公开(业界共识为 CLIP 系 ViT)✅ CLIP 系列(共识)官方未披露细节,但多模态架构普遍认定基于 CLIP 视觉塔
GPT-OSS(120B/20B)OpenAI 2025官方纯文本 MoE,无原生视觉➖ 非 VLM官方开源版无图像编码器;社区多模态扩展接 CLIP,InternVL3.5-GPT-OSS 复用 InternViT(CLIP 系列)
BLIP-2 / InstructBLIPSalesforce 2023CLIP ViT-L/14 或 EVA-CLIP ViT-g/14✅ CLIP/EVA-CLIP(均属 CLIP 家族)Q-Former 对齐冻结视觉塔;EVA-CLIP 是 CLIP 强预训练变体

结论

  • 全部主流 VLM 的 image encoder 都是 CLIP 系列(CLIP / SigLIP / EVA-CLIP,或基于 SigLIP 初始化/微调的 ViT)视觉塔。其中 Qwen2-VL 系、MiniMax-VL、GLM-4V 等虽为自研 ViT 权重,但架构仍是「ViT 视觉塔 + 投影层 + LLM」的 CLIP 双塔范式,而非 XVLM 式融合塔;MiniCPM-V、Kimi-VL、DeepSeek-VL、InternVL 全系则直接用 SigLIP。GPT-OSS 官方是纯文本模型,本身不算 VLM,但其多模态衍生版同样接 CLIP 系列视觉塔。
  • XVLM 的 Swin + BERT + 独立 cross-modal encoder 融合塔路线已被完全取代,确非当代主流——这进一步支持 GeoText-1652 选 XVLM 只是作者团队自身工作延续,不代表范式方向。
  • 对 DroneCLIP 的含义:我们与主流一致采用 CLIP 视觉塔(且 SigLIP 同为 77-token 文本上限),GPU/编码瓶颈与主流 VLM 同源;GeoText-1652 的 31% 长句截断问题在任何 CLIP 系列骨干下都存在,与是否改用 SigLIP 无关。