GeoText-1652: Towards Natural Language-Guided Drones
- 来源: https://arxiv.org/abs/2311.12751
- 日期: 2024-11-20 (ECCV 2024)
- 标签:
text-image-retrieval,uav,drone,benchmark,spatial-relation,vision-language - 研究方向: Computer Vision → Vision-Language → Cross-modal Retrieval (Drone Navigation)
- 作者: Ming Dai, Enhui Zheng, Zongxia Xie, et al. (MultimodalGeo)
- 提交日期: 2023-11-21 (v1)
- 会议/期刊: ECCV 2024
- 代码: https://github.com/MultimodalGeo/GeoText-1652
- 项目主页: (无)
摘要
问题: 自然语言引导的无人机导航缺乏高质量图文数据集,且语言与细粒度视觉表征的对齐困难。
方案: 构建 GeoText-1652 数据集(继承自 University-1652 的 query/gallery 组织),并提出 Blending Spatial Matching(融合空间关系匹配)方法,利用区域级空间关系增强图文对齐。
关键创新/贡献:
- GeoText-1652 数据集: 1,652 个 location(701 train / 951 test),每张图配多句自然语言描述(含空间关系词,如 "in the center"、"on the left"),支持 text→image 与 image→text 检索。
- Blending Spatial Matching: 在跨模态匹配损失之外,引入 grounding loss(词→区域对齐)与 spatial loss(区域间空间关系匹配),两者融合提升检索与定位能力。
- 验证: 在 XVLM*(Swin + BERT,16M 图像预训练)上微调,检索 Recall 显著超过 ALBEF/XVLM 等基线;消融表明 grounding loss 是检索提升主因。
1 Introduction
背景 & 动机:
- 无人机需"听懂"自然语言指令完成导航/定位(如搜救、物流)。
- 现有跨视角地理定位数据集(University-1652、VIGOR)只有图像级标签,无自然语言描述;而纯文本检索数据集不含无人机视角。
- 仅有图像级 caption 不足以表达"目标在图的哪个方位"——这正是无人机场景的核心难点。
本文定位: 在 University-1652 的 1,652 个 location 基础上,为每图生成自然语言描述(含空间关系),把"跨视角 geo-localization"升级为"自然语言引导的无人机检索"。
2 Related Works(对标原论文 §2)
原论文 §2 综述两条技术线,并点明本文与它们的区别:
2.1 Cross-view Geo-localization(跨视角地理定位)
- 目标:把不同视角(无人机/卫星/地面)拍的同一地点图像关联起来,核心是提取视角不变(viewpoint-invariant)的判别性视觉表征。
- 代表工作:
- Wang et al. 划分策略(partitioning)用图像多部位丰富特征;Lin et al. 用新注意力模块发现关键点、聚焦显著区。
- Dai et al. 引入带 content alignment 的 transformer 结构;Yang et al. 利用自注意力与 Ground/Aerial 的位置编码特性。
- Rodrigues et al. 双路网络融合局部区域与全局特征做部分航拍图匹配。
- 其它增强路线:Shi et al. 融合位姿估计与几何投影做特征匹配;Hu et al. 强调街景图像朝向精度;Chen et al. 在 transformer 中引入跨无人机映射机制。
- GeoDTR 用两种数据增广同时抓低层细节与空间配置;TransGeo 结合 transformer 灵活性与注意力引导的非均匀裁剪提升关键区分辨率;Dhakal et al. 设计对比学习框架预测地面景物的文本嵌入。
- 本文区别:上述方法都只做图像↔图像匹配,本文聚焦两个新的「自然语言引导」无人机任务,给用户一种直控无人机的方式。
2.2 Multi-modality Alignment(多模态对齐)
- 自然语言引导导航可视为 text-to-image retrieval 的子任务。早期工作多在结构设计:
- 双路网络(dual-path);Wang et al. 用自适应门控处理负对与无关信息、基于融合特征算匹配分;Li et al. 用图卷积做图像区域语义推理。
- Chen et al. 在大规模预训练中提出 word-region alignment(词-区域对齐);Li et al. 用图像中检测出的 object tags 作锚点缓解对齐学习;Yang et al. 研究属性相关关键词。
- CLIP(Radford et al.)提出图文对对比学习;Jia et al.(ALIGN)设计简单双编码器对齐视觉与语言;Li et al.(ALBEF)用自训练从伪目标精炼 ITM 损失。
- Zeng et al.(X-VLM)进一步对齐多区域视觉概念与对应文本;BLIP 用 caption bootstrapping 利用噪声网络数据。
- 本文区别:不同于这些已有工作,本文引入空间感知(spatial-aware)方法,显式建模细粒度「文本-区域」的空间关系匹配——当相似元素出现在同一图中时,若模型无法辨别其空间关系差异,就会错误对齐,而本文的 grounding + spatial loss 正是为此设计。
注:原论文 §2 是 Related Works,纯文献综述、无新方法;其价值在于交代「图像级 geo-localization」与「图文对齐」两条线的来龙去脉,并据此定位本文贡献(自然语言 + 空间关系)。本 §2 严格对标原文,未掺入非论文内容。
3 Dataset: GeoText-1652(对标原论文 §3)
3.1 规模与组织(原论文 §3.1 + 本项目实测)
论文原描述:在 University-1652 基础上扩展,1,652 栋建筑 / 72 所高校,三平台(Satellite / Drone / Ground),每图标注 3 条全局描述 + 平均 2.62 个 bbox(已过滤低质量框);全局描述平均 70.23 词,区域描述平均 21.6 词。
本项目实测(drone-only 过滤后,见 data/reports/train/geotext1652.md):
| 项 | 值 |
|---|---|
| locations | 701 (train) / 951 (test,覆盖更多 location) |
| 图像来源 | University-1652 的 Drone / Ground / Satellite 三平台 |
| train drone-only 图像 | 37,854(过滤 Ground 11,663 + Satellite 701) |
| train 图文对(展开后) | 363,816(每图 ~9.6 条) |
| test drone-only gallery / queries | 51,319 / 153,957 |
注:论文本身用全视角(Drone+Ground+Satellite)训练;本项目 DroneCLIP 为低空无人机专用,故
--drone-only过滤离域平台,仅保留 37,854 张无人机图参与训练。
3.2 标注框架(原论文 §3.2,两阶段 + referee model)
数据集靠 人机交互标注策略 降本增效,分两阶段:
- Modality Expansion(模态扩展):对每图用两类 prompt(显著物体 / 全图描述)问 visual-LLM 生成文本;因 LLM 有幻觉/模糊,引入 referee model(LLM 作 teacher 分类正负样本 + 关键词过滤 + 人工抽检)质控,最终每图得 3 条图像级描述 + 9 条区域级描述候选。
- Spatial Refinement(空间精修):用现成 text-based visual grounding 模型 为区域描述打 bbox;因区域描述含 left/right 等空间词,设空间规则过滤错位的框,并反过来给描述补 vertical 词(upper left / down right)。9 条候选最终平均只留 2.62 个 bbox。
3.3 文本特点(关键,连接 §4 的 grounding/spatial loss)
- 描述强调空间关系:"the white car on the left side"、"the building in the center"——这正是 §4 Blending Spatial Matching 要建模的对象。
- 本项目实测 token 长度(open_clip SimpleTokenizer,77 token 上限):
- train 展开后 caption:median 23 / p95 177 / max 311,31.2% 超 75 token 被 CLIP 截断。
- eval drone queries:median 41 / p95 82 / max 165,8.0% 超长。
- 对比 RefDrone(<1% 截断),GeoText-1652 文本侧有损编码明显——长句尾部空间细节在 CLIP 截断后丢失,恰是最该保留的部分(详见附录「77-token 限制」)。
4 Method(对标原论文 §4)
4.1 整体架构(XVLM 三塔)
基于 XVLM:image encoder = Swin Transformer;text encoder = BERT(无 77-token 限制);外加一个 cross-modal encoder(Transformer,做图文深度融合)。在常规图文对比/匹配损失外,新增两类空间损失。
4.2 Image-text Semantic Matching(式 1–4)
ITC(in-batch 对比,式 1–3)+ ITM(hard negative 采样 + cross-modal encoder 二分类,式 4)——传统双塔对齐。
4.3 Blending Spatial Matching(论文核心创新,式 5–6)
- Grounding loss(式 5):region-level 文本 → 预测 bbox(cross-attention ×6 + MLP),IoU + L1 回归。将空间词(left/center/…)映射到对应区域,是检索提升主因子(见 §5.3 消融)。
- Spatial loss(式 6):取 3 个 ROI 的 ROI-Pooling 特征,拼成 pair 过 MLP 预测 9 类相对位置(左/中/右 × 上/中/下,由 bbox 中心距定义),显式建模"区域 A 在区域 B 某方位"。
4.4 训练目标与实现细节(式 7;§5.1 实现)
- 总损失:
L_total = L_itc + L_itm + λ(L_grounding + L_spatial),λ=0.1(Table 6 实证最佳,过大反而掉点)。 - 骨干 XVLM(16M 图预训练);图像 resize 384×384、patch 32;不用随机翻转/旋转(会丢空间信息);评测时去停用词。
5 Experiment(对标原论文 §5)
5.1 实现细节(对标原论文 §5.1)
- 骨干:XVLM(在 16M 图像上预训练)作 backbone;text encoder = BERT,image encoder = Swin Transformer。
- 优化器:AdamW,weight decay = 0.01,learning rate = 3e-5。
- 图像预处理:训练时所有图 resize 到 384×384,patch size = 32;仅做轻量增强(亮度调整、identity),不用随机旋转/水平翻转(会丢失空间信息)。
- 评测:全局描述作 text query 时**去除停用词(stop words)**以保持 query 简洁。
注:原论文 §5.1 仅此实现配置,无结果表格;数据已在 §3(规模/标注)与 §4(Method)铺垫,此处只列超参与训练设置。
5.2 Geo-localization Results(原论文 Table 3:双向检索)
表 5.2|Text→Image / Image→Text 双向检索(Recall@K,%)(节选关键行;XVLM 预训练 16M 图、finetuned 即在 GeoText-1652 上微调)
| Method | 预训练图数 | Text R@1 | Text R@5 | Text R@10 | Image R@1 | Image R@5 | Image R@10 |
|---|---|---|---|---|---|---|---|
| XVLM(仅预训练) | 16M | 4.5 | 9.9 | 13.4 | 5.0 | 14.4 | 21.4 |
| XVLM_finetuned | 16M | 13.2 | 23.7 | 29.6 | 25.0 | 52.3 | 65.1 |
| Ours | 16M | 13.7 (+0.5) | 25.7 (+2.0) | 32.3 (+2.7) | 26.2 (+1.2) | 53.5 (+1.2) | 66.4 (+1.3) |
- 数据集有效性:对比 XVLM 仅预训练(Text R@1 4.5 / Image R@1 5.0)与 finetuned(13.2 / 25.0),微调后 Recall 翻数倍 → aerial-view 对通用大模型仍难,GeoText-1652 这类专域数据必要。
- 方法优越性(Ours vs XVLM_finetuned):双向各 K 均提升,且提升集中在 R@5/R@10(把正例往前排),实际部署价值高;R@1 仅 +0.5/+1.2,说明本文主要改善"排序"而非"首位命中"。
5.3 Ablation Study(原论文 Table 4/5/6 + Fig5/6)
表 5.3a|Loss 逐项加(Table 4,baseline=XVLM_finetuned,无 grounding/spatial)
| 配置 | Text R@1 | Text R@5 | Text R@10 | Image R@1 | Image R@5 | Image R@10 |
|---|---|---|---|---|---|---|
| Baseline(无 grounding/spatial) | 13.2 | 23.7 | 29.6 | 25.0 | 52.3 | 65.1 |
| + grounding only | 13.5 (+0.3) | 25.4 (+1.7) | 31.7 (+2.1) | 25.8 (+0.8) | 53.0 (+0.7) | 65.9 (+0.8) |
| + spatial only | 13.3 (+0.1) | 23.9 (+0.2) | 29.8 (+0.2) | 25.1 (+0.1) | 52.5 (+0.2) | 65.3 (+0.2) |
| Ours(两者) | 13.7 | 25.7 | 32.3 | 26.2 | 53.5 | 66.4 |
结论(论文原话):grounding loss 是检索提升主因(单独贡献 Text/Image R@1 +0.3/+0.8);spatial loss 单独贡献极小(仅 +0.1),但两者叠加稳定更好。
表 5.3b|不同训练集(Table 5)
| Training Set | #imgs | Text R@1 | Text R@5 | Text R@10 | Image R@1 | Image R@5 | Image R@10 |
|---|---|---|---|---|---|---|---|
| Drone only | 37,854 | 13.1 | 23.6 | 29.4 | 25.4 | 51.3 | 63.2 |
| Satellite + Ground | 12,364 | 10.4 | 19.2 | 24.5 | 18.5 | 38.7 | 50.2 |
| Satellite + Drone + Ground | 50,218 | 13.7 | 25.7 | 32.3 | 26.2 | 53.5 | 66.4 |
- 多平台混合 > 纯 Drone > Satellite+Ground;混合比纯 Drone 高 +0.6 Text R@1 / +0.8 Image R@1。
- 评测口径提醒(务必严谨):本表(原论文 Table 5)是训练集消融——三行分别对应"训练时用了哪种数据",但评测均在同一个全视角测试集(55,192 图)上完成。它比的是"喂不同训练数据 → 在全视角测试上的表现",并非在 drone-only 测试协议上出数字;原论文从未发布过 drone-only 测试协议的检索结果。
- ⚠️ 与本项目 drone-only 决策的关系(不可直接比):论文结论是"训练数据多样性(混合)在全视角测试上带来 +0.6 增益",即训练侧多源有益;本项目因 DroneCLIP 专攻低空无人机,在训练与测试两侧都过滤离域平台(drone-only 协议,gallery=51,319 图),这是自定义测试协议,论文无对应项。二者一是训练集差异(同全视角测试)、一是测试协议差异(同砍离域),口径不同、不可直接比,仅可作"训练多源是否有益"的参考。需在实验中实测混合训练是否对专域模型真有益。
表 5.3c|λ 消融(Table 6)
| λ | Text R@1 | Text R@5 | Text R@10 | Image R@1 | Image R@5 | Image R@10 |
|---|---|---|---|---|---|---|
| 1.00 | 10.0 | 21.2 | 27.4 | 20.6 | 47.1 | 60.2 |
| 0.50 | 11.1 | 22.4 | 29.2 | 22.8 | 50.0 | 62.6 |
| 0.10 | 13.7 | 25.7 | 32.3 | 26.2 | 53.5 | 66.4 |
| 0.05 | 12.8 | 24.4 | 31.0 | 24.5 | 52.7 | 64.9 |
λ=0.1 最佳;λ 过大(1.0/0.5)空间 loss 权重过高压制 ITC/ITM,反而掉点。
定性(Fig5/6):Fig5 海上建筑/船等未见场景也能按空间词定位正确 region;Fig6 提供空间描述时比 baseline 更命中"内容相似但空间不对"的干扰图(baseline 只抓 car/sports field 等物体标签,漏掉 "in the center/down side/upper left" 等空间对齐)。
6 Conclusion
GeoText-1652 是首个面向自然语言引导无人机导航的视觉-语言数据集,支持图文双向检索与目标定位;Blending Spatial Matching 通过区域级空间关系提升跨模态检索与泛化。
与我们 DroneCLIP 的关联(重点)
- 数据复用:本项目已本地化 GeoText-1652(drone-only 363,816 对训练 / 51,319 gallery 评测),作为比 RefDrone(21,057 对)大 ~17 倍的候选训练源。
- 检索协议对齐:沿用论文的 text→image / image→text 双协议;本项目额外提供 drone-only 评测(与 drone-only 训练分布一致),并保留全视角协议作 SOTA 对照。
- 文本质量警示:论文未处理 CLIP 77-token 截断,而 GeoText-1652 长 caption 占 31% 被截、丢失的恰是空间细节(论文方法的重点)。这提示我们:若用 GeoText-1652 训练 DroneCLIP,应先过滤/重切超长句,否则空间信号被编码截断削弱。
- 方法借鉴:论文证明 grounding loss 对检索最关键——但 XVLM 三塔才有 cross-modal encoder 承载该 loss,我们 DroneCLIP 是 CLIP 双塔,无法直接照搬。若未来引入区域级监督(GeoText-1652 的 bbox 字段已备),需外接 grounding head 或做区域级对比,而非原样加 XVLM 式融合 loss。
个人评价
核心价值: 把"无人机 + 自然语言空间描述"系统化成一个可训练、可评测的基准,填补了 University-1652 只有图像标签、没有语言描述的空白。
可借鉴点:
- 空间关系词标注思路,对无人机检索("左边那辆车")极有价值。
- grounding loss 主因子的结论,指导我们若加监督应优先区域级对齐。
实验设计亮点:
- 同时给 train/test location 数不同(951>701),强制模型泛化到未见 location,设计干净。
- 全视角 vs drone-only 双协议,兼顾 SOTA 对照与专域评测。
与我们的分歧点:
- 论文主张多平台混合提升检索;本项目 drone-only 过滤离域。需在实验中实测:对 DroneCLIP 这种专域模型,混合是否真的有益,还是论文结论只适用于通用 XVLM。
疑问解答 (Q&A)
Q1: GeoText-1652 和 RefDrone 在 DroneCLIP 实验中的角色有何不同?
答: RefDrone 原任务是 REC(短语→框),我们取其整图 caption 改造成小规模(21k 对)检索基准,噪声小、适合做组件剥离;GeoText-1652 原任务就是图文检索、规模大(364k 对)、含空间关系词,适合做"数据规模/质量"对比。两者都是"整图描述训练",但规模与文本特性差异大,正好构成 mini-ablation 的大小两极。
Q2: 为什么 GeoText-1652 有 31% caption 被 CLIP 截断,论文却没提?
答: 论文用 XVLM(BERT 文本编码器,无 77-token 硬上限,且 384×384 图像),其 text side 不受 CLIP 限制;而我们 DroneCLIP 基于 CLIP(77 token 封顶),同样的长 caption 会被截。这是"换 backbone 后新出现的编码瓶颈",论文视角下不存在,故未讨论。我们做对比实验时须自行处理。
附录:官方榜单两个 Test Split 的区别
(来源:GeoText-1652 仓库 README 的 Primary Leaderboard / Hardware-friendly Split 两段。)
两个榜单评测的是同一批模型的检索能力,但 gallery(候选图像池)规模不同,均由官方 Method/re_bbox.py 切换 json 跑出:
| Full Test (951 buildings) | 24GB Test | |
|---|---|---|
| 评测文件 | test_951_version.json | test_24G_version.json |
| 含义 | 完整官方测试集,覆盖全部 951 栋建筑(全量 gallery) | GPU 友好版,为小显存硬件做的精简测试集 |
| 用途 | 主榜单(primary leaderboard),最终结论看这个 | 方便 ≤24GB 显存设备(如 3090/4090 单卡)快速复现/对比 |
| 难度 | 高:候选 building 多 → 指标偏低 | 低:候选 building/图更少 → 指标明显虚高 |
| 例:NGCG Mean | 48.2 | 69.3 |
| 例:官方 Mean | 36.1 | 58.7 |
- "24GB" 是硬件友好标签(指 ≤24GB 显存可跑),不是数据量 24GB,也与 77-token 截断无关——官方 LEADERBOARD.md 原话:"GPU-friendly test_24G_version.json evaluation for quick comparison on smaller hardware"。
- 为什么小硬件能跑、指标却虚高(据
Method/re_bbox.py评测机理):itm_eval按 building 排名(inds[i] = img2building[...],target = 该 query 所属 building 在全量 building 列表中的名次)。R@K 的"干扰项"是全部 building——候选 building 越多,排进前 K 越难。24GB 版把参与排名的 building / 候选图规模压到单张 24GB 卡(如 3090/4090)能容纳相似度矩阵与 ITM 重排(sims_matrix、score_matrix全量驻留半精度显存),故叫"GPU 友好";代价是候选变少 → 所有方法 R@K 都约 +20 点。 - ⚠️ 未查实项:24GB 版具体压到多少 building / 是否减每栋图数,
test_24G_version.json不在仓库、LEADERBOARD 也未写数字;仅能确认"候选 building 规模变小"是机理必然,不能写死具体数值。 - DroneCLIP 若上 GeoText-1652 对比:以 Full Test (951 buildings) 为主榜单口径报数;24GB 版仅用于自己快速 debug,不对外比分(高分=候选少所致,非真强)。
背景延伸:视觉塔范式与主流 VLM 调研(非论文内容,连接 §4 的 XVLM 选择)
本节非 GeoText-1652 论文内容,是为理解论文为何选 XVLM、以及我们 DroneCLIP 为何用 CLIP 系列所做的背景调研,故置于全文末尾、与论文正文章节(§1–§6)分开。
范式差异(重要):XVLM 三塔 ≠ CLIP 双塔。CLIP 为 image encoder(ViT) + text encoder(各自 transformer) + 无 cross-modal encoder,靠对比学习把两塔投影到同一空间、点积算相似度。XVLM = Swin(ViT) + BERT + 独立 cross-modal encoder,grounding/spatial loss 作用在融合表征上;CLIP 原生无此融合塔,故论文的 loss 设计不能直接套到我们 DroneCLIP 的 CLIP 双塔——最多后期外接 grounding head 或做区域级对比,而非原样加 loss。
主流 VLM 图像编码器系统调研(结论:清一色 CLIP 系列视觉塔):
| 模型 | 机构/年份 | 视觉编码器 | 是否 CLIP 系列 | 说明 |
|---|---|---|---|---|
| LLaVA / LLaVA-1.5 | UW-Madison 2023 | OpenAI clip-vit-large-patch14-336 | ✅ 原版 CLIP | 冻结 CLIP ViT-L/14 作视觉塔 + MLP projector + LLM |
| LLaVA-NeXT / OneVision | 2024 | SigLIP / CLIP 混合 | ✅ CLIP 系列 | NeXT 起用 SigLIP-L 等更强视觉塔 |
| Qwen-VL | 阿里 2023 | OpenAI CLIP ViT-bigG | ✅ 原版 CLIP | 初代沿用 CLIP 视觉塔 |
| Qwen2-VL / Qwen2.5-VL / Qwen3-VL | 阿里 2024–25 | 自研 ViT(native dynamic resolution, 2D-RoPE) | ⚠️ 权重非 CLIP,但仍是 ViT 架构 + 投影 + LLM 的 CLIP 范式 | 视觉塔从头训练,但整体路线是「ViT 视觉塔 + projector + LLM」,与 XVLM 融合塔无关 |
| InternVL / 1.5 / 2 / 2.5 / 3 / 3.5 | 上海AI Lab 2023–25 | 自研 InternViT(1.5 起基于 SigLIP-L 初始化/混合) | ✅ SigLIP(CLIP 系列) | InternViT-6B 融合 CLIP/SigLIP 预训练知识;3.5 版甚至直接挂 GPT-OSS / Qwen3 作 LLM |
| MiniCPM-V / 2.6 | OpenBMB 2024 | SigLIP(SigLip-400M / 改进 SigLIP 架构) | ✅ SigLIP(CLIP 系列) | 分层压缩编码器基于 SigLIP,每 token 编码 1024 像素;+ Qwen2 |
| Kimi-VL / -VL-Thinking | 月之暗面 2025 | MoonViT(基于 SigLIP-SO-400M 微调) | ✅ SigLIP(CLIP 系列) | 用 SigLIP 损失 + caption 生成交叉熵训练;+ MoE LLM (Moonlight) |
| MiniMax-VL-01 | MiniMax 2025 | ViT(300M 参数,ViT-MLP-LLM 架构) | ✅ CLIP 范式 ViT | 动态分辨率 336→2016;视觉塔走 ViT+投影+LLM 路线 |
| DeepSeek-VL / VL2 | DeepSeek 2024 | SigLIP(+ SAM 训练 ViT) | ✅ SigLIP(CLIP 系列) | VL2 用 SigLIP + 动态切片;+ DeepSeek-MoE |
| GLM-4V / 4V-Plus | 智谱 2024 | CLIP/SigLIP 风格 ViT | ✅ CLIP 范式 | 视觉塔属 CLIP 风格双塔投影路线 |
| GPT-4V / GPT-4o | OpenAI 2023–24 | 未公开(业界共识为 CLIP 系 ViT) | ✅ CLIP 系列(共识) | 官方未披露细节,但多模态架构普遍认定基于 CLIP 视觉塔 |
| GPT-OSS(120B/20B) | OpenAI 2025 | 官方纯文本 MoE,无原生视觉 | ➖ 非 VLM | 官方开源版无图像编码器;社区多模态扩展接 CLIP,InternVL3.5-GPT-OSS 复用 InternViT(CLIP 系列) |
| BLIP-2 / InstructBLIP | Salesforce 2023 | CLIP ViT-L/14 或 EVA-CLIP ViT-g/14 | ✅ CLIP/EVA-CLIP(均属 CLIP 家族) | Q-Former 对齐冻结视觉塔;EVA-CLIP 是 CLIP 强预训练变体 |
结论:
- 全部主流 VLM 的 image encoder 都是 CLIP 系列(CLIP / SigLIP / EVA-CLIP,或基于 SigLIP 初始化/微调的 ViT)视觉塔。其中 Qwen2-VL 系、MiniMax-VL、GLM-4V 等虽为自研 ViT 权重,但架构仍是「ViT 视觉塔 + 投影层 + LLM」的 CLIP 双塔范式,而非 XVLM 式融合塔;MiniCPM-V、Kimi-VL、DeepSeek-VL、InternVL 全系则直接用 SigLIP。GPT-OSS 官方是纯文本模型,本身不算 VLM,但其多模态衍生版同样接 CLIP 系列视觉塔。
- XVLM 的 Swin + BERT + 独立 cross-modal encoder 融合塔路线已被完全取代,确非当代主流——这进一步支持 GeoText-1652 选 XVLM 只是作者团队自身工作延续,不代表范式方向。
- 对 DroneCLIP 的含义:我们与主流一致采用 CLIP 视觉塔(且 SigLIP 同为 77-token 文本上限),GPU/编码瓶颈与主流 VLM 同源;GeoText-1652 的 31% 长句截断问题在任何 CLIP 系列骨干下都存在,与是否改用 SigLIP 无关。
