- 类型
- 论文
- 来源
- arXiv AI
- 发布
- 2026年7月30日 05:39
- 状态
- 单一信源
发生了什么
SpatialCLI框架通过三个阶段(Call、Learn、Internalize)让视觉语言模型(VLM)先使用空间工具,再逐步内化感知能力。在MindCube基准上,Qwen3-VL-8B-Instruct的工具使用准确率从29.3%提升至84.6%,超过GPT-5.6 Sol的72.1%,内化后无工具准确率保持73.8%。
为什么重要
此前通用VLM与专用视觉模型存在能力鸿沟:通用模型能推理任务但细节不足,专用模型细节准确但缺乏任务决策。SpatialCLI通过工具增强和内部化,显著提升了VLM的空间感知能力,且内化后仍保持较高准确率,为具身智能和空间推理提供了新路径。
底层逻辑
SpatialCLI利用专用视觉模型作为外部工具,增强VLM的感知细节;通过冷启动监督微调和代理强化学习优化工具使用;最后将成功的工具使用轨迹语言化,使VLM在不依赖工具时也能复现部分感知能力。这种‘外部工具+内部化’机制,弥补了通用模型与专用模型的能力差距。
产品与商业机会
SpatialCLI可应用于具身智能产品,如机器人导航、空间感知,提升决策准确率。对于开发者,可能减少对高成本专用模型的依赖,并降低模型迭代成本。
- 开发基于SpatialCLI的视觉语言模型工具包,集成到机器人操作系统
- 在自动驾驶或AR产品中,利用SpatialCLI提升空间理解和任务决策
- 为生成式AI平台提供空间推理增强服务
仍待确认
- 证据仅来自单一摘要,SpatialCLI在真实场景中的泛化能力如何?
- 内部化后保留的73.8%准确率是否随模型规模变化?
- 工具内化后对提示词长度和推理延迟的影响未提及