浙江大学发布ProVisE框架评估生成式模型空间认知能力
科技专栏 2026-08-10 01:48:03
财π新闻 长期以来,人工智能领域对空间认知能力的评测,普遍要求模型以坐标、文本选项等形式输出结果,这种方式与人类通过指向、标记、绘制等视觉动作表达空间判断的直觉习惯相悖,也让天然运行在像素空间的图像生成模型难以充分发挥自身优势,无法在统一的任务标准下与文本输出类视觉语言模型实现公平对比。近日,浙江大学OmniAI团队推出ProVisE空间认知评估框架,打破了这一反直觉的评测现状,让图像生成模型可以直接在图像中画出答案回应空间问题,同时能将生成的视觉答案还原为原有基准可直接评分的结构化预测结果。
ProVisE框架内置Agentic Protocol Construction模块,可根据不同的任务输入、答案结构和评分规则自动搭建对应的生成与解析协议,整个运行流程分为三个清晰步骤。第一是协议路由选择,系统会根据当前任务的特性匹配最适配的视觉协议;第二是模型按引导提示生成图像答案,图像生成模型按照预设的引导提示,通过标记目标、绘制方向网格、生成深度图、高亮目标区域或是画出运动轨迹等方式输出视觉化的作答内容;第三是解析器将像素结果转换为结构化预测,专门的解析模块会从生成图像的颜色、位置、区域等像素信息中提取有效内容,转换为原有评测基准要求的标签、点位、掩码、状态或轨迹等结构化结果,无需人工介入即可完成自动评分。
为了实现对空间认知能力的全面刻画,研究团队同步构建了SpatialGen-Bench评测基准,覆盖空间感知、空间理解、空间推理和空间交互四个能力层级,包含14项细分的子任务,能够从不同维度检验模型对空间结构的真实理解程度,避免模型依靠记忆训练数据完成作答的情况出现。
基于该基准开展的大规模评测结果显示,Claude Fable 5与GPT-5.6 Sol的得分均超过80分,和Kimi K3一同位列综合表现前三。不同类型模型展现出鲜明的能力差异,图像生成模型在深度图生成、空间标记等任务上表现出更直接的空间直觉,而文本输出类视觉语言模型在需要抽象推理的任务上平均领先17.6个百分点。两类模型还呈现出明显的能力互补特性,在GPT-5.4答错的题目中,GPT Image 2成功答对了37%的内容。研究同时也指出了当前图像生成模型的核心短板,88.03%的失败样本都属于成功生成图像并完成解析,但最终预测的空间状态与实际情况不符,空间表达的准确性仍有较大提升空间。
这项研究为生成式模型的空间智能评估开辟了全新路径,让视觉任务回归视觉表达的本质逻辑,也为后续探索不同类型AI模型的空间认知机制、构建更贴合人类直觉的空间交互系统提供了新的研究方向。

购物车