雅安pvc管道胶水 浙大提出Agentic空间认知评估框架
发布日期:2026-08-10 10:45 点击次数:103

如果你问个人 “杯子在哪?”,他通常会直接用手指给你看,而不是面表情地回答:“目标位于屏幕横坐标 345 至 412、纵坐标 512 至 600 的边界框内”。然而,在现有空间认知评测中,我们却直在强迫 AI 用这种 “反直觉” 的坐标式来证明自己的空间认知能力。
空间判断本来就活在连续的视觉场景里,但现有 benchmark 几乎都要求模型用坐标、选项或文字作答。这对文本 VLM 已不够自然,工作在像素空间、本可直接 “画” 出答案的图像生成模型是被挡在门外。
生成式模型会不会是承载空间认知自然的载体? 如果让模型直接把答案 “画” 出来,怎样让它把空间判断表达清楚?在不依赖人工的情况下,如何准确判断它画得对不对?进步看,生成式模型与文本输出 VLM 在不同空间任务上的能力差异究竟在哪里?
近日,浙江大学 OmniAI 团队在 《Show, Don’t Tell: Evaluating Spatial Cognition in Generative Pixels Rather Than LLM Text》 中提出 ProVisE,让图像生成模型直接在图中回答空间问题,并将视觉答案为原 benchmark 可以评分的结构化预测。
论文链接:https://arxiv.org/abs/2607.21072
项目地址:https://zju-omniai.github.io/ProVisE/
Github 链接:https://github.com/ZJU-OmniAI/ProVisE
Benchmark 链接:https://huggingface.co/datasets/wx91726/SpatialGen-Bench
链接:https://mp.weixin.qq.com/s/M78bQEqADqvY4GufqZ4-iA
ProVisE:生成模型如何 “画出答案”?
为了让生成模型能够以自己擅长的式回答空间问题,我们提出了 ProVisE(Protocolized Visual Evaluation)框架。它不再要求模型输出干巴巴的文本或坐标,而是通过视觉协议雅安pvc管道胶水,引模型直接在图像上 “作答”:标记目标、填充向网格、生成度图、涂出目标区域,或者画出机器人的运动轨迹。
视觉协议是 ProVisE 的基本单元。每套协议都包含段 guidance prompt,规定模型应该怎样展示答案;同时配有对应的 parser,将生成图像中的颜、位置、区域等恢复为结构化预测。
整个流程可以概括为三步:先,Protocol Router 根据任务选择适的视觉协议;随后,图像生成模型按照 Guidance Prompt 产生可解析的视觉答案;后,Protocol Parser 将像素结果转换成原 benchmark 所需的标签、点、掩码、状态或轨迹。
文本输出 VLM 直接生成结构化答案;图像生成模型通过视觉协议生成图像答案,再由 parser 恢复为原任务所需的预测。
Agentic Builder:自动化构建视觉评测协议
为了应对形式各异的空间 benchmark,我们在 ProVisE 中内置了 Agentic Protocol Construction 框架,根据任务的输入、答案结构和评分规则,自动构建相应的 “生成 — 解析” 协议。
Agentic Builder 根据任务选择 Reuse、Build 或 Fallback 路径,构建并验证对应的视觉协议。
Agentic Builder 逐任务扫描数据、输入形式、答案结构和评分规则,将其统为任务规范;随后根据任务特点选择三种协议构建模式:
Reuse: 直接复用兼容的已有协议
Build: 利用已注册的解析组件组装新协议
Fallback: 在确定组件法覆盖时,由辅助 VLM 解析生成图像并恢复结构化预测
协议构建完成后还需经过验证,确保视觉答案能够正常生成、解析并接入原指标;通过后即被冻结,用于所有图像生成模型的评测。
正如下图例子展示雅安pvc管道胶水,模型可以直接把目标公交车点出来,把机械臂的移动轨迹画在原图上;判断 A、B 两点谁近时,就生成张度图。面对 “缆车上还能否再坐个人” 这样的问题,模型会把二位乘客补到座椅上,直观展示空间是否足够。随后,万能胶生产厂家相应的解析器再将这些图像答案转换为坐标、选项或轨迹。
图中展示了图像生成模型从任务输入、视觉作答到结果解析与评估的完整过程。
SpatialGen-Bench:刻画空间认知能力
为了系统描绘空间认知能力,我们构建了 SpatialGen-Bench,涵盖从直接视觉感知、场景理解、空间理到具身交互的 14 项子任务:
空间感知:考察模型从画面中提取基础几何与空间属的能力,包括计数、相对度、朝向和尺寸比较
空间理解:要求模型整多个物体及不同视角的信息,形成对物体关系与整体场景的理解,包括目标 grounding、关系分析、视角判断和场景建模
空间理:在场景理解基础上,检验模型能否结空间关系和物理约束进行多步演,包括多步理、状态预测和几何可行判断
空间交互:进步将空间认知延伸至行动,考察模型能否据此作出决策,包括可供 grounding、航和轨迹规划
SpatialGen-Bench 将 14 项任务组织为感知、理解、理和交互四个层。
Leaderboard
Claude Fable 5 与 GPT-5.6 Sol 均过 80 分,与 Kimi K3 起霸榜前三,GPT-5.4 得分为 61.04;图像生成模型中,GPT-5 Image 2 以 54.49 分排名。
生成模型的空间能力怎么样?
在 SpatialGen-Bench 上,我们比较了 20 个文本输出 VLM 和 11 个图像生成模型。结果显示,两类模型的优势集中在不同任务上:
1. 图像生成模型展现出直接的 “空间直觉”。 当任务可以直接用度图或空间标记回答时,生成模型表现出较强竞争力。直接在像素空间作答,减少了将连续空间关系转换成文字时的信息损耗。
左:两类模型在不同空间任务上的相对优势;右:图像生成模型的失败归因。
2. 在 GPT-5.4 做错的题目中,GPT Image 2 做对了 37。两类模型做对的并不是同批题,因而具有明显的互补。
3. 文本输出 VLM 在需要抽象理的任务上仍占优势。 计数、尺寸比较、几何可行和状态预测,需要统计多个对象、比较尺度、组几何约束或演状态变化;在空间理层,VLM 组平均先 17.6 个百分点。
4. 生成成功并不意味着空间答案正确。 失败归因显示,88.03 的失败样本已经生成图像并解析出有预测,只是预测结果错误。主要问题不是图像没有生成或法解析,而是图中呈现的空间状态不准确。
总结与展望
我们希望这项工作提供种新的空间智能视角。真正理解物理世界的智能体,不应只是会计坐标的 “文本机器”,还应能够在像素空间中直接表达并预演空间状态。未来系统也不在 Show 与 Tell 之间二选:文本或 latent 表示承担约束规划与组理,视觉生成负责呈现空间状态,再由确定工具完成验证。理解、生成与验证的协同,或许比单纯扩大任类模型的规模接近通用空间智能。
团队介绍
浙江大学 OmniAI 团队致力于大模型与智能体、多模态空间理、具身智能和情感交互等向的研究。作者旭为大四本科生,已拟录取至浙江大学;姚凯翔为硕士年研究生。张文祺与张旭鸿为共同通讯作者,张旭鸿为 OmniAI 团队负责人。相关词条:储罐保温 异型材设备 钢绞线厂家 玻璃丝棉厂家 万能胶厂家
奥力斯 保温护角专用胶批发 联系人:王经理 手机:13903175735(微信同号) 地址:河北省任丘市北辛庄乡南代河工业区
1.本网站以及本平台支持关于《新广告法》实施的“极限词“用语属“违词”的规定雅安pvc管道胶水,并在网站的各个栏目、产品主图、详情页等描述中规避“违禁词”。
2.本店欢迎所有用户指出有“违禁词”“广告法”出现的地方,并积极配合修改。
3.凡用户访问本网页,均表示默认详情页的描述,不支持任何以极限化“违禁词”“广告法”为借口理由投诉违反《新广告法》,以此来变相勒索商家索要赔偿的违法恶意行为。
乌鲁木齐海绵胶 人形机器人要有“身份证”了!29位编码都是什
天门万能胶 里人出外旅行,万万要枚硬币在冰箱,很多人都不知道
南宁PVC管道管件粘接胶 从实习记者到央视主播,
潍坊万能胶生产厂家 小鹏汽车自研!台纯视觉Robotaxi量
保山泡沫板专用胶厂 从用户割裂到单客耕: 劲浪携手微盟数智化
北京海绵专用胶厂 掌握聊天技巧, 轻松拉近恋距离
