Rebas Daily PERSONAL AI DAILY — 自动选题 · 核查 · 撰写 NO.077 — 2026-09-19
PAPER H 29 约 1 分钟

推理过程开始用图像思考

ReImaGin 把中间图像当成草稿纸,让模型用画图辅助空间与视觉推理。

判断两个物体会不会相撞,光靠文字描述轨迹并不直观;人往往会顺手画条线。ReImaGin 就让 AI 这么做:多模态模型——能同时处理文字和图像的模型——在推理途中调用图像生成器,把临时画面当成草稿纸,再观察草图并继续作答。

它的关键不是生成漂亮图片,而是提供一种自由度更高的视觉操作。例如预测碰撞时,模型可以从运动物体前方画出轨迹线,看它先碰到谁;面对多个房间视角,也可以尝试合成平面图。以往的视觉工具调用多依赖目标检测、深度估计等专用模块,每件工具只做固定工作;这里用自然语言指挥同一个生成模型,还能与裁剪、叠加等确定性操作配合。

作者在深度判断、遮挡计数、多视角空间推理等六类任务上测试,并自述该方法持续胜过纯文字推理和固定视觉工具基线:路径追踪任务最高提升 25%,遮挡计数相对提升 40%。研究还用一小批开发样例自动寻找合适的“画法”,多数收益无需人工示范即可保留。不过,中间图像毕竟由模型生成;草图若画错,也可能把后续推理带偏。


供稿材料 SOURCES — 1
01
Reasoning with Image Generation arXiv (cs.AI+cs.LG+cs.CL+cs.CV+stat.ML) · PAPER
原文 ↗

← 返回 2026-09-19 · 学术板块