Vision Banana:视觉领域的生成即理解革命
- 来源:X/Twitter
- 原文链接:https://x.com/grapeot/status/2064115254213370288
- 作者:grapeot
- 日期:2026-06-12
- 抓取时间:2026-06-12 12:38
LLM的生成即理解路径,终于在视觉里有了一个原生的版本。
Vision Banana是Google DeepMind上个月放出的一个模型。何恺明和谢赛宁是leadership sponsor。它的做法是把分割、深度估计、表面法线估计这些视觉任务都改成画图任务。同一个模型,同一套权重,改提示词就能切换输出。
NLP那边,从GPT-3之后大家已经接受了这个逻辑:一个只会预测下一个词的模型,在大规模预训练之后,自然学会了语法、事实、推理、意图跟随。生成和理解是同一件事的两面。翻译、摘要、问答不过是prompt的不同写法。
视觉领域一直没有一个对等的实验。现在多模态模型看图回答问题,逻辑是把图像信号灌进一个已经学会理解的语言模型里,理解能力的来源在LLM那一侧,不在视觉信号本身。一个纯粹的图像生成模型,能不能靠生成训练学到三维世界、物体边界、空间关系,这个假设一直有人猜,一直缺少大规模实验证据。
Vision Banana把这个空缺填上了。基础模型是Nano Banana Pro,一个以图像生成为唯一能力的模型。视觉任务数据以极小的比例混入原来的生成训练流做轻量指令微调,本质上只是在教模型把答案画成图片,而不是从头学做分割。结果:同一个模型在语义分割上超过SAM 3(mIoU 69.9 vs 65.2),在度量深度估计上超过Depth Anything 3(δ1 0.929 vs 0.918),在表面法线估计上超过Lotus-2(角度误差15.55° vs 16.56°)。图像生成质量基本没掉,没有灾难性遗忘。
顺着这个对称性往下想。NLP花了好几年才从怀疑走到共识:生成式预训练不是补全文字的技巧,而是理解语言的最根本路径。视觉领域现在拿到了第一组完整的实验证据,证明同一套逻辑在图像上也成立。它和LLM的路径高度相似,只是一个做token预测,一个做像素生成。
论文作者在金阁寺门口随手拍了张照做非标准测试:Vision Banana预测画面里某一点距离镜头13.71米,Google Maps实测12.87米。这个测试没经过基准标准化,但它直接说明了一件事:模型不是在靠记忆训练数据取巧,它真的从单张图里提取出了物理世界的绝对尺度信息。