返回知识库

AI 与提示 · 多模态与媒体

视觉理解Vision

视觉理解让模型从图里框出物体、缺陷和图内文字。看不清、被裁切或反光时要停,不能把低置信当成已经验过货。

先认出这张带框的退货照,再看没图或看不清会怎样

下面就是退货照片。默认框出碎杯可以退;只给文字看不见缺口;反光时框还在,但必须待审。

退货照 · A-8842看见了

碎杯 0.91

杯口缺一块,包装瘪了,可按破损退。模型直接读像素。框和置信度写在照片上,不是猜的。

原因:检测框落在缺口上,置信度够。下一步:拿掉图片,看只靠文字能不能答。

知识点:看见,不是猜见

照片上的框和待审章已经演过,这里只给命名。

  • 视觉理解让模型读像素,输出物体、缺陷、图内文字和位置。
  • 检测框和置信度要长在图上,才能核对「它到底看了哪」。
  • 模糊、裁切、反光会让断言失效;低于阈值就停、补拍、交人。
  • 它不是 OCR:OCR 专抠字;视觉回答的是「图里有什么、坏在哪」。

什么时候用、怎么用

判断依赖照片里的物体、布局或损坏,而不是一篇文字说明。

  • 信号:退货照、货架、设计稿、单据版面。
  • 适用:先框再答;低置信和质量差的图不要当验收。
  • 不适用:已经有清晰文字记录的问题——不必绕一张图。
  • 最短路径:给图 → 看框和置信度 → 看不清就补拍或交人。

正反例:同一张碎杯照

问题都是「能不能按破损退」。

正例框在缺口上,0.91,可退

客服能指着框跟用户对,不是空口说「看起来碎了」。

反例反光 0.54 仍写成「已验货」

框是虚的。把不确定当成验过,错退或拒退都会发生。

快速自测

退货照反光,碎杯检测只有 0.54。下一步最不该做什么?

继续查证

术语的技术定义和行为以这些一手或权威资料为准。

下一步学

和本知识点经常一起出现的概念。