陶瓷杯碎 · 盒瘪
订单 A-8842,杯子碎了,按破损退。照片补上文字没有的订单号和损坏。两种信号一起看才够退。先认出这张带照片的消息,再看缺了图会怎样
下面就是用户发来的退款消息。默认图文齐了能定位 A-8842;只发字找不到杯子;图和字打架就追问,不硬退。
原因:照片带上订单号和损坏,文字只负责诉求。下一步:拿掉照片,看同一句退款还会不会定位。
知识点:一起看,才叫多模态
消息卡上的照片和回复已经演过,这里只给命名。
- 多模态 = 同一轮里同时接收或产出文字、图像、音频等,并联合理解。
- 另一种模态能补上文字没有的事实:订单号、损坏、尺寸。
- 图文打架时要停并追问,不能选一种故事编圆。
- 它不是只会看图:那是视觉;这里强调的是跨模态一起用。
什么时候用、怎么用
用户手里的证据不在文字里,而在截图、录音或视频时。
- 信号:退货照、设计稿、语音留言,单靠打字说不清。
- 适用:把相关模态一起交给模型,回答要能指回哪张图、哪句话。
- 不适用:纯翻译、纯改文案——不必硬配一张图。
- 最短路径:收齐输入 → 看各模态贡献了什么 → 对不上就追问。
正反例:同一句「我要退款」
诉求不变,只差有没有照片。
客服按破损退,依据在图上,对得上。
不知道哪一单、坏没坏。错退或反复追问都会发生。
快速自测
用户文字写「杯子碎了」,附图却是完好的马克杯。模型最该怎么做?
继续查证
术语的技术定义和行为以这些一手或权威资料为准。
下一步学
和本知识点经常一起出现的概念。