返回知识库

AI 与提示 · 多模态与媒体

多模态Multimodal

多模态是同一轮里同时看文字、图像或音频。图里的订单号、损坏这些文字没有的事实,只有一起给才会被用上;对不上就追问。

先认出这张带照片的消息,再看缺了图会怎样

下面就是用户发来的退款消息。默认图文齐了能定位 A-8842;只发字找不到杯子;图和字打架就追问,不硬退。

「这个订单怎么回事?我要退款。」图文齐了

陶瓷杯碎 · 盒瘪

订单 A-8842,杯子碎了,按破损退。照片补上文字没有的订单号和损坏。两种信号一起看才够退。

原因:照片带上订单号和损坏,文字只负责诉求。下一步:拿掉照片,看同一句退款还会不会定位。

知识点:一起看,才叫多模态

消息卡上的照片和回复已经演过,这里只给命名。

  • 多模态 = 同一轮里同时接收或产出文字、图像、音频等,并联合理解。
  • 另一种模态能补上文字没有的事实:订单号、损坏、尺寸。
  • 图文打架时要停并追问,不能选一种故事编圆。
  • 它不是只会看图:那是视觉;这里强调的是跨模态一起用。

什么时候用、怎么用

用户手里的证据不在文字里,而在截图、录音或视频时。

  • 信号:退货照、设计稿、语音留言,单靠打字说不清。
  • 适用:把相关模态一起交给模型,回答要能指回哪张图、哪句话。
  • 不适用:纯翻译、纯改文案——不必硬配一张图。
  • 最短路径:收齐输入 → 看各模态贡献了什么 → 对不上就追问。

正反例:同一句「我要退款」

诉求不变,只差有没有照片。

正例照片带上 A-8842 和碎杯

客服按破损退,依据在图上,对得上。

反例只看文字直接答应退

不知道哪一单、坏没坏。错退或反复追问都会发生。

快速自测

用户文字写「杯子碎了」,附图却是完好的马克杯。模型最该怎么做?

继续查证

术语的技术定义和行为以这些一手或权威资料为准。

下一步学

和本知识点经常一起出现的概念。