✏️ AI 术语图鉴

多模态 · Multimodal

英文:multimodalmulti 重音在前

AI 基础难度:入门

🗣️一句话大白话

能同时看图、听音频、读文字的模型。你发一张截图问「这报错怎么回事」,它能看懂图——这就是多模态。

🎬真实场景

把微信里的报错弹窗截图直接丢给 AI,它读出错误码并给出解决办法——纯文字模型做不到,多模态模型看一眼就行。发票识别、界面走查、看图写文案,都靠它。

📮你可以这样说

「看这张截图里的报错信息,告诉我怎么解决」——直接发图加提问,不用自己先把图转成文字。

⚠️边界与常见误解

  • 看图不等于全对:小字、手写、复杂表格仍会认错,关键信息要复核
  • 图片很吃 Token:一张图可能等于几百上千字的费用
  • 模型之间能力差异大:有的能读懂图表数据,有的只认得风景照

🔗相关术语