多模态 · Multimodal
英文:multimodal(multi 重音在前)
AI 基础难度:入门 ★
🗣️一句话大白话
能同时看图、听音频、读文字的模型。你发一张截图问「这报错怎么回事」,它能看懂图——这就是多模态。
🎬真实场景
把微信里的报错弹窗截图直接丢给 AI,它读出错误码并给出解决办法——纯文字模型做不到,多模态模型看一眼就行。发票识别、界面走查、看图写文案,都靠它。
📮你可以这样说
「「看这张截图里的报错信息,告诉我怎么解决」——直接发图加提问,不用自己先把图转成文字。」
⚠️边界与常见误解
- ▸看图不等于全对:小字、手写、复杂表格仍会认错,关键信息要复核
- ▸图片很吃 Token:一张图可能等于几百上千字的费用
- ▸模型之间能力差异大:有的能读懂图表数据,有的只认得风景照