多模态 Multimodal AI
用户上传手机结算页截图,并问哪里会让人看不清;应用先识别界面结构,再把视觉发现和文字目标合成具体修改建议。
AI 与智能体约 10 分钟 · 从真实需求理解
1AI 能看懂我发的截图吗?
MULTIMODAL AI · SEE + READ + ACT把截图里的线索,和你的目标放在一起理解
TEXT + IMAGE → ACTION图片告诉模型看到了什么,文字告诉它要解决什么。
结算⋯
订单总计订单总计 ¥99
优惠码[ 应用 ]
立即支付→
多模态 AI 不只处理文字,也可以接收截图、图片或其他受支持的输入。比如你上传手机结算页截图,再问“哪里会让人看不清”,模型要先读出界面中的按钮、文字和拥挤区域,再把这些视觉线索和你的目标放在一起理解。
- 文字告诉模型要解决什么,截图提供页面里真实存在的视觉证据。
- 模型需要分别确认支持哪些输入、能输出什么结果,不能把“能看图”直接等同于“能准确完成任务”。
- 好的回答要指出截图中的具体区域和下一步动作,而不是只说“图片看起来没问题”。
2看见图片,不等于自动看懂任务
多模态不是简单给文字模型加一个图片附件,而是让不同输入共同参与理解。截图能提供布局、层级和视觉状态,但模型仍然要知道你想检查什么,应用也要确认当前模型支持的输入与输出能力。
- OCR 只回答“图片里写了什么”,多模态任务还可能要回答“哪个区域与目标有关”。
- 图片描述只复述看到了什么,多模态回答还要把观察结果连接到用户的文字目标。
因此,上传截图后得到一段流畅描述,并不自动代表问题已经解决;要看回答是否引用了真实视觉线索,并能落到可执行的下一步。
3一次多模态理解由哪些部分组成?
订单总计 ¥99优惠码 [ 应用 ]立即支付 →
拆开一次截图检查,可以看到文字目标、视觉证据、视觉识别和行动答案四个部分。它们不是四张独立的卡片,而是一条从“想解决什么”到“具体改哪里”的证据链。
- TEXT GOAL 说明用户希望模型判断或完成什么。
- IMAGE EVIDENCE 提供截图中的页面结构、文字、控件和视觉状态。
- VISUAL READING 把截图里的区域和关系转成可讨论的线索。
- ACTIONABLE ANSWER 把线索对应到具体区域和下一步修改,而不是停在泛泛描述。
4怎样把多模态需求交给 Agent?
请做一个多模态 AI 截图检查流程:用户同时提供手机结算页截图和“找出让用户看不清的地方”这句文字目标;先在截图中标出识别到的操作区域,再把视觉发现和文字目标结合,最后给出指出具体区域、可以直接执行的修改建议。请确认输入和输出能力,支持键盘操作、暗色主题,并保证 390px、320px 下不横向滚动。
5不用背,看看你能不能判断
1 / 3
在截图检查中,文字目标和图片分别承担什么作用?
请选择一个最符合题意的答案
社区延伸
看别人真实遇到过什么
社区帖子还没有关联到这个词条。