AI制造局 提示词 · 本局出品
← 返回首页
duomotai

多模态提示词:文字、图片、语音一起用

更新于 2026年8月14日 分类:写作辅助 更多提示词 →

多模态提示词:文字、图片、语音混合使用,看懂和用好,让 AI 理解力再上一个台阶。

只会打字问 AI,等于把它的能力用掉一半。现在的 AI 能看图、听语音、读文件,把这些模态加进提示词,很多说不清的事就说得清了。这篇讲多模态提示词怎么用,配模板和避坑。

先拿走 3 条:今天就能用上的多模态提示词示例

示例1(文字+图片):我上传了一张产品照片,请根据照片写一段电商详情页文案:先描述外观;再提炼 3 个卖点;语气自然不夸张。要求:只描述照片里能看到的东西。

示例2(文字+语音):这是一段会议录音转写(见下),请帮我出纪要;另外请判断说话人的语气是平静还是激烈,给出依据。输出格式:纪要加语气分析。

示例3(文字+文件):我上传了一份 Excel 和一份 PDF 说明,请核对:Excel 里的数字和 PDF 里的口径是否一致?找出不一致的地方并列出。

多模态提示词是什么

多模态就是让 AI 同时处理文字、图片、语音、文件。用法关键在「分工明确」:哪张图回答哪部分、哪个文件是依据、输出里哪些来自图哪些来自文,都要在提示词里说清。很多 AI 已经支持上传图片和文件,但你不说「只基于图片回答」,它可能把文字和图片的信息混在一起,甚至脑补图片里没有的内容。

两个场景模板+参考选项

场景一:图文结合

模板
我上传了{{图片/文件}},请基于它{{任务}}。要求:{{依据范围}}{{输出}}{{禁止}}
参考选项:
- {{图片/文件}}:产品照片/截图/图表/PDF
- {{任务}}:写文案/做分析/提取信息
- {{依据范围}}:只基于图片内容/结合文字背景
- {{输出}}:描述+结论/表格/分点
- {{禁止}}:不要脑补图片外内容/不要编造数据

场景二:多来源核对

模板
我上传了{{材料A}}{{材料B}},请核对:{{核对项}}。要求:{{来源}}{{输出}}{{不一致时}}
参考选项:
- {{材料A}}:Excel 数据/合同/报告
- {{材料B}}:PDF 说明/聊天记录/清单
- {{核对项}}:数字是否一致/口径是否相同/信息是否有冲突
- {{来源}}:每项标注来自哪个文件
- {{不一致时}}:列出差异并说明影响
填好的示例
我上传了产品照片,请基于它写文案。要求:只基于图片内容;描述+结论;不要脑补图片外内容。

已把参考选项的第一组填进模板,复制后改数字、细节就能直接发给 AI。

使用说明

怎么用:三步。① 上传前想清楚:哪部分信息该由哪个文件提供;② 提示词里写明依据范围和禁止项(只基于图片、别脑补);③ 多来源任务要求标注来源,方便核对。

为什么选它

多模态能把「说不清」变成「看得清」,尤其产品、图表、文档类场景。

怎么用好

把「只基于上传内容+标注来源+不脑补」写成固定规则,所有多模态任务都带上。

常见坑

坑 1:不限制依据来源。AI 可能脑补图片里没有的内容,写明「只基于图片」。

坑 2:多来源不标出处。两份材料混在一起说不清,要求每项标注来源文件。

坑 3:图片质量太差。模糊、截断的图识别不准,上传前检查清晰度。

常见问题

问:哪些 AI 支持多模态?
答:ChatGPT、Kimi、通义千问、豆包等都支持上传图片和文件,具体看当前版本。

问:语音和图片能同时用吗?
答:多数情况是「语音转文字+图片」组合,提示词里把两者关系说清楚即可。

适用模型:ChatGPT / Kimi / 通义千问 / 豆包

适用场景:看图写文案;文档数据核对;图片和文字混合的信息提取

返回首页继续找提示词 浏览全部分类
分享这篇提示词: 微博 QQ空间 微信:复制链接发给朋友即可
AI 制造局 · 提示词工坊

一个人工整理的中文提示词库。每篇都按「示例+模板+参考选项+使用说明」的标准出厂,提示词经实际使用验证;内容由本站编辑撰写,欢迎按自己的场景改造成更好用的版本。

发表评论