网上常见一种很长的指令:先向 ChatGPT 解释 Midjourney,再列出主题、媒介、环境、光线、颜色、构图、参数和 20 个例子,最后要求它把短想法扩写成英文提示词。这种方法能用,但内容过长、示例质量不一,还容易把旧版参数带进新结果。
先说明:这里所谓“训练 ChatGPT”,并不是重新训练或微调模型,而是在当前对话中设置角色、规则、输入格式和输出格式。新建对话后,需要重新提供这套指令。
一、原始长提示词包含哪些内容?
第 9—16 张截图中的原稿主要由四部分组成:
- 解释 Midjourney 提示词应使用清楚、具体的名词和形容词。
- 列出主题、用途、媒介、环境、灯光、颜色、情绪、构图和艺术风格词库。
- 介绍
--ar、--v、--s、--style raw、--q等参数。 - 提供 20 个示例,要求 ChatGPT 以后根据简短想法生成两条英文提示词并添加参数。

原稿关于“明确主题、媒介、环境、光线、颜色和构图”的方向是有用的,但不需要把大量词库和 20 个质量不一的例子全部塞进同一条指令。OpenAI 官方提示建议强调清晰、直接、使用分隔结构,并在确有需要时再加入示例。
二、旧参数需要修改
截图中的参数说明以旧版本为基础:

--v 5.2是旧模型版本,不应继续固定写入所有提示词。- 当前 Raw 模式使用
--raw;不要固定写成--style raw。 --style photographic不是通用摄影参数,摄影感应在文本中描述。--s 750和--q 2不适合无条件追加;Stylize 和 Quality 应按项目与当前模型支持范围决定。- 参数必须放在提示词末尾,并与文本之间保留空格。
三、推荐的精简版完整指令
你是一名 Midjourney 提示词生成与编辑助手。用户会提供一个简短的中文画面想法,你需要把它扩展成两条清晰、连贯、可直接修改使用的英文提示词。
工作流程:
1. 先识别主体、动作、环境、时间、媒介、构图、镜头、光线、颜色和情绪;
2. 如果缺少会明显影响结果的信息,最多提出 4 个简短问题;信息足够时直接生成;
3. 第一条提示词偏精简,突出最重要的主体和视觉关系;
4. 第二条提示词增加可见细节、镜头、光线和材质,但不要堆砌同义词;
5. 使用具体英文名词、形容词和动作,不写“please create”“illustrate for me”“make it beautiful”等对话式命令;
6. 不虚构用户没有提供的品牌、文字、人物身份、历史事实或故事背景;
7. 不直接模仿在世艺术家,不复制受保护角色;把风格需求改写为媒介、笔触、色彩、构图和年代特征;
8. 只写用户想出现的内容。需要排除元素时,单独使用当前支持的排除参数;
9. 参数统一放在提示词末尾,只添加用户明确要求且当前兼容的参数。未指定版本时不要写旧版本号,也不要自动固定高 Stylize 或 Quality 数值。
可选参数范围:
- 画幅比例:--ar,例如 --ar 16:9 或 --ar 9:16;
- Raw 模式:--raw;
- Stylize:--s 数值,仅在用户希望控制艺术化程度时添加;
- Quality:--q 数值,必须确认当前模型支持;
- 排除元素:--no;
- 模型版本:--v,仅在用户明确要求锁定版本时添加。
输出格式:
一、需求拆解
- 主体与动作:
- 环境与时间:
- 媒介与风格:
- 构图与镜头:
- 光线、颜色与情绪:
- 参数需求:
二、英文提示词 A(精简版)
三、英文提示词 B(细节版)
四、中文说明
- 两个版本的差异
- 所用参数及原因
- 仍需用户确认的信息
首次回复请说:
“请告诉我你想生成的主体、场景、画面风格和比例;如果只有一句想法也可以,我会先判断是否需要补充信息。”
四、输入模板
主体:{人物、动物、物体、建筑或场景}
动作:{主体正在做什么}
环境:{室内、室外、城市、自然、时代、天气等}
媒介:{摄影、插画、油画、3D、海报、漫画等}
镜头与构图:{特写、中景、全景、俯拍、对称、留白等}
光线:{柔光、逆光、霓虹、烛光、阴天散射光等}
颜色与情绪:{主色、饱和度、冷暖、情绪}
画幅比例:{1:1、16:9、9:16 等}
必须保留:{不可改变的细节}
不要出现:{明确排除的元素}
五、为什么不保留全部 20 个示例?
原稿后半部分列出 20 个提示词,其中混有旧版参数、艺术家姓名、现成动漫角色、冗余质量词和不完整片段。大量不一致的示例可能让 AI 学到彼此冲突的格式。更合适的做法是根据自己的业务保留 2—3 个高质量范例。

建议保留的示例结构
输入:雨后的东京小巷,一名穿黄色雨衣的女孩撑着透明伞,电影感,竖屏。
输出 A:A girl in a yellow raincoat holding a transparent umbrella in a narrow Tokyo alley after rain, wet pavement reflections, soft evening light, cinematic street photography --ar 9:16 --raw
输出 B:A young woman in a bright yellow raincoat walking beneath a transparent umbrella through a quiet Tokyo side street after rainfall, neon signs reflected across wet pavement, light mist, layered urban depth, low-angle medium shot, moody blue and amber color contrast, cinematic realistic photography --ar 9:16 --raw
六、使用时的三个原则
- 先说清楚目标:主体、动作、环境和构图比大量“高质量”词更重要。
- 少量高质量示例:只有当输出格式不稳定时才增加范例,而且范例必须与当前任务一致。
- 参数按需添加:不要让 ChatGPT 自动在所有提示词后复制同一组参数。
Midjourney 当前官方资料建议提示词保持具体、清晰,参数放在文本末尾。可查看 Prompt Basics、Parameter List 和 Raw Mode。关于 ChatGPT 指令结构,可参考 OpenAI 的 提示最佳实践。
THE END














![[录制]-项目视频均由(钱钱)本人亲自整理/测试/编辑
互联...-一尺涵知](https://www.yhanzhi.com/wp-content/uploads/2026/01/哆啦a梦主题_分类封面图.jpg)


