Nano Banana Pro 提示词:稳定生成影棚级画面的结构化写法

想让 Nano Banana Pro 稳定生成影棚级画面,关键不在堆砌“8K”等质量词,而在把主体、构图、动作、场景、风格与编辑要求写成清晰简报。本文拆解 Google 的提示框架,并讲清镜头、光线、文字、参考图、品牌一致性和分辨率的实战写法,帮你减少随机发挥,更快得到可交付、可复现的结果。

Friday, September 4, 2026Omid Saffari
Tools
Nano Banana Pro 提示词:稳定生成影棚级画面的结构化写法

Nano Banana Pro 提示词写得敷衍,模型就会把错误一路执行到底。信息流里泛滥的粗糙 AI 图,与干净的影棚级画面之间,差的不是神秘种子,也不是所谓魔法词,而是结构。Google 已经公开了完整框架,只是各类提示词包网站又把它包装起来,悄悄卖给了你。

想让 Nano Banana Pro 更快生成好图,就别再堆关键词,改写一份清楚的创意简报。它的模型是 Gemini 3 Pro Image,与 Gemini 3 Pro 使用同一套推理引擎。因此,它理解提示词的方式更像艺术指导阅读创意简报:需要明确的主体、画面、光线,以及每张参考图承担的任务。信息给全,它就能稳定产出干净、清晰、可复现的结果;只写 "logo, modern, 8k, ultra HD",得到的往往只是平庸成片。

下面这套方法以 Google 官方的七条提示框架为基础,再补上真正能把框架变成可交付作品的专业技巧。

Google DeepMind 上的 Nano Banana Pro 模型页面
Nano Banana Pro,即 Google 的 Gemini 3 Pro Image 模型

写好 Nano Banana Pro 提示词,先守住这一条

具体比冗长更重要。效果不佳,几乎总是因为提示词太模糊,而不是因为字数太少。

Nano Banana Pro 会推理你写下的内容,而不是简单匹配词语模式,所以堆上 "masterpiece, 8k, ultra-detailed, award-winning" 这类质量标签几乎没有作用。模型本来就会追求高保真;它真正无法替你决定的,是你没有交代的部分:镜头怎样构图、光从哪里来、画面是什么情绪。留白越多,模型自由发挥得越多,而粗糙感往往就藏在这些即兴发挥里。

所以下文所有提示词都遵循同一条原则:写清真正重要的信息,删掉装饰性词语。"A ceramic coffee cup" 太弱;"A matte-black ceramic cup, top-down, on a raw concrete counter, hard mid-morning window light from the left" 才是一条可执行的指令,模型也更可能连续两次做出一致结果。

用六个部分写清场景

把提示词拆成六个部分,就能在模型开始猜测之前,把它需要的信息基本补齐。这正是 Google 的检查清单;每一项都在堵住一个自由发挥的缺口,所以有效。

  • 主体:画面里是谁或什么,要写具体。不要只写“一个机器人”,而要写“一个神情冷静、双眼发出蓝光的机器人咖啡师”。
  • 构图:镜头如何取景,例如极近特写、广角全景、低机位或人像构图。
  • 动作:正在发生什么,例如冲咖啡、迈步途中或施放魔法。
  • 地点:事情发生在哪里,例如火星上的未来咖啡馆,或黄金时刻洒满阳光的草地。
  • 风格:整体审美方向,例如照片级写实、黑色电影、1990 年代产品摄影或扁平矢量风。
  • 编辑指令:修改现有图片时直接说清楚,例如 "change the man's tie to green,"、"remove the car in the background."

来看一次真实的前后对比。先写偷懒版本:"a sneaker product photo, clean, professional." 得到的会是一只普通鞋,摆在普通的无缝背景前;当占位图尚可,对品牌毫无价值。现在把六个部分补齐:"A single white leather low-top sneaker (subject), shot at a three-quarter hero angle, filling 60% of the frame (composition), resting still on a brushed-concrete plinth (action and location), in the style of premium 1990s catalog product photography with soft directional studio light (style)." 模型没变,耗时仍是五秒,但这次的画面已经可以放进提案。

前一种写法是在搜索,后一种是在下简报。模型每次都会更偏爱后者。

像摄影指导一样调度画面

场景确定后,真正拉开业余与影棚级差距的控制项,与摄影师使用的完全相同:画幅、镜头和光线。Nano Banana Pro 能直接理解这三类自然语言指令。

先定画布。 首先写明宽高比,也就是画面的宽与高之比。图标或社交方图用 1:1,横幅主视觉或幻灯片用 16:9,手机竖版海报或 Story 用 9:16,电影感宽银幕用 21:9,信息流里表现更好的竖图用 4:5。开头就说明比例,可以避免模型为了适配你并不想要的画幅而裁掉主体。

再调度相机。 直接借用摄影指导的词汇,模型会按这些指令执行:

  • "A low-angle shot with a shallow depth of field (f/1.8)":景深指画面中保持清晰的范围;浅景深会让主体锐利、背景化成柔和虚影,通常更显高级。
  • "Golden hour backlighting creating long shadows":同时说明光线的质感和方向。
  • "Cinematic color grading with muted teal tones":调色是有意识地为整幅画面叠加色彩倾向,让它更像电影剧照,而不是随手快照。
  1. 锁定画幅

    开头先写宽高比和景别:"A 4:5 portrait, eye-level medium shot."

  2. 布置光线

    说明光源、方向和质感:"soft window light from camera-left, gentle falloff into shadow."

  3. 确定调色

    最后补上色彩处理:"warm, slightly desaturated color grade, filmic contrast."

画幅、光线、调色,这三行指令足以让一张“生成图”更接近一张“拍摄成片”,代价不过是多写十五个词。

怎样让图片里的文字真正可读

如果画面必须带有清晰可辨的文字,Nano Banana Pro 是目前最出色的工具,但前提是把文字当作需要调度的画面元素,而不是临时补上的备注。

这是该模型最突出的能力。它能直接在图片中生成多种语言的正确、可读文字,因此成为海报、样机和信息图的常用选择;其他图像模型在这些场景里往往仍会生成乱码。诀窍是明确三件事:准确文案、字体风格和摆放位置。

"The headline 'URBAN EXPLORER' rendered in bold, white, sans-serif type at the top third of the frame."

用引号标出字符串,模型才知道每个字应该怎样拼写。说明风格,比如粗体、窄体、手写体或某个年代的字体,让文字贴合品牌;再指定位置,避免它飘到主体上。对产品样机或海报来说,这种控制力正是选择该模型而非 Midjourney 的关键原因,后者至今仍无法稳定排出一行干净的文字。

参考图要逐张分配任务

给 Nano Banana Pro 输入参考图时,最能明显改善结果的一步,是说明每张图究竟用来做什么。一次合成最多可接收 14 张参考图(准确上限会随使用入口而变化),并能在同一场景中维持最多 5 个人的相貌一致性。正因为如此,它才能用于真实的品牌和角色项目,而不只是生成一次性图片。

常见错误是一次扔进去三张图,然后期待模型自己理解。解决办法是在提示词里为每张图指定任务:

"Use Image A for the character's pose, Image B for the art style, and Image C for the background environment."

这样,模型会带着明确意图完成合成,而不是把所有输入平均成一团混沌。品牌主理人可以借此让同一位创始人的脸贯穿整套营销活动,代理公司也能让同一个吉祥物稳定出现在十个触点中。不分配角色时,四图混合很容易得到一个浑浊的杂交结果;分配之后,每张参考图只负责一项工作。

品牌一致性提示词:建立可复用的规范模块

做品牌项目时,不要每次从头写提示词,而要反复使用同一套结构化规范。保持视觉风格可复现的方法,是先把品牌定义成带标签的固定模块,再粘贴到每次生成任务中。

把视觉识别写成明确规范,让模型每次都用同一种方式读取:

品牌规范: 主色为深海军蓝 (#10203A),强调色为暖珊瑚色。字体:标题使用粗体几何无衬线,全大写。气质:自信、极简、大量留白。标志:左上角放一个简洁的珊瑚色圆形标记。

本次素材: 将品牌规范应用于一张 4:5 的产品发布社交卡片,标题 "SHIP IT" 居中。

固定品牌识别模块有两项好处:既能阻止风格在多轮生成中漂移,又只需改动“本次素材”这一行,就能为整套营销活动持续产出统一画面。模型也擅长把既定设计、图案、标志或艺术作品贴合到 3D 物体和样机上,同时让光线保持自然,因此同一规范模块可以从平面卡片一路沿用到产品棚拍图。

个人创业者在这里能获得最大的杠杆:一份严谨的品牌规范模块,就能让模型像一位永远不会忘记风格指南的初级设计师。企业内部团队还可以在共享文档中管理模块版本,让所有人默认生成符合品牌规范的素材。

它会在哪里失手,以及如何补救

真正可靠的方法必须把失败场景说清楚。Google 已经列出 Nano Banana Pro 的局限,而每一项都有可以直接纳入工作流的解决办法。

优势
做得好的地方
10 points

  • 可直接在图片中生成多种语言的清晰标题文字
  • 能让最多 5 个人或一个产品在同一场景中保持一致
  • 借助 Search 生成基于现实信息的信息图和示意图
  • 用自然语言控制影棚级光线、镜头和色彩
  • 原生输出最高可达 4K
  • 小字号和精细细节可能乱码或拼写错误
  • 示意图里的数据可能错得十分笃定
  • 多语言文字可能出现语法或文化错误
  • 重度混合与光照编辑可能留下瑕疵
  • 连续编辑时,角色特征可能发生漂移

补救方法与问题一一对应:

  • 小字乱码 → 只生成醒目的大标题,正文和法律文案随后在设计工具中叠加。
  • 图表事实错误 → 绝不要相信生成图表里的数字;在提示词中提供真实数据,交付前逐一目视核对所有标签。Search grounding 有帮助,但不能免除检查责任。
  • 多语言失误 → 翻译文字投放到付费营销活动之前,交给母语人士校对。
  • 混合瑕疵 → 减少参考图数量、分配更清楚的角色,或者手动完成最终合成,不要强求模型一次完成高难度混合。
  • 角色漂移 → 锁定核心参考图,每次从原始参考图重新生成,不要在反复编辑过的图片上继续编辑。

分辨率与导出:按任务选择档位

按照任务需要选择分辨率,不必每次都拉到最高。Nano Banana Pro 提供三个原生输出档位:1K (1024px) 适合快速草稿和社交内容,2K (2048px) 适合大多数成品网页与演示材料,4K (最高 4096px,约 16 megapixels) 适合印刷、大幅输出或后续需要重度裁切的素材。

档位越高,每张图消耗的时间和费用越多。因此先用 1K 确认构图,反复调整提示词,等画面正确后,再用胜出的提示词以 4K 重跑一次作为最终稿。每张输出还带有不可见的 SynthID 水印,用于标记它由 AI 生成;如果素材使用场景重视来源,这一点值得提前了解。日常使用可以通过 Gemini app 完成;需要模型控制和 API 访问时,则使用 Google AI Studio 或 Vertex AI。

Google AI Studio 界面
Google AI Studio 提供模型控制和 API 访问

想知道各个平台分别如何收费、自己真正需要哪个访问档位,可以查看 Nano Banana Pro 定价详解。如果仍在判断是否要把它定为标准工具,请看它在 2026 年 AI 图像生成器对比中的位置;若只做风格探索,Midjourney在插画与氛围表现上仍然领先。

有哪些值得复制粘贴的 Nano Banana 提示词?

复制粘贴式提示词包可以用来了解模型的能力范围,但它只是起点,不是方法。相比借来的长句,模型更偏爱由主体、构图、动作、地点和风格组成的结构化场景规范。先用提示词包学习表达方式,再围绕自己的实际主体写简报。为具体场景定制的提示词,每次都会胜过通用模板。

怎样写提示词才能提升图片质量?

质量来自明确调度,而不是质量标签。堆叠 "8k, ultra-HD, masterpiece" 几乎没有作用,因为模型本来就会追求高保真。应该写出真正影响质量的条件:分辨率档位(以 2K 或 4K 生成)、真实的相机与镜头提示("shot on a 50mm lens, shallow depth of field"),以及明确光线("soft directional window light")。这些信息比一串形容词有效得多。

Nano Banana Pro 提示词能用于照片编辑吗?

可以,而且这是它的强项之一。上传图片后,直接针对现有内容发出编辑指令:"change the jacket to forest green,"、"remove the sign in the background,"、"relight this as golden hour." 明确说明只想改动的一项内容;指令含糊,模型就可能重做原本希望保留的部分。

Nano Banana Pro 的文字能力为什么优于其他模型?

它能直接在图片中生成多种语言的正确、清晰文字,而大多数图像模型仍会输出错乱字母。把准确文案放进引号,说明字体风格和位置,它就能排出干净的标题。但要留意尺寸:生成文字应当大而短,因为小字号和长段落仍会拼错。

最近更新

2026年9月4日

分类Design

在 Google 中优先显示本站

将 omidsaffari.com 添加为 Google 搜索的优先来源

把 omidsaffari.com 设为优先来源,Google 会在 Top Stories、AI Overviews 和 AI Mode 中为您优先展示。

更多 Design 文章

查看全部 Design 文章
订阅通讯

每周日,一封信。 写运转中的系统,不写热评。

来自一组 AI 项目组合运营的构建日志、生产系统与一线笔记。

每周一期。无垃圾邮件。随时退订。