使用 Gemini 创建图像的实用指南(2026 版)

2026/06/29

“如何用 Gemini 创建图像?”是我几乎与视频相关话题一样频繁收到的问题——而且和视频类似,大多数人的想象都有些偏差。他们以为存在一个叫“Gemini”的模型来绘制图画。实际情况是,Gemini 背后有一小群图像模型,每个都针对不同的“动词”而构建。一旦你搞清楚自己实际调用的模型,就能停止猜测,并在首次尝试时获得可用的图像。

以下是诚实的版本和实用的版本。

首先:Gemini 是大脑,图像模型才是画笔

Gemini 是一系列多模态模型。它能推理、写作、阅读图像并理解你的提示。但生成图片的实际像素来自谷歌专用的图像模型:

  • Imagen 4 — 谷歌旗舰级文生图模型。你给出文本提示,它从零生成全新的图片。纯粹生成式:无法编辑、不可上传,只需输入文本就能输出照片。它在逼真度和构图方面确实非常出色。
  • Nano Banana(Gemini Flash 图像)—— 编辑模型。上传图像,用对话方式描述要修改的内容,它会保留你未提及的一切。这就是人们所说的“用 AI 编辑我的照片”时所指的模型。

一条规则总结:Imagen 4 负责创建图像,Nano Banana 负责编辑图像。 如果你有一块空白画布,那就生成。如果你已经有图像并只想改变某一部分,那就编辑。选错动词不仅会损失质量,还会浪费积分。

访问图像模型的三种方式

与 Gemini 栈中的其他功能一样,三者在价格与麻烦程度之间有所权衡:

  1. Gemini 应用 / Google AI Studio。 提供免费套餐,但存在速率限制,有时会加水印,并且对特定模型的访问取决于套餐和地区。适合一次性实验。
  2. Google Cloud Vertex AI。 原生 API。完全控制权,无水印——但需要 GCP 账户和结算设置,以及 API 密钥,按图像计费。除非你要构建基础设施,否则大材小用。
  3. 托管工具(服务端包装模型)。 输入提示,它就能生成,只需为你生成的图像付费。无需密钥、无需 GCP、没有意外账单。我正是出于这个原因构建了 GeminiOmni 的图像生成器,因为选项 1 和 2 要么过于受限,要么步骤太多,不适合只想获得一张图像的人。

根据频率选择。每月一次?Gemini 应用就足够了。每周超过一次?托管包装器既能省钱,又无需进行 GCP 设置。

实际操作步骤(文生图)

无论你选择哪条路线,操作机制都是一样的:

1. 将场景编写为提示。 在一两句话中描述主体、风格、光线和构图。关键框架如下。

2. 首先选择宽高比。 16:9 用于横幅和缩略图,1:1 用于动态及头像,9:16 用于故事。在生成前决定——后续裁剪会损失分辨率。

3. 根据任务选择模型。 草稿和迭代时追求快速廉价(像 Z-Image Turbo 这样的轻量级模型成本仅旗舰级的一小部分);当需要 2K 输出和图像中清晰的文字时,使用 Nano Banana Pro 这样的高级模型。

4. 生成并查看。 现代图像模型只需几秒即可返回。观察整个画面,而不仅仅关注主体——手、文字和面孔依然是模型容易出错的地方。

5. 每次只迭代一个变量。 如果结果达到 80% 正确,不要重写整个提示。只改变一个元素——光线、镜头或时间——然后重新生成。

真正有效的提示词框架

经过数百次生成后,这是我每次都会使用的结构:

[镜头类型 / 媒介] 的 [主体] 正在 [做某事],[场景],[光线 / 时间],[情绪],[风格或相机细节]。

一个例子:

在黄金时段的岩石海岸上,一座孤独灯塔的电影级广角镜头,长长的阴影,平静怀旧的情绪,使用 35mm 胶片拍摄,浅景深。

其中包括:

  • 媒介或镜头类型(“电影级广角镜头”、“棚拍产品照”、“扁平矢量图”)—— 这决定了整体外观。图像模型能识别媒介词汇。
  • 正在做某事的具体主体—— 具体的名词和动词胜过堆砌形容词。“岩石海岸上的一座灯塔”优于“一副美丽的景色”。
  • 光线和时间—— “黄金时段”、“霓虹夜晚”、“阴天的早晨”。这个短语决定了情绪的一半。
  • 风格或相机细节—— 追求逼真时用“35mm 胶片”、“浅景深”、“4K,超精细”;追求图形时用“扁平矢量”、“水彩”、“等距”。

不利于提示的因素:堆叠十个形容词、自相矛盾的指令(“极简但高度详细的场景”)、以及没有视觉锚点的抽象概念(“一张关于自由的图像”)。模型渲染的是它能看见的东西——所以给它可看见的东西。

常见失败及解决方法

“图像中的文字杂乱不清。” 扩散模型历来在书写单词方面表现糟糕。保持文字简短,在提示中用引号括起来,并使用更强的模型——Nano Banana Pro 渲染清晰文字的能力远胜于快速层级。

“面孔看起来不对。” 面孔是2026 年每一款图像模型面临的最大难题。拉远镜头,避免极端特写,添加“自然肌肤纹理,柔和的棚拍灯光”,而不是期望快速层级能生成完美的肖像。

“它忽略了我一半的提示。” 你很可能描述过度了。一个主体、一个瞬间、一种情绪。砍掉后半部分。

“它看起来不真实。” 添加“使用 35mm 胶片拍摄”、“浅景深”、“自然光”——并降低对手和细小文字的期望,这些仍然是所有模型的薄弱环节。

编辑而非生成

如果你已经有一张喜欢的图像——产品照片、插画、角色——不要从头重新描述。把图像交给编辑模型,只提示你想要改变的部分。这正是人们真正追求的使用“AI 编辑照片”,而且它几乎总是优于纯文生图,因为模型不需要猜测构图——你已经给出了框架。大多数托管工具(包括我们的)将其作为一个独立的上下文编辑模式提供。

那么,获得首张图像的最快免费路径是什么?

如果你只想试一次,不介意水印,那么在 Gemini 应用中生成即可。如果你会经常使用——内容创作、营销、缩略图——跳过 GCP 设置,使用一个在服务端包装模型并按渲染计费的工具。这正是 GeminiOmni 填补的空白:你输入提示,几秒内就能得到一张真实的图像。新账户从免费积分开始——而且因为快速层级生成一张图像只需少量积分,你的首张图像实际上是免费的,无需绑定信用卡就能验证其效果。

这些模型已经足够好了。挡在你和一张让你自豪的图像之间的,不是 Gemini 或 Imagen,而是提示。从上面的框架入手,每次只改变一个变量。你会惊人地快速上手。

Lena Hoffmann

Lena Hoffmann