“如何用 Gemini 建立影像?”是我幾乎與影片相關話題一樣頻繁收到的問題——而且和影片類似,大多數人的想象都有些偏差。他們以為存在一個叫“Gemini”的模型來繪製圖畫。實際情況是,Gemini 背後有一小群影像模型,每個都針對不同的“動詞”而構建。一旦你搞清楚自己實際呼叫的模型,就能停止猜測,並在首次嘗試時獲得可用的影像。
以下是誠實的版本和實用的版本。
首先:Gemini 是大腦,影像模型才是畫筆
Gemini 是一系列多模態模型。它能推理、寫作、閱讀影像並理解你的提示。但生成圖片的實際畫素來自谷歌專用的影像模型:
- Imagen 4 — 谷歌旗艦級文生圖模型。你給出文本提示,它從零生成全新的圖片。純粹生成式:無法編輯、不可上傳,只需輸入文本就能輸出照片。它在逼真度和構圖方面確實非常出色。
- Nano Banana(Gemini Flash 影像)—— 編輯模型。上傳影像,用對話方式描述要修改的內容,它會保留你未提及的一切。這就是人們所說的“用 AI 編輯我的照片”時所指的模型。
一條規則總結:Imagen 4 負責建立影像,Nano Banana 負責編輯影像。 如果你有一塊空白畫布,那就生成。如果你已經有影像並只想改變某一部分,那就編輯。選錯動詞不僅會損失質量,還會浪費積分。
訪問影像模型的三種方式
與 Gemini 棧中的其他功能一樣,三者在價格與麻煩程度之間有所權衡:
- Gemini 應用 / Google AI Studio。 提供免費套餐,但存在速率限制,有時會加水印,並且對特定模型的訪問取決於套餐和地區。適合一次性實驗。
- Google Cloud Vertex AI。 原生 API。完全控制權,無水印——但需要 GCP 帳戶和結算設定,以及 API 金鑰,按影像計費。除非你要構建基礎設施,否則大材小用。
- 託管工具(服務端包裝模型)。 輸入提示,它就能生成,只需為你生成的影像付費。無需金鑰、無需 GCP、沒有意外賬單。我正是出於這個原因構建了 GeminiOmni 的影像生成器,因為選項 1 和 2 要麼過於受限,要麼步驟太多,不適合只想獲得一張影像的人。
根據頻率選擇。每月一次?Gemini 應用就足夠了。每週超過一次?託管包裝器既能省錢,又無需進行 GCP 設定。
實際操作步驟(文生圖)
無論你選擇哪條路線,操作機制都是一樣的:
1. 將場景編寫為提示。 在一兩句話中描述主體、風格、光線和構圖。關鍵框架如下。
2. 首先選擇寬高比。 16:9 用於橫幅和縮圖,1:1 用於動態及頭像,9:16 用於故事。在生成前決定——後續裁剪會損失解析度。
3. 根據任務選擇模型。 草稿和迭代時追求快速廉價(像 Z-Image Turbo 這樣的輕量級模型成本僅旗艦級的一小部分);當需要 2K 輸出和影像中清晰的文字時,使用 Nano Banana Pro 這樣的高階模型。
4. 生成並檢視。 現代影像模型只需幾秒即可返回。觀察整個畫面,而不僅僅關注主體——手、文字和麵孔依然是模型容易出錯的地方。
5. 每次只迭代一個變數。 如果結果達到 80% 正確,不要重寫整個提示。只改變一個元素——光線、鏡頭或時間——然後重新生成。
真正有效的提示詞框架
經過數百次生成後,這是我每次都會使用的結構:
[鏡頭型別 / 媒介] 的 [主體] 正在 [做某事],[場景],[光線 / 時間],[情緒],[風格或相機細節]。
一個例子:
在黃金時段的岩石海岸上,一座孤獨燈塔的電影級廣角鏡頭,長長的陰影,平靜懷舊的情緒,使用 35mm 膠片拍攝,淺景深。
其中包括:
- 媒介或鏡頭型別(“電影級廣角鏡頭”、“棚拍產品照”、“扁平向量圖”)—— 這決定了整體外觀。影像模型能識別媒介詞彙。
- 正在做某事的具體主體—— 具體的名詞和動詞勝過堆砌形容詞。“岩石海岸上的一座燈塔”優於“一副美麗的景色”。
- 光線和時間—— “黃金時段”、“霓虹夜晚”、“陰天的早晨”。這個短語決定了情緒的一半。
- 風格或相機細節—— 追求逼真時用“35mm 膠片”、“淺景深”、“4K,超精細”;追求圖形時用“扁平向量”、“水彩”、“等距”。
不利於提示的因素:堆疊十個形容詞、自相矛盾的指令(“極簡但高度詳細的場景”)、以及沒有視覺錨點的抽象概念(“一張關於自由的影像”)。模型渲染的是它能看見的東西——所以給它可看見的東西。
常見失敗及解決方法
“影像中的文字雜亂不清。” 擴散模型歷來在書寫單詞方面表現糟糕。保持文字簡短,在提示中用引號括起來,並使用更強的模型——Nano Banana Pro 渲染清晰文字的能力遠勝於快速層級。
“面孔看起來不對。” 面孔是2026 年每一款影像模型面臨的最大難題。拉遠鏡頭,避免極端特寫,新增“自然肌膚紋理,柔和的棚拍燈光”,而不是期望快速層級能生成完美的肖像。
“它忽略了我一半的提示。” 你很可能描述過度了。一個主體、一個瞬間、一種情緒。砍掉後半部分。
“它看起來不真實。” 新增“使用 35mm 膠片拍攝”、“淺景深”、“自然光”——並降低對手和細小文字的期望,這些仍然是所有模型的薄弱環節。
編輯而非生成
如果你已經有一張喜歡的影像——產品照片、插畫、角色——不要從頭重新描述。把影像交給編輯模型,只提示你想要改變的部分。這正是人們真正追求的使用“AI 編輯照片”,而且它幾乎總是優於純文生圖,因為模型不需要猜測構圖——你已經給出了框架。大多數託管工具(包括我們的)將其作為一個獨立的上下文編輯模式提供。
那麼,獲得首張影像的最快免費路徑是什麼?
如果你只想試一次,不介意水印,那麼在 Gemini 應用中生成即可。如果你會經常使用——內容創作、營銷、縮圖——跳過 GCP 設定,使用一個在服務端包裝模型並按渲染計費的工具。這正是 GeminiOmni 填補的空白:你輸入提示,幾秒內就能得到一張真實的影像。新帳戶從免費積分開始——而且因為快速層級生成一張影像只需少量積分,你的首張影像實際上是免費的,無需繫結信用卡就能驗證其效果。
這些模型已經足夠好了。擋在你和一張讓你自豪的影像之間的,不是 Gemini 或 Imagen,而是提示。從上面的框架入手,每次只改變一個變數。你會驚人地快速上手。
