如何使用 GPT Image 2.5:提示詞、編輯與最佳設定

GPT Image 2.5 最適合用於疊代式圖像工作流程,而非一次性提示生成器。 您應先定義資產,加入清晰的參考資料與限制,然後透過精準編輯進行優化,同時保留角色、產品、版面或文字等不應變動的元素。
其主要升級包括:更佳的參考保真度、更精準的編輯、更強的多輪一致性,以及更優化的視覺控制。Flare 和 Sunburst 也為 API 使用者提供了速度與精準度之間的不同權衡,儘管重複編輯仍可能導致圖像偏移。
本指南涵蓋了提示詞、編輯、角色與產品一致性、參考資料、Flare 與 Sunburst 比較、品質設定、4K、透明度、API 工作流程及疑難排解。對於將核准視覺內容轉化為影片的團隊,Leadde 能將此工作流程延伸至如何使用 AI 製作企業影片,以應用於教育、簡報和行銷內容。
如何在 ChatGPT 中使用 GPT Image 2.5:逐步指南
有效運用 GPT Image 2.5 的關鍵,不在於找到一個完美的提示詞,而是透過受控階段逐步建構圖像。OpenAI 將 Images 2.5 定位為具備更強的參考保真度、更精準的編輯、更佳的多輪一致性及更快的生成速度。它可在 ChatGPT 的桌面、行動裝置和網頁版上使用,但 Sketch、評論和範本等功能可能因平台而異。
步驟 1:生成您的第一張圖像
首先告訴 ChatGPT 您正在製作什麼,而不僅僅是您希望它呈現的感受。
避免使用:
製作一張高質感電影風格圖像。
應先定義交付成果:
製作一張 4:5 的護膚品瓶身廣告,在淺色石面上以柔和晨光拍攝。保留右上角視覺簡潔,以便放置標題文字。
一個實用的初始提示詞通常應涵蓋:
- 交付成果: 產品照片、廣告、海報、UI、資訊圖表、投影片
- 主體: 人物、物件、產品、環境
- 構圖: 畫面取景、攝影機位置、主體擺放、留白空間
- 視覺方向: 光線、色彩、材質、紋理
- 文字: 確切的核准文案
- 限制: 不應出現的內容
OpenAI 的提示詞指南建議,應從您所需的圖像開始,然後描述主體、構圖、風格和限制,而非依賴模糊的風格詞彙。
如果最終圖像需要特定方向,請務必提早決定。在核准構圖後,將圖像從直向改為橫向,可能會迫使模型重新思考空間配置、主體比例和背景內容。
步驟 2:一次只編輯一項內容
當第一張圖像接近理想狀態時,請停止將每個提示詞都視為一次全新的生成。
更佳的編輯指令應為:
變更: 將白色夾克替換為深藍色夾克。保留: 臉部、頭髮、身體比例、姿勢、攝影機角度、背景、光線和裁切。
這種區分至關重要,因為 GPT Image 2.5 旨在編輯過程中保留更多現有圖像元素,但明確的邊界設定仍能帶來益處。OpenAI 特別建議說明哪些應變更,哪些必須保持不變,然後一次只優化一個方面。
對於不明確的局部編輯,請使用圖像編輯器或選取工具(若有提供)。然而,選取區域應被視為編輯指引,而非 Photoshop 式的像素鎖定。API 文件也同樣警告,遮罩雖能引導 GPT Image 編輯,但可能無法達到精確的幾何準確度。
步驟 3:優化、儲存並重複使用成果
對於多輪工作,請將先前核准的圖像作為下一個輸入,並保持重要限制可見。
實用的生產模式是:
生成 → 核准 → 分支編輯 → 品質保證 (QA) → 再次核准
而非:
編輯 1 → 編輯 2 → 編輯 3 → 編輯 4 → 編輯 15
OpenAI 表示 Images 2.5 在重複編輯中具有更高的一致性,並且更有可能保留先前的變更。但更好的穩定性並不意味著無限編輯是沒有風險的。
一位在 Reddit 上製作漫畫頁面的使用者報告,經過多次連續編輯後,畫面取景似乎逐漸被裁切,細線條也變得模糊。這是一個個別社群報告,而非經證實的普遍行為,但它支持了一項實用的工作流程規則:如果編輯鏈開始劣化,請返回最後核准的主版本,而非繼續編輯已劣化的版本。
| 工作流程方法 | 方法 | 風險等級 | 最適用於 |
| 一次性生成 | 單一長提示詞,試圖一次性完成所有設定 | 高(易受 AI 解讀偏移影響) | 快速腦力激盪、隨性構思 |
| 疊代式工作流程(推薦) | 生成基礎圖像 -> 編輯 1 個變數 -> 儲存主版本 -> 重複 | 低(受控進程) | 專業資產、嚴格品牌規範 |
如何撰寫更優質的 GPT Image 2.5 提示詞?
沒有特殊的 JSON 語法或秘密短語能解鎖 GPT Image 2.5。清晰的視覺指令比提示詞格式更為重要。
從交付成果、主體和構圖開始
第一句話應告知模型正在製作何種類型的資產。
例如:
為登陸頁面主視覺製作一張簡潔的編輯產品照片。
這比單純寫下:
極簡、高質感、電影風格。
更能為模型提供強大的上下文。
接著定義結構:
主體: 什麼是可見的 位置: 出現在何處 取景: 特寫、全身、廣角 留白空間: 重要內容不應出現的位置 背景: 環境與深度
對於人物,請加入直接影響姿勢和解剖結構的細節:
- 取景: 半身、全身、特寫
- 視線: 注視鏡頭、注視產品
- 手部: 握著手機、放在桌上
- 姿勢: 坐姿、行走、倚靠
這些指令比添加一連串形容詞更為實用。
描述可見細節,而非僅用風格詞彙
諸如高質感、電影風格或奢華等詞彙都帶有主觀性。請將它們轉化為模型可渲染的視覺屬性。
避免使用:
讓它看起來奢華。
嘗試使用:
深色胡桃木桌、拉絲金屬細節、攝影機左側的溫暖定向光、柔和的衰減、克制的陰影、低飽和度背景、寫實產品攝影。
實用類別包括:
光線: 柔和窗光、正午強光、輪廓光 材質: 霧面塑膠、拉絲鋁、亞麻、玻璃 紋理: 自然毛孔、細緻紙紋、磨損石材 色彩: 柔和大地色系、高對比黑白與奶油色 媒介: 照片、向量插畫、編輯拼貼、水彩
攝影機和鏡頭術語也能引導外觀,但最好將它們視為視覺提示,而非精確物理光學的保證。
如何正確處理文字和標籤
GPT Image 2.5 可以在海報、包裝、投影片和廣告中渲染實用文字,但重要的文案仍需要明確的指令和品質保證。
請提供最終文字,而非要求模型自行發明:
精準渲染文字 「Designed for Everyday Motion」 一次。
然後指定:
- 位置
- 層級
- 對齊方式
- 字體樣式
- 大小寫
- 是否允許其他文字
OpenAI 的提示詞指南建議提供確切文字,並檢查結果中的拼寫和可讀性。
如果小型標籤重複失敗,請勿立即將提示詞加倍。在保持提示詞不變的情況下,測試更高的品質設定。 這有助於判斷失敗是源於渲染品質不足還是指令不夠清晰。
對於長段落、法律文本、密集表格或必須像素級別匹配現有設計的排版,通常更安全的方法是生成視覺基礎,然後在傳統設計工具中完成排版。
| 模糊提示詞(避免) | 具體視覺指令(改用) | 類別 |
| 「讓它看起來奢華」 | 深色胡桃木桌、拉絲金屬細節、溫暖定向光 | 光線與材質 |
| 「人物的電影鏡頭」 | 半身取景、注視鏡頭、柔和大地色系 | 構圖與主體 |
| 「添加一些關於動態的文字」 | 精準渲染文字「Designed for Everyday Motion」一次,置中,無襯線字體 | 文字與標籤 |
如何在編輯圖像時不損失角色、產品或細節?
GPT Image 2.5 的編輯改進在您明確定義模型修改圖像的自由度時,最能發揮其效用。
運用變更、保留、整合和排除原則
一個更強大的編輯提示詞可以圍繞四個區塊來建構:
變更 (CHANGE) 什麼應該不同?
保留 (PRESERVE) 什麼必須保持可辨識和穩定?
整合 (INTEGRATE) 新元素應如何融入現有圖像?
排除 (EXCLUDE) 模型應避免添加或重新設計什麼?
例如:
變更: 將瓶身顏色替換為深森林綠。保留: 瓶身幾何形狀、瓶蓋、標籤尺寸、標誌位置、印刷文案、攝影機角度、產品比例、背景、裁切。整合: 自然更新反射和色彩反彈,以匹配新的瓶身顏色。排除: 請勿重新設計包裝或添加新品牌。
「保留」部分尤其重要。如果某個元素很重要但從未被提及,模型可能會將其視為可編輯的背景內容。
如何使用參考圖像來保持角色和產品的一致性
請勿上傳多個參考圖像,然後讓模型自行猜測每個圖像的意義。
分配角色:
圖像 1: 角色身份 圖像 2: 服裝 圖像 3: 構圖 圖像 4: 視覺風格
然後說明不應複製的內容。
例如:
圖像 2 僅用於夾克設計。請勿複製其人物、背景、姿勢或光線。
對於角色,單一肖像可能不足以提供大幅度姿勢變化的資訊。一位 Reddit 使用者報告,透過建立一份包含多個角度、表情、姿勢和細節視圖的16 格角色參考表,並在每個新場景中提供相同的參考表,能獲得更好的連續性。在該使用者的測試中,角色在六個場景中仍保持可辨識,無需重新生成。這屬於社群經驗,而非 OpenAI 的保證,但它是一種測試重複出現角色的實用方法。
中性背景對於此類參考表很有用,因為它能降低意外將每個未來場景錨定到參考圖像的光線或環境的風險。
對於產品,請保留:
輪廓、尺寸、包裝幾何形狀、標籤位置、標誌、印刷文案、材質和攝影機角度。
目標不僅僅是「一個相似的瓶子」。它是在不同情境下,仍可辨識的相同產品。
如何進行微小或像素敏感的編輯
戒指、按鈕、微小標誌、標籤、珠寶或單獨手指等小目標更難處理,因為它們在模型的輸入中佔據的視覺空間極小。
一位 OpenAI 開發者社群使用者描述了如何透過以下工作流程改進困難的「將戒指戴在這根手指上」任務:
裁切 → 放大 → 引導/遮罩 → 編輯 → 縮放 → 合成
裁切能為目標提供更多視覺空間。最終的合成步驟意味著只有核准的像素會被放回主圖像中,即使模型改變了臨時裁切的其他部分。作者表示這改善了他們自己的結果,但明確指出他們並未進行大規模基準測試。
還有另一個微妙的問題:您選取的點與完成編輯所需的空間不總是相同。
如果您點擊一隻眼睛並要求添加眼鏡,眼睛周圍的微小選取範圍不足以容納兩個鏡片和一個鼻樑。允許的編輯區域必須包含您想要添加的完整物件。
對於真正像素敏感的工作,這種應用層級的裁切與合成方法,比單純依賴提示詞或遮罩來保證像素不變更更為可靠。
| 元素 | 目的 | 範例指令 |
| 變更 | 定義要修改的確切目標 | 「將瓶身顏色替換為深森林綠。」 |
| 保留 | 鎖定不應變動的元素 | 「保留瓶身幾何形狀、標誌位置和背景。」 |
| 整合 | 使新編輯與場景協調一致 | 「自然更新反射和色彩反彈。」 |
| 排除 | 明確的負面限制 | 「請勿重新設計包裝或添加新品牌。」 |
Flare 與 Sunburst 及品質設定:您該如何選擇?
GPT Image 2.5 擁有兩種 API 模型:
GPT-Image-2.5 Flare 和 GPT-Image-2.5 Sunburst。
它們使用相同的通用提示詞技術,但針對不同的生產優先級。
Flare 與 Sunburst:實際差異為何?
OpenAI 將 Flare 描述為其最快的模型,適用於高品質的日常圖像生成,並推薦其作為許多應用程式的預設選擇。而 Sunburst 則是在編輯精準度最為重要時,功能更強大的模型。
一個實用的起點是:
| 需求 | 從何開始 |
| 快速疊代 | Flare |
| 大量生成 | Flare |
| 嚴格編輯精準度 | Sunburst |
| 精細產品創意 | Sunburst |
| 不確定 | 在相同任務上測試兩者 |
請勿假設 Sunburst 會自動在每個提示詞中勝出。OpenAI 建議使用相同的提示詞、參考資料、尺寸和明確的品質設定來比較模型,如果較快的選項仍符合您的驗收標準,則選擇它。
最近的一項 Reddit 比較也發現了值得測試的現象:在一個產品提示詞上,當品質改變時,Flare 大幅重新構圖了場景,而 Sunburst 則保持了核准的產品角度和構圖更為穩定。這是一位使用者的測試,而非普遍基準,但它突顯了一項重要的品質保證規則:不要僅憑模型的首次生成來判斷;應測試它是否能在後續編輯和設定變更中保留核准的構圖。
低、中、高、特高與最高品質設定
兩種 2.5 API 模型目前都支援:
自動 (auto)、低 (low)、中 (medium)、高 (high)、特高 (xhigh) 和 最高 (max)。
OpenAI 明確警告,更高的品質設定不保證每個提示詞都能產生更好的結果。當目前的輸出未能滿足要求時,才提高品質;一旦通過,則測試較低的設定是否能以更低的延遲達到可接受的品質。
一個實用的工作流程是:
草稿 → 審閱 → 定稿
在您仍在調整構圖時,請使用中等設定。只有在結構確定後,才提高品質。
此外,請避免假設僅更改 quality 會像傳統的放大一樣。生成模型可以重新詮釋構圖,而不僅僅是添加細節。
Tosea 的 41 次呼叫基準測試發現了另一個遷移問題:對於其 2048×1152 投影片工作負載,GPT Image 2.5 的 high 使用的輸出代幣預算與 GPT Image 2 的 medium 相同,而 2.5 的 max 則與 GPT Image 2 的 high 相匹配。這是一個第三方針對特定工作負載的測量結果——而非官方的普遍對應關係——但它顯示了為什麼僅替換模型 ID 而保持相同的品質標籤,可能會改變成本和輸出複雜度。
您應該使用什麼尺寸、長寬比和解析度?
OpenAI 目前列出了常見尺寸,包括:
1024×1024 — 正方形 1536×1024 — 橫向 1024×1536 — 直向 2048×2048 — 2K 正方形 2048×1152 — 2K 橫向 3840×2160 — 4K 橫向 2160×3840 — 4K 直向
自訂尺寸的每個維度必須保持在 3,840 像素或以下,使用 16 的倍數,維持在 3:1 的長寬比內,並在文件記載的總像素範圍內。目前,超過 2560×1440 / 3,686,400 像素的輸出被標記為實驗性。
更高的解析度雖然有用,但它並不能自動解決所有「AI 感」的偽影。一位專業建築使用者報告,幾何形狀和攝影機視角得到了很好的保留,但仍出現重複的岩石、植物和表面圖案。該使用者認為問題在於缺乏自然的微小變化,而非原始解析度。同樣,這是一個專業社群報告,而非官方模型限制。
| 解析度 | 格式 / 長寬比 | 目標使用案例 | 狀態 |
| 1024×1024 | 1:1 正方形 | 社群媒體、標準生成 | 標準 |
| 1536×1024 | 3:2 橫向 | 網站主視覺、文章 | 標準 |
| 1024×1536 | 2:3 直向 | 行動裝置螢幕、海報 | 標準 |
| 2048×2048 | 1:1 2K 正方形 | 高解析度紋理、印刷 | 標準 |
| 2048×1152 | 16:9 2K 橫向 | 投影片、標準影片資產 | 標準 |
| 3840×2160 | 16:9 4K 橫向 | 4K 顯示器、電影資產 | 實驗性 |
| 2160×3840 | 9:16 4K 直向 | 垂直影片、數位看板 | 實驗性 |
如何將 GPT Image 2.5 用於進階工作流程和 API?
GPT Image 2.5 的用途不僅限於基本的文字轉圖像生成。最強大的工作流程是結合多種控制形式,而非僅依賴單一長提示詞。
草圖、範本、透明度、UI 和圖表
當幾何形狀比文字描述更容易繪製時,草圖 (Sketch) 就很有用。粗略的繪圖可以建立空間意圖——例如房間佈局、服裝輪廓或視覺排列——而提示詞則定義材質、光線和完成度。OpenAI 隨 Images 2.5 一同推出了 Sketch;目前的說明中心筆記顯示它透過行動版 ChatGPT 介面提供,而範本則為海報和商品等格式提供了起點。
對於透明資產,請區分:
「在透明背景上繪製此圖。」
與實際透過 API 請求:
**background="transparent"**
Flare 和 Sunburst 支援透明輸出,OpenAI 建議使用 PNG 或 WebP 格式。務必檢查頭髮、玻璃、陰影和柔和邊緣周圍的實際 Alpha 通道。圖像中繪製的棋盤格圖案並非透明度。
對於 UI、投影片、圖表和資訊圖表,請將提示詞視為成品規格,而非藝術提示詞。
定義:
- 畫布結構
- 資訊層級
- 確切標籤
- 內容區域
- 間距
- 真實數據
- 關係
然後驗證結果。圖像模型應渲染資訊——而非成為事實或計算的權威來源。
圖像 API 與回應 API
目前的 OpenAI 文件支援透過以下兩種方式使用 GPT Image 2.5:
圖像 API (Image API)
以及
回應 API 圖像生成工具 (Responses API image generation tools)。
當您的工作流程主要為:
生成圖像 → 編輯圖像
時,請使用圖像 API。
當圖像生成是更廣泛的對話式或多步驟工作流程的一部分時,請使用回應 API。Flare 和 Sunburst 都可以被選為圖像生成工具模型。
這一點很重要,因為一些發布週的第三方指南曾指出 GPT Image 2.5 無法透過回應 API 使用。該資訊現已過時。
核心 API 控制項包括:
模型 (model) gpt-image-2.5-flare 或 gpt-image-2.5-sunburst
品質 (quality) auto、low、medium、high、xhigh、max
尺寸 (size) auto 或支援的自訂解析度
背景 (background) auto、opaque、transparent
請將這些技術參數與創意提示詞分開。這有助於實驗更容易重現和偵錯。
成本、速度與生產效率
Flare 和 Sunburst 目前使用相同的列出代幣費率:
- 文字輸入: $5 / 1M 代幣
- 快取文字輸入: $1.25 / 1M
- 圖像輸入: $8 / 1M
- 快取圖像輸入: $2 / 1M
- 圖像輸出: $30 / 1M
因此,這兩種模型之間的差異並非簡單的「便宜模型與昂貴模型」之分。
Tosea 的投影片基準測試發現,在相同的輸出代幣預算下,Flare 比 Sunburst 和 GPT Image 2 都更快。對於一個 1,413 輸出代幣的配置,它測得 Flare 平均為 19.7 秒,Sunburst 為 27.7 秒,GPT Image 2 為 37.3 秒,在其工作負載中每張投影片的成本大致相同。這些是 Tosea 的測量結果,而非 OpenAI 的普遍性能保證。
對於生產而言,更有用的指標通常是:
每張核准圖像的成本
而非:
每次請求的成本。
一個需要四次重試才能完成的較便宜生成,其成本可能高於第一次嘗試就通過品質保證的較慢結果。
GPT Image 2.5 仍有哪些不足,以及如何解決?
GPT Image 2.5 提升了編輯一致性,但並未消除生成式圖像編輯的核心不確定性。
編輯偏移、裁切與細節損失
根據 OpenAI 的說法,多輪編輯比以往更穩定,但圖像仍可能在請求目標之外發生變化。
Tosea 的三步驟投影片編輯基準測試發現,所有受測模型都完成了請求的編輯,但累積的非目標像素變化在連續回合中仍有所增加。GPT Image 2.5 在該測試中顯示出比 GPT Image 2 更少的測量偏移,但它並未完全消除偏移。
社群使用者也額外報告了:
- 重複編輯中輕微的畫面取景變化
- 累積性裁切
- 線條柔化
- 精細細節的損失
這些觀察結果屬於軼事,而非受控的模型基準測試。
最安全的應對方式是程序性的:
一次只進行一項主要編輯。 重複關鍵的「保留」限制。 儲存核准的主版本。 如果編輯鏈開始劣化,請從乾淨的主版本分支。
請勿僅因為它是最新版本,就持續編輯已劣化的資產。
為什麼您的角色、產品或構圖仍會改變
當保留失敗時,請先檢查工作流程,而非僅僅加長提示詞。
常見原因包括:
參考角色不明確 模型不知道參考圖像是用於身份、服裝、構圖還是風格。
保留清單不完整 一個看似次要的背景物件從未受到保護。
大規模同時變更 在一次操作中改變姿勢、環境、攝影機位置、服裝和風格,會給予模型更大的自由度。
品質或模型變更 從一個品質等級或模型轉換到另一個,可能會導致全新的詮釋,而非更高解析度的複製。
冗長編輯鏈 每個新生成都繼承了前一個生成,而非原始像素。
如果舊的 GPT Image 工作流程在遷移到 2.5 後行為不同,請將此次遷移視為新的基準測試。簡化提示詞,固定模型和品質,重複使用相同的參考資料,並一次只改變一個變數。請勿假設添加更多「請勿變更」的語句會自動修復工作流程。
重複紋理與其他 AI 感偽影
一個實用的區分是:
結構保真度 ≠ 表面真實感。
圖像可以保留:
- 攝影機角度
- 房間尺寸
- 產品幾何形狀
- 主體位置
- 版面配置
同時仍顯示以下方面的重複人工痕跡:
- 植物
- 岩石
- 皮膚紋理
- 風化效果
- 織物
- 背景細節
OpenAI 開發者社群上的一位專業建築使用者報告了完全相同的模式:幾何形狀和構圖得到了很好的保留,但在自然紋理中卻出現了重複的「仿製圖章式」細節。
單純提高解析度可能無法解決這個問題,因為問題不總是像素不足。它可能是自然變化的不足。
對於高價值生產工作,請將流程拆分:
階段 1:鎖定結構和構圖。 階段 2:改善表面真實感和微細節。 階段 3:手動對關鍵區域進行品質保證。
如果一張完成圖像的 95% 已經正確,請避免重新生成整個畫布來修復最後的 5%。有針對性的修補或傳統合成工作流程通常更安全。
結論
GPT Image 2.5 最適合作為受控的創意工作流程,而非一次性提示生成器。 請清晰定義資產,為參考資料賦予特定角色,區分應變更與必須保持不變的內容,一次只編輯一個主要元素,並在冗長編輯鏈之前保留核准的主圖像。Flare、Sunburst、品質等級和更高解析度都應根據實際專案要求進行測試——而非將其視為自動「更好」的設定。當任務越接近像素級別的完美生產時,將 GPT Image 2.5 與傳統合成、排版和品質保證結合使用,將比要求模型一次性解決所有問題更為實用。








