GPT Image 2(ChatGPT 影象)提示詞指南:對話式修圖怎麼用
熬夜改一個功能改到第三版,最煩的不是改,是每次都要把前兩版的上下文重新講一遍。ChatGPT 裡的影象生成和編輯——社群一般直接叫它 GPT Image 2——最省心的地方就在這,它記得上一輪你改了什麼,第二輪直接說"再往左挪一點"就行,不用把整段描述重寫一遍。這篇不吹它比誰強,就講實操:gpt image 2 提示詞該怎麼組織,效率最高。
對話式連續修圖,多輪怎麼改
第一輪給完整描述,把主體、場景、風格一次說清楚;第二輪開始,只說"變化量",不用重複沒變的部分。比如第一輪出了一張照片,第二輪想調整表情,直接說"表情換成微笑,其他不變",它能接住這個上下文,不需要你把人物穿著、背景全部重新打一遍。這個邏輯跟改程式碼一樣——已經跑通的部分別動,只 diff 變化的那一行。
常見的翻車點是心急,一次性甩出五六條修改要求,指望它一輪全改完。實測下來,改動項超過三條,命中率明顯往下掉,不如拆成兩三輪,每輪改一兩處,改完看一眼再繼續,跟提交小步 commit 是一個道理,出問題也好回溯是哪一步錯的。
還有個容易踩的坑是中途換話題——上一輪在改人像的表情,這一輪突然要求換成完全不相關的產品圖,模型會把之前的上下文當成還在生效的約束,結果兩邊都不乾淨。需要跳轉到新主題時,乾脆開一輪新對話,比硬接在同一串上下文裡省事,也省得回頭排查是哪句話把風格帶歪的。

這張人臉參考復刻案例就是靠多輪對話逐步逼近的,先定構圖,再逐輪校準五官細節,一次到位的機率其實不高,分步來才穩,這類需求在修圖改圖分類裡能找到更多同邏輯的案例。
自然語言描述 vs 引數堆砌,這模型吃哪一套
寫慣了引數化提示詞的人,上來容易犯一個錯——把 GPT Image 2 當成需要堆關鍵詞的模型,一串"4K, 電影感, 超寫實, 高對比"甩過去。它其實更吃人話,直接描述場景發生了什麼、人物在做什麼動作,比堆形容詞管用。舉個例子,與其寫"高階感通勤寫真,都市感,冷淡風",不如寫"電梯門剛開啟,她穿著通勤裝回頭看了一眼,背景是寫字樓大堂",後者資訊密度高,模型不用猜你到底想要哪種"高階感"。

這張電梯寫真的提示詞就是按"發生了什麼"來寫的,沒有堆砌形容詞,構圖和神態反而更準,這條思路跟站內提示詞萬能結構公式裡說的"主體先具體"是一回事。
區域性替換與風格化,直接說要改哪塊
改圖這件事,GPT Image 2 的對話屬性用在區域性修改上最划算。不用重新生成整張圖,直接說"背景元素去掉,其他保留"或者"把這塊換成拼貼風格",它能理解"其他不變"這個隱含要求,不會順帶把沒提到的部分也改了。風格化轉換同理,直接說想要的效果和保留的邊界,比寫一長串風格關鍵詞更精準。

這張撕紙拼貼案例展示的就是區域性風格化的效果,邊緣毛邊和底層畫面的過渡是提示詞裡明確要求保留的,具體的換背景寫法可以參考ChatGPT修圖指令大全這篇,裡面有更完整的指令清單。
動作類的替換也是同樣思路——保留物理邏輯,只換主體。

這張動作替換案例把人物換了但攀爬姿態的物理合理性保留住了,這類創意腦洞類需求,提示詞裡主動寫"保持動作的物理連貫性"這句,比不寫效果穩定得多。
和繪圖類模型的定位差異
GPT Image 2 更像一個"能聊的修圖助手",起點是已有影象或明確的場景描述,靠對話逐步逼近想要的效果;Nano Banana Pro 這類模型更偏向一次性把結構化長提示詞跑到位,尤其是畫面裡要出現大段文字、或者需要多圖參考保一致性的場景,結構化寫法效率更高。簡單說,邊聊邊改選前者,一次性長提示詞追求精細排版選後者,兩條路線互相不替代,具體差異可以看GPT Image 2 對比 Nano Banana Pro這篇實測對比,跟速度更快的Nano Banana對比可以看這篇。

這張字型排版實驗是 GPT Image 2 處理設計類需求的一個例子,字型和人物的空間穿插關係是靠對話逐步調整位置定下來的,不是一次成型,這類設計素材需求同樣能靠多輪修改逼近滿意的排版。
chatgpt 修圖怎麼用,幾條實操建議
中文提示詞直接能用,不用先翻譯成英文再輸入,這點省了不少事;改圖前先想清楚這輪到底改哪一處,別把新需求和舊需求混在一句話裡;效果不滿意的時候,回頭看是描述模糊了,還是這類需求本身就該換個模型試試——不是所有需求都適合硬跟一個模型死磕。參考圖能上傳就儘量上傳,比純文字描述"跟這張類似"要準得多,模型能直接讀取構圖和配色,不用靠文字二次轉譯。提示詞裡該避免的雷區,負面提示詞指南這篇裡也有講到,同樣適用。
想直接上手試試這套對話式流程,首頁image.faxianai.com可以照著案例改欄位用,模型定位差異更全面的說明在模型百科,全部對比資料在對比專題。
