兩者都源自同一個擴散模型家族,但解決的是不同的問題——選錯方法,是生成結果跟你原本想像的不一樣,最常見的原因。文生圖完全依據你的文字描述來建構畫面;圖生圖則是從既有的參考圖出發,再進行改動。對 NSFW 生成來說,人體結構準確度與姿勢控制比多數其他類別都更重要,選擇哪一種方法,對結果的影響常常比提示詞怎麼寫更大。
兩種工作流程都試試你用文字描述主體、姿勢、場景與燈光,模型從雜訊開始建構圖像,唯一的依據就是你的文字描述。沒有起始圖片、想要自由探索——不同角色、不同場景、不同風格——這時候文生圖是對的工具;但這也代表模型必須為你沒有明確指定的任何細節做出猜測,這正是結果容易偏離預期的地方。
你提供一張參考圖,模型依據的是實際的像素資料,而不是這張圖的文字描述——在改變風格、服裝或周圍場景的同時,保留姿勢、構圖,或某個特定角色的樣貌。當你需要特定姿勢,或想在一系列生成中維持同一個虛構角色的一致性時,這一點格外重要,因為模型是依據真實圖像資料進行條件生成,而不是每次都要從你的描述重新推敲。
人體結構準確度,正是純文字描述最容易猜錯、而且錯得明顯的地方——在文生圖裡,模型只能單靠文字推敲姿勢與比例;圖生圖則是從參考圖直接鎖定這個結構,而不是憑空猜測。對於精準姿勢或角色一致性很重要的結果,圖生圖通常能用更少的嘗試次數達成。
在 Uncutly 上,Seedream 與 Qwen Image 是從零打造場景的強力文生圖預設選擇,而 FLUX.1 Kontext 則是專為圖生圖編輯打造——只改變既有圖片中的一個特定元素,其餘(包含角色的臉部)維持一致。許多模板同時支援兩種工作流程,你可以先從模板經過測試的提示詞開始(文生圖),之後再切換到參考圖來鎖定某個角色(圖生圖)。
可以,而且是很常見的工作流程:先用文生圖生成初版結果,再把這個結果當作參考圖,透過圖生圖進一步鎖定姿勢或修飾細節。
不需要——參考圖是用來引導姿勢、構圖或風格,生成一個全新的虛構 AI 角色,而不是用來重現某個真實、可辨識人物的肖像。
單純探索創意時,文生圖通常比較快,因為不需要準備參考圖。如果你已經清楚知道想要的確切姿勢或樣貌,圖生圖往往能用更少的總嘗試次數達成。
邏輯是一樣的:文生影片完全依據文字描述建構動態,圖生影片則是為上傳的照片加上動態,主體與場景都會錨定在這張起始圖片上。