AI 換臉、換裝、風格轉換常被含糊地歸類成同一種「AI 修圖」,但實際上,這三者是建立在完全不同模型架構上的技術路徑,各自有不同的強項,也各自有不同的失敗模式——換臉靠的是身分特徵重建,換裝靠的是區域重繪,風格轉換靠的是統計特徵套用,彼此並不是同一套技術換個名字。我們的模板橫跨這三個類別,所以值得老實拆解每一種技術底層到底在做什麼——不是行銷文案,而是誠實比較每種技術擅長什麼、又會在哪裡露餡,這樣你才知道自己實際上在用哪種技術、能期待什麼結果。
生成一個虛構角色傳統換臉技術——也就是「deepfake」這個詞最初誕生時所指的技術——建立在共享編碼器(shared encoder)的自編碼器(autoencoder)架構上:單一編碼器把來源臉與目標臉都壓縮進同一組潛在表示,再由兩個各自獨立的解碼器分別重建——一個訓練來重建來源身分,一個重建目標身分。切換解碼器,就能讓來源身分的特徵在目標的姿態與表情裡被重建出來,最後再透過融合處理(常見手法是 Poisson 影像編輯)把結果無縫嵌回原畫面。許多實作還會疊加一層 GAN 精修,純粹是為了讓畫面看起來更逼真。這項技術很擅長在大量影片幀之間維持一致的身分特徵,但遇到極端角度、遮擋,或來源與目標光線不一致時就會露餡——融合邊界的痕跡與光線不一致,是最常見的破綻。
換裝工具走的是完全不同的流程:圖片修復繪製(inpainting)。分割模型先標出要修改的區域,再由擴散模型只針對被遮罩的像素透過反覆去噪重新生成,依據周圍圖像與文字或參考提示詞來決定內容——沒有什麼「藏在底下」被揭露出來,單純是一次新的、統計上合理的像素猜測。較舊的做法會用 GAN,先把服裝變形貼合到身形上,再生成合成結果;這種方法能保留精確的服裝紋理,但遇到不常見的姿勢或背景時,泛化能力就很差。新一代工具較常用的擴散式修復繪製,訓練過程更穩定,能適應更廣的姿勢範圍,代價是重繪區域的顏色與紋理精確度會打些折扣。(我們在別處寫過這套流程更深入的技術拆解——這裡刻意簡短,因為換裝只是本文比較的三種技術之一。)
風格轉換這個名詞底下其實藏著兩套完全不同的做法。傳統的神經風格轉換(neural style transfer)透過優化 CNN 的特徵圖統計量(Gram matrix),把一張特定的參考風格圖套用到內容圖上——它需要一張具體的範例圖,而且本質上是一次學一種風格。基於擴散模型的 img2img 生成則走另一條路:用文字提示詞直接描述目標風格,去噪強度(denoising strength)設定決定原始構圖能留下多少,而且因為風格詞彙早就內建在基礎模型的訓練資料裡,套用新風格不需要額外訓練。這種靈活性同時也是代價——由提示詞驅動的風格比較鬆散,不像對著單一參考圖優化那樣能精確重現。
每種技術都有自己特有的破綻:換臉容易在融合邊界露餡,遇到光線不一致或極端頭部角度也會失準,影片還可能出現逐幀閃爍;換裝式修復繪製容易在遮罩邊緣、手部,以及被大量遮擋的布料處出錯;風格轉換強度調得太高,可能連原始構圖都保不住,導致內容失真。鑑識偵測工具通常就是針對這些技術特有的指紋去找——例如針對換臉找融合邊界痕跡與時序不一致,而不是套用單一萬用的「AI 偵測器」。另一種思路不是偵測、而是溯源:像 C2PA(內容來源與真實性聯盟,Coalition for Content Provenance and Authenticity,其指導委員會成員包括 Adobe、Google、Microsoft、OpenAI 等)這樣的標準,會在檔案上附加一份簽章過的「內容憑證」紀錄,說明來源與編輯歷程——運作方式比較像清單,而不是鑑識掃描,但前提是有工具真的去寫入這份紀錄,而且這份紀錄要一路留存到有人去查驗——目前這件事並不穩定。
以上三種技術本質上都不是專門用來改動真人照片的工具——它們是可以指向不同輸入的通用生成方法。Uncutly 的模板運用了這些技術的部分能力,來打造全新、虛構的 AI 原創角色;平台的內容政策獨立禁止在未經同意的情況下,以任何真實、可辨識人物的實際樣貌作為生成依據——不論這些底層技術原理上能做到什麼。這是建立在通用技術之上的政策與架構選擇,而不是技術本身的限制。
換臉用的是共享編碼器的自編碼器(通常再疊加一層 GAN 精修),在目標的姿態與表情裡重建出另一個身分的特徵。換裝用的是圖片修復繪製——由擴散模型針對被遮罩的區域重新生成,並依據周圍圖像調整。這是兩套解決不同問題的模型家族,不是同一種技術套用在不同內容上。
不一定,這是取捨,不是單純的技術升級。擴散模型通常訓練更穩定,對沒見過的姿勢或場景泛化能力更好;而 GAN 式做法在它擅長的區域裡,往往能更精確地保留紋理與細節。實際用哪一種,取決於這套流程要優化的目標是什麼。
沒有放諸四海皆準的辦法。鑑識偵測會找技術特有的指紋——融合邊界痕跡、影片的逐幀不一致、遮罩邊緣的錯誤——而準確度會因為具體模型、以及檔案後續被重新壓縮或轉傳而有很大落差。這是雙方都還在動態較量的領域,不是已經解決的問題。
C2PA 是一套內容溯源標準——在檔案上附加一份簽章過的紀錄,說明其來源與編輯歷程,背後由包含多家主要科技與 AI 公司在內的指導委員會支持。它本身不會偵測或阻擋任何東西;它只有在工具真的寫入這份紀錄、而且這份紀錄能留存到有人查驗時才有幫助——而這件事目前並不一致。
不會。Uncutly 的模板運用了部分這類技術來生成全新、虛構的 AI 原創角色,平台政策獨立禁止在未經同意的情況下,以任何真實、可辨識人物的實際樣貌作為生成依據——不論底層模型技術上能做到什麼,這條規則都會被強制執行。