UncutlyHer

مبادلة الوجه وتبديل الملابس ونقل الأسلوب بالذكاء الاصطناعي: كيف تعمل كل تقنية فعليًا

غالبًا ما يتم تجميع مبادلة الوجه وتبديل الملابس ونقل الأسلوب تحت مسمى غامض واحد هو "تحرير بالذكاء الاصطناعي"، لكنها في الواقع ثلاثة خطوط إنتاج تقنية مختلفة، مبنية على معماريات نماذج مختلفة، بنقاط قوة وأنماط إخفاق مختلفة. قوالبنا تلامس الفئات الثلاث جميعها، لذا يستحق الأمر تفصيلًا صادقًا لما تفعله كل تقنية فعليًا تحت الغطاء — ليس كنص تسويقي، بل كمقارنة تقنية صادقة لما تُجيده كل تقنية، وأين لا تزال تفشل.

توليد شخصية خيالية

مبادلة الوجه: مُرمِّزات تلقائية بمُرمِّز مشترك، وليست مجرد لصق صور بسيط

تعمل تقنية مبادلة الوجه الكلاسيكية — التقنية التي صِيغَت من أجلها كلمة "deepfake" في الأصل — على معمارية مُرمِّز تلقائي (autoencoder) بمُرمِّز مشترك: مُرمِّز واحد يضغط كلًا من وجه المصدر ووجه الهدف في تمثيل كامن مشترك، ثم يُعيد فك تشفير كل وجه فكّان منفصلان، أحدهما مدرَّب على هوية المصدر والآخر على هوية الهدف. تبديل فك التشفير المستخدم يسمح بإعادة بناء ملامح هوية المصدر داخل وضعية وتعبير الهدف، ويُدمَج الناتج في الإطار المحيط (غالبًا عبر تحرير صور بواسون) بحيث لا يظهر خط الوصل. تضيف كثير من التطبيقات طبقة تحسين بواسطة GAN فقط لزيادة الواقعية الفوتوغرافية. هذه تقنية قوية في الحفاظ على هوية متسقة عبر إطارات فيديو كثيرة، وضعيفة أمام الزوايا الحادة أو الحجب أو الإضاءة غير المتطابقة بين المصدر والهدف — وتُعد آثار حدود الدمج وعدم تطابق الإضاءة أكثر العلامات المرئية شيوعًا.

تبديل الملابس: inpainting، وليس أشعة سينية مخفية

تعمل أدوات تغيير الزي على خط إنتاج مختلف تمامًا: inpainting الصور. تقوم خطوة تجزئة (segmentation) بتحديد قناع للمنطقة المراد تغييرها، ثم يعيد نموذج الانتشار (diffusion) توليد البكسلات المُقنَّعة فقط عبر عملية إزالة ضوضاء تكرارية، مشروطة بالصورة المحيطة وبرومبت نصي أو مرجعي — لا يُكشف شيء مخفي، بل يُولَّد تخمين بكسلات جديد معقول إحصائيًا. الأساليب الأقدم استخدمت شبكات GAN تُشوِّه الملابس أولًا لتلائم شكل الجسم ثم تُولِّد المُركَّب؛ وهذه تحافظ جيدًا على نسيج الملابس الدقيق لكنها تُعمِّم بشكل سيئ على الوضعيات أو الخلفيات غير المألوفة. أما inpainting القائم على الانتشار، وهو النهج الأكثر شيوعًا في الأدوات الأحدث، فيتدرَّب بثبات أكبر ويُعمِّم على نطاق أوسع من الوضعيات، على حساب بعض الدقة في اللون والنسيج في المنطقة المُولَّدة. (كتبنا تحليلًا تقنيًا أعمق لخط الإنتاج هذا تحديدًا في مكان آخر — نُبقيه موجزًا هنا لأنه واحد فقط من ثلاث تقنيات تتم مقارنتها.)

نقل الأسلوب: عصران مختلفان لنفس الفكرة

يجمع نقل الأسلوب تحت اسم واحد نهجين مختلفين حقًا. نقل الأسلوب العصبي الكلاسيكي يُحسِّن إحصائيات خرائط السمات في شبكة CNN (مصفوفات Gram) لتطبيق صورة أسلوب مرجعية محددة على صورة محتوى — يحتاج إلى صورة مثال حرفية، ويتعلم فعليًا أسلوبًا واحدًا في كل مرة. أما توليد img2img القائم على الانتشار فيعمل بشكل مختلف: يصف برومبت نصي الأسلوب المستهدف مباشرة، ويتحكم إعداد قوة إزالة الضوضاء في مقدار ما يبقى من التكوين الأصلي، ولأن مفردات الأسلوب مُضمَّنة بالفعل في تدريب النموذج الأساسي، لا حاجة لخطوة تدريب منفصلة لأسلوب جديد. هذه المرونة هي أيضًا المقايضة — فالأسلوب المُوجَّه بالبرومبت أكثر مرونة وأقل قابلية للاستنساخ الدقيق من التحسين مقابل صورة مرجعية واحدة محددة.

أين تفشل كل تقنية، وكيف يعمل الكشف فعليًا

تفشل كل تقنية بطرق مميزة وخاصة بها: تعاني مبادلة الوجه عند حدود الدمج وتحت الإضاءة غير المتطابقة أو زوايا الرأس الحادة، ويمكن أن يُظهر الفيديو تحديدًا وميضًا من إطار لآخر؛ ويعاني inpainting تبديل الملابس عند حواف القناع واليدين والأقمشة شديدة الحجب؛ ويمكن لنقل الأسلوب عند شدة عالية أن يفقد ما يكفي من التكوين الأصلي بحيث تتأثر دقة المحتوى. أدوات الكشف الجنائي (forensic) تبحث عمومًا عن هذه البصمات الخاصة بكل تقنية تحديدًا — آثار حدود الدمج وعدم الاتساق الزمني لمبادلة الوجه مثلًا — بدلًا من تشغيل "كاشف ذكاء اصطناعي" شامل واحد. هناك نهج منفصل غير جنائي وهو تتبُّع المصدر (provenance) بدلًا من الكشف: معايير مثل C2PA (تحالف مصدر المحتوى وأصالته، المدعوم بلجنة توجيهية تضم من بين أعضائها Adobe وGoogle وMicrosoft وOpenAI) تُرفق بالملف سجلًا موقَّعًا لـ"بيانات اعتماد المحتوى" يصف مصدره وتاريخ تحريره — يعمل هذا أشبه ببيان (manifest) وليس فحصًا جنائيًا، لكنه يساعد فقط حيث تكتب أداة ما هذا السجل فعليًا وحيث يبقى السجل حتى نقطة يتحقق فيها أحد ما منه، وهذا اليوم غير متسق.

أين تضع منصة مثل Uncutly الخط الفاصل، بغض النظر عن التقنية

لا تُعد أي من التقنيات الثلاث أعلاه أداة مخصصة بطبيعتها لتغيير صورة شخص حقيقي — إنها أساليب توليد عامة الغرض يمكن توجيهها نحو مدخلات مختلفة. تستخدم قوالب Uncutly أجزاءً من هذه التقنية لبناء شخصيات ذكاء اصطناعي خيالية جديدة أصيلة؛ وتحظر سياسة المحتوى الخاصة بالمنصة بشكل مستقل توليد أي شيء يستند إلى مظهر شخص حقيقي قابل للتعريف دون موافقته، بغض النظر عما تستطيع هذه التقنيات الأساسية فعله من حيث المبدأ. هذا خيار سياسي ومعماري مبني فوق تقنية عامة الغرض، وليس قيدًا تقنيًا في التقنية نفسها.

FAQ

ما الفرق التقني الفعلي بين مبادلة الوجه وتبديل الملابس؟

تستخدم مبادلة الوجه مُرمِّزًا تلقائيًا بمُرمِّز مشترك (غالبًا مع طبقة تحسين GAN) لإعادة بناء ملامح هوية داخل وضعية وتعبير هوية أخرى. يستخدم تبديل الملابس inpainting الصور — منطقة مُقنَّعة يُعيد توليدها نموذج انتشار، مشروطة بالصورة المحيطة. هذه عائلات نماذج مختلفة تحل مشكلات مختلفة، وليست نفس التقنية مُطبَّقة على محتوى مختلف.

هل الانتشار (diffusion) أفضل دائمًا من الأساليب القائمة على GAN؟

لا — إنها مقايضة، وليست ترقية مطلقة. عادةً ما تتدرب نماذج الانتشار بثبات أكبر وتُعمِّم بشكل أفضل على وضعيات أو مشاهد لم تُرَ من قبل، بينما يمكن للأساليب القائمة على GAN الحفاظ على النسيج الدقيق والتفاصيل الدقيقة بأمانة أكبر في المنطقة التي تُجيدها. أيّهما يُستخدم يعتمد على ما يُحسِّنه خط الإنتاج المحدد.

هل يمكن كشف محتوى مبادلة الوجه أو تبديل الملابس بشكل موثوق؟

ليس بشكل عام. يبحث الكشف الجنائي عن بصمات خاصة بكل تقنية — آثار حدود الدمج، عدم الاتساق بين الإطارات في الفيديو، أخطاء حواف القناع — وتتفاوت الدقة كثيرًا حسب النموذج المحدد وكيفية إعادة ضغط الملف أو إعادة رفعه لاحقًا. إنه هدف متحرك بنشاط من كلا الجانبين، وليس مشكلة محلولة.

ما هو C2PA، وهل يوقف الـ deepfakes؟

C2PA هو معيار لتتبُّع مصدر المحتوى — سجل موقَّع مُرفق بملف يصف مصدره وتاريخ تحريره، تدعمه لجنة توجيهية تضم شركات تقنية وذكاء اصطناعي كبرى. لا يكشف أو يحجب أي شيء بحد ذاته؛ بل يساعد فقط في التحقق من المصدر حيث تكتب أداة ما هذا السجل فعليًا وحيث يبقى حتى يتحقق منه أحد، وهذا اليوم غير متسق.

هل تستخدم Uncutly تقنية مبادلة الوجه على صور أشخاص حقيقيين؟

لا. تستخدم قوالب Uncutly أجزاءً من هذه التقنية لتوليد شخصيات ذكاء اصطناعي خيالية جديدة أصيلة، وتحظر سياسة المنصة بشكل مستقل توليد محتوى يستند إلى مظهر شخص حقيقي قابل للتعريف دون موافقته — وهي قاعدة تُطبَّق بغض النظر عمّا يستطيع النموذج الأساسي فعله تقنيًا.

قوالب NSFW رائجة

تصفّح كل القوالب →