UncutlyHer

ทำไม AI สร้างภาพถึงปฏิเสธพรอมต์ NSFW?

ถ้าคุณเคยพิมพ์พรอมต์สำหรับผู้ใหญ่ลงใน Midjourney หรือ DALL-E แล้วได้คำเตือนนโยบายคลุมเครือแทนที่จะเป็นภาพ การบล็อกนั้นไม่ใช่บั๊กหรืออุบัติเหตุ — มันคือฟิลเตอร์หลายชั้นที่ทำงานตามที่ออกแบบไว้จริง ๆ การเข้าใจว่าชั้นเหล่านั้นทำงานยังไงก็อธิบายด้วยว่าทำไม "AI ไม่เซ็นเซอร์" ไม่ใช่กลเม็ดหลบเลี่ยงมัน แต่เป็นสายพันธุ์เทคนิคที่ต่างไปตั้งแต่ต้น สร้างและโฮสต์ขึ้นมาเพื่อจุดประสงค์นี้โดยเฉพาะ

ลองสร้างแบบไม่เซ็นเซอร์

ชั้นที่หนึ่ง: พรอมต์ไม่มีโอกาสแม้แต่จะเริ่ม

เครื่องสร้างภาพกระแสหลักส่วนใหญ่จะรันข้อความพรอมต์ของคุณผ่านตัวจำแนกก่อนที่การสร้างภาพจะเริ่มเลยด้วยซ้ำ มันสแกนหาคำและชุดคำที่ถูกตั้งค่าไว้ ถ้าโดนฟิลเตอร์จับได้ คำขอจะถูกปฏิเสธก่อนที่พิกเซลแม้แต่จุดเดียวจะถูกเรนเดอร์ — ไม่ว่าจะเขียนใหม่ให้แนบเนียนแค่ไหน ก็ไม่เปลี่ยนผลการตัดสินที่ซ่อนอยู่ ถ้าตัวจำแนกถูกจูนมาให้จับที่แนวคิด ไม่ใช่แค่คำศัพท์

ชั้นที่สอง: ผลลัพธ์ก็ถูกตรวจเช่นกัน

แม้แต่พรอมต์ที่ผ่านด่านแรกก็ยังต้องเจอการตรวจครั้งที่สอง ภาพที่สร้างออกมาจะถูกรันผ่านตัวจำแนกภาพอีกตัวที่ฝึกมาเพื่อจับความเปลือยและเนื้อหาโจ่งแจ้งโดยเฉพาะ ถ้าโดนฟิลเตอร์นั้นจับได้ ผลลัพธ์จะถูกเบลอ ทิ้ง หรือแทนที่ก่อนที่คุณจะได้เห็นมันด้วยซ้ำ บางแพลตฟอร์มรันทั้งสองชั้นพร้อมกัน พรอมต์เดียวกันจึงอาจล้มเหลวต่างกันไปในแต่ละครั้ง ขึ้นอยู่กับว่าโมเดลบังเอิญเรนเดอร์อะไรออกมา

ชั้นที่สาม: มันถูกฝังอยู่ในตัวโมเดลเอง

ชั้นที่ลึกที่สุดไม่ใช่ฟิลเตอร์ที่คุณสามารถหลบผ่านได้เลย — มันคือการฝึก alignment ที่ถูกฝังลงไปในน้ำหนักของโมเดลตั้งแต่ขั้นตอน fine-tuning โมเดลที่ถูกฝึกแบบนี้ไม่ได้แค่ถูกบล็อกจากการสร้างเนื้อหาบางอย่าง แต่มันไม่เคยถูกสอนให้สร้างมันออกมาให้น่าเชื่อตั้งแต่แรก นี่คือเหตุผลที่แม้แต่พรอมต์ที่หลุดผ่านตัวจำแนกไปได้ ผลลัพธ์ก็มักจะออกมาบิดเบี้ยวหรือถูกทำให้ดูสะอาดเกินจริง

ทำไมแพลตฟอร์มกระแสหลักถึงออกแบบมาแบบนี้

นี่เป็นการตัดสินใจทางธุรกิจพอ ๆ กับเรื่องความปลอดภัย บริษัทอย่าง OpenAI และ Adobe ต้องรับผิดชอบต่อผู้ลงโฆษณา ลูกค้าองค์กร และนโยบายแอปสโตร์ที่ห้ามเนื้อหาโจ่งแจ้งโดยตรง — ทั้ง Apple และ Google ต่างแบนแอปเนื้อหาผู้ใหญ่ออกจากสโตร์ของตัวเองโดยสิ้นเชิง การควบคุมเนื้อหาผู้ใหญ่อย่างรับผิดชอบในสเกลโซเชียลเน็ตเวิร์กระดับผู้บริโภคก็มีต้นทุนสูงและความเสี่ยงทางกฎหมายมาก แพลตฟอร์มทั่วไปส่วนใหญ่จึงเลือกที่จะไม่ทำเลยดีกว่าสร้างโครงสร้างพื้นฐานนั้นขึ้นมา

"ไม่เซ็นเซอร์" คือสายพันธุ์ที่ต่างไป ไม่ใช่การหลบเลี่ยง

แพลตฟอร์มที่สร้างมาเพื่อการสร้างเนื้อหาผู้ใหญ่ไม่ได้รัน Midjourney เวอร์ชันแฮ็กที่ปิดฟิลเตอร์ — พวกมันสร้างขึ้นบนสาขาโมเดลที่ต่างออกไปโดยสิ้นเชิง (มักเป็นโมเดล diffusion แบบ open-weight และเวอร์ชัน fine-tune ที่สร้างขึ้นมาเฉพาะ) ที่ไม่เคยถูกฝึกด้วยชั้น alignment นั้นตั้งแต่แรก ถูกนำไปใช้งานบนโครงสร้างพื้นฐานที่สร้างขึ้นเพื่อการควบคุมเนื้อหาผู้ใหญ่โดยเฉพาะ: การยืนยันอายุตอนสมัคร การบังคับใช้นโยบายเนื้อหาที่ห้ามใช้ใบหน้าบุคคลจริง และกระบวนการนำเนื้อหาลงที่เหมาะกับหมวดหมู่นี้ มันคือเครื่องมือที่ต่างกันสร้างมาเพื่องานที่ต่างกัน ไม่ใช่เครื่องมือเดียวกันที่แค่ถูกงัดกุญแจออก

FAQ

ฉันแค่ jailbreak Midjourney หรือ DALL-E เพื่อเอาผลลัพธ์ NSFW ได้ไหม?

กลเม็ด prompt-injection ที่พยายามคุยอ้อมตัวจำแนกนั้นไม่น่าเชื่อถือ มักละเมิดข้อกำหนดการใช้งานของแพลตฟอร์ม และบัญชีมักถูกระงับ นี่เป็นคนละเรื่องกับการใช้แพลตฟอร์มที่สร้างขึ้นมาเพื่อการสร้างเนื้อหาผู้ใหญ่ตั้งแต่รากฐานจริง ๆ

"AI ไม่เซ็นเซอร์" คือเรื่องเดียวกับการหลบฟิลเตอร์ไหม?

ไม่ใช่ การหลบเลี่ยงคือความพยายามหลอกโมเดลที่ถูกฝึกให้ปฏิเสธ ส่วนแพลตฟอร์มไม่เซ็นเซอร์รันโมเดลที่ไม่เคยถูกฝึกด้วยชั้นการปฏิเสธนั้นเลย และถูกนำไปใช้โดยแพลตฟอร์มที่สร้างขึ้นรอบการยืนยันอายุและนโยบายเนื้อหาแทน

ทำไมพรอมต์เดียวกันถึงถูกบล็อกบนแพลตฟอร์มหนึ่งแต่ไม่ถูกบล็อกบนอีกแพลตฟอร์ม?

เพราะแพลตฟอร์มเหล่านั้นรันโมเดลที่ต่างกันโดยพื้นฐาน ไม่ใช่โมเดลเดียวกันที่ตั้งค่าต่างกัน สิ่งที่การฝึก alignment ของแพลตฟอร์มหนึ่งปฏิเสธที่จะเรนเดอร์ อีกโมเดลหนึ่งอาจไม่เคยถูกสอนให้ปฏิเสธมันตั้งแต่แรก

การสร้างเนื้อหา AI ไม่เซ็นเซอร์ผิดกฎหมายไหม?

เนื้อหาผู้ใหญ่ที่เป็นเรื่องสมมติและสร้างด้วย AI ที่แสดงภาพผู้ใหญ่ที่ยินยอมนั้นถูกกฎหมายในวงกว้างในเขตอำนาจศาลส่วนใหญ่ แพลตฟอร์มที่น่าเชื่อถือยังคงบังคับใช้นโยบายชั้นของตัวเองซ้อนทับอยู่ดี — การยืนยันอายุ และการห้ามใช้ใบหน้าบุคคลจริงที่ระบุตัวตนได้โดยไม่ได้รับความยินยอม — ไม่ว่าโมเดลที่อยู่เบื้องหลังจะมีฟิลเตอร์เนื้อหาหรือไม่ก็ตาม

เทมเพลต NSFW ยอดนิยม

ดูเทมเพลตทั้งหมด →