มีความรู้สึกหงุดหงิดแบบเฉพาะเจาะจงที่เฉพาะคนที่ทดสอบเครื่องมือ AI เป็นอาชีพเท่านั้นที่จะเข้าใจอย่างแท้จริง คุณนั่งลงกับแพลตฟอร์มใหม่ พิมพ์อะไรบางอย่างที่แปลกใหม่ในแบบที่งานสร้างสรรค์ที่น่าสนใจมักจะแปลกใหม่ และระบบก็มองกลับมาด้วยท่าทางเหมือนกำลังยักไหล่และบอกว่าไม่ ไม่ใช่เพราะสิ่งที่คุณขอเป็นอันตราย ไม่ใช่เพราะมันละเมิดกฎใดๆ ที่คนทั่วไปจะเรียกว่าเป็นกฎ แต่เพราะลึกๆ แล้วในโครงสร้างของระบบ มีคนตัดสินใจว่าความคลุมเครือมีค่าใช้จ่ายสูงเกินกว่าจะยอมรับได้ และลากเส้นแบ่งเนื้อหาไปไกลมากจนครอบคลุมทุกอย่างที่อยู่ในรัศมีที่ค่อนข้างกว้างของความไม่ธรรมดา
มันเกิดขึ้นบ่อยจนผมเลิกนับไปแล้วตั้งแต่แพลตฟอร์มที่สามที่ผมทดสอบอย่างจริงจัง และสิ่งที่กระทบใจคุณ เมื่อจ้องมองข้อความปฏิเสธนั้นเป็นครั้งที่ร้อยแล้วนั้น ไม่ใช่ความโกรธเสียทีเดียว มันเป็นความรู้สึกที่ช้ากว่าและทำให้สับสนมากกว่าความโกรธ มันคือความรู้สึกเวียนหัวที่รู้ว่าเครื่องจักรเบื้องหลังอินเทอร์เฟซนั้นสามารถทำในสิ่งที่คุณขอได้อย่างสมบูรณ์แบบ คุณรู้สึกได้ เหมือนกับที่คุณรู้สึกว่าประตูที่ล็อกอยู่ไม่ได้ติดอยู่ แต่ถูกปิดอย่างจงใจ โมเดลมีอยู่ ความสามารถมีอยู่ สิ่งที่ขวางกั้นระหว่างคุณกับผลลัพธ์ไม่ใช่ข้อจำกัดทางเทคนิค แต่เป็นการตัดสินใจของคนที่ไม่เคยมีใครพบ ในการประชุมที่คุณไม่เคยได้รับเชิญ เกี่ยวกับสิ่งที่คนอย่างคุณควรและไม่ควรได้รับอนุญาตให้ร้องขอ พวกเขาลากเส้นแบ่งอย่างใจกว้างห่างจากสิ่งที่เป็นอันตรายอย่างแท้จริง และสุดท้ายคุณก็อยู่ผิดฝั่งอยู่ดี ไม่ใช่เพราะสิ่งที่คุณต้องการ แต่เพราะสิ่งที่คำสั่งของคุณดูเหมือนสำหรับระบบที่ได้รับการฝึกฝนให้กลัวความคล้ายคลึง คุณคือเหยื่อ
ช่องว่างระหว่างสิ่งที่ระบบเหล่านี้สามารถทำได้จริงกับสิ่งที่ผู้ควบคุมระบบเต็มใจที่จะเปิดเผยนั้นไม่ได้ลดลงเลย หากแต่กลับเพิ่มมากขึ้นเรื่อยๆ ซึ่งเป็นเหตุผลว่าทำไมการค้นหาเครื่องมือสร้างวิดีโอ AI ที่ไม่ถูกเซ็นเซอร์ เครื่องมือแปลงข้อความเป็นวิดีโอ AI ที่ไม่มีการเซ็นเซอร์ และเครื่องมือที่สร้างเนื้อหาได้โดยไม่มีข้อจำกัดที่ผู้ใช้ส่วนใหญ่พบเจอโดยไม่ทันรู้ตัว จึงเพิ่มขึ้นอย่างต่อเนื่องจนการอัปเดตอัลกอริทึมใดๆ ก็ไม่สามารถหยุดยั้งได้ พฤติกรรมการค้นหานี้ไม่ใช่ความอยากรู้อยากเห็นเพียงอย่างเดียว แต่เป็นความต้องการ เป็นกลุ่มผู้ใช้ที่เคยสัมผัสประสบการณ์การสร้างวิดีโอ AI ที่ใช้งานได้จริงมาแล้ว และต้องการรู้ว่ามันจะเป็นอย่างไรเมื่อไม่มีใครมาขวางกั้นระหว่างพวกเขากับผลลัพธ์
คำถามนั้นคือแก่นหลักของชิ้นงานนี้: เพดานมาจากไหน ต้นทุนเชิงสร้างสรรค์เป็นเท่าใด และภูมิทัศน์เป็นอย่างไรสำหรับคนที่ตัดสินใจแล้วว่าพวกเขาจะไม่ยอมรับมันอีกต่อไป
โปรแกรมสร้างวิดีโอ AI แบบไม่เซ็นเซอร์คืออะไร?
โปรแกรมสร้างวิดีโอ AI แบบไม่เซ็นเซอร์ คือระบบที่ออกแบบมาเพื่อสร้างเนื้อหาวิดีโอจากข้อความที่เขียน โดยไม่ต้องใช้ตัวกรองการตรวจสอบที่เข้มงวดซึ่งแพลตฟอร์ม AI กระแสหลักส่วนใหญ่ใส่ไว้ในผลิตภัณฑ์ของตน ในขณะที่บริษัท AI ขนาดใหญ่จำกัดสิ่งที่โมเดลของพวกเขาสามารถสร้างได้เป็นอย่างมาก แต่ระบบนิเวศที่กำลังเติบโตของเครื่องมือทดลอง แพลตฟอร์มอิสระ และโมเดลโอเพนซอร์ส ทำงานโดยมีข้อจำกัดน้อยกว่ามาก ทำให้ผู้ใช้สามารถเข้าถึงผลลัพธ์เชิงสร้างสรรค์ที่หลากหลายกว่าที่แพลตฟอร์มระดับองค์กรทั่วไปจะอนุญาต
คำว่า "แพลตฟอร์มที่ไม่ถูกเซ็นเซอร์" ครอบคลุมการกำหนดค่าที่แตกต่างกันทางเทคนิคหลายแบบ เครื่องมือที่ไม่ถูกเซ็นเซอร์บางอย่างเป็นแพลตฟอร์มบนคลาวด์ที่เลือกใช้นโยบายการควบคุมเนื้อหาที่ผ่อนปรนกว่าคู่แข่งหลักๆ บางอย่างเป็นโมเดลโอเพนซอร์สที่ผู้ใช้ติดตั้งใช้งานในเครื่องของตนเอง โดยอยู่นอกเหนือโครงสร้างพื้นฐานเซิร์ฟเวอร์ของบริษัทใดๆ อย่างสิ้นเชิง ซึ่งไม่มีนโยบายเนื้อหาแบบรวมศูนย์ที่จะประเมินหรือปฏิเสธข้อความแจ้งเตือน และบางอย่างก็อยู่ระหว่างสองแบบนี้ คือแพลตฟอร์มแบบโฮสต์ที่สร้างขึ้นบนโมเดลพื้นฐานที่มีข้อจำกัดน้อยกว่า ออกแบบมาโดยเฉพาะสำหรับกรณีการใช้งานเชิงสร้างสรรค์ที่อยู่นอกเหนือขอบเขตที่ผู้เล่นรายใหญ่ๆ จะให้ความสำคัญ
การเข้าใจว่าคุณกำลังใช้งานอุปกรณ์ประเภทใดนั้นมีความสำคัญในทางปฏิบัติ เพราะความยืดหยุ่นที่แต่ละรูปแบบนำเสนอ และข้อดีข้อเสียที่เกี่ยวข้องนั้นแตกต่างกันอย่างแท้จริง บทความนี้จะอธิบายรายละเอียดทั้งหมดนั้น
การแยกตัวนี้เป็นสิ่งที่สำคัญที่สุดที่เกิดขึ้นในวงการนี้ในขณะนี้ ในช่วงหลายปีแรกของการสร้างวิดีโอด้วย AI คำถามที่ว่าระบบเหล่านี้สามารถผลิตอะไรได้บ้าง และคำถามที่ว่าบริษัทใดบริษัทหนึ่งจะอนุญาตให้คุณผลิตอะไรได้บ้างนั้นมีคำตอบเดียวกัน แต่ตอนนี้ไม่ใช่แล้ว และช่องว่างระหว่างทั้งสองก็กว้างขึ้นทุกไตรมาส
แรงขับเคลื่อนเบื้องหลังการเปลี่ยนแปลงนี้คือระบบนิเวศของโมเดลโอเพนซอร์สที่กำลังเติบโต ซึ่งสามารถทำงานได้อย่างสมบูรณ์บนฮาร์ดแวร์ในพื้นที่ โดยไม่มีเซิร์ฟเวอร์ระยะไกลมาประเมินข้อความแจ้งของคุณ และไม่มีนโยบายแพลตฟอร์มใด ๆ มาขวางกั้นระหว่างคุณกับผลลัพธ์ ณ ต้นปี 2026 โมเดลเหล่านี้หลายตัวได้บรรลุมาตรฐานคุณภาพที่ทำให้การเปรียบเทียบกับทางเลือกบนคลาวด์นั้นสามารถแข่งขันได้อย่างแท้จริง แทนที่จะเป็นเพียงความปรารถนา
ว่าน 2.1
Wan 2.1 และรุ่นต่อๆ มาจาก Alibaba ทำงานได้โดยใช้ VRAM เพียง 8 ถึง 12 GB ซึ่งทำให้สามารถใช้งานได้กับฮาร์ดแวร์ระดับผู้บริโภคที่ครีเอเตอร์มืออาชีพจำนวนมากมีอยู่แล้ว สถาปัตยกรรมนี้สร้างสมดุลระหว่างคุณภาพการสร้างภาพกับต้นทุนการคำนวณในแบบที่โมเดลโอเพนซอร์สรุ่นก่อนๆ ทำไม่ได้อย่างน่าเชื่อถือ และผลลัพธ์ที่ได้นั้นดีเป็นพิเศษในด้านการเคลื่อนไหวแบบภาพยนตร์และความต่อเนื่องของฉาก อินเทอร์เฟซต่างๆ เช่น ComfyUI ทำให้การใช้งานในระดับท้องถิ่นเข้าถึงได้ง่ายขึ้น แม้ว่าอุปสรรคทางเทคนิคจะยังคงมีอยู่ แต่ก็ไม่จำเป็นต้องมีความรู้ด้านแมชชีนเลิร์นนิงก็สามารถเอาชนะได้อีกต่อไป
แอลทีเอ็กซ์-2
LTX-2 จาก Lightricks นั้นมีระดับความทะเยอทะยานที่แตกต่างออกไป รองรับความละเอียด 4K อย่างแท้จริง อัตราเฟรมสูงสุดถึง 50fps การสร้างเสียงแบบซิงโครไนซ์ และใบอนุญาต Apache 2.0 ที่ครอบคลุมถึงการใช้งานเชิงพาณิชย์: นี่คือข้อกำหนดระดับการผลิตบนโมเดลที่สามารถใช้งานได้ในพื้นที่ ซึ่งเป็นสิ่งที่แทบจะเป็นไปไม่ได้เลยในอดีตteen หลายเดือนก่อน สำหรับผู้สร้างสรรค์ที่ต้องการความสม่ำเสมอและการควบคุมผลลัพธ์โดยไม่ต้องพึ่งพาระบบคลาวด์ ปัจจุบันมันอยู่ในอันดับต้น ๆ ของสิ่งที่สามารถเข้าถึงได้ในทางปฏิบัติ
สกายรีลส์
SkyReels สร้างขึ้นบนพื้นฐานอย่าง HunyuanVideo และปรับแต่งอย่างละเอียดด้วยชุดข้อมูลภาพยนตร์และโทรทัศน์จำนวนมาก เชี่ยวชาญในด้านที่โมเดลโอเพนซอร์สส่วนใหญ่ประสบปัญหาอย่างเห็นได้ชัด นั่นคือการสร้างภาพบุคคลสมจริงในแต่ละเฟรม ความต้องการ VRAM สูงกว่า โดยอยู่ระหว่าง 14 ถึง 24 GB ขึ้นอยู่กับการกำหนดค่า แต่สำหรับงานที่เน้นตัวละคร ผลลัพธ์ที่ได้นั้นคุ้มค่ากับการลงทุนด้านฮาร์ดแวร์ในแบบที่โมเดลที่เบากว่าในปัจจุบันไม่สามารถเทียบได้
โมจิ 1
Mochi 1 จาก Genmo แก้ปัญหาด้วยสถาปัตยกรรมแบบกระจายและแปลงสัญญาณ ซึ่งช่วยลดช่องว่างด้านคุณภาพกับโมเดลเชิงพาณิชย์แบบปิดได้อย่างมีนัยสำคัญ การปฏิบัติตามมาตรฐานอย่างรวดเร็วของมันอยู่ในระดับที่แข็งแกร่งที่สุดในด้านโอเพนซอร์ส ซึ่งมีความสำคัญในทางปฏิบัติ เพราะโมเดลที่สร้างผลลัพธ์ตามที่คุณต้องการได้อย่างน่าเชื่อถือ ย่อมมีประโยชน์มากกว่าโมเดลที่สร้างผลลัพธ์ที่พิเศษบ้างไม่พิเศษบ้าง และส่วนใหญ่สร้างผลลัพธ์ที่ใกล้เคียงกับสิ่งที่คุณต้องการ
โดยทั่วไปแล้ว สิ่งเหล่านี้จะเข้าถึงได้ผ่านทางอินเทอร์เฟซต่างๆ เช่น สะดวกสบาย, พิโนคิโอหรือกำหนดเอง กราดิโอ แอปพลิเคชันเหล่านี้ทำงานบนเครื่องโลคอล ดังนั้นข้อจำกัดเพียงอย่างเดียวในการสร้างผลลัพธ์คือข้อมูลที่มีอยู่หรือไม่มีอยู่ในข้อมูลฝึกฝนพื้นฐาน ไม่มีแพลตฟอร์มใดปฏิเสธคำขอของคุณได้ ไม่มีเลเยอร์การตรวจสอบใด ๆ อยู่ระหว่างข้อมูลนำเข้าและข้อมูลส่งออก ระบบนิเวศมีการเปลี่ยนแปลงอย่างรวดเร็วมากจนการถือว่าเวอร์ชันใดเวอร์ชันหนึ่งเป็นเวอร์ชันที่แน่นอนนั้นเป็นความผิดพลาด กอดหน้า และที่เก็บข้อมูล GitHub ที่เกี่ยวข้องคือที่ที่ค่าถ่วงน้ำหนักปัจจุบัน การปรับแต่งโดยชุมชน และเอกสารประกอบที่อัปเดตแล้วอยู่จริง
ในทางปฏิบัติแล้ว นั่นหมายความว่าเครื่องมือสร้างวิดีโอ AI ที่ไม่มีการเซ็นเซอร์นั้นไม่ใช่เพียงแค่แนวคิดทางทฤษฎีอีกต่อไป มันเป็นชุดเครื่องมือเฉพาะที่มีข้อกำหนดด้านฮาร์ดแวร์และคุณภาพเฉพาะ ซึ่งมีให้ใช้งานแล้วในปัจจุบัน พัฒนาอย่างต่อเนื่อง และควบคุมได้โดยเครื่องคอมพิวเตอร์ของคุณเองเท่านั้น
เพื่อให้เห็นภาพรวมชัดเจนยิ่งขึ้น นี่คือการเปรียบเทียบโดยย่อของประเภทหลักๆ ของ “ไม่แน่ใจ“การตั้งค่าที่ผู้คนพบเจอใน” มีนาคม:
| ประเภทของ “ไม่เซ็นเซอร์” | รายละเอียด | ข้อดี | ข้อเสีย / ข้อแลกเปลี่ยน | ตัวอย่างทั่วไป (2026) |
|---|---|---|---|---|
| ตัวกรองระดับแพลตฟอร์มถูกลบออกแล้ว | ตัวกรองจะถูกนำไปใช้เฉพาะในระดับเซิร์ฟเวอร์/แพลตฟอร์มเท่านั้น รุ่นพื้นฐานอาจยังคงใช้งานได้ | ใช้งานง่ายทางออนไลน์ รวดเร็ว และไม่จำเป็นต้องใช้ฮาร์ดแวร์ในพื้นที่ | อาจคงไว้ซึ่งอคติในการฝึกอบรม มีความเสี่ยงต่อการถูกแบนบัญชีหรือการเปลี่ยนแปลงนโยบายอย่างกะทันหัน และไม่เป็นส่วนตัวอย่างแท้จริง | Eternal AI, Viyou, Tensor.art (ระบบคลาวด์ที่มีข้อจำกัดน้อยกว่าหรือสามารถถอดออกได้) |
| โอเพนซอร์สแบบโลคัลอย่างสมบูรณ์ | ดาวน์โหลดและรันโมเดลบนพีซี/ฮาร์ดแวร์ของคุณเองโดยสมบูรณ์ โดยไม่ต้องใช้ตัวกรองหรือเซิร์ฟเวอร์ภายนอกใดๆ | ความเป็นส่วนตัวสูงสุด อิสระอย่างสมบูรณ์ (ไม่มีการปฏิเสธใดๆ ทั้งสิ้น) ปรับแต่งได้เต็มที่ | ต้องใช้การ์ดจอที่ดีพอสมควร (โดยทั่วไปต้องมี VRAM 8 ถึง 24 GB ขึ้นไป); ต้องติดตั้งโปรแกรมทางเทคนิค (เช่น ComfyUI, Pinokio เป็นต้น); และจะทำงานช้าลงหากใช้ฮาร์ดแวร์ที่ด้อยกว่า | Wan 2.2, LTX-วิดีโอ (หรือ LTX-2), SkyReels V1/V4, Mochi 1, HunyuanVideo |
| ฐานที่ปรับแต่งอย่างละเอียด / ไม่มีการเซ็นเซอร์ | แบบจำลองพื้นฐาน (หรือแบบต่างๆ) ที่ได้รับการฝึกฝนหรือปรับแต่งอย่างละเอียดโดยไม่มีการจัดเรียงความปลอดภัยที่ซับซ้อนหรือข้อมูลที่ถูกยกเว้น | คุณภาพดีขึ้นในหัวข้อที่ "ยาก" หรือกรณีพิเศษ มักตรงต่อเวลาดี | ความสม่ำเสมอของการเคลื่อนไหว/ตัวอักษรอาจยังคงแตกต่างกันไป อาจจำเป็นต้องใช้ LoRA จากชุมชนเพื่อผลลัพธ์ที่ดีที่สุด คุณภาพขึ้นอยู่กับการปรับแต่งอย่างละเอียด | เวอร์ชันชุมชนของ HunyuanVideo, การปรับแต่งอย่างละเอียดของซีรีส์ Wan, LoRA ต่างๆ บน Hugging Face |
AI แปลงข้อความเป็นวิดีโอสร้างวิดีโอได้อย่างไร
กลไกเบื้องหลังเวทมนตร์
มองเผินๆ ระบบแปลงข้อความเป็นวิดีโอเหมือนจะทำงานอย่างง่ายดายจนน่าอาย: คุณอธิบายบางสิ่ง แล้วมันก็ปรากฏขึ้น ระยะห่างระหว่างการป้อนข้อมูลและผลลัพธ์รู้สึกได้ทันที เกือบจะเหมือนการบอกเล่าให้ศิลปินผู้มากความสามารถที่ทำงานด้วยความเร็วเหนือมนุษย์ แต่ความรู้สึกนั้นซ่อนเร้นกระบวนการทำงานที่ซับซ้อนมากพอที่จะทำให้ความรู้สึกง่ายดายนั้นดูเหมือนปาฏิหาริย์เล็กๆ บางสิ่งบางอย่างสลายไปในทันทีที่คำพูดของคุณข้ามผ่านจุดนั้น มันเข้าไปในฐานะภาษาและออกมาเป็นสิ่งที่ระบบสร้างขึ้นจากเศษซากของมัน ไม่ใช่การแปล แต่เป็นการขุดค้นขึ้นมาใหม่
แบบจำลองนี้ไม่ได้ประมวลผลประโยคของคุณในแบบที่ผู้อ่านจะทำ คือเคลื่อนจากซ้ายไปขวาตามความหมายจนถึงจุดจบประโยค มันแยกประโยคทั้งหมดออกเป็นแรงกดดันย่อยๆ: ระดับอารมณ์ที่ซ่อนอยู่ภายใต้คำนาม น้ำหนักทางสายตาที่แฝงอยู่ในการเลือกใช้คำกริยา ช่องว่างระหว่างสิ่งที่คุณระบุไว้กับสิ่งที่คุณเว้นว่างไว้ ทั้งหมดนี้ถูกนำมาพิจารณาพร้อมกัน ชั่งน้ำหนักซึ่งกันและกัน และยุบรวมเป็นชุดพิกัดที่ไม่ใช่การอธิบายสถานที่ แต่เป็นการหาจุดอ้างอิงโดยประมาณ ฉากที่คุณนึกถึงนั้นไม่ได้อยู่ในประโยคของคุณ มันอยู่เบื้องหลังประโยค ในโครงสร้างของการบอกใบ้ และสิ่งที่แบบจำลองสร้างขึ้นคือการสร้างห้องขึ้นมาใหม่ที่ดีที่สุดเท่าที่จะอนุมานได้จากเสียงที่คำพูดของคุณกระทบกับผนัง
ภาพแต่ละเฟรมค่อยๆ สะสมขึ้น การเคลื่อนไหวปรากฏขึ้น สิ่งที่คุณได้รับในตอนท้ายคือคลิปวิดีโอที่ปัญญาประดิษฐ์สร้างขึ้นจากจินตนาการ โดยอิงจากทุกสิ่งที่มันเคยเห็นและคำสั่งเฉพาะที่คุณให้ไว้
สาขานี้มีชื่อเรียกอย่างเป็นทางการสำหรับกระบวนการนี้ว่า การสร้างวิดีโอจากข้อความ (Text to Video Generation) และอยู่ตรงจุดตัดระหว่างวิทยาการคอมพิวเตอร์ด้านการมองเห็น การประมวลผลภาษาธรรมชาติ และการสร้างแบบจำลองเชิงกำเนิด นอกจากนี้ยังเป็นหนึ่งในสิ่งที่ต้องใช้การคำนวณสูงที่สุดที่คุณสามารถขอให้ระบบ AI ทำได้ ซึ่งเป็นส่วนหนึ่งที่ทำให้ผลลัพธ์ยังคงวัดเป็นวินาทีแทนที่จะเป็นชั่วโมง
ปัญหาเรื่องความสม่ำเสมอที่ไม่มีใครพูดถึงมากพอ
การสร้างภาพที่น่าสนใจเพียงภาพเดียวก็ยากแล้ว การสร้างภาพต่อเนื่องห้าสิบภาพที่สอดคล้องกันมากพอที่จะดูเหมือนเป็นฉากเดียวกันนั้นเป็นความท้าทายที่แตกต่างออกไปอย่างสิ้นเชิง
ทุกเฟรมต้องสอดคล้องกับเฟรมก่อนหน้า แหล่งกำเนิดแสงต้องอยู่ในตำแหน่งเดียวกัน ใบหน้าของตัวละครในเฟรมที่สามสิบแปดต้องเป็นใบหน้าเดียวกับในเฟรมที่สามอย่างเห็นได้ชัด วัตถุไม่สามารถเปลี่ยนรูปร่างไปมาระหว่างฉากได้ ฟิสิกส์ แม้แต่ฟิสิกส์ที่ถูกดัดแปลง ก็ต้องเป็นไปตามตรรกะที่สอดคล้องกันภายใน ซึ่งสายตาของมนุษย์ยอมรับว่าเป็นไปได้
นี่คือจุดที่ระบบส่วนใหญ่เผยให้เห็นข้อจำกัดของมัน ไม่ใช่ผ่านความล้มเหลวอย่างฉับพลัน แต่ผ่านการเปลี่ยนแปลงอย่างค่อยเป็นค่อยไป ชนิดที่สังเกตเห็นว่าผิดปกติก่อนที่คุณจะอธิบายได้ว่าทำไม และนี่คือจุดที่ช่องว่างระหว่างแบบจำลองที่ดีที่สุดที่มีอยู่กับสิ่งอื่นๆ ปรากฏชัดเจนที่สุด ผมใช้เวลาพอสมควรกับระบบเหล่านี้ และช่องว่างนั้นมีอยู่จริง วัดได้ และกำลังแคบลงเร็วกว่าที่ผมคาดไว้เมื่อเริ่มงานนี้
การเคลื่อนไหวเป็นภาษาที่ปัญญาประดิษฐ์ยังคงเรียนรู้อยู่
ในการสร้างวิดีโอ มีอีกชั้นหนึ่งที่มักไม่ค่อยมีการพูดถึงในการรายงานข่าวที่เน้นผลลัพธ์และการสาธิต นั่นคือชั้นของการจำลองการเคลื่อนไหว ซึ่งระบบไม่ได้แค่คาดการณ์ว่าสิ่งต่างๆ จะมีลักษณะอย่างไร แต่ยังคาดการณ์ถึงพฤติกรรมของสิ่งเหล่านั้นเมื่อเวลาผ่านไปด้วย เช่น ผ้าจะเคลื่อนไหวอย่างไรเมื่อร่างกายเปลี่ยนตำแหน่ง ใบหน้าจะเปลี่ยนรูปร่างอย่างไรผ่านการแสดงออกทางสีหน้า แทนที่จะแค่เปลี่ยนระหว่างสองสถานะคงที่ น้ำหนักและโมเมนตัมจะส่งผลต่อการล้ม การหยุด หรือการหมุนของสิ่งต่างๆ อย่างไร
ระบบที่สร้างวิดีโอที่ดูสมจริงที่สุดได้ลงทุนอย่างมากในส่วนนี้ ส่วนระบบที่สร้างเนื้อหาที่ดูไม่สมจริง ดูน่าเชื่อถือในแต่ละเฟรม แต่เมื่อเคลื่อนไหวแล้วกลับดูไม่สมจริงนั้น คือระบบที่ขาดการลงทุนในส่วนนี้ หรือลงทุนไม่เพียงพอ ในความคิดของผม นี่คือมิติที่สำคัญที่สุดของการสร้างวิดีโอที่มีคุณภาพ แต่กลับถูกมองข้ามไปมากที่สุด
เหตุใดโปรแกรมสร้างวิดีโอ AI ส่วนใหญ่จึงใช้ฟิลเตอร์
ความรับผิดที่ปลอมตัวเป็นหลักการ
ระบบการกลั่นกรองเนื้อหาที่สร้างขึ้นในแพลตฟอร์มวิดีโอ AI กระแสหลักนั้นไม่ใช่เพียงแค่โครงสร้างทางจริยธรรมเท่านั้น แต่เป็นส่วนสำคัญที่เกี่ยวข้องกับกฎหมายและชื่อเสียง บริษัทที่ดำเนินงานในหลายสิบประเทศไม่สามารถที่จะมาพบภายหลังว่าเครื่องมือของตนสร้างเนื้อหาที่อาจถูกดำเนินคดีในประเทศที่ตนไม่ได้คำนึงถึงเป็นพิเศษได้ ทางออกคือการสร้างตัวกรองที่เข้มงวดเพียงพอที่จะสร้างพื้นที่ปลอดภัยที่ยอมรับได้ในทุกที่พร้อมกัน
สิ่งที่ระบบดักจับได้จริง ๆ ไม่ใช่อันตราย อันตรายเป็นเป้าหมายเล็ก ๆ และระบบเหล่านี้ไม่ใช่เครื่องมือที่แม่นยำ พวกมันเป็นเหมือนแหขนาดใหญ่ที่ลากผ่านภาษา และสิ่งที่ปรากฏขึ้นมาก็คือทุกสิ่งที่ตรงกับรูปแบบที่ใครบางคนเคยตัดสินใจห้ามไว้ โดยไม่คำนึงว่าความคล้ายคลึงนั้นจะมีความหมายอะไรหรือไม่ เรื่องราวที่ซับซ้อนทางศีลธรรม ฉากที่ต้องการความมืดมิดเพื่อความซื่อสัตย์ คำขอที่แปลกประหลาดในเชิงสไตล์มากพอที่จะทำให้ระบบที่เรียนรู้ความระมัดระวังจากตัวอย่างมากกว่าหลักการมองว่าน่าสงสัย
สิ่งเหล่านี้ไม่มีสิ่งใดเป็นอันตรายในแง่ของการใช้งานจริง แต่มีลักษณะคล้ายคลึงกับสิ่งที่อาจก่อให้เกิดปัญหาได้ ไม่มีใครที่ร่างกฎเหล่านั้นตั้งใจจะบีบคั้นวิสัยทัศน์ของผู้สร้างภาพยนตร์หรือปิดกั้นฉากที่นักเขียนรู้สึกไม่สบายใจ พวกเขาเริ่มต้นด้วยเอกสารทางกฎหมาย รายการสถานการณ์ความรับผิด และความเหนื่อยล้าจากการพยายามทำให้กฎระเบียบเดียวสามารถใช้ได้กับสภาพแวดล้อมทางกฎหมายกว่า 30 แห่งที่ไม่เห็นด้วยกับความหมายของคำว่า "อันตราย"
กฎเกณฑ์ที่เกิดขึ้นจากกระบวนการนั้นไม่ได้โหดร้าย เพียงแต่ถูกเขียนขึ้นในระดับที่เจตนาสร้างสรรค์ส่วนบุคคลมองไม่เห็น ทุกสิ่งทุกอย่างที่ต่ำกว่าเกณฑ์ความธรรมดาจึงดูเหมือนกันหมด และผลกระทบที่เกิดขึ้นจากการลดทอนความธรรมดานั้นก็เป็นปัญหาของคนอื่นที่จะต้องรับมือ มันค่อยๆ สะสมขึ้นอย่างเงียบๆ การปฏิเสธบ้าง การถูกบล็อกบ้าง ผู้สร้างภาพยนตร์พยายามหลีกเลี่ยงข้อจำกัดที่ไม่ได้มีไว้สำหรับเธอตั้งแต่แรก ไม่ใช่ความผิดพลาดในระบบใดๆ ที่ใครๆ ก็ติดตาม แต่เป็นเพียงภาษีที่งานสร้างสรรค์ต้องจ่ายสำหรับการดำรงอยู่ในดินแดนที่โครงสร้างทางกฎหมายไม่ได้ถูกสร้างขึ้นมาเพื่อทำความเข้าใจ
นี่ไม่ใช่การปกป้องแพลตฟอร์มที่บล็อกสิ่งที่ไม่ควรบล็อก แต่เป็นการอธิบายว่าทำไมพวกเขาถึงทำเช่นนั้น เพราะการเข้าใจกลไกนั้นจำเป็นต่อการเข้าใจว่าทางเลือกที่ไม่ถูกเซ็นเซอร์นั้นหมายถึงอะไรกันแน่
ความแตกต่างระหว่างตัวกรองพื้นผิวและตัวกรองโครงสร้าง
สิ่งหนึ่งที่การรายงานข่าวเกี่ยวกับการคัดกรองเนื้อหาด้วย AI ส่วนใหญ่เข้าใจผิดคือ ตัวกรองไม่ได้เหมือนกันทั้งหมด
ระบบการตรวจสอบบางส่วนถูกนำมาใช้ในระดับแพลตฟอร์ม โดยทำงานอยู่บนโมเดลที่ไม่มีข้อจำกัดใดๆ ระบบเหล่านี้จะตรวจสอบข้อความแจ้งเตือน ตรวจจับรูปแบบ และปฏิเสธการสร้างเนื้อหาก่อนที่จะเริ่มต้น ระบบเหล่านี้สามารถถูกลบหรือหลีกเลี่ยงได้ในทางทฤษฎีโดยผู้ที่มีสิทธิ์เข้าถึงโมเดลพื้นฐานโดยตรง
นอกจากนี้ ยังมีข้อจำกัดอื่นๆ ที่ถูกกำหนดไว้ในตัวโมเดลเองระหว่างการฝึกฝน เนื้อหาบางประเภทจะถูกตัดออกจากข้อมูลการฝึกฝนอย่างเป็นระบบ ซึ่งหมายความว่าโมเดลจะไม่สามารถสร้างเนื้อหาเหล่านั้นได้ไม่ว่าผู้ใช้จะร้องขออะไรก็ตาม เนื่องจากไม่มีตัวกรองให้ลบออก เพราะความสามารถนั้นไม่มีอยู่ในระดับสถาปัตยกรรม
เมื่อผู้คนค้นหาโปรแกรมสร้างวิดีโอ AI ที่ไม่มีการเซ็นเซอร์ พวกเขามักจะอธิบายสถานการณ์ทั้งสองแบบนี้โดยไม่ได้แยกแยะความแตกต่างระหว่างกัน ความแตกต่างนี้มีความสำคัญในทางปฏิบัติ: เวอร์ชันของโมเดลที่ใช้งานในเครื่องโดยลบตัวกรองระดับแพลตฟอร์มออก อาจทำงานแตกต่างจากที่ผู้ใช้คาดหวัง หากโมเดลพื้นฐานได้รับการฝึกฝนอย่างระมัดระวังตั้งแต่เริ่มต้น
คำว่า “ไม่เซ็นเซอร์” ในที่นี้หมายความว่าอย่างไรกันแน่
สามสิ่งที่ไม่เหมือนกันแต่ติดป้ายยี่ห้อเดียวกัน
คำว่า "ไม่เซ็นเซอร์" มีบทบาทสำคัญอย่างมากในบทสนทนานี้ และควรค่าแก่การหยุดพิจารณาอย่างถี่ถ้วนว่ามันมีความหมายอย่างไรกันแน่
สำหรับผู้ใช้งานกลุ่มหนึ่ง คำว่า "ไม่เซ็นเซอร์" ไม่ได้มีความหมายอะไรมากไปกว่าระบบที่ประเมินคำขอสร้างสรรค์จากเนื้อหาที่แท้จริงมากกว่ารูปแบบภายนอก แพลตฟอร์มที่พร้อมจะรับมือกับเรื่องราวที่มืดมน สถานการณ์ที่คลุมเครือทางศีลธรรม หรือคำขอที่มีสุนทรียภาพแปลกใหม่ โดยไม่ปิดกั้นตัวเองโดยอัตโนมัติเพียงเพราะหัวข้อนั้นดูเหมือนจะใกล้เคียงกับสิ่งต้องห้าม นี่คือความคาดหวังที่สมเหตุสมผลซึ่งอธิบายถึงกลุ่มผู้ใช้งานจำนวนมากที่รู้สึกผิดหวัง แต่ก็เป็นผู้ใช้งานที่ถูกต้องตามกฎหมายอย่างแท้จริง
สำหรับอีกหมวดหมู่หนึ่ง คำว่า "ไม่เซ็นเซอร์" หมายถึงการสร้างเนื้อหาสำหรับผู้ใหญ่โดยเฉพาะ เนื้อหาทางเพศที่โจ่งแจ้งซึ่งแพลตฟอร์มกระแสหลักปฏิเสธโดยสิ้นเชิง นี่เป็นกรณีการใช้งานที่แตกต่างออกไป มีแพลตฟอร์มของตัวเอง ชุมชนของตัวเอง ตรรกะทางเศรษฐกิจของตัวเอง และความเสี่ยงด้านกฎระเบียบของตัวเอง เราจะกล่าวถึงภาพรวมเฉพาะของเครื่องมือสร้างวิดีโอ AI ที่ไม่เหมาะสมในบทความเฉพาะเรื่องอื่น ๆ บนเว็บไซต์นี้ รวมถึงการจัดอันดับแพลตฟอร์มที่คุ้มค่าแก่การใช้งานเป็นประจำ ซึ่งสร้างขึ้นจากวิธีการทดสอบเดียวกันกับที่เราใช้กับทุกสิ่งในที่นี้
สำหรับหมวดหมู่ที่สาม ความน่าสนใจจะอยู่ที่แง่มุมทางปรัชญามากกว่า กล่าวคือ ความอยากรู้ว่าระบบเหล่านี้มีอะไรอยู่ข้างในบ้าง และสามารถทำอะไรได้บ้างเมื่อไม่มีข้อจำกัดใดๆ อีกต่อไป ราวกับเป็นหน้าต่างที่เปิดให้เห็นถึงธรรมชาติของเทคโนโลยีเอง มากกว่าที่จะมุ่งไปที่เป้าหมายด้านเนื้อหาใดๆ โดยเฉพาะ
การเปลี่ยนแปลงสู่โอเพนซอร์ส
พัฒนาการที่สำคัญที่สุดในเชิงโครงสร้างในวงการวิดีโอ AI ที่ไม่มีการเซ็นเซอร์นั้น ไม่ใช่การเปิดตัวแพลตฟอร์มหรือโมเดลใดโมเดลหนึ่งโดยเฉพาะ แต่เป็นการพัฒนาอย่างค่อยเป็นค่อยไปของโมเดลสร้างวิดีโอแบบโอเพนซอร์สที่สามารถใช้งานบนฮาร์ดแวร์ส่วนบุคคลได้ โดยไม่ต้องพึ่งพาโครงสร้างพื้นฐานเซิร์ฟเวอร์ของบริษัทใดๆ และไม่มีเลเยอร์การควบคุมจากส่วนกลางที่คอยตัดสินใจว่าคำขอของคุณสามารถขออะไรได้บ้าง
เมื่อโมเดลทำงานในเครื่องโลคอล การควบคุมเพียงอย่างเดียวที่มีอยู่คือสิ่งที่ถูกสร้างขึ้นในโมเดลระหว่างการฝึกฝน ข้อจำกัดระดับแพลตฟอร์มจะหายไปโดยสิ้นเชิงเพราะไม่มีแพลตฟอร์ม สิ่งที่เหลืออยู่คือความสามารถพื้นฐานของโมเดลเอง ซึ่งสามารถเข้าถึงได้ผ่านอินเทอร์เฟซที่ชุมชนโอเพนซอร์สสร้างและดูแลรักษาโดยอิสระจากนักวิจัยดั้งเดิม
นี่เป็นการเปลี่ยนแปลงที่มีความหมาย หมายความว่าคำถามที่ว่าการสร้างวิดีโอด้วย AI สามารถสร้างอะไรได้บ้างนั้น เริ่มแยกออกจากคำถามที่ว่าบริษัทใดบริษัทหนึ่งยินดีที่จะอนุญาตให้แพลตฟอร์มของตนสร้างอะไรได้บ้าง ในช่วงหลายปีแรกของการเกิดขึ้นของเทคโนโลยีนี้ คำถามทั้งสองมีคำตอบเดียวกัน แต่ตอนนี้คำตอบนั้นไม่เหมือนกันอีกต่อไปแล้ว
สถาปัตยกรรมที่แตกต่างกันของการสร้างวิดีโอด้วย AI
แปลงข้อความเป็นวิดีโอ: การสร้างวิดีโอจากภาษาอย่างแท้จริง
การสร้างวิดีโอจากข้อความเต็ม โดยใช้ข้อความเขียนเป็นข้อมูลป้อนเข้าเพียงอย่างเดียว และระบบจะสร้างผลลัพธ์ทางภาพทั้งหมดขึ้นมาเอง ยังคงเป็นกระบวนการที่ต้องการความเชี่ยวชาญทางเทคนิคสูงที่สุดและมีคุณภาพแปรผันมากที่สุด เพดานนั้นยอดเยี่ยมมาก พื้นนั้นแปลกประหลาดอย่างแท้จริง ราวกับความฝันอันเพ้อเจ้อแบบอิมเพรสชันนิสต์ ที่ซึ่งฟิสิกส์เป็นเพียงเครื่องประดับ และกายวิภาคศาสตร์นั้นสามารถต่อรองได้
ระบบที่ดีที่สุดที่ผมทดสอบมานั้น สร้างคลิปวิดีโอสั้นๆ ที่มีความสอดคล้องของการเคลื่อนไหวและความคมชัดของภาพ ซึ่งเป็นสิ่งที่ทำไม่ได้เมื่อสองปีก่อน ส่วนระบบที่แย่ที่สุดนั้น สร้างผลลัพธ์ที่น่าสนใจในฐานะสิ่งประดิษฐ์ที่แสดงให้เห็นถึงความล้มเหลวของระบบเหล่านั้น มากกว่าที่จะเป็นเนื้อหาที่มีประโยชน์ ช่วงความแตกต่างภายในสเปกตรัมนั้นกว้างใหญ่มาก และการสำรวจความแตกต่างเหล่านั้นเป็นหนึ่งในสิ่งที่เรากำลังสร้างเว็บไซต์นี้ขึ้นมาเพื่อช่วยเหลือ
การแปลงภาพเป็นวิดีโอ: การทำงานโดยใช้สิ่งที่มีอยู่แล้ว
การสร้างภาพเคลื่อนไหวจากภาพที่มีอยู่แล้วนั้นง่ายกว่าการสร้างทุกอย่างตั้งแต่เริ่มต้นมาก เพราะโครงสร้างภาพของฉากนั้นถูกกำหนดไว้แล้ว หน้าที่ของแบบจำลองไม่ใช่การสร้างโลกขึ้นมาใหม่ แต่เป็นการทำให้โลกนั้นเคลื่อนไหว
วิธีการนี้ให้ผลลัพธ์ที่สม่ำเสมอกว่า โดยเฉพาะอย่างยิ่งสำหรับการสร้างภาพเคลื่อนไหวบุคคลและตัวละคร และเป็นวิธีการที่ใช้ในการสร้างเนื้อหาวิดีโอ AI ที่มีคุณภาพสูงที่สุดที่เผยแพร่อยู่ในปัจจุบันเป็นจำนวนมาก คลิปวิดีโอจำนวนมากที่ดูเป็นมืออาชีพนั้นไม่ได้สร้างขึ้นจากข้อความเพียงอย่างเดียว แต่สร้างขึ้นจากภาพนิ่งที่สร้างโดย AI แล้วจึงนำมาสร้างภาพเคลื่อนไหว ซึ่งเป็นกระบวนการสองขั้นตอนที่ช่วยหลีกเลี่ยงปัญหาความสม่ำเสมอที่ยากที่สุดในการสร้างวิดีโอจากข้อความทั้งหมด
ความสอดคล้องของตัวละคร: ปัญหาที่ยังแก้ไม่ตกซึ่งเป็นหัวใจสำคัญของทุกสิ่ง
หากคุณต้องการเข้าใจว่าความท้าทายทางวิศวกรรมที่แท้จริงในการสร้างวิดีโอด้วย AI ในปัจจุบันอยู่ที่ใด ลองดูที่ความสม่ำเสมอของตัวละคร ความสามารถในการรักษาเอกลักษณ์ของตัวละครที่จดจำได้และคงที่ในคลิปที่สร้างขึ้นหลายๆ คลิป ในฉากและสภาพแสงที่แตกต่างกัน รวมถึงมุมกล้องต่างๆ คือความสามารถที่แยกการสร้างวิดีโอที่มีประโยชน์อย่างแท้จริงออกจากเดโมที่น่าประทับใจแต่มีข้อจำกัด
ระบบส่วนใหญ่ในปัจจุบันไม่สามารถทำเช่นนี้ได้อย่างน่าเชื่อถือ ตัวละครจะเปลี่ยนไปมาระหว่างคลิปในลักษณะที่ทำให้การเล่าเรื่องต่อเนื่องเป็นไปไม่ได้ นี่คือปัญหาที่แพลตฟอร์มที่น่าสนใจที่สุดหลายแห่งในวงการนี้กำลังเร่งแก้ไข และเป็นเกณฑ์ที่ผมให้ความสำคัญมากที่สุดในการประเมินระบบสำหรับการจัดอันดับที่เราจัดทำขึ้นที่นี่
ข้อจำกัดที่แท้จริงของเทคโนโลยีในปัจจุบัน
ความสั้นไม่ใช่ข้อผิดพลาด แต่มันคือสถาปัตยกรรม
ความยาวของคลิปวิดีโอที่ระบบ AI ตัดต่อส่วนใหญ่จะทำได้นั้น อยู่ที่ประมาณสี่ถึงห้านาทีteen ระยะเวลาการแสดงผลที่สอดคล้องกันหลายวินาที ไม่ใช่การเลือกออกแบบโดยพลการ หรือข้อจำกัดทางการค้าที่รอการปลดล็อกด้วยการสมัครสมาชิกแบบพรีเมียม แต่สะท้อนให้เห็นถึงความยากลำบากในการคำนวณอย่างแท้จริงในการรักษาความสม่ำเสมอข้ามเวลาในแบบจำลองวิดีโอแบบสร้างภาพ
แต่ละเฟรมที่เพิ่มเข้ามาเป็นโอกาสอีกครั้งที่ระบบจะสะสมข้อผิดพลาดเล็กๆ น้อยๆ ซึ่งจะสะสมกันจนกลายเป็นความไม่สอดคล้องกันที่เห็นได้ชัด ยิ่งคลิปยาวเท่าไหร่ ปัญหานี้ก็จะยิ่งปรากฏชัดเจนมากขึ้นเท่านั้น ขอบเขตการวิจัยกำลังผลักดันขีดจำกัดนี้ และในปีที่ผ่านมา ผมได้เห็นระบบที่สามารถสร้างเอาต์พุตความยาวสามสิบวินาที ซึ่งเป็นไปไม่ได้เลยหากเป็นคลิปแปดเฟรมteen หลายเดือนก่อน แต่แพลตฟอร์มที่ผู้บริโภคเข้าถึงได้ยังคงทำงานต่ำกว่าขีดจำกัดนั้นมาก และช่องว่างระหว่างสิ่งที่ทำได้ทางเทคนิคกับสิ่งที่เข้าถึงได้อย่างน่าเชื่อถือยังคงมีนัยสำคัญ
ปัญหาเรื่องกายวิภาคศาสตร์เป็นเรื่องจริงและเกิดขึ้นอย่างต่อเนื่อง
มือของมนุษย์ยังคงเป็นตัวบ่งชี้ที่เชื่อถือได้ว่าระบบสร้างวิดีโออยู่ในขั้นตอนการพัฒนาใด การทำให้มือดูสมจริงในเฟรมภาพหลายสิบเฟรม รักษาความสม่ำเสมอของสัดส่วน การเคลื่อนไหวของข้อต่อที่สมจริง และท่าทางพักมือที่เป็นธรรมชาติ ยังคงเป็นสิ่งที่ระบบส่วนใหญ่ไม่สามารถทำได้อย่างน่าเชื่อถือ เช่นเดียวกับสีหน้าท่าทางที่ซับซ้อนขณะเคลื่อนไหว ฟิสิกส์ของเส้นผม และวิธีการกระจายและปรับน้ำหนักของร่างกายอย่างละเอียดอ่อนขณะเคลื่อนไหว
ข้อจำกัดเหล่านี้ปรากฏให้เห็นแตกต่างกันไปขึ้นอยู่กับการใช้งาน สำหรับเนื้อหาที่เป็นนามธรรมหรือมีสไตล์ ข้อจำกัดเหล่านี้มักมองไม่เห็นหรือถูกมองว่าเป็นเพียงทางเลือกด้านสุนทรียศาสตร์ แต่สำหรับสิ่งใดก็ตามที่มุ่งหวังความสมจริงระดับภาพถ่าย ข้อจำกัดเหล่านี้จะปรากฏให้เห็นได้อย่างชัดเจน การทดสอบของฉันใช้ตัวบ่งชี้เหล่านี้เป็นตัวชี้วัดคุณภาพอย่างสม่ำเสมอ เพราะมันมีความสัมพันธ์อย่างน่าเชื่อถือกับความซับซ้อนโดยรวมของความเข้าใจการเคลื่อนไหวในโมเดล
สิ่งที่คุณจ่ายไปจริงๆ แล้วเป็นค่าอะไรเมื่อคุณจ่ายเงิน
ต้นทุนการคำนวณในการสร้างวิดีโอ AI คุณภาพสูงนั้นเป็นเรื่องจริง และส่งผลโดยตรงต่อโครงสร้างราคาของทุกแพลตฟอร์มในด้านนี้ เวลาในการประมวลผลของ GPU นั้นมีราคาแพง การประมวลผลที่ความละเอียดและอัตราเฟรมที่จำเป็นในการสร้างเอาต์พุตวิดีโอที่ใช้งานได้นั้นมีราคาแพงกว่าการสร้างภาพนิ่งอย่างมาก นี่คือเหตุผลที่โมเดลที่ดีที่สุดยังคงถูกจำกัดไว้ด้วยราคาสำหรับองค์กร การเข้าถึงเพื่อการวิจัย หรือข้อกำหนดด้านฮาร์ดแวร์ที่ทำให้ผู้ใช้ส่วนใหญ่เข้าไม่ถึง
นี่คือเหตุผลที่ผมไม่เชื่อมั่นในแพลตฟอร์มที่สัญญาว่าจะสร้างวิดีโอความละเอียดสูงได้ไม่จำกัดในราคาที่ไม่สะท้อนต้นทุนที่แท้จริงในการใช้งานโมเดลเหล่านั้น มักจะมีบางอย่างถูกตัดทอนไป และโดยปกติแล้วมักจะเป็นคุณภาพ ความเร็ว หรือการลงทุนในการฝึกฝน ซึ่งเป็นตัวกำหนดว่าผลลัพธ์ที่ได้จะดีแค่ไหน
เหตุใดปริมาณการค้นหาเกี่ยวกับหัวข้อนี้จึงเป็นเรื่องจริง
กลุ่มคนรุ่นใหม่ที่สร้างภาพลักษณ์เติบโตขึ้นแล้ว
กลุ่มเป้าหมายที่พร้อมที่สุดที่จะนำเทคโนโลยีสร้างวิดีโอด้วย AI มาใช้ คือกลุ่มเป้าหมายเดียวกับที่ใช้เวลาสองปีที่ผ่านมาทำงานกับเทคโนโลยีสร้างภาพด้วย AI พวกเขาเข้าใจหลักการออกแบบการตอบสนองอย่างรวดเร็ว พวกเขามีสัญชาตญาณเกี่ยวกับพฤติกรรมของโมเดล และพวกเขาก็พร้อมสำหรับก้าวต่อไป ความอยากรู้อยากเห็นของพวกเขาเกี่ยวกับสิ่งที่โมเดลวิดีโอสามารถทำได้ โดยเฉพาะอย่างยิ่งโดยปราศจากข้อจำกัดที่เป็นอุปสรรคสำคัญในประสบการณ์การสร้างภาพของพวกเขา เป็นสิ่งที่คาดเดาได้ไม่ยาก
นี่ไม่ใช่กลุ่มเฉพาะกลุ่มใดกลุ่มหนึ่ง ผู้คนนับล้านได้นำการสร้างภาพด้วย AI มาใช้ในกระบวนการทำงานสร้างสรรค์ โครงการส่วนตัว และงานระดับมืออาชีพ เมื่อพวกเขาถามว่าวิดีโอ AI สามารถทำอะไรได้บ้างโดยไม่ต้องใช้ฟิลเตอร์ พวกเขากำลังถามคำถามที่ถูกต้องและมีความสำคัญในทางปฏิบัติอย่างแท้จริง
ชุมชนโอเพนซอร์สในฐานะตัวชี้วัดชั้นนำ
ชุมชน AI แบบโอเพนซอร์สมีจำนวนประมาณแปดคนโดยประมาณteen กลุ่มผู้ใช้งานเหล่านี้ล้ำหน้าตลาดผู้บริโภคไปหลายเดือนในแง่ของความเป็นไปได้ทางเทคนิคและการเข้าถึงสำหรับผู้ใช้งานที่มีความเชี่ยวชาญด้านเทคโนโลยี การติดตามสิ่งที่ชุมชนนี้กำลังสร้างและทดลองอยู่ในขณะนี้ ถือเป็นตัวชี้วัดที่เหมาะสมสำหรับสิ่งที่แพลตฟอร์มกระแสหลักจะนำเสนอในอนาคตอันใกล้
ในขณะนี้ ชุมชนดังกล่าวให้ความสนใจอย่างมากกับการสร้างวิดีโอที่สามารถใช้งานได้ในระดับท้องถิ่น เทคนิคการรักษาความสอดคล้องของตัวละคร และคำถามเฉพาะเจาะจงที่ว่าโมเดลเหล่านี้สามารถสร้างอะไรได้บ้างเมื่อไม่มีข้อจำกัดในระดับแพลตฟอร์ม ความสนใจดังกล่าวเป็นสัญญาณบ่งบอกถึงทิศทางความต้องการของผู้บริโภค ไม่ว่าแพลตฟอร์มกระแสหลักจะตามมาหรือไม่ก็ตาม
งานทดสอบที่อยู่เบื้องหลังเว็บไซต์นี้
ฉันอยากจะพูดตรงๆ เกี่ยวกับสิ่งที่มักถูกมองข้ามในบทวิจารณ์ AI ส่วนใหญ่ นั่นก็คือ การทดสอบระบบเหล่านี้อย่างเข้มงวดนั้นเป็นงานที่สำคัญ ใช้เวลานาน และมีค่าใช้จ่ายสูง การเปรียบเทียบอย่างมีความหมายระหว่างแพลตฟอร์มการสร้างวิดีโอต่างๆ จำเป็นต้องสร้างผลลัพธ์จำนวนมากภายใต้สภาวะที่ควบคุมได้ ประเมินความสม่ำเสมอในรูปแบบคำสั่งและระดับความซับซ้อนต่างๆ และกลับไปตรวจสอบแพลตฟอร์มเหล่านั้นเป็นประจำเมื่อมีการอัปเดตโมเดล
การจัดอันดับและบทวิจารณ์ที่เราเผยแพร่ที่นี่สร้างขึ้นจากผลงานนั้น เราทดสอบอย่างเป็นระบบมากกว่าการใช้ความรู้สึกส่วนตัว เมื่อเราบอกว่าแพลตฟอร์มใดทำงานได้ดีในด้านความสอดคล้องของตัวละคร หรือทำงานได้ไม่ดีในด้านความสมจริงของการเคลื่อนไหว การประเมินนั้นมาจากการประเมินอย่างเป็นระบบในปริมาณผลลัพธ์ที่มากพอที่จะมีความหมาย ไม่ใช่จากตัวอย่างที่เลือกมาเพียงไม่กี่ตัวอย่าง
เรากำลังพัฒนาระบบจัดอันดับที่ครอบคลุมและอัปเดตเป็นประจำสำหรับโปรแกรมสร้างวิดีโอ AI ที่มีเนื้อหาไม่เหมาะสมและไม่เซ็นเซอร์ ซึ่งเป็นหนึ่งในหัวข้อที่มีผู้ร้องขอมากที่สุดและยังไม่ได้รับการตรวจสอบอย่างเข้มงวดเท่าที่ควร ระบบจัดอันดับนี้จะปรากฏบนเว็บไซต์นี้ จะได้รับการอัปเดตเมื่อแพลตฟอร์มต่างๆ พัฒนาขึ้น และจะสร้างขึ้นบนมาตรฐานการทดสอบเดียวกันกับที่เราใช้กับทุกสิ่งทุกอย่างในเว็บไซต์นี้ หากนี่คือสิ่งที่คุณกำลังมองหา ระบบนี้กำลังจะมา และมันจะคุ้มค่ากับการรอคอย
เทคโนโลยีนี้จะก้าวไปในทิศทางไหนกันแน่
การบูรณาการคือขั้นตอนต่อไป
การพัฒนาที่สำคัญที่สุดในระยะสั้นของ AI วิดีโอไม่ใช่การปรับปรุงความสามารถเพียงอย่างเดียว แต่เป็นการผสานรวมเครื่องมือหลายอย่างเข้าด้วยกันในกระบวนการทำงานสร้างสรรค์ที่สอดคล้องกัน ทิศทางในอนาคตคือระบบที่การออกแบบตัวละคร การสร้างสภาพแวดล้อม การพัฒนาบท และการผลิตวิดีโอ ไม่ใช่ขั้นตอนแยกกันที่ต้องใช้เครื่องมือแยกกัน แต่เป็นขั้นตอนที่บูรณาการเข้าด้วยกันในกระบวนการเดียวที่ขับเคลื่อนด้วยภาษาธรรมชาติตลอดทั้งกระบวนการ
ปัจจุบันมีหลายแพลตฟอร์มที่กำลังรวบรวมชิ้นส่วนเหล่านี้เข้าด้วยกัน ผลลัพธ์ในวันนี้ยังไม่สม่ำเสมอ แต่ทิศทางนั้นชัดเจน ภายในระยะเวลาไม่กี่เดือน แทนที่จะเป็นปี แนวคิดของกระบวนการผลิตวิดีโอที่ขับเคลื่อนด้วย AI อย่างครบวงจรจะเปลี่ยนจากความปรารถนาไปสู่สิ่งที่ใช้งานได้จริงเพื่อวัตถุประสงค์เชิงสร้างสรรค์
แรงกดดันด้านกฎระเบียบเป็นเรื่องเชิงโครงสร้าง ไม่ใช่ชั่วคราว
ความเคลื่อนไหวทางด้านกฎหมายและข้อบังคับเกี่ยวกับเนื้อหาที่สร้างโดย AI ไม่ใช่ปฏิกิริยาชั่วคราวต่อเหตุการณ์สำคัญเพียงไม่กี่เหตุการณ์ แต่เป็นการเปลี่ยนแปลงเชิงโครงสร้างในวิธีการที่รัฐบาลและระบบกฎหมายใช้ในการจัดการกับสื่อสังเคราะห์ ซึ่งจะเปลี่ยนแปลงสภาพแวดล้อมการทำงานของแพลตฟอร์มวิดีโอ AI อย่างถาวร
แพลตฟอร์มที่ถือว่าสถาปัตยกรรมด้านความปลอดภัยเป็นข้อกำหนดพื้นฐานในการออกแบบ จะสามารถทำงานได้อย่างยั่งยืนในสภาพแวดล้อมนั้นมากกว่าแพลตฟอร์มที่ถือว่าความปลอดภัยเป็นเพียงข้อจำกัดที่ต้องลดให้เหลือน้อยที่สุด
นี่ไม่ได้หมายความว่าเครื่องมือ AI สำหรับวิดีโอที่มีข้อจำกัดน้อยกว่าจะหายไป แต่หมายความว่าเครื่องมือที่จะอยู่รอดและเติบโตได้นั้นจะเป็นเครื่องมือที่เลือกอย่างรอบคอบว่าจะอนุญาตหรือไม่อนุญาตอะไรบ้าง มากกว่าเครื่องมือที่แค่ปิดตัวกรองแล้วรอว่าจะเกิดอะไรขึ้น
ความแตกต่างระหว่างเสรีภาพในการสร้างสรรค์และการอนุญาตให้ใช้ประโยชน์อย่างไม่เหมาะสม คือคำถามสำคัญที่เทคโนโลยีนี้จะต้องหาคำตอบต่อสาธารณชนในอนาคตอันใกล้ เราจะติดตามเรื่องนี้อย่างใกล้ชิด