ทำไมวิดีโอ AI จึงแสดงมือและใบหน้าผิด

วิดีโอ AI ที่แสดงมือและใบหน้ามักเกิดข้อผิดพลาด เนื่องจากโมเดลต้องรักษาความสอดคล้องกันของโครงสร้างกายวิภาค ตัวตน แสง ท่าทาง และการเคลื่อนไหวให้คงที่ตลอดหลายเฟรม ไม่ใช่เพียงแค่วาดภาพเดียวให้ดูสมจริง. มือที่ดูเป็นธรรมชาติในเฟรมที่ 20 อาจข้ามผ่านใบหน้าในเฟรมที่ 24 เปลี่ยนระยะห่างระหว่างนิ้วในเฟรมที่ 26 และผสมผสานกับผมในเฟรมที่ 28 ดังนั้น โมเดลจึงต้องแก้ไขพื้นที่ที่ไม่ชัดเจนหลายแห่งพร้อมกัน.

เราได้ทดสอบคำสั่งสั้นแบบ “friendly-wave” กับคำสั่ง “open-palm” ที่มีข้อจำกัดมากกว่ามาก ผ่าน CLI ของ GlobalGPT เวอร์ชันที่มีข้อจำกัดสร้างการเคลื่อนไหวที่สงบกว่าและท่ามือที่อ่านได้ง่ายขึ้น แต่ไม่สามารถรักษาเอกลักษณ์ของบุคคลต้นแบบ เสื้อผ้า ไมโครโฟน หรือห้องไว้ได้ ผลลัพธ์ที่ผสมผสานนี้มีประโยชน์มากกว่าการสาธิตที่สมบูรณ์แบบ เพราะมันแสดงให้เห็นว่าข้อจำกัดของคำสั่งสามารถควบคุมอะไรได้และอะไรไม่ได้.

คลิปวิดีโอสั้น 2 คลิป
ปรับปรุงความชัดเจนของท่าทาง
ไม่รักษาข้อมูลระบุตัวตน
ลองใช้ Top Video Models ได้เลย

ทำไมมือจึงเสื่อมสภาพตามกาลเวลา

มือเป็นวัตถุที่มีข้อต่อและส่วนประกอบเล็กๆ จำนวนมาก มักเกิดการบังตัวเองบ่อยครั้ง และรูปทรงมีการเปลี่ยนแปลงอย่างรวดเร็ว มือที่โบกจะหมุน นิ้วมือทับซ้อนกัน ความเบลอจากการเคลื่อนไหวทำให้ขอบดูนุ่มนวล และฝ่ามือเคลื่อนที่สัมพันธ์กับใบหน้า ตัวสร้างภาพต้องสามารถอนุมานโครงสร้าง 3 มิติที่สอดคล้องกันจากทุกมุมมองใหม่ พร้อมทั้งรักษาข้อมูลจากเฟรมก่อนหน้าไว้.

ปัญหาจะปรากฏให้เห็นได้ เช่น นิ้วมือเพิ่มขึ้น นิ้วมือติดกัน ตำแหน่งเล็บเปลี่ยนไป ข้อมือมีลักษณะนุ่มเหมือนยาง หรือมือที่เปลี่ยนข้างได้ ปัญหาที่กว้างขึ้น การวินิจฉัยข้อผิดพลาดในวิดีโอด้วย AI ช่วยแยกความผิดพลาดด้านกายวิภาคออกจากความผิดพลาดด้านกล้อง ฟิสิกส์ และความต่อเนื่อง.

ทำไมใบหน้าถึงดูเบลอ แม้เฟรมหนึ่งจะดูดี

ใบหน้ามีความไวต่อการเปลี่ยนแปลงเล็กน้อยในระยะห่างระหว่างตา รูปทรงของเปลือกตา มุมปาก ความกว้างของจมูก และเส้นผม การพูดและการแสดงออกทางสีหน้าทำให้จุดสังเกตเหล่านี้เคลื่อนไหวอย่างต่อเนื่อง หากใบหน้าดูเล็กลง หันหน้าไปทางอื่น อยู่ในเงา หรือถูกมือบังบางส่วน ระบบจะมีความข้อมูลน้อยลง และอาจต้องวาดภาพระบุตัวตนใหม่.

นั่นคือเหตุผลที่ กระบวนการทำงานเพื่อรักษาความสม่ำเสมอของวิดีโอด้วย AI มองความเสถียรของตัวละครเป็นปัญหาเกี่ยวกับลำดับภาพ ภาพแรกที่ชัดเจนจะช่วยได้ แต่คำสั่ง คำแนะนำ กล้อง ระยะเวลา และการเคลื่อนไหว ก็ต้องช่วยรักษาสัญญาณเอกลักษณ์ด้วย.

การทดสอบพื้นฐานและการทดสอบภายใต้ข้อจำกัดของเรา

ทั้งสองครั้งใช้ภาพต้นแบบเดียวกันและเส้นทาง Imagine Grok ที่ความละเอียด 1280×720 เป็นเวลาประมาณ 5 วินาที ในแบบทดสอบพื้นฐาน ผู้หญิงถูกขอให้หันหน้ามาทางกล้องและโบกมือ ส่วนคำสั่งที่มีข้อจำกัดได้ระบุให้ใช้มือขวา แยกนิ้วทั้งห้าให้ชัดเจน วางมือไว้ข้างไหล่ ห้ามให้ใบหน้าถูกปิดบัง จำกัดการเคลื่อนไหวของศีรษะ และล็อกกล้อง.

แต่ละงานมีค่าใช้จ่าย 500 เครดิต นี่เป็นการสังเกตแบบ A/B โดยดำเนินการหนึ่งครั้งต่อคำสั่ง ไม่ใช่การทดลองที่มีการควบคุมทางสถิติ เราได้เลือกตัวอย่างจากช่วงเวลาที่กำหนดไว้ และตรวจสอบวิดีโอด้วยความเร็วปกติ.

การรันแบบพื้นฐานหนึ่งครั้ง คลื่นมีพลัง แต่บุคคลและห้องที่สร้างขึ้นมีความแตกต่างอย่างมากจากภาพต้นแบบ.
การรันหนึ่งครั้งภายใต้ข้อจำกัด การเคลื่อนไหวดูสงบลงและท่ามือชัดเจนขึ้น แต่การรักษาเอกลักษณ์ยังคงล้มเหลว.
เฟรมตัวอย่างที่เปรียบเทียบคลื่นพื้นฐานกับท่ามือเปิดที่จำกัด
การสังเกตการณ์สองครั้งในรอบเดียว การจำกัดเงื่อนไขได้ส่งผลให้มีการเปลี่ยนแปลงทั้งในด้านการเคลื่อนไหวทันทีและองค์ประกอบ แต่คู่ข้อมูลนี้ไม่สามารถพิสูจน์ได้ว่ามีผลเชิงสาเหตุที่เป็นสากล.

ผลเบื้องต้น: การเคลื่อนไหวที่สดใส, การเปลี่ยนแปลงอัตลักษณ์อย่างรุนแรง

ภาพพื้นหลังสร้างคลื่นที่ดูเป็นมิตรและเต็มไปด้วยพลัง มือที่เปิดออกยังคงมองเห็นได้ชัดเจนในเฟรมที่สุ่มตัวอย่าง แต่ผลลัพธ์ที่ได้แทนที่ตัวละครหลักด้วยผู้หญิงที่มีลักษณะต่างออกไป ซึ่งอยู่ในห้องและสวมชุดที่ต่างกัน การจัดองค์ประกอบเปลี่ยนไปก่อนที่คลื่นนั้นจะกลายเป็นจุดเด่นของฉาก.

ผลลัพธ์ดังกล่าวแสดงให้เห็นว่าทำไมมือที่ดูดีเพียงอย่างเดียวจึงไม่เพียงพอ หากงานนั้นต้องการผู้นำเสนอที่ปรากฏตัวเป็นประจำแล้ว ตัวตนและสภาพแวดล้อมจึงเป็นเกณฑ์การคัดเลือกที่สำคัญ การสร้างตัวละครที่สอดคล้องกันจากภาพถ่ายเพียงภาพเดียว อธิบายถึงการเลือกภาพต้นแบบที่สามารถปรับปรุงข้อมูลอ้างอิงเริ่มต้นได้ แต่ผลวิจัยของเราแสดงให้เห็นว่าภาพต้นแบบเพียงอย่างเดียวไม่สามารถรับประกันความต่อเนื่องได้.

ผลลัพธ์ภายใต้ข้อจำกัด: ท่าทางดีขึ้น แต่ข้อมูลระบุตัวยังคงสูญหาย

ท่าทางที่ถูกจำกัดนั้นเคลื่อนไหวช้าลง มือถูกวางไว้ข้างหัว และรักษาท่ามือเปิดที่ดูสะอาดตา มือไม่กวาดผ่านหน้า ความแตกต่างเหล่านี้ทำให้ท่าทางนั้นสังเกตได้ง่ายขึ้น และจะช่วยให้การแก้ไขง่ายขึ้น.

อย่างไรก็ตาม ตัวบุคคล เสื้อผ้า ไมโครโฟน และห้องยังคงมีการเปลี่ยนแปลงอย่างน่าสังเกต คำสั่งให้รักษาลักษณะเดิมอย่างแม่นยำ แต่โมเดลไม่สามารถทำได้ตามนั้น เราสามารถกล่าวได้ว่าการรันแบบจำกัดช่วยปรับปรุงความชัดเจนของท่าทางในคู่นี้ แต่เราไม่สามารถกล่าวได้ว่ามันแก้ไขปัญหาด้านกายวิภาคได้อย่างทั่วถึง หรือรักษาเอกลักษณ์ไว้ได้.

เขียนหัวข้อการเขียนเกี่ยวกับความมองเห็นและการเคลื่อนไหว

คำสั่งด้วยมือที่มีประโยชน์จะระบุส่วนร่างกายหนึ่งส่วน การเคลื่อนไหวหนึ่งครั้ง ท่าทางหนึ่งท่า และระยะเวลาหนึ่งช่วง “ยกมือขวาขึ้น แสดงฝ่ามือที่เปิดอยู่ข้างไหล่ ถือไว้หนึ่งวินาที แล้วลดมือลง” เป็นคำสั่งที่สามารถตรวจสอบได้ ส่วน “ทำท่าทางอย่างเป็นธรรมชาติขณะพูดด้วยความตื่นเต้น” กลับไม่ระบุข้อต่อ ความเร็ว และช่วงที่มือปิดปากอย่างชัดเจน.

การเคลื่อนไหวของกล้องก็สำคัญเช่นกัน ให้ล็อกกล้องไว้ ให้มือทั้งมืออยู่ภายในกรอบภาพ และหลีกเลี่ยงการซูมอย่างกะทันหันระหว่างการเคลื่อนไหวมือ การควบคุมกล้องและสัญญาณเตือนการเคลื่อนไหว ให้คำศัพท์ที่กว้างขึ้นสำหรับระบบควบคุมกล้องและระบบควบคุมการเคลื่อนไหว ส่วน เทคนิคการให้คำกระตุ้นผ่านการเคลื่อนไหว Veo เพิ่มเทคนิคการให้คำสั่งที่เฉพาะสำหรับ Veo.

ปกป้องใบหน้าก่อนที่จะเพิ่มประสิทธิภาพ

ให้ใบหน้ามีขนาดใหญ่พอที่จะอ่านได้ชัดเจน จำกัดการหันหัว การแสดงสีหน้าที่เกินจริง และการไขว้มือในช่วงเวลาสำคัญที่แสดงถึงตัวตน ขอให้มีการกระพริบตาอย่างละเอียดและเคลื่อนไหวปากเล็กน้อย ก่อนที่จะรวมบทสนทนา อุปกรณ์ประกอบฉาก และกล้องที่เคลื่อนไหวเข้าด้วยกัน ให้เพิ่มความซับซ้อนก็ต่อเมื่อช็อตที่เรียบง่ายที่สุดผ่านไปแล้วเท่านั้น.

สำหรับลำดับภาพที่ยาว ให้แบ่งการแสดงออกเป็นช็อตต่าง ๆ ที่มีเฟรมเริ่มต้นและเฟรมสิ้นสุดที่คงที่ ความสม่ำเสมอของตัวละครในวิดีโอที่ยาว อธิบายว่าทำไมการรักษาความต่อเนื่องของตัวละครจึงยากขึ้นเมื่อคลิปวิดีโอสะสมมากขึ้น และว่าผู้ดำเนินรายการช่วยได้อย่างไรในการตัดต่อ.

สร้างกรอบแหล่งข้อมูลที่ดีขึ้น

ใช้ภาพที่คมชัดและแสงส่องสม่ำเสมอ โดยทั้งสองตาต้องมองเห็นได้ชัดเจน รูปทรงเส้นผมต้องชัดเจน และมือต้องมองเห็นได้ทั้งหมด หรืออยู่นอกกรอบภาพโดยสิ้นเชิง หลีกเลี่ยงการตัดนิ้วมือด้วยขอบกรอบภาพ การใช้ฟิลเตอร์ความงามที่มากเกินไป การเบลอจากการเคลื่อนไหวที่รุนแรง และพื้นหลังที่มีลวดลายที่ตัดผ่านร่างกาย.

กรอบภาพต้นแบบควรสอดคล้องกับองค์ประกอบวิดีโอที่ต้องการด้วย การขอให้ภาพพอร์ตเรตระยะใกล้กลายเป็นภาพคลื่นแบบครึ่งตัวบน จะทำให้ผู้แบบต้องจินตนาการแขน มือ เสื้อผ้า และรายละเอียดของห้องขึ้นพร้อมกัน ดังนั้น ควรสร้างหรือถ่ายภาพกรอบภาพที่จำเป็นก่อนเริ่มทำแอนิเมชัน.

แก้ไขข้อผิดพลาดในขั้นตอนการคัดกรอง แทนที่จะเขียนใหม่ทั้งหมด

  • หากนิ้วมือติดกัน ให้ลดความเร็วของท่าทางลง และแยกมือออกจากใบหน้าหรือร่างกาย.
  • หากการเคลื่อนไหวของใบหน้าไม่ตรงกับภาพต้นแบบ ให้ลดการหมุนหัว ช่วงการเคลื่อนไหวของใบหน้า และระยะเวลาของคลิป.
  • หากข้อมือโค้งงออย่างผิดปกติ ให้ลดความซับซ้อนของเส้นทางการเคลื่อนไหวของมือ และยกเลิกการโต้ตอบกับอุปกรณ์สนับสนุน.
  • หากพื้นหลังเปลี่ยนแปลง ให้ล็อคกล้องและกำหนดจุดอ้างอิงของฉากที่คงที่.
  • หากมีความผิดพลาดหลายอย่างเกิดขึ้นพร้อมกัน ให้กลับไปยังเฟรมต้นทางที่สะอาดกว่า.

ข้อผิดพลาดทั่วไปในการสร้างวิดีโอด้วย AI ระบุข้อผิดพลาดในการวางแผนที่พบบ่อย ซึ่งมักก่อให้เกิดความล้มเหลวที่ทวีความรุนแรงขึ้น.

ข้อความพื้นฐานที่สามารถคัดลอกได้และข้อความคำสั่งที่มีข้อจำกัด

ลองรันเบสไลน์สั้นก่อน เพื่อดูว่าโมเดลจะเลือกอะไรโดยไม่มีการช่วยเหลือ จากนั้นเปลี่ยนเฉพาะข้อจำกัดการเคลื่อนไหวเท่านั้น โดยรักษาโมเดล แหล่งข้อมูล ระยะเวลา และอัตราส่วนภาพไว้ การทำเช่นนี้จะช่วยให้การเปรียบเทียบเข้าใจได้ง่ายขึ้น แม้ว่าตัวอย่างเพียงสองตัวอย่างจะไม่สามารถพิสูจน์ความสัมพันธ์เชิงสาเหตุได้.

คำสั่งการเคลื่อนไหวพื้นฐาน
คำสั่งที่มีข้อจำกัดเกี่ยวกับมือและใบหน้า

ดูทีละเฟรม แล้วดูด้วยความเร็วปกติ

การเล่นวิดีโอด้วยความเร็วปกติจะช่วยให้ทราบได้ว่าการเคลื่อนไหวดูเป็นธรรมชาติหรือไม่ การดูภาพทีละเฟรมจะช่วยให้เห็นได้เมื่อโครงสร้างร่างกายหรือลักษณะเฉพาะตัวเริ่มผิดเพี้ยน ตรวจสอบจุดเริ่มต้น ท่าทางสูงสุด จุดที่ร่างกายถูกบัง และท่าทางเมื่อกลับสู่จุดเริ่มต้น ดูทั้งสองมือ ไม่ใช่แค่มือที่โบกเท่านั้น และเปรียบเทียบรูปตาและมุมปากกับต้นฉบับ.

บันทึกเฟรมที่มีปัญหาตั้งแต่ต้นที่สุด สิ่งนี้จะช่วยให้คุณตัดสินใจได้ว่าควรเปลี่ยนแหล่งที่มา ย่อความยาวของช็อต หรือจำกัดการเปลี่ยนฉากเฉพาะจุดใด การบันทึกแบบคลุมเครือว่า “ดูแปลกๆ” จะทำให้ยากที่จะเปลี่ยนเป็นคำแนะนำที่ชัดเจนขึ้น.

มองการปิดกั้นเป็นความเสี่ยงในการผลิต

การปิดบังเกิดขึ้นเมื่อวัตถุหนึ่งปิดบังวัตถุอีกชิ้น: เช่น นิ้วมือปิดหน้า, ผมปิดตา, อุปกรณ์ประกอบฉากปิดข้อมือ หรือร่างกายหันหน้าออกจากกล้อง โครงสร้างที่ถูกปิดบังนั้นยังคงต้องถูกอนุมาน และโมเดลอาจแสดงมันกลับมาด้วยรูปทรงที่ต่างออกไป การเคลื่อนไหวที่เร็วทำให้การอนุมานนั้นยากขึ้น เนื่องจากเฟรมที่อยู่ติดกันให้ข้อมูลหลักฐานที่เสถียรน้อยลง.

จัดท่าทางให้ส่วนสำคัญของร่างกายยังคงมองเห็นได้ชัดเจน วางมือไว้ข้างใบหน้าแทนที่จะอยู่ด้านหน้าใบหน้า ให้อุปกรณ์ประกอบฉากอยู่ห่างจากข้อนิ้ว หากการสัมผัสเป็นสิ่งจำเป็น ให้แบ่งท่าทางออกเป็นฉากการเข้าใกล้ ฉากการสัมผัส และฉากการปล่อย แล้วตัดต่อเข้าด้วยกัน วิธีนี้จะช่วยลดจำนวนการเปลี่ยนฉากที่ซับซ้อน ซึ่งระบบต้องประมวลผล.

ทำซ้ำการทดสอบก่อนที่จะสรุปผลแบบทั่วไป

คลิปทั้งสองคลิปของเราเป็นข้อมูลสังเกตที่มีประโยชน์ แต่ค่า seed เดียวอาจทำให้ผลลัพธ์ของ prompt ดีขึ้นหรือแย่ลงได้ สำหรับการเลือกโมเดลที่เหมาะสม ควรลองใช้ prompt แต่ละข้อซ้ำหลายครั้งด้วยแหล่งข้อมูลและตั้งค่าเดียวกัน ให้ประเมินคะแนนความอ่านได้ของข้อความด้วยมือ ความสอดคล้องของตัวตน ฉากหลัง การทำงานของกล้อง และการดำเนินการให้เสร็จสมบูรณ์อย่างแยกกัน และบันทึกผลลัพธ์ที่ถูกปฏิเสธไว้ในบันทึก.

การทดสอบซ้ำสามารถช่วยเปิดเผยได้ว่าคำสั่งที่มีข้อจำกัดนั้นช่วยเพิ่มโอกาสที่จะได้ท่าทางที่ใช้งานได้จริง หรือเพียงแต่สร้างตัวอย่างที่โชคดีเพียงหนึ่งเดียวเท่านั้น นอกจากนี้ยังช่วยแสดงให้เห็นถึงการแลกเปลี่ยนกัน: การควบคุมการเคลื่อนไหวที่เข้มงวดขึ้นอาจทำให้การแสดงออกลดลง หรือทำให้การแสดงดูแข็งกระด้างขึ้น ดังนั้นควรเลือกความสมดุลที่เหมาะสมกับฉากนั้น แทนที่จะพยายามตามหาเฟรมที่สมบูรณ์แบบเพียงเฟรมเดียว.

รู้เมื่อใดควรแก้ไขและเมื่อใดควรสร้างใหม่

แก้ไขจุดบกพร่องเล็กๆ เมื่อการระบุตัวตน การเคลื่อนไหว และมุมกล้องยังดีอยู่ การตัดฉากสั้นๆ สามารถซ่อนการพับนิ้วที่เกิดขึ้นในสองเฟรมได้ ส่วนการตัดต่อให้กระชับขึ้นสามารถลบท่าทางกลับตัวที่ไม่ดีได้ สร้างใหม่เมื่อใบหน้าเปลี่ยนแปลงไปตลอดทั้งคลิป มือที่ผิดทำท่าทาง พื้นหลังเปลี่ยนไป หรือโครงสร้างร่างกายผิดเพี้ยนในหลายเฟรม.

อย่าเสียเวลาหนึ่งชั่วโมงไปกับการแก้ไขคลิปที่ขัดกับข้อกำหนดหลักของโครงการ ในทางกลับกัน ก็อย่าทิ้งผลงานที่ยอดเยี่ยมไปเพียงเพราะปัญหาเล็กน้อยที่สามารถแก้ไขได้ด้วยการตัดต่อปกติ รายการตรวจสอบการรับงานควรแยกแยะข้อผิดพลาดที่ร้ายแรงออกจากข้อบกพร่องที่สามารถแก้ไขได้ ก่อนที่จะเริ่มการตรวจสอบ.

ใช้รายการตรวจสอบการยอมรับการเคลื่อนไหวของมนุษย์

สำหรับทุกเทค ให้ให้คะแนน 5 ด้านอย่างแยกกัน ได้แก่: ตัวตน, โครงสร้างร่างกาย, การเคลื่อนไหว, กล้อง และฉาก ตัวตน ครอบคลุมสัดส่วนใบหน้า, ผม และเสื้อผ้า โครงสร้างร่างกาย ครอบคลุมนิ้วมือ, ข้อมือ, ข้อศอก, ฟัน และการเคลื่อนไหวของตา การเคลื่อนไหว ตรวจสอบว่าการเคลื่อนไหวที่ขอไว้เริ่มต้น, ถึงจุดสูงสุด และสิ้นสุดอย่างถูกต้องหรือไม่ กล้อง ครอบคลุมการจัดกรอบภาพและการเคลื่อนไหวที่ไม่ต้องการ ฉาก ครอบคลุมความต่อเนื่องของอุปกรณ์ประกอบฉาก, ฉากหลัง และแสง.

ให้ทำเครื่องหมายแต่ละส่วนว่าผ่าน, สามารถแก้ไขได้ หรือถูกปฏิเสธ ผลที่ "สามารถแก้ไขได้" อาจมีเฟรมที่ผิดปกติเพียงช่วงสั้นๆ ซึ่งสามารถตัดออกได้โดยไม่ทำให้ความหมายเปลี่ยนแปลง ส่วนที่ "ถูกปฏิเสธ" มีปัญหาการเบี่ยงเบนของตัวตนที่ต่อเนื่อง, การพับมือที่ซ้ำๆ หรือการขาดการกระทำ การจัดประเภทนี้ช่วยป้องกันไม่ให้คลิปที่ดูดีทางภาพหลุดผ่านไปได้โดยมีข้อผิดพลาดด้านความต่อเนื่องที่ร้ายแรง.

ตรวจสอบเสียงอย่างแยกต่างหาก แม้บทความจะเน้นไปที่ใบหน้าและมือก็ตาม เสียงที่ไม่คาดคิด ความผิดปกติของเสียงพูด หรือแทร็กที่ขาดหายไป อาจทำให้เทคที่ดูดีทางภาพไม่สามารถใช้งานได้ ไฟล์ที่ผ่านการตรวจสอบตามข้อกำหนดการส่งมอบทั้งหมดคือไฟล์ที่ผ่านการตรวจสอบขั้นสุดท้าย ไม่ใช่ภาพนิ่งที่ดูดีที่สุดบนแผ่นติดต่อ.

ข้อสรุปในทางปฏิบัติ

คำสั่งที่มีข้อจำกัดของเราสร้างท่าทางมือที่ดูสงบและอ่านได้ง่ายกว่าแบบพื้นฐาน แต่ผลลัพธ์ทั้งสองเปลี่ยนลักษณะตัวตนไปอย่างชัดเจน การปรับแต่งคำสั่งช่วยปรับปรุงในด้านหนึ่งเท่านั้น โดยยังไม่สามารถแก้ไขปัญหาความต่อเนื่องโดยรวมได้.

วิธีการที่พร้อมสำหรับการผลิตจริงประกอบด้วยการจัดวางแหล่งภาพอย่างเหมาะสม การกระทำที่ควบคุมได้ กล้องที่มั่นคง ตัวอย่างที่ถ่ายซ้ำหลายครั้ง และรายการตรวจสอบการรับมอบที่เขียนไว้ เมื่อผู้แสดงต้องพูดหรือใช้ของประกอบฉาก ให้แสดงพฤติกรรมเหล่านั้นในฉากสั้นๆ แยกกันก่อนที่จะรวมเข้าด้วยกัน ความซับซ้อนควรเกิดขึ้นจากการทดสอบที่ประสบความสำเร็จ.

อย่าตัดสินท่ามือจากภาพสุดท้ายเพียงอย่างเดียว ให้สังเกตเส้นทางทั้งหมดตั้งแต่เริ่มทำท่าจนถึงสิ้นสุด แล้วเปรียบเทียบใบหน้ากับต้นแบบ ฝ่ามือที่เรียบเนียนไม่สามารถชดเชยได้หากเป็นบุคคลที่ต่างออกไป และใบหน้าที่มั่นคงก็ไม่สามารถชดเชยได้หากข้อมือทรุดตัวลงระหว่างการเคลื่อนไหว.

เปรียบเทียบเส้นทางวิดีโอใน GlobalGPT เมื่อภาพถ่ายไม่สำเร็จ ให้เปลี่ยนตัวแปรทีละตัว และบันทึกแหล่งที่มา การตั้งค่า และเหตุผลที่ภาพถูกปฏิเสธไว้เสมอ มือและใบหน้าที่ดูดีขึ้นเกิดจากการลดความไม่แน่นอนในทั้งกระบวนการ ไม่ใช่จากการเพิ่ม “โครงสร้างกายวิภาคที่สมบูรณ์แบบ” ลงในคำสั่งที่ซับซ้อนเกินไป.

สำหรับการทดสอบครั้งต่อไป ให้ทำซ้ำคำสั่งทั้งสองหลายครั้งด้วยแหล่งข้อมูลเดียวกัน และให้ให้คะแนนด้านอัตลักษณ์ โครงสร้างร่างกาย การเคลื่อนไหว กล้อง และฉากอย่างแยกกัน ตัวอย่างขนาดเล็กนี้จะแสดงให้เห็นว่าคำสั่งที่มีข้อจำกัดนั้นช่วยเพิ่มอัตราการเก็บภาพที่ดีได้จริง หรือเพียงแค่ให้ผลลัพธ์ที่ดีโดยบังเอิญเท่านั้น รักษาการเคลื่อนไหวให้สั้นและชัดเจนจนกระทั่งท่าทางหลักคงที่ จากนั้นเพิ่มคำพูด อุปกรณ์ประกอบฉาก หรือการเคลื่อนไหวของกล้องทีละอย่าง โดยเก็บรักษาเวอร์ชันที่สะอาดของทุกขั้นตอนที่ผ่านการตรวจสอบ.

คำถามที่พบบ่อย

ทำไมมือในวิดีโอ AI จึงมีนิ้วเพิ่มเติม?

การเคลื่อนไหวที่รวดเร็ว การปิดกั้นตัวเอง การเบลอจากการเคลื่อนไหว และการเปลี่ยนมุมมอง ทำให้โครงสร้างของนิ้วมือไม่ชัดเจนระหว่างเฟรมต่าง ๆ โมเดลอาจวาดมือใหม่ในรูปแบบที่ต่างกันเมื่อมือเคลื่อนไหว.

ทำไมใบหน้าจึงเปลี่ยนไปในวิดีโอ AI?

ใบหน้าขนาดเล็ก การหันหัว สีหน้า เงา และการบดบัง ทำให้สัญญาณระบุตัวตนอ่อนลง จากนั้น ตัวสร้างจะสร้างจุดอ้างอิงบนใบหน้าขึ้นใหม่ แทนที่จะรักษาจุดเหล่านั้นไว้อย่างแม่นยำ.

คำสั่งที่ดีขึ้นจะช่วยแก้ปัญหา AI Hands ได้หรือไม่?

คำสั่งที่มีข้อจำกัดสามารถลดการเคลื่อนไหวและการบังกัน ซึ่งช่วยปรับปรุงความชัดเจนในการอ่านผลในทดสอบครั้งเดียวของเรา อย่างไรก็ตาม มันไม่สามารถรับประกันความถูกต้องของโครงสร้างกายวิภาคในทุกโมเดลหรือทุกครั้งที่รันได้.

ภาพอ้างอิงจะรับประกันความสอดคล้องของตัวตนได้หรือไม่?

ไม่ครับ แหล่งข้อมูลที่แม่นยำช่วยได้ แต่โมเดลวิดีโออาจยังคงปรับเปลี่ยนบุคคล เสื้อผ้า ห้อง หรือการจัดวางกล้องได้ระหว่างการเคลื่อนไหว.

การเคลื่อนไหวของกล้องแบบใดที่ปลอดภัยที่สุดสำหรับใบหน้าและมือ?

การตั้งกล้องให้คงที่ด้วยมุมมองระดับกลางหรือระดับเอวขึ้นไปเป็นจุดเริ่มต้นที่ปลอดภัยที่สุด ให้เพิ่มการแพนกล้อง การซูม หรือการหมุนกล้องรอบวัตถุได้ก็ต่อเมื่อการเคลื่อนไหวพื้นฐานนั้นผ่านไปแล้ว.

หากการถ่ายภาพไม่สำเร็จซ้ำๆ ผมสามารถเปลี่ยนรุ่นได้ไหม?

ใช่ครับ GlobalGPT ช่วยให้คุณสามารถเปรียบเทียบเส้นทางวิดีโอที่มีอยู่ได้ โดยรักษาแหล่งข้อมูลและเกณฑ์การยอมรับให้คงที่ เพื่อที่คุณจะสามารถประเมินได้ว่าการเปลี่ยนแปลงโมเดลนั้นมีประโยชน์จริงหรือไม่.

แชร์โพสต์:

โพสต์ที่เกี่ยวข้อง

วิธีสร้างภาพสำหรับบล็อกด้วย AI ที่ช่วยเพิ่มประสิทธิภาพการค้นหาและดึงดูดผู้อ่าน

เรียนรู้วิธีสร้างภาพสำหรับบล็อกด้วย AI โดยใช้แหล่งข้อมูลล่าสุด การทดสอบในทางปฏิบัติ ข้อจำกัดที่ชัดเจน และขั้นตอนที่ปลอดภัยยิ่งขึ้น ตั้งแต่การทดลองครั้งแรกจนถึงขั้นตอนการผลิต.

อ่านเพิ่มเติม

แพ็กเกจวิดีโอ AI ไม่จำกัดรายปี: สิ่งที่ "ไม่จำกัด" ครอบคลุมจริง ๆ คืออะไร

เรียนรู้แพ็กเกจวิดีโอ AI แบบไม่จำกัดต่อปี พร้อมแหล่งข้อมูลล่าสุด การทดสอบในทางปฏิบัติ ข้อจำกัดที่ชัดเจน และเส้นทางที่ปลอดภัยยิ่งขึ้น ตั้งแต่การทดลองครั้งแรกจนถึงขั้นตอนการผลิต.

อ่านเพิ่มเติม

ตัวเลือกแทน GPT Live 1: Live Voice, Chat Plus TTS และแพ็กเกจวิดีโอ

เรียนรู้ทางเลือกอื่น ๆ ของ GPT Live 1 ด้วยแหล่งข้อมูลล่าสุด การทดสอบในทางปฏิบัติ ข้อจำกัดที่ชัดเจน และเส้นทางที่ปลอดภัยยิ่งขึ้น ตั้งแต่การทดลองครั้งแรกจนถึงการนำไปใช้งานจริง.

อ่านเพิ่มเติม

วิธีตั้งค่าเอเย่นต์ AI เสียงใน Freshcaller และเชื่อมต่อกับ Freshdesk

เรียนรู้วิธีตั้งค่า Freshdesk Voice AI Agents และ Freshcaller ด้วยแหล่งข้อมูลล่าสุด การทดสอบในทางปฏิบัติ ข้อจำกัดที่ชัดเจน และขั้นตอนที่ปลอดภัยยิ่งขึ้น ตั้งแต่การทดลองใช้ครั้งแรกจนถึงการตั้งค่า Freshdesk Voice AI Agents.

อ่านเพิ่มเติม