NEWสร้าง โมเดล 3D จากข้อความหรือรูปภาพ — พร้อมริกกิ้ง แอนิเมชัน และส่งออกไฟล์ลองใช้ 3D
PopcraftPopcraft
A dot plot of integrated loudness across four scenes. The four text-to-speech readings sit inside a spread of half a loudness unit; the four readings from the finished clip's audio spread across 9.4.
ผลิตภัณฑ์อ่าน 2 นาที

ทำไมพิธีกร AI ของคุณถึงฟังดูเหมือนคนละคนในทุกคลิป

สรุปสั้นๆ หากเสียงพิธีกร AI ของคุณเปลี่ยนไปในแต่ละคลิป ปัญหาน่าจะไม่อยู่ที่ text-to-speech แต่อยู่ที่โมเดลวิดีโอ Seedance 2.5 จะสร้างเสียงพากย์ของคุณใหม่ในทุกเทค และเลือกสภาพเสียงห้องจากขนาดช็อต ปรับมาตรฐานความดังไปยังเป้าหมายเดียว รักษาระยะช็อตของการพูดให้เท่ากันทุกครั้ง และเมื่อจำเป็นต้องรักษาไฟล์เสียงต้นฉบับไว้ ให้สร้างด้วย Wan 3.0 ซึ่งส่งผ่านเสียงของเราไปโดยไม่มีการเปลี่ยนแปลง

เราวัดค่า 5 อย่างใน 4 ฉากของวิดีโอสอนที่มีพิธีกรที่สร้างขึ้น และพบว่าระบบ text-to-speech ไม่ได้เป็นต้นเหตุของปัญหา

ผู้หญิงหนึ่งคน ห้องหนึ่งห้อง เสียงหนึ่งเสียง ฟุตเทจความยาวสิบสองนาที ทุกคลิปดูดีเมื่อดูแยกกัน แต่เมื่อนำมาตัดต่อรวมกันเธอก็เสียความสม่ำเสมอ: เสียงสดใสและใกล้ในช็อตหนึ่ง กลับฟังดูอู้อี้และห่างไกลในช็อตถัดไป ราวกับว่าเธอเดินสลับไปมาระหว่างบูธอัดพอดแคสต์กับครัวของใครบางคนกลางประโยค

ทำไมพิธีกร AI ถึงฟังดูต่างไปในทุกคลิป?

เลิกเดากันก่อน การสุ่มสร้างเทคใหม่จนกว่าจะฟังดูดีนั้นเสียค่าใช้จ่ายและไม่ได้บอกอะไรคุณเลย เราจึงวัดค่า 5 อย่างเดียวกันจากต้นฉบับ text-to-speech และจากเสียงที่เสร็จแล้ว ใน 4 ฉาก: ระดับเสียง ความสว่างของสเปกตรัม ความดังแบบ integrated ระดับเสียงรบกวน และระดับเสียงพูด ตารางเดียวก็บอกเรื่องราวทั้งหมดแล้ว

ช่วงความแตกต่างระหว่างฉากต้นฉบับ Text-to-Speechเสียงคลิปที่เสร็จสมบูรณ์
ความดัง0.5 LU9.4 LU
ระดับเสียงพูด2.5 dB8.3 dB
ระดับเสียง (ค่ามัธยฐาน F0)17.3 Hz9.5 Hz
เสียงห้อง (Noise floor)10.6 dB4.8 dB

ช่วงความแตกต่าง = ตั้งแต่ฉากที่ดังที่สุดไปจนถึงเบาที่สุด ระดับเสียงสูงที่สุดไปจนถึงต่ำที่สุด

Text-to-Speech ทำได้เกือบสมบูรณ์แบบ: สี่ฉากอยู่ที่ −14.4, −14.9, −14.8 และ −14.9 LUFS โมเดลวิดีโอให้ค่ากลับมาที่ −21.8, −16.1, −17.7 และ −12.4 ช่วงความแตกต่าง 9.5 เดซิเบลนี้คือสิ่งที่ทำให้ "เธอเสียงเปลี่ยนไปในทุกคัต" อย่างแท้จริง

สังเกตสองแถวที่มีแนวโน้มตรงกันข้าม ระดับเสียงและเสียงห้องมีความสม่ำเสมอมากกว่าหลังจากผ่านโมเดลวิดีโอ สิ่งที่เราคาดเดาว่ามีการเบี่ยงเบนนั้นกลับไม่มีการเบี่ยงเบนเลย

โมเดลวิดีโอใช้เสียงพากย์ของคุณหรือสร้างเสียงใหม่?

บางโมเดลใช้เสียงเดิม บางโมเดลสร้างเสียงใหม่ นี่เป็นข้อค้นพบที่เปลี่ยนกระบวนการทำงานของเรา เราได้ทำการหาค่าสหสัมพันธ์ข้ามระหว่างเสียงต้นฉบับกับเสียงที่ฝังอยู่ในแต่ละคลิปที่เสร็จสมบูรณ์ จากนั้นตรวจสอบว่าความสอดคล้องยังคงอยู่หรือไม่

โมเดลความสัมพันธ์กับต้นฉบับการเบี่ยงเบนตลอดคลิป
Seedance 2.50.30 – 0.55120 – 440 ms
Wan 3.00.82 – 0.950 ms

Wan 3.0 ส่งคืนคลื่นเสียงของคุณกลับมาโดยมีค่าความล่าช้าคงที่ Seedance 2.5 ส่งคืนการแสดงใหม่: โดยอ้างอิงจากต้นฉบับของคุณ ซึ่งเป็นตัวละครเดียวกันอย่างเห็นได้ชัด แต่ถูกสังเคราะห์ใหม่ เมื่อวัดเทียบกับต้นฉบับ มันดึงระดับเสียงลง 0.2 ถึง 1.3 เซมิโทน และทำให้โทนเสียงทุ้มลง 5 ถึง 19 เปอร์เซ็นต์ ซึ่งแตกต่างกันไปในทุกเทค

สำหรับโมเดลที่สร้างเสียงใหม่ มีผลลัพธ์ตามมาสองประการ และทั้งสองประการล้วนสำคัญ

ไม่มีพรอมต์ใดจะแก้ไขได้ ความแปรปรวนเกิดขึ้นภายในกระบวนการสังเคราะห์เสียงของโมเดล ไม่ใช่ในสิ่งที่คุณสามารถอธิบายได้ เราใช้เวลาเขียนคำแนะนำอย่างละเอียดเกี่ยวกับเสียงห้องที่สม่ำเสมอก่อนจะตระหนักว่าเสียงห้องนั้นสม่ำเสมอดีอยู่แล้ว

คุณไม่สามารถสลับเสียงที่สะอาดกลับเข้าไปได้อีก มันดูเหมือนจะเป็นวิธีแก้ไขที่สมบูรณ์แบบ คือเก็บภาพที่ดีไว้ แล้ววางแทร็กเสียงที่สมบูรณ์ของคุณไว้ด้านล่าง แต่ใน Seedance มันล้มเหลว เพราะการขยับปากกำลังติดตามการแสดงของโมเดลเองที่ถูกปรับเวลาใหม่ ซึ่งเบี่ยงเบนไปจากไฟล์ของคุณสูงสุดถึง 440 ms เมื่อสิ้นสุดคลิป

ควรใช้โมเดลใดสำหรับผู้ดำเนินรายการที่พูด?

ตัดสินใจว่าสิ่งใดที่ต้องคงอยู่หลังการสร้าง

  • ไฟล์เสียงที่แน่นอนต้องคงอยู่ — เสียงแบรนด์ที่โคลนมา สคริปต์ที่ต้องพูดถูกต้องทุกคำ หรือเสียงพากย์ที่ลูกค้าอนุมัติแล้ว ใช้ Wan 3.0 เอาต์พุตของมันจะล็อกกับไฟล์ของคุณที่ค่าออฟเซ็ตคงที่ ดังนั้นคุณสามารถลบความล่าช้าและวางแทร็กต้นฉบับกลับไว้ใต้ภาพได้ การอ้างอิงเสียงจำกัดที่ 15 วินาทีต่อคำขอ ดังนั้นให้วางแผนจังหวะการพูดเป็นส่วนๆ ในความยาวดังกล่าว
  • การแสดงสามารถเปลี่ยนแปลงได้ — การอ่านของโมเดลเองนั้นยอมรับได้ และคุณให้ความสำคัญกับภาพมากกว่าคลื่นเสียงที่แน่นอน Seedance 2.5 ก็ใช้ได้ และส่วนที่เหลือของโพสต์นี้จะอธิบายวิธีทำให้เทคของมันสอดคล้องกัน

ไม่ว่าจะด้วยวิธีใด เสียงเองก็เริ่มต้นที่ ตัวสร้าง Text-to-Speech แหล่งที่มาที่สม่ำเสมอคือส่วนเดียวที่ไม่เคยเป็นปัญหา

ทำไมผู้ดำเนินรายการ AI ถึงฟังดูห่างไกลในภาพกว้าง?

โมเดลปรับเสียงห้องให้เข้ากับภาพ ความรู้สึกแบบห้องบันทึกพอดแคสต์เทียบกับห้องครัวนั้นมาจากเสียงห้อง เราจึงวัดอัตราส่วนเสียงตรงต่อเสียงก้อง คือเสียงที่แห้งและใกล้เพียงใดเทียบกับปริมาณเสียงห้องรอบๆ และเวลาการสลายตัวหลังแต่ละประโยค

ฉากการจัดองค์ประกอบความแห้งการสลายตัวของห้อง
จังหวะสารภาพใกล้2.8116 ms
การแนะนำใกล้3.181 ms
การเปิดกว้าง1.3139 ms
การปิดกว้าง0.3209 ms

ภาพกว้างเทียบกับภาพใกล้ของผู้ดำเนินรายการ AI ในห้องเดียวกัน ภาพกว้าง: ความแห้ง 0.3 ถึง 1.3 การสลายตัวของห้อง 139 ถึง 209 ms ภาพใกล้: ความแห้ง 2.8 ถึง 3.1 การสลายตัวของห้อง 81 ถึง 116 ms ตัวเลขถูกวาดขึ้น ไม่ใช่ภาพถ่าย

ภาพกว้างคือภาพที่มีเสียงก้อง ภาพใกล้ทั้งสองเป็นเสียงแห้งและใกล้ชิด โมเดลอนุมานสภาพเสียงจากขนาดภาพ คือคนที่ถ่ายจากอีกฟากของห้องควรจะฟังดูห่างไกลกว่า มันจึงทำให้พวกเขาอยู่ห่างออกไป นั่นเป็นสัญชาตญาณการสร้างภาพยนตร์ที่ดี แต่มันก็มองไม่เห็นจนกว่าคุณจะตัดภาพกว้างต่อกับภาพใกล้ แล้วผู้ดำเนินรายการของคุณก็ดูเหมือนจะวาร์ป

คุณสามารถแก้ไขเสียงวิดีโอ AI ที่ไม่สม่ำเสมอในขั้นตอนหลังการผลิตได้หรือไม่

แก้ไขได้สองในสามส่วน เราสร้างกระบวนการจับคู่และวัดผลอย่างตรงไปตรงมา

ก่อนหลัง
ความแปรปรวนของความดัง9.4 LU0.4 LU
ความแปรปรวนของน้ำเสียง2.9 dB1.1 dB
ความแปรปรวนของเสียงห้อง2.3 dBไม่เปลี่ยนแปลง

การปรับระดับความดังแบบสองรอบไปยังเป้าหมายเดียวจะขจัดปัญหาความดังออกไปได้อย่างสมบูรณ์ วิธีนี้ไม่มีค่าใช้จ่ายและคุณควรทำอยู่แล้ว วัดระดับแต่ละคลิป จากนั้นแก้ไขด้วยค่าที่ได้จากการวัด โดยใช้เป้าหมายเดียวกันสำหรับทุกคลิปในการตัดต่อ:

# pass 1: measure. Read the five measured_* values out of the JSON it prints.
ffmpeg -i clip.mp4 -af loudnorm=I=-14:TP=-1.5:LRA=11:print_format=json -f null -

# pass 2: correct, pasting pass 1's own numbers into the placeholders.
ffmpeg -i clip.mp4 -af loudnorm=I=-14:TP=-1.5:LRA=11:measured_I=<input_i>:measured_TP=<input_tp>:measured_LRA=<input_lra>:measured_thresh=<input_thresh>:offset=<target_offset>:linear=true -c:v copy out.mp4

การใช้ Shelf EQ แบบเบาๆ กับแต่ละคลิปจะช่วยปรับน้ำเสียงให้ใกล้เคียงกันได้อย่างมาก

เสียงก้องเป็นเพียงสิ่งที่ไม่ยอมลดลง เราเพิ่มเสียงห้องขนาดเล็กที่ใช้ร่วมกันให้กับทุกคลิปเพื่อให้มีหางเสียงเดียวกัน แต่กลับทำให้ความแปรปรวน แย่ลง จาก 2.3 dB เป็น 2.9 dB: เสียงก้องที่ใช้ร่วมกันจะไปเพิ่มหางเสียงเดิมของแต่ละคลิปแทนที่จะทดแทนมัน การจับคู่เสียงก้องจะได้ผลเฉพาะเมื่อลดลงโดยการกำจัดมันออก ซึ่งต้องใช้เครื่องมือกำจัดเสียงก้องโดยเฉพาะแทนที่จะเป็นชุดฟิลเตอร์

ดังนั้นคำตอบที่ตรงไปตรงมาสำหรับคำถามที่ว่า "แก้ไขในขั้นตอนหลังการผลิตได้ไหม" คือ: แก้ไขได้สองในสามส่วน และไม่เสียค่าใช้จ่าย ส่วนหนึ่งในสามที่เหลือการป้องกันถูกกว่าการแก้ไข

คุณจะรักษาความสม่ำเสมอของเสียงพิธีกร AI ในแต่ละคลิปได้อย่างไร

การจัดองค์ประกอบภาพอย่างมีวินัย ไม่ใช่เสียง รักษาระยะภาพของการพูดทุกจังหวะให้เท่าเดิม แล้วลักษณะเสียงห้องจะไม่เปลี่ยน เพราะโมเดลจะไม่ถูกขอให้เปลี่ยนมัน

เราพบข้อสรุปเดียวกันจากอีกทิศทางหนึ่ง การนำทุกคลิปผ่านโมเดลทำความเข้าใจวิดีโอเพื่อตรวจสอบคุณภาพ ภาพระยะใกล้ได้คะแนนความตรงกับปาก 7 จาก 10 โดยไม่มีความคลาดเคลื่อน ภาพระยะไกลได้คะแนน 4 ถึง 6 โดยมีความคลาดเคลื่อน 40 ถึง 100 ms คำอธิบายคือ: ในภาพระยะไกลใบหน้าจะเล็ก ทำให้รูปปากดูเบลอ

การวัดผลอิสระสองวิธีให้คำตอบเดียวกัน: ถ่ายพิธีกรที่สร้างขึ้นของคุณในระยะใกล้ และรักษาระยะนั้นไว้ ใช้ภาพระยะไกลสำหรับการเคลื่อนไหว สำหรับห้อง หรือสำหรับทุกสิ่งที่เธอไม่ได้พูด หากคุณต้องการให้เสียงนิ่งยิ่งขึ้นไปอีก ให้ระบุในพรอมต์แทนที่จะปล่อยให้โมเดลคาดเดาเอง ทุกพรอมต์ตอนนี้จะระบุให้เสียงอยู่ใกล้และแห้งสนิทกับไมโครโฟน ราวกับใช้ไมค์หนีบปกเสื้อที่ห่างออกไปหนึ่งช่วงมือ โดยไม่มีเสียงก้องจากห้อง

close and dry to the microphone, as if on a lapel mic a hand's width away, with no room echo

คุณจะตรวจสอบความตรงกับปากของ AI โดยอัตโนมัติได้อย่างไร

ให้โมเดลประเมินแทนคุณ โมเดลทำความเข้าใจวิดีโอสมัยใหม่ ซึ่งเป็นโมเดลมัลติโมดัลปัจจุบันที่รองรับวิดีโอ จะดูคลิปและประเมินความตรงกับปาก ซึ่งเปลี่ยนข้อโต้แย้งเชิงอัตวิสัยให้เป็นเช็กลิสต์ โมเดลของเราตรวจพบพยัญชนะริมฝีปากที่ปิดไม่สนิท ภาพสะท้อนในกระจกพื้นหลังที่ไม่ได้ขยับตามฉากหน้า และการขยิบตาที่ไม่ได้สั่งให้ทำซึ่งโมเดลเพิ่มเข้ามาเอง นอกจากนี้ยังประเมินความคลาดเคลื่อนของเสียงเป็นมิลลิวินาที ซึ่งเป็นตัวเลขที่คุณต้องใช้เพื่อเลือกระหว่างสองวิธี สำหรับการทำงานของโมเดลตรวจสอบความตรงกับปากตั้งแต่แรก ดูที่ อธิบายเทคโนโลยี AI lip sync

ข้อควรระวังหนึ่งข้อ: การเลือกโมเดลสำคัญกว่าที่คุณคิด โมเดลรุ่นเก่าให้คะแนนทุกคลิปเท่ากันที่ 6 จาก 10 และปฏิเสธที่จะประเมินความคลาดเคลื่อน ซึ่งไร้ประโยชน์สำหรับการจัดอันดับ โมเดลรุ่นใหม่แยกแยะได้อย่างชัดเจนและให้ค่าความคลาดเคลื่อนมา หากตัวตรวจสอบของคุณบอกว่าทุกอย่างเหมือนกัน ให้สงสัยตัวตรวจสอบไว้ก่อน

เมื่อตัวตรวจสอบพบจุดบกพร่องหนึ่งจุดในเทคที่ดีอยู่แล้ว ให้แก้ไขคลิปแทนการสร้างใหม่

สรุปสั้นๆ

  • วัดผลก่อนสร้างใหม่ ความแปรปรวนระหว่างฉากจะระบุขั้นตอนที่มีปัญหาในตารางเดียว
  • ข้อความที่แปลงเป็นเสียงของคุณน่าจะไม่ได้เป็นต้นเหตุ
  • โมเดลวิดีโอบางตัวส่งผ่านเสียงของคุณไปเลย บางตัวสร้างเสียงใหม่ Seedance 2.5 สร้างเสียงใหม่ Wan 3.0 ส่งผ่านเสียงของเราไปเลย สิ่งนี้กำหนดว่าคุณจะสามารถสลับแทร็กเสียงที่สะอาดกลับเข้าไปได้อีกหรือไม่
  • การปรับระดับความดังทำได้ฟรีและแก้ปัญหาที่ใหญ่ที่สุดได้
  • เสียงก้องไม่สามารถแก้ไขได้ด้วยการเพิ่มเสียงก้องเข้าไปอีก เราทดสอบแล้ว
  • ถ่ายจังหวะการพูดในระยะใกล้และรักษาระยะให้คงที่ มันแก้ไขทั้งเสียงแวดล้อมและความตรงกับปากไปพร้อมกัน

ทุกตัวเลขในหน้านี้วัดจากเทคของเราเอง ซึ่งสร้างด้วย Popcraft ภาพปกแสดงกราฟตัวเลขความดังในตารางแรก วิธีการ: ระดับเสียงผ่าน pYIN บนเฟรมที่มีเสียง ความดังผ่านมิเตอร์ EBU R128 ความแห้งเป็นอัตราส่วนของ 50 ms แรกของการเริ่มพูดแต่ละครั้งต่อ 150 ms ถัดไป การลดลงเป็นเวลาที่ลดลง 20 dB หลังจากหยุดพูด

คำถามที่พบบ่อย

ทำไมพิธีกร AI ของฉันถึงฟังดูต่างไปในทุกคลิป?
มักเป็นเพราะโมเดลวิดีโอสร้างเสียงใหม่ในทุกเทค ใน 4 ฉาก ระบบ text-to-speech ของเราคงความดังไว้ภายใน 0.5 LU แต่เสียงในคลิป Seedance 2.5 ที่เสร็จแล้วมีความดังกระจายไปถึง 9.4 LU พร้อมเสียงห้องที่เปลี่ยนไปตามขนาดช็อต
ฉันสามารถสลับกลับไปใช้เสียงต้นฉบับที่สะอาดได้ไหม?
ขึ้นอยู่กับโมเดล Seedance 2.5 จะสร้างการแสดงใหม่ที่คลาดเคลื่อนจากต้นฉบับสูงสุดถึง 440 ms ตลอดทั้งคลิป ทำให้ปากขยับตามจังหวะของมัน ไม่ใช่ไฟล์ของคุณ และแทร็กที่สลับเข้าไปจะไม่ซิงค์ Wan 3.0 ส่งคืนเวฟฟอร์มของเราด้วยค่าความหน่วงคงที่โดยไม่มีการคลาดเคลื่อน ดังนั้นจึงสามารถวางแทร็กเดิมกลับไว้ใต้ภาพได้เมื่อลบความหน่วงนั้นออกแล้ว
โมเดลวิดีโอ AI ตัวไหนที่คงเสียงพากย์ของฉันไว้โดยไม่เปลี่ยนแปลง?
ในการทดสอบของเรา Wan 3.0: เอาต์พุตมีความสัมพันธ์ 0.82 ถึง 0.95 กับเสียงต้นฉบับ และคงค่าออฟเซ็ตคงที่ตลอดทั้งคลิป Seedance 2.5 มีความสัมพันธ์ 0.30 ถึง 0.55 และคลาดเคลื่อน 120 ถึง 440 ms เนื่องจากมีการสังเคราะห์เสียงใหม่ ทั้งสองโมเดลพร้อมใช้งานบน Popcraft
ทำไมเธอถึงฟังดูอยู่ไกลในช็อตกว้าง?
โมเดลจะอนุมานสภาพเสียงจากขนาดช็อต ใน 4 ฉาก การจัดเฟรมกว้าง 2 ช็อตเป็นช็อตที่มีเสียงก้องมากที่สุด โดยมีการสลายตัวของเสียงที่ 139 และ 209 ms เทียบกับ 81 และ 116 ms สำหรับช็อตใกล้ 2 ช็อต
การปรับมาตรฐานความดังเพียงอย่างเดียวเพียงพอหรือไม่?
มันแก้ปัญหาส่วนใหญ่ได้และไม่มีค่าใช้จ่าย: การปรับมาตรฐานแบบสองรอบไปยังเป้าหมายเดียวช่วยลดการกระจายความดังจาก 9.4 LU เหลือ 0.4 LU น้ำเสียงต้องใช้ shelf EQ แยกตามคลิป และเสียงก้องไม่สามารถแก้ไขได้ด้วยเชนฟิลเตอร์เลย
ควรปรับมาตรฐานความดังของคลิปวิดีโอ AI ไปที่ระดับใด?
เลือกเป้าหมายเดียวและใช้กับทุกคลิปในคัต เราใช้ −14 LUFS แบบ integrated พร้อมขีดจำกัด true-peak ที่ −1.5 dBTP ซึ่งเหมาะกับแพลตฟอร์มสตรีมมิ่งและโซเชียลมีเดียส่วนใหญ่ ความสม่ำเสมอระหว่างคลิปสำคัญกว่าตัวเลขที่แน่นอน

พร้อมลองใช้แล้วหรือยัง? เริ่มต้นใช้งาน Popcraft วันนี้

เปิดตัวสร้างวิดีโอ
เราทดสอบ Gemini Omni 1.1 Flash มาหนึ่งวัน นี่คือคลิป 40 วินาทีและค่าใช้จ่ายที่เกิดขึ้น
ผลิตภัณฑ์อ่าน 4 นาที

เราทดสอบ Gemini Omni 1.1 Flash มาหนึ่งวัน นี่คือคลิป 40 วินาทีและค่าใช้จ่ายที่เกิดขึ้น

บันทึกภาคสนามจากการเปิดใช้งาน Gemini Omni 1.1 Flash ของ Google: คลิป 5 วินาทีที่ได้ผลลัพธ์ยาวถึง 25 วินาที เทรลเลอร์ 40 วินาทีจากพรอมต์เดียว การทดสอบพลศาสตร์ของไหล 30 วินาที การทดสอบการเคลื่อนกล้อง สิ่งที่ Google กล่าวอ้าง สิ่งที่เราวัดได้ และวิธีเขียนพรอมต์สำหรับการต่อวิดีโอ

The Complete Guide to Popcraft's AI Creative Suite
ผลิตภัณฑ์อ่าน 6 นาที

The Complete Guide to Popcraft's AI Creative Suite

A comprehensive overview of every tool in Popcraft: image, video, audio, avatars, and the AI Agent. Find the right AI creative tool for your next project.

Speed Up Your Video Workflow with AI-Powered Templates
ผลิตภัณฑ์อ่าน 7 นาที

Speed Up Your Video Workflow with AI-Powered Templates

Discover how AI video templates can dramatically speed up your content production. Create a full week of professional video content in well under an hour with smart templates.