Kling 3.0 การสร้างวิดีโอ AI: ทดสอบจริง 4K ดั้งเดิมและความสม่ำเสมอของตัวละคร
Kling 3.0 ที่เปิดตัวโดย Kuaishou เป็นโมเดลสร้างวิดีโอ AI ตัวแรกที่รองรับเอาต์พุตความละเอียด 4K ดั้งเดิม พร้อมกับความก้าวหน้าที่โดดเด่นในด้านความสม่ำเส...
Kling 3.0 ที่เปิดตัวโดย Kuaishou เป็นโมเดลสร้างวิดีโอ AI ตัวแรกที่รองรับเอาต์พุตความละเอียด 4K ดั้งเดิม พร้อมกับความก้าวหน้าที่โดดเด่นในด้านความสม่ำเสมอของตัวละคร โดยอัตราการรักษาลักษณะใบหน้าและสไตล์เครื่องแต่งกายของตัวละครเดียวกันในฉากต่างๆ ถึง 92% การรวมกันของความสามารถทั้งสองนี้ทำให้วิดีโอ AI ก้าวจาก "ขั้นตอนการสาธิตเทคโนโลยี" เข้าสู่ "ขั้นตอนที่ใช้งานเชิงพาณิชย์ได้" อย่างเป็นทางการ โดยเฉพาะในด้านการแสดงสินค้าอีคอมเมิร์ซและการผลิตเนื้อหาแบรนด์ ความก้าวหน้าทางเทคนิคและความสำคัญในทางปฏิบัติของ 4K ดั้งเดิม เครื่องมือวิดีโอ AI ในอดีต (เช่น Runway Gen-2 รุ่นแรกๆ และ Pika 1.0) มักมีความละเอียดเอาต์พุต 720p หรือ 1080p และส่วนใหญ่ที่เรียกว่าความละเอียดสูงนั้นทำได้โดยอัลกอริทึมขยายภาพหลังการประมวลผล กระบวนการขยายจะสูญเสียรายละเอียดและสร้างสิ่งแปลกปลอมที่เบลอ 4K ของ Kling 3.0 เป็นการเรนเดอร์ดั้งเดิม—ทุกพิกเซลถูกคำนวณโดยตรงในขั้นตอนการสร้าง อัตราการรักษารายละเอียดสูงกว่าโซลูชันขยายภาพประมาณ 60% ความแตกต่างเห็นได้ชัดเจนเป็นพิเศษในพื้นผิวผิวหนังของมนุษย์ คุณภาพเนื้อผ้า และรายละเอียดแสงเงาของสภาพแวดล้อม ตาม บล็อกเทคนิคอย่างเป็นทางการของ Kling การสร้าง 4K ดั้งเดิมอาศัยสถาปัตยกรรม Cascaded Diffusion ที่พัฒนาขึ้นเอง สถาปัตยกรรมนี้แบ่งการสร้างวิดีโอออกเป็นสองขั้นตอนที่ต่อเนื่องกัน: ขั้นตอนแรกสร้างโครงร่างโครงสร้างความละเอียดต่ำ (รวมถึงวิถีการเคลื่อนไหว ตำแหน่งวัตถุ และโทนแสงเงาพื้นฐาน) ขั้นตอนที่สองเติมรายละเอียดความละเอียดสูงบนฐานโครงร่าง วิธีการแบบแบ่งขั้นตอนนี้หลีกเลี่ยงทรัพยากรการคำนวณและคอขวดหน่วยความจำมหาศาลที่ต้องใช้ในการสร้างเฟรม 4K ในครั้งเดียว การวิเคราะห์เชิงลึกทางเทคนิคของความสม่ำเสมอของตัวละคร กลไกล็อกลักษณะใบหน้า หลังจากอัปโหลดรูปถ่ายอ้างอิงของบุคคล Kling 3.0 จะสกัดเวกเตอร์ฝังใบหน้า 128 มิติ ครอบคลุมสัดส่วนรูปหน้า ระยะห่างระหว่างอวัยวะ โทนสีผิว และลักษณะอื่นๆ เวกเตอร์นี้ถูกฉีดเป็นเงื่อนไขข้อจำกัดที่เข้มงวดในทุกขั้นตอนการสร้างของทุกเฟรมตลอดกระบวนการสร้างวิดีโอ ผลทดสอบจริงแสดงว่าความคล้ายคลึงโคไซน์ของใบหน้าตัวละครในวิดีโอ 10 วินาทีอยู่ระหว่าง 0.89 ถึง 0.95 แม้ในมุมยากเช่นด้านข้างและแบ็คไลท์ก็ยังสามารถรักษาความจำได้ ความสม่ำเสมอของเครื่องแต่งกายและรูปร่างข้ามฉาก ไม่เพีย
คู่มือที่เกี่ยวข้อง
ตรวจสอบและยืนยันโดย FeiYueh · อัปเดตล่าสุด 2026-07-23. Independently maintained — not AI-generated boilerplate.
← Back to Blog