Hailuo AI tạo video — Kiểm chứng thực tế tính nhất quán nhân vật của MiniMax Hailuo

Hiệu năng nhất quán nhân vật của MiniMax Hailuo 02 trong clip ngắn 6 giây phụ thuộc vào việc có dùng chế độ "khung đầu-cuối" (Start-End Frame) hay không: video

Hiệu năng nhất quán nhân vật của MiniMax Hailuo 02 trong clip ngắn 6 giây phụ thuộc vào việc có dùng chế độ "khung đầu-cuối" (Start-End Frame) hay không: video đa cảnh tạo thuần bằng văn bản có tỷ lệ trôi dạt khuôn mặt nhân vật cao, còn khi khóa khung khởi đầu bằng cùng một ảnh tham chiếu, độ nhận diện nhân vật qua ba đoạn tạo liên tiếp tăng lên rõ rệt. Đây là kết luận vận hành then chốt nhất khi thử nghiệm thực tế dòng Hailuo — tính nhất quán không phải năng lực có sẵn của mô hình, mà được thiết kế ra từ phía đầu vào. Hailuo là gì: dòng sản phẩm tạo video của MiniMax Hailuo (Hải Loa) là mô hình tạo video do công ty AI Trung Quốc MiniMax phát hành, ra mắt video-01 lần đầu vào tháng 9 năm 2024 và tung ra Hailuo 02 vào tháng 6 năm 2025. MiniMax thành lập năm 2021, nhà đầu tư gồm Alibaba và Tencent, "MiniMax phát hành Hailuo 02 vào tháng 6 năm 2025, hỗ trợ độ phân giải gốc 1080p và thời lượng 10 giây" (nguồn: thông cáo chính thức của MiniMax) . Về kiến trúc mô hình, Hailuo 02 áp dụng kiến trúc huấn luyện mà MiniMax gọi là NCR (Noise-aware Compute Redistribution). Hãng tuyên bố kiến trúc này giúp "hiệu suất huấn luyện và suy luận tăng 2,5 lần so với thế hệ trước, số tham số mô hình gấp 3 lần và lượng dữ liệu huấn luyện gấp 4 lần thế hệ trước" (nguồn: thông cáo chính thức của MiniMax) . Trên thực tế điều này phản ánh ở độ hợp lý của mô phỏng vật lý — với các cảnh động mạnh như lộn nhào thể dục hay nước bắn tung, tỷ lệ sụp đổ chi thể của Hailuo 02 thấp hơn phần lớn mô hình mã nguồn mở cùng thời. Dòng sản phẩm hiện gồm vài hướng: văn bản sang video (T2V), ảnh sang video (I2V), chế độ khung đầu-cuối, và chế độ tham chiếu chủ thể (Subject Reference) S2V-01 ra mắt nửa cuối năm 2025. Hướng cuối cùng này chính là cốt lõi của tính nhất quán nhân vật. Vì sao nhất quán nhân vật lại khó: giới hạn cấu trúc của mô hình khuếch tán Trôi dạt nhân vật ở mô hình tạo video bắt nguồn từ việc mỗi lần tạo đều là một quá trình khử nhiễu độc lập. Mô hình không "nhớ" nhân vật trong đoạn video tr

相關工具書

Đã được xem xét và xác minh bởi FeiYueh · Lần xác minh gần nhất 2026-09-16. Independently maintained — not AI-generated boilerplate.

← Back to Blog