海螺 AI 影片生成 — MiniMax Hailuo 的角色一致性實測
MiniMax Hailuo 02 在 6 秒短片內的角色一致性表現,取決於是否使用「首尾幀」(Start-End Frame)模式:純文字生成的多鏡頭角色臉部漂移率高,而以同一張參考圖鎖定起始幀時,連續三段生成的角色辨識度明顯提高。這是實測 Hailuo 系列最關鍵的操作結論——一致性不是模型內建能力,是輸入端設計出
MiniMax Hailuo 02 在 6 秒短片內的角色一致性表現,取決於是否使用「首尾幀」(Start-End Frame)模式:純文字生成的多鏡頭角色臉部漂移率高,而以同一張參考圖鎖定起始幀時,連續三段生成的角色辨識度明顯提高。這是實測 Hailuo 系列最關鍵的操作結論——一致性不是模型內建能力,是輸入端設計出來的。 Hailuo 是什麼:MiniMax 的影片生成產品線 Hailuo(海螺)是中國 AI 公司 MiniMax 推出的影片生成模型,2024 年 9 月首次發表 video-01,2025 年 6 月推出 Hailuo 02。MiniMax 成立於 2021 年,投資方包含阿里巴巴與騰訊, 「MiniMax 於 2025 年 6 月發表 Hailuo 02,支援 1080p 原生解析度與 10 秒時長」(來源:MiniMax 官方公告) 。 模型架構上,Hailuo 02 採用 MiniMax 稱為 NCR(Noise-aware Compute Redistribution)的訓練架構。官方宣稱該架構讓 「訓練與推論效率相較前代提升 2.5 倍,模型參數量達前代 3 倍、訓練資料量達 4 倍」(來源:MiniMax 官方公告) 。實務上這反映在物理模擬的合理度——體操翻滾、水花濺起這類高動態場景,Hailuo 02 的肢體崩壞率低於同期多數開源模型。 產品線目前包含幾條路徑:文字轉影片(T2V)、圖片轉影片(I2V)、首尾幀模式,以及 2025 年下半推出的 S2V-01 主體參考模式(Subject Reference)。最後這條,正是角色一致性的核心。 角色一致性為什麼難:擴散模型的結構性限制 影片生成模型的角色漂移,源自每次生成都是獨立的去噪過程。模型不會「記得」上一段影片裡角色長什麼樣,除非你在輸入端提供錨點。這與 LLM 的上下文記憶完全不同——影片模型的「記憶」只存在於單次生成的 latent 空間內,跨生成即歸零。 三種常見的漂移類型必須分開處理: 幀內漂移 :同一段 6 秒影片內,角色臉部隨鏡頭移動而變形。這通常發生在角色轉頭超過 45 度、或鏡頭快速推近時。 幀間漂移 :兩段獨立生成的影片,同一提示詞卻產出不同長相的角色。這是最常見也最致命的問題。 服裝與配件漂移 :臉部維持住了,但衣服顏色、髮飾、手持道具在段落間變化。 學術界對此已有系統性研究。 Animate Anyone 論文(Hu et al., 2023) 提出以 ReferenceNet 保留參考圖的細節特徵,是目前多數商用模型處理一致性的技術基礎。理解這點很重要:所有宣稱「角色一致」的商用產品,本質上都是在做參考特徵注入,而不是模型真的認得你的角色。 實測方法與三種模式對照 測試設計為同一角色設定、跨三段連續劇情,比較三種輸入模式的一致性表現。角色設定固定為:「28 歲亞洲女性,齊肩黑髮,銀框眼鏡,米色針織衫」。三段劇情分別為:走進咖啡廳、坐下打開筆電、抬頭看向窗外。每種模式各生成 3 次,取樣本觀察。 模式一:純文字提示(T2V) 純文字模式的跨段一致性最差。即使提示詞完全複製貼上,三段影片產出的角色在臉型、髮長、眼鏡框粗細上都有明顯差異。這是可預期的結果——沒有視覺錨點,模型每次都從隨機噪聲重新詮釋文字描述。實務結論:純文字模式只適合單鏡頭、不需要角色延續的素材。 模式二:圖生影片(I2V) I2V 模式下,角色的起始幀完全鎖定,但漂移發生在影片後段。前 2 秒角色與參考圖高度吻合,3 秒後隨動作幅度增加,臉部細節開始偏移。當角色做出參考圖中未呈現的動作(例如低頭、側身),模型必須「想像」未見過的角度,此時漂移最嚴重。 降低漂移的具體做法:參考圖使用正面偏 3/4 角度的半身構圖,而非純正面大頭照。3/4 角度提供更多立體資訊,模型推測其他角度時的誤差較小。另外把提示詞的動作幅度壓小——「緩緩轉頭」比「快速轉身」的一致性高出一截。 模式三:首尾幀 + 主體參考 首尾幀模式是目前最穩定的方案。提供起始幀與結束幀兩張圖,模型只需要補中間的運動軌跡,角色的兩個端點都被鎖死,漂移空間大幅壓縮。搭配 S2V 主體參考,跨段一致性再提升一級。 操作上的關鍵是「幀鏈接」:第一段影片的最後一幀,截圖後當作第二段的起始幀。這樣串接三段,角色的視覺連續性能維持在可接受範圍。代價是每段之間的過渡會略顯生硬,需要在剪輯階段用轉場處理。 Hailuo 在市場中的定位 Hailuo 的優勢在動態物理與成本,不在角色一致性。與 Google Veo 3、OpenAI Sora 2、Runway Gen-4 相比,Hailuo 02 的高動態場景表現排在前段,但在長片段的角色穩定度上,Runway Gen-4 的 References 功能與 Ve
相關工具書
由 FeiYueh 親自審稿驗證 · 最後更新於 2026-09-16. Independently maintained — not AI-generated boilerplate.
← Back to Blog