HunyuanVideo-Avatar

HunyuanVideo-Avatar是由騰訊混元視頻大模型(HunyuanVideo)與騰訊音樂天琴實驗室MuseV技術聯合研發的語音數字人模型,於2025年5月28日由騰訊混元發布並開源。該模型支持通過單張人物圖像和音頻生成包含自然表情、唇形同步及全身動作的說話或唱歌視頻,覆蓋頭肩、半身與全身景別,兼容多風格、多物種與雙人場景。

該模型基於多模態擴散變換器(MM-DiT)架構,包含角色圖像注入模組、音頻情感模組(AEM)和面部感知音頻適配器(FAA)等技術模組,可自動識別環境特徵及音頻情感,實現多角色同屏對話與動態背景保真。用戶上傳14秒內音頻可生成720p短視頻,支持FP8量化推理與ComfyUI節點調用。套用場景涵蓋電商直播、線上教育、短視頻創作及MV生成,已落地騰訊音樂多款產品。

基本介紹

  • 外文名:HunyuanVideo-Avatar
  • 發布時間:2025年5月28日
發展歷史,功能簡介,

發展歷史

2025年5月28日,騰訊混元發布並開源的語音數字人模型HunyuanVideo-Avatar。

功能簡介

HunyuanVideo-Avatar支持頭肩、半身與全身景別,以及多風格、多物種與雙人場景,面向視頻創作者提供高一致性、高動態性的視頻生成能力。用戶可上傳人物圖像與音頻,HunyuanVideo-Avatar模型會自動理解圖片與音頻,比如人物所在環境、音頻所蘊含的情感等,讓圖中人物自然地說話或唱歌,生成包含自然表情、唇形同步及全身動作的視頻。

相關詞條

熱門詞條

聯絡我們