HunyuanVideo-Avatar是由騰訊混元視頻大模型(HunyuanVideo)與騰訊音樂天琴實驗室MuseV技術聯合研發的語音數字人模型,於2025年5月28日由騰訊混元發布並開源。該模型支持通過單張人物圖像和音頻生成包含自然表情、唇形同步及全身動作的說話或唱歌視頻,覆蓋頭肩、半身與全身景別,兼容多風格、多物種與雙人場景。
該模型基於多模態擴散變換器(MM-DiT)架構,包含角色圖像注入模組、音頻情感模組(AEM)和面部感知音頻適配器(FAA)等技術模組,可自動識別環境特徵及音頻情感,實現多角色同屏對話與動態背景保真。用戶上傳14秒內音頻可生成720p短視頻,支持FP8量化推理與ComfyUI節點調用。套用場景涵蓋電商直播、線上教育、短視頻創作及MV生成,已落地騰訊音樂多款產品。
基本介紹
- 外文名:HunyuanVideo-Avatar
- 發布時間:2025年5月28日
