OmniHuman

OmniHuman是位元組跳動於2025年2月6日正式發布的端到端多模態AI數字人模型,其核心功能為通過單張靜態照片和音頻輸入生成具備自然動作的動態視頻。該模型採用基於DiT架構的多模態運動條件混合訓練策略,解決了高質量訓練數據稀缺的行業難題,可生成與音頻精確匹配的肢體動作和唇形,支持演講、歌唱及樂器演奏等複雜場景。

在技術突破方面,OmniHuman實現了動態背景與全身肢體動作的協同生成,顯著最佳化了手勢自然度和非真人素材適配能力,支持動漫、3D卡通等藝術風格的視頻渲染。通過即夢AI平台,該模型已實現15秒完整視頻一鍵生成功能,並率先在教育、影視製作、虛擬偶像領域開展商業化套用。IDC數據顯示,中國AI數字人市場規模預計在2026年達到102.4億元,該模型的發布標誌著數字人技術向平台化服務入口升級。

基本介紹

  • 開發者:位元組跳動智慧型創作數字人團隊
  • 核心技術:基於DiT架構的多模態運動條件混合訓練 
  • 發布時間:2025年2月6日
  • 技術突破:全身動作生成、手勢最佳化、多風格適配
  • 套用場景:影視動畫、直播電商、教育培訓 
  • 主要競品:騰訊智慧型數字人、百度智慧型雲曦靈
技術特性,行業影響,平台套用,核心突破,

技術特性

模型採用單張圖片與音頻輸入生成視頻的端到端架構,通過多模態處理算法實現語音與肢體動作的時空對齊。相較於傳統方案,該模型突破了三項技術瓶頸:支持任意比例輸入圖片的角色姿態還原,實現動態背景與全身動作的協同生成,並通過混合訓練策略提升手部細節生成精度達40%以上。
在非真人素材處理領域,OmniHuman建立了獨特的風格遷移算法,可保留動漫、3D卡通等素材的原始藝術特徵與運動規律,支持奧特曼舞蹈、初音未來演奏等複雜動畫場景製作。2025年定量評測顯示,其生成視頻的唇形同步誤差較同期模型降低32%,被評價為"AI視頻2.0時代的標誌性產品"。

行業影響

根據浙商證券分析報告,該模型可能成為連線AI大模型與企業服務的入口,形成toB降本增效與toC內容變現的雙重商業閉環。在影視製作領域,其"大師模式"可將動畫短片製作周期從傳統流程的5-7天縮短至15分鐘,而在直播電商場景,已實現虛擬主播腳本自動生成與實時互動功能。
IDC預測數據顯示,中國AI數字人市場規模將從2025年的58.3億元增長至2026年的102.4億元,年均複合增長率達75.6%。位元組跳動通過將該模型與火山引擎、抖音生態整合,正在構建覆蓋數字人創作、分發、運營的全鏈條服務體系。

平台套用

通過即夢AI平台,OmniHuman已於2025年2月進入測試階段,提供網頁端與API接口兩種服務形態。平台建立了內容安全審核機制,對輸出視頻強制添加數字水印,並限制敏感場景的生成許可權。內測數據顯示,企業用戶主要套用於產品演示與虛擬客服場景。
技術文檔顯示,模型支持1080P高清視頻輸出,支持中英日韓四種語言的語音輸入。在硬體適配方面,推薦使用顯存12GB以上的NVIDIA顯示卡進行本地部署,雲端服務則按分鐘計費。

核心突破

區別於傳統面部動畫方案,OmniHuman-1版本首次實現了完整的肢體表演生成能力,包括動態走位、樂器演奏互動等複雜動作序列。在測試案例中,該模型成功還原了麥可·傑克遜《Billie Jean》的經典舞步,動作連貫性達到專業編舞水平的87%。
針對行業痛點,研發團隊構建了包含高質量訓練數據的訓練集,通過基於DiT架構的多模態運動條件混合訓練策略最佳化運動軌跡的物理合理性。在2025年國際計算機視覺會議展示中,其生成視頻的人類感知評分(HPS)達到4.21分(滿分5分),較行業基準提升19%。

熱門詞條

聯絡我們