Step-1V

Step-1V是由階躍星辰於2024年03月23日發布的千億參數多模態理解大模型,專注於圖像、文字、數據圖表等信息的精準描述與理解,並具備視頻理解能力。該模型在全球權威評測LMSYS大模型競技場中與Gemini-1.5-Flash-8B-Exp-0827總分持平,位列中國大模型視覺領域第一。其升級版本Step-1.5V於2024年07月11日發布,新增視頻氛圍與情緒理解功能,後續疊代的Step-1o Vision進一步提升了視覺識別與推理能力。該系列模型已套用於視頻監控、智慧型安防、內容審核、教育、編程、藝術創作等多個領域。

基本介紹

  • 發布時間:2024年
  • 參數規模:千億級
  • 評測排名:中國第一  
  • 升級版本:Step-1.5V 
  • 所屬系列:Step系列 
  • 套用領域:視頻監控、智慧型安防、內容審核、教育、編程、藝術創作等多個領域 
技術特點,評測表現,版本疊代,套用領域,

技術特點

Step-1V基於千億參數規模設計,能夠實現圖像內容創作、邏輯推理、數據分析等多項任務。該模型支持端到端的文本、視覺、語音三模態處理,可識別視頻中的物體、人物和環境信息,並具備解答數學題、編寫代碼等高級推理功能。

評測表現

截至2024年11月27日,Step-1V在LMSYS大模型競技場視覺領域總分與Gemini-1.5-Flash-8B-Exp-0827持平。2024年03月23日發布的Step-1V在國內“司南”評測平台的多模態模型榜單中位列第一,其識別準確率涵蓋複雜圖像關鍵字、外語翻譯及幽默表達方式。

版本疊代

2024年07月11日,階躍星辰發布Step-1.5V,在圖像感知和理解能力上實現了質的飛躍,並具備了出色的視頻理解能力,能夠準確識別視頻中的物體、人物和環境,理解視頻的整體氛圍與人物情緒。2025年01月21日推出的Step-1o Vision進一步最佳化視覺感知與指令跟隨能力,並在端到端三模態生成與理解任務中取得突破。

套用領域

階躍星辰多模態大模型已套用於智慧型安防系統、內容審核流程、教育解題輔助、編程代碼生成及藝術創作場景,截至2024年11月覆蓋超過10個行業領域。

相關詞條

熱門詞條

聯絡我們