套用發展,套用領域,圖像生成與增強,文本生成與自然語言處理,醫藥與生物信息學,音頻與音樂生成,教育與美育,生成式人工智慧的挑戰,社會治安隱患,隱私保護隱患,就業市場隱患,社會經濟影響,生成式人工智慧未來展望,發展背景,基本原理,機率圖模型,生成對抗網路(GAN),自回歸生成模型,擴散模型,相關認證,GAI認證,認證平台,統計數據,相關觀點,
套用發展 2025年3月6日,阿里巴巴集團旗下的
阿里雲 宣布將向日本企業提供生成式AI基礎模型方案,以促進當地企業在人工智慧套用方面的發展。
2025年7月11日,谷歌DeepMind宣布開源新的Python庫“GenAI Processors”。該工具集用於構建異步、可組合的生成式AI工作流,支持實時處理音頻、視頻和文本等多模態數據,可用於基於Gemini API的應用程式開發。
截至2025年10月23日,上海市新增2款已完成備案的生成式人工智慧服務,累計已完成104款生成式人工智慧服務備案。
截至2025年12月31日,累計有748款生成式人工智慧服務完成備案,435款生成式人工智慧套用或功能完成登記。
2026年1月,百度開展“AI魔改”視頻治理。
2026年1月13日,浙江省政協委員、中國美術學院藝術管理與教育學院院長孔令偉在浙江省政協會議上建議加快發展數字美育,構建與數字時代相適應的藝術教育體系,推動數字藝術教育與社會美育融合發展,並提及生成式人工智慧在美育中的套用。
套用領域 圖像生成與增強 生成對抗網路(GAN)和穩定擴散模型(SD)在圖像生成與增強領域取得了突破性進展,並被廣泛套用於電影、藝術設計和廣告等行業,為創意產業提供了全新工具。這些技術通過生成高質量的圖像和視頻,大幅度提升了創作效率,降低了製作成本,為從事相關行業的設計人員提供了極大的便利。例如,
NVIDIA 的StyleGAN能夠驅動生成逼真的虛擬人臉;Adobe藉助SD模型開發了Firefly工具,實現智慧型圖像擴展和風格轉換;Google的DeepArt利用藝術風格遷移技術,將普通圖像轉化為著名藝術家風格的藝術作品;CycleGAN可輕鬆實現場景的季節轉換和畫面風格統一,大大降低電影製作的特效成本。這些套用極大地拓展了創意和內容生產的邊界。
文本生成與自然語言處理 生成式語言模型如GPT-3、ChatGPT在自然語言生成(NLG)中展現了極大的潛力,廣泛套用於文本生成、對話系統、內容創作和客戶服務等領域。尤其是ChatGPT已在教育和客戶支持等場景中實現商業化套用,為用戶帶來更智慧型的互動體驗。此外,OpenAI的GPT-4進一步提升了多模態生成能力,能夠生成和理解更複雜的文本內容。在評估這些生成文本的質量和準確性時,通常會考量其流暢性、語義準確性、上下文一致性,創造性和多樣性。同時,用戶反饋的生成內容真實性也是一項關鍵指標,只有根據反饋不斷進行改進,確保模型輸出符合實際需求,才能進一步提升用戶體驗。
醫藥與生物信息學 生成式人工智慧在藥物發現和生物分子結構生成中也得到了套用。比如,
生成模型 用於預測
蛋白質結構 ,並幫助科學家在更短時間內篩選出潛在藥物。近年來,這類技術已成功推動了多種藥物研發,如英矽智慧型(Insilico Medicine)利用其人工智慧平台,已在
腫瘤 、
免疫 、
纖維化 、
代謝 等多個疾病領域搭建了超過30個創新藥物研發項目,大大縮短了研發周期;2025年12月,英矽智慧型在
香港交易所 主機板成功上市,成為首家依據相關規則上市的人工智慧生物醫藥科技公司。2026年1月,該公司宣布與全球製藥企業
施維雅 (Servier)達成總金額最高達8.88億美元的多年期研發合作,共同利用AI平台發現和開發候選藥物,其創始人兼CEO Alex Zhavoronkov稱此舉意味著“製藥超級智慧型”(即
AI智慧型體 能夠自主決策並設計實驗)的未來已近在眼前;
Exscientia 通過生成式人工智慧輔助篩選技術快速發現多款潛在藥物,顯著提高了藥物研發效率。行業合作方面,2025年AI製藥領域業務拓展(BD)合作活躍,除英矽智慧型外,
石藥集團 與
阿斯利康 、晶泰科技與
禮來 等也達成了高額戰略合作。市場分析認為,高額預付款表明AI生成分子的可信度提升,企業合作共擔風險正推動AI製藥從“概念”驗證走向產生“現金流”的階段,這些成功案例表明生成式人工智慧正在改變傳統藥物發現過程,為生物醫藥領域帶來突破性進展。
音頻與音樂生成 AIGC技術在音頻與音樂生成領域的套用也取得了全新的進展,通過生成高質量的音樂音效,顯著提升了創作效率,降低了製作成本,為音樂人、音頻工程師、音樂創意團隊提供了全新的工具。例如,OpenAI的Jukebox能夠生成多種風格的音樂,模擬特定歌手的聲音,輕鬆創作出極具個性化的作品;Meta的AudioGen可以生成逼真的環境音效,為遊戲和電影提供智慧型化的音效設計方案;Google的Magenta項目通過深度學習生成旋律,為音樂創作者提供創作靈感;Voicemod通過實時語音生成技術實現個性化音頻設計,廣泛套用於流媒體、遊戲配音和虛擬現實等場景。這些套用極大地改變了音頻音樂的創作模式,為內容生產和娛樂體驗開闢了新的可能性。
教育與美育 生成式人工智慧在數字美育中的套用包括通過“文本—圖像”、“實物—圖像”等多重轉化方式,結合數位化採集、生成式人工智慧與
擴展現實 (
XR )等技術,建設覆蓋學校、社區、家庭等多場景的沉浸式美育環境。
人工智慧 在內容生成、傳播方式和審美體驗等方面的廣泛套用,為公共文化建設和美育傳播帶來了新的機遇。同時,人工智慧的多場景、低門檻套用也帶來了一些新問題,例如
價值觀 與事實認知的分裂,低品味與同質化作品的複製傳播,以及人文意識與
科技倫理 的缺位等。
對此,相關建議包括強化價值引領,通過加強頂層設計,完善數字藝術領域的法律法規與行業規範。其次,要深化理論研究,推動以經典文本、文物、藝術史作品等為核心元素,系統構建數字藝術創作的知識邏輯。最後,建議依託高校資源,加快建設一批高水平數字人文實驗室,並建立涵蓋內容質量、教育效果、社會反響等多維度的綜合評價體系。
生成式人工智慧亦套用於公民教育領域,例如通過生成視頻等技術輔助公共政策教育與公共溝通。
生成式人工智慧的挑戰 儘管生成式人工智慧的賦能為許多行業帶來了全新的發展機遇,但其快速的發展也帶來了諸多現實問題,主要體現在社會治安、隱私保護和工作取代等方面。
社會治安隱患 生成式人工智慧在提升技術創新的同時,也對社會治安帶來了潛在的危害。在當今的網路媒體時代,信息的傳播成本被極大的降低,一條信息僅需幾秒鐘便可傳遍世界每一個角落。但由於生成式人工智慧可以製造出逼真的虛假信息,一旦有不法分子妄圖擾亂公眾視聽,在網路媒體的推波助瀾下,此類信息可能會以難以遏制的速度引發公眾的恐慌。例如:2023年法國騷亂期間,一些生成的假新聞圖片在社交媒體上迅速傳播,其中一張被廣泛傳播的圖片顯示一座法國地標性建築在暴力事件中被燒毀殆盡。儘管這張圖片是生成式人工智慧製作的虛假內容,但在未被闢謠的期間內還是引發了大量公眾的恐慌。而如何鑑別這些逼真的虛假信息仍沒有較好的解決方案,就像對抗生成網路算法GAN的思想一樣,鑑別器和生成器是共同疊代進步的,隨著鑑別技術的升級,假信息技術的升級也緊跟其後。
隱私保護隱患 隱私保護問題是生成式人工智慧帶來的另一個嚴峻挑戰。生成式人工智慧模型的訓練通常依賴於大量數據,其中包括用戶的個人信息甚至隱私信息。數據泄露或被不當使用的風險使得個人隱私受到了極大的威脅。儘管國內早已出台了《個人信息保護法》來規範數據的使用,但在生成式人工智慧極速發展的背景下,個人數據泄露的風險依然存在。
就業市場隱患 生成式人工智慧對就業市場的衝擊也逐漸顯現。生成式人工智慧通過自動化生產內容、設計和分析,已經在一定程度上取代了人們在新聞編輯、廣告設計和客戶服務等領域的工作。路透社的一篇報導顯示,根據Adecco集團的調查,全球2000家大型公司中,大約41%的高級管理人員預計由於生成式人工智慧技術的發展,企業將會維持更少的員工隊伍。這不僅影響個人的經濟收入,還可能加劇社會的不平等,帶來更為深層的社會問題。
社會經濟影響 自2022年底
ChatGPT 橫空出世以來,以大型語言模型(LLMs)為代表的生成式人工智慧技術引發了全球性的“AI大爆炸”,以前所未有的深度和速度重塑了學術研究生態。生成式AI正在深刻地改變
經濟學 這門學科本身的研究方法和工具箱,帶來範式性的轉變。具體表現為AI處理非結構化文本信息的能力極強,幫助構建全新資料庫,並擁有強大的代碼能力。AI還能輔助文獻綜述,並深度參與數據分析與論文撰寫全過程。
生成式AI技術的普及已對諸多產業產生了直接且顯著的影響。AI的採用存在門檻效應,大型企業更能有效整合AI技術。AI投資能顯著降低企業運營績效的波動性,提升企業價值。同時,AI既可能強化科技巨頭的壟斷,也可能賦能小微創新,改變產業集中度。
生成式AI對
勞動力市場 的影響是一個複雜領域。其影響取決於現有的不平等和
職業隔離 模式,可能縮小某些差距同時擴大其他差距。生成式AI對白領認知工作的衝擊尤為直接,但也創造了“AI提示工程師”等新職業。AI的影響呈現顯著的地理和創業集中度,可能導致“AI鴻溝”。
生成式人工智慧亦開始介入並重塑教育體系,特別是在藝術教育(數字美育)領域。通過結合數位化採集、生成式人工智慧與
擴展現實 (
XR )等技術,該技術正推動構建與數字時代相適應的沉浸式藝術教育環境。這一進程對人才培養提出了新要求,即需要培養兼具藝術素養與技術能力的複合型人才,以適應技術套用帶來的變革。
經濟學的市場設計、激勵機制、福利分析、反壟斷理論、公平理論正在反向影響AI的發展方向、治理模式和套用倫理。涉及數據激勵、算法偏見矯正、風險監管等領域。
生成式人工智慧未來展望 生成式人工智慧在未來有望賦能多個領域的發展。通過在內容創作、科學研究、教育、醫療等方面的創新套用,生成式人工智慧將繼續拓展人類創造力的邊界。它不僅能夠加速新藥物和材料的發現,使得生命科學研究從“試錯”走向“
智慧型設計 ”,還可能在
人機互動 上推動實現個性化,使得教育、娛樂和服務業能夠滿足更廣泛的用戶需求。在教育領域,生成式人工智慧有望通過構建沉浸式學習環境等方式創新
美育 與
藝術教育 模式,推動跨學科融合。隨著多模態生成技術的進一步提升,生成式人工智慧將能夠更加自然地理解並生成文字、圖像、視頻和音頻,為
創意產業 提供無限的可能性。未來,生成式人工智慧或將成為重要的創新工具,輔助人類解決複雜問題、推動知識發現、拓展藝術表現,塑造出一個更具創造性的智慧型化世界。
發展背景 早期的生成模型理論(20世紀50-80年代)
生成模型的基礎理論最早在20世紀50年代至80年代確立,這一時期主要集中於機率模型等生成理論算法的研究。1950年代的馬爾可夫鏈(Markov Chains)和1970年代的隱馬爾可夫模型(Hidden Markov Models, HMM)為生成式模型奠定了理論基礎。
2014年,Ian Goodfellow等人提出了生成對抗網路(GAN),標誌著生成式人工智慧的關鍵突破。GAN通過生成器和判別器的對抗訓練,能夠生成高度真實的圖像和數據,是現代生成式AI的重要模型之一。
大語言模型的興起(2018年)
隨著計算能力的提升和海量數據的套用,生成式AI進入了以
大語言模型 (LLMs)為主的階段。2018年,OpenAI發布了
GPT (Generative Pre-trained Transformer)模型,通過大規模數據的預訓練和自回歸生成能力,推動了自然語言生成的顯著進展。
GPT-3 和多模態生成模型(2020年)
2020年,OpenAI發布了GPT-3,具備1750億參數,是當時規模最大的語言模型。GPT-3具備強大的自然語言理解和生成能力,廣泛套用於對話、寫作等任務。同年,OpenAI發布了DALL-E,展示了生成式AI在圖像生成領域的多模態能力。
ChatGPT 的普及與商業化套用(2022年)
2022年底,ChatGPT正式上線並迅速普及,標誌著生成式AI進入大規模商業化套用階段。ChatGPT基於GPT-3.5,能進行自然流暢的對話,廣泛套用於教育、客戶服務等領域。
ChatGPT 的成功激勵了其他科技公司加快生成式AI套用的開發。
全球標準的逐步確立(2023-2024年)
伴隨生成式AI的廣泛套用,各國開始制定政策和行業標準,確保生成式AI技術的安全合規。2024年,聯合國科技大會上發布了生成式AI的套用安全測試標準,中國工信部和網信辦等也相繼出台了生成式AI服務的管理辦法,規範行業發展。
基本原理 機率圖模型 機率圖模型 的架構基於圖結構,用節點和邊來描述隨機變數以及各變數之間的依賴關係,這種結構十分適合套用於生成式人工智慧。圖的每一個節點代表一個變數,比如在文本生成中,每個詞語可以被視作一個節點;在圖像生成中,每個像素或圖像特徵可以被看作一個節點。通過這種結構化的節點表示,生成式模型能夠細緻刻畫內容生成過程中各變數之間的關聯。而各變數之間的依賴關係由有向邊和無向邊描述。有向邊構成了貝葉斯網路,通常用於表示因果關係。例如,在生成文本或圖像時,有向邊可以表示生成過程中的條件依賴關係,如上下文信息對當前生成結果的影響。而無向邊則構成馬爾可夫隨機場,常用於沒有明確因果關係的場景,尤其適合描述圖像中像素之間對稱的依賴關係,這種表示方法保證了圖像生成的細節一致性。圖1展示了各類圖模型演變關係。
條件獨立性是機率圖模型中的一項關鍵特性。條件獨立性意味著在給定一些條件時,某些變數之間可以看作獨立。這個特性在生成式模型中非常重要,能夠幫助模型有效減少計算量,簡化生成過程並維持對變數依賴關係的細緻描述。例如,在生成長文本時,通過引入條件獨立性,可以簡化對長距離依賴的計算,提升生成效率。
在面對稀疏數據或信息缺失的情況下,機率圖模型可以確保生成結果具有一定的一致性和合理性。這一特性尤其適合生成式人工智慧中的自然語言生成和圖像生成任務,確保生成內容在邏輯與細節上更加自然。
生成對抗網路(GAN) 2014年,Ian Goodfellow等人提出生成對抗網路(GAN),一種通過對抗性學習實現高質量數據生成的模型架構。它的核心思想是利用生成器和判別器進行博弈,逐步最佳化生成效果,使生成數據的分布逐漸逼近真實數據的分布。生成器負責從隨機噪聲中生成樣本,儘量模仿真實數據的特徵,以騙過判別器。而判別器則承擔辨別真偽的角色,它接收生成器的樣本和真實樣本,不斷提升判斷的準確性。
在這一過程中,生成器與判別器處於不斷對抗的狀態。生成器每次生成樣本後,判別器都通過判斷結果來反饋生成器的生成質量。判別器不斷更新參數以增強自身識別能力,迫使生成器在不斷最佳化中生成更加逼真的樣本。通過這樣的對抗訓練,生成器逐漸學會模仿真實數據的特徵分布,最終生成的樣本在判別器面前接近於真實數據,使得判別器難以分辨。
這種對抗性的架構使得GAN具備了強大的生成能力, GAN的出現推動了圖像和視頻生成的顯著進展,被廣泛套用於藝術、設計和遊戲開發中。
自回歸生成模型 圖3 OpenAI Image GPT模型架構的示意圖 自回歸生成模型是一類基於序列預測的生成式模型,通過自回歸方式逐步生成序列中的每一個元素。在自然語言處理領域,自回歸模型通過條件機率建模,逐步預測序列中的下一個詞,從而生成符合上下文語境的文本內容。
自回歸生成模型的架構基於序列預測,每個時刻的輸出都是對前面已生成內容的條件依賴。在GPT中,模型採用了基於Transformer的架構,利用自注意力機制捕捉詞與詞之間的依賴關係。在生成過程中,模型逐步對序列中的每個詞進行條件機率建模。整體生成過程以一個初始詞或短語作為起點,基於上下文來預測接下來的詞,並在生成新詞後將其加入上下文中,而後繼續預測下一個詞。這個自回歸生成過程讓GPT可以根據上下文生成連貫且有邏輯的文本。
在GPT的自回歸架構中,自注意力機制是核心組件,使得模型能夠在每個生成步驟中聚焦於上下文中的重要部分。Transformer架構使得GPT能夠處理長距離依賴關係,讓生成內容保持一致性和邏輯性。並且,GPT還通過多層的神經網路和大量參數,讓模型具備高度的生成能力,能夠生成符合上下文要求的內容。圖3為OpenAI Image GPT模型架構的示意圖。
擴散模型 圖4 Stable Diffusion 模型原理圖 擴散模型(Diffusion Model)是一種基於機率擴散的生成式模型,其核心思想是通過對數據的逐步破壞再重建,生成新的數據。擴散模型在訓練階段對數據逐步加入噪聲,使其逐漸接近於隨機噪聲的狀態;在生成階段,模型反向地一步步去噪,將噪聲還原為有結構的樣本。這種逐步去噪的生成方式使擴散模型能夠生成高質量且真實感強的樣本。圖4為Stable Diffusion 模型原理圖。擴散模型的步驟原理如下:
正向擴散過程:
正向擴散是指對原始數據逐步加入噪聲的過程,其目標是將數據從有結構的形式逐步破壞到接近隨機噪聲的狀態。模型通過預設的步驟,在每一步中加入少量的隨機噪聲,使數據逐步失去原有的結構特徵。經過多次加噪後,數據最終會變為符合各個方向獨立且分布均勻的噪聲(類似高斯分布的隨機噪聲)。這一步為反向生成階段做好準備。
反向生成過程:
反向生成的目標是從隨機噪聲中逐步還原出目標數據。模型從一個隨機噪聲的起點出發,逐步去掉噪聲,使數據逐漸變得更有結構,接近目標數據的分布。在每一步,模型會根據前一階段學習到的規律,去除數據中的部分噪聲,同時保留恢復出的結構化信息。最終,經過多次去噪的處理,模型能夠生成逼近真實數據的樣本,比如清晰的圖像或結構化的聲音。
模型的特點與優勢:
擴散模型的逐步加噪與去噪過程確保了其生成質量和穩定性。生成的樣本真實感強,尤其適合圖像生成任務。並且逐步生成機制使模型在高複雜度任務中表現出更強的可靠性,模型適用於各種需要高質量輸出的任務。通過這樣的逐步擴散與去噪機制,擴散模型在生成任務中表現出了獨特的優勢。
相關認證 GAI認證 GAI認證,全稱生成式人工智慧(Generative AI Foundations)認證,是由全球知名的終身學習公司培生(Pearson)推出的。這個認證旨在為職場人士、學生以及所有對AI感興趣的朋友提供一套全面且實用的生成式人工智慧技能培訓框架及認證。
認證平台 生成式人工智慧認證(GAI認證)中文官網
統計數據 2025年1月17日,中國網際網路信息中心(CNNIC)發布第55次《中國網際網路發展狀況統計報告》。《報告》顯示,2024年生成式人工智慧相關產業快速發展,新業態、新套用持續湧現,為經濟社會的發展注入了強勁動能。截至12月,中國有3.31億人表示自己聽說過生成式人工智慧產品,占整體人口的23.5%;有2.49億人表示自己使用過生成式人工智慧產品,占整體人口的17.7%。在生成式人工智慧用戶中,利用生成式人工智慧產品回答問題的用戶最為廣泛,占比達77.6%;將生成式人工智慧產品作為辦公助手的用戶占比達45.5%。
截至2024年底,共302款生成式人工智慧服務在國家網信辦完成備案,算力總規模位居全球第二。生成式人工智慧產品的用戶規模達2.49億人,占整體人口的17.7%。從各年齡段網民的使用情況來看,20~29歲網民使用生成式人工智慧產品的比例最高,達41.5%。通過對使用過生成式人工智慧產品的用戶進一步調查發現,利用生成式人工智慧產品回答問題的用戶最為廣泛,使用率達77.6%;將生成式人工智慧產品作為自己的辦公助手的用戶比例為45.5%,主要用於生成會議紀要、製作PPT等。隨著生成式人工智慧的多模態大模型在2024年迅速發展,越來越多的用戶開始使用這類產品生成圖片、視頻,占比為31%。
截至2025年3月31日,共有346款生成式人工智慧服務在國家網信辦完成備案;對於通過API接口或其他方式直接調用已備案模型能力的生成式人工智慧套用或功能,共有159款生成式人工智慧套用或功能在地方網信辦完成登記。
2025年7月11日,“網信中國”訊息,促進生成式人工智慧服務創新發展和規範套用,網信部門會同有關部門按照《生成式人工智慧服務管理暫行辦法》要求,持續開展生成式人工智慧服務備案工作。截至2025年6月30日,累計有439款生成式人工智慧服務完成備案,233款生成式人工智慧套用或功能完成登記。
截至2025年7月14日,上海市新增5款已完成登記的生成式人工智慧服務,累計已完成100款生成式人工智慧服務登記。
2025年10月18日,中國網際網路信息中心在2025(第六屆)中國網際網路基礎資源大會上發布《生成式人工智慧套用發展報告(2025)》。報告顯示,截至2025年6月,中國生成式人工智慧用戶規模達5.15億人,較2024年12月增長2.66億人,用戶規模半年翻番;普及率為36.5%。
截至2025年11月1日,新增73款生成式人工智慧服務在國家網信辦完成備案,對於通過API接口或其他方式直接調用已備案模型能力的生成式人工智慧套用或功能,由地方網信辦開展登記,本階段新增35款完成登記。截至11月1日,累計有611款生成式人工智慧服務完成備案,306款生成式人工智慧套用或功能完成登記。
2026年1月,國家網際網路信息辦公室公告:2025年全年新增446款生成式人工智慧服務在國家網信辦完成備案,對於通過API接口或其他方式直接調用已備案模型能力的生成式人工智慧套用或功能,由地方網信辦開展登記,新增330款完成登記。截至2025年12月31日,累計有748款生成式人工智慧服務完成備案,435款生成式人工智慧套用或功能完成登記。
相關觀點 2025年2月27日,零一萬物CEO、創新工場董事長李開復在演講中表示,2025年將是AI套用爆發的起點,套用將會遍地開花,結出豐碩的成果。
2025年5月20日,國際勞工組織發布一份有關生成式人工智慧與就業的報告表示,全球四分之一的工作崗位可能受到生成式人工智慧影響。報告顯示,高收入國家就業崗位受生成式人工智慧影響的比例更高,達到34%。由於生成式人工智慧理論上能實現多種任務的自動化,文職類工作面臨的風險最為顯著。這些崗位曾是開發中國家增加女性就業的途徑,因此女性就業更易受到生成式人工智慧影響。