AndroidLab

AndroidLab是由清華大學與北京大學研究團隊於2024年11月推出的一個Android智慧型體訓練與評估框架。它提供了一個集成文本和圖像模態操作環境、統一操作空間及可重現基準測試的系統化環境。

該框架包含一個覆蓋9個常見套用的基準測試,共138個任務,涵蓋操作與查詢任務類型。它設計了XML和SoM兩種操作模式以分別支持LLMs和LMMs,並引入了Android Instruct數據集用於模型訓練。AndroidLab已被用於評估MobileRL、UI-Genie、ZeroGUI、AutoGLM等多種移動端GUI智慧型體。

基本介紹

  • 外文名:AndroidLab
開發背景與目標,核心特性與設計,評估體系,數據集與訓練,性能表現與影響,套用案例,

開發背景與目標

AndroidLab是由清華大學與北京大學的研究團隊開發的一個Android代理訓練與評估框架。該框架於2024年11月推出。
其核心目標是解決移動GUI智慧型體研究領域缺乏統一、可復現評估標準的問題。為此,AndroidLab提供了一個集成了文本和圖像模態操作環境、定義了統一操作空間並包含可復現基準測試的系統框架。

核心特性與設計

AndroidLab是一個由清華大學與北京大學研究團隊開發的、用於Android智慧型體訓練與評估的綜合性框架,旨在為基於大語言模型和多模態大模型的智慧型體提供一個標準化的互動環境、統一的操作空間以及可重現的基準測試,以支持公平的性能比較和系統性研究。
該框架定義了一個標準化的操作環境,能夠支持LLMs和LMMs在相同的操作空間內進行互動,從而支持不同模型間的公平比較。
為滿足不同模態模型的需求,AndroidLab設計了XML模式和SoM(Set-of-Mark)模式兩種操作模式。XML模式專為文本輸入的LLMs設計,通過壓縮的XML信息傳遞界面狀態,模型直接選擇元素執行操作;SoM模式針對LMMs設計,將螢幕截圖與標記信息結合,模型選擇帶有編號的標記元素進行操作。
為進一步提升智慧型體在複雜任務中的表現,框架集成了ReAct框架和SeeAct框架兩種高級操作框架。ReAct框架基於逐步推理和操作輸出,模型在輸出操作的同時展示中間推理過程;SeeAct框架將推理與操作分離,分兩輪互動進行,首輪生成詳細推理步驟,次輪執行具體操作。
AndroidLab內置了一個包含138個任務的基準測試,覆蓋9個常見套用,任務類型包括操作任務和查詢任務。為精準評估智慧型體表現,基準測試引入了任務完成率、子目標成功率、反向冗餘率、合理操作比率等多個評價指標。

評估體系

AndroidLab定義了一個覆蓋9個常見應用程式的基準測試,共包含138個任務。這些任務分為操作任務和查詢檢測任務兩大類。
用於評估智慧型體任務表現的指標包括任務完成率(SR)、子目標成功率(Sub-SR)、反向冗餘率(RRR)和合理操作比率(ROR)。
對於操作任務,通過XML樹結構匹配來驗證每個子目標的完成情況。查詢檢測任務則可能由GPT進行評分。

數據集與訓練

AndroidLab框架配套構建了名為Android Instruct的數據集,用於對智慧型體模型進行監督微調(SFT),以提升其在移動GUI互動任務中的表現。該數據集包含726條操作軌跡和超過6000個步驟,採用自動化探索與人工標註相結合的方式生成高質量運算元據。使用該數據集對開源模型進行指令微調後,模型性能得到顯著提升,例如在XML模式下,開源大語言模型(LLM)的平均任務成功率從4.59%提升至21.50%,多模態模型(LMM)的平均成功率從1.93%提升至13.28%。

性能表現與影響

在AndroidLab基準測試中,閉源模型如GPT-4系列在XML和SoM模式下均取得最高成功率,其中GPT-4-1106-Preview在XML模式下任務成功率為31.16%,GPT-4o在SoM模式下任務成功率為31.16%。開源模型經過指令微調後,平均任務成功率從4.59%提升至21.50%(LMM從1.93%提升至13.28%),顯著縮小了與閉源模型的性能差距。實驗表明,ReAct框架在XML模式下能有效提高複雜任務的任務完成率,幫助模型更好地分步推理和操作。
MobileRL框架使用GLM-4.1V-9B模型在AndroidLab上達到46.8%的成功率。此外,UI-Genie在AndroidLab上任務成功率為38.7%,AutoGLM成功率為36.2%,ZeroGUI也顯示出性能提升。
AndroidLab框架為移動GUI智慧型體研究的性能對比與未來改進方向提供了標準化基準,通過定義統一操作空間、評估指標和基準任務,推動了領域的公平比較和性能最佳化。

套用案例

2024年11月,清華大學和北京大學團隊推出AndroidLab時,構建了AndroidInstruct數據集,經微調後開源大語言模型在基準上的平均成功率從4.59%提升至21.50%。2024年12月,智譜團隊開發的AutoGLM智慧型體在AndroidLab上的成功率達到36.2%。2025年5月,UI-Genie-Agent-7B模型在AndroidLab上實現了38.7%的任務成功率。2025年6月,ZeroGUI方法在AndroidLab的操作任務子集上評估時,在子目標成功率指標上實現了+2.9的提升。2025年8月,清華大學與智譜團隊提出的MobileRL框架在AndroidLab基準上取得了46.8%的成功率。

相關詞條

熱門詞條

聯絡我們