到多模態(tài)AGI:數(shù)據(jù)與計算如何重塑人工智能范式)
1. 從“苦澀的教訓(xùn)”談起AGI之路上的范式之爭最近在圈子里一篇名為“苦澀的教訓(xùn)”的短文又被翻了出來反復(fù)咀嚼。這篇由強(qiáng)化學(xué)習(xí)先驅(qū)理查德·薩頓撰寫的文章雖然篇幅不長卻像一把精準(zhǔn)的手術(shù)刀剖開了我們追求通用人工智能AGI道路上最核心、也最令人不安的癥結(jié)。文章的核心觀點用大白話講就是過去七十年里AI研究最大的教訓(xùn)是那些試圖將人類知識、邏輯或特定領(lǐng)域結(jié)構(gòu)“硬編碼”進(jìn)AI系統(tǒng)的努力最終都被基于大規(guī)模計算和數(shù)據(jù)的“蠻力”方法所超越。這個結(jié)論對于許多深耕于符號主義、知識圖譜或試圖為AI設(shè)計“完美架構(gòu)”的研究者而言無疑是苦澀的。為什么說它“苦澀”因為這挑戰(zhàn)了我們作為智能生物的一種本能優(yōu)越感。我們總認(rèn)為人類的智慧是精妙的、結(jié)構(gòu)化的、充滿先驗知識的。我們試圖讓機(jī)器模仿我們的思維方式為它們設(shè)計復(fù)雜的推理引擎、知識表示框架和邏輯規(guī)則。然而“苦澀的教訓(xùn)”指出這種“人類中心主義”的路徑效率低下。真正的突破往往來自于放手讓簡單的學(xué)習(xí)算法比如搜索、神經(jīng)網(wǎng)絡(luò)在近乎無限的計算資源和海量數(shù)據(jù)的驅(qū)動下自己去發(fā)現(xiàn)規(guī)律。從國際象棋到圍棋從圖像識別到自然語言處理歷史一再證明基于搜索和學(xué)習(xí)的方法最終碾壓了基于人類專家知識精心設(shè)計的系統(tǒng)?,F(xiàn)在當(dāng)我們談?wù)揂GI特別是結(jié)合最新的“多模態(tài)AGI”熱潮時這個教訓(xùn)顯得愈發(fā)尖銳。多模態(tài)AGI不再是處理單一的文字或圖片它要求模型能理解、關(guān)聯(lián)并生成跨越文本、圖像、音頻、視頻甚至更多感官模態(tài)的信息。面對如此復(fù)雜的任務(wù)我們是應(yīng)該投入巨大精力去設(shè)計一個能“理解”世界運(yùn)作原理的超級符號系統(tǒng)還是應(yīng)該構(gòu)建一個足夠龐大的模型用前所未有的算力和數(shù)據(jù)去“喂”它讓它自己從原始信號中涌現(xiàn)出跨模態(tài)的理解能力當(dāng)前的趨勢顯然強(qiáng)烈地指向后者。這不僅是技術(shù)路徑的選擇更是一種思維范式的根本轉(zhuǎn)變。2. “蠻力”的勝利計算與數(shù)據(jù)何以成為AGI的基石薩頓所說的“苦澀的教訓(xùn)”其底層邏輯是“可擴(kuò)展性”的勝利。人類知識是寶貴的但也是有限的、有偏見的、難以形式化的。而計算和數(shù)據(jù)的增長在過去幾十年里遵循著近乎指數(shù)級的摩爾定律和數(shù)據(jù)爆炸規(guī)律。一個依賴于人類先驗知識的系統(tǒng)其性能天花板在系統(tǒng)設(shè)計之初就被鎖定了。但一個基于學(xué)習(xí)和搜索的系統(tǒng)其性能理論上可以隨著投入的計算資源和數(shù)據(jù)量無限提升。我們可以看看幾個標(biāo)志性的案例。深藍(lán)擊敗卡斯帕羅夫核心是暴力搜索結(jié)合了精心調(diào)校的評估函數(shù)其中的人類象棋知識已經(jīng)讓位于強(qiáng)大的算力。而AlphaGo擊敗李世石則是一個更純粹的“苦澀教訓(xùn)”范例。它初期通過人類棋譜學(xué)習(xí)模仿學(xué)習(xí)但最終超越人類的AlphaGo Zero和AlphaZero完全摒棄了人類知識僅通過自我對弈強(qiáng)化學(xué)習(xí)和蒙特卡洛樹搜索從零開始發(fā)現(xiàn)了甚至顛覆人類千年圍棋定式的下法。它的“智能”完全源于海量的模擬對局和計算。到了今天的多模態(tài)大模型如GPT-4V、Gemini等這一趨勢達(dá)到了新的高度。這些模型沒有內(nèi)置的“視覺常識推理模塊”或“圖文對齊知識庫”。它們所有的“理解”能力都來自于在數(shù)萬億token的文本和數(shù)百億張圖像-文本配對數(shù)據(jù)上的訓(xùn)練。模型通過海量數(shù)據(jù)自發(fā)地學(xué)習(xí)到了像素陣列與語言描述之間復(fù)雜的統(tǒng)計關(guān)聯(lián)從而能夠進(jìn)行看似需要深層理解的跨模態(tài)任務(wù)比如根據(jù)描述生成圖像、回答關(guān)于圖片的復(fù)雜問題等。這里的“智能”是一種從數(shù)據(jù)分布中涌現(xiàn)出來的屬性而非預(yù)設(shè)的規(guī)則。這帶來了一個關(guān)鍵啟示在通往AGI的道路上構(gòu)建一個能夠高效利用近乎無限計算和數(shù)據(jù)的學(xué)習(xí)架構(gòu)比試圖將人類所有知識編碼進(jìn)去更為根本和有效。這個架構(gòu)需要具備極端的可擴(kuò)展性模型規(guī)模、數(shù)據(jù)規(guī)模、計算規(guī)模、強(qiáng)大的泛化能力以及從多模態(tài)原始數(shù)據(jù)中自我學(xué)習(xí)的能力。當(dāng)前基于Transformer的架構(gòu)配合海量數(shù)據(jù)和分布式訓(xùn)練正是這一思想的體現(xiàn)。它的成功不在于其結(jié)構(gòu)多么精巧地模仿了人腦而在于它作為一個“計算容器”能夠貪婪地吸收并利用計算與數(shù)據(jù)資源。3. 多模態(tài)AGI當(dāng)前實踐如何印證并挑戰(zhàn)“教訓(xùn)”“多模態(tài)AGI”作為最新的熱點可以看作是“苦澀的教訓(xùn)”在更復(fù)雜戰(zhàn)場上的延續(xù)和壓力測試。當(dāng)前的實踐強(qiáng)烈印證了數(shù)據(jù)與計算的核心地位但也暴露出這一路徑下的新挑戰(zhàn)。印證方面所有領(lǐng)先的多模態(tài)模型其核心能力無一不是通過在海量、高質(zhì)量的多模態(tài)對齊數(shù)據(jù)上進(jìn)行大規(guī)模預(yù)訓(xùn)練獲得的。例如訓(xùn)練一個既能看懂圖又能生成文字描述的模型需要數(shù)以億計的圖像文本描述配對數(shù)據(jù)。模型的性能與訓(xùn)練數(shù)據(jù)的規(guī)模和質(zhì)量呈現(xiàn)出強(qiáng)烈的相關(guān)性。沒有這些數(shù)據(jù)再精巧的模型設(shè)計也無濟(jì)于事。同時訓(xùn)練這些模型所需的算力是天文數(shù)字進(jìn)一步凸顯了“計算”作為核心資源的地位。模型從這些數(shù)據(jù)中“自學(xué)”出了顏色、形狀、空間關(guān)系、物體功能乃至社會常識的關(guān)聯(lián)這個過程幾乎沒有注入顯式的人類知識規(guī)則。挑戰(zhàn)方面“苦澀的教訓(xùn)”路徑在多模態(tài)場景下也遇到了新的“苦澀”。數(shù)據(jù)瓶頸與對齊難題高質(zhì)量、精準(zhǔn)對齊的多模態(tài)數(shù)據(jù)如圖文對、視頻-文本對的獲取和清洗成本極高?;ヂ?lián)網(wǎng)上的數(shù)據(jù)噪音大存在大量錯誤關(guān)聯(lián)或描述模糊的數(shù)據(jù)。模型從有噪聲的數(shù)據(jù)中學(xué)習(xí)會繼承甚至放大這些偏見和錯誤。這就是為什么多模態(tài)模型有時會產(chǎn)生“幻覺”——生成與輸入圖像無關(guān)或事實錯誤的文本。這可以看作是一種新的“教訓(xùn)”即使有海量計算數(shù)據(jù)的質(zhì)量和對齊精度成為了新的瓶頸。“理解”還是“關(guān)聯(lián)”批評者認(rèn)為大模型學(xué)到的只是表面上的統(tǒng)計關(guān)聯(lián)而非真正的因果理解。例如模型知道“蘋果”這個詞常與紅色圓形物體和“吃”這個動作一起出現(xiàn)但它是否理解蘋果是一種水果、可以生長在樹上、有營養(yǎng)價值根據(jù)“苦澀的教訓(xùn)”我們或許不該糾結(jié)于這種哲學(xué)意義上的“理解”只要這種統(tǒng)計關(guān)聯(lián)足夠強(qiáng)大和泛化能解決復(fù)雜任務(wù)就可以視作一種有效的智能形式。然而在需要深度推理、因果判斷或長鏈條規(guī)劃的AGI任務(wù)中僅靠統(tǒng)計關(guān)聯(lián)可能力有不逮。能耗與可持續(xù)性這條路徑是極度“貪婪”的對算力和電力的需求不斷攀升。訓(xùn)練一個頂尖多模態(tài)模型的碳足跡可能相當(dāng)驚人。這引發(fā)了關(guān)于技術(shù)路徑可持續(xù)性的倫理和社會思考。純粹的“規(guī)模擴(kuò)張”是否有一個物理或經(jīng)濟(jì)上的極限我們是否需要尋找更高效的學(xué)習(xí)算法在吸收“苦澀教訓(xùn)”精髓的同時降低對資源的依賴注意在多模態(tài)模型開發(fā)中數(shù)據(jù)質(zhì)量的重要性已經(jīng)超越了數(shù)據(jù)規(guī)模的粗放增長。構(gòu)建一個干凈、多樣、對齊精準(zhǔn)的高質(zhì)量數(shù)據(jù)集往往比單純堆砌十倍規(guī)模的噪聲數(shù)據(jù)更能提升模型性能并能顯著降低后續(xù)對齊和糾偏的成本。4. 超越“苦澀”尋找下一階段的合成路徑完全擁抱“苦澀的教訓(xùn)”意味著將AGI的研究完全押注在擴(kuò)大模型規(guī)模、收集更多數(shù)據(jù)、投入更多算力上。這固然是當(dāng)前的主航道且潛力巨大但我們也應(yīng)看到其局限性。未來的AGI之路可能需要一種新的合成在接納“規(guī)模優(yōu)先”這一核心教訓(xùn)的基礎(chǔ)上巧妙地融入結(jié)構(gòu)化先驗和因果推理而不是簡單地回到老路。首先我們需要區(qū)分“有害的先驗”和“有用的歸納偏置”?!翱酀慕逃?xùn)”反對的是那些過于具體、僵化、限制系統(tǒng)學(xué)習(xí)能力的人類知識例如為圍棋程序編寫具體的開局定式。但它并不反對為學(xué)習(xí)系統(tǒng)提供一些更通用、更底層的“歸納偏置”。例如卷積神經(jīng)網(wǎng)絡(luò)CNN的局部連接和權(quán)重共享思想就是一種針對圖像空間局部相關(guān)性的有效歸納偏置它極大地提升了學(xué)習(xí)效率。對于多模態(tài)AGI類似的偏置可能包括對時空連續(xù)性的假設(shè)、對物體持久性的假設(shè)、對因果方向性的偏好等。將這些作為模型架構(gòu)的軟約束而非硬規(guī)則可以引導(dǎo)學(xué)習(xí)更快地收斂到更好的解空間而不是從零開始“重新發(fā)明輪子”。其次強(qiáng)化學(xué)習(xí)與基礎(chǔ)模型的結(jié)合可能是關(guān)鍵突破口?!翱酀慕逃?xùn)”源于強(qiáng)化學(xué)習(xí)領(lǐng)域而當(dāng)前的大語言/多模態(tài)模型主要是通過自監(jiān)督學(xué)習(xí)獲得知識。讓這些擁有龐大先驗知識的基礎(chǔ)模型在一個模擬或真實的環(huán)境中通過強(qiáng)化學(xué)習(xí)進(jìn)行“試錯”和“目標(biāo)驅(qū)動”的學(xué)習(xí)是讓它們從“知識庫”邁向“智能體”的必經(jīng)之路。AlphaGo Zero的成功已經(jīng)展示了自我博弈強(qiáng)化學(xué)習(xí)的威力。將這種范式應(yīng)用于擁有多模態(tài)理解能力的基礎(chǔ)模型讓它們?yōu)榱送瓿蓮?fù)雜任務(wù)如操作軟件、控制機(jī)器人、進(jìn)行科學(xué)研究而主動規(guī)劃、行動并從結(jié)果中學(xué)習(xí)有望催生出更接近AGI的行為能力。最后模塊化與系統(tǒng)化思維可能重新變得重要。一個純粹的、單一的巨大模型可能并非AGI的最優(yōu)形態(tài)。未來的系統(tǒng)或許是由多個 specialized 的、通過“苦澀教訓(xùn)”方式訓(xùn)練出來的大模型通過一種可學(xué)習(xí)的、靈活的協(xié)作機(jī)制組成。有的模塊擅長感知有的擅長規(guī)劃有的擅長工具使用。系統(tǒng)架構(gòu)本身也可以被優(yōu)化。這樣既能保持每個模塊強(qiáng)大的數(shù)據(jù)驅(qū)動學(xué)習(xí)能力又能通過架構(gòu)引入必要的功能分離和協(xié)作邏輯以應(yīng)對超長鏈條、需要多種認(rèn)知能力的復(fù)雜任務(wù)。我個人的體會是“苦澀的教訓(xùn)”不是一個終點而是一個路標(biāo)。它告訴我們不要試圖用人類的智力去“雕刻”AI而要為AI的自我成長提供最肥沃的土壤——無限的計算和數(shù)據(jù)以及一個足夠開放的學(xué)習(xí)框架。但在開墾這片土壤時我們可以選擇播下更有潛力的“種子”更好的歸納偏置并設(shè)計更高效的“灌溉系統(tǒng)”更優(yōu)的學(xué)習(xí)算法與架構(gòu)。多模態(tài)AGI的征程正是我們在這條被指明的道路上面對新挑戰(zhàn)尋找新平衡點的持續(xù)探索。最終那個能通過圖靈測試、能通用地解決各類問題的系統(tǒng)很可能既不是純粹符號主義的結(jié)晶也不是完全無引導(dǎo)的暴力產(chǎn)物而是在深刻吸收了這一“苦澀教訓(xùn)”之后進(jìn)化出的一個更高級的合成體。