
本文整理自QCon北京《談鑒鋒、周天昱 - From Computer Use to Datacenter Use for AI》通過AI音視頻總結(jié)工具Ai好記進行視頻轉(zhuǎn)文字轉(zhuǎn)錄整理以下為精煉整理后的會議筆記內(nèi)容?,F(xiàn)在聊 AI Agent大家聽到最多的一句話是「給 Agent 一臺電腦讓它自己去工作」在虛擬環(huán)境里調(diào)工具、調(diào)接口、調(diào)大模型服務(wù)。但作者開頭拋出一個很關(guān)鍵的觀點如果 Agent 足夠聰明真正需要的是更粗的手和腳也就是算力。比如要做一個炒股的 Agent模型再聰明也讀不完一整年的交易數(shù)據(jù)它需要的是寫個程序去跑歷史數(shù)據(jù)、不斷優(yōu)化策略。這篇文章講螞蟻提出的 AKernel 基礎(chǔ)設(shè)施目標就是讓 Agent 能像用本地資源一樣快速拿到數(shù)據(jù)中心級別的算力。為什么叫 Datacenter UseComputer Use局限于單臺計算機的有限資源而Datacenter Use是讓 Agent 直接、無縫地調(diào)用跨節(jié)點、跨地域的數(shù)據(jù)中心算力、存儲和網(wǎng)絡(luò)資源按需、彈性、全局。作者判斷 Agent 往下發(fā)展有兩個趨勢把單個 agent 拆成產(chǎn)品經(jīng)理、開發(fā)、測試等角色分工協(xié)作Datacenter Use給聰明的大佬配上足夠的手腳現(xiàn)有云原生基礎(chǔ)設(shè)施的鴻溝從 2015 年容器和云原生火起來后基礎(chǔ)設(shè)施已經(jīng)從巔峰期走到落地期?,F(xiàn)狀是縱向分層、橫向分域帶來大量協(xié)同問題。雖然能支撐各家大促和容災(zāi)但靠的是日復(fù)一日的演練大促準備時間從半年壓到三個月再到一個月還是不夠。核心痛點對 Agent 來講讓它等一天都不可接受要的是分鐘級甚至秒級就有算力可用工業(yè)化細分程度已經(jīng)很高但要給 Agent 把算力真正用起來中間還有很大的 gap總不能配一個 50 人的團隊每天專門給 Agent 提供服務(wù)另一個判斷Agent 未來的用戶可能大量是 C 端用戶需要給每個人的眾多 Agent 都匹配 Datacenter Use 能力要能在全球算力池里找便宜的、合適的做出多云的感覺對應(yīng)一個Build Your Own Cluster的概念。三個技術(shù)支柱AKernel 是一套基礎(chǔ)設(shè)施為上層用戶提供及時可用的算力設(shè)計目標是縮小系統(tǒng)半徑做到輕量、高內(nèi)聚。它基于三個技術(shù)支柱搭建。第一支柱OpenYuanrong 分布式內(nèi)核作者對「分布式內(nèi)核」這個理念很認同認為它偶合性好計算、網(wǎng)絡(luò)、存儲的一體化設(shè)計能有效縮小系統(tǒng)半徑。主要能力提供相對寬松relaxed的存儲算力在哪就在哪搭一個足夠可用的存儲系統(tǒng)提供對象存儲和分布式存儲省掉了自建一套的成本提供函數(shù)系統(tǒng)和數(shù)據(jù)系統(tǒng)前者做資源調(diào)度管控后者做跨節(jié)點或節(jié)點內(nèi)跨沙箱的高效數(shù)據(jù)共享基于共享內(nèi)存完整的運行時接入SDK 支持 C、Python、Go 等方便用戶快速使用集群資源第二支柱AFaaS 安全沙箱沙箱是給 Agent 跑的運行時。它基于系統(tǒng)調(diào)用語義能從一個已保存好的沙箱狀態(tài)快速克隆出新的沙箱實現(xiàn)毫秒級甚至 10 秒內(nèi)的快速啟動同時保持強安全隔離能力。應(yīng)用場景支撐 Agent SandboxRL 訓練、蒸餾、評測對外 serving比如類似 Kimi 的 agent 場景快速拉起第三支柱鏡像懶加載加 P2P 分發(fā)問題當要同時拉起 1 萬個 Agent 沙箱時如果每個沙箱都從中心倉庫拉 3 到 5 個 G 的自定義鏡像流量根本扛不住效果是分級很慢。解決方案節(jié)點上的鏡像組件做 lazy load真正訪問到鏡像里的具體文件時才觸發(fā)拉取再用集群內(nèi)的鏡像加速組件建立緩存走 P2P 網(wǎng)絡(luò)加速分發(fā)效果可以從分級優(yōu)化到秒級關(guān)鍵技術(shù)特性1. 全鏈路 Checkpoint/Restore功能用戶可通過 SDK 或 CLI 對已拉起的沙箱做 checkpoint產(chǎn)生的鏡像存到數(shù)據(jù)系統(tǒng)需要時快速加載恢復(fù)觸發(fā)方式既可以用戶主動觸發(fā)也能通過函數(shù)系統(tǒng)檢測到閑置沙箱自動 checkpoint 和 restore價值這種狀態(tài)保存與恢復(fù)能力對訓練到一半的模型、故障恢復(fù)、狀態(tài)遷移都很有價值2. 雙向網(wǎng)絡(luò)代理本地到沙箱在集群里跑一個 Jupyter 服務(wù)可以暴露到本地直接訪問沙箱到本地做 RL rollout 時本地起推理引擎集群里的沙箱需要訪問本地的大模型服務(wù)也能通過另一個方向的代理打通3. 對話式部署流程把倉庫代碼 clone 下來打開 cloud code告訴它要在阿里云某個區(qū)域的集群部署一個 AKernel 集群只需提供云服務(wù)商的 SK就能在 10 分鐘內(nèi)自動完成多云集群搭建底層技術(shù)通過 Terraform 創(chuàng)建資源、Helm 編排、K8s 部署云支持目前基于 Terraform 已適配阿里云 ACK 和華為云 CCE運維簡化一個 CLI 能列出所有資源、進入沙箱排查Grafana 儀表盤、trace、日志都開箱即用4. 自帶監(jiān)控鏈路拉集群時就自帶一套監(jiān)控對每個節(jié)點資源內(nèi)存、磁盤、沙箱創(chuàng)建耗時都有監(jiān)控沙箱拉起能精確到調(diào)度 20 多毫秒、節(jié)點側(cè) 10 毫秒以內(nèi)小團隊運維的核心技術(shù)架構(gòu)AKernel 用統(tǒng)一的代碼庫維護OpenYuanrong 加各種開源組件放一個大庫日常研發(fā)用 AI 驅(qū)動AI 驅(qū)動運維示例容器拉起遇到故障打開 code 工具加一個強模型喂給它監(jiān)控和整個大庫代碼5 到 10 分鐘就能定位出原因團隊規(guī)模對比傳統(tǒng)方式維護一套 K8s 加節(jié)點操作系統(tǒng)內(nèi)核加調(diào)度系統(tǒng)加分布式存儲團隊少說也要 30 到 50 人AKernel 方式小于 3 人的全棧團隊就能維護核心優(yōu)勢輕量化設(shè)計加上 AI 驅(qū)動把需求、研發(fā)、測試、運維一個人端到端打通打破了基礎(chǔ)設(shè)施必須大團隊的固有認知。落地與展望當前落地情況這套體系在螞蟻的場景里已經(jīng)落地依賴集群快速拉起、函數(shù)系統(tǒng)和數(shù)據(jù)系統(tǒng)的高效調(diào)度與數(shù)據(jù)分發(fā)、沙箱快速啟動和安全隔離能力。核心價值三點AI 時代用少量人做大量事通過 AI 驅(qū)動運維大幅降低人力成本不讓基礎(chǔ)設(shè)施能力制約 Agent通過極致優(yōu)化釋放 Agent 對算力的需求讓開發(fā)者拿到代碼就能部署集群實現(xiàn)真正的 Datacenter Use未來方向持續(xù)支持 GPU、各種國產(chǎn)加速卡沙箱也會支持更多的通用運行時以上內(nèi)容由 Ai好記 轉(zhuǎn)錄整理。Ai好記是一款支持音視頻轉(zhuǎn)圖文筆記的AI知識庫工具支持B站、小紅書、抖音、小宇宙等平臺鏈接及本地音視頻文件視頻轉(zhuǎn)文字后自動生成精華速覽、思維導圖和結(jié)構(gòu)化圖文筆記幫助你把幾小時的視頻內(nèi)容變成可搜索、可復(fù)習的圖文筆記。