
本文整理自QCon北京《談鑒鋒、周天昱 - From Computer Use to Datacenter Use for AI》通過AI音視頻總結工具Ai好記進行視頻轉文字轉錄整理以下為精煉整理后的會議筆記內容。現在聊 AI Agent大家聽到最多的一句話是「給 Agent 一臺電腦讓它自己去工作」在虛擬環境里調工具、調接口、調大模型服務。但作者開頭拋出一個很關鍵的觀點如果 Agent 足夠聰明真正需要的是更粗的手和腳也就是算力。比如要做一個炒股的 Agent模型再聰明也讀不完一整年的交易數據它需要的是寫個程序去跑歷史數據、不斷優化策略。這篇文章講螞蟻提出的 AKernel 基礎設施目標就是讓 Agent 能像用本地資源一樣快速拿到數據中心級別的算力。為什么叫 Datacenter UseComputer Use局限于單臺計算機的有限資源而Datacenter Use是讓 Agent 直接、無縫地調用跨節點、跨地域的數據中心算力、存儲和網絡資源按需、彈性、全局。作者判斷 Agent 往下發展有兩個趨勢把單個 agent 拆成產品經理、開發、測試等角色分工協作Datacenter Use給聰明的大佬配上足夠的手腳現有云原生基礎設施的鴻溝從 2015 年容器和云原生火起來后基礎設施已經從巔峰期走到落地期?,F狀是縱向分層、橫向分域帶來大量協同問題。雖然能支撐各家大促和容災但靠的是日復一日的演練大促準備時間從半年壓到三個月再到一個月還是不夠。核心痛點對 Agent 來講讓它等一天都不可接受要的是分鐘級甚至秒級就有算力可用工業化細分程度已經很高但要給 Agent 把算力真正用起來中間還有很大的 gap總不能配一個 50 人的團隊每天專門給 Agent 提供服務另一個判斷Agent 未來的用戶可能大量是 C 端用戶需要給每個人的眾多 Agent 都匹配 Datacenter Use 能力要能在全球算力池里找便宜的、合適的做出多云的感覺對應一個Build Your Own Cluster的概念。三個技術支柱AKernel 是一套基礎設施為上層用戶提供及時可用的算力設計目標是縮小系統半徑做到輕量、高內聚。它基于三個技術支柱搭建。第一支柱OpenYuanrong 分布式內核作者對「分布式內核」這個理念很認同認為它偶合性好計算、網絡、存儲的一體化設計能有效縮小系統半徑。主要能力提供相對寬松relaxed的存儲算力在哪就在哪搭一個足夠可用的存儲系統提供對象存儲和分布式存儲省掉了自建一套的成本提供函數系統和數據系統前者做資源調度管控后者做跨節點或節點內跨沙箱的高效數據共享基于共享內存完整的運行時接入SDK 支持 C、Python、Go 等方便用戶快速使用集群資源第二支柱AFaaS 安全沙箱沙箱是給 Agent 跑的運行時。它基于系統調用語義能從一個已保存好的沙箱狀態快速克隆出新的沙箱實現毫秒級甚至 10 秒內的快速啟動同時保持強安全隔離能力。應用場景支撐 Agent SandboxRL 訓練、蒸餾、評測對外 serving比如類似 Kimi 的 agent 場景快速拉起第三支柱鏡像懶加載加 P2P 分發問題當要同時拉起 1 萬個 Agent 沙箱時如果每個沙箱都從中心倉庫拉 3 到 5 個 G 的自定義鏡像流量根本扛不住效果是分級很慢。解決方案節點上的鏡像組件做 lazy load真正訪問到鏡像里的具體文件時才觸發拉取再用集群內的鏡像加速組件建立緩存走 P2P 網絡加速分發效果可以從分級優化到秒級關鍵技術特性1. 全鏈路 Checkpoint/Restore功能用戶可通過 SDK 或 CLI 對已拉起的沙箱做 checkpoint產生的鏡像存到數據系統需要時快速加載恢復觸發方式既可以用戶主動觸發也能通過函數系統檢測到閑置沙箱自動 checkpoint 和 restore價值這種狀態保存與恢復能力對訓練到一半的模型、故障恢復、狀態遷移都很有價值2. 雙向網絡代理本地到沙箱在集群里跑一個 Jupyter 服務可以暴露到本地直接訪問沙箱到本地做 RL rollout 時本地起推理引擎集群里的沙箱需要訪問本地的大模型服務也能通過另一個方向的代理打通3. 對話式部署流程把倉庫代碼 clone 下來打開 cloud code告訴它要在阿里云某個區域的集群部署一個 AKernel 集群只需提供云服務商的 SK就能在 10 分鐘內自動完成多云集群搭建底層技術通過 Terraform 創建資源、Helm 編排、K8s 部署云支持目前基于 Terraform 已適配阿里云 ACK 和華為云 CCE運維簡化一個 CLI 能列出所有資源、進入沙箱排查Grafana 儀表盤、trace、日志都開箱即用4. 自帶監控鏈路拉集群時就自帶一套監控對每個節點資源內存、磁盤、沙箱創建耗時都有監控沙箱拉起能精確到調度 20 多毫秒、節點側 10 毫秒以內小團隊運維的核心技術架構AKernel 用統一的代碼庫維護OpenYuanrong 加各種開源組件放一個大庫日常研發用 AI 驅動AI 驅動運維示例容器拉起遇到故障打開 code 工具加一個強模型喂給它監控和整個大庫代碼5 到 10 分鐘就能定位出原因團隊規模對比傳統方式維護一套 K8s 加節點操作系統內核加調度系統加分布式存儲團隊少說也要 30 到 50 人AKernel 方式小于 3 人的全棧團隊就能維護核心優勢輕量化設計加上 AI 驅動把需求、研發、測試、運維一個人端到端打通打破了基礎設施必須大團隊的固有認知。落地與展望當前落地情況這套體系在螞蟻的場景里已經落地依賴集群快速拉起、函數系統和數據系統的高效調度與數據分發、沙箱快速啟動和安全隔離能力。核心價值三點AI 時代用少量人做大量事通過 AI 驅動運維大幅降低人力成本不讓基礎設施能力制約 Agent通過極致優化釋放 Agent 對算力的需求讓開發者拿到代碼就能部署集群實現真正的 Datacenter Use未來方向持續支持 GPU、各種國產加速卡沙箱也會支持更多的通用運行時以上內容由 Ai好記 轉錄整理。Ai好記是一款支持音視頻轉圖文筆記的AI知識庫工具支持B站、小紅書、抖音、小宇宙等平臺鏈接及本地音視頻文件視頻轉文字后自動生成精華速覽、思維導圖和結構化圖文筆記幫助你把幾小時的視頻內容變成可搜索、可復習的圖文筆記。