一臺Mac也能跑Kimi K3!128GB內(nèi)存硬塞1.6TB權(quán)重
Kimi K3 開放完整權(quán)重后不少人都躍躍欲試。2.8 萬億參數(shù)、官方 MXFP4 權(quán)重?fù)碛辛诉@些你就可以自己搗鼓這個規(guī)模巨大的模型可以部署到本地?,F(xiàn)實情況真有這么簡單嗎有人總結(jié)運行 Kimi K3 其實很容易只需要 1.5TB GPU 內(nèi)存、大約 8 張 H100以及一座小型變電站。很快有人算了一筆賬按照這張粗略的成本表如果將大容量 GPU 服務(wù)器和供電設(shè)施都算進(jìn)去整套配置可能觸及百萬美元。這么一看好像已經(jīng)和我們這些「個人玩家」沒什么關(guān)系了。也有人不死心開始認(rèn)真研究能不能通過量化把這個 2.8 萬億參數(shù)模型強行塞進(jìn)個人設(shè)備。只不過評論區(qū)對此普遍不太樂觀。但沒想到還真有人在一臺ac 上跑起來了。128GB 的 Mac真把 1.6TB 權(quán)重塞下了一名開發(fā)者拿出一臺 128GB 統(tǒng)一內(nèi)存的 M5 Max直接加載 Kimi K3 發(fā)布在 Hugging Face 上的官方 MXFP4 權(quán)重。這套權(quán)重足足有 1.56TB體積超過設(shè)備內(nèi)存十倍顯然無法一次性完整載入。他的辦法是讓約 97GiB 的靜態(tài)權(quán)重常駐內(nèi)存其余部分不一次性加載而是在推理過程中從固態(tài)硬盤持續(xù)讀取。模型運行到哪一層對應(yīng)的權(quán)重才被送入內(nèi)存參與計算。這樣一來128GB 內(nèi)存不需要同時裝下整個模型只需要容納常駐權(quán)重和當(dāng)前參與計算的部分。最終Kimi K3 真的開口了。開發(fā)者先問了一句「How are you」模型正?;卮稹窱 am fine, thank you」。隨后他又讓模型解釋 Transformer 中的注意力機制Kimi K3 也開始生成回答。但輸出速度相當(dāng)緩慢。測試中模型處理輸入的速度約為 0.98 token/s生成速度只有 0.32 token/s。換算下來每生成一個 token 大約需要三秒。一個正常長度的回答可能要等上幾分鐘。這至少證明了一件事一臺只有 128GB 內(nèi)存的 Mac確實能夠以流式讀取的方式運行 1.6TB 的 Kimi K3 官方權(quán)重。不過這只解決了容量問題。權(quán)重需要不斷從硬盤搬進(jìn)內(nèi)存模型每生成一個 token都要等待大量數(shù)據(jù)完成讀取和計算推理速度自然很難提高。開發(fā)者也表示這套方案目前主要用來調(diào)通推理圖。下一步他準(zhǔn)備把模型進(jìn)一步壓縮到 Q2再使用兩臺各配備 512GB 統(tǒng)一內(nèi)存的 Mac Studio嘗試把速度提升到可以正常聊天的水平。顯然如果不想讓 Kimi K3 的語速「快得像閃電」——《瘋狂動物城》里的那只樹懶只用一臺 128GB 的 Mac 是不行的。80 張 5090這是真能用繼續(xù)壓縮是不太行了還有人選擇把顯卡數(shù)量提上去。Ning 團隊使用 80 張 RTX 5090完整運行了 2.8 萬億參數(shù)的 Kimi K3。整套系統(tǒng)由 10 個節(jié)點組成每個節(jié)點安裝 8 張 RTX 5090總顯存達(dá)到 2.56TB。團隊直接使用 Kimi 官方發(fā)布的 MXFP4 權(quán)重沒有進(jìn)一步量化。在首日測試中Kimi K3 的單流推理速度達(dá)到了 20 token/s。相比 Mac 上的 0.32 token/s輸出速度提高了六十多倍基本進(jìn)入可以正常對話的范圍。這套方案使用仍然是消費級顯卡。RTX 5090 搭載 GDDR7 顯存不具備 HBM 和 NVLink10 個節(jié)點之間也只通過 25GbE 以太網(wǎng)連接。80 張 5090 提供了 2.56TB 總顯存和約 143TB/s 聚合帶寬高于 32 張 H100 方案的 107TB/s 和 16 張 B200 方案的 128TB/s。當(dāng)然聚合帶寬無法直接代表整套系統(tǒng)的推理性能多節(jié)點通信、算子效率和調(diào)度開銷都會影響最終速度。即便如此20 token/s 的實測結(jié)果已經(jīng)證明消費級 GPU 集群也能以可用速度運行完整 Kimi K3。團隊表示這還只是首日、未經(jīng)充分優(yōu)化的結(jié)果。此前他們曾將 4090 集群運行 GLM-5.2 的速度從 30 token/s 提升至 110 token/sKimi K3 仍有繼續(xù)提速的空間。相比傳統(tǒng)的數(shù)據(jù)中心 GPU 方案這條路線降低了對 HBM 和高速互聯(lián)設(shè)備的依賴但 80 張 5090、10 個節(jié)點以及配套的網(wǎng)絡(luò)、供電和散熱設(shè)施投入依然相當(dāng)可觀。這么看來一臺 ThinkPad 確實不可能80 張游戲顯卡倒是可以跑。

相關(guān)新聞

OpenCV模板匹配實戰(zhàn):從原理到多目標(biāo)檢測與性能優(yōu)化

OpenCV模板匹配實戰(zhàn):從原理到多目標(biāo)檢測與性能優(yōu)化

1. 項目概述:從“找茬”到工業(yè)質(zhì)檢,模板匹配的實戰(zhàn)價值如果你玩過“大家來找茬”這類游戲,或者用過手機上的“以圖搜圖”功能,那你已經(jīng)對圖像匹配有了最直觀的感受。在工業(yè)自動化、安防監(jiān)控、甚至我們?nèi)粘5奈臋n處理中&#xff0c…

2026/8/2 10:25:21 閱讀更多
WSaiOS應(yīng)用工程實踐WSaiOS Application Engineering Practice

WSaiOS應(yīng)用工程實踐WSaiOS Application Engineering Practice

第九卷WSaiOS應(yīng)用工程實踐WSaiOS Application Engineering Practice第十章WSaiOS應(yīng)用工程發(fā)展方向WSaiOS Application Engineering Future Development10.1 項目概述WSaiOS應(yīng)用工程發(fā)展方向,是對WSaiOS應(yīng)用體系未來擴展路徑的規(guī)劃。經(jīng)過前面多個工程系統(tǒng)建設(shè)&#x…

2026/8/2 11:15:23 閱讀更多
3分鐘搞定!QQ空間歷史說說完整備份終極指南

3分鐘搞定!QQ空間歷史說說完整備份終極指南

3分鐘搞定!QQ空間歷史說說完整備份終極指南 【免費下載鏈接】GetQzonehistory 獲取QQ空間發(fā)布的歷史說說 項目地址: https://gitcode.com/GitHub_Trending/ge/GetQzonehistory 你是否曾想過,那些年發(fā)過的QQ空間說說,那些記錄青春的文字…

2026/8/2 0:04:01 閱讀更多
3分鐘搞定!QQ空間歷史說說完整備份終極指南

3分鐘搞定!QQ空間歷史說說完整備份終極指南

3分鐘搞定!QQ空間歷史說說完整備份終極指南 【免費下載鏈接】GetQzonehistory 獲取QQ空間發(fā)布的歷史說說 項目地址: https://gitcode.com/GitHub_Trending/ge/GetQzonehistory 你是否曾想過,那些年發(fā)過的QQ空間說說,那些記錄青春的文字…

2026/8/2 0:04:01 閱讀更多
AMAT 0100-02186 I/O 分配 PCB

AMAT 0100-02186 I/O 分配 PCB

AMAT 0100-02186 I/O分配PCB板是應(yīng)用材料(Applied Materials)公司生產(chǎn)的一款用于半導(dǎo)體設(shè)備的I/O信號分配電路板。該型號(0100-02186)的核心特點如下:專用于Endura等半導(dǎo)體工藝腔室。集成信號路由與分配功能。連接控制…

2026/8/2 2:51:21 閱讀更多
Nissei Corp FFMN-32L-10-T0 40AX 三相異步電動機

Nissei Corp FFMN-32L-10-T0 40AX 三相異步電動機

Nissei Corp FFMN-32L-10-T0 40AX 三相異步電動機是日本日清(Nissei)品牌的一款工業(yè)用三相異步電機,適用于自動化設(shè)備及通用機械驅(qū)動。該型號(FFMN-32L-10-T0 40AX)的核心特點如下:三相交流異步電動機。額定…

2026/8/2 2:52:49 閱讀更多