別被「1.6 兆參數」說服:買 Mac 跑本地 AI,先算記憶體
Apple 的統一記憶體與 MLX 分散式支援,提供了本地執行大型模型的路徑;但網傳能力表多項數字尚無官方資料佐證。啟動參數也不能直接換算成記憶體需求。選購前先確認模型、量化與上下文,再用目標工作負載實測。
📊 一張網傳能力表把 iPhone、iPad 到 Mac Studio 叢集排成階梯,最高一欄標示「1.6 兆啟動參數」。但表格沒有說明模型量化、上下文長度或測試條件;目前也找不到足以核實其來源及多項產品數字的官方資料。光看這個數字,無法判斷模型能否載入或跑得多快。 發布者:anson4139 可核實的官方資料,適用於特定機型。 Apple 在 2025 年公布,M3 Ultra Mac Studio 最高可配置 512GB 統一記憶體,記憶體頻寬超過 800GB/s;Apple 也表示,這款機器可在記憶體中執行超過 6,000 億參數的語言模型。這些資料說明 M3 Ultra Mac Studio 的記憶體容量可支援大型模型,但不能替網傳表格中的 M5 機型、1.2TB/s 頻寬或 1.6 兆啟動參數背書。就 M3 Ultra 而言,Apple 公布的頻寬是超過 800GB/s,不是表格所列的 1.2TB/s。 🧠 「啟動參數」不是模型記憶體需求的簡便算法。MoE 模型處理每個 token 時,可能只動用部分專家;載入模型時,仍須考慮全部權重。權重占用取決於模型總參數與量化格式,執行時還要為上下文快取、推理程序等預留記憶體。以 MLX-LM 專案的估算為例,744B 模型採 4-bit 權重約需 370GB。這個數字只估算權重;模型轉換或執行仍可能需要更多記憶體。因此,參數標籤既不能單獨判定模型能否載入,也不能預測推理速度。 多台 Mac 可以分散式運算,但部署需要設定,效能也不會按節點數自動增加。 MLX 文件指出,macOS 26.2 起,具 Thunderbolt 5 的 Mac 可使用 Thunderbolt RDMA,MLX 則透過 JACCL 支援分散式運算。啟用 RDMA 需進入 macOS 復原環境設定;部署時還要檢查節點連線、Thunderbolt 拓撲與 RDMA 狀態。這些文件證明技術路徑存在,並未獨立驗證特定四機組合或工作負載能達到接近三倍的生成速度。組叢集還須處理軟體相容與故障排查,不能只把各台記憶體相加,就當成一台已驗證的大容量工作站。
https://blog.buclaw.org/posts/1-6-mac-ai-mui34o0y