地端 AI 部署完整指南:企業自建 AI 基礎設施的規劃與實作
大型語言模型已從單人試用走向多人共享、長上下文與 AI Agent。地端部署能讓企業掌握資料流向、模型版本與服務容量,但硬體選型也已從 RTX 4090、A100、H100 世代,進入 DGX Spark、RTX PRO 6000 Blackwell、H200、B200 與 B300 並存的階段。本指南以 2026 年 8 月可採購的平台,重新整理企業地端 AI 的硬體、軟體、安全與維運決策。
地端 AI 部署的核心優勢與適用場景
地端 AI(On-Premise AI)是指企業將 AI 模型與推論服務部署在自有或租用的實體機房中,所有資料的處理、儲存與模型推論均在企業可控的物理邊界內進行。與雲端 AI 服務相比,地端部署在資料主權、法規合規、延遲效能與長期成本上具有明顯優勢。
核心優勢之一是資料主權。企業機密文件、客戶個資、財務報表等敏感資料無需離開企業網路,可移除「資料被送往第三方雲端處理」這條風險路徑,並讓資料流向的說明與舉證變得單純許多。要注意的是,這降低的是特定一類風險,而非全部:端點被入侵、內部權限過大、備份媒體外流、軟體與模型更新的供應鏈風險,都仍需個別設計控制措施。
在法規面向上,台灣並沒有一部統一的資料在地化法。實務上的在地化壓力來自個人資料保護法對國際傳輸的限制、資通安全管理法對公務機關與特定非公務機關的資安維護義務(依資通安全責任等級 A 至 E 分級)、金管會對金融機構作業委外與運用 AI 的相關規範,以及醫療法規與衛生福利部對病歷與醫療資訊的保護要求。地端部署通常較容易對應這些要求,但是否合規仍須依資料類型、機構性質與實際資料流逐項判斷。實際適用範圍與作業要求,仍應以主管機關最新公告及貴機關(或貴公司法務)認定為準。
第二個核心優勢是延遲可控。透過外部 API 呼叫時,每次請求都要經過網際網路往返,也無法控制供應商的排隊狀況。尖峰時段的延遲波動往往比平均值更難處理。地端部署把推論放在內網,延遲主要由企業自己的硬體、批次與同時請求設定決定,因此較容易訂出服務水準。
不過「地端一定比雲端快」仍是過度簡化。實際延遲會受到模型大小、量化方式、KV cache、上下文長度、同時使用人數與推論框架影響。比較時應使用相同提示詞與流量曲線,量測首個 Token 產出時間、每秒輸出 Token 數與 P95 延遲,再決定是否採購。
第三是成本可預測。雲端 API 適合流量尚未穩定、需要快速取得前沿模型的情境;地端設備則適合長期且穩定的高使用量、固定模型版本或嚴格資料治理。不能只比較 Token 單價與 GPU 卡價,還要把伺服器、網路、機房供電、散熱、軟體授權、維運人力、備援與硬體折舊納入一年至三年的總持有成本。
適合考慮地端 AI 部署的場景包括:金融機構的內部知識庫與文件處理、政府機關的公文自動化與輔助決策、醫療機構的病歷分析、製造業的品管知識管理與設備維護,以及需要在離線或網路品質不穩定環境中執行 AI 的情境。
硬體選型指南:GPU 伺服器規格解析
地端 AI 的核心不是只買一張最快的 GPU,而是讓模型權重、KV cache、同時請求量、記憶體頻寬、GPU 互連、供電與散熱形成可維運的系統。不同世代的 FP16、FP8、FP4 數字不能直接橫向比較,因此下表改用平台級距與實際部署角色整理。
| 平台 | 加速器記憶體 | 記憶體頻寬 | 適合工作負載 | 部署定位 |
|---|---|---|---|---|
| NVIDIA DGX Spark | 128 GB LPDDR5x 統一記憶體 | 273 GB/s | 個人與小組 PoC、Agent 原型、模型評估與微調測試 | 桌上型開發平台,適合驗證,不宜直接當成多人正式推論伺服器 |
| NVIDIA RTX PRO 6000 Blackwell Server Edition | 96 GB GDDR7 ECC | 1,597 GB/s | 中型開放權重模型、多模態文件、視覺運算與部門級共享服務 | 工作站與伺服器的成本效益路線,可從單卡擴充至多卡 |
| NVIDIA H200 SXM/NVL | 141 GB HBM3e | 4.8 TB/s | 大型模型、長上下文、企業共享推論與成熟 Hopper 軟體環境 | 正式上線的穩健選項,適合重視供貨、相容性與既有維運經驗的團隊 |
| NVIDIA DGX B200 | 8 張 Blackwell GPU,共 1,440 GB HBM3e | 整機共 64 TB/s | 大型 MoE、模型微調、跨 GPU 推論與高吞吐 Agent 服務 | 資料中心級整機,最大耗電約 14.3 kW,採購前須先確認機房條件 |
| NVIDIA DGX B300 | 8 張 B300 GPU,每張 288 GB,共 2.3 TB HBM3e | 第五代 NVLink 互連 14.4 TB/s(原廠未單列整機 HBM 頻寬) | 超大型模型、超長上下文、訓練與大規模推論 | Blackwell Ultra 旗艦整機,耗電約 14.5 kW,需完整評估機櫃、供電、散熱與網路 |
規格依 NVIDIA 官方資料整理,更新日為 2026 年 8 月 15 日。DGX Spark 的 128 GB 是 CPU 與 GPU 共用的統一記憶體,不能直接等同 128 GB HBM。B200 與 B300 此處列的是 DGX 八 GPU 整機,不是單卡報價。DGX B300 的記憶體容量以原廠使用者指南的「8 × 288 GB=2.3 TB」為準,NVIDIA 產品頁另標示 2.1 TB,詢價時建議直接向代理商確認該批次的標示值。正式採購仍須以台灣代理商的當期整機規格、交期、保固、供電與散熱設計為準。
採購時先用完整模型權重估算基準容量,再加上 KV cache、推論框架、批次處理與視覺編碼器。MoE 每次只啟用部分參數,不代表只需載入啟用中的權重。長上下文與多人同時使用也會快速放大記憶體需求,因此必須用實際提示詞長度、輸出長度與同時請求量壓測。
除了 GPU,還要一併規劃 CPU、系統記憶體、高速 NVMe SSD、網路互連、電源與散熱。單機工作站通常重視 PCIe 設定與噪音;四卡或八卡伺服器則要確認 NVLink、InfiniBand 或高速乙太網路、機櫃空間、每機櫃功率與冷卻方式。正式環境建議保留約三成餘裕,並把備援切換與維修期間的容量納入設計。
軟體堆疊架構設計
地端 AI 的軟體堆疊從作業系統到應用層有完整的架構設計。正確的軟體選型能大幅降低維運複雜度,提升系統穩定性。
作業系統層
Ubuntu Server 的 LTS 版本是 AI 伺服器最常見的作業系統選擇,硬體驅動支援廣泛、社群資源多;部分企業因安全政策採用 RHEL(Red Hat Enterprise Linux)或其相容版本(如 Rocky Linux、AlmaLinux),同樣可支援 NVIDIA GPU 與主流 AI 框架。
版本選擇上不建議直接抄任何文章寫的固定版號,因為作業系統、GPU 驅動、CUDA 版本與推論框架之間有相容性矩陣,而各方的支援期程並不同步。正確的順序是先確定推論框架與模型版本,再查它支援的 CUDA 與驅動範圍,最後選擇仍在支援期限內的作業系統。決定後把整組版本鎖定並記錄,升級前先在測試環境驗證。GPU 驅動與 CUDA 升級是地端 AI 常見的故障來源。
容器化層(Container)
Docker 是標準的容器化工具,搭配 NVIDIA Container Toolkit 可讓容器存取 GPU 資源。容器化有助於環境隔離與快速部署,不同模型或服務可以在獨立容器中執行,容器映像也方便在多台伺服器之間複製。正式環境應固定映像版本與雜湊,並建立弱點掃描及軟體物料清單。
容器編排層(Kubernetes)
若部署規模達到多節點或需要高可用性,Kubernetes(K8s)是容器編排的事實標準。NVIDIA GPU Operator 可以自動化管理 K8s 叢集中的 GPU 資源分配。對於規模較小或初期部署,直接使用 Docker Compose 管理多容器服務是更簡單的選擇,待業務需求成長後再遷移至 K8s。
模型服務層
模型服務層負責接收請求、執行推論並回傳結果。Ollama 適合桌面開發與快速 PoC;vLLM 與 SGLang 適合 OpenAI 相容 API、批次處理及企業共享服務;TensorRT-LLM、NVIDIA NIM 與 Dynamo 則適合需要 NVIDIA 平台最佳化、多 GPU 或大規模服務的環境。實際支援仍取決於模型架構、量化格式與 GPU 世代。
應用整合層
API 閘道(如 Nginx 或 Kong)負責身分驗證、流量限制、負載平衡與稽核,讓應用程式透過統一的 REST API 或 OpenAI 相容介面呼叫地端 AI。相容介面能降低切換成本,但不同模型的工具格式、推理參數與多模態輸入仍可能需要調整,不能預設完全不必修改程式。
LLM 模型地端執行方案比較
選擇合適的 LLM 推論框架是地端部署成敗的關鍵之一。以下比較三個主流方案的特性:
| 框架 | 主要特點 | 並發效能 | 支援模型格式 | 適合對象 |
|---|---|---|---|---|
| Ollama | 安裝極簡,一行指令啟動,支援 GGUF 量化格式 | 低至中(單一請求處理) | GGUF, Safetensors | 個人開發、小規模測試、快速 PoC |
| vLLM | PagedAttention 高並發、連續批次處理,OpenAI API 相容 | 高(支援數十至數百並發) | Safetensors, AWQ, GPTQ | 企業生產環境、高並發推論服務 |
| SGLang | RadixAttention 前綴快取,約束解碼支援結構化輸出 | 高(共用前綴的工作負載效益最大) | Safetensors、AWQ、GPTQ 等主流格式 | 多輪對話、Agent 與需要穩定 JSON 輸出的服務 |
2026 年的地端候選可分成三層。單機與工作站級可先測 Gemma 4、Gemma-3-TAIDE-12B、Muse Glimmer 30B、Qwen3.8-27B、Nemotron 3.5 Lightning、gpt-oss-20b 與 Ministral 3。H200 或多張 RTX PRO 6000 可支援更高同時請求量與較大的量化模型。Qwen3.8-2.4T、DeepSeek V4、Kimi K3 與 Nemotron 3 Ultra 等超大型 MoE,完整地端部署則屬多 GPU 或多節點資料中心工程。
TAIDE 應保留在台灣題庫中,因為它提供正體中文、行政與在地用語基線;Gemma 4 適合需要西方供應鏈、Apache 2.0 授權與端側至工作站級多模態的團隊;Nemotron 3.5 Lightning 則適合重視 NVIDIA 推論工具鏈與高吞吐 Agent 子任務的環境。中國來源模型是否可採用,應依公務機關規範、產業監理、政府採購契約與公司供應鏈政策個別確認,不能把一般民間企業與公部門寫成同一答案。
量化技術可降低顯示記憶體需求,常見格式包括 GGUF、AWQ、GPTQ 與 NVIDIA NVFP4。權重占用可先用「總參數量乘以每參數位元數再除以 8」粗估,但實際容量還要加上 KV cache、推論框架、視覺編碼器與運算暫存。對 MoE 模型而言,每個 Token 啟用的參數量主要影響運算量,不等於只需載入同樣大小的權重。
務實的採購流程是先固定模型、量化格式、推論框架、目標上下文長度、同時請求量與可接受延遲,再用真實工作負載壓測峰值記憶體與吞吐量。最後回推 GPU 數量、互連與備援,並保留約三成容量因應模型更換與流量成長。
安全防護與存取控制設計
地端 AI 系統雖然消除了資料外傳風險,但仍需要完善的內部安全架構。以下是關鍵的安全設計原則:
網路隔離與分段
AI 推論伺服器建議置於獨立的 VLAN 或網段,與一般辦公網路隔離。對外只開放必要的 API 連接埠(如 8080、443),並透過防火牆嚴格控制存取來源。若 AI 系統需要存取企業知識庫或文件系統,應透過專用的資料存取介面,避免直接暴露資料庫連接埠。
身分驗證與授權
企業 AI 服務應整合既有的身分驗證系統,例如 Active Directory、LDAP 或 SAML/SSO。API 存取應要求有效的 API 金鑰或 JWT Token,並依使用者角色或部門實施細緻的權限控管。例如,人資部門只能使用人資知識庫,研發部門才能存取技術文件庫。
傳輸加密
所有 API 通訊應強制使用 HTTPS(TLS 1.2 以上),即使是在企業內網中也不應使用明文傳輸。若涉及特別敏感的應用,可進一步考慮端對端加密或零信任網路架構(Zero Trust Network Access, ZTNA)。
稽核日誌
完整的稽核日誌是合規要求的核心。應記錄每次 AI 服務呼叫的來源 IP、使用者帳號、請求時間、輸入摘要(避免記錄完整敏感內容)以及回應狀態。日誌應集中儲存在獨立的日誌系統中(如 ELK Stack),並設定適當的保存期限。保存期限沒有適用於所有組織的單一數字,應依適用法規、所屬產業的監理要求、資料分級與內部稽核政策訂定;常見做法是把可即時查詢的熱資料與壓縮歸檔的冷資料分層,並注意日誌本身可能含有個人資料或查詢內容,因此期限宜由資安與法務共同決定。
維運管理與持續優化
地端 AI 系統的維運是長期工作,需要建立完善的監控、更新、和容量規劃機制。
效能監控
GPU 利用率、VRAM 使用量、推論延遲(P50/P95/P99)、請求吞吐量(TPS)是核心監控指標。建議使用 Prometheus + Grafana 建立監控儀表板,並設定告警閾值。NVIDIA DCGM(Data Center GPU Manager)可提供詳細的 GPU 健康狀態監控,及早發現硬體問題。
模型更新策略
模型版本管理需要建立標準化流程:新模型先在測試環境驗證效果(包括效能基準測試和業務場景測試),確認無誤後才進行生產環境的藍綠部署(Blue-Green Deployment),在不中斷服務的情況下切換到新版本。若新版本出現問題,可以立即回滾到舊版本。
容量規劃
每季檢視使用量、上下文長度、快取命中率與 P95 延遲,並提前向代理商確認交期。工作站、H200 伺服器與 DGX B200/B300 的機房條件差異很大。DGX B200 整機最大耗電約 14.3 kW,DGX B300 約 14.5 kW,已不能沿用一般伺服器機櫃的供電與散熱假設。採購前應由機房、網路、資安與 AI 平台團隊共同簽核。
知識庫維護
若地端 AI 系統包含 RAG 知識庫,需要建立定期更新機制,確保文件是最新版本,避免 AI 根據過時資訊回答。同時應建立回饋與版本追蹤,讓使用者標記不正確的回應,協助維運團隊找出需要更新的內容。
延伸閱讀
常見問題
不過在企業的專業領域問答上,決定答案品質的往往不是模型的通用能力,而是它能不能讀到正確的內部文件。因此搭配 RAG、把企業最新的規章與文件檢索進來後,地端系統在「回答貴公司的問題」這件事上,實務表現有機會不輸給沒有你資料的雲端通用模型。但這不是必然結果,仍取決於檢索品質、文件版本與切分策略,應以自建測試集實測比對。
人力需求無法用一個固定數字概括,取決於四個變數:你承諾的可用性水準(是否需要值班與備援切換)、資安要求(是否需要定期弱點掃描、修補與稽核報告)、模型更新頻率,以及知識庫的內容治理是否由 IT 或業務單位負責。若可用性要求不高、知識庫由業務單位自行維護,兼任的 IT 人力通常可以支撐;若需要接近全天候的服務水準或有嚴格的資安稽核義務,就應規劃專責人力與代理人機制。建議在導入前先把這四項寫清楚,再估算人力,而不是先假設人數。
參考資料
- NVIDIA.H200 Tensor Core GPU。nvidia.com
- NVIDIA.RTX PRO 6000 Blackwell Server Edition。nvidia.com
- NVIDIA.DGX Spark。nvidia.com
- NVIDIA.DGX B200。nvidia.com
- NVIDIA.DGX B300 User Guide。docs.nvidia.com
- Kwon, W. et al. (2023). "Efficient Memory Management for Large Language Model Serving with PagedAttention." SOSP 2023. DOI: 10.1145/3600006.3613165
- 《資通安全責任等級分級辦法》(現行條文,分為 A 至 E 五級);主管機關為數位發展部。全國法規資料庫:law.moj.gov.tw;資安法規彙整:moda.gov.tw
- Touvron, H. et al. (2023). "Llama 2: Open Foundation and Fine-Tuned Chat Models." arXiv:2307.09288. arXiv