LargitData:企業情報與風險 AI 平台

最後更新:

地端 AI 部署完整指南:企業自建 AI 基礎設施的規劃與實作

大型語言模型已從單人試用走向多人共享、長上下文與 AI Agent。地端部署能讓企業掌握資料流向、模型版本與服務容量,但硬體選型也已從 RTX 4090、A100、H100 世代,進入 DGX Spark、RTX PRO 6000 Blackwell、H200、B200 與 B300 並存的階段。本指南以 2026 年 8 月可採購的平台,重新整理企業地端 AI 的硬體、軟體、安全與維運決策。

地端 AI 部署完整指南:企業自建 AI 基礎設施的規劃與實作資訊圖表配圖,呈現AI 知識中心的重點概念

地端 AI 部署的核心優勢與適用場景

地端 AI(On-Premise AI)是指企業將 AI 模型與推論服務部署在自有或租用的實體機房中,所有資料的處理、儲存與模型推論均在企業可控的物理邊界內進行。與雲端 AI 服務相比,地端部署在資料主權、法規合規、延遲效能與長期成本上具有明顯優勢。

核心優勢之一是資料主權。企業機密文件、客戶個資、財務報表等敏感資料無需離開企業網路,可移除「資料被送往第三方雲端處理」這條風險路徑,並讓資料流向的說明與舉證變得單純許多。要注意的是,這降低的是特定一類風險,而非全部:端點被入侵、內部權限過大、備份媒體外流、軟體與模型更新的供應鏈風險,都仍需個別設計控制措施。

在法規面向上,台灣並沒有一部統一的資料在地化法。實務上的在地化壓力來自個人資料保護法對國際傳輸的限制、資通安全管理法對公務機關與特定非公務機關的資安維護義務(依資通安全責任等級 A 至 E 分級)、金管會對金融機構作業委外與運用 AI 的相關規範,以及醫療法規與衛生福利部對病歷與醫療資訊的保護要求。地端部署通常較容易對應這些要求,但是否合規仍須依資料類型、機構性質與實際資料流逐項判斷。實際適用範圍與作業要求,仍應以主管機關最新公告及貴機關(或貴公司法務)認定為準。

第二個核心優勢是延遲可控。透過外部 API 呼叫時,每次請求都要經過網際網路往返,也無法控制供應商的排隊狀況。尖峰時段的延遲波動往往比平均值更難處理。地端部署把推論放在內網,延遲主要由企業自己的硬體、批次與同時請求設定決定,因此較容易訂出服務水準。

不過「地端一定比雲端快」仍是過度簡化。實際延遲會受到模型大小、量化方式、KV cache、上下文長度、同時使用人數與推論框架影響。比較時應使用相同提示詞與流量曲線,量測首個 Token 產出時間、每秒輸出 Token 數與 P95 延遲,再決定是否採購。

第三是成本可預測。雲端 API 適合流量尚未穩定、需要快速取得前沿模型的情境;地端設備則適合長期且穩定的高使用量、固定模型版本或嚴格資料治理。不能只比較 Token 單價與 GPU 卡價,還要把伺服器、網路、機房供電、散熱、軟體授權、維運人力、備援與硬體折舊納入一年至三年的總持有成本。

適合考慮地端 AI 部署的場景包括:金融機構的內部知識庫與文件處理、政府機關的公文自動化與輔助決策、醫療機構的病歷分析、製造業的品管知識管理與設備維護,以及需要在離線或網路品質不穩定環境中執行 AI 的情境。

硬體選型指南:GPU 伺服器規格解析

地端 AI 的核心不是只買一張最快的 GPU,而是讓模型權重、KV cache、同時請求量、記憶體頻寬、GPU 互連、供電與散熱形成可維運的系統。不同世代的 FP16、FP8、FP4 數字不能直接橫向比較,因此下表改用平台級距與實際部署角色整理。

平台 加速器記憶體 記憶體頻寬 適合工作負載 部署定位
NVIDIA DGX Spark 128 GB LPDDR5x 統一記憶體 273 GB/s 個人與小組 PoC、Agent 原型、模型評估與微調測試 桌上型開發平台,適合驗證,不宜直接當成多人正式推論伺服器
NVIDIA RTX PRO 6000 Blackwell Server Edition 96 GB GDDR7 ECC 1,597 GB/s 中型開放權重模型、多模態文件、視覺運算與部門級共享服務 工作站與伺服器的成本效益路線,可從單卡擴充至多卡
NVIDIA H200 SXM/NVL 141 GB HBM3e 4.8 TB/s 大型模型、長上下文、企業共享推論與成熟 Hopper 軟體環境 正式上線的穩健選項,適合重視供貨、相容性與既有維運經驗的團隊
NVIDIA DGX B200 8 張 Blackwell GPU,共 1,440 GB HBM3e 整機共 64 TB/s 大型 MoE、模型微調、跨 GPU 推論與高吞吐 Agent 服務 資料中心級整機,最大耗電約 14.3 kW,採購前須先確認機房條件
NVIDIA DGX B300 8 張 B300 GPU,每張 288 GB,共 2.3 TB HBM3e 第五代 NVLink 互連 14.4 TB/s(原廠未單列整機 HBM 頻寬) 超大型模型、超長上下文、訓練與大規模推論 Blackwell Ultra 旗艦整機,耗電約 14.5 kW,需完整評估機櫃、供電、散熱與網路

規格依 NVIDIA 官方資料整理,更新日為 2026 年 8 月 15 日。DGX Spark 的 128 GB 是 CPU 與 GPU 共用的統一記憶體,不能直接等同 128 GB HBM。B200 與 B300 此處列的是 DGX 八 GPU 整機,不是單卡報價。DGX B300 的記憶體容量以原廠使用者指南的「8 × 288 GB=2.3 TB」為準,NVIDIA 產品頁另標示 2.1 TB,詢價時建議直接向代理商確認該批次的標示值。正式採購仍須以台灣代理商的當期整機規格、交期、保固、供電與散熱設計為準。

採購時先用完整模型權重估算基準容量,再加上 KV cache、推論框架、批次處理與視覺編碼器。MoE 每次只啟用部分參數,不代表只需載入啟用中的權重。長上下文與多人同時使用也會快速放大記憶體需求,因此必須用實際提示詞長度、輸出長度與同時請求量壓測。

除了 GPU,還要一併規劃 CPU、系統記憶體、高速 NVMe SSD、網路互連、電源與散熱。單機工作站通常重視 PCIe 設定與噪音;四卡或八卡伺服器則要確認 NVLink、InfiniBand 或高速乙太網路、機櫃空間、每機櫃功率與冷卻方式。正式環境建議保留約三成餘裕,並把備援切換與維修期間的容量納入設計。

軟體堆疊架構設計

地端 AI 的軟體堆疊從作業系統到應用層有完整的架構設計。正確的軟體選型能大幅降低維運複雜度,提升系統穩定性。

作業系統層

Ubuntu Server 的 LTS 版本是 AI 伺服器最常見的作業系統選擇,硬體驅動支援廣泛、社群資源多;部分企業因安全政策採用 RHEL(Red Hat Enterprise Linux)或其相容版本(如 Rocky Linux、AlmaLinux),同樣可支援 NVIDIA GPU 與主流 AI 框架。

版本選擇上不建議直接抄任何文章寫的固定版號,因為作業系統、GPU 驅動、CUDA 版本與推論框架之間有相容性矩陣,而各方的支援期程並不同步。正確的順序是先確定推論框架與模型版本,再查它支援的 CUDA 與驅動範圍,最後選擇仍在支援期限內的作業系統。決定後把整組版本鎖定並記錄,升級前先在測試環境驗證。GPU 驅動與 CUDA 升級是地端 AI 常見的故障來源。

容器化層(Container)

Docker 是標準的容器化工具,搭配 NVIDIA Container Toolkit 可讓容器存取 GPU 資源。容器化有助於環境隔離與快速部署,不同模型或服務可以在獨立容器中執行,容器映像也方便在多台伺服器之間複製。正式環境應固定映像版本與雜湊,並建立弱點掃描及軟體物料清單。

容器編排層(Kubernetes)

若部署規模達到多節點或需要高可用性,Kubernetes(K8s)是容器編排的事實標準。NVIDIA GPU Operator 可以自動化管理 K8s 叢集中的 GPU 資源分配。對於規模較小或初期部署,直接使用 Docker Compose 管理多容器服務是更簡單的選擇,待業務需求成長後再遷移至 K8s。

模型服務層

模型服務層負責接收請求、執行推論並回傳結果。Ollama 適合桌面開發與快速 PoC;vLLM 與 SGLang 適合 OpenAI 相容 API、批次處理及企業共享服務;TensorRT-LLM、NVIDIA NIM 與 Dynamo 則適合需要 NVIDIA 平台最佳化、多 GPU 或大規模服務的環境。實際支援仍取決於模型架構、量化格式與 GPU 世代。

應用整合層

API 閘道(如 Nginx 或 Kong)負責身分驗證、流量限制、負載平衡與稽核,讓應用程式透過統一的 REST API 或 OpenAI 相容介面呼叫地端 AI。相容介面能降低切換成本,但不同模型的工具格式、推理參數與多模態輸入仍可能需要調整,不能預設完全不必修改程式。

LLM 模型地端執行方案比較

選擇合適的 LLM 推論框架是地端部署成敗的關鍵之一。以下比較三個主流方案的特性:

框架 主要特點 並發效能 支援模型格式 適合對象
Ollama 安裝極簡,一行指令啟動,支援 GGUF 量化格式 低至中(單一請求處理) GGUF, Safetensors 個人開發、小規模測試、快速 PoC
vLLM PagedAttention 高並發、連續批次處理,OpenAI API 相容 高(支援數十至數百並發) Safetensors, AWQ, GPTQ 企業生產環境、高並發推論服務
SGLang RadixAttention 前綴快取,約束解碼支援結構化輸出 高(共用前綴的工作負載效益最大) Safetensors、AWQ、GPTQ 等主流格式 多輪對話、Agent 與需要穩定 JSON 輸出的服務

2026 年的地端候選可分成三層。單機與工作站級可先測 Gemma 4、Gemma-3-TAIDE-12B、Muse Glimmer 30B、Qwen3.8-27B、Nemotron 3.5 Lightning、gpt-oss-20b 與 Ministral 3。H200 或多張 RTX PRO 6000 可支援更高同時請求量與較大的量化模型。Qwen3.8-2.4T、DeepSeek V4、Kimi K3 與 Nemotron 3 Ultra 等超大型 MoE,完整地端部署則屬多 GPU 或多節點資料中心工程。

TAIDE 應保留在台灣題庫中,因為它提供正體中文、行政與在地用語基線;Gemma 4 適合需要西方供應鏈、Apache 2.0 授權與端側至工作站級多模態的團隊;Nemotron 3.5 Lightning 則適合重視 NVIDIA 推論工具鏈與高吞吐 Agent 子任務的環境。中國來源模型是否可採用,應依公務機關規範、產業監理、政府採購契約與公司供應鏈政策個別確認,不能把一般民間企業與公部門寫成同一答案。

量化技術可降低顯示記憶體需求,常見格式包括 GGUF、AWQ、GPTQ 與 NVIDIA NVFP4。權重占用可先用「總參數量乘以每參數位元數再除以 8」粗估,但實際容量還要加上 KV cache、推論框架、視覺編碼器與運算暫存。對 MoE 模型而言,每個 Token 啟用的參數量主要影響運算量,不等於只需載入同樣大小的權重。

務實的採購流程是先固定模型、量化格式、推論框架、目標上下文長度、同時請求量與可接受延遲,再用真實工作負載壓測峰值記憶體與吞吐量。最後回推 GPU 數量、互連與備援,並保留約三成容量因應模型更換與流量成長。

安全防護與存取控制設計

地端 AI 系統雖然消除了資料外傳風險,但仍需要完善的內部安全架構。以下是關鍵的安全設計原則:

網路隔離與分段

AI 推論伺服器建議置於獨立的 VLAN 或網段,與一般辦公網路隔離。對外只開放必要的 API 連接埠(如 8080、443),並透過防火牆嚴格控制存取來源。若 AI 系統需要存取企業知識庫或文件系統,應透過專用的資料存取介面,避免直接暴露資料庫連接埠。

身分驗證與授權

企業 AI 服務應整合既有的身分驗證系統,例如 Active Directory、LDAP 或 SAML/SSO。API 存取應要求有效的 API 金鑰或 JWT Token,並依使用者角色或部門實施細緻的權限控管。例如,人資部門只能使用人資知識庫,研發部門才能存取技術文件庫。

傳輸加密

所有 API 通訊應強制使用 HTTPS(TLS 1.2 以上),即使是在企業內網中也不應使用明文傳輸。若涉及特別敏感的應用,可進一步考慮端對端加密或零信任網路架構(Zero Trust Network Access, ZTNA)。

稽核日誌

完整的稽核日誌是合規要求的核心。應記錄每次 AI 服務呼叫的來源 IP、使用者帳號、請求時間、輸入摘要(避免記錄完整敏感內容)以及回應狀態。日誌應集中儲存在獨立的日誌系統中(如 ELK Stack),並設定適當的保存期限。保存期限沒有適用於所有組織的單一數字,應依適用法規、所屬產業的監理要求、資料分級與內部稽核政策訂定;常見做法是把可即時查詢的熱資料與壓縮歸檔的冷資料分層,並注意日誌本身可能含有個人資料或查詢內容,因此期限宜由資安與法務共同決定。

維運管理與持續優化

地端 AI 系統的維運是長期工作,需要建立完善的監控、更新、和容量規劃機制。

效能監控

GPU 利用率、VRAM 使用量、推論延遲(P50/P95/P99)、請求吞吐量(TPS)是核心監控指標。建議使用 Prometheus + Grafana 建立監控儀表板,並設定告警閾值。NVIDIA DCGM(Data Center GPU Manager)可提供詳細的 GPU 健康狀態監控,及早發現硬體問題。

模型更新策略

模型版本管理需要建立標準化流程:新模型先在測試環境驗證效果(包括效能基準測試和業務場景測試),確認無誤後才進行生產環境的藍綠部署(Blue-Green Deployment),在不中斷服務的情況下切換到新版本。若新版本出現問題,可以立即回滾到舊版本。

容量規劃

每季檢視使用量、上下文長度、快取命中率與 P95 延遲,並提前向代理商確認交期。工作站、H200 伺服器與 DGX B200/B300 的機房條件差異很大。DGX B200 整機最大耗電約 14.3 kW,DGX B300 約 14.5 kW,已不能沿用一般伺服器機櫃的供電與散熱假設。採購前應由機房、網路、資安與 AI 平台團隊共同簽核。

知識庫維護

若地端 AI 系統包含 RAG 知識庫,需要建立定期更新機制,確保文件是最新版本,避免 AI 根據過時資訊回答。同時應建立回饋與版本追蹤,讓使用者標記不正確的回應,協助維運團隊找出需要更新的內容。

常見問題

開發與概念驗證可以從一台 DGX Spark、單張 RTX PRO 6000 Blackwell,或其他符合模型容量的單卡工作站開始。正式環境需要幾張 GPU,取決於完整權重、量化方式、上下文長度、同時請求量、延遲目標與備援設計,不能用固定張數回答。最可靠的作法是先在相同 GPU 世代租用環境完成壓測,再決定單卡、多卡或 H200、B200、B300 等資料中心平台。
開放權重模型的繁體中文能力近年有明顯進步。以台灣可落地的選項而言,TAIDE 因以台灣語料對齊,在行政與法規語境的用詞上最貼近實務;Gemma 4、GPT-OSS 與 Mistral 則在通用能力與授權條件上較有優勢。若與雲端旗艦模型相比,純粹的語言生成品質通常仍有落差,這一點不必迴避。

不過在企業的專業領域問答上,決定答案品質的往往不是模型的通用能力,而是它能不能讀到正確的內部文件。因此搭配 RAG、把企業最新的規章與文件檢索進來後,地端系統在「回答貴公司的問題」這件事上,實務表現有機會不輸給沒有你資料的雲端通用模型。但這不是必然結果,仍取決於檢索品質、文件版本與切分策略,應以自建測試集實測比對。
選用一站式地端 AI 平台(如 QubicX)時,日常維運工作量相對有限。系統上線後的例行工作主要是:監控系統健康狀態(自動化告警可大幅降低人工巡檢需求)、定期模型與套件更新、使用者帳號與權限管理,以及知識庫內容維護。

人力需求無法用一個固定數字概括,取決於四個變數:你承諾的可用性水準(是否需要值班與備援切換)、資安要求(是否需要定期弱點掃描、修補與稽核報告)、模型更新頻率,以及知識庫的內容治理是否由 IT 或業務單位負責。若可用性要求不高、知識庫由業務單位自行維護,兼任的 IT 人力通常可以支撐;若需要接近全天候的服務水準或有嚴格的資安稽核義務,就應規劃專責人力與代理人機制。建議在導入前先把這四項寫清楚,再估算人力,而不是先假設人數。
企業 GPU 伺服器可依保固、零件供應與公司的會計政策規劃三年至五年的使用週期,但模型與推論框架的變化通常比硬體故障更早造成汰換壓力。採購時應確認原廠支援年限、驅動與 CUDA 相容性、電源與散熱餘裕,以及未來是否能增加 GPU、記憶體或高速網路。DGX 類整機的 GPU 並非一般工作站那樣可自由更換,不能一概用「日後只換卡」作為升級策略。
可以。透過容器化與 Kubernetes 編排,地端 AI 基礎設施可以同時服務多個部門,並透過命名空間(Namespace)與資源配額(Resource Quota)隔離用量,避免單一部門的尖峰流量影響其他服務。例如,同一套 GPU 叢集可以執行人資知識助理、法務合約審查與客服智慧助理。

參考資料

  1. NVIDIA.H200 Tensor Core GPU。nvidia.com
  2. NVIDIA.RTX PRO 6000 Blackwell Server Edition。nvidia.com
  3. NVIDIA.DGX Spark。nvidia.com
  4. NVIDIA.DGX B200。nvidia.com
  5. NVIDIA.DGX B300 User Guide。docs.nvidia.com
  6. Kwon, W. et al. (2023). "Efficient Memory Management for Large Language Model Serving with PagedAttention." SOSP 2023. DOI: 10.1145/3600006.3613165
  7. 《資通安全責任等級分級辦法》(現行條文,分為 A 至 E 五級);主管機關為數位發展部。全國法規資料庫:law.moj.gov.tw;資安法規彙整:moda.gov.tw
  8. Touvron, H. et al. (2023). "Llama 2: Open Foundation and Fine-Tuned Chat Models." arXiv:2307.09288. arXiv

準備好開始規劃地端 AI 基礎設施了嗎?

聯絡 LargitData 的解決方案顧問,我們將根據您的企業規模、資料敏感度和使用場景,提供量身訂製的地端 AI 部署規劃建議。

立即諮詢