從算力調度到資料儲存,補齊企業地端 AI 部署的最後一塊拼圖
2026年企業持續擴大 AI 基礎設施投資,算力、儲存與網路已成為 IT 資本支出中成長最快的項目之一。然而,投資規模擴大的同時,運算資源能否被有效掌握、調度與運用,成為關鍵課題。
Flexera 最新發布的《2026 State of ITAM Report》彙整逾 500 位 IT 資產管理專業人士意見,指出企業對 AI 資產的掌握仍面臨挑戰:完整 IT 資產可視性較前一年下降 7 個百分點至 36%;僅 31% 的受訪組織能掌握 AI 軟體使用情況,84% 將「追蹤或採用新 AI 應用」列為主要挑戰,59% 表示 AI 相關浪費支出增加。顯示企業投資 AI 的速度,正逐漸超越治理與資源可視化能力。
這個現象在地端的 AI 基礎設施建置上尤其明顯,許多專案的成敗,關鍵不只在於機房部署多少高階 GPU,更在於運算資源能否被完整追蹤、有效調度,並獲得穩定的資料供給。企業擴充算力的同時,也須同步完善「調度」、「儲存」與「可視性」,三者協同運作才能讓投資轉化為產出。
算力空轉:企業地端 AI 部署的隱形成本
從金融業的智慧客服與風險控管模型、醫療機構的醫學影像辨識,到半導體與高階製造的缺陷檢測與智慧排程,自建地端 AI 基礎設施已成為企業的重要策略選項。然而部分企業投入高額預算採購 GPU 伺服器後,才發現實際產出仍低於帳面算力。根據 INFINITIX 在 AI-Stack 專案現場的觀察,部分地端 GPU 叢集利用率僅約 30%;QNAP 技術資料亦指出,儲存 I/O 等待可能是 AI 訓練的重要瓶頸。換言之,企業買到的算力,未必都能有效投入運算。
問題的根源往往不在 GPU 本身,而在資料供應鏈未能協同。AI 訓練與推論需要持續、高頻讀取資料批次,一旦儲存吞吐量或延遲跟不上,GPU 便可能因等待資料而閒置,直接放大單位訓練成本。地端 AI 建置的成效,因此不只取決於算力規模,更取決於算力調度、網路與儲存架構能否協同運作。
資料主權、機敏資訊保護與法規遵循也持續推動地端部署。金融、醫療與政府機構受監管要求影響,核心工作負載未必適合全面移轉至公有雲。如何在資料留存於自有或受控環境的前提下降低儲存與網路傳輸瓶頸,正是 INFINITIX AI-Stack 與 QNAP 聯合方案要解決的命題:AI-Stack 擔任編排與調度層,QNAP 高效能 NAS 提供儲存層支援,共同補齊地端 AI 部署的關鍵環節。
地端化不只是選擇題,更是治理必答題
隨著資料治理、資安與稽核要求日益嚴謹,「AI 是否上雲」已不再只是成本或效能的選擇題。金融業的信用風險模型、醫療院所的病歷影像,以及政府單位的公文與情資系統,均可能受到資料所在地、委外管理、跨境傳輸與稽核規範影響。地端或受控環境部署,因此逐漸成為企業治理與風險管理的重要選項。
然而,地端 AI 落地仍面臨兩項挑戰:內部 IT 團隊須承擔複雜的算力編排與維運;儲存架構的效能、擴充性與韌性也不能妥協。INFINITIX AI-Stack 與 QNAP 因此整合算力調度與企業級儲存專長,協助客戶降低架構取捨與整合成本。
AI-Stack 專注於 AI 基礎設施編排與調度,透過 CTAs(Core Type Aware Scheduler)依工作負載配置GPU資源,並支援 GPU 切割、聚合、跨節點運算、多租戶管理及 MLOps 工具鏈,讓企業以接近雲端的方式管理地端算力。QNAP 則聚焦儲存效能、擴充性與資料韌性,透過高吞吐架構、不可變儲存與 Airgap+ 隔離備份,支援高合規場景的資料保護需求。
這是一套調度與儲存各司其職的互補架構,協助企業兼顧效能、治理與資料保護,正是本次合作的核心價值。
AI-Stack Cluster Engine × QNAP NFS over RDMA:協同架構解析

INFINITIX 的 AI-Stack 採三層架構——開發者生態層、控制管理層與基礎設施叢集層。基礎設施叢集層中的 Cluster Engine 負責 AI 工作負載排程、容器編排、GPU 切割與儲存權限管理,並統一串接 GPU Server Cluster 與 Storage Server Cluster;QNAP 高效能 NAS 即位於 Storage Server Cluster,透過 NFS over RDMA 提供高吞吐、低延遲的資料存取,與 AI-Stack 算力調度協同運作,降低 GPU 因 I/O 等待而閒置的情況。
為什麼傳統 NFS 可能餵不飽 GPU?
傳統 NFS over TCP 的資料路徑涉及使用者空間與核心空間切換、TCP 封包處理、checksum 計算及多次記憶體複製;這些作業會消耗 CPU 資源,卻不直接產生 AI 運算價值。根據 QNAP 實驗室以 NFS 4.1、單機 100GbE 環境進行的實測,在未啟用 RDMA 時,平均延遲依負載點不同,約介於 1,836 ms 至 20,238 ms,尖峰(Max)延遲最高曾達約 464,591 ms;儲存端 CPU 使用率則隨負載由約 28% 上升至約 54%。當多片 GPU 同時平行讀取時,資源爭用與延遲可能隨規模擴大而加劇。
NFS over RDMA:重建資料路徑
本方案採用 QNAP 支援的 NFS over RDMA(RoCE v2)。RDMA(Remote Direct Memory Access)可繞過傳統 TCP/IP 路徑中的部分核心處理,讓主機透過 RDMA 網卡進行高速資料傳輸,並將部分通訊協定工作卸載至網路硬體,藉此降低資料複製與 CPU 介入,讓 QNAP NVMe 儲存更有效率地供應資料給 AI 伺服器。
在 QNAP 實驗室實測中,啟用 RDMA 後,同一負載點的平均延遲最高可由約 5,110 ms 大幅降至約 12 ms,尖峰延遲亦由約 464,591 ms 降至約 458 ms,延遲穩定度明顯改善;同時,啟用 RDMA 後系統亦可承載更高的並行 IOPS(實測由約 139,520 提升至約 190,720),顯示儲存層在更高吞吐下仍維持穩定回應。搭配適當規劃的高速乙太網路,儲存層可為 AI-Stack 動態調度的 GPU 叢集提供更穩定的資料串流,降低 GPU 因 I/O 等待而閒置的機率。
值得留意的是,實測數據顯示:啟用 RDMA 後,儲存端 CPU 使用率在數字上略高於未啟用時(如同一負載點由 41% 上升至 53%)。這主要反映 RDMA 讓儲存系統得以在同一時間處理更高的吞吐量;若換算為每單位 I/O 的 CPU 耗用,RDMA 情境下的效率其實優於未啟用 RDMA 的情境。

部署時須留意:RoCE v2 運作於標準乙太網路,需搭配支援 PFC(Priority Flow Control)的交換器以建立低丟包網路環境,部分情境亦需評估 ECN 等設定。NVIDIA Spectrum、Cisco Nexus、Arista 等企業級交換器多有相應支援,導入前仍應確認設備相容性並完成端到端網路調校。
AI-Stack Cluster Engine:地端算力的控制核心
若說 QNAP 解決的是「資料送得快、存得穩」,AI-Stack 解決的則是「算力看得見、調得動、用得好」。AI-Stack Cluster Engine 以 Kubernetes 原生架構為核心,整合主流 AI 開發與 MLOps 工具,支援 GPU 切割與聚合、跨節點運算、多租戶管理、視覺化監控及任務排程,將 NVIDIA、AMD GPU、NPU 等異構資源轉化為可彈性配置的算力。平台亦透過命名空間(Namespace)、角色權限(RBAC)、資源配額與儲存權限,隔離不同團隊的運算任務與資料存取;管理者可介接 QNAP NFS 儲存叢集,依專案授權掛載路徑與存取權限;儲存端容量則由 QNAP 以共享資料夾配額進行管控。使用者可將儲存裝置掛載至容器、任務及分散式訓練環境,讓模型、資料集、快取與 Checkpoint 在容器生命週期之外持續保存。
當 AI-Stack 將工作負載派發至 GPU 節點時,QNAP 可透過 NFS over RDMA 提供高吞吐、低延遲的資料存取,由調度層降低算力閒置、儲存層減少 I/O 等待,共同兼顧效能、資源隔離與資料治理,提升地端 AI 基礎設施的整體效率。
實務落地:重點產業的地端 AI 部署情境
聯合方案可依不同產業的效能、資料治理與資安需求,規劃相應的部署架構。
半導體與高階製造
晶片缺陷檢測與晶圓良率模型訓練需要頻繁存取大量高解析影像資料,對儲存容量、擴充性與平行存取能力要求極高。QNAP 高效能儲存架構可依需求擴充容量與頻寬,搭配 AI-Stack 的多租戶 GPU 調度,支援多個研發團隊共享基礎設施並降低資源爭用,有助縮短模型訓練與良率分析的迭代週期。
以 INFINITIX 既有精密製造業導入經驗為例,企業自行開發 AI 瑕疵檢測設備時,曾面臨軟硬體整合與跨團隊 GPU 資源共享等挑戰。導入 AI-Stack 後,透過統一管理與彈性配置 GPU 資源,提升模型開發、訓練與測試效率,加速 AI 視覺檢測與智慧製造應用落地。
金融與醫療等高合規場景
金融與醫療機構不僅需將機敏資料留存在受控環境,也須因應勒索軟體、權限濫用與法規稽核等風險。QNAP 透過不可變儲存(Immutable Storage/WORM)與 Airgap+ 隔離備份強化資料完整性與可復原性;AI-Stack 則提供 GPU 資源集中管理、智慧排程、多租戶、角色存取控制與稽核紀錄,支援多項 AI 專案同步執行與模型全生命週期管理。
兩者整合後,可為病理切片、3D DICOM 影像等大型醫療資料提供穩定且高效的存取能力,協助企業建立兼顧效能、資安、治理與合規需求的地端 AI 基礎設施。
可衡量的整合效益
綜合產品能力、實驗室測試與專案經驗,這套軟硬整合方案可從以下四個面向創造效益。
第一,提升算力使用效率:AI-Stack 透過資源切割、聚合與智慧調度降低 GPU 碎片化與閒置,QNAP NFS over RDMA 則降低傳輸延遲、減少 I/O 等待。第二,加速資料存取:依 QNAP 實驗室實測,在特定負載點下,啟用 RDMA 後平均延遲可由約 5,110 ms 降至約 12 ms,尖峰延遲由約 464,591 ms 降至約 458 ms。第三,提升 CPU 使用效率:RDMA 硬體卸載與較少記憶體複製,讓儲存系統可在更高吞吐量下運作,讓每單位 I/O 的 CPU 耗用更低。第四,支援高 I/O 工作負載:以 QNAP TS-h1290FX 為例,官方測試顯示 iSCSI 4K 隨機讀取最高可達 816K IOPS,適合大量平行存取與資料密集型應用。

在總體持有成本(TCO)方面,地端部署可降低長期公有雲用量與資料傳出(egress)費用的不確定性;AI-Stack 授權模式則可依專案規模與服務方案規劃。企業仍應將硬體折舊、軟體維護、機房、能源、網路及人力成本納入整體評估,才能建立完整且可比較的 TCO 模型。
從靜態儲存走向近算力端的高速資料層
隨著大型語言模型規模與上下文長度持續增加,傳統儲存架構面臨更高的吞吐量與延遲要求。QNAP NAS 在 AI 架構中的角色,可由靜態資料儲存延伸為近算力端的高速資料層;透過 NVMe 全快閃陣列、高速網路與快取機制,協助模型權重、向量資料與訓練資料集更快速供應給運算節點,減少重複資料搬移與 I/O 等待,有助縮短訓練與推論週期並改善整體能源使用效率。
INFINITIX 與 QNAP 將持續評估 MLOps 調度與底層儲存通訊的整合機會,協助企業打造更敏捷、可擴充且易於治理的 AI 基礎設施。
從概念到行動:打造下一代地端 AI 基礎設施
從算力調度到資料儲存,INFINITIX 與 QNAP 展現一套完整、可落地的地端 AI 參考架構,協助企業整合運算、網路與儲存,並在效能、治理、資安與成本之間取得務實平衡。
面對 AI 應用規模化,競爭力不只來自投入更多 GPU,更取決於算力、資料與模型能否高效協同。AI-Stack 的智慧調度與工作負載管理,結合 QNAP 的高效能儲存與資料保護,可提升資源利用率、縮短模型部署週期,建立安全、可治理且具擴充性的 AI 營運底座,讓算力投資轉化為可衡量的業務價值。
想進一步了解這套架構如何導入您的地端 AI 環境,歡迎聯繫 INFINITIX(hello@infinitix.co/www.infinitix.ai),或查詢 QNAP 官方網站 www.qnap.com。
*本文之部分文字與影像素材係透過 AI 技術輔助生成,並經由作者檢視與審核,以確保內容品質。