數據中心是甚麼?
數據中心是集中放置伺服器、儲存與網絡設備,並為它們供電、冷卻、連網與保安的設施。規模可以是一個上鎖的機房,也可以是獨立建築的整個園區;重點不在建築物大小,而在設備與支援系統怎樣組織起來。
網站與企業系統在哪裏運行?
你公司的網站、網店或報名系統,如果使用租用的寄存或雲端服務,檔案與資料庫便放在服務商安排的伺服器上。訪客在瀏覽器輸入網址,請求經互聯網送到那部伺服器,頁面再傳回屏幕。買網頁寄存、伺服器或雲主機,本質上就是租用數據中心裏的資源。
對營運負責人來說,設施質素影響供電、冷卻與基建網絡的穩定;網站實際速度還取決於程式、主機資源與訪客一端的網絡。備份做多密,看的是服務方案與設定,不是設施等級自動包辦。假設一間貿易公司,官網只是幾頁簡介,另一套報價查詢系統卻直接影響海外買家下單,兩者對停機的承受力不同,要問的問題也不同。
數據中心如何維持運作?
伺服器、儲存與網絡設備
伺服器負責執行程式與處理請求;儲存設備保管檔案與資料庫;網絡設備(例如交換器、路由器與防火牆)把伺服器和儲存設備連接起來,再接通往互聯網。租用服務時看到的主機規格,指的主要是運算與儲存兩類設備;網絡一層的能力,則反映在連線速度與流量上限。
供電與冷卻系統如何令設備持續運行?
市電經變電設施進入機房後,先通過不間斷電源系統(UPS)才供給設備;停電時,UPS 以電池支撐交接期,讓備用發電機啟動接管。等級較高的設施會鋪設多條供電路徑,一條檢修時,另一條繼續送電。設備運行時大量發熱,機房以冷熱通道分隔引導氣流,由精密空調把熱量帶走;機櫃發熱密度愈高,散熱設計就愈講究。

實體保安與環境監控看甚麼?
機房以門禁分層管理,由大堂到機櫃區逐級授權,訪客有登記,閉路電視長期運作。環境監控系統全天候量度溫度、濕度、漏水與煙霧,數值異常便觸發警報,交當值人員跟進。合約裏的保安要求與訪客政策,多數源自這些安排。
數據中心的類型與管理分工
「類型」問的不是建築外觀,而是三個答案:設施由誰擁有、設備由誰擁有、日常由誰管理。不同組合構成自建、共置與雲端三種主要模式,管理深度與部署位置再在其上細分。
企業自建、共置與雲端有甚麼分別?
企業自建:整個設施自己擁有
自建數據中心由企業興建與營運,土地、供電、冷卻、維修團隊全部自己負責。控制與客製程度最高,適合對合規和資料存放有嚴格要求的大型機構;代價是前期投資龐大,產能規劃還要預留擴展空間。對多數香港中小企,這不是預設選項。
共置服務:設備自己擁有,設施租用
共置(Colocation)之下,企業自購伺服器放進服務商機房,租的是機櫃空間、電力、冷卻與網絡接駁。設施層的供電散熱由服務商管理,設備上的系統與應用仍由企業自己負責。硬件投資留在自己手上,日後遷移時設備也可以帶走,這是它與雲端最根本的分別。
雲端服務:按需租用運算資源
這裡談的雲端服務主要是公有雲,把運算能力本身變成租用項目:虛擬機器、儲存空間、資料庫服務按需要開啟與釋放,費用跟着用量走,實體設備由服務商擁有和操作。美國國家標準與技術研究院(NIST)2011 年的雲運算定義文件,把按需租用、資源快速調配列為雲運算的關鍵特徵。不過分工要看服務層級:租用虛擬機器,作業系統與應用通常仍由用戶管理;採用受管理的資料庫等服務,分工則不同,以合約寫明的為準。
託管服務包辦到哪個層次?
在「誰管理」這條線上,還分幾個層次。純共置只管設施,作業系統、安全更新與監控全部自己來;受管理的伺服器或雲主機,把部分系統層工作交給服務商。「受管理」沒有劃一標準:更新、備份、故障處理是否包含、做到哪個程度,看服務層級與合約寫法。判斷自己需要哪一層,不應只看技術偏好,而要按實際管理需求評估:日常系統更新、備份、監控、故障處理,以及出事時的支援與合約責任,內部或供應商各自能承擔多少。
邊緣運算為何重視部署位置?
串流、即時互動、物聯網這類應用,對幾十毫秒的來回延遲都有感覺,於是出現規模較小、貼近用戶的邊緣數據中心,把部分運算移到就近處理。用戶與伺服器的實際距離會影響傳輸時間,但延遲還取決於路由、網絡互聯與服務當時的負載。一般網站對延遲沒有這樣敏感,未必要優先投資邊緣部署。
Tier I 至 IV:數據中心的可靠性等級怎樣分?
Tier 是業界常用的設施分級,由 Uptime Institute 制定,描述供電、冷卻等基建在維護與故障面前的能力。四級的讀法有兩條線:計劃維護要不要停機,單一故障會不會中斷服務。下表按官方分級說明整理。
| 等級 | 名稱 | 維護安排 | 故障影響 |
|---|---|---|---|
| Tier I | 基本容量(Basic Capacity) | 維護或維修需要全站停止 | 容量組件或配送系統出現故障,會影響站點運作 |
| Tier II | 備援容量組件(Redundant Capacity Components) | 計劃維護仍需要全站停止 | 設有備援容量組件;容量組件故障仍可能影響站點,配送系統故障則會影響站點 |
| Tier III | 可同時維護(Concurrently Maintainable) | 容量組件與配送路徑可按計劃移除維護,不影響運作 | 個別設備故障或操作錯誤仍可能影響站點 |
| Tier IV | 故障容錯(Fault Tolerant) | 同樣具備可同時維護能力 | 個別設備故障或配送路徑中斷,不影響關鍵運作 |

沒有一級等於永不停機:設施等級之外,營運管理與人為操作同樣左右實際表現;等級亦不宜直接換算成固定的可用率,實際停機表現要連合約與管理一起看。真正該問自己的反而是:系統可以接受計劃維護在甚麼時段停機?單一故障發生時,業務等得起多久?
設施認證與 SLA 是同一回事嗎?
不是。認證是第三方按標準驗證設施,Uptime Institute 的 Tier 認證分開設計文件、建成設施與營運可持續性幾個對象;設計文件取得認證,不代表建成後的設施已通過驗證。見到服務商寫「Tier III 認證」,值得要求對方列明設施名稱、認證對象與相應證書。
SLA(服務水平協議)屬合約層:保障範圍涵蓋供電、網絡還是回應時間,計劃維護算不算違約,達不到標準怎樣補償,全部以白紙黑字為準。設施等級描述基建能力,SLA 界定你實際得到的承諾,兩者要分開看,也要一起看。
數據中心與 AI 的應用及效益
AI 與數據中心的關係是雙向的:設施提供運算、儲存與網絡資源,支撐模型訓練與應用;AI 亦被用於管理機房,冷卻控制是其中一個有公開紀錄的應用。
AI 訓練與推論需要甚麼運算支援?
訓練與推論是兩種工作量。訓練用大量數據把模型建立起來,屬計算密集的工作,大型模型的訓練常見以大量 GPU 長時間運行,供電與散熱壓力隨之上升;推論是模型建成後回應每次查詢的日常運算,講求穩定與回應速度。兩者哪個更耗電,沒有一概而論的答案,實際視乎模型規模與使用量。

支撐這些工作負載的不止運算。GPU 之間要靠高速網絡交換數據,儲存要餵得動訓練資料與模型檔案,這些設備連同 GPU 本身的耗電,最終都由設施的供電與冷卻系統承受。配備 GPU 的機房因此屬於特定配置,不是所有數據中心都有。企業應用 AI,可以按負載使用雲端 GPU 服務,硬件與機房由服務商提供,無須自建。
企業知識庫與智能應用怎樣用起來?
知識型應用是一個具體例子:把產品規格、內部流程、報價文件匯入系統,查詢時先檢索相關文件,再由模型根據原文生成答案,這就是檢索增強生成(RAG);NVIDIA 的企業 RAG 部署指南,就把文件匯入、檢索與生成列為同一套方案。假設一間貿易公司把歷年產品手冊與常見問題放入知識庫,同事查詢出口包裝規定,系統引用文件回答,而非只憑模型的記憶。效益這樣量:用同一批日常問題,比較人手查找與系統回答所需時間,再核對引用文件是否支持答案;新同事是否更快上手,要另作觀察。
AI 也可以管理機房冷卻嗎?
可以,而且有公開案例。Google 與 DeepMind 在 2018 年發表的自動化冷卻控制案例,讓 AI 利用機房感測器數據,預測不同冷卻動作的能源後果,在預設的安全限制內選取動作,再交本地系統覆核執行,營運人員全程保留控制權。案例說明:AI 在既有設施上優化控制,不是推倒重建,安全限制與人手接管寫在設計之內。
AI 機房帶來的能源與散熱挑戰
需求一端同樣在升溫。IEA 在 2026 年 4 月發表的能源與 AI 報告估計,2025 年全球 AI 導向數據中心的用電增長 50%;報告同時指出,AI 伺服器的功率密度上升,訓練與模型使用亦會帶來快速而明顯的電力負載波動。電網接駁與設備供應的限制,正在影響新設施的擴展速度。
散熱方式隨之改變。機櫃功率密度提高,風冷應付不來時,把冷卻液直接送到晶片與機櫃的液冷,是其中一條路線。衡量能源效率的 PUE 由 The Green Grid 制定,定義是設施總能源除以 ICT 設備能源;數值愈接近 1,代表支援系統額外佔用的能源比例愈低;但不代表總耗電少,也不代表用的是綠電,電力來源要另外看供電組合與再生能源採購。
如何整理數據中心服務需求?
與服務商對話之前,先寫下三樣東西:系統做甚麼、由誰管理、資料放哪裏。清單寫得出來,報價與規格就比得準;寫不出來的部分,正好就是你要向對方問清楚的問題。
系統用途與資源規模
用途決定資源。用途不同,流量、資料與停機影響都不同:官網與形象網站一般較平穩;網店涉及訂單與付款,資料庫和備份的安排要相應配合;活動報名或購票系統則可能有明顯高峰,開放首小時湧入的訪客,跟平日完全是兩回事。把每個系統的預計流量、儲存量、備份頻率寫下來,連同可接受的停機時段一併記錄,資源規模就有輪廓。
管理能力與支援範圍
清單第二項關於人:系統由誰管理,向服務商買到哪一層支援。內部有技術團隊,共置或自行配置的彈性值得保留;沒有這樣的人力,受管理的寄存或雲主機便比較合理,把系統層維護交給服務商,相關安排可先看伺服器與雲主機服務的說明。支援範圍逐項問清:合約包設施層還是系統層、故障回應時間、維護通知提前多久、更新與備份是否包含。
資料存放地點與連接需求
資料放在哪個地區,影響延遲與適用的法規。客人集中在香港的系統,值得直接量度不同節點的實際連線表現,而不是單看地點:固定同一測試頁面、裝置與登入狀態,分別從目標用戶使用的網絡測試,記錄回應時間與失敗情況。有跨境辦公室的企業,還要考慮多地連接與資料流通的安排。
資料參考
- NIST(2011)雲運算定義文件:按需租用、資源快速調配列為雲運算關鍵特徵,另列私有雲等部署方式
- Uptime InstituteTier Certification:Tier I 至 IV 的維護與故障能力,設計文件、建成設施與營運可持續性的認證對象
- NVIDIA企業 RAG 部署指南:文件匯入、檢索與生成屬同一套方案的組成部分
- Google/DeepMind(2018)自動化冷卻控制案例:AI 在安全限制內選取冷卻動作,營運人員保留控制權
- IEA(2026)能源與 AI 報告:2025 年全球 AI 導向數據中心用電增長 50%,功率密度與電力負載波動上升
- The Green GridPUE 詞條:數據中心總能源與 ICT 設備能源之比
數據中心類型、Tier 與服務選擇常見問題
自建、共置與雲端數據中心,香港中小企應怎樣選擇?
三種模式對應不同的管理人力、硬件持有與資源需求。沒有技術團隊時,先看是否有受管理服務、更新與故障處理由誰負責,不能把一般公有雲當作自動包辦管理。基本分工如下:
| 模式 | 設施與設備 | 日常管理 |
|---|---|---|
| 公有雲/寄存 | 設施與設備由服務商提供 | 系統層視服務層級而定 |
| 共置 | 設施租用,設備自購 | 設備上的系統自行管理 |
| 自建 | 全部自己擁有 | 全部自行負責 |
選擇的起點是管理能力與預算,不是技術偏好。
Tier 等級較高,是否等於網站不會停機?
不是。Tier 分級描述設施在計劃維護與單一故障面前的能力,沒有一級等於永不停機;實際表現還受營運管理與人為操作影響,等級亦不宜直接換算成固定的可用率。它真正的作用是對照業務需要:系統能否接受維護時段停機、單一故障發生時業務等得起多久,答案不同,需要的等級就不同。判斷的依據是中斷對業務的影響:系統停下來一小時,損失多大、有沒有替代流程;影響愈大的系統,愈值得認真考慮高一級的設施。
中小企想用 AI,需要自建數據中心嗎?
不需要。企業應用 AI 可以透過雲端服務按負載使用運算資源,訓練與推論的硬件由服務商的基建承擔,配備 GPU 的機房不必由自己擁有。真正要規劃的是用途與數據準備:以企業知識庫為例,先把文件整理好,系統檢索相關內容再生成答案,效益可以用同一批問題、比較人手查找與系統回答所需時間來衡量。硬件交給服務商,判斷力放在用途與數據上,是較務實的起點。
服務商標明「Tier III 認證」,應該追問甚麼?
追問認證的對象與階段。Uptime Institute 的 Tier 認證分開設計文件、建成設施與營運可持續性,設計文件取得認證,不代表建成後的設施已通過驗證。見到這類標示,值得要求對方列明設施名稱、認證對象與相應證書,再另核服務水平協議的保障範圍、維護安排與補償條款;認證講設施能力,合約講實際承諾,兩者要分開看。
公司資料要放在香港的數據中心,還是放海外也可以?
兩者都可以。地區影響延遲與適用的法規。用戶與伺服器的實際距離會影響傳輸時間,但延遲還取決於路由、網絡互聯與服務當時的負載,地點近不一定代表連線較快。
客人集中在香港的系統,值得直接量度不同節點的實際連線表現,而不是單看地點。做法是固定同一測試頁面、裝置與登入狀態,從目標用戶使用的網絡分別測試,記錄回應時間與失敗情況。有跨境辦公室的企業,還要考慮多地連接與資料流通安排。先弄清這些需要,再比較各地節點的報價。

