在我們的諮詢工作中,愈來愈多的企業客户會問:未來算力將朝什麼方向發展?今天,當人們談到AI算力時,注意力通常會集中在大型數據中心、高端GPU(圖形處理器)和規模愈來愈龐大的訓練集群上。但未來是不是依然這樣?
眾所周知,全球領先的科技企業正在投入巨額資金建設新的AI數據中心。Meta位於路易斯安那州的Hyperion園區總投資已正式擴大至超過500億美元,IT計算容量提升至5吉瓦(GW)。該項目將成為Meta全球最大的AI數據中心及世界最大的AI基礎設施項目之一。
為了訓練更大的模型,這些設施需要更多芯片、更高速的網絡、更強的電力供應和更複雜的冷卻系統。大型算力園區似乎已成為AI時代最重要的基礎設施。
兩種趨勢並存
不過,AI算力的發展是不是只會沿着不斷集中、大規模的方向前進?我們認為不一定。在大型訓練中心持續擴張的同時,另一種變化也正在發生。AI算力正在逐漸進入分散式的區域數據中心、企業機房、工廠、汽車、機器人和其他智能設備。
不過,未來的AI算力並不會簡單繼續走向集中或開始分散,而是形成兩種並存的趨勢:前沿模型預訓練的算力組織仍將相對集中,推理則會根據任務類型呈現更加明顯的分化。
但這並不意味着雲端的重要性會下降。前沿和複雜推理仍會大量運行在雲端,企業私有化部署將繼續增加,更多推理也會進入邊緣和端側。不同計算任務將在不同層級的基礎設施中運行。
這種變化不僅將重塑AI基礎設施的格局,催生新的芯片需求,還將進一步改變企業的組織、流程和決策方式。

前沿預訓練為何仍相對集中?
前沿模型訓練是一項高度複雜的系統工程。
訓練大型模型通常需要成千上萬顆GPU或其他AI處理器共同完成同一項任務。芯片之間必須保持緊密、持續和低延遲的通訊。任何通訊瓶頸都可能降低整個集群的效率。
因此,決定訓練能力的並不只是單顆芯片的性能,還包括整個系統能否把大量芯片有效地連接起來。
英偉達透過NVLink(GPU高速互聯技術)和NVLink Switch(高速交換芯片)提高GPU之間的通信能力。谷歌的TPU(張量處理器)體系也通過專用高速網絡,將數千顆芯片組織成統一的計算節點集群。
這些系統的共同特點是將大量算力集中起來,讓不同芯片能夠像一個整體一樣運行。這種「集中」主要發生在前沿模型預訓練階段,因為它高度依賴大規模、高帶寬、低延遲的芯片協同。大型AI數據中心因此仍將承擔前沿模型預訓練和其他高度同步的計算任務。
但算力相對集中,並不意味着模型開發也會進一步集中在少數公司手中。隨着開源模型的發展,愈來愈多的企業和研究團隊可以在基礎模型之上進行二次開發。
一些擁有深厚專業知識和數據壁壘的企業,例如金融、工業和醫藥等領域的企業,可能會進一步微調、繼續訓練和業務適配,以形成更貼近自身業務的模型能力。這些任務所需的算力規模遠小於前沿模型預訓練,可以由雲平台、專業服務商或企業自身提供。
而消費品、零售和一般服務行業的大多數企業,往往不需要進一步訓練模型,更重要的是利用已有的通用模型,並將自身的知識、數據和業務工具與之結合。
但訓練並不是AI的全部。

推理正在走向分化
推理是模型訓練完成後的實際運行,例如回答問題、運行智能體、識別圖像、分析現場訊息或協助企業判斷。
與前沿訓練不同,許多推理任務可以獨立完成,並不需要成千上萬顆芯片同時協作。它們可以根據用戶、數據和應用所在的位置,運行在雲端,也可以部署到企業內部、邊緣節點或端側設備。
近年來,隨着長程智能體、上下文工程以及多步驟工具調用的發展,一些複雜推理任務對算力的要求在提高。它們需要處理更長的上下文、調用更多模型和工具,並維持持續運行的狀態。在可預見的未來,大部分複雜推理仍可能留在雲端。雲端數據中心可以在不同用户和任務之間共享算力,並透過較高的設備利用率、成熟的軟件工具和專業運維,降低單位推理成本。
另一方面,現場感知、實時預測以及與設備運行相關的部分推理,具有更強的分布式部署條件。隨着AI進入更多實際場境,推動推理離開雲端向外延伸的兩股力量也變得愈發清晰。
第一類力量是企業內部的私有化部署。醫療、工業、金融和政府等領域的部分數據具有較高敏感性,受到不同的監管要求限制,不能輕易進入公共雲。這些領域推動AI從公共雲進入自身可控的環境,最重要的原因往往是數據安全、隱私、監管要求以及對數據和系統的控制權。
在這些場境中,企業可以透過自有數據中心、私有雲或專屬算力節點運行AI,使敏感數據和關鍵業務留在自身可控的環境中。
微軟的分布式基礎結構解決方案Azure Local允許企業在本地基礎設施中運行雲服務和AI模型。這使部分敏感數據可以留在企業內部,同時完成推理和分析。
第二類力量是邊緣和端側計算。兩者都讓計算能力更加接近數據和業務發生的位置,但所處位置不同。邊緣計算主要運行在靠近業務現場的服務器或計算節點,如工廠、園區或運營商網絡中的邊緣節點;端側計算則直接運行在汽車、機械人、攝像頭和其他智能設備本身。
邊緣和端側計算的主要驅動力,是數據產生和業務執行本身就在現場,以及部分任務對響應速度、網絡連續性和離線運行具有較高要求。
距離本身會直接影響AI系統的響應速度。數據從現場傳到雲端,再返回結果,需要經過多次網絡傳輸與處理。節點愈遠,延遲愈高,不確定性也愈大。
對於一般的知識問答或後台分析,短暫延遲通常不會造成嚴重後果。但在一些關鍵場境中,實時性的要求非常高,例如汽車制動和工業設備緊急停機,都要求系統在極短時間內作出反應。
因此,在涉及安全與實時控制的任務中,關鍵控制鏈路必須留在現場。雲端可以承擔模型訓練、版本更新與數據分析等相對非實時的工作,邊緣或端側的AI則可以參與感知、預測和輔助判斷,並與經過驗證的實時控制系統協同運行。
換句話說,更適合邊緣和端側部署的並不一定是複雜的大模型推理,往往是感知、現場預測和輔助判斷等更加貼近物理世界的任務。
單個端側設備所需要的算力未必很大,但汽車、機械人和各類智能設備的數量可能十分龐大。因此從長期來看,端側可能成為分布式推理的重要增長來源之一。
亞馬遜雲計算服務(AWS)等企業已經開始將部分實時推理能力部署到工廠、現場乃至設備端,並支持部分節點在離線狀態下仍可繼續運行。

AI基礎設施正在形成多層體系
未來的AI基礎設施或將形成從雲端到邊緣、再到端側的多層體系。大型AI數據中心承擔前沿模型預訓練和複雜推理;邊緣節點承擔靠近業務現場的實時推理和數據處理;端側設備則直接在汽車、機器人等設備上完成感知、預測和輔助判斷。安全關鍵任務的最終控制仍由現場經過驗證的實時控制系統完成。
與此同時,對於數據安全、隱私和合規要求較高的企業,部分AI還會以私有方式運行在企業自有數據中心、私有雲或邊緣節點中。
這一多層體系也會受到能源條件的影響。國際能源署預計到2030年,全球數據中心用電量可能接近翻倍,達到約945太瓦時(TWh)。
大型算力中心一旦建成,它的地理布局通常較為固定,電力供應就成為影響其持續擴容的主要約束。電力供應能力、輸配電條件與併網水平,會直接影響算力中心的擴展空間與承載上限。
相比之下,邊緣節點的位置更多取決於業務現場、實時性要求與網絡條件。汽車、機器人和其他智能設備上的端側算力必須跟隨設備本身,難以單純依據能源成本進行遷移。
因此,與其說分布式計算是在「解決」能源問題,不如說它正在重塑算力的空間分布邏輯:大型訓練和複雜推理仍將主要運行在具備穩定電力與基礎設施條件的算力中心,更多現場推理則會隨着業務需要進入邊緣和端側。與此同時,部分企業也會出於數據安全和控制權要求採用私有化部署。
原刊於《經濟觀察報》,本社獲作者授權轉載。
AI算力的新格局 二之一










































