跳到主要內容

發表文章

目前顯示的是有「Nvidia」標籤的文章

CoreWeave:專為 AI 打造的 GPU 雲端領導者

CoreWeave 是一家於 2017 年成立於美國的雲端運算公司,專門為人工智慧開發人員提供 GPU 基礎設施 。該公司最初以 Atlantic Crypto 為名,從事加密貨幣挖礦業務,之後策略性地轉型為 AI Hyperscaler™ 。CoreWeave 受益於市場對人工智慧運算能力日益增長的需求,在 2024 年實現了顯著的收入增長 。該公司計畫於 2025 年進行 IPO,目標估值可觀 。 公司概覽與歷史 CoreWeave 最初於 2017 年由 Michael Intrator、Brian Venturo 和 Brannin McBee 創立,名為 Atlantic Crypto,最初專注於使用 GPU 進行 ETH 挖礦 。該公司在加密貨幣挖礦方面的經驗使其掌握了部署和管理能源密集型 GPU 集群的專業知識,這對其未來在人工智慧運算領域的發展至關重要 。在 2018 年加密貨幣市場低迷之後,公司於 2019 年轉型為雲端 GPU 基礎設施供應商,並更名為 CoreWeave 。 該公司在美國和歐洲的主要地區營運著不斷擴大的資料中心 。截至 2024 年 12 月,CoreWeave 在美國擁有 13 個資料中心,在英國擁有 2 個資料中心 ,到同年底,資料中心數量已擴增至 30 個 ,之後更報告擁有 32 個資料中心和超過 25 萬個 NVIDIA GPU 。2024 年,CoreWeave 在倫敦設立了歐洲總部,並宣布在英國進行重大投資 。 核心業務與價值主張 CoreWeave 的核心業務是提供專為 GPU 加速運算設計的雲端服務,特別針對人工智慧工作負載進行了優化 。其使命是透過簡化人工智慧基礎設施的複雜性,並為人工智慧模型訓練和推論提供尖端的效能和效率,從而推動人工智慧革命 。 CoreWeave 的價值主張包括: 專為人工智慧打造的雲端服務,這與為網路規模應用程式設計的傳統雲端不同 。 存取最新和最強大的 NVIDIA GPU,通常是首批提供新架構的雲端供應商之一 。 增強人工智慧工作負載的效能和可擴展性 。 相較於較大型、通用型的雲端設施,可能具有更低的成本 。 透過自動化和託管服務簡化複雜人工智慧基礎設施的管理 。 強大的技術合作夥伴關係,尤其與 NVIDIA 的合作 。 CoreWeave 的專業化使其能夠針對人工智慧的需求優化基礎...

NVIDIA 發表 Blackwell 架構 GPU,為 AI 應用提供前所未有的性能

NVIDIA 最近宣布了一個新一代的 AI 加速器,稱為 Blackwell 架構。這個新系列包括 B100、B200 和 GB200 GPU,有希望為 AI 應用,特別是生成式 AI 領域,提供前所未有的性能。在這篇文章中,我們整理了一下這些新 GPU 的細節、規格、性能以及它們對 AI 產業的可能影響。 NVIDIA Blackwell 架構  Blackwell 架構代表了 NVIDIA 在 GPU 技術上的最新進展,接替了 Hopper 架構。Blackwell 架構以著名數學家 David Harold Blackwell 的名字命名,引入了六項變革性技術,專門為了加速計算和生成式 AI。這些技術包括第二代 Transformer 引擎、第五代 NVLink、RAS 引擎、安全 AI 功能以及用於加速資料庫查詢的解壓縮引擎。 B100 和 B200 GPU B100 和 B200 GPU 是基於 Hopper 的 H100 和 H200 的繼任者。預計 B200 將包含比 B100 更大的高頻寬記憶體容量。B200 是一個 1000W 的模組,高於 H100 的 700W,功率和性能有顯著提升。B200 被稱為世界上最強大的晶片,擁有 2080 億個電晶體,提供高達 20 petaflops 的 FP4 馬力。另一方面,B100 預計將是一個較低階的加速器,TDP 為 700W,使其可以直接與 H100 系統相容。 B100 和 B200 GPU 的整體外觀相比於 H100/H200 大,是因為 Nvidia 將兩組 Blackwell 架構的 Die,號稱是最大的兩顆 Die 直接連接在一起成為一個 Blackwell GPU。 GB200 超級晶片 GB200,也被稱為 Grace Blackwell 超級晶片,是兩個 B200 GPU 和一個 Grace CPU 的組合,提供更高的性能。它是 NVIDIA GB200 NVL72 的一部分,這是一個多節點、液冷的資料中心電腦系統,專為 AI 訓練和推理任務而設計。與相同數量的 NVIDIA H100 Tensor Core GPU 相比,GB200 NVL72 系統可以為 LLM 提供高達 30 倍的性能提升,同時將成本和能耗降低高達 25 倍。 超級電腦的架構 Nvidia 針對 Black...

Nvidia SXM:高效能計算的連接方案

Nvidia 的 SXM(Server PCI Express Module),是個連接高效能計算加速器如 GPU 至系統的高頻寬方案。這項技術支援 Nvidia 多代的高性能 Tensor Core GPU,包括 Pascal、Volta、Ampere 與 Hopper 等架構。 主要特色與優勢 高頻寬與高功率 SXM 插槽以其卓越的頻寬能力聞名,對於機器學習應用和數據中心的高負荷工作至關重要。相較於傳統 PCIe 連接,SXM 提供了更為優異的功率輸出,這對於滿足 Nvidia Tensor Core GPU 的高性能需求非常關鍵。 NVLink 與 NVSwitch 技術 SXM 模組通常整合了 NVLink 交換機,這讓 GPU 之間的通信更加迅速,有效減少了 CPU 和 PCIe 中常見的瓶頸問題。例如,採用 Hopper 架構的 H100 SXM5 GPU,能夠透過 18 個 NVLink 4 通道,達到高達 900GB/s 的頻寬。 高效能冷卻與電源管理 SXM 插槽同時負責電源供應,省去了 PCIe 卡所需的外接電源線。這種設計加上水平安裝方式,使得冷卻效率更高,讓基於 SXM 的 GPU 能在更高性能下運作。舉例來說,Hopper 架構的 H100 僅透過 SXM 插槽就能提供高達 700W 的功率。 系統組裝簡化 SXM 基礎的系統由於沒有利用纜線連結,使得大型系統的組裝與維修更為簡便,同時降低了潛在的故障點。這對於對維護和系統可靠性要求極高的數據中心來說,方便了不少。 Nvidia 生態系統中的 SXM DGX 與 HGX 平台 Nvidia 的 DGX 和 HGX 平台採用 SXM 插槽,為 AI 和機器學習領域提供高性能計算能力。DGX 系統就配備了支援高頻寬和功率輸出的 SXM 插槽,以滿足 Tensor Core GPU 的需求。這些系統具有良好的擴展性,能夠加速訓練過程,並更有效地部署如 GPT-4 這樣的大型語言模型 (LLM)。 客製化與性能表現 HGX 平台提供了客製化選項,用戶可以根據自己的需求選擇記憶體、儲存和網路配置,同時享受 SXM 形式因素帶來的高性能優勢,讓數據中心能夠針對特定需求進行系統定制。 不同世代的插槽 Nvidia 推出了多個世代的 SXM 插槽,如針對 Volta GPU 的 SXM2、針對 Ampere...

為什麼 VRAM 是現代 GPU 不可或缺的原件?

VRAM 是什麼? 視訊隨機存取記憶體(VRAM)是一種專為圖形處理設計的專用記憶體。它被整合於顯示卡內部,扮演著 GPU 與電腦顯示器之間的高速緩衝角色。VRAM 對於儲存 GPU 渲染顯示影像所需的數據是必要的存在,這包括在影片遊戲、3D 建模、影片編輯等圖形密集型應用中渲染圖形所需的紋理、顏色和幾何數據。 VRAM 的重要性 VRAM 對於圖形處理性能的提升起著決定性作用,因為它能夠快速存取和處理影像數據。這一點對於需要即時渲染的應用,例如影片遊戲或模擬,尤其關鍵。VRAM 的容量直接影響到渲染高解析度影像的能力以及支援多顯示器的可能性。更高的 VRAM 容量能夠帶來更流暢的幀率、更細膩的紋理解析度,以及整體更加平滑的圖形表現。 VRAM 如何運作 VRAM 採用並行架構,能夠同時進行讀取和寫入操作,這加快了數據的存取和處理速度。這對於即時渲染尤其重要,因為 GPU 需要迅速處理大量的圖形數據。VRAM 由多個記憶體或模組構成,使其能夠平行處理數據,進一步提升性能。常見的 VRAM 類型包括圖形雙倍數據速率(GDDR,Graphics Double Data Rate)和高帶寬記憶體(HBM,High-Bandwidth Memory),各自在速度和能源效率方面有著不同的優勢。 VRAM 的主要製造商 主要的 VRAM 製造商為 GPU 提供記憶體晶片的公司,包括 Samsung、Micron(NASDAQ:MU) 和 Hynix 等。這些企業以其先進的記憶體技術聞名於世,並經常被 Nvidia 和 AMD 等 GPU 大廠選為合作夥伴,在顯示卡使用上他們的 VRAM。 VRAM 的不同類型 VRAM 有多種不同的形式,包括: Multibank DRAM(MDRAM) :由 MoSys 開發,通過將記憶體分割成多個獨立 bank 來提升性能。 Synchronous Graphics RAM(SGRAM) :專為圖形硬體而設計,支持同時進行讀寫操作。 Window RAM(WRAM) :適用於極高解析度顯示器。 GDDR SDRAM :一系列高性能記憶體標準,包括最新的 GDDR6,用於當代高端 GPU。 High Bandwidth Memory(HBM) :以高傳輸速率和低功耗為特點,適合於高性能顯示卡。 GPU 中的 VRAM 如 Nvidia 的 G...

超越 NVIDIA?Groq 的 LPU 晶片展現超高速的處理能力

Groq:新創 AI 晶片商異軍突起 Groq,不是 Elon Musk 的 Grok 最近引起了不小注意。在高性能 AI 晶片市場中,Groq 這家由前 Google 員工創立的新創公司,正以其獨特的處理器架構引人注意。Groq 致力於處理人工智慧(AI)、機器學習(ML)以及高性能計算(HPC)的高負荷處理,特別專注於 AI 推理領域,即利用訓練過的 AI 模型進行預測或決策的過程。 創立宗旨與遠景 2016 年,Jonathan Ross 率先創立 Groq,並擔任 CEO。Groq 的宗旨在於讓 AI 技術普及,進而將計算成本降至最低。公司努力突破現有 GPU 和 CPU 系統的限制,釋放 AI 的無限潛能。 技術革新:語言處理單元(LPU) Groq 推出了全球首創的語言處理單元(LPU,Language Processing Unit),這是一款專門針對 AI 推理設計的晶片。LPU 的設計目的是為了提供超快速度的推理能力,特別是針對大型語言模型(LLM),這對於聊天機器人、翻譯服務以及其他消費者級 AI 應用相當重要,畢竟時間就是金錢,以現在 GTP-4 的處理速度,也是讓很多使用者不滿意的一點。 LPU 採用 Groq 的 Tensor Streaming Processor(TSP)架構,這一架構免除了複雜的調度硬體需求,使得處理過程更加簡化。這種設計讓 Groq 的晶片能夠展現出出色的性能:高產出與低延遲。 性能表現與市場影響 Groq 的 LPU 在性能上展現了驚人的成績,與 NVIDIA、AMD 和 Intel 等 AI 晶片市場的重量級廠商相媲美。LPU 在一個龐大的 AI 模型上達到了每秒 100 個 token 的記錄速度,並在最近進一步突破,達到每秒超過 240 個 token。這種性能效率的表現,使 Groq 成為業界潛在的新星,很可能衝擊 NVIDIA 的占比。 Groq 已成功籌集顯著的融資,包括一輪由 Tiger Global Management 和 D1 Capital 共同領投的 3 億美元 C 輪融資。公司到目前為止總融資額達到 3.67 億美元,展現了投資者對其技術和市場潛力的高度期待。 應用範疇與實際案例 Groq 的 LPU 適用於各種需要快速且高效 AI 推理的應用場景,包括消費者級生成 AI 應用、自動駕駛汽...