展會信息港展會大全

GPT-4 模型架構(gòu)泄露:包含 1.8 萬億參數(shù)、采用混合專家模型
來源:互聯(lián)網(wǎng)   發(fā)布日期:2023-07-14 14:42:27   瀏覽:12086次  

導讀:IT之家 7 月 13 日消息,外媒 Semianalysis 近日對 OpenAI 今年 3 月發(fā)布的 GPT-4 大模型進行了揭秘,其中包括 GPT-4 模型架構(gòu)、訓練和推理的基礎(chǔ)設施、參數(shù)量、訓練數(shù)據(jù)集、token 數(shù)、成本、混合專家模型(Mixture of Experts)等具體的參數(shù)和信息。 ▲ 圖...

IT之家 7 月 13 日消息,外媒 Semianalysis 近日對 OpenAI 今年 3 月發(fā)布的 GPT-4 大模型進行了揭秘,其中包括 GPT-4 模型架構(gòu)、訓練和推理的基礎(chǔ)設施、參數(shù)量、訓練數(shù)據(jù)集、token 數(shù)、成本、混合專家模型(Mixture of Experts)等具體的參數(shù)和信息。

▲ 圖源Semianalysis

外媒表示,GPT-4 在 120 層中總共包含了 1.8 萬億參數(shù),而 GPT-3 只有約 1750 億個參數(shù)。而為了保持合理的成本,OpenAI 采用混合專家模型來進行構(gòu)建。

IT之家注:混合專家模型(Mixture of Experts)是一種神經(jīng)網(wǎng)絡,該系統(tǒng)根據(jù)數(shù)據(jù)進行分離訓練多個模型,在各模型輸出后,系統(tǒng)將這些模型整合輸出為一個單獨的任務。

▲ 圖源Semianalysis

據(jù)悉,GPT-4 使用了 16 個混合專家模型 (mixture of experts),每個有 1110 億個參數(shù),每次前向傳遞路由經(jīng)過兩個專家模型。

此外,它有 550 億個共享注意力參數(shù),使用了包含 13 萬億 tokens 的數(shù)據(jù)集訓練,tokens 不是唯一的,根據(jù)迭代次數(shù)計算為更多的 tokens。

GPT-4 預訓練階段的上下文長度為 8k,32k 版本是對 8k 微調(diào)的結(jié)果,訓練成本相當高,外媒表示,8x H100 也無法以每秒 33.33 個 Token 的速度提供所需的密集參數(shù)模型,因此訓練該模型需要導致極高的推理成本,以 H100 物理機每小時 1 美元計算,那么一次的訓練成本就高達 6300 萬美元(約 4.51 億元人民幣)。

對此,OpenAI 選擇使用云端的 A100 GPU 訓練模型,將最終訓練成本降至 2150 萬美元(約 1.54 億元人民幣)左右,用稍微更長的時間,降低了訓練成本。

贊助本站

人工智能實驗室
相關(guān)內(nèi)容
AiLab云推薦
推薦內(nèi)容
展開

熱門欄目HotCates

Copyright © 2010-2024 AiLab Team. 人工智能實驗室 版權(quán)所有    關(guān)于我們 | 聯(lián)系我們 | 廣告服務 | 公司動態(tài) | 免責聲明 | 隱私條款 | 工作機會 | 展會港