看板 PC_Shopping 關於我們 聯絡資訊
前陣子有朋友在評估只有一條PCIE-X16主機板想玩雙卡AI 故這次這邊買了一組PCIE轉SFF-8654通道拆分卡來實測 https://i.meee.com.tw/xZShP8H.jpg
測試設備: CPU: R9-5900X MB: ASROCK B550M-ITX/AC (PCI-E 4.0) VGA: 2張 ZOTAC 5060TI 16G 想說反正5060TI本來也就只有物理PCIE X8 一張卡佔用一條X16實在太浪費,乾脆拿來測試這套設備 1.先做一般顯示輸出測試,確認其穩定度與可用性 (1)顯卡直插主機板 3DMark-TimeSpy 測試 https://i.meee.com.tw/KPjD3t1.jpg
https://i.meee.com.tw/mydevDH.png
(2)透過拆分板&SFF-8654連接 3DMark-TimeSpy 測試 https://i.meee.com.tw/vyGVAiV.jpg
https://i.meee.com.tw/dRFW6Ug.jpg
https://i.meee.com.tw/DmohbnF.png
可以看到透過拆分裝置連接的5060TI (PCIE Link-Speed 16GT/s 代表走 PCI-E 4.0) 在PCIE Error Counter中 Recoverey Count 的數量明顯增加 (但直插時也有這個Count只是較少) NAKs Received Count 也出現幾筆 (直插沒這個Count) 但沒有出現被列為Error等級的Count 表示訊號傳輸確實會受到拆分裝置影響,但不至於出現"錯誤"等級的問題 從3DMark分數來看也在誤差範圍內,證明這套拆分裝置的可用性。 2.雙卡AI測試 https://i.meee.com.tw/7ze7zSz.jpg
https://i.meee.com.tw/F5DdSko.png
用Ollama跑Qwen3.6-27B-Q4_K_M KV量化Q8 Pipeline Parallel 情況下 得到結果為23tk/s (當然換個引擎會更快但主要是驗證通道拆分裝置,就不另外多測了) 這邊可以看到 Recoverey及NAKs Received Count 都集中在有插螢幕的這張卡上 沒螢幕只負責計算的卡 Recoverey Count 就很少 可推斷通道拆分裝置對Pipeline Parallel模式下的AI多卡運算影響不大 3.PCI-E降速測試 網路上一直有查到一套論述是 "對於Pipeline Parallel模式,PCI-E 3.0 & 4.0 在X8下 差異不大" 正好就拿這套設備來自己驗證 https://i.meee.com.tw/HGuSq2o.png
可以看到跑出來速度還是23tk/s左右 (PCIE Link-Speed 8GT/s 代表走 PCI-E 3.0) 4.測試小結 (1) "品質好的"通道拆分裝置,對於2張5060TI等級的卡,要跑PP並行模式的AI,其穩定 性是足夠的。 (2) PCI-E X8 3.0 & 4.0 對於2張5060TI等級的卡,在PP並行模式下,AI運算速度影響不 大。 分享給有考慮SFF-8654 PCI-E通道拆分裝置的板友參考~ ****本篇內容僅為個人測試心得,若論點或觀點有誤還請各位多幫忙指正或分享資訊**** ****以上係對Pipeline Parallel進行驗證,想跑Tensor Parallel的要另外驗證影響程度 **** 感謝您的收看~ -- ※ 發信站: 批踢踢實業坊(ptt.cc), 來自: 172.56.164.96 (美國) ※ 文章網址: https://www.ptt.cc/bbs/PC_Shopping/M.1786029182.A.931.html
pphyy5844548: 換個引擎是指換llm.cpp嗎 123.252.75.84 08/06 23:16
ck203l5: 絕大多數情況下llama.cpp一定比Ollama快 12.170.106.26 08/06 23:21
ck203l5: Ollama就是主打懶人用的但效能不是最好 12.170.106.26 08/06 23:22
crimsonmoon9: 個人實測過就算只有PCIe的頻寬在vLL 42.77.121.248 08/07 00:26
crimsonmoon9: M上TP還是比PP有效率 42.77.121.248 08/07 00:26
crimsonmoon9: 有點想不通它的邏輯 之前手算應該要 42.77.121.248 08/07 00:26
crimsonmoon9: NVLink等級才會追過才對 42.77.121.248 08/07 00:26
fu1vu03: 用50不考慮跑個NVFP4嗎 211.76.56.41 08/07 00:39
marklai: 請問如果主版是5×16, 這樣拆分後是5×8 125.231.12.162 08/07 02:10
marklai: 或4×8呢?它的轉接版跟線可以支援到pcie 125.231.12.162 08/07 02:10
marklai: 5嗎? 125.231.12.162 08/07 02:10
TameFoxx: TP其實沒那麼吃頻寬 182.233.84.193 08/07 02:16
TameFoxx: 他權重拆layer,kv好像也會拆,兩邊 182.233.84.193 08/07 02:17
TameFoxx: 傳遞最新生出來那個就好,應該類似這樣 182.233.84.193 08/07 02:17
crimsonmoon9: 你那個是PP吧 TP是同一層拆到兩張上 42.77.121.248 08/07 02:29
crimsonmoon9: 算完再all-gather同步後再接著算拆 42.77.121.248 08/07 02:29
crimsonmoon9: 開的下一層 42.77.121.248 08/07 02:29
ck203l5: SFF-8654只有PCI-E 4.0,但它有另一個 12.170.106.26 08/07 03:11
ck203l5: 外觀很像的規格叫 MCIO(SFF-TA-1016) 12.170.106.26 08/07 03:11
ck203l5: 是跑PCI-E 5.0的,蝦皮美亞搜一下就有。 12.170.106.26 08/07 03:11
ck203l5: 但有個先決條件就是主機板BIOS要有支援 12.170.106.26 08/07 03:11
ck203l5: PCIe通道拆分(PCIe Bifurcation),才能 12.170.106.26 08/07 03:11
ck203l5: 將原本X16插槽自己先拆成X8+X8兩段訊號, 12.170.106.26 08/07 03:12
ck203l5: 再透過MCIO轉接卡將前後兩段分別拉出來 12.170.106.26 08/07 03:12
ck203l5: 成2個獨立的PCI-E插槽。 12.170.106.26 08/07 03:12
ck203l5: 若主機板原生5.0X16且支援PCIe通道拆分 12.170.106.26 08/07 03:12
ck203l5: 就能用MCIO線材拆成2個獨立的5.0X8插槽 12.170.106.26 08/07 03:13
ck203l5: 並獨立安裝兩張顯示卡(2張都跑5.0X8)。 12.170.106.26 08/07 03:13
ck203l5: https://i.meee.com.tw/H4VLcRq.jpg 12.170.106.26 08/07 03:22
ck203l5: 像這種就是MCIO規格走PCI-E 5.0的 供參 12.170.106.26 08/07 03:22
fautumn: 感謝測試111.240.133.159 08/07 10:32
TameFoxx: Crim 大看到了 好像是batch沒很大時 42.79.182.17 08/07 12:48
TameFoxx: 感受不到差異,所以單人使用沒啥差 42.79.182.17 08/07 12:49
d030b: 感謝分享 36.226.192.222 08/07 18:57
sonicyang: 一直想導入,但是沒解決的是機箱問題。 49.239.79.96 08/07 19:54
sonicyang: 不是很想讓顯卡裸奔 49.239.79.96 08/07 19:54
moco5360: 27b的模型 也很尷尬… 上下文一多 任 42.79.34.114 08/07 22:37
moco5360: 務長一點 就開始弱智了.. 有能力的就 42.79.34.114 08/07 22:37
moco5360: 直接 統一記憶體架構 或者 線上api…. 42.79.34.114 08/07 22:37