看板 PC_Shopping 關於我們 聯絡資訊
最初本來只是在主力機只有一張4080在玩ComfyUI,後來看到一張便宜的3080 12G後 就收下來用想說其中一張卡跑一個較小的LLM,但入手後隨著想想玩的東西越來越多 東西也越買越多,最後就乾脆獨立一台。 而這台最終的組合是 X99 平台配五張 RTX 3060,合計 60 GB VRAM。以下大致照組 裝的順序記錄選料、踩到的坑與實際數據。 ▲ 完成後的樣子,開放式礦機架 https://i.urusai.cc/8OpY3.jpeg
【主機板與 CPU】 主機板、CPU 與散熱器是二手整組買的,2500 元。CPU 是 i7-5960X,主機板是 ASUS X99 Deluxe。 選這組的理由是 PCIe 通道配置。這張板子的 所有PCIe x16 插槽由 CPU 直出,不 需要額外的拆分卡就可以有5組 PCIe 3.0 x8插五張 GPU 。網路卡則插在 PCH 提供 的 PCIe 2.0 x4 上。 https://i.urusai.cc/nupyq.jpeg
【記憶體】 記憶體用 2 條 REG ECC 16 GB DDR4-2666。主機板與 CPU 的規格表只寫原生支援到 2133,但實際插上去會自動跑到 2666。 後來跟朋友借了 4 條 8 GB DDR4-3200 來試,四通道 DDR4-3200 也上得去,不過效 能似乎卡在 CPU IMC 本身的限制,跟雙通道 DDR4-2666 差距不大,所以最後就維持 原本那兩條 ECC。反正模型權重全部在 VRAM,主機記憶體只在載入時走一次。 【系統碟與模型儲存】 只配了一顆 256 GB 的 Kingston SKC600 SATA SSD 當系統開機碟。模型權重檔全部 放在 NAS 上,透過 SMB Direct 存取,本機不留副本。 【電源供應器】 電供是技嘉 P1000GM 1000W,RMA 回來未開封的,2000 元收到。它本身就有 6 個 PCIe 8pin 可以直接用,另外再自己做了幾條 SATA 轉 PCIe 6pin 的線,供電給 PCIe 轉接板。 【網路卡】 網路卡用 HPE 544FLR-QSFP+ 40G,很久以前買的,加轉接板一張幾百元。 因為 NAS 端目前是 25G/10G 的網路卡,所以必須加轉接頭降速成 10G 來用。不過 NAS 實際讀取上限大約 2 GB/s,網路卡只有10Gbps還算可以接受。 ▲ HPE 544FLR-QSFP+ 加轉接板 https://i.urusai.cc/Pv0nV.jpeg
【PCIe 延長方案】 延長走的是純被動方案:PCIe x8 轉 SFF-8654 x1,再用 SFF-8654 x1 轉回 PCIe x16。找閒魚上的委託代購,一組含線大約 500 元台幣。 ▲ 轉接板與 SFF-8654 線材 https://i.urusai.cc/JdYT3.jpeg
市面上容易找到的 PCIe x8 轉 SFF-8654 轉接板有兩種,線路看起來比較簡單的那 一種,要把板子上 R5 的電阻位置短路,否則插在主機板第一條 PCIe x16 以外的插 槽會偵測不到卡。 原因是這個電阻位置的兩端分別是 PRSNT1# 與 PCIe x8 的 PRSNT2#,主機板就是靠 這兩個接點有沒有導通,去判斷插槽上到底有沒有插介面卡。第一條插槽會過是因為 它本來就預期有卡,其他插槽就得靠這組訊號自己表態。 ▲ R5 位置補一點錫短路就正常了 https://i.urusai.cc/6mEaM.jpeg
【電力配置】 這台跟主力機共用一組 220V 的電源回路。兩台閒置時合計約 200~250W,LLM 跑起 來大概再加 650W;如果主力機的雙卡(4080 + 3080)同時在生圖或跑影片,總功耗 會衝到 1600W 以上。 ▲ 只有 LLM 在跑的時候 https://i.urusai.cc/9egUG.jpeg
▲ LLM 加上主力機生圖,220V 那一路來到 1651W https://i.urusai.cc/uMpSq.jpg
先前兩台加 NAS 都掛在同一組 110V/15A 回路上,不小心讓 LLM 跟生圖一起跑就會 直接跳電,後來乾脆自己拉了一路 220V/15A 專門給主力機和 LLM 用。NAS 因為接 110V 的 UPS,就繼續留在 110V。 【顯示卡】 五張 3060 是前兩個月陸續收的,單張 5500~6000 元。廠牌沒有統一,ASUS 的 ROG Strix、TUF、Dual 各一張,再加兩張 MSI──二手市場有什麼就收什麼,反正 VRAM 一樣大、跑起來也差不多。以目前新品的售價來看,現在大概很難再用這個價格收到了。 ▲ 五張 3060,廠牌與散熱器都不一樣 https://i.urusai.cc/tm2Hc.jpeg
【軟體與效能】 OS 是 Ubuntu 26,跑 llama.cpp。原本載入跟切換模型都靠 script 檔,後來覺得 太麻煩,就叫 Opus 寫了一個網頁控制介面。 ▲ llama.cpp 控制台,起停模型跟改參數都在這裡 https://i.urusai.cc/N85Ls.png
目前主要跑 Qwen3.6 27B Q8,開多模態與 MTP,模型與 KV 全部放在 VRAM, context 可以開到 256K。在 32K context 長度下,TTFT 48 秒、prefill 677 t/s、 decode 42 t/s。 補一下 Q4 與 Q8 在沒有 MTP 情況下的測試結果: ▲ llama-bench,Q4_K_M 對 Q8_0 https://i.urusai.cc/LFyNp.png
【花費總結】 RAM、SSD、網路卡、礦機架都是本來就有的,這次額外買的只有主機板加 CPU 加散 熱器、電源供應器,以及 PCIe 延長板。 ‧ 主機板 + CPU + 散熱器(二手整組):2,500 ‧ 電源供應器 P1000GM 1000W(二手未拆):2,000 ‧ PCIe 延長板:一組含線約 500,五組約 2,500 ‧ RTX 3060 x5:單張 5,500~6,000,合計約 2.8~3 萬 顯示卡以外的部分加起來大約 7,000 元。以 60 GB VRAM、能把 27B Q8 連同 256K context 整個放進 VRAM 來說還算划算吧 弄下來的一點感想是要搞多 GPU 門檻我覺得並不高。 AM5 平台大多支援把 PCIe x16 拆成 x8+x8、x8+x4+x4 或 x4+x4+x4+x4,再加上 CPU 直出的兩個 x4 M.2,配上 PCIe x16 轉 4x OcuLink 以及 M.2 轉 OcuLink 的 轉接板,就可以生出 6 組 PCIe 4.0 x4 給 6 張 GPU 用。AM4 也可以有 5 組。 我之前就是在 AM5 主力機上跑 PCIe 4.0 x8+x8+x4+x4。用 HWiNFO 看會發現 GPU 的 PCIe Error 計數器有一些數字,但實際運作沒遇到什麼問題;而如果降到 PCIe 3.0,這些錯誤計數就不會出現了。如果改用那種板上有 PCIe Redriver/Retimer 的 延長方案,應該就可以在 PCIe 4.0 下完全沒有錯誤,只是價格貴很多。 至於PCIe頻寬夠不夠,目前 3060 跑 --sm tensor 模式,在 PCIe 3.0 x8(跟 4.0 x4 差不多)下還是有明顯增益的。 接下來說一些建置過程中的測試調整,也有近期看到有人在討論的PCIe頻寬與TP議題 軟體設定修改與測試方面主要是由Codex與Claude Code處理的 下面的內容也是叫Codex/Claude Code撈出來整理的 要先補充的是另一台機器:主力工作站是 Ryzen 7 9800X3D 配約 64 GB DDR5-6000, 平常跑 ComfyUI 生圖,目前掛 RTX 4080 加 RTX 3080 兩張卡。多卡實驗最早就 是在它身上做的,後來卡片才陸續搬到專用伺服器。 卡片在這兩台之間流動過好幾次,這是下文所有測試的背景。順序大致是:主力工作 站先從兩張卡擴到四張,成為多卡實驗的第一個場地;接著才另外組了專用伺服器, 起初只有兩張 3060,中途曾把其中一張換成 3080 用來測異質組合,之後才逐步補 到四張、再到五張同型號的 3060。所以下文提到「這台」時,指的是當時正在測的 那一台,兩者的卡數與拓樸都不同。 最一開始是搞清楚單張 4080 跑得動什麼、能開多大 context。用的是官方 QAT 量 化的 Gemma 4 12B(gemma-4-12b-it-qat-q4_0.gguf,6.50 GiB,另加約 0.16 GiB 的 mmproj),RTX 3080 完全保留不用,正式 profile 設 262,144 context 配 Q8 K/V cache 與 Flash Attention。 ▲ 單卡 Gemma 12B:context 上限 32K vs 256K https://i.urusai.cc/gTBZK.png
這組數字給出了一個貫穿後續所有 context 決策的結論:把可用 context 上限從 32K 拉到 256K,短序列的解碼速度幾乎沒有變化(73.60 對 73.51)。換句話說, 增加 context 上限本身不必然拖慢生成,真正的成本在 KV cache 佔掉的容量,以 及長 prompt 的 prefill 時間。這條結論後來讓幾乎每個 profile 都敢把 context 開大,只在 VRAM 真的不夠時才往回收。 再往後上線的是 Gemma 4 26B A4B Uncensored HauhauCS Balanced Q4_K_M(15.64 GiB,約 26B 總參數配約 4B active),跑在 4080 加 CPU/RAM 上、排除 3080,同 樣是 131,072 context 與 Q8 KV。長時間日誌完成過一次 65,536-token 的連續生 成,平均 43.99 tok/s,另有約 49-50 tok/s 的一般生成紀錄──這證明它不只能 載入,還能長時間穩定輸出。 值得先記一筆的是:這顆 MoE 在「部分權重留在 RAM」的配置下仍有 44 tok/s。同 尺寸的 dense 模型在同樣情況下會慢得多,因為 MoE 每個 token 只啟用少數專家, 實際需要讀取的權重量少了一個量級。 再來是Gemma4-31B Opus Distill 的兩個量化──它們跑在同一組三張卡(3080 加 兩張 3060)上,唯一的關鍵差異是 KV cache 放在 GPU 還是 CPU: ▲ Gemma4-31B Opus Distill:KV 放 CPU vs 放 GPU https://i.urusai.cc/JdUKL.png
Q5 這邊還有更細的量測:載入後三張卡的剩餘量分別是約 2.3 GB、3080 只剩約 436 MB、約 1.05 GB;跑完一次 21K token 的 prefill 之後 3080 仍有約 418 MB, 確認了「idle 時的餘裕約等於穩態餘裕」──因為 KV 是在載入時就整塊預先配 置好的,不會隨著實際用量慢慢長大。生成速度約 11 到 12 tok/s,而且隨深度幾 乎平坦(0 深度 10.9、21K 深度 12.2),代表它是被層鏈中最慢的那張卡綁住,而 不是被 KV 綁住;prefill 在 21K prompt 時約 757 tok/s,首字約 28 秒。 兩相對照,把 KV 留在 CPU 的代價極高──Q6_K 的長生成只剩 4.16 tok/s,是 Q5 (KV 在 GPU)的四成不到,因為每個 token 的跨 PCIe 與 RAM 路徑成了熱點。但 Q6_K 換到的是 128K context(Q5 只有 96K),所以這是一筆刻意的交易而不是設 定失誤:需要長 context 就付速度,需要速度就收 context。 另外 Q5 的 3080 只剩不到 0.5 GB,這個量化已經不能再往上加 context。這也是 整段歷程反覆出現的一個規律:真正卡住的永遠是「最滿的那一張卡」,不是幾張卡 加起來的總量。三張 12 GB 看起來有 36 GB,但只要有一張先滿,整個配置就到頂 了。 主力工作站常常要跑ComfyUI,覺得要切換使用很麻煩,於是要搞了套X99,接下來的 多卡測試換到了另一台X99機器上。這台起初只有兩張 3060──兩張卡都是 Gen3 x16 直連 CPU root port下面幾組測試都是在這台上做的。 換到這台機器最大的一筆效能提升來自切換張量切分方式,而原本的預測完全相反: 這台沒有 P2P、卡間只有 5.57 GB/s 而且要繞主機記憶體,照直覺推斷 tensor parallel 應該不划算。 實測推翻了這個預測(Qwen3.6-27B Q4_K_M @ ctx32K,同一個 prompt、temp 0): ▲ Qwen3.6-27B:-sm layer vs -sm tensor(MTP 開/關) https://i.urusai.cc/J4w9f.png
TP 與 MTP 是乘法疊加的:18.3 經 TP 變成 30.9(1.7 倍),再經 MTP 變成 46 (又 1.5 倍),總共 2.5 倍。 原因在於 batch=1 的生成是記憶體頻寬瓶頸而不是通訊瓶頸:每一層的 all-reduce 只有大約 10 KB,幾微秒就傳完;而 -sm layer 的問題是同一時間只有一張卡在動, -sm tensor 則讓兩張卡同時計算每一層,等效頻寬因此翻倍。GPU 使用率的觀察 印證了這點──layer 模式下有一張卡閒著,tensor 模式下兩張都在 89% 與 92%。 得到的教訓是:不要用「PCIe 慢、沒有 NVLink、沒有 P2P」來推論 TP 不划算,那 個直覺只適用於大 batch 的 prefill。附帶好處是 tensor 模式的 VRAM 分配很平 均(10361/10353),不像 layer 模式那樣偏斜(9747/10949)。生成越長還越快: 114 token 是 34.6,300 token 45.4,800 token 45.8,8.6K prompt 則到 48.5 tok/s。 【把 PCIe 頻寬砍半來測 TP 的敏感度】 既然 TP 的收益這麼大,下一個問題就是它對頻寬有多敏感──如果換到頻寬更窄的 插槽還划算嗎?做法是用 setpci 把 root port 的 LNKCTL2 target speed 從 Gen3 降到 Gen2 再 retrain(這個改動不持久,重開機自動回復)。Gen2 x16 的 8.0 GB/s 約等於 PCIe 3.0 x8 的 7.88 GB/s,是很好的代理,因為軟體改不了 lane 數 只能改速度。 ▲ PCIe 由 Gen3 x16 降到 Gen2 對 TP 的影響 https://i.urusai.cc/Qbtgs.png
頻寬砍半只讓 prefill 掉 9%、decode 掉 5%,所以即使只有 x8 也該用 tensor (44.4 對 29.6,還是 1.5 倍)。對照組只掉 1% 與 0.4%,這證明量到的確實是 PCIe 的影響而不是雜訊。 更重要的是從這裡導出的洞察:痛不痛不是看頻寬,而是看「通訊佔計算時間的比例」。 主力工作站的 3080 掛在 PCH 後面的 PCIe 4.0 x4(7.88 GB/s,跟這裡的 Gen2 差不多),但那邊的 tensor prefill 卻直接腰斬(2123 掉到 1011)。差別 有兩個:一是 4080 與 3080 的算力約為 3060 的三倍,計算時間短,同樣的通訊量 佔比就大增;二是 PCH 多了一跳而且有 DMI 爭用,延遲遠高於直連 root complex。 所以單純從 x16 降到 x8 不痛,PCH 加上快卡才痛。 【P2P 解鎖:技術上成功,實用上幾乎沒有意義】 TP 既然靠卡間通訊,那把被鎖住的通道打開應該還能再快一點──這是很自然的下 一步。消費卡的 P2P DMA 被 NVIDIA 鎖住,但社群有開源分支可以解開,原本估計 「通訊約 5ms 一個 token,P2P 省一半就有 +10%」。 實際做法是把 BIOS 改成 OS Type=Other OS(Secure Boot 關閉)並開啟 Above 4G Decoding,驅動換成 .run 安裝的 610.43.03 userspace 加上 aikitoria/open-gpu-kernel-modules 的 610.43.03-p2p 自編未簽名模組(taint 12288),並補上 nouveau 黑名單與 update-initramfs -u、把三個 kernel 套件 apt-mark hold 住、開 NVreg_EnableResizableBar=1 加 grub 的 pci=realloc,以 及把 NCCL 的 P2P 層級設成 SYS。 ▲ P2P 解鎖前後:卡間頻寬 vs llama.cpp 實際效能 https://i.urusai.cc/bcS8a.png
原本估的 +10% 是錯的。CUDA 層確實開通了,但 llama.cpp 幾乎沒有受益──因為 llama.cpp 早就把通訊與計算重疊了,通訊根本不在關鍵路徑上,加速它省不到時間。 頻寬分析只在大 batch 的 prefill 才成立,而那正好就是唯一有改善的地方。這 也和前一節的結論互相呼應:既然頻寬砍半只掉 5%,把頻寬加倍自然也換不回多少。 另外三點值得記:NCCL_P2P_LEVEL=SYS 不設就等於整套白裝(NCCL 看到 PHB 拓撲 會預設走繞主機的路徑);ReBAR 生效的關鍵是 pci=realloc 而不是驅動版本 (GPU0 是 boot_vga,BAR 卡在 4G 以下,沒有 realloc 搬不上去),BAR1 因此從 256 MB 變成 16 GB;而把 patch 移植到舊驅動是死路──上游 fork 最新只到 570, 套到 595 有六個 hunk 失敗、全都在建立 peer PTE 的那段程式碼,手工補會靜 默地寫錯實體位址,比不能用還糟。 【-ts 有效,但 3080 的 12 GB 是個死結】 這台專用機中途曾把一張 3060 換成 3080,於是有了一組乾淨的異質卡環境可以驗 證 -ts(手動指定各卡分配比例)到底有沒有用──兩張卡都是 Gen3 x16 直連、沒 有 PCH 汙染。單卡的 tg128 是 3080 89.5、3060 42.1,所以理論最佳比例是 0.68/0.32。 ▲ 異質卡 -ts 比例掃描(3080 + 3060) https://i.urusai.cc/7v4B7.png
從均分調到正確比例是 +38%,而且是單調上升直到理論最佳點才 OOM──如果不設 -ts,快卡會完全被慢卡拖住。 但把整個組合背對背比較之後,結論卻很掃興: ▲ 3080+3060 與 2x3060 的 decode 背對背比較 https://i.urusai.cc/JJk8a.png
-ts 調校與 MTP 只能二選一,而 MTP 比較划算。要讓 3080 真正出力就得給它 68% 的層數,也就是 10.8 GB,再加上 MTP 的 context(458 MB)與 compute buffer 就爆掉 12 GB──ctx 試到 32k、16k、8k 全部 OOM,連 8192 都不行。核心問題是 3080 快 2.13 倍但 VRAM 跟 3060 一樣是 12 GB,速度配不上容量,要換 24 GB 的 卡才解得開。 換句話說,換上一張更快的卡並沒有換到更快的推論。這台機器最後的選擇是回頭走 同型號路線──與其湊一張快卡加一張慢卡,不如多放幾張一樣的卡,讓分配變簡單、 也讓每張卡的負擔平均。 【四卡一次到位】 四張 3060 到位之後,嘗試一次拿到「Q8 精度加 128K context 加多模態加 MTP」 全開。腳本用四卡 -sm tensor(同型號同速所以不需要 -ts,正好省掉上一節那個 兩難)、ctx 131072、Q8 KV、Flash Attention 打開、MTP 開啟,並為視覺任務加 上 --image-min-tokens 1024。 結果是一次就成功、零 OOM:VRAM 用掉 39,900 / 49,152 MiB(81%),每張卡還剩 1.5 到 2.6 GB,載入 56 秒。短文字生成 39.3 tok/s;8.6K prompt 的 prefill 是 836 tok/s、生成 48.2 tok/s;圖片 prefill 436 tok/s。最有說服力的是深層 驗證:52,551 token 的 prompt 以 760 tok/s 處理完,而埋在最開頭的密語被一字 不差地複述出來──這證明它不只是「能載入」,而是真的記得住。 那麼加卡到底買到了什麼? ▲ 2x3060 vs 4x3060:加卡的邊際效益 https://i.urusai.cc/Xwtle.png
擴展是次線性的,效率大約 0.33,因為 4-way all-reduce 的通訊成本吃掉了大半 算力紅利。但加卡的真正價值不是速度而是容量──四卡跑 Q8(836 / 48.2)全面 勝過雙卡跑 Q4(664 / 45.7),等於精度翻倍、context 翻倍、圖片快十倍,而速 度不減。 其中「圖片快十倍」值得單獨說明:四卡最大的好處是 mmproj 可以放上 GPU。雙卡 時 VRAM 不夠,必須讓視覺編碼器跑在 CPU 上,圖片 prefill 只有 46 tok/s;四 卡放上 GPU 之後(GPU0 多吃 1.1 GB)跳到 436 tok/s。 補充有人提問的Qwen3.6 35B A3B Q4的測試 https://i.urusai.cc/9r7pc.png
-- ※ 發信站: 批踢踢實業坊(ptt.cc), 來自: 218.161.18.24 (臺灣) ※ 文章網址: https://www.ptt.cc/bbs/PC_Shopping/M.1786274152.A.A50.html
d030b: 感謝分享 36.226.229.109 08/09 19:26
saito2190: 先推,拉220V的都是狠人 XD 114.24.163.152 08/09 19:29
YCL13: 推經驗分享,一般而言這些實測多不會分享 1.161.149.226 08/09 19:39
ms0317929: 推經驗分享 122.118.26.176 08/09 20:02
EYESOFDARKKE: 推經驗分享,這些細節很難看到。 114.27.87.184 08/09 20:06
weiber82: 可以寫論文了XD 118.231.193.86 08/09 20:07
DSI: 推! 124.218.173.68 08/09 20:19
xzero0911: 超猛 玩LLM我最後還是覺得訂閱線上便宜 114.34.51.252 08/09 20:27
xzero0911: 的用就好… 114.34.51.252 08/09 20:27
CGary: 推一下細節分享 我最近也動腦筋到 223.137.159.84 08/09 20:47
CGary: 這種事 學習了 223.137.159.84 08/09 20:47
yenchieh1102: 超猛,相比看不下去的好像分享了什 1.161.64.81 08/09 21:00
yenchieh1102: 麼又好像什麼都沒分享 1.161.64.81 08/09 21:00
powergreen: 推118.168.217.117 08/09 21:01
nanobiofilm: 推 1.162.165.22 08/09 21:13
zorro1111: 推 114.25.205.204 08/09 21:41
kawa0710: 超猛,根本小論文 123.241.243.11 08/09 21:43
kcwu1234: 好奇問這種可以做影片嗎?MJ VS Dio之類 125.229.194.59 08/09 22:07
跑影片模型的話不會多快,影片模型偏重計算而3060單卡算力太弱了 影片的話我是另一台4080+3080 12G去跑的
Transposon: PTT電蝦所口試論文 61.227.11.134 08/09 22:37
narukaza: 如果RAM是ECC的,可以考慮升級EPYC,7 114.34.174.204 08/09 22:37
narukaza: 卡不是夢(? 114.34.174.204 08/09 22:37
narukaza: 而且基本功耗可以少個100瓦以上... 114.34.174.204 08/09 22:37
是有考慮過EPYC,但主機板二手價都不便宜。 理想上PCIe 4.0x8 x8卡+128GB 8通道DDR4,做部分CPU Offload可以跑更大的模型 不過記憶體目前也還在漲....
ms0608432: 最近也在研究,感謝分享 114.24.33.6 08/09 22:56
saiboos: 推 電蝦論文 118.231.177.8 08/09 22:58
GenShoku: 我現在很認真在考慮要不要搞個兩張4090D 123.192.94.227 08/09 23:21
GenShoku: 48G來塞我的全精度qwen3.8 27b... 123.192.94.227 08/09 23:21
也有想過玩魔改卡但有點擔憂耐用度,反覆加熱及沒原廠焊接品管,且單卡也不便宜
felixr0123: 好猛喔 可以跑什麼模型 是不是影片什 42.73.211.72 08/09 23:32
felixr0123: 麼都一下就算出來了 42.73.211.72 08/09 23:32
seemoon2000: 其實我也是玩了一堆方案 我自己心得 45.144.227.89 08/09 23:40
seemoon2000: 就是 直接買DGX就好.... 45.144.227.89 08/09 23:41
sdbb: 謝謝原po和seemoon2000 112.104.65.143 08/09 23:53
shinjikawuru: 結論 能一張大卡 就一張大卡 省事XD 1.172.79.206 08/10 00:05
會搞這個的其中一個原因就是買不起大卡&DGX&大容量Strix Halo...
d0178411: PTT到底還是學術論壇 223.143.242.96 08/10 00:26
wellzx: 推分享 1.160.129.61 08/10 00:31
v86861062: 推推 220.134.60.79 08/10 00:47
Link1218: 推經驗分享118.231.192.130 08/10 00:52
ian31722: 推分享 114.24.198.159 08/10 01:01
Obama19: 搞一堆 結果還是叫Opus寫程式 笑死 114.37.209.17 08/10 01:18
felaray: 推個 夠細節 118.168.212.28 08/10 02:11
Supasizeit: 推一下 可是這麼搞剛跟MacBook Pro203.204.195.174 08/10 04:22
Supasizeit: 跑起來效能差不多@@203.204.195.174 08/10 04:22
bhmagic: 你是那裏找到這麼多3060 16GB的 XDD 99.118.209.229 08/10 04:53
bhmagic: 眼花 看錯了 沒事沒事 99.118.209.229 08/10 04:54
samsonfu: 推 111.81.33.102 08/10 05:30
aries5420: 推一個 122.117.59.50 08/10 06:33
cannedtuna: 可以推出水冷+熱水器的機殼了 1.168.221.188 08/10 06:42
cannedtuna: 24小時運轉的1000w家用伺服器 1.168.221.188 08/10 06:42
cannedtuna: 拿來燒熱水剛好 1.168.221.188 08/10 06:42
cannedtuna: 伺服器過熱就自動提醒去洗澡消耗熱水 1.168.221.188 08/10 06:49
lordmi: x99配30系顯卡效能跟價格剛好,但是要用 36.229.110.69 08/10 07:29
lordmi: 更現代的卡,天花板就會被卡住了 36.229.110.69 08/10 07:29
也是覺得3060這等級卡的卡最適合
kf0916: 推心得分享 223.143.240.28 08/10 07:35
baby850811: 專業推 42.75.69.163 08/10 07:58
※ 編輯: laeva75 (218.161.18.24 臺灣), 08/10/2026 08:20:31
avans: 實用(?)推223.137.118.240 08/10 08:15
※ 編輯: laeva75 (218.161.18.24 臺灣), 08/10/2026 08:29:58
paul5566: 推喇 61.227.33.112 08/10 08:47
marklai: 推 3060真是長青卡,我也有一張還在用 125.231.21.65 08/10 09:01
vsbrm: 沒有一定硬體跟軟體知識還真的搞不起來,還 223.138.26.101 08/10 09:09
vsbrm: 好是出現在電蝦版,如果出現在硬體版就.... 223.138.26.101 08/10 09:09
chuckysky: ptt果然是學術論壇 223.140.36.36 08/10 09:23
gbcg9725: 漲價前395不貴 五萬多 110.28.121.96 08/10 09:26
gbcg9725: 多卡生圖生影片沒什麼幫助 110.28.121.96 08/10 09:27
d82465213: 推 39.10.61.168 08/10 09:29
foolishness: 感謝分享 118.231.148.13 08/10 09:46
stinkyshit77: 優文推 42.72.145.181 08/10 10:14
fredking1: 專業推 223.140.86.149 08/10 10:41
lolicat: 好猛 純推 49.215.241.49 08/10 10:46
marklai: 多卡跑comfyUI,我覺得還是蠻可以的,我 125.231.21.65 08/10 11:05
marklai: 有一台三張N卡一起跑,有的跑語言模型, 125.231.21.65 08/10 11:05
marklai: 有的跑圖有的跑影片,常常很忙,記憶體 125.231.21.65 08/10 11:05
marklai: 大一點的像3090 ,有時候又要跑llm 又要 125.231.21.65 08/10 11:05
marklai: 跑圖,忙得不亦樂乎 125.231.21.65 08/10 11:05
marklai: 另外一台5070ti+intel b70,現在正在分 125.231.21.65 08/10 11:11
marklai: 別跑comfyui,b70要分別跑llm,zit還有影 125.231.21.65 08/10 11:11
marklai: 片minimax,常常在loading 又unloading 125.231.21.65 08/10 11:11
marklai: 很忙 125.231.21.65 08/10 11:11
fay001: 根本神 49.215.57.104 08/10 11:17
e2167471: 以前礦機是會被噓爆的,現在AI機倒是大 60.250.144.174 08/10 11:19
e2167471: 大方方,有人分析過兩者的差異嗎?在我 60.250.144.174 08/10 11:20
e2167471: 看來其實意思差不多 60.250.144.174 08/10 11:20
kitkat1051: 一個有實際產出 相關研究可以推進技 116.59.165.91 08/10 11:32
kitkat1051: 術迭代 一個沒有 116.59.165.91 08/10 11:32
inte629l: 推實驗 超酷 118.167.71.136 08/10 11:48
ganei: 拿礦機比是來亂的吧?XX比雞腿 42.79.188.105 08/10 11:52
gbcg9725: 共通點應該只有顯卡大幅漲價 110.28.121.96 08/10 11:59
seemoon2000: 礦潮還有其他周邊礦渣可以撿 LLM這 89.117.42.38 08/10 12:06
seemoon2000: 波是買家變成渣 89.117.42.38 08/10 12:06
years7944: 超用心整理的 感謝分享223.140.134.197 08/10 12:09
xiaotee: 推223.139.106.251 08/10 12:17
liknacamgal: 推 36.238.251.104 08/10 12:33
BisWang: 推經驗分享,本地AI要嘛燒錢要嘛就要有創 223.137.87.253 08/10 12:36
BisWang: 意 223.137.87.253 08/10 12:36
BisWang: 喔對了,建議把SATA轉pcie供電換掉,那個 223.137.87.253 08/10 12:40
BisWang: 東西超容易燒,大4pin轉pcie還好一點 223.137.87.253 08/10 12:40
Supasizeit: 他自己做的線沒差吧 轉接頭都一樣有203.204.195.174 08/10 13:09
Supasizeit: 風險203.204.195.174 08/10 13:09
PolarClover: 如果跑llm+長期運作,弄個兩張r9700 111.71.78.153 08/10 13:19
PolarClover: 32gb應該比較省事,至少有兩條x8 sl 111.71.78.153 08/10 13:19
PolarClover: ot的主機板就能用,目前相容性再差也 111.71.78.153 08/10 13:19
PolarClover: 比Imtel B70要好的多 111.71.78.153 08/10 13:19
widec: COOL 1.165.2.132 08/10 13:21
mookio: 不要瞧不起intel b70 32g, 目前想 27.247.89.208 08/10 13:21
mookio: 買還買不到,成熟的速度很快 27.247.89.208 08/10 13:21
mookio: https://i.ibb.co/ZRjHgkPw/1.jpg 27.247.89.208 08/10 13:24
mookio: 五卡ai推理機 + 5卡comfyui 任意出 27.247.89.208 08/10 13:24
mookio: 圖 27.247.89.208 08/10 13:24
twisukuku: 推專業 猛 49.216.130.154 08/10 13:26
e2167471: 礦機是賺個人錢,本地AI機說穿了也是啊 60.250.144.174 08/10 13:39
e2167471: 有哪一台AI機是為了公共利益?但搶卡搶 60.250.144.174 08/10 13:39
e2167471: 零組件毫無疑問是共通的,鄉民的態度卻 60.250.144.174 08/10 13:40
e2167471: 大不相同,說真的礦潮也一堆鄉民在偷挖 60.250.144.174 08/10 13:40
e2167471: 只是不敢拿到板上講而已 60.250.144.174 08/10 13:40
wei115: 太貴惹,我現在找GPU租賃,5090一小時3塊 111.82.148.124 08/10 13:53
wei115: 人民幣,但搞NSFW要規劃加密,LLM則是lla 111.82.148.124 08/10 13:53
wei115: ma cpp都在記憶體中處理,線路也是ssh隧 111.82.148.124 08/10 13:53
wei115: 道,搞什麼審查工都很大,不划算,所以就 111.82.148.124 08/10 13:53
wei115: 沒管 111.82.148.124 08/10 13:53
GenShoku: 礦機是純粹賺投機錢,本地AI機是偏向個 114.137.64.54 08/10 13:56
GenShoku: 人使用優化工作流,甚至有些人認為這就 114.137.64.54 08/10 13:56
GenShoku: 是在「玩」,那這樣跟買顯卡玩遊戲不就 114.137.64.54 08/10 13:56
GenShoku: 是同樣道理? 本地AI那個算力速度是要怎 114.137.64.54 08/10 13:56
GenShoku: 麼多併發當伺服器賺錢啦,根本完全不同 114.137.64.54 08/10 13:56
GenShoku: 的事情好嗎 114.137.64.54 08/10 13:56
gbcg9725: 這波漲價主因又不是個人導致 110.28.121.96 08/10 13:58
RaiGend0519: 推心得 111.82.182.93 08/10 14:11
RaiGend0519: 本地AI著重處理個人本地資料 111.82.182.93 08/10 14:13
RaiGend0519: 跟雲端AI的用途不同 111.82.182.93 08/10 14:13
yymeow: 推這篇,超專業的 60.250.130.216 08/10 14:20
catboost: 太猛了 114.136.143.54 08/10 14:23
shiauber: 這local端 超讚的 真的優秀 114.137.61.193 08/10 15:03
hangtenboy: 只能跪了… 101.10.158.181 08/10 15:07
kuroshizu21: 這文一定要推的, 感謝分享啊!! 61.227.28.176 08/10 15:14
ganei: 你的工作是當礦工嗎?拿AI的生產力跟挖礦比 42.79.188.105 08/10 15:17
ganei: ,叫那些挖礦軟體寫幾段程式來看看 42.79.188.105 08/10 15:17
necrophagist: Local ai需要展現更大的需求 廠商 111.81.62.27 08/10 16:06
necrophagist: 才會 care 出更多產品 111.81.62.27 08/10 16:06
BisWang: 回94樓,sata就是容易燒在接頭,針腳太密 223.137.87.253 08/10 16:17
BisWang: 自己做用好線也沒啥用,有點像現在災難的 223.137.87.253 08/10 16:18
BisWang: 12VHPWR 223.137.87.253 08/10 16:18
Nafusica: 有轉接都會燒 不過問題在12V倒灌 220.141.208.55 08/10 16:35
Nafusica: 其實跟線材關係不大 PCB Trace都會燒了 220.141.208.55 08/10 16:35
Nafusica: 但目前沒有電源廠有意識到12V倒灌的問題 220.141.208.55 08/10 16:36
Nafusica: solution也是沒防 土砲多卡只能多燒香 220.141.208.55 08/10 16:36
kcwu1234: 組一台做影片的,投稿紅果XD 223.137.92.245 08/10 16:44
lordmi: 在正經用ComfyUI的話這配備是很可以但不是 36.229.110.69 08/10 17:45
lordmi: 很推,流水線用5090兩張能最快交件。再上 36.229.110.69 08/10 17:46
lordmi: 去沒那麼划算,說到底就是X99之後就沒類似 36.229.110.69 08/10 17:48
lordmi: 切性能切太大塊的方案了... 36.229.110.69 08/10 17:48
kunyi: 強 推一個 59.124.80.190 08/10 19:30
proton63: 推 111.255.11.88 08/10 20:13
maxim755: 現在好像都沒有x99 x299這種平台出來了 118.168.128.97 08/10 20:15
maxim755: 嗎 118.168.128.97 08/10 20:15
w1222067: 猛,但我不是客群xd 61.224.25.82 08/10 20:23
Xray2002: 推,強者 220.141.234.18 08/10 21:08
ck203l5: 感謝分享那麼多寶貴的設定細節,X99萬歲 12.170.106.26 08/10 23:12
ck203l5: 最寶貴的是多卡TP在不同PCIE下速度比較 12.170.106.26 08/10 23:16
ck203l5: 看來最大重點就是卡不能掛在PCH的PCIE上 12.170.106.26 08/10 23:16
tyr2004: 推223.139.227.227 08/10 23:18
Ruhaha: 雖然看不懂 不過給個推 180.218.86.85 08/11 00:33
Litfal: 跪的腳好麻 1.34.131.99 08/11 01:40
p41413: 優質文 推推 152.117.171.93 08/11 07:47
z1357961: 推優質論文(? 165.91.13.58 08/12 02:19
※ 編輯: laeva75 (218.161.18.24 臺灣), 08/12/2026 07:06:19
winiel559: 高手 114.24.155.251 08/12 09:13
demintree: p2p要在同一個PCIe Switch 之後才能發 73.252.153.154 08/13 16:01
demintree: 揮最大效率,GPU 之間的DMA不需要經過r 73.252.153.154 08/13 16:01
demintree: oot complex 73.252.153.154 08/13 16:01
demintree: PCIe有error,大部分就是重送一次封包, 73.252.153.154 08/13 16:06
demintree: 所以error多會明顯影響速度 73.252.153.154 08/13 16:06