作者ck203l5 (ck203l5)
看板PC_Shopping
標題[閒聊] 洋垃圾低價雙卡AI主機跑Qwen3.6笑能分享
時間Fri Jul 24 03:16:00 2026
2026年堪稱 迴光返照 文藝復興 的重大紀元
只因為AI讓大家都快買不起新電腦
導致什麼奇形怪狀的舊3C零件都能被挖出來重新上架還賣得嚇嚇叫
俗話說 AI主機沒撇步 鈔票砸下去就有
在這個砸大錢就有高效能的時代
來分享一下買不起新零件的窮人AI機笑能供各位板友參考
本次用前陣子特價的 RX9060XT 16G 搭配舊硬體進行測試
********固定設備********
顯示卡: 2張 RX9060XT 16G
LLM: qwen3.6:27b-q4_K_M
Docker: Ollama
KV-Cache量化: q_8
Context Window: 64K
Parallelism: Pipeline Parallelism 流水線並行
********設備1********
CPU: E5-2673 V3
RAM: DDR3-1600L 32GB Dual-CH
MB: HUANANZHI X99 CD3
NAME ID SIZE PROCESSOR CONTEXT UNTIL
qwen3.6:27b-q4_K_M a50eda8ed977 19 GB 100% GPU 65536 Forever
total duration: 1m14.1222733s
load duration: 530.1327ms
prompt eval count: 12 token(s)
prompt eval duration: 368.881ms
prompt eval rate: 32.53 tokens/s
eval count: 965 token(s)
eval duration: 1m13.191813s
eval rate: 13.18 tokens/s
https://i.meee.com.tw/DzRAxhW.png
https://i.meee.com.tw/etWE5Yx.jpg
https://i.meee.com.tw/gkkB4tA.jpg
********比較設備2********
CPU: E5-2690 V4
RAM: DDR4-2400 32GB Quad-CH
MB: 白牌山寨 X99
NAME ID SIZE PROCESSOR CONTEXT UNTIL
qwen3.6:27b-q4_K_M a50eda8ed977 19 GB 100% GPU 65536 Forever
total duration: 1m26.1562391s
load duration: 463.7373ms
prompt eval count: 12 token(s)
prompt eval duration: 349.873ms
prompt eval rate: 34.30 tokens/s
eval count: 1128 token(s)
eval duration: 1m25.335511s
eval rate: 13.22 tokens/s
https://i.meee.com.tw/HUECTE0.png
********比較設備3********
CPU: R9-5900X
RAM: DDR4-3200 64GB Dual-CH
MB: ASRock B550M-ITX/AC + PCI-E通道分割設備
NAME ID SIZE PROCESSOR CONTEXT UNTIL
qwen3.6:27b-q4_K_M a50eda8ed977 19 GB 100% GPU 65536 Forever
total duration: 41.5421257s
load duration: 225.8911ms
prompt eval count: 12 token(s)
prompt eval duration: 323.544ms
prompt eval rate: 37.09 tokens/s
eval count: 565 token(s)
eval duration: 40.97805s
eval rate: 13.79 tokens/s
https://i.meee.com.tw/TWK9EQo.png
********小結********
https://www.reddit.com/r/LocalLLM/comments/1szvz9q/qwen3627b_q3_k_s_on_rx_9060_xt_16gb_decent/
有Reddit上的網友用 [ R9-7950X, 64GB DDR5, RX9060XT 16G, ROCm, llama.cpp ]
跑qwen3.6:27b-q3_K_S, 12288 context, Full GPU offload, KV-Cache q_4, 14.8GB
VRAM Used
<<速度大概是 14 tok/s>>
本次測試用 [ E5-2673V3, 32GB DDR3, RX9060XT 16G X2, Ollama(llama.cpp核心)]
跑qwen3.6:27b-q4_K_M, 65536 context, Full GPU offload, KV-Cache q_8, 19GB
VRAM Used
<<速度大概是 13~14 tok/s>>
<比較點>
1.跑q4_K_M理論上較q3_K_S慢
2.跑64K q8-KV理論上較12K q4-KV慢
3.雙卡跑Pipeline Parallelism (流水線並行)只會比單卡慢不會更快
令人欣慰的是實際跑出來速度沒有慢很多。
但對於RX9060XT這種記憶體頻寬只有320.0 GB/s的顯示卡來說,在Full GPU offload情況
下,換好的CPU或記憶體效能提升似乎有限?
********個人心得********
雖然13~14 tok/s的"笑能"對5070Ti或是5090的卡來說就是個笑話,
但用手邊現有的DDR3記憶體&舊SSD,整套設備大概花1015出頭USD(國內買會更便宜),且9
成預算的零件是能直接挪用到其他電腦,
就能有一台有32G VRAM的AI主機,算是頗划算的了,雖然速度真的有點慢就是了~
CPU: 15 USD
MB: 65 USD
RAM: 0 (現有)
GPU: 850 USD
SSD: 0 (現有)
POWER: 35 USD
CASE: 50 USD
Total: 1015 USD
分享給手邊已有大容量舊記憶體、不想花大錢又想玩AI的板友~
********預算充足能買整台DDR5新電腦的請不要用這種零件折磨自己********
****本篇內容僅為個人測試心得,若論點或觀點有誤還請各位多幫忙指正或分享資訊****
順便分享一下本月剛發布的 LM Studio Bionic 引擎,
用這台設備已能在地端用開源權重模型直接運行自動化AI任務,
它能自己調用工具讀取檔案,分析後自動產製一份Word報告文件(雖然整個要花12分鐘有
點慢就是了)。
https://i.meee.com.tw/yDOXE1x.png
https://i.meee.com.tw/NHKdk8K.png
https://i.meee.com.tw/JyfLBHg.png
感謝您的收看~
--
※ 發信站: 批踢踢實業坊(ptt.cc), 來自: 12.170.106.26 (美國)
※ 文章網址: https://www.ptt.cc/bbs/PC_Shopping/M.1784834166.A.837.html
→ crimsonmoon9: MTP尬下去可以x1.8吧 223.139.62.72 07/24 03:18
推 Leohs: 沒想到9060xt跟395+差不多,MTP下去395大約 203.204.24.193 07/24 03:23
→ Leohs: 20T/s (Q4) 203.204.24.193 07/24 03:23
→ gbcg9725: 關鍵還是顯卡吧 119.14.217.132 07/24 03:37
→ reaturn: 重點是便宜218.166.130.208 07/24 03:42
推 laeva75: 這幾天也弄了台X99+4卡3060 12G花約3萬元 218.161.18.24 07/24 05:07
→ laeva75: Qwen3.6 27B Q8+MTP+多模+128K context 218.161.18.24 07/24 05:09
→ laeva75: prefill 836t/s,decode 48t/s 218.161.18.24 07/24 05:10
推 laeva75: llama.cpp跑--split-mode tensor 218.161.18.24 07/24 05:13
推 kira925: 那樣395+反而是好的那邊吧 1.164.125.38 07/24 07:50
推 seemoon2000: 一般家用重點還是顯存 要先跑得起來 45.144.227.62 07/24 08:20
推 sachialanlus: 幫他找個鞋盒吧 223.137.24.4 07/24 08:27
推 bruce511239: 推分享 X99平台還在發力 114.38.207.32 07/24 08:37
推 saito2190: 別再用ollama惹 改用llama.cpp 114.24.165.214 07/24 09:22
→ saito2190: 參數調一下應該還能更快 114.24.165.214 07/24 09:22
推 are2: 395開mtp大概20tps但是限代碼生成 42.79.30.252 07/24 09:46
推 yymeow: 不考慮張量並行嗎 60.250.130.216 07/24 10:52
推 are2: 主板pcie太舊 開張量並行會悲劇 42.79.30.252 07/24 10:56
推 laeva75: 我測過3060兩張跑pcie 3.0 x16,用--sm 27.53.146.250 07/24 11:05
→ laeva75: tensor後從--sm layer的27t/s提升到45t/ 27.53.146.250 07/24 11:05
→ laeva75: s 27.53.146.250 07/24 11:05
推 laeva75: 再測試頻寬降到PCIe 2.0 x16,速度只降 27.53.146.250 07/24 11:08
→ laeva75: 到44t/s 27.53.146.250 07/24 11:08
→ patvessel: 想追性能就真的別用ollama了 153.192.161.76 07/24 11:18
推 jhjhs33504: 進入AI時代了 真的很缺跑得快的電腦 1.162.85.101 07/24 12:43
→ ganei: 換掉ollama+1,雙卡不要用這個應該會更好, 223.136.93.169 07/24 15:02
→ ganei: 然後bios有above 4G選項的話記得開,resize 223.136.93.169 07/24 15:02
→ ganei: bar應該是不會有,沒得用 223.136.93.169 07/24 15:02
→ ganei: 舊MB就盡量找有x16 pcie的卡,找x8的頻寬會 223.136.93.169 07/24 16:26
→ ganei: 直接腰斬,洋垃圾基本上不太需要擔心pcie的 223.136.93.169 07/24 16:26
→ ganei: Lane 不夠用 223.136.93.169 07/24 16:26
→ skycat2216: 我覺得問題是Ollama223.138.243.205 07/24 19:10
→ skycat2216: 我4060ti只有16G跑個Qwen 3.6 35B,K223.138.243.205 07/24 19:10
→ skycat2216: V雙Q4都只比你慢5Tokens/s223.138.243.205 07/24 19:10
→ skycat2216: 而我的軟體平台是LM Studio223.138.243.205 07/24 19:10
推 cn201: 35B是MoE架構,跟dense的27B比速度基準不一114.136.122.252 07/24 19:25
→ cn201: 樣啦,35B用只有12G的4070ti offload都還有114.136.122.252 07/24 19:25
→ cn201: 20toks以上了114.136.122.252 07/24 19:25
→ bhmagic: CPU PCIE的通道太舊了 隨便換個epyc會好 99.118.209.229 07/24 21:09
→ bhmagic: 一點 epyc洋垃圾的生態也滿健康的 99.118.209.229 07/24 21:09
→ bhmagic: gen4 雙16 的主板 會有點貴就是 99.118.209.229 07/24 21:11