推 kcy05785: 更低買中國2080ti魔改2張22k搞定 114.34.209.162 08/05 18:05
→ kcy05785: 剩下就這樣板子要能拆成X8+X8的 114.34.209.162 08/05 18:05
→ kcy05785: 我弄一弄整機不到50k 114.34.209.162 08/05 18:06
推 seemoon2000: 中國他們網友都說店保=不保=送張哥 45.144.227.57 08/05 18:11
推 pphyy5844548: 2張5080不知道可不可行,跑Qwen 3 39.10.48.1 08/05 18:17
→ pphyy5844548: .5 27B 39.10.48.1 08/05 18:17
→ pphyy5844548: 我主機板最多裝兩張,再上去就不知 39.10.48.1 08/05 18:18
→ pphyy5844548: 道怎麼裝了@@ 39.10.48.1 08/05 18:18
推 cercloud: 藍廠的B70有未來可以戰嗎 49.217.129.222 08/05 18:18
推 kcy05785: 2張5080大概是2張2080ti魔改的5-6倍價 114.34.209.162 08/05 18:20
→ kcy05785: 2張2080ti足夠跑27B的模型了 114.34.209.162 08/05 18:20
推 GenShoku: 目前最便宜的方案就雙3090共48G 可以認 123.192.94.227 08/05 18:20
→ GenShoku: 真開始跑些有用的東西 再上去就是看dgx 123.192.94.227 08/05 18:20
→ GenShoku: spark跟mac了 123.192.94.227 08/05 18:20
→ kcy05785: 3090的價格炒到1張30k以上,還不保證 114.34.209.162 08/05 18:21
→ kcy05785: 是不是礦卡。 114.34.209.162 08/05 18:21
→ kcy05785: 要不然20k出頭的3080是真的可以 114.34.209.162 08/05 18:22
推 kcy05785: 講錯3090 114.34.209.162 08/05 18:25
推 deolinwind: b70看起來便宜,但滯銷代表還是貴 118.233.161.3 08/05 18:27
推 eddy13: 一般個人本地跑會選FP8的應該算少數吧, 114.137.19.103 08/05 18:32
→ eddy13: 選GGUF的Q4等級的應該比較多 114.137.19.103 08/05 18:32
推 moonkuma: 3080 20g*2也不錯 40gb能跑的東西也不少 49.158.135.118 08/05 18:44
推 seemoon2000: 32G級別的就是看27b 35b這次qwen3.8223.137.118.232 08/05 18:53
→ seemoon2000: Q4量化"目前"的模型都是會大幅弱化223.137.118.232 08/05 18:54
→ seemoon2000: tool calling的能力 但這塊剛好是本223.137.118.232 08/05 18:54
→ seemoon2000: 地化AI最重要的技能 反而不是知識和223.137.118.232 08/05 18:54
→ seemoon2000: 長鏈推理223.137.118.232 08/05 18:54
推 GenShoku: Q4量化tool calling能力是一坨,至少Q6 123.192.94.227 08/05 20:41
→ GenShoku: 才勉強能用,Q8才能真正發揮9成5實力 123.192.94.227 08/05 20:41
推 ck203l5: 可以改用混合架構? 像LM Studio新推出 65.211.18.190 08/05 21:34
→ ck203l5: 的Bionic軟體搭配Q4的模型,呼叫工具 65.211.18.190 08/05 21:34
→ ck203l5: 這種工作給Bionic透過Python去做即可 65.211.18.190 08/05 21:34
→ ck203l5: 至少這邊看它做Word Excel PDF這種文件 65.211.18.190 08/05 21:36
→ ck203l5: 讀取+思考分析+產製文檔結果還不算太差 65.211.18.190 08/05 21:36
推 visa829: Dense模型像Qwen 27B對Q4量化沒那麼敏感 220.134.116.61 08/05 21:38
→ visa829: 真的有餘裕才往上看Q5 Q6 Q8可是VRAM高很 220.134.116.61 08/05 21:39
→ visa829: 多。MoE模型像Qwen 35B-A3B用張6GB以上 220.134.116.61 08/05 21:40
推 sdbb: 謝謝 112.104.65.143 08/05 21:41
→ visa829: 的顯卡都能跑到1x tg/s了,單張卡塞不進 220.134.116.61 08/05 21:41
→ visa829: 27B的就35B-A3B或是Gemma4 12B/MoE玩玩就 220.134.116.61 08/05 21:42
→ visa829: 好。不過MoE據社群說對量化程度比較敏感 220.134.116.61 08/05 21:43
→ visa829: RAM大一點,把VRAM塞不下的用--n-cpu-moe 220.134.116.61 08/05 21:44
→ visa829: 往RAM丟就好了,跑Q6 Q8都有可能,pp tg 220.134.116.61 08/05 21:44
推 seemoon2000: MoE在APEX量化 工具調用下滑比較少 82.140.187.28 08/05 21:44
→ visa829: 也不會太差 220.134.116.61 08/05 21:45
→ ganei: 其實色圖跟色影有板上的CUI大禮包在罩,用A118.165.155.217 08/05 21:48
→ ganei: MD反而俗又大碗,真的要跑LLM刷CODE寫作業118.165.155.217 08/05 21:48
→ ganei: ,那還得推薦NV才行(16GB起跳),蘇媽要扳回118.165.155.217 08/05 21:48
→ ganei: 一城等下一代看有沒有機會。118.165.155.217 08/05 21:48
推 ganei: 另外塞的資料如果沒有很肥,也能接受慢一截118.165.155.217 08/05 21:54
→ ganei: 的prefill速度(提示詞輸入後要等一下才反應118.165.155.217 08/05 21:54
→ ganei: ),MoE可以幫忙省不少VRAM,118.165.155.217 08/05 21:54
→ ganei: 只要VRAM比換算完大小的AxxB大(但是MB RAM118.165.155.217 08/05 21:54
→ ganei: 要夠大,塞剩下的模型),調整一下允許的上118.165.155.217 08/05 21:54
→ ganei: 下文長度後大多有 約10~2x T/S 的回應速度118.165.155.217 08/05 21:54
→ ganei: ,以個人小玩的程度來說堪用了118.165.155.217 08/05 21:54