推 are2: MOE模型用啥跑都很快 但你接受這智商?118.150.170.141 07/06 02:11
→ are2: 長遠看別買I卡獨顯 N家入股後可能會被放生118.150.170.141 07/06 02:11
→ are2: 買張7900XTX生態跟速度都更好 還更便宜118.150.170.141 07/06 02:12
推 are2: 喔 看錯 原來卡有了 那剩下隨便118.150.170.141 07/06 02:14
→ Litfal: 我也好奇26B不嫌笨嗎?1.34.131.99 07/06 02:14
→ shane10222: 本地端有更好的?60.198.151.23 07/06 03:29
→ shane10222: 32GB有其他更好的選擇嗎?60.198.151.23 07/06 03:30
推 MK47: 好奇這麼笨的模型要用做啥?不甘脆用API嗎?36.235.197.109 07/06 04:48
推 TameFoxx: 小模型用dense的比較好182.233.84.193 07/06 04:53
→ TameFoxx: 但輸出速度就沒辦法快182.233.84.193 07/06 04:53
推 saito2190: 你RAM夠的情況下,本地跑用Gemma4 31B59.115.148.173 07/06 05:55
→ saito2190: 或Qwen 3.6 27B這種Dense模型智力跟Ag59.115.148.173 07/06 05:55
→ saito2190: ent性能方面都會比較好59.115.148.173 07/06 05:55
→ saito2190: 如果用途比較專一在推理或是寫Code,59.115.148.173 07/06 05:56
→ saito2190: 用llama cpp加隨便一個qwen 3.5被opus59.115.148.173 07/06 05:56
→ saito2190: 或fable微調過的版本都不錯59.115.148.173 07/06 05:56
→ iceyang: 小模型用來養馬61.224.176.135 07/06 06:22
推 GenShoku: 本地小MoE模型還是拿來聊天就好,真要幹123.192.94.227 07/06 06:25
→ GenShoku: 活,就算慢也是選dense模型穩123.192.94.227 07/06 06:25
推 YCL13: 也是建議由Gemma4 31B或Qwen3.6 27B二選一1.161.178.76 07/06 06:35
推 yenchieh1102: 電供抓大一點,未來再插一張卡(? 42.70.248.221 07/06 08:36
好 der,我改買 Leadex VII 1000W,存點錢再加一張
推 are2: 目前地端天花板就是qwen3.6 27b呀42.70.252.91 07/06 09:23
推 akimu: 真的用過api就會知道中國那幾個都是智障101.12.128.32 07/06 11:02
→ akimu: 跑分漂亮長期用下來就是鬼打牆101.12.128.32 07/06 11:03
→ akimu: 來不如直接用美國的 最後也不會比較貴101.12.128.32 07/06 11:03
推 ElrosHsun: 原本也是想本地跑後來還是用dsv4 flas194.114.136.219 07/06 11:26
→ ElrosHsun: h超便宜比電費還省194.114.136.219 07/06 11:26
推 takanasiyaya: 本地端顯卡玩qwen3.6 27B或Gemma4 349.216.106.151 07/06 11:37
→ takanasiyaya: 1B沒錯啊。當然你跟真正大模型比差49.216.106.151 07/06 11:37
→ takanasiyaya: 的還是太遠也是事實49.216.106.151 07/06 11:37
→ crimsonmoon9: 兩家的MoE都這麼不堪嗎?223.139.62.72 07/06 11:40
推 GenShoku: 以gemma4 26b a4b來說,他實際就只是知42.79.123.16 07/06 11:44
→ GenShoku: 識量較多比較聰明的4B模型而已,真的要42.79.123.16 07/06 11:44
→ GenShoku: 長鏈路推理、作業、寫文章,完全沒法跟42.79.123.16 07/06 11:44
→ GenShoku: 實打實的27b dense模型相比42.79.123.16 07/06 11:44
→ GenShoku: 目前單卡本地的天花板就是qwen3.6 27b,42.79.123.16 07/06 11:46
→ GenShoku: 找個破限跟opus蒸餾版,基本可以當一個42.79.123.16 07/06 11:46
→ GenShoku: 全能小模型42.79.123.16 07/06 11:46
推 yymeow: 我覺得寫文章還行,不過現下買32G的卡主要60.250.130.216 07/06 11:47
→ yymeow: 拿來跑圖比較香60.250.130.216 07/06 11:47
→ crimsonmoon9: 原來如此 測試的時候都只看前面跟測223.139.62.72 07/06 11:55
→ crimsonmoon9: TTFT而已沒注意到性能差這麼多223.139.62.72 07/06 11:55
推 a29022792: 26ba4b超爛 實際上幾乎處於不能用的程223.140.241.146 07/06 12:03
→ a29022792: 度223.140.241.146 07/06 12:03
→ a29022792: 我覺得他比gemini cli的mini?還差 而3.223.140.241.146 07/06 12:05
→ a29022792: 1flash就已經很難用了 處於幾乎不能信223.140.241.146 07/06 12:05
→ a29022792: 任的狀態223.140.241.146 07/06 12:05
推 GenShoku: Qwen3.6 27b > gemma4 31b > qwen3.6 3542.79.123.16 07/06 12:11
→ GenShoku: b a3b > gemma4 12b > gemma4 26b a4b42.79.123.16 07/06 12:11
推 Bustycat: 聊天倒是比Qwen有感情106.64.128.15 07/06 12:16
推 wei115: gemma 4還是有好處啦 他道德感超強,用解42.79.203.178 07/06 12:25
→ wei115: 鎖模型他還會非常激動的指正你,但又不得42.79.203.178 07/06 12:25
→ wei115: 不回答,非常有女騎士的感覺,Qwen就很無42.79.203.178 07/06 12:25
→ wei115: 聊,解鎖模型就跟沒有羞恥心似的42.79.203.178 07/06 12:25
推 xylophone135: Qwen3.5之後就冷冰冰了哪有感情 114.36.243.126 07/06 12:28
→ xylophone135: Gemma 4 26B A4B用在Agentic確實爛 114.36.243.126 07/06 12:30
→ xylophone135: Qwen3.6 35B A3B稍微好一點 114.36.243.126 07/06 12:30
→ xylophone135: 之後來試試Dense模型 114.36.243.126 07/06 12:30
推 lordmi: 目前20b 以下的MOE只適合檔案整理、簡單223.140.135.158 07/06 12:50
→ lordmi: shell、摘要、approval 。Agent loop 最223.140.135.158 07/06 12:50
→ lordmi: 低限度的智力的最下限目前還在Qwen3.6-27223.140.135.158 07/06 12:50
→ lordmi: B Gemma 4 31B,+ Q4/Q5 + 100K context223.140.135.158 07/06 12:50
→ lordmi: + 量化 KV加上其他配套至少要48的統一記223.140.135.158 07/06 12:50
→ lordmi: 憶體或者VRAM低於這個規格的機器就別想了223.140.135.158 07/06 12:50
推 setsuha: Gemma 4聽起來太澀了ㄅ 220.130.134.10 07/06 12:57
推 pphyy5844548: 請問這樣拿來評分英文短文的話,用 27.52.39.7 07/06 13:35
→ pphyy5844548: Qwen 27B可以跑嗎? 目前是5080+3 27.52.39.7 07/06 13:35
→ pphyy5844548: 2G RAM 27.52.39.7 07/06 13:35
推 GenShoku: Qwen3.6 27b Q4量化 + 128K上下文 + K Q 42.79.123.16 07/06 13:36
→ GenShoku: 8 + V Q4_1,應該是塞得進32G顯卡內啦, 42.79.123.16 07/06 13:36
→ GenShoku: 印象中 42.79.123.16 07/06 13:36
推 stlinman: Qwen 3.6 27B 好像跑的久但完成率可以拉150.116.129.113 07/06 13:36
→ stlinman: 高! 在意品質還是稠密模型會比MoE強啦。150.116.129.113 07/06 13:37
推 GenShoku: 評分文章的需求有點模糊,但摘要應該沒 42.79.123.16 07/06 13:45
→ GenShoku: 啥問題,本地小模型指令理解度沒有大廠 42.79.123.16 07/06 13:45
→ GenShoku: 線上模型好,需要明確的指令 42.79.123.16 07/06 13:45
※ 編輯: tacovirus (101.9.103.172 臺灣), 07/06/2026 13:53:58
推 giantwinter: 26B沒用阿 114.137.191.69 07/06 14:08
推 jhjhs33504: MoE伺服器友善強在多終端記憶體利用率 36.228.8.135 07/06 14:38
推 jhjhs33504: 缺點是帳面總參數不是實際活躍參數量 36.228.8.135 07/06 15:24
→ jhjhs33504: 就是用小部分參數當寫手 品質不如稠密 36.228.8.135 07/06 15:26
推 Supasizeit: 我看你們是沒玩過破防的gemma4203.204.195.174 07/06 17:41
推 pxhome: 你聽好了,你的目標是跑AI, 36.230.161.245 07/06 19:58
→ pxhome: 要以GPU優先,其他的CPU & DDR是第幾代的 36.230.161.245 07/06 19:58
→ pxhome: 通通都不是重點。 36.230.161.245 07/06 19:58
→ pxhome: 第一主機板一定要找有兩條PCIe X16插槽的 36.230.161.245 07/06 19:58
→ pxhome: ,VRAM是你的一切這很重要! 36.230.161.245 07/06 19:58
→ pxhome: GPU請直接拿買N卡, 至少遇到問題用GPT還 36.230.161.245 07/06 19:58
→ pxhome: 能快速幫你解決。 36.230.161.245 07/06 19:58
→ pxhome: N卡在雲端上的分支計畫資源最豐富,實裝 36.230.161.245 07/06 19:58
→ pxhome: 難度也最小,還有NVIDIA 提供的集裝箱,下 36.230.161.245 07/06 19:58
→ pxhome: 載及用,省下為了最佳化重新編譯的時間也 36.230.161.245 07/06 19:58
→ pxhome: 不用擔心安裝後搞亂系統,讓你把精力放在 36.230.161.245 07/06 19:58
→ pxhome: 產出的品質上。 36.230.161.245 07/06 19:58
→ pxhome: 驅動還是工具鏈穩定是必須的,在這個基礎 36.230.161.245 07/06 19:58
→ pxhome: 上你才能針對需求去切換效果更好的模型。 36.230.161.245 07/06 19:58
→ pxhome: 比如說無道德審查模型,量化版的A卡沒有幾 36.230.161.245 07/06 19:58
→ pxhome: 個能用。 36.230.161.245 07/06 19:58
→ pxhome: 最後別被I卡的VRAM給騙了,B70 32GB漲價 36.230.161.245 07/06 19:58
→ pxhome: 後的價錢都可以買兩張5060 Ti 16GB,實際 36.230.161.245 07/06 19:58
→ pxhome: 上就只是一張吃電290W的3060Ti,算力還不 36.230.161.245 07/06 19:58
→ pxhome: 如5050。 36.230.161.245 07/06 19:58
→ pxhome: 更別提5060Ti X2這個高CP值的組合,NVFP4 36.230.161.245 07/06 19:58
→ pxhome: 用對量化模型產出可以妣美4090,遇到只有F 36.230.161.245 07/06 19:58
→ pxhome: P8的老模型打開FlashAttention 3也可以追 36.230.161.245 07/06 19:58
→ pxhome: 平3090。 36.230.161.245 07/06 19:58
→ pxhome: DDR4 2133 ECC 16GBX4 (6千NTD有找) 36.230.161.245 07/06 19:58
→ pxhome: 5900XT & X570 WS ACE看看還能不能搞到手 36.230.161.245 07/06 19:58
→ pxhome: 。 36.230.161.245 07/06 19:58
→ pxhome: DDR3 1866四通道(頻寬接近D5 6K雙通道) 36.230.161.245 07/06 19:58
→ pxhome: 但是有些人無法接受洋垃圾,對於DRAM組建2 36.230.161.245 07/06 19:58
→ pxhome: 56GB的成本最低是事實啊! 36.230.161.245 07/06 19:58
→ pxhome: MoE模型相對於稠密模型來說,每次獲得到 36.230.161.245 07/06 20:03
→ pxhome: 的結果差異性很大 36.230.161.245 07/06 20:03
→ pxhome: 你將來一定會被B70單卡的推理速度慢到受 36.230.161.245 07/06 20:09
→ pxhome: 不了,再加一張B70讓算力達到9070XT單卡 36.230.161.245 07/06 20:09
→ pxhome: 的水平。 36.230.161.245 07/06 20:09
→ pxhome: 32GB通常都是跑30-35B 36.230.161.245 07/06 20:22
推 are2: 26B MOE那水平要我掏錢我都懶118.150.170.141 07/06 21:24
推 jhjhs33504: 26B QAT輸出品質約與兩倍E4B QAT相當 36.228.8.135 07/06 21:36
推 dsin: ddr3 1866x4 接近 ddr5 6000x2 這什麼笑話? 123.194.245.27 07/06 22:49
→ pxhome: 這不是笑話,自己找圖比較 36.230.138.251 07/07 03:43
→ pxhome: 一樣的GDDR7 128Bit =896 bit GDDR6 256Bi 36.230.138.251 07/07 03:43
→ pxhome: t 36.230.138.251 07/07 03:43
→ pxhome: 那個896是AI亂加的XD 36.230.138.251 07/07 03:45
→ pxhome: 1866四通道60GB/s(X79) 36.230.138.251 07/07 03:54
→ pxhome: ,6000雙通道只有47GB/s因為你用的是AMD 36.230.138.251 07/07 03:54
→ pxhome: 9600X & DDR5 6000已經測到爛了 36.230.138.251 07/07 03:56
→ pxhome: AMD因為IO Die和IF總線,雙通道沒有吃滿, 36.230.138.251 07/07 03:58
→ pxhome: 記憶體性能下降25%左右。 算AI還是挑Intel 36.230.138.251 07/07 03:58
→ pxhome: 比較適合 36.230.138.251 07/07 03:58
→ pxhome: 挑便宜的買即可 36.230.138.251 07/07 04:11
推 ck203l5: 最近也在考慮洋垃圾AI機,低成本雙PCIE 12.170.106.26 07/07 05:42
→ ck203l5: 實在太香,順便借個文請問一下樓上有無 12.170.106.26 07/07 05:42
→ ck203l5: 測過2張5060Ti都跑在PCIE3.0 X8情況下 12.170.106.26 07/07 05:42
→ ck203l5: 跑AI推論效能大概損失多少? 謝謝 12.170.106.26 07/07 05:42
→ ck203l5: 5060Ti大硬傷就是只有物理X8通道,裝在洋 12.170.106.26 07/07 05:45
→ ck203l5: 垃圾主機板上最高就只剩下PCIE3 X8而已 12.170.106.26 07/07 05:45
推 yymeow: 我試過兩張5060TI,主板是華碩Pro WS Z890 60.250.130.216 07/07 10:59
→ yymeow: ACE SE。撇開PCIe減損的問題,比較大的問 60.250.130.216 07/07 11:00
→ yymeow: 題是要找支援張量並行的部屬方案,比如 60.250.130.216 07/07 12:08
→ yymeow: vLLM。下一個問題是要找到適用在vLLM的量 60.250.130.216 07/07 12:09
→ yymeow: 化模型,會比單卡32G的限制要多 60.250.130.216 07/07 12:09
→ yymeow: 例如單卡32G在ollama下很容易就找到qwen 60.250.130.216 07/07 12:11
→ yymeow: 3.6 27Bq4,但是vLLM要在hugging face下找 60.250.130.216 07/07 12:12
→ yymeow: 官方只有提供非量化的,要不就要自己再量 60.250.130.216 07/07 12:12
→ yymeow: 化了 60.250.130.216 07/07 12:12
→ pxhome: 張量平行是假議題,Ollama用對模型也可以 49.216.181.198 07/07 12:49
→ pxhome: 破百Tokens /s, 5060Ti 16GB X2根本不用 49.216.181.198 07/07 12:49
→ pxhome: 去考慮.cpp還是vLLM 49.216.181.198 07/07 12:49
→ pxhome: RTX50初始算力高有本錢折騰,不用搞那些 49.216.181.198 07/07 12:53
→ pxhome: 花里胡俏的,把FlashAttention打開性能自 49.216.181.198 07/07 12:53
→ pxhome: 然就出來 49.216.181.198 07/07 12:53
推 pxhome: PCIe減損也不用擔心,只要PCI error值為零 49.216.181.198 07/07 12:56
→ pxhome: , 就算用老舊的PCIe2.0X8對性能影響也不 49.216.181.198 07/07 12:56
→ pxhome: 到5%。 49.216.181.198 07/07 12:56
推 pxhome: 以5060Ti來說,用Ollama跑NV官網公告的Gem 49.216.181.198 07/07 13:13
→ pxhome: ma4 26B如果是線性成長,單卡40T雙卡80T四 49.216.181.198 07/07 13:14
→ pxhome: 卡160T但實際上是單卡20T雙卡80四卡200。 49.216.181.198 07/07 13:14
→ pxhome: vllm張量平行的增加幅度還沒有這麼誇張, 49.216.181.198 07/07 13:14
→ pxhome: 我認為問題要放在第一字的回應延時,四通 49.216.181.198 07/07 13:14
→ pxhome: 道D4 2400 76.8GB/s 最快還要歷時0.9秒, 49.216.181.198 07/07 13:14
→ pxhome: 沒辦法像雲端AI那樣控制在毫秒等級,目前D 49.216.181.198 07/07 13:14
→ pxhome: 5 8800雙通道140GB/s也沒有辦法做到。 49.216.181.198 07/07 13:14
推 lordmi: Qwen可以雙卡llama.cpp 21t/s vLLM 60 t/s 114.45.195.56 07/07 14:30
→ lordmi: 但如果是一次只有 1~2 個 Agent 在運行 114.45.195.56 07/07 14:31
→ lordmi: 部署簡單、回應快,那llama體感好 114.45.195.56 07/07 14:33
→ lordmi: 要Interactive Chat 很舒服那就不用考慮 114.45.195.56 07/07 14:37
→ lordmi: vLLM是高併發高用量自己7x24的環境更適合 114.45.195.56 07/07 14:38
推 pxhome: 考慮高併發的話,例如3人同時上線,KV Cac 36.230.138.251 07/07 15:49
→ pxhome: he就只能限制在16K以下, VRAM佔用量增加5 36.230.138.251 07/07 15:49
→ pxhome: 0%, 36.230.138.251 07/07 15:49
→ pxhome: 超長上下文比如說100K在部署上的難度顯著 36.230.138.251 07/07 15:49
→ pxhome: 增加。 36.230.138.251 07/07 15:49
→ pxhome: 因為VRAM對於本地AI是寸土寸金 36.230.138.251 07/07 15:49
→ pxhome: 所以目前我把它當單機操作,最多就是同時 36.230.138.251 07/07 15:49
→ pxhome: 執行Qwen 3.6 35B和Gemma3 27B無道德審查 36.230.138.251 07/07 15:49
→ pxhome: 模型, 36.230.138.251 07/07 15:49
→ pxhome: 框架之間的差異對我來說無感。 36.230.138.251 07/07 15:49
→ pxhome: 除非將來PEX89096 PCIe5.0 Swtich擴充板量 36.230.138.251 07/07 15:49
→ pxhome: 產,讓我可以同時使用6張5060Ti 16GB一共9 36.230.138.251 07/07 15:49
→ pxhome: 6GB,這樣vLLM建立家用AI工作站才有意義, 36.230.138.251 07/07 15:49
→ pxhome: 但說不定RTX50會是末代8Pin的60Ti。 36.230.138.251 07/07 15:49
→ pxhome: 商用本地AI的話,首字回應延時必須控制在 36.230.138.251 07/07 15:51
→ pxhome: 毫秒等級, 目前的消費級的平台都不可行。 36.230.138.251 07/07 15:51
→ pxhome: 理想值是0.2-0.3秒 36.230.138.251 07/07 16:47
推 TameFoxx: TTFT毫秒也要看你input長度多少 223.136.127.19 07/07 17:46
→ TameFoxx: 你丟十萬以上,雲端也沒法那麼快 223.136.127.19 07/07 17:47
推 moonkuma: 樓上有個用ai 在亂回答,什麽無審查版模 42.77.46.153 07/07 19:31
→ moonkuma: 型amd不能用,聽他在鬼扯全篇都在誤導,a 42.77.46.153 07/07 19:31
→ moonkuma: md cpu記憶體沒比較慢9800x3d用6000 cl3 42.77.46.153 07/07 19:31
→ moonkuma: 0一樣能跑出80-90多gb/s但是模型 oom太 42.77.46.153 07/07 19:31
→ moonkuma: 多到系統記憶體也是會很慢,隨之在讓ai 42.77.46.153 07/07 19:31
→ moonkuma: agent工作時也會一直超時,另外別去用x9 42.77.46.153 07/07 19:31
→ moonkuma: 9洋垃圾組雙卡,1866/2133/2400這種就算 42.77.46.153 07/07 19:31
→ moonkuma: 8通道因為cpu太弱架構太舊我用過反而比 42.77.46.153 07/07 19:31
→ moonkuma: 新平台單卡慢、還不如用單卡限縮一下上 42.77.46.153 07/07 19:31
→ moonkuma: 下文。我個人是用7600x組a+n雙卡7900xtx 42.77.46.153 07/07 19:31
→ moonkuma: 跑qwen3.6 27b q4無審查副卡3080 20gb跑 42.77.46.153 07/07 19:31
→ moonkuma: comfyui,試過3080 20gb雙卡結果就像前 42.77.46.153 07/07 19:31
→ moonkuma: 面說的卡在平台太老舊之後入手能x8+x8的 42.77.46.153 07/07 19:31
→ moonkuma: am5或intel平台再來試,組雙卡可以看看i 42.77.46.153 07/07 19:31
→ moonkuma: ntel平台建構成本比較便宜可以用比較便 42.77.46.153 07/07 19:31
→ moonkuma: 宜的ddr4+z690+12400,另外可以用螢幕不 42.77.46.153 07/07 19:31
→ moonkuma: 接顯卡讓vram最大化,intel堪用的內顯可 42.77.46.153 07/07 19:31
→ moonkuma: 以掛網跑些網遊,ram夠大可以再掛些模擬 42.77.46.153 07/07 19:31
→ moonkuma: 器,amd apu pcie通道太少 7、9000的2cu 42.77.46.153 07/07 19:31
→ moonkuma: 內顯實在太弱了 42.77.46.153 07/07 19:31
推 laeva75: 多卡跑--split-mode layer的話,PCIe影 114.41.11.243 07/07 22:03
→ laeva75: 響也不大吧? 114.41.11.243 07/07 22:03
推 TameFoxx: 是 vllm 用tp串連,pcie影響不大 182.233.84.193 07/07 23:07
推 are2: 前面很多都錯誤訊息 這篇廢樓了118.150.170.141 07/08 02:33
→ pxhome: 雙PCIe的主機板越來越少,還要跟M2共享頻 36.230.138.251 07/08 06:47
→ pxhome: 寬, 難道要拿SATA硬幹? 36.230.138.251 07/08 06:47
推 pxhome: D5 6000 雙通最多就是90GB/s 聽你在吹? A 36.230.138.251 07/08 06:49
→ pxhome: MD記憶體弱本來就是事實,有多卡需求一定 36.230.138.251 07/08 06:49
→ pxhome: 是上EPYC了, 我只是模擬PCIe2.0對產出的 36.230.138.251 07/08 06:49
→ pxhome: 影響 36.230.138.251 07/08 06:49
推 pxhome: 還說9800X3D? 我從頭到尾說的是GPU推理, 36.230.138.251 07/08 06:55
→ pxhome: CPU只是配角 36.230.138.251 07/08 06:55
→ pxhome: 首字延時不是提示詞決定,而是你一次最大 36.230.138.251 07/08 06:55
→ pxhome: 生成字數決定的,Gemma4它的上限是8192 36.230.138.251 07/08 06:55
→ pxhome: 是怎樣? 講AMD不好就影響你的股價? 36.230.138.251 07/08 06:57
推 moonkuma: 只會用ai亂答的就別出來丟人,你有真的 42.77.46.153 07/08 13:05
→ moonkuma: 架過本地部署嗎?我是實際使用過的心得 42.77.46.153 07/08 13:05
→ moonkuma: 9800x3d ddr5 6000是我的遊戲機aida64 42.77.46.153 07/08 13:05
→ moonkuma: 寫入我測出來就是90gb/s,我也拿來裝過 42.77.46.153 07/08 13:05
→ moonkuma: 本地部署最終還是回歸遊戲機的使用, 76 42.77.46.153 07/08 13:05
→ moonkuma: 00x a+n雙卡是我目前的本地部署,在這之 42.77.46.153 07/08 13:05
→ moonkuma: 前嘗試過x570沒內顯會吃掉一些顯存跑ai 42.77.46.153 07/08 13:05
→ moonkuma: 時看yt或開網頁查資料都會吃掉不少vram, 42.77.46.153 07/08 13:05
→ moonkuma: 也用過雙路8通道加雙卡3080一起跑27b q4 42.77.46.153 07/08 13:05
→ moonkuma: q6模型跑起來瓦特計直接突破700w光待機 42.77.46.153 07/08 13:05
→ moonkuma: 就突破150w房間溫度都提高幾度了,跑35b 42.77.46.153 07/08 13:05
→ moonkuma: moe模型可以降到500w左右但只能對話或 42.77.46.153 07/08 13:05
→ moonkuma: 做簡單的工作,我用的是技嘉的c612雙路 42.77.46.153 07/08 13:05
→ moonkuma: 主板,當然使用更高階有雙pcie4.0x16的ep 42.77.46.153 07/08 13:05
→ moonkuma: yc可能不會遇到跟我一樣雙卡速度提升不 42.77.46.153 07/08 13:05
→ moonkuma: 明顯,瓶頸應該是在cpu太舊時脈太低,然 42.77.46.153 07/08 13:05
→ moonkuma: 後a黑的你幹嘛推epyc你不知道這是amd的c 42.77.46.153 07/08 13:05
→ moonkuma: pu嗎?不是說amd的就是慢又有問題嗎? 42.77.46.153 07/08 13:05
→ moonkuma: 最後在能耗跟性能取捨最終用了a+n組合 42.77.46.153 07/08 13:05
→ moonkuma: 雙卡27b q4到q6都測過,結論日常夠用但 42.77.46.153 07/08 13:05
→ moonkuma: 還是會發生鬼打牆亂答,需要花時間調教 42.77.46.153 07/08 13:05
→ moonkuma: ,工作上使用還是線上模型聰明省事多了 42.77.46.153 07/08 13:05
→ moonkuma: 。 42.77.46.153 07/08 13:05
推 oldgooddays: Qwythos Qwable或Ornith這些後天訓 114.137.240.30 07/09 12:15
→ oldgooddays: 練過的呢? 114.137.240.30 07/09 12:15
→ oldgooddays: 尤其是dense的? 114.137.240.30 07/09 12:15
→ GenShoku: 要看模型 很多都只針對輕量文本如32K-64114.137.209.158 07/09 14:52
→ GenShoku: K訓練的 拉到128K-256K就注意力渙散+思114.137.209.158 07/09 14:52
→ GenShoku: 考無限loop率提高 要自己看好模型訓練說114.137.209.158 07/09 14:52
→ GenShoku: 明跟社群實測結果114.137.209.158 07/09 14:52