看板 Gossiping 關於我們 聯絡資訊
現在qwen3.8-27b(q3_k_m)就是目前智力與設備成本,效能生產力的最佳平衡點,我是用r9- 5900h 3080(16g) 64g+1t。 往下, qwen 3.5-9b-instruct(q4_k_m)或qwen 3.8-14b(q4_k_m),智力下降太多。 往上走,qwen3-72b-instruct(q4_k_m),不是涉及太複雜且跨學科領域且長上下文的,不太 需要,而且這設備上pc要至少96g,mac要128g以上,成本增加也不少。 再往上,deepseek-r1 671b(iq4_xs)(深度推理取向),或者deepseek v4 flash 0731(iq4 _xs + dspark)(效率取向),至少要mac studio 256g以上,成本大增,不值得。 我是建議qwen3.8-27b(q3_k_m)和qwen3-72b-instruct(q4_k_m)切換著用,設備可考慮macbo ok pro 16 m3 max~m5 max 128g,如果是pc用5060+96g即可。 往上走就步子邁大一點,72b等級,一步到位,不要等級差不多的比來比去停留浪費太多時 間。 ※ 引述 《naticom (踢踢~)》 之銘言: :   : 之前發文詢問,說我的 qwen 3.6-35b-a3b 超級弱 : 請他寫個小網頁遊戲 (例如一些撲克牌遊戲或是簡單的桌遊) 都不成功 : 隨便寫寫之後就交差給我,也沒跑測試,給我的東西也只是半成品 : 需要不斷地提示他,搞了好久,才可以寫出一個像樣的 : 後來有老外提醒我說 thinking 給他開到 extra high ,也許不用preserve thinking : 真是開了新世界,我的 qwen 3.6-35b-a3b 突然變得超聰明 : 而且速度以小資電腦來說還可以 (2000+ tk/s 預處理 60+ tk/s 產生回應) :   : 前幾天試了 qwen 3.8-27b ,速度瞬間砍半,而且上下文也得調低 : 開啟了 MTP 後,generation最高只有 30 tk/s : 我給他同樣的指令做一個同樣的網頁遊戲,沒有特別感覺比 qwen 3.6-35b-a3b聰明 : 但因為速度砍半,花了超久時間才完成,整個房間從22度C拉到26度C :   : 請問有在玩本地大模型的板友,有什麼有趣的project可以讓我跑跑感受兩個模型的差異? :   -- ※ 發信站: 批踢踢實業坊(ptt.cc), 來自: 126.120.245.113 (日本) ※ 文章網址: https://www.ptt.cc/bbs/Gossiping/M.1788363450.A.1E4.html
kusomanfcu: 其實大陸的便宜到不需要搞本地 39.10.65.59 09/02 23:59
KINGWAP: 本地72B以下的模型的進步是持續明顯的 111.249.241.89 09/03 02:43
KINGWAP: 雲端大模型Token的計算越來越謎 111.249.241.89 09/03 02:43
KINGWAP: 遇到幾次改兩三個bug就直接歸零 111.249.241.89 09/03 02:43
KINGWAP: 目前看到雲端的便宜都是補貼來的 111.249.241.89 09/03 02:43
KINGWAP: 反正就兩邊都跳著用 111.249.241.89 09/03 02:43
KINGWAP: 哪邊涼快哪邊閃 111.249.241.89 09/03 02:43