看板 MobileComm 關於我們 聯絡資訊
1.原文連結:https://reurl.cc/vGK9V1 2.原文標題: Snapdragon 8 Elite Gen 6的Hexagon NPU為代理AI與專家混合 模型而生,新增Element加速器與更大共享快取 3.原文來源(媒體/作者):Cool3c/Chevelle.fu 4.原文內容: 高通繼為即將在9月下旬於Snapdragon高峰會公布的Snapdragon 8 Elite Gen 6搶先預覽 CPU、GPU的特色後,再針對新一代Hexagon NPU進行預覽解密;Snapdragon 8 Elite Gen 6的Hexagon NPU將是為代理式AI與專家混合模型而生,加入Element加速器、進一步增加 共享快取與支援廣泛的精度,提供自預填充、推論到輸出更迅捷、低延遲的代理AI體驗。 AI運算需求從單一推論轉化為持續、多模、低延遲 高通提到,隨著代理式AI成為繼生成式AI後的新趨勢,AI的運算需求也從原本聚焦在執行 單一模型、追求推論速度轉化為需要具備持續、多模態及低延遲,也成為高通在規劃新一 代Hexagon NPU的重點;具體而言,高通全新Hexagon NPU聚焦在兩個重點:Element加速 器與增加50%容量的共享快取。 為代理式AI執行設計的Element加速器 Element是因應新一代生成式與代理式AI所設計的加速器,結合純量、向量與矩陣擴展, 可加速大型模型最重要的運算,使代理式AI可更快的反應、更有效率的推論,進而在不影 響續航力的前提提供豐富的代理體驗。 更大的共享快取減少頻繁的資料傳輸 新一代Hexagon NPU也將共享快取容量提升50%,藉由更大的記憶體系統容納更多模型狀態 、啟動質與中間張量,減少資料需要頻繁傳輸到外部的DDR記憶體的情況,可以減少記憶 體瓶頸,加速AI執行速度與響應,也能降低資料頻繁傳輸的能耗。 因應代理式AI負載需求的設計 代理式AI的效能關鍵在於維持代理式AI執行多個任務時仍可維持響應迅速、上下文相關與 高效率運作,新一代Hexagon NPU借助添加上述兩項特色,使得在進行AI、長上下文推論 、多模態模型具有更出色的持續性能,並帶來低延遲。 更大的快取能使NPU把資料盡可能保持在近端,可協助代理式AI更快完成響應、修正、規 劃與行動,帶來更豐富的上下文視窗、更快的Token輸出與多工具、多任務的代理式AI轉 換。Element加速器則提升生成式與代理式AI最關鍵的轉換器操作效能,透過項量擴展加 速高吞吐量AI數學運算與純量擴展,支援代理最關鍵的決策邏輯、路由與編排。 藉更低記憶體頻寬執行更大的模型 新一代Hexagon NPU也放眼下一代模型架構,高通攜手領先的記憶體與模型供應商合作, 將基於MoE專家混合模型的新一代裝置端AI架構整合至Hexagon NPU,載入一個30B參數的 MoE模型時,在NPU輸出Token階段僅需動用3B的參數。 MoE模型與密集模型不同,MoE會透過動態方式從混合模型中選擇任務對應的專家模型,進 而使運算資源與記憶體頻寬需求降低;在整合智慧的快閃記憶體及記憶體專家管理與快取 技術,專家混合模型能夠以低功耗、低記憶體需求時現更廣泛全面的AI體驗,並提供手機 快速回應、安全的產生高品質的AI代理。 支援廣泛精度及提升預填充 為了應對專家混合模型需求及降低對記憶體頻寬需求,新一代Hexagon NPU具體的作法是 支援更廣泛的精度,提供自INT2、INT4、INT8、FP8至FP16的支援,開發者可靈活的在效 能、記憶體、模型品質與功耗之間選擇合宜的格式與模型規模。 此外對於影響響應最關鍵的預填充,新一代Hexagon NPU在INT4模型提高50%的預填充性能 ,並具備更快的解碼吞吐、更強的預測性解碼能力及更高的每秒Token,最終提供即時、 流暢的裝置端AI體驗。 與CPU及GPU異構運算同樣重要 雖然Hexagon NPU的目的是高效率的盡可能執行所有階段的AI任務,不過現行的AI負載仍 須仰賴異構運算,其中任務於核心之間移動的智慧路由、編排與資料可用性需要透過CPU ,而GPU也同樣在現代圖形運算納入特定的AI運算需求。 Snapdragon 8 Elite Gen 6引入超越5GHz時脈的下一代Oryon CPU及Oryon Flex Cache快 取架構,協助在AI任務編排的CPU負載更高效的完成;而全新Adreno GPU亦納入神經網路 加速架構,於圖像處理階段自管線進行AI增強處理,帶來更出色的視覺體驗。 5.心得/評論: 新一代Hexagon NPU憑藉快取與加速器升級,完美解答代理式AI的低延遲與高算力需求。 -- ※ 發信站: 批踢踢實業坊(ptt.cc), 來自: 123.194.188.44 (臺灣) ※ 文章網址: https://www.ptt.cc/bbs/MobileComm/M.1789120437.A.C47.html
NoneWolf : 能跑30B MoE 但機器只配16G記憶體 何意味? 09/11 18:13
BadGame : 蘋果殺出跑分後 高通急 頻率還在定 這版不穩發熱高 09/11 18:50
sxing6326 : 之前才知道高通的Hexagon只能定址4GB記憶體,不知 09/11 19:54
sxing6326 : 道這代改進了沒 09/11 19:54
Hohenzollern: 高通S8 Elite Gen6晶片多核CPU應該贏過蘋果A20 Pro 09/11 22:05
Hohenzollern: 晶片 09/11 22:05
Hohenzollern: 三大晶片廠牌 高通最後發表產品壓力最大 09/11 22:10
Hohenzollern: 蘋果CPU單核和聯發科GPU比不上 高通只能極限壓榨多 09/11 22:11
Hohenzollern: 核CPU跑分 09/11 22:11
aegis43210 : 高通的NPU和google一樣專注在AI推論,ARM則是用在遊 09/11 22:16
aegis43210 : 戲補幀上 09/11 22:16
aegis43210 : 並不是高通GPU弱,而是ARM在繪圖上偷吃步 09/11 22:17
KudanAkito : 很好 8E5該降價了吧 09/11 23:42
WOGEchidna : 放冰箱還能跑出45度的騷操作你就學吧 09/12 02:06
banbanzon : 狗通GPU弱?那一堆安卓高端掌機怎麼都用狗通SOC? 09/12 03:04
shengshampoo: 不懂就問,板上鄉民版友怎麼用AI?聊天機器問問? 09/12 11:29
shengshampoo: 會應用到AI agent 融入整合工作流? 09/12 11:30
shengshampoo: 邊緣運算場景,鄉民版友的等級會怎麼做? 09/12 11:31
setsuha : 機器就算配到32G 1樓也買不起阿 09/12 16:40
pipi5867 : 這代看目前流出的消息 感覺滿爛的 09/12 17:07
empingao : https://i.urusai.cc/Dfqpp.png 09/12 17:42
empingao : 8ee6 明顯沒跑滿. 09/12 17:43