端側大模型怎麼塞進掌心大的 AI 玩具:NPU、量化和那道 5W 功耗牆

Industry Insights · · 閱讀:5

AI 玩具這兩年最怕的不是「會不會聊」,而是「聊的內容出不出得去」。把對話模型放在雲端,隱私、延遲、月費全是坑;塞進設備本地,又卡在掌心裏那幾瓦電和一點點內存。怎麼塞進去,是 2026 年這類產品真正的硬仗。

NPU 是本地推理的發動機

product photo

說白了,手機裏那顆 NPU(神經網絡處理單元)就是本地 AI 的發動機。高通驍龍 8 Elite 的 Hexagon NPU 能到 75 TOPS,聯發科天璣 9400 的 APU 790 約 46 到 50 TOPS,專門加速低精度矩陣運算。對玩具來說,跑 2B 到 3B 的小模型就夠撐一段自然對話了——這恰是端側模型的甜區:夠用、夠快、夠省電。

量化把模型壓進內存和功耗牆

光有芯片還不夠,模型本身得「瘦身」。一個 8B 模型在 FP16 下要佔 16GB 內存,手機根本放不下;壓到 INT4 四位精度,體積縮到約 4.5GB,直接進得了主流設備的內存。Gemma 4 E2B 這類 4-bit 量化模型只佔約 1.5GB,在驍龍 Hexagon 上能跑 30 到 45 token/秒,首字響應壓到 50 毫秒以內。整條鏈路靠 NPU 的低精度算術把功耗摁在 5W 以下,否則電池撐不住也燙手。

一句話建議:端側的好處很實在——對話不出設備、斷網也能聊、沒有隱性月費。代價是能力上限基本鎖在 3B 級小模型,復雜長任務還是得回到雲端。挑產品時別只看「會聊天」,多問一句「這大腦在本地還是上雲」,差別比參數表大得多。

返回列表 文章 ID:#90