AI 玩具这两年最怕的不是「会不会聊」,而是「聊的内容出不出得去」。把对话模型放在云端,隐私、延迟、月费全是坑;塞进设备本地,又卡在掌心里那几瓦电和一点点内存。怎么塞进去,是 2026 年这类产品真正的硬仗。
NPU 是本地推理的发动机

说白了,手机里那颗 NPU(神经网络处理单元)就是本地 AI 的发动机。高通骁龙 8 Elite 的 Hexagon NPU 能到 75 TOPS,联发科天玑 9400 的 APU 790 约 46 到 50 TOPS,专门加速低精度矩阵运算。对玩具来说,跑 2B 到 3B 的小模型就够撑一段自然对话了——这恰是端侧模型的甜区:够用、够快、够省电。
量化把模型压进内存和功耗墙
光有芯片还不够,模型本身得「瘦身」。一个 8B 模型在 FP16 下要占 16GB 内存,手机根本放不下;压到 INT4 四位精度,体积缩到约 4.5GB,直接进得了主流设备的内存。Gemma 4 E2B 这类 4-bit 量化模型只占约 1.5GB,在骁龙 Hexagon 上能跑 30 到 45 token/秒,首字响应压到 50 毫秒以内。整条链路靠 NPU 的低精度算术把功耗摁在 5W 以下,否则电池撑不住也烫手。
一句话建议:端侧的好处很实在——对话不出设备、断网也能聊、没有隐性月费。代价是能力上限基本锁在 3B 级小模型,复杂长任务还是得回到云端。挑产品时别只看「会聊天」,多问一句「这大脑在本地还是上云」,差别比参数表大得多。