AI 评测机构 Artificial Analysis 于 8 月 24 日发布博文,携手 Liquid AI 推出面向手机端的本地 AI 性能基准,重点关注模型在苹果 iPhone 17 Pro 上的真实表现。双方分工明确:Artificial Analysis 负责智能水平测试,Liquid AI 负责推理性能测试,共选用函数调用、指令遵循、知识认知、高难问答与数学五类基准。
小模型也能跑出高智能
测试对象为 4 bit 量化后体积不超过 8GB、可在端侧跑起来的模型,示例包括 Gemma 4 E2B 与 LFM2-2.6B-Exp。在上下文限制 16K tokens 时,平均得分最高的是南北阁实验室的 Nanbeige4.2-3B 与 Liquid AI 的 LFM2.5-2.6B;若把响应时间卡在 1 分钟内,LFM2.5-8B-A1B 则登顶,其后依次为 LFM2-2.6B-Exp、Gemma 4 E4B 与 Granite 4.1 8B。
Nanbeige4.2-3B 由 BOSS 直聘旗下实验室推出,仅 30 亿非嵌入参数却借 Looped Transformer 架构循环复用层,在不增参数的前提下抬高有效计算深度,得分比肩对手。这套基准把"端侧小模型"的智能上限摆上台面,也说明手机本地 AI 的竞赛,正从单纯能跑转向跑得快、答得准。
.png)
发评论,每天都得现金奖励!超多礼品等你来拿
登录 在评论区留言并审核通过后,即可获得现金奖励,奖励规则可见: 查看奖励规则