Artificial Analysis 联手 Liquid AI 发手机端 AI 跑分:iPhone 17 Pro 跑 8GB 内模型座次出炉

AI 评测机构 Artificial Analysis 联合 Liquid AI 发布了针对手机端本地大模型的跑分基准,首次在 iPhone 17 Pro 上对比了多款 8GB 内存以内的小模型,结果显示“小模型”在智商和推理上已能逼近更大尺寸模型,手机 AI 竞争正从“能跑”转向“跑得快、答得准”。

一句话看懂:AI 评测机构 Artificial Analysis 联合 Liquid AI 发布了针对手机端本地大模型的跑分基准,首次在 iPhone 17 Pro 上对比了多款 8GB 内存以内的小模型,结果显示“小模型”在智商和推理上已能逼近更大尺寸模型,手机 AI 竞争正从“能跑”转向“跑得快、答得准”。

事件核心:发生了什么

8 月 24 日,AI 评测机构 Artificial Analysis 发布博客,宣布与 Liquid AI 合作推出面向移动设备的本地 AI 性能基准测试。双方分工明确:Artificial Analysis 负责测试模型的“智商”水平,Liquid AI 则聚焦推理性能。测试覆盖了函数调用、指令遵循、知识理解、难题和数学五类任务。

本次测试对象是经过 4-bit 量化后体积不超过 8GB、可在手机端边缘运行的模型,包括 Gemma 4 E2B 和 LFM2-2.6B-Exp 等。结果显示出两个关键排名:当上下文限制在 16K tokens 时,南华实验室的 Nanbeige4.2-3B 和 Liquid AI 的 LFM2.5-2.6B 平均得分最高;如果将响应时间限制在一分钟内,LFM2.5-8B-A1B 位居榜首,其后依次是 LFM2-2.6B-Exp、Gemma 4 E4B 和 Granite 4.1 8B。

值得注意的 Nanbeige4.2-3B 由 BOSS 直聘旗下实验室开发,仅有 30 亿非嵌入参数,但通过 Looped Transformer 架构循环复用层,在不增加参数的前提下提升了有效计算深度,最终得分与竞品持平。这证明了架构创新可以弥补参数规模的不足。

为什么重要

这套跑分基准的发布,把“边缘小模型”的智能上限摆到了台面上。过去手机端 AI 更多是验证“能不能跑”,如今量化到 8GB 以内的模型在特定任务上已经能接近云端大模型的表现,这意味着高端手机无需联网也能完成复杂推理任务。

对行业而言,这直接影响了端侧 AI 的竞争逻辑。苹果、高通、联发科等芯片厂商的算力升级与模型厂商的架构优化正在形成协同效应。Liquid AI 与 Artificial Analysis 的合作,也在试图为碎片化的端侧评测建立统一标尺,帮助开发者在不同模型之间做出可量化的选型判断,而非凭感觉或营销宣传。

对用户/开发者/创作者的影响

对于普通用户,最直观的变化是手机上的语音助手、文档摘要、照片处理等应用将能本地完成,隐私性更好,响应也更快。此次跑分中“一分钟响应”维度的加入,说明评测方已经把用户体验中的延迟作为核心指标,而非只看纸面分数。

GamsGo AI

AI 工具推荐

想把多个 AI 模型放在一个入口?

GamsGo AI 集成 ChatGPT、DeepSeek、Gemini、Claude、Midjourney、Veo 等常用模型,适合写作、绘图、视频和日常 AI 工作流。

了解 GamsGo AI

推广链接:通过此链接购买,我可能获得佣金,不影响你的价格。

对开发者和企业而言,8GB 内模型跑出高分意味着更低的部署硬件门槛。开发者无需依赖云端 API 即可在 iPhone 等设备上集成本地大模型,长期来看推理成本更低,离线场景的 AI 应用(如会议记录、翻译、医疗辅助)会更容易落地。创作者也可以利用本地模型处理视频字幕、图片描述等任务,减少数据上传的合规顾虑。

值得关注的后续

目前公开信息显示,该基准仍处于早期发布阶段。接下来值得关注三点:其一,Nanbeige4.2-3B 的 Looped Transformer 架构是否会开源或商业化,吸引更多团队跟进这一技术路线;其二,LFM2.5-8B-A1B 的领先是否意味着 Liquid AI 在推理效率上形成了可复制的技术壁垒;其三,安卓阵营旗舰机(如骁龙 8 系列、天玑 9000 系列)的同类测试成绩何时发布,届时才能判断端侧 AI 的竞争格局是否会被重新洗牌。

来源:AIbase

celebrityanime
celebrityanime
文章: 20417

发表回复

您的邮箱地址不会被公开。 必填项已用 * 标注