苹果-iphone-上最快本地-ai-模型maple-preview-20b-a1b-登场可达-127-tokenss

2026年08月11日 | 来源:
信息源:

📋 多平台草稿预览 (12平台差异化改编)

iPhone 上跑 127 tokens/s?这可能是端侧 AI 的“iPhone 时刻”

当大多数端侧大模型还在为每秒跑出 10 个 token 而沾沾自喜时,一个名叫 Maple-Preview 的模型在 iPhone 上跑出了 127 tokens/s——这不仅仅是快 13 倍,而是彻底改变了“手机 AI”的想象边界。

当大多数端侧大模型还在为每秒跑出 10 个 token 而沾沾自喜时,一个名叫 Maple-Preview 的模型在 iPhone 上跑出了 127 tokens/s——这不仅仅是快 13 倍,而是彻底改变了“手机 AI”的想象边界。

想象一下,你掏出手机,对着语音助手说了一句“帮我总结一下今天所有的未读邮件”,它几乎在你话音落下的瞬间就开始流畅地输出回答,完全没有转圈等待的“思考”过程——这不是 5G 云端推理的功劳,而是完全在手机本地运行的 AI 模型完成的。

这就是 DeepGrove 实验室最新发布的 Maple-Preview 模型带来的体验。当业界还在争论“10B 参数已经是手机端侧极限”时,这个总参数量 202 亿、激活参数仅 14.9 亿的混合专家(MoE)模型,用实测数据给了所有人一个响亮的回答:端侧 AI 的算力天花板,远比你想象的更高。

13 倍速差背后:MoE 架构的胜利

要理解 127 tokens/s 意味着什么,我们先做一个简单的对比。目前市面上主流的高端手机端侧模型,比如 Bonsai 27B,在 iPhone 上的运行速度大约为 9.6 tokens/s——这意味着你问它一个问题,可能要等上好几秒才能看到第一个字蹦出来。而 Maple-Preview 直接把这一数字拉升到了 127 tokens/s,快了整整 13 倍。

这个差距之所以如此悬殊,核心在于 Maple-Preview 采用了混合专家(Mixture of Experts, MoE)架构。简单来说,MoE 模型就像一个大型咨询公司:虽然公司总共有 202 名“专家”(总参数 202 亿),但在处理每个具体问题时,只需要激活其中一小部分最相关的“专家”(激活参数 14.9 亿)来工作。

这种设计的精妙之处在于,它既保留了大型模型的“知识储备”,又大幅降低了推理时的计算量。打个比方,一个拥有 200 名医生的医院,每次接诊时只需要 15 名相关科室的医生会诊,而不是让所有人一拥而上——效率自然天差地别。

端侧推理的“不可能三角”被打破了?

长期以来,端侧 AI 面临着所谓的“不可能三角”:模型质量、推理速度、设备资源,三者难以兼得。想要高质量的回答,就需要更大的模型,但大模型在手机上跑不快;想要速度快,就得牺牲模型规模,但小模型“智力”又不够。

Maple-Preview 的突破在于,它通过 MoE 架构重新定义了这三个维度之间的关系。14.9 亿的激活参数保证了推理速度,202 亿的总参数维持了模型的知识容量,而这一切都被压缩在 iPhone 的算力和内存范围内。

端侧大模型推理性能对比(iPhone 实测) 推理速度 (tokens/s) 0 25 50 75 100 125 Bonsai 27B 9.6 tokens/s Maple-Preview 127 tokens/s 约 13 倍提升

当然,我们也要清醒地看到,这个测试结果可能是在特定条件下取得的——比如使用了 iPhone 上的神经网络加速器(ANE)、特定的量化精度、以及特定的提示词长度。但这并不影响 Maple-Preview 的里程碑意义:它证明了,至少在技术层面,手机完全有能力流畅运行百亿参数级别的模型。

端侧 AI 的“寒武纪大爆发”要来了?

Maple-Preview 的出现,很可能会引发端侧 AI 模型架构的新一轮竞赛。过去,业界普遍认为端侧模型的理想规模在 7B-13B 之间,而 Maple-Preview 用 20B 总参数量 + MoE 架构的组合,为这个看似明确的边界撕开了一道口子。

对于开发者来说,这意味着一系列新的可能性。比如,更流畅的本地语音助手、更智能的拍照翻译、甚至是在飞行模式下也能运行的“随身 AI 顾问”。而对普通用户来说,最直观的感受可能是:以后手机上的 AI 功能,不再需要“转菊花”等待了。

不过,我们也要保持理性的期待。127 tokens/s 虽然快,但在复杂的多轮对话、长文本生成等场景下,实际体验可能还是会打折扣。而且,不同的 iPhone 机型(比如 iPhone 15 Pro 和 iPhone 14)之间的性能差异,也可能相当显著。

写在最后

从 ChatGPT 诞生时“云端 AI 才是王道”的主流论调,到如今 Maple-Preview 在 iPhone 上跑出 127 tokens/s——端侧 AI 的进化速度,确实远超大多数人的预期。虽然目前 Maple-Preview 还只是一个“预览版”,但它所展示的技术方向,已经足够让我们对下一代 iPhone 的 AI 能力浮想联翩。

毕竟,当 AI 模型不再需要“上网”才能思考时,那才是真正的“随身智能”。



排版建议:
  • 标题字号 18px,加粗
  • 正文 15px,#333333
  • 引用块 #888888 14px
  • 代码块使用深色背景
  • 段落间距 1.75 倍行距
  • 图片居中,宽度 100%

IT之家(https://www.ithome.com/0/986/493.htm)

标签:端侧AI, MoE架构, iPhone, 大模型性能突破

知乎回答


问题:如何看待 iPhone 上跑 127 tokens/s?这可能是端侧 AI 的“iPhone 时刻”?


当大多数端侧大模型还在为每秒跑出 10 个 token 而沾沾自喜时,一个名叫 Maple-Preview 的模型在 iPhone 上跑出了 127 tokens/s——这不仅仅是快 13 倍,而是彻底改变了“手机 AI”的想象边界。

当大多数端侧大模型还在为每秒跑出 10 个 token 而沾沾自喜时,一个名叫 Maple-Preview 的模型在 iPhone 上跑出了 127 tokens/s——这不仅仅是快 13 倍,而是彻底改变了“手机 AI”的想象边界。

想象一下,你掏出手机,对着语音助手说了一句“帮我总结一下今天所有的未读邮件”,它几乎在你话音落下的瞬间就开始流畅地输出回答,完全没有转圈等待的“思考”过程——这不是 5G 云端推理的功劳,而是完全在手机本地运行的 AI 模型完成的。

这就是 DeepGrove 实验室最新发布的 Maple-Preview 模型带来的体验。当业界还在争论“10B 参数已经是手机端侧极限”时,这个总参数量 202 亿、激活参数仅 14.9 亿的混合专家(MoE)模型,用实测数据给了所有人一个响亮的回答:端侧 AI 的算力天花板,远比你想象的更高。

13 倍速差背后:MoE 架构的胜利

要理解 127 tokens/s 意味着什么,我们先做一个简单的对比。目前市面上主流的高端手机端侧模型,比如 Bonsai 27B,在 iPhone 上的运行速度大约为 9.6 tokens/s——这意味着你问它一个问题,可能要等上好几秒才能看到第一个字蹦出来。而 Maple-Preview 直接把这一数字拉升到了 127 tokens/s,快了整整 13 倍。

这个差距之所以如此悬殊,核心在于 Maple-Preview 采用了混合专家(Mixture of Experts, MoE)架构。简单来说,MoE 模型就像一个大型咨询公司:虽然公司总共有 202 名“专家”(总参数 202 亿),但在处理每个具体问题时,只需要激活其中一小部分最相关的“专家”(激活参数 14.9 亿)来工作。

这种设计的精妙之处在于,它既保留了大型模型的“知识储备”,又大幅降低了推理时的计算量。打个比方,一个拥有 200 名医生的医院,每次接诊时只需要 15 名相关科室的医生会诊,而不是让所有人一拥而上——效率自然天差地别。

端侧推理的“不可能三角”被打破了?

长期以来,端侧 AI 面临着所谓的“不可能三角”:模型质量、推理速度、设备资源,三者难以兼得。想要高质量的回答,就需要更大的模型,但大模型在手机上跑不快;想要速度快,就得牺牲模型规模,但小模型“智力”又不够。

Maple-Preview 的突破在于,它通过 MoE 架构重新定义了这三个维度之间的关系。14.9 亿的激活参数保证了推理速度,202 亿的总参数维持了模型的知识容量,而这一切都被压缩在 iPhone 的算力和内存范围内。

端侧大模型推理性能对比(iPhone 实测) 推理速度 (tokens/s) 0 25 50 75 100 125 Bonsai 27B 9.6 tokens/s Maple-Preview 127 tokens/s 约 13 倍提升

当然,我们也要清醒地看到,这个测试结果可能是在特定条件下取得的——比如使用了 iPhone 上的神经网络加速器(ANE)、特定的量化精度、以及特定的提示词长度。但这并不影响 Maple-Preview 的里程碑意义:它证明了,至少在技术层面,手机完全有能力流畅运行百亿参数级别的模型。

端侧 AI 的“寒武纪大爆发”要来了?

Maple-Preview 的出现,很可能会引发端侧 AI 模型架构的新一轮竞赛。过去,业界普遍认为端侧模型的理想规模在 7B-13B 之间,而 Maple-Preview 用 20B 总参数量 + MoE 架构的组合,为这个看似明确的边界撕开了一道口子。

对于开发者来说,这意味着一系列新的可能性。比如,更流畅的本地语音助手、更智能的拍照翻译、甚至是在飞行模式下也能运行的“随身 AI 顾问”。而对普通用户来说,最直观的感受可能是:以后手机上的 AI 功能,不再需要“转菊花”等待了。

不过,我们也要保持理性的期待。127 tokens/s 虽然快,但在复杂的多轮对话、长文本生成等场景下,实际体验可能还是会打折扣。而且,不同的 iPhone 机型(比如 iPhone 15 Pro 和 iPhone 14)之间的性能差异,也可能相当显著。

写在最后

从 ChatGPT 诞生时“云端 AI 才是王道”的主流论调,到如今 Maple-Preview 在 iPhone 上跑出 127 tokens/s——端侧 AI 的进化速度,确实远超大多数人的预期。虽然目前 Maple-Preview 还只是一个“预览版”,但它所展示的技术方向,已经足够让我们对下一代 iPhone 的 AI 能力浮想联翩。

毕竟,当 AI 模型不再需要“上网”才能思考时,那才是真正的“随身智能”。



总结:

这个事件/技术的核心价值在于它推动了一个重要方向的发展。作为从业者/关注者,我们既要看到短期的影响,也要理解其长期意义。


IT之家(https://www.ithome.com/0/986/493.htm)

原文链接:https://www.ithome.com/0/986/493.htm

抖音口播脚本

时长:60秒以内


【开场 Hook(0-5秒)】

当大多数端侧大模型还在为每秒跑出 10 个 token 而沾沾自喜时,一个名叫 Maple-Preview 的模型在 iPhone 上跑出了 127 tokens/s——这不仅仅是快 13 倍,而是彻底改变了“手机 AI”的想象边界。


【核心内容(5-45秒)】

iPhone 上跑 127 tokens/s?这可能是端侧 AI 的“iPhone 时刻”

(根据文章正文提炼 3-5 个关键点,口语化表达)

【结尾引导(45-60秒)】

如果你觉得有用,点赞收藏,评论区告诉我你的看法!


拍摄建议:
  • 竖屏 9:16
  • 表情自然,语速适中
  • 关键信息配文字弹幕
  • 背景音乐:科技感电子乐

小红书笔记


iPhone 上跑 127 tokens/s?这可能是端侧 AI 的“iPhone 时刻” 🔥

当大多数端侧大模型还在为每秒跑出 10 个 token 而沾沾自喜时,一个名叫 Maple-Preview 的模型在 iPhone 上跑出了 127 tokens/s——这不仅仅是快 13 倍,而是彻底改变了“手机 AI”的想象边界。


💡 关键信息:

  • 来源:IT之家
  • 更多详情见完整文章

#端侧AI #MoE架构 #iPhone #大模型性能突破

#科技资讯 #前沿技术

🚀 多平台发布

点击「复制」获取平台专属文案,到各平台编辑器(App/网页)粘贴即可发布。
有密钥的 4 个平台(微信服务号 / 头条 / 百家号 / 微博)可自动发布,密钥填好后自动点亮。

平台状态操作
💬 公众号🔑 待配置密钥
🤔 知乎📋 手动复制
🎵 抖音📋 手动复制
📕 小红书📋 手动复制