当大多数端侧大模型还在为每秒跑出 10 个 token 而沾沾自喜时,一个名叫 Maple-Preview 的模型在 iPhone 上跑出了 127 tokens/s——这不仅仅是快 13 倍,而是彻底改变了“手机 AI”的想象边界。
当大多数端侧大模型还在为每秒跑出 10 个 token 而沾沾自喜时,一个名叫 Maple-Preview 的模型在 iPhone 上跑出了 127 tokens/s——这不仅仅是快 13 倍,而是彻底改变了“手机 AI”的想象边界。
想象一下,你掏出手机,对着语音助手说了一句“帮我总结一下今天所有的未读邮件”,它几乎在你话音落下的瞬间就开始流畅地输出回答,完全没有转圈等待的“思考”过程——这不是 5G 云端推理的功劳,而是完全在手机本地运行的 AI 模型完成的。
这就是 DeepGrove 实验室最新发布的 Maple-Preview 模型带来的体验。当业界还在争论“10B 参数已经是手机端侧极限”时,这个总参数量 202 亿、激活参数仅 14.9 亿的混合专家(MoE)模型,用实测数据给了所有人一个响亮的回答:端侧 AI 的算力天花板,远比你想象的更高。
要理解 127 tokens/s 意味着什么,我们先做一个简单的对比。目前市面上主流的高端手机端侧模型,比如 Bonsai 27B,在 iPhone 上的运行速度大约为 9.6 tokens/s——这意味着你问它一个问题,可能要等上好几秒才能看到第一个字蹦出来。而 Maple-Preview 直接把这一数字拉升到了 127 tokens/s,快了整整 13 倍。
这个差距之所以如此悬殊,核心在于 Maple-Preview 采用了混合专家(Mixture of Experts, MoE)架构。简单来说,MoE 模型就像一个大型咨询公司:虽然公司总共有 202 名“专家”(总参数 202 亿),但在处理每个具体问题时,只需要激活其中一小部分最相关的“专家”(激活参数 14.9 亿)来工作。
这种设计的精妙之处在于,它既保留了大型模型的“知识储备”,又大幅降低了推理时的计算量。打个比方,一个拥有 200 名医生的医院,每次接诊时只需要 15 名相关科室的医生会诊,而不是让所有人一拥而上——效率自然天差地别。
长期以来,端侧 AI 面临着所谓的“不可能三角”:模型质量、推理速度、设备资源,三者难以兼得。想要高质量的回答,就需要更大的模型,但大模型在手机上跑不快;想要速度快,就得牺牲模型规模,但小模型“智力”又不够。
Maple-Preview 的突破在于,它通过 MoE 架构重新定义了这三个维度之间的关系。14.9 亿的激活参数保证了推理速度,202 亿的总参数维持了模型的知识容量,而这一切都被压缩在 iPhone 的算力和内存范围内。
当然,我们也要清醒地看到,这个测试结果可能是在特定条件下取得的——比如使用了 iPhone 上的神经网络加速器(ANE)、特定的量化精度、以及特定的提示词长度。但这并不影响 Maple-Preview 的里程碑意义:它证明了,至少在技术层面,手机完全有能力流畅运行百亿参数级别的模型。
Maple-Preview 的出现,很可能会引发端侧 AI 模型架构的新一轮竞赛。过去,业界普遍认为端侧模型的理想规模在 7B-13B 之间,而 Maple-Preview 用 20B 总参数量 + MoE 架构的组合,为这个看似明确的边界撕开了一道口子。
对于开发者来说,这意味着一系列新的可能性。比如,更流畅的本地语音助手、更智能的拍照翻译、甚至是在飞行模式下也能运行的“随身 AI 顾问”。而对普通用户来说,最直观的感受可能是:以后手机上的 AI 功能,不再需要“转菊花”等待了。
不过,我们也要保持理性的期待。127 tokens/s 虽然快,但在复杂的多轮对话、长文本生成等场景下,实际体验可能还是会打折扣。而且,不同的 iPhone 机型(比如 iPhone 15 Pro 和 iPhone 14)之间的性能差异,也可能相当显著。
从 ChatGPT 诞生时“云端 AI 才是王道”的主流论调,到如今 Maple-Preview 在 iPhone 上跑出 127 tokens/s——端侧 AI 的进化速度,确实远超大多数人的预期。虽然目前 Maple-Preview 还只是一个“预览版”,但它所展示的技术方向,已经足够让我们对下一代 iPhone 的 AI 能力浮想联翩。
毕竟,当 AI 模型不再需要“上网”才能思考时,那才是真正的“随身智能”。
IT之家(https://www.ithome.com/0/986/493.htm)
标签:端侧AI, MoE架构, iPhone, 大模型性能突破当大多数端侧大模型还在为每秒跑出 10 个 token 而沾沾自喜时,一个名叫 Maple-Preview 的模型在 iPhone 上跑出了 127 tokens/s——这不仅仅是快 13 倍,而是彻底改变了“手机 AI”的想象边界。
当大多数端侧大模型还在为每秒跑出 10 个 token 而沾沾自喜时,一个名叫 Maple-Preview 的模型在 iPhone 上跑出了 127 tokens/s——这不仅仅是快 13 倍,而是彻底改变了“手机 AI”的想象边界。
想象一下,你掏出手机,对着语音助手说了一句“帮我总结一下今天所有的未读邮件”,它几乎在你话音落下的瞬间就开始流畅地输出回答,完全没有转圈等待的“思考”过程——这不是 5G 云端推理的功劳,而是完全在手机本地运行的 AI 模型完成的。
这就是 DeepGrove 实验室最新发布的 Maple-Preview 模型带来的体验。当业界还在争论“10B 参数已经是手机端侧极限”时,这个总参数量 202 亿、激活参数仅 14.9 亿的混合专家(MoE)模型,用实测数据给了所有人一个响亮的回答:端侧 AI 的算力天花板,远比你想象的更高。
要理解 127 tokens/s 意味着什么,我们先做一个简单的对比。目前市面上主流的高端手机端侧模型,比如 Bonsai 27B,在 iPhone 上的运行速度大约为 9.6 tokens/s——这意味着你问它一个问题,可能要等上好几秒才能看到第一个字蹦出来。而 Maple-Preview 直接把这一数字拉升到了 127 tokens/s,快了整整 13 倍。
这个差距之所以如此悬殊,核心在于 Maple-Preview 采用了混合专家(Mixture of Experts, MoE)架构。简单来说,MoE 模型就像一个大型咨询公司:虽然公司总共有 202 名“专家”(总参数 202 亿),但在处理每个具体问题时,只需要激活其中一小部分最相关的“专家”(激活参数 14.9 亿)来工作。
这种设计的精妙之处在于,它既保留了大型模型的“知识储备”,又大幅降低了推理时的计算量。打个比方,一个拥有 200 名医生的医院,每次接诊时只需要 15 名相关科室的医生会诊,而不是让所有人一拥而上——效率自然天差地别。
长期以来,端侧 AI 面临着所谓的“不可能三角”:模型质量、推理速度、设备资源,三者难以兼得。想要高质量的回答,就需要更大的模型,但大模型在手机上跑不快;想要速度快,就得牺牲模型规模,但小模型“智力”又不够。
Maple-Preview 的突破在于,它通过 MoE 架构重新定义了这三个维度之间的关系。14.9 亿的激活参数保证了推理速度,202 亿的总参数维持了模型的知识容量,而这一切都被压缩在 iPhone 的算力和内存范围内。
当然,我们也要清醒地看到,这个测试结果可能是在特定条件下取得的——比如使用了 iPhone 上的神经网络加速器(ANE)、特定的量化精度、以及特定的提示词长度。但这并不影响 Maple-Preview 的里程碑意义:它证明了,至少在技术层面,手机完全有能力流畅运行百亿参数级别的模型。
Maple-Preview 的出现,很可能会引发端侧 AI 模型架构的新一轮竞赛。过去,业界普遍认为端侧模型的理想规模在 7B-13B 之间,而 Maple-Preview 用 20B 总参数量 + MoE 架构的组合,为这个看似明确的边界撕开了一道口子。
对于开发者来说,这意味着一系列新的可能性。比如,更流畅的本地语音助手、更智能的拍照翻译、甚至是在飞行模式下也能运行的“随身 AI 顾问”。而对普通用户来说,最直观的感受可能是:以后手机上的 AI 功能,不再需要“转菊花”等待了。
不过,我们也要保持理性的期待。127 tokens/s 虽然快,但在复杂的多轮对话、长文本生成等场景下,实际体验可能还是会打折扣。而且,不同的 iPhone 机型(比如 iPhone 15 Pro 和 iPhone 14)之间的性能差异,也可能相当显著。
从 ChatGPT 诞生时“云端 AI 才是王道”的主流论调,到如今 Maple-Preview 在 iPhone 上跑出 127 tokens/s——端侧 AI 的进化速度,确实远超大多数人的预期。虽然目前 Maple-Preview 还只是一个“预览版”,但它所展示的技术方向,已经足够让我们对下一代 iPhone 的 AI 能力浮想联翩。
毕竟,当 AI 模型不再需要“上网”才能思考时,那才是真正的“随身智能”。
这个事件/技术的核心价值在于它推动了一个重要方向的发展。作为从业者/关注者,我们既要看到短期的影响,也要理解其长期意义。
IT之家(https://www.ithome.com/0/986/493.htm)
原文链接:https://www.ithome.com/0/986/493.htm【开场 Hook(0-5秒)】
当大多数端侧大模型还在为每秒跑出 10 个 token 而沾沾自喜时,一个名叫 Maple-Preview 的模型在 iPhone 上跑出了 127 tokens/s——这不仅仅是快 13 倍,而是彻底改变了“手机 AI”的想象边界。
【核心内容(5-45秒)】
iPhone 上跑 127 tokens/s?这可能是端侧 AI 的“iPhone 时刻”
(根据文章正文提炼 3-5 个关键点,口语化表达)【结尾引导(45-60秒)】
如果你觉得有用,点赞收藏,评论区告诉我你的看法!
iPhone 上跑 127 tokens/s?这可能是端侧 AI 的“iPhone 时刻” 🔥
当大多数端侧大模型还在为每秒跑出 10 个 token 而沾沾自喜时,一个名叫 Maple-Preview 的模型在 iPhone 上跑出了 127 tokens/s——这不仅仅是快 13 倍,而是彻底改变了“手机 AI”的想象边界。
💡 关键信息:
#端侧AI #MoE架构 #iPhone #大模型性能突破
#科技资讯 #前沿技术
点击「复制」获取平台专属文案,到各平台编辑器(App/网页)粘贴即可发布。
有密钥的 4 个平台(微信服务号 / 头条 / 百家号 / 微博)可自动发布,密钥填好后自动点亮。
| 平台 | 状态 | 操作 |
|---|---|---|
| 公众号 | 🔑 待配置密钥 | |
| 知乎 | 📋 手动复制 | |
| 抖音 | 📋 手动复制 | |
| 小红书 | 📋 手动复制 |