别让你的 Mac 本地 AI 还在"挤牙膏"——爱马仕助手 0.3 引入 MTP,生成速度直接翻倍
别让本地 AI 还在挤牙膏。爱马仕助手 0.3 正式引入 MTP 多 Token 并行预测,Qwen 3.8 与 Gemma 4 12B 已默认集成,生成速度提升约 2 倍;模型库同步更新至 9 大系列 25 款,覆盖编码、推理、多模态全场景,Mac 本地部署也能又快又稳。
你一定也经历过这个场面:本地大模型终于跑起来了,可屏幕上的字一个一个往外蹦,半分钟才挤出一小段,急得你恨不得替它打字。要说硬件,M 系列芯片哪点差了?可偏偏体验卡得像按了慢放键。
这次爱马仕助手 0.3 版本,就是冲着这个痛点来的。它正式引入了 MTP 加速——这是本次更新里最值得关注的变化。
MTP 是什么?为什么要专门讲它
MTP 的全称是 Multi-Token Prediction,多 Token 并行预测。过去大模型生成文字,是一个字接着一个字地"挤"出来,串行推进,再快也有极限。而 MTP 让模型一次预测多个字,把串行变成并行,相当于把一条单车道拓宽成双车道——生成速度因此能提升约 2 倍。
说人话就是:以前要等半分钟的内容,现在十几秒就能出来。你可能体会不到参数的改变,但你一定体会得到"字终于跟得上思维"的畅快。
AI 的体验好坏,从来不只看参数大小,更看你等它的那几秒。
0.3 已经默认集成的两款模型
这版 0.3 不需要你手动折腾,就已经针对 Qwen 3.8 和 Gemma 4 12B 默认集成 MTP 加速。装好就能享受翻倍的速度。
Qwen 3.8 主攻中文理解和性价比,做日常写作、翻译、文档处理很顺手;Gemma 4 12B 是那种能看图、能读文的全能选手。这两款配上 MTP,长文分析、会议纪要、代码补全的等待感会明显变轻。仙踪问道团队在实测中发现,MTP 带来的速度提升在处理长上下文时感知尤为明显——等待时间缩短,人就不容易走神。
本地模型库更新:9 大系列 25 款
这次更新的模型库也一并整理清楚了,覆盖编码、推理、多模态全场景,全部通过 oMLX 引擎深度适配 Apple 芯片,通义千问、Gemma 4、DiffusionGemma、Ornith、Laguna、Devstral、Nex N2、Nemotron、GPT-OSS 九大系列都在列。
| 系列 | 代表性型号亮点 | 定位 |
|---|---|---|
| 通义千问 Qwen | Qwen 3.8 27B(MTP 加速) | 中文理解、性价比王 |
| Gemma 4 | 12B(MTP 加速)/ 26B / E4B | 全能、长文本、多模态 |
| DiffusionGemma | 26B A4B | 并行写作、速度飞起 |
| Ornith | 35B / 9B | 编程搭档 |
| Laguna | S 2.1(1M 上下文) | 超大项目写代码专才 |
| Devstral | Small 2 24B | 会写代码还会看图 |
| Nex N2 | Mini | Mac 专属、省电丝滑 |
| Nemotron | 3 Nano | 严谨靠谱、企业级 |
| GPT-OSS | 20B | OpenAI 开源、数据本地 |
从需要 48GB 大内存的 Laguna,到 4B 轻量到能塞进轻薄本的 Nemotron,不同配置的 Mac 都能找到合适的。而且整个模型库都是本地跑,数据留在本地,零网络延迟,长期用下来也省下不少云 API 的钱。
除了 MTP,这几个体验点也别忽略
一次下载就能把环境一起装好的能力,加上国内网络加速,让"从零开始搭一个 AI 工作台"这件事真正变简单了。升级失败、端口冲突、配置报错这种头疼事,点一下 Pi 智能助手就能用大白话排查。桌面 App 加 Web 监控,任务跑到哪、资源用了多少,看一眼就知道。别忘了它还兼容 Open WebUI,本地聊天界面也能有一块,怎么顺手怎么来。
一句话总结
爱马仕助手 0.3 的核心,是把"能用"变成"好用"——MTP 让本地模型第一次有了接近云端的响应速度,再把模型库和诊断工具补齐,你缺的不再是能力,而是一次下载。
本地 AI 的这场翻身仗,不是在拼参数,而是在拼你肯不肯多等它一秒。
如果你想现在就试试,可以根据你的 Mac 芯片类型下载对应的安装包(Apple Silicon 和 Intel 版本都有),一键部署原版纯血 Hermes Agent。如果你在用 Mac 本地跑模型,欢迎在评论区聊聊你现在用的是哪一款、体验如何;觉得有用的话,也欢迎关注我,后面继续拆解 Hermes 和本地 AI 的实操玩法,不讲有的没的,只讲能落地的方法。
