从零开始在本地部署AI并测试全流程记录。
型号:Macbook Pro M5
内存:48GB
系统版本:Mac os 26.5.2
1. 部署
本次部署共测试两个平台以及一个界面扩展软件,分别为:Ollama,LM Studio,Open WebUI。
从Ollama官网下载Ollama软件作为模型载体,然后下载适合的模型。
整个过程完全傻瓜式操作,直接使用ollama run 模型名字 即可直接下载并运行模型,如果需要删除模型,则使用ollama rm 模型名字。
LM Studio 部署流程几乎一样,唯一不同的一点在于LM Studio自带UI界面,而Ollama需要借助Open WebUI通过http协议才能在网页端实现UI界面。
2. 测试
本次共测试四个模型,为获取更好的性能表现,全部模型采用专为Mac优化过的MLX版本,如下所示:
Qwen 3.8 27B
Gemma 4 26B A4B QAT
Gemma 4 31B
Qwen 3.5 9B
在相同测试条件下,Qwen 3.8 27B 和 Gemma 4 31B输出token的速度和准确性无太大差别。两者也都支持本地agent模式(通过LM studio调用shell,分析文件等)。但是在开启思考模式时,功率提升非常明显,电池模式下,十几分钟就消耗40%电量,并且风扇狂转,非常夸张。
此外,最初以为Ollama支持终端以文件内容作为输入,但是实测发现只支持文本输入和文本输出,应该需要其他类型的平台才能实现(例如LM Studio),有待以后测试。
Gemma 4 26B A4B QAT 经测试发现在准确率相差无几的情况下,输出速度大幅提高。但是还是无法与 Qwen 3.5 9B 相比。后者因为模型体量小,因此输出速度极快。
3. 遇到的问题
Open WebUI安装时的python环境问题
这是个老生常谈的问题了,安装时提示找不到python库,安装之后却发现找到的库在不正确的python版本的路径。即使使用虚拟环境以及设置全局python版本还是无效。后来发现是python环境变量设置问题,使用 unset PYTHONPATH 即可解决。
实时语音转录问题
LM Studio和Open WebUI都提供了语音转文字功能,但是Open WebUI的文字转语音功能却很简陋,LM Studio甚至没有这个功能。Open WebUI的文本转语音猜测应该是使用系统自带引擎,发声语调僵硬,电子声明显。