Mac 运行 DeepSeek 与 Qwen 模型优化实战
分享在 Mac 上运行 DeepSeek 和 Qwen 模型的优化经验。实测表明,处理超长上下文时应避开 llama.cpp,以防底层连接超时卡死、重新预填充耗时以及生成速度过慢。推荐使用 mlx-dspark:在内存充足时配合草稿模型或开启 --lookup-drafts 模式,将上下文限制在 64k 以内,并利用自动切片、前缀缓存与 Small-M 优化内核,实现极速的预填充与生成加速,同时无需量化上下文即可保障输出质量。此外,建议让 DeepSeek harness 自行编写联网与记忆插件,从而保证客观知识的准确性及多会话间的连续性。