AiNews
⚡ 速览 🧠 模型
← 返回首页

#mlx

包含标签 "mlx" 的文章,共 4 篇。

🛠️ 开发工具 V2EX

Mac 运行 DeepSeek 与 Qwen 模型优化实战

分享在 Mac 上运行 DeepSeek 和 Qwen 模型的优化经验。实测表明,处理超长上下文时应避开 llama.cpp,以防底层连接超时卡死、重新预填充耗时以及生成速度过慢。推荐使用 mlx-dspark:在内存充足时配合草稿模型或开启 --lookup-drafts 模式,将上下文限制在 64k 以内,并利用自动切片、前缀缓存与 Small-M 优化内核,实现极速的预填充与生成加速,同时无需量化上下文即可保障输出质量。此外,建议让 DeepSeek harness 自行编写联网与记忆插件,从而保证客观知识的准确性及多会话间的连续性。

📰 行业资讯 V2EX

苹果官方文档中的大模型 Token 译名解析

大模型核心概念 token 在苹果官方中文文档中存在两岸译名差异:大陆译为“词元”,台湾译为“符元”,这类似于大陆称“内存”而台湾称“记忆体”的习惯。同时,苹果在技术文档中公开了基于 M 系列芯片与 MLX 框架运行大模型的实测参数,为开发者评估端侧推理性能提供了参考。

💻 AI 编程 Reddit

基于 MLX 框架在 Mac 上运行 Nvidia Nemotron Omni

Nvidia 近期开源了具备音视频及推理能力的 Nemotron Omni 模型。由于 Mac 平台缺乏官方运行时支持,标准 MLX 工具此前只能加载其文本主干,视觉和音频塔无法直接工作。有开发者通过纯 MLX 框架重写了兼容运行时,成功移植了 c-radio vit-h 视觉塔、parakeet conformer 音频塔、处理器及 Token 拼接逻辑。配合 MLX 社区提供的 4bit 量化版本,该模型现已能在苹果设备上实现本地完整部署,为多模态模型在 Mac 端的高效推理打通了关键链路。

🛠️ 开发工具 V2EX

M5 Air 32G本地跑大模型实测:散热成瓶颈

本文针对配备 32G 内存的 MacBook Air M5 进行了本地大模型运行实测。结论表明,该配置虽能运行本地模型,但由于无风扇设计,高强度运行下温度上升极快并会导致降频,外挂风扇也无法根治,不适合长期高负载推理。测试对比了 Ollama 与针对 Mac 优化的 MLX 平台,结果显示 MLX 运行速度更快。受限于 32G 统一内存,建议运行的模型大小不要超过 22GB。实测中成功运行了 Qwen、Gemma、GLM 等主流模型的 4-bit 量化版本。对于有高强度本地开发与推理需求的开发者,建议选择带主动散热的 MacBook Pro;Air 仅适合轻度便携式调试。