AiNews
⚡ 速览 🧠 模型
返回首页
Reddit

Ornith-1.5-35B-A3B在4070Ti上跑出60tk/s

在RTX 4070Ti上测试Ornith-1.5-35B-A3B MoE模型时,通过将核心活跃专家参数塞满显存、其余部分卸载至内存的策略,生成速度达到了约60 tokens/s,同时留出约1GB显存用于KV缓存。这种精细的显存协同方案证明,中端硬件同样能高效跑起较大规模的MoE模型,为主流开发者本地部署大模型提供了一个可行的优化思路。

获取每日 AI 情报与羊毛福利

加入 Telegram 频道 @ainews_Go,第一时间接收精选资讯推送。

立即加入

相关阅读