AiNews
⚡ 速览 🧠 模型
← 返回首页

#ling

包含标签 "ling" 的文章,共 2 篇。

🧠 模型动态 Reddit

AntLing 发布 Ling-3.0-flash dspark 草稿模型

AntLing 推出 Ling-3.0-flash 的 dspark 草稿模型,专为投机解码等推理加速技术设计,用来提升大模型的响应速度与吞吐量。目前 Hugging Face 尚未提供对应的 GGUF 格式量化版本,本地部署用户还需等待更新。对于关注推理性能优化的开发者来说,该模型提供了一个轻量化的新选择,适合在资源受限的环境下探索高效的推理方案。

🧠 模型动态 Reddit

Ling 3.0 Tiny 与 Qwen 27B 双模型协作方案

开发者近期分享了一种双模型本地部署方案:以 Qwen 3.8 27B (Hermes) 作为主力模型,搭配 Ling 3.0 Tiny 负责上下文压缩和文本摘要等轻量任务。测试表明,Ling 3.0 Tiny 的吞吐速度约为主力模型的 5 倍,且支持 5K 以上的提示词处理能力。在 Q6 量化、KV Q8 且达到 131K 上下文的配置下,整体显存占用依然低于 10GB。这套方案为显存有限的开发者提供了一种高效的本地大模型组合思路。