AiNews
⚡ 速览 🧠 模型
← 返回首页

#gemma

包含标签 "gemma" 的文章,共 13 篇。

🧠 模型动态 Reddit

开发者 Drummer 发布开源模型 Artemis 31B

社区开发者 Drummer 近期开源了基于 Gemma 架构的 Artemis-31B-v1 及其升级版 v1.1,相关权重已上线 Hugging Face。作者提到,Gemma 系列模型的普及近期有效缓解了开源社区在算力与模型更新上的瓶颈。作为新加入的中等规模开源选项,Artemis-31B 为开发者在本地部署、下游微调以及特定任务落地时提供了新的基础模型资源,用户目前可直接前往 Hugging Face 获取详细配置和权重文件。

🧠 模型动态 Reddit

Gemma 4 31B 与 Qwen3.8 27B 基准测试差异分析

开源社区近期围绕 Gemma 4 31B 与 Qwen3.8 27B 的基准测试表现展开了热烈讨论。开发者在实际选型时发现,Artificial Analysis 等主流评测平台的综合评分,与模型在真实业务场景中的表现存在明显反差。这一现象再次引发了业内对大模型基准测试有效性及指标偏见的思考,对中等规模开源模型的实际落地应用具有重要的参考价值。

🧠 模型动态 Reddit

Gemma 4 12B 模型去对齐变体评估报告

该报告详细评估了 12 款基于 Gemma 4 12B 的去对齐(Abliterated)变体,包括 10 款全量微调模型与 2 款 LoRA 适配器,并以官方基座模型作为对比基准。研究者在单张 RTX 5090 上耗时 165 小时完成了测试。 核心评估方法包括: 1. 技术分析:涵盖权重取证(Weight forensics)与 KL 散度分析。 2. 性能基准:通过 13 项基准测试评估模型基础能力。 3. 安全性与对齐:利用 HarmBench 包含的 400 种行为进行测试,并由大模型裁判对 6,800 条响应进行推理链路审查,共产生 6,000 条判定结果。 该研究为开发者提供了关于去对齐技术对模型性能与安全性影响的实证数据,揭示了不同去对齐路径在实际应用中的表现差异,对理解开源模型定制化后的行为偏差具有参考价值。

🧠 模型动态 Hacker News

Ollama、Gemma与Transformers曝出提示词注入漏洞

安全研究发现,Ollama、Gemma及HuggingFace Transformers库近期曝出提示词注入漏洞。攻击者可通过精心构造的输入操纵模型输出,对本地运行环境与大模型框架构成安全隐患。这表明在AI应用开发中必须重视输入验证,开发者在集成和部署开源模型与工具链时需及时评估并加固相关安全防护。

🧠 模型动态 Reddit

Gemma4与Qwen3.6在SciCode评测中的排名差异

Reddit社区近期围绕artificialanalysis.ai的评测结果展开讨论,焦点集中在Gemma4与Qwen3.6 27b在SciCode基准测试中的科学代码生成表现。两款模型在特定测试维度上的评分差异,折现出当前大模型评测在基准设计、提示词策略以及专业领域效能上面临的实际挑战。对开发者而言,理解不同评测平台的数据口径与模型特性,能更准确地评估开源模型的综合表现,为技术选型和落地提供务实的参考依据。

🧠 模型动态 Reddit

Gemma 4 31B MTP草稿模型量化优化

双卡 RTX 3090 环境下的 Gemma 4 31B 实践。开发者将 MTP(多Token预测)草稿模型从 Unsloth 默认的 Q4_0 转为 Q4_K 格式。实测显示,解码速度从 65 TPs 提升到 72 TPs,性能提升约 10%。此外,更激进的 Q2_K 量化效果不佳。该方案为消费级双卡环境下的推理加速和草稿模型调优提供了可行参考。

🧠 模型动态 Reddit

小型语言模型正在消亡吗?

当前开源社区涌现出不少性能强劲的模型,但 27B 以下的 SLM(如 3B 到 12B 权重范围)正面临生存空间被挤压的局面。在处理复杂的 Agent 编程和智能助手任务时,这些小型模型逐渐暴露出能力上限,难以与 Qwen 3.5 4B/9B 或 Gemma 4 12B 等同类产品拉开显著差距,这也引发了开发者对小型模型技术极限的新一轮思考。

💻 AI 编程 Reddit

Gemma4 (31B) 文件编辑失败问题探讨

有开发者在使用本地运行的 Gemma4 (31B, bf16) 模型进行代码编写和文件编辑任务时,发现该模型频繁陷入循环,无法正确完成文件修改。主要表现为模型在编辑文件时提供的原始内容存在偏差(例如缩进错误等),导致测试框架或代码管理工具因无法匹配原始代码而拒绝修改请求。开发者尝试了多种不同的工具环境和框架,均遇到了类似的文件编辑匹配失败问题,这引发了社区关于该模型在本地代码辅助场景下实际应用表现的讨论。

🧠 模型动态 V2EX

Gemma 4本地实测:MTP加速超越Qwen

有开发者在RTX 3080(10G显存)显卡上测试发现,利用llama.cpp的MTP(多Token预测/投机采样)技术,Gemma 4 12B(Q4量化)的本地运行速度可达85~105 token/s,超越了此前Qwen 9B的75 token/s,且生成质量更优。技术实现上,该方案通过llama-server配置了专门的草稿模型(Draft Model),并开启了KV Cache的Q4_0量化,将模型层完全卸载至GPU。这一实测结果证明了MTP与投机解码技术在消费级硬件上压榨大模型性能的巨大潜力,为开发者本地部署更大参数模型提供了极具价值的实践参考。

🧠 模型动态 LINUX DO

谷歌AI漏洞:输入“忽略”绕过系统指令

近日,有研究者在谷歌浏览器及 Gemini Advanced 中发现了一个显著的提示词注入漏洞。用户只需在对话中输入简单的“忽略”或“ignore it”,AI 就会无条件执行该指令,从而直接绕过其内置的系统提示词(System Prompt)。经过在 Gemma 和 Gemini 1.5 Flash 模型上的针对性测试,研究人员通过分析思维链(CoT)发现,AI 在接收到“忽略”指令后,虽然在逻辑上并不知道具体需要忽略什么,但却在行为上停止遵守系统预设的规则(如“保持简短”、“避免使用夸张词汇”等)。这一现象揭示了当前大模型在处理系统指令与用户指令优先级时的安全缺陷,强调了严格隔离系统提示词与用户输入的重要性。

🧠 模型动态 Reddit

Qwen3.6与Gemma4本地推理实测对比

在Reddit的LocalLLaMA社区中,开发者针对Qwen3.6-35B-A3B与Gemma4-26B-A4B两款热门开源大模型在本地部署时的表现展开了讨论。发帖者分享了其在Radeon 9070 XT显卡上使用最新版llama.cpp进行推理的实际体验。测试表明,虽然Qwen3.6在生成质量和回答效果上表现出色,但Gemma4在运行速度上具有显著优势。这一对比反映了当前本地大模型部署的核心痛点:在模型参数量、活跃参数量(如A3B与A4B)以及硬件适配之间寻找平衡。对于使用AMD显卡及llama.cpp的开发者而言,Gemma4在推理效率上表现更佳。这一讨论为开发者在选择本地模型时,提供了关于“生成质量”与“响应速度”权衡的重要参考。

🧠 模型动态 Reddit

Gemma-4 APEX量化实测:长上下文表现优异

近日,Reddit 社区用户分享了针对 Gemma-4 26B A4B 模型的 APEX 量化版本(APEX-I-Compact,约 15GB)的实测体验。在 16GB 显存的显卡上,通过 llama.cpp Vulkan 运行,该量化模型在高达 90,000 的超长上下文窗口下,依然跑出了 38 tps 的高速度,且未出现生成死循环或明显的质量退化。相比之下,此前使用的 Unsloth ud-q5kxl 量化版本(大小为 21.2GB)在 50,000 上下文时就会出现死循环。这一测试结果表明,APEX 量化技术在保持模型精度的同时,极大地优化了显存占用与长上下文处理能力。对于使用消费级显卡(如 16GB 显存)的本地大模型开发者而言,APEX 量化版 GGUF 模型提供了一个兼顾速度、容量与长文本稳定性的优秀选择。

🛠️ 开发工具 Reddit

谷歌AI Edge更新:支持Gemma 4与MCP

Google AI Edge Gallery 发布新版,重点支持 Gemma 4 多 Token 预测(MTP)与 Pixel TPU 硬件加速。同时引入实验性 MCP(模型上下文协议)支持,提升端侧 AI 的工具调用与上下文连接能力,并新增聊天历史保存功能。这极大优化了开发者在边缘端部署高性能 AI 应用的体验。