AiNews
⚡ 速览 🧠 模型
← 返回首页

#prompt_cache

包含标签 "prompt_cache" 的文章,共 2 篇。

💻 AI 编程 V2EX

Claude Code Prompt Cache 工作原理与失效陷阱

本文为中国开发者和AI创业者深入剖析了Claude Code中Prompt Cache的关键作用、工作原理及其对开发成本的深远影响。作者指出,与传统API调用输入输出大致1:1不同,Claude Code单次请求的输入Token量远超输出(例如,一次“改bug”对话可能输入15K Token,输出仅500 Token,输入是输出的30倍)。这种结构使得输入Token的单价几乎决定了总账单。Prompt Cache在此背景下尤为关键,因为它对命中部分提供高达90%的折扣(仅收取10%费用),这并非小幅优化,而是能带来数量级差异的成本节约。 文章纠正了关于Prompt Cache的常见误解,即它并非简单地检测重复内容并打折。其真实机制是基于“前缀匹配”:服务端会保存用户最近发送的Prompt前缀,当下一次请求的前缀与缓存中的前缀完全一致(一字不差)时,系统将直接从缓存读取,从而跳过重新计算,显著降低Token消耗。作者强调,理解这一机制对于避免缓存失效的“坑”至关重要,并基于个人实践、源码阅读及官方博客的理解,整理了可能导致缓存失效的5个常见陷阱,旨在帮助开发者更高效地利用Claude Code,优化开发成本。

🤖 AI Agent V2EX

开源桌面Agent LeAgent:支持形象定制与记忆

开源桌面 Agent 项目 LeAgent 近日在 GitHub 开源,该项目主打可定制的宠物形象、桌面整理及系统工具能力,并完整支持 DeepSeek API。其核心技术亮点在于: 1. **分层提示词系统**:由 ContextManager 动态组装系统提示词,将人格、工具策略、运行环境及用户指令等解耦为独立 ContextSource。通过计算 stable_hash 实现稳定层 Prompt Cache,大幅降低 DeepSeek 等服务的长会话 Token 成本。 2. **三模态认知记忆**:参考人类记忆机制,划分为情节记忆(历史摘要)、语义记忆(用户偏好与事实)和程序记忆(工具链成功模式)。通过 RetrievalPipeline 进行混合召回与按需注入,配合会话压缩控制上下文。 该项目为开发者提供了一个轻量且技术架构清晰的桌面 Agent 实践范例,展示了如何通过精细化上下文管理优化 LLM 应用的成本与体验。