大模型缓存知识介绍
面向 LLM 应用 / 网关开发者的缓存知识梳理。覆盖从推理引擎内部到 API 网关的完整缓存层次,以及各厂商 Prompt Caching 的用法与计费规则。
技术博客与学习记录
面向 LLM 应用 / 网关开发者的缓存知识梳理。覆盖从推理引擎内部到 API 网关的完整缓存层次,以及各厂商 Prompt Caching 的用法与计费规则。
仓库:https://github.com/affaan-m/ECC 作者:affaan-m(单 maintainer) 许可证:MIT(OSS 永久免费) 当前版本:v2.0.0-rc.1(2026 年 4 月);v2.0 alpha 已通过
ecc2/Rust 控制面原型上线(dashboard/start/sessions/status/stop/resume/daemon 子命令可用) 元数据快照:⭐ 211k · 🍴 32.5k · 2,055 commits · 40 branches · 14 tags · 18 issues · 27 PRs · 230+ contributors 维护节奏:10 小时前仍有 commit(feat(discord): release -> #announcements auto-post + pin),单 maintainer 10 个月强度迭代 分析时间:2026-06-11
Gobin v1.2.0 已经发布。这是一个向后兼容的功能版本,核心目标很明确:让一个静态博客项目从“能快速构建”,继续往“能长期维护、能放心发布、能顺手部署”推进。
最近在项目中遇到两个 SSE (Server-Sent Events) 相关的问题,一个是业务逻辑层面的"提前结束",一个是基础设施层面的"连接超时"。记录一下排查和解决过程,供大家参考。
在之前的文章中,我们成功实现了 gRPC-Web 项目,通过 HTTP/1.1 协议调用 gRPC 服务。但在某些场景下,我们可能需要使用 WebSocket 来调用 gRPC 服务,比如:
本文记录了一个完整的 gRPC-Web 项目的实现过程,包括使用 Go 实现 gRPC 服务端(包含流式服务)、使用 TypeScript 通过 gRPC-Web 调用服务,以及通过 Envoy 代理的完整配置。在整个实现过程中,我们遇到了多个技术挑战并逐一解决,希望这篇文章能帮助其他开发者避免类似的坑。
gRPC-Web 是一个官方提供的技术标准和相关实现,它允许直接从浏览器中的 JavaScript 应用程序调用 gRPC 服务。我们可以把它看作是 gRPC 在浏览器环境中的适配器。
本文记录了一次生产环境中遇到的性能问题排查和优化过程,包括Redis内存泄漏和数据库IO过高的诊断与解决。
这是一篇根据实际经验整理的「微信公众号网页授权配置」开发踩坑记录。希望能帮你绕开我走过的那些坑。
找出同时满足以下4个条件的所有三位数(即000-999):