监控报警体系不是把指标画成看板,而是把系统故障转化为正确的人在正确时间采取行动的反馈系统。本文从 SLI/SLO、分层指标、采集链路、告警生命周期、降噪和成熟度路线,系统讲清楚监控报警体系应该怎么建设。
最近更新
按时间写下的文章
解读 Headroom:一个 20k star 的 AI Agent 压缩层
深度分析 20k star 开源项目 Headroom:为 AI Agent 上下文做压缩,60-95% 减少 token。从源码学习:ML 内容检测(Google Magika)、ContentRouter 内容感知路由、管道生命周期模式与扩展点、CCR 可逆压缩设计、CacheAligner KV 缓存对齐、零代码改动的代理模式、Python+Rust 混合架构,以及从失败中学习的 headroom learn 机制。
Obsidian:把笔记变成知识网络
Obsidian 是什么:本地优先的 Markdown 笔记软件,所有笔记是纯文本文件,永远归你所有。核心差异:双向链接让知识之间有连接,不只是存储。为什么用它:vs Notion(本地/离线/隐私)vs Roam(免费/轻量)vs 文件夹(可视化连接)。怎么用:Vault 概念、双链语法、Graph View、标签与属性、模板、常用插件(Dataview/Calendar/Templater/Excalidraw)。
FlashAttention:注意力的瓶颈不是算力,是内存带宽
FlashAttention 的核心洞察:注意力机制的瓶颈不是算力,是内存带宽。标准 Attention 需要把 N×N 的注意力矩阵写入再读出 HBM,IO 复杂度 O(N²)。FlashAttention 用分块(Tiling)+在线 Softmax+反向重计算,把 HBM 访问降到 O(N),在不损失精度的前提下提速 2-4 倍。FlashAttention-2 进一步减少非矩阵乘法运算、改进并行策略,再快约 2 倍。
有了 AI,重构这件事变了
有了 AI 之后,重构代码的执行成本接近于零——以前让你推迟重构的那些原因,几乎都消失了。但什么没有变:判断「该不该重构」和「重构成什么样」仍然需要你。这篇文章讲清楚重构的摩擦力从哪里来、AI 消灭了哪些、留下了哪些,以及这件事对工程实践意味着什么。
Agent 自动化评测:为什么难,怎么做
Agent 自动化评测技术:为什么比传统 ML 评测难(有状态环境、多条合法路径、副作用);三种评测方式(执行验证/LLM-as-Judge/轨迹评测)各自的适用场景和局限;SWE-bench、GAIA、WebArena、OSWorld 四个主流 Benchmark 的设计思路;以及工程层面的环境隔离、非确定性处理、成本控制。
Apache Doris 查询指南:从写对到写快
Apache Doris SQL 查询详解:连接方式、分区裁剪(查询快慢的核心)、聚合模型与预聚合、精确去重(bitmap)vs 近似去重(HLL/approx)、窗口函数、Join 优化(Broadcast vs Shuffle)、EXPLAIN 分析查询计划、物化视图加速。同一个查询不同写法可以差 100 倍。
OpenAI Codex 的执行安全模型:三层防线
OpenAI Codex 执行安全模型分析:AskForApproval 审批策略的五种模式、ExecPolicy 规则引擎如何用前缀匹配决定命令是否允许执行、以及 macOS Seatbelt、Linux bubblewrap 和 Landlock 三种平台沙箱的实现思路。
解包 OpenAI Codex:SQ/EQ 协议与 Agent 会话模型
解包 OpenAI Codex 的核心架构:SQ/EQ 异步通信协议、Op 枚举与 EventMsg 枚举的设计、CodexThread 会话模型,以及上下文压缩(inline 和 remote v2)的实现机制。
GPU 资源模型:为什么一万件事能同时发生
GPU 的资源模型和 CPU 完全相反:不追求让一件事做得快,而是让一万件事同时发生。SM 架构、Warp 执行模型、显存带宽为何是 LLM 推理的真正瓶颈(不是算力)、HBM vs GDDR、KV Cache 和显存容量的关系、批大小对吞吐的影响。后端工程师需要理解 GPU 的哪些概念。