小黄鸭
分享后端工程与 AI 实践:MySQL 索引/死锁/慢查询排查、Nginx 灰度与高并发调优、 Go pprof 性能剖析、Java GC 与并发,以及 AI Agent 记忆、Agentic Coding 与工程方法论的思考。
最新文章
-
Loop Engineering:从手工调 prompt 到设计实验回路
我们把一个分类 Agent 的准确率优化交给了另一个 Agent,它跑了一个周末,迭代了十几轮,交回一个比我手工调了两周更好的版本——中间也差点被它的 reward hacking 摆了一道。记录这次实践和 Loop Engineering 的几个关键机制。
-
目标驱动循环:从口头指令到完成合同
用 goal 模式治好了一个折磨我们三周的 flaky test,也烧过一整晚 token 一无所获。两次经历的差别不在模型,在于我有没有把「完成」定义清楚。聊聊 goal 类功能的机制设计和写好一份完成合同的六要素。
-
编辑格式之战:str_replace、apply_patch 与 hashline
模型明明「想」对了,改文件却改错了——自己搭 harness 的人都在这摔过跤。对比三种编辑格式的设计取舍,附上我自己在内部任务集上复测的结果,和一个关于 harness 设计的普遍规律。
-
工作区可以是文件,账本必须是数据库
一场持续两周的存储选型之争,和一次用 YAML 管任务状态翻车的亲身经历。Agent 时代的存储分工,我现在的答案是一句话:工作区可以是文件,账本必须是数据库。
-
Prefix Caching:Agent 时代的成本工程
一行看似无害的代码——往系统提示词里注入当前时间——让我们的推理账单翻了三倍。查这个问题的过程让我把前缀缓存彻底搞明白了,这篇把结论写下来。
-
Agent 记忆架构:四层模型与冷热分离
我们的第一版 Agent 记忆系统失败得很彻底:三个月攒了两千多条「记忆」,检索命中率不到一成,捞回来的全是过期垃圾。第二版推倒重来,核心改动只有一个——从「记住更多」改成「坚决少记」。
-
上下文工程:比 Prompt 更重要的那一层
Prompt 工程优化的是「怎么说」,上下文工程管理的是「模型在决策时刻能看到什么」。当任务从单轮问答变成长程 Agent,后者才是质量的决定因素。本文给出一套可落地的上下文预算管理方法。
-
子代理:主 Agent 的上下文防火墙
一次线上性能退化的排查,让我彻底想明白了子代理该怎么用、什么时候不该用。顺便聊聊委派契约,和一个我们用血泪换来的硬规则:嵌套深度不超过二。
-
多 Agent 系统的协作模式:从单兵到军团
单 Agent 的能力上限是上下文窗口,多 Agent 的能力上限是协作设计。本文拆解 Orchestrator、流水线、辩论、群体投票四种主流协作模式的适用边界,以及多 Agent 系统最大的暗坑:上下文割裂。
-
指令预算:模型只能有效遵循几百条指令
给我们的系统提示词做了一次「考古」,挖出三个模型版本之前的老拐杖若干。删掉四成规则之后效果反而变好——这件事背后有一个值得认真对待的约束:模型的服从容量是有限的。