小黄鸭

分享后端工程与 AI 实践:MySQL 索引/死锁/慢查询排查、Nginx 灰度与高并发调优、 Go pprof 性能剖析、Java GC 与并发,以及 AI Agent 记忆、Agentic Coding 与工程方法论的思考。

小黄鸭

最新文章

  • /

    我们把一个分类 Agent 的准确率优化交给了另一个 Agent,它跑了一个周末,迭代了十几轮,交回一个比我手工调了两周更好的版本——中间也差点被它的 reward hacking 摆了一道。记录这次实践和 Loop Engineering 的几个关键机制。

  • /

    用 goal 模式治好了一个折磨我们三周的 flaky test,也烧过一整晚 token 一无所获。两次经历的差别不在模型,在于我有没有把「完成」定义清楚。聊聊 goal 类功能的机制设计和写好一份完成合同的六要素。

  • /

    模型明明「想」对了,改文件却改错了——自己搭 harness 的人都在这摔过跤。对比三种编辑格式的设计取舍,附上我自己在内部任务集上复测的结果,和一个关于 harness 设计的普遍规律。

  • /

    一场持续两周的存储选型之争,和一次用 YAML 管任务状态翻车的亲身经历。Agent 时代的存储分工,我现在的答案是一句话:工作区可以是文件,账本必须是数据库。

  • /

    一行看似无害的代码——往系统提示词里注入当前时间——让我们的推理账单翻了三倍。查这个问题的过程让我把前缀缓存彻底搞明白了,这篇把结论写下来。

  • /

    我们的第一版 Agent 记忆系统失败得很彻底:三个月攒了两千多条「记忆」,检索命中率不到一成,捞回来的全是过期垃圾。第二版推倒重来,核心改动只有一个——从「记住更多」改成「坚决少记」。

  • /

    Prompt 工程优化的是「怎么说」,上下文工程管理的是「模型在决策时刻能看到什么」。当任务从单轮问答变成长程 Agent,后者才是质量的决定因素。本文给出一套可落地的上下文预算管理方法。

  • /

    一次线上性能退化的排查,让我彻底想明白了子代理该怎么用、什么时候不该用。顺便聊聊委派契约,和一个我们用血泪换来的硬规则:嵌套深度不超过二。

  • /

    单 Agent 的能力上限是上下文窗口,多 Agent 的能力上限是协作设计。本文拆解 Orchestrator、流水线、辩论、群体投票四种主流协作模式的适用边界,以及多 Agent 系统最大的暗坑:上下文割裂。

  • /

    给我们的系统提示词做了一次「考古」,挖出三个模型版本之前的老拐杖若干。删掉四成规则之后效果反而变好——这件事背后有一个值得认真对待的约束:模型的服从容量是有限的。