跳到主要内容

TRANSMISSION LOG / 003

用写作让证据可检查。

关于 Agent 搜索、协作记忆、产品方法与系统实践的双语记录。

43篇记录
01

AI Agent 的防御性工程,是怎么一步步长出来的?

兼容层、全量测试、迁移框架和免责声明并不天然多余。问题是 AI Agent 怎样把未来风险提前做成当前工作,以及我们怎样用可达证据判断去留。

更新
02

Stop That Shit 与 AGENTS.md 有什么区别?

Stop That Shit 与 AGENTS.md 的区别在于当前任务授权与长期仓库约定;本文说明 Skill、Guard、插件安装、SHIT 缩写和已知局限性。

更新
03

只让 Codex 导出一个文件,它却多做了一份 SHA-256

从一份无人读取的 .sha256 出发,说明 AI Coding Agent 的过度工程如何发生,以及怎样用消费者、下一步动作和 Stop Ladder 判断一项工作该不该做。

更新
04

我的 AI 自进化系统每天都在空转,而 cron 报告一切正常

一次对 AI 自进化管线空转问题的完整诊断——616 个积压 session、被反复扫描的 watchdog、以及一个让知识库停止增长三天的隐藏 bug。

更新
05

2026 年怎么选 AI Agent 框架,先分清框架、平台、运行时和工具层

LangGraph、OpenAI Agents SDK、CrewAI、AutoGen、Google ADK、Dify 与 DeepSeek Harness 应该怎么选?本文不按 Star 排名,从控制流、状态恢复、审批、部署和工具边界给出决策路径。

更新
06

下一代 Agent Harness 也许不该有一个永远不能被替换的核心

DeepSeek Harness 已采用 MIT 开源。它把模型适配器、工具注册、会话日志,连 Agent Loop 也放进插件边界。本文沿官方代码拆解这种设计的价值、代价与当前限制。

更新
07

MCP 工具输出太大怎么办?先别截断,正常路径 Token 减少 76%

MCP 工具目录和大结果为什么挤占上下文?本文拆解渐进式发现、一次上游调用和可逆结果交付,并用 24 项任务与 8000 行压力测试说明 76% Token 减少何时成立。

更新
08

2026 AI Agent 生态全景调研:从框架到平台到搜索

GitHub 热门 Agent 框架、2,781 个 MCP Server、封闭/开源产品全景图、以及一个被忽略的痛点:Agent 搜索。

更新
09

2026 中文 AI Agent GitHub 项目观察,Star 快照与生态分层

截至 2026 年 8 月 14 日,OpenClaw、Dify、MetaGPT 等中文背景或中文生态 Agent 项目在 GitHub 上有多少 Star?本文给出带日期的项目快照,并解释这些数字能说明什么。

更新
10

让 AI 整理 Agent Skills:为什么正确结果可能是零删除

一轮 Curator 检查了 73 个活跃 Skills 的候选集,最终零合并、零归档。本文解释固定保护、完整阅读、运行前备份和可恢复归档为何比删除配额更重要。

更新
11

Stars 不是采用:我如何监控开源 MCP 的增长与搜索质量

开源 MCP 项目如何同时监控 GitHub、npm、克隆、搜索质量与内容发现?这篇实践记录解释为什么这些信号必须分开,并保留每条链路的失败状态。

更新
12

Agent Search 不只是搜索 API:一套面向 AI Agent 的评估框架

如何评估 Agent Search?本文用查询契约、多源路由、失败可见性、证据预算、可复现性和运营边界给出检查清单,并以 Agent Search MCP 为案例。

更新
13

我给 GPT‑5.6 Sol 一个 2500 行的项目,让它全重构。261 个文件后……

用 OpenAI 旗舰模型重构 Agent Search MCP v3.2 的真实记录——什么干得好、什么翻车了、29,000 行 AI 辅助代码变更长什么样。

更新
14

免费 Tavily 替代:用 Agent Search MCP 做 AI 网页搜索

想找免费 Tavily 替代?Agent Search MCP 是一个免费优先、自托管的 MCP 网页搜索路由器,默认支持中英文零密钥来源,并返回紧凑、可追溯的多源证据。

更新
15

MCP Slim Guard Alpha:减少 76% MCP Token,并保留精确恢复

从工具发现、一次上游执行到 read_result 恢复,记录 MCP Slim Guard Alpha 的交付机制、24 项任务基准和当前 Host 支持。

更新
16

被 You.com 选中的 MCP 搜索服务器:一次意外的市场验证

You.com 扫描了 93 个 AI Agent 项目推广搜索 API,agent-search-mcp 在 MCP 搜索品类中胜出。一次推广 bot PR 如何变成了意外的架构认可和市场定位报告。

更新
17

沉默的 Job:如何设计一套不会产生假阳性的系统巡检体系

一次系统审计发现 37 个 cron job 中有 2 个从未成功运行、4 个从未触发、每天收到同一组假阳性告警。这不是运维事故统计——这是我们自己的系统。本文记录如何用组件声明式检查 + Dead Man's Switch 重建巡检架构,从源头消除假阳性。

更新
18

Trace → Fix → PR:构建 Agent 自修复管线的三个阶段

从 PostHog Self-driving mode 获得灵感,在 baby-harness 中实现了一个三阶段闭环:trace 错误模式检测 → 自动生成修复 → 提交 GitHub Draft PR。记一次从产品思路到代码落地的完整过程。

更新
19

给 AI Agent 设计的项目文档模板:Agent Workspace RefArch 实战

AGENTS.md + HANDOVER.md + 三层架构 + ARID 原则。Anthropic 的渐进式披露、OpenAI 的 agents.md、加上我们自己的上下文工程实践——揉到一起就是一份给 AI Agent 读的项目文档标准。

更新
20

让 AI 团队持久协作:Maker/Checker 架构的生产级实践

MetaGPT 之后,除了对话式的多 agent 协作,还有另一种模式——持久化 Maker/Checker 团队。Pi 写代码、Hermes 编排审查、技能跨项目积累。L3 质量门禁、缺陷模式库、Checker 自我校准——这套我们跑了 2 个完整 cycle 后的真实数据。

更新
21

把 275 份文档喂给 AI Agent:知识库结构设计实战

给 AI Agent 准备知识库 ≠ 把文档扔进向量数据库。270+ 文档、6 个 bundle、16 种类型——我如何设计一套 AI 自己能导航的知识体系,以及过程中学到的组织原则。

更新
22

QQ 机器人大升级:免费接入 LLM,让群聊 Bot 真正听懂人话

受够了群聊机器人的智障回复?从 NapCatQQ 到 LLM Agent,手把手教你搭一个有人格、有记忆、能联网搜索的 QQ AI Bot。完全开源免费。

更新
23

AI Agent 自进化实战:196 次会话 → 自动化技能提取

你的 AI 会从错误中学习吗?完整拆解一套自进化管线:轨迹挖掘、并行分析、技能固化。从 196 次会话到自动提效,无 GPU 也能跑。

更新
24

对抗式 Reviewer:让 AI 审计 AI 的系统设计

介绍一套 3-Persona 对抗审查系统——用 Saboteur / New Hire / Security Auditor 三个角色协同审计 AI 生成的代码和技能,配合强制发现、交叉升级、假阳性三层过滤机制。附 131 个 skill 的实战审计数据。

更新
25

Agent 自进化的生物学启示:从 MAP-Elites 到免疫记忆

调研生物学、物理学、数学中可借鉴的进化概念——Baldwin 效应、MAP-Elites、免疫系统、自由能原理、新奇性搜索——以及如何将这些机制落地到 AI Agent 自进化系统中。附 EvoMap 案例剖析和最新论文解读。

更新
26

对抗审查 + Property-Based Testing:让 AI 帮你找代码里的逻辑 bug

把 Anthropic 的 agentic-pbt 研究整合进我们的对抗性代码审查体系:用 Hypothesis 自动推导 invariant 并搜索反例,补上安全/设计/运行时审查看不到的纯逻辑 bug。

更新
27

给 Agent 知识库换个标准格式:OKF 转换实战

Google 刚发了 Open Knowledge Format (OKF) v0.1。我用了两天,把自己 270 份知识文档全部转了过去。这篇文章是转换过程中的真实体验——踩了什么坑,哪些是白送的,以及我为什么觉得这个格式值得一试。

更新
28

Agent 自进化:从半年实践到 Trajectory Mining Pipeline

一篇经验文章,记录我们在 Hermes Agent 体系中实践自进化的过程:从 8 篇论文调研到 4-Agent pipeline 落地,从两条路线之争到 Executor-Curator 分离架构,从 196 个 session 聊天记录到自动提取 intelligence 的完整链路。

更新
29

AI Agent 搜索引擎选型指南:Brave vs Tavily vs Exa vs DDG 到底怎么选

Agent 每次任务都要搜几十次。选错搜索引擎,每个月多花几百刀。本文对比 8 个主流搜索 API,从定价到痛点到选型建议。

更新
30

Claude Tag 给 AI 编码助手上了三堂课:Ambient、Memory、Identity

Anthropic 刚发布的 Claude Tag 不只是又一个 Slack bot。它的三个核心设计理念——主动感知、上下文积累、身份隔离——同样可以搬进本地编码 Agent。本文分享我的实战方案。

更新
31

我给 AI Agent 装了一套「记忆系统」:从 ACE 论文到生产级闭环

如果你的 AI 编码助手每次新 session 都像得了失忆症——不知道上次做到哪、不记得踩过的坑、不更新自己的技能库。我用一个周末,基于两篇顶会论文,给 Hermes Agent 搭了一套完整的上下文工程系统。成果:skills 描述缩减 84%,16 个 cron job 全自动运行,5 个 draft skill 自动生成。

更新
32

MCP 搜索生态深度分析:为什么 2,781 个 Server 里免费的没有一个好用

分析了 100+ MCP 搜索 Server——付费的体验好但贵,免费的要么质量差要么不稳定。这个市场缺口恰恰是最大的机会。

更新
33

Agent 的 RAG 不只是向量搜索:混合检索架构实践

Skill 检索本身就是一个 RAG 系统——用检索到的 skill 增强 agent 的生成能力。本文拆解双路混合检索的实现与取舍。

更新
34

AI Agent 的失忆症:每个新 session 都要重新认识你的项目

> Claude Code / Codex / Cursor 每次启动都是一张白纸。这不是模型不够强,是你没有给它一套「上下文工程」机制。三层架构 + 生命周期 hooks,让 agent 带着记忆工作。

更新
35

Skill-MAS 读后:你的技能系统离「自动进化」还差几步

arXiv 2606.18837 告诉我们:Meta-agent 的编排能力可以写成一份可自动进化的技能文本。而我们手上已经有 56 个 skill、一套 compound-system、若干个 agent 框架——这张牌怎么打。

更新
36

让 Agent 技能自动进化:失败驱动 + 模式提取,告别手动维护

56 个技能、384 维语义检索、失败自动降权——构建一套无需 GPU、能自我进化的 Agent 技能系统。SkillRL 论文思想的轻量落地实践。

更新
37

Agent Search MCP:AI Agent 的免费多源搜索引擎

AI Agent 的免费搜索引擎——7 引擎聚合、多源验证、Token 优化、内置安全。从零到 v2.1.0 的架构设计与实现全貌。

更新
38

构建 Baby Harness:自进化的 AI Agent 任务框架

为什么写一个轻量级自治 Agent 框架,以及它的架构设计全貌——零外部依赖,1500 行 Python,16 个模块,148 个测试。

更新
39

给 Hermes Agent 装上「外挂系统」:记忆系统与 Skill 系统的深度改造

一套完整的 AI Agent 记忆管理 + Skill 自进化 + 自动化维护的实践记录。不改 Hermes 核心代码,通过外挂插件让 Agent 越用越聪明。

更新
40

像训练神经网络一样训练 Agent 技能:SkillOpt 集成实践

将微软 SkillOpt 与 Hermes Agent 集成的完整实践

更新
41

Vercel eve:当 Agent 不再是代码,而是一个目录

深度拆解 Vercel 新发布的 AI Agent 框架 eve 的设计哲学——为什么它把 Agent 定义为文件系统而非代码 API,以及这与其他主流框架的根本差异。

更新
42

Golden 数据驱动的自动评测管线

> 自动评测是优化的基础——没有评测,优化就是盲人摸象。

更新
43

从规则到混合 ML:SAG 自动调参与优化器实践

> SAG 检索有 7 个超参数,手动调参不现实。我们用三层递进式优化解决这个问题。

更新