AI Agent 项目群:从实验仓库到可运行平台
这篇把 GitHub 仓库里的 AI Agent 相关项目整理成一张项目层知识图谱。它回答一个问题:这些仓库分别验证了 Agent 工程里的哪一部分能力?
总体判断
Agent 平台不是单一模型调用,也不是一个提示词模板库。真正可持续的 Agent 工程至少包含六个部分:
- Runtime:任务状态、上下文、工具执行和轨迹记录。
- Tools:MCP、内部 API、文件、命令、浏览器和业务系统能力。
- Safety:权限、审批、风险分类、工作区边界和敏感数据隔离。
- Knowledge:RAG、引用、缓存、文档处理和知识库。
- Evals:golden set、LLM-as-Judge、回归基线和实验对照。
- Observability:日志、Trace、Langfuse、执行回放和成本监控。
当前仓库正好覆盖了这些层次。
Sure:面向真实业务的写作 Agent
sure 是一个面向中文保险顾问的微信公众号写作 Agent。它运行在 Cloudflare Worker 上,使用 D1、R2、Queues、Durable Objects、Workflows、Workers AI,以及 Claude Agent SDK runner。
这个项目沉淀的知识点是:Agent 产品要把“聊天生成内容”变成“可交付业务流程”。Worker 负责公开路由、数据持久化、队列分发和安全边界;Sandbox runner 负责 Claude Agent SDK 执行;写作 skill 则把领域写作经验固化成可复用能力。
它对应的知识节点是 Cloudflare、Workers、Queues、Durable Objects、Workflows、Sandbox、Agent Runtime、Skills Hub 和生产验证。
SAC Agent:软件工程 Agent 的安全骨架
sac-agent 是教学向 Python 软件工程 Agent。它当前不追求完整自动编码,而是把边界拆清楚:仓库检查、命令风险分类、审批请求、patch 应用和 TUI 会话记录。
这个项目的价值在于刻意保留“慢”的部分:模型、shell、工具和文件系统是不同信任域。读仓库可以低风险,执行命令要分类,修改文件要走明确 patch primitive。未来模型能力增强,也不应该绕过这些边界。
它对应的知识节点是 Agent Runtime、Approval、Tool Safety、Patch、TUI、Python 和软件工程教育。
SAC Agent4J:用 Java 手写最小 Agent Loop
sac-agent4j 是一个手写 Java SWE Agent。它刻意避开 Spring AI、LangChain4j 和大型框架,用最小循环暴露 Agent 的本质:
build context -> ask for one JSON action -> execute tool -> record observation -> repeat这个项目验证的是:Agent 框架可以很复杂,但核心抽象必须可解释。一个可教学、可调试的 Agent Loop 需要计划、todo、虚拟文件、上下文卸载、读文件、搜索、shell、patch、测试和 finish 这些基础动作。
它对应的知识节点是 Java、Agent Loop、Context、Tool Use、Test Feedback、Trajectory 和 GraalVM。
Agent Lab:评估和可观测性的实验室
agent-lab 把 FastAPI coding agent、Langfuse、Postgres、ClickHouse、Redis、MinIO 和 Docker Compose 组合成实验环境。它不仅能跑 Agent,还能做 skill evaluation、baseline/treatment 对照、重复运行和证据导出。
这个项目沉淀的核心能力是 Evals。没有评估,Agent 的提升只是主观感觉;有了 benchmark、run id、评分、pass-rate、错误率和输出证据,才有可能比较不同 skill、prompt 或 runtime 设计的效果。
它对应的知识节点是 Langfuse、Evals、Benchmark、Coding Agent、FastAPI、Docker Compose 和观测闭环。
DDIA Skill:把架构判断固化为 Skill
ddia-skill 把数据密集型系统设计判断整理成 Codex skill。它关注数据库选择、复制、分区、事务、幂等、派生数据、流处理、故障模式和验证实验。
这个项目说明:skill 不只是“提示词文件”,而是可以被评估、对照和迭代的工程资产。它把架构师经验从一次性回答转成可复用的判断流程,并用 benchmark 约束质量。
它对应的知识节点是 DDIA、Skill、系统设计、数据一致性、幂等、事务、故障模式和验证。
OpenAI Agentic RAG:知识库的基本工程边界
openai-agentic-rag 是长文档 RAG 问答系统。它把文档分块、检索、答案合成、引用、缓存、模型选择和 LLM-as-Judge 验证拆成独立模块。
这个项目的价值在于把 RAG 从“向量库加模型”推进到工程系统:答案要有引用,模型选择要有策略,缓存要能降低成本,验证要能发现幻觉和漂移。
它对应的知识节点是 RAG、Document Chunking、Citation、Cache、Routing、Synthesis、Verification 和 LLM-as-Judge。
K12 与 RoboLabX:垂直场景 Agent 产品化
k12 记录了 RoboLabX 的 Cloudflare standalone 方向,也保留了依赖 gateway、identity、workspace、storage 的平台化路径。它体现了一个典型取舍:垂直产品可以先独立运行,但长期仍要和平台能力连接。
这个项目对应的知识节点是教育场景、Cloudflare、Gateway、Identity、Workspace、Storage、Agent Skill 和产品边界。
Tachi:Agent 工作状态的本地可视化
e-acc 当前产品名是 Tachi。它不是编码 Agent,而是读取 Claude Code 和 Codex 的本地会话痕迹,把后台运行状态变成菜单栏和面板里的持续感知。
这个项目说明 Agent Native 软件不只发生在“模型生成代码”的瞬间,也发生在人的工作流感知里。AI Coding 会产生大量后台状态,Tachi 试图把这些状态变成低打扰、可理解的环境信号。
它对应的知识节点是 Codex、Claude Code、Local-first、macOS、Session Awareness 和 AI Coding Workflow。
项目群之间的关系
这些项目可以组成一条完整链路:
sac-agent4j解释 Agent Loop 的最小模型。sac-agent加入安全边界和审批模型。openai-agentic-rag补上知识库和答案验证。ddia-skill把专家判断固化成可复用 skill。agent-lab对 skill 和 Agent 行为做评估。sure把 Agent 交付到真实业务和生产运行环境。k12和 Tachi 扩展到垂直场景和工作流感知。
这条链路也解释了 架构师知识图谱 里的 AI 工程判断:先能执行,再能被约束;先能观测,再谈优化;先能评估,再谈规模化。