研究报告AI Agent 项目群

AI Agent 项目群:从实验仓库到可运行平台

这篇把 GitHub 仓库里的 AI Agent 相关项目整理成一张项目层知识图谱。它回答一个问题:这些仓库分别验证了 Agent 工程里的哪一部分能力?

总体判断

Agent 平台不是单一模型调用,也不是一个提示词模板库。真正可持续的 Agent 工程至少包含六个部分:

  • Runtime:任务状态、上下文、工具执行和轨迹记录。
  • Tools:MCP、内部 API、文件、命令、浏览器和业务系统能力。
  • Safety:权限、审批、风险分类、工作区边界和敏感数据隔离。
  • Knowledge:RAG、引用、缓存、文档处理和知识库。
  • Evals:golden set、LLM-as-Judge、回归基线和实验对照。
  • Observability:日志、Trace、Langfuse、执行回放和成本监控。

当前仓库正好覆盖了这些层次。

Sure:面向真实业务的写作 Agent

sure 是一个面向中文保险顾问的微信公众号写作 Agent。它运行在 Cloudflare Worker 上,使用 D1、R2、Queues、Durable Objects、Workflows、Workers AI,以及 Claude Agent SDK runner。

这个项目沉淀的知识点是:Agent 产品要把“聊天生成内容”变成“可交付业务流程”。Worker 负责公开路由、数据持久化、队列分发和安全边界;Sandbox runner 负责 Claude Agent SDK 执行;写作 skill 则把领域写作经验固化成可复用能力。

它对应的知识节点是 Cloudflare、Workers、Queues、Durable Objects、Workflows、Sandbox、Agent Runtime、Skills Hub 和生产验证。

SAC Agent:软件工程 Agent 的安全骨架

sac-agent 是教学向 Python 软件工程 Agent。它当前不追求完整自动编码,而是把边界拆清楚:仓库检查、命令风险分类、审批请求、patch 应用和 TUI 会话记录。

这个项目的价值在于刻意保留“慢”的部分:模型、shell、工具和文件系统是不同信任域。读仓库可以低风险,执行命令要分类,修改文件要走明确 patch primitive。未来模型能力增强,也不应该绕过这些边界。

它对应的知识节点是 Agent Runtime、Approval、Tool Safety、Patch、TUI、Python 和软件工程教育。

SAC Agent4J:用 Java 手写最小 Agent Loop

sac-agent4j 是一个手写 Java SWE Agent。它刻意避开 Spring AI、LangChain4j 和大型框架,用最小循环暴露 Agent 的本质:

build context -> ask for one JSON action -> execute tool -> record observation -> repeat

这个项目验证的是:Agent 框架可以很复杂,但核心抽象必须可解释。一个可教学、可调试的 Agent Loop 需要计划、todo、虚拟文件、上下文卸载、读文件、搜索、shell、patch、测试和 finish 这些基础动作。

它对应的知识节点是 Java、Agent Loop、Context、Tool Use、Test Feedback、Trajectory 和 GraalVM。

Agent Lab:评估和可观测性的实验室

agent-lab 把 FastAPI coding agent、Langfuse、Postgres、ClickHouse、Redis、MinIO 和 Docker Compose 组合成实验环境。它不仅能跑 Agent,还能做 skill evaluation、baseline/treatment 对照、重复运行和证据导出。

这个项目沉淀的核心能力是 Evals。没有评估,Agent 的提升只是主观感觉;有了 benchmark、run id、评分、pass-rate、错误率和输出证据,才有可能比较不同 skill、prompt 或 runtime 设计的效果。

它对应的知识节点是 Langfuse、Evals、Benchmark、Coding Agent、FastAPI、Docker Compose 和观测闭环。

DDIA Skill:把架构判断固化为 Skill

ddia-skill 把数据密集型系统设计判断整理成 Codex skill。它关注数据库选择、复制、分区、事务、幂等、派生数据、流处理、故障模式和验证实验。

这个项目说明:skill 不只是“提示词文件”,而是可以被评估、对照和迭代的工程资产。它把架构师经验从一次性回答转成可复用的判断流程,并用 benchmark 约束质量。

它对应的知识节点是 DDIA、Skill、系统设计、数据一致性、幂等、事务、故障模式和验证。

OpenAI Agentic RAG:知识库的基本工程边界

openai-agentic-rag 是长文档 RAG 问答系统。它把文档分块、检索、答案合成、引用、缓存、模型选择和 LLM-as-Judge 验证拆成独立模块。

这个项目的价值在于把 RAG 从“向量库加模型”推进到工程系统:答案要有引用,模型选择要有策略,缓存要能降低成本,验证要能发现幻觉和漂移。

它对应的知识节点是 RAG、Document Chunking、Citation、Cache、Routing、Synthesis、Verification 和 LLM-as-Judge。

K12 与 RoboLabX:垂直场景 Agent 产品化

k12 记录了 RoboLabX 的 Cloudflare standalone 方向,也保留了依赖 gateway、identity、workspace、storage 的平台化路径。它体现了一个典型取舍:垂直产品可以先独立运行,但长期仍要和平台能力连接。

这个项目对应的知识节点是教育场景、Cloudflare、Gateway、Identity、Workspace、Storage、Agent Skill 和产品边界。

Tachi:Agent 工作状态的本地可视化

e-acc 当前产品名是 Tachi。它不是编码 Agent,而是读取 Claude Code 和 Codex 的本地会话痕迹,把后台运行状态变成菜单栏和面板里的持续感知。

这个项目说明 Agent Native 软件不只发生在“模型生成代码”的瞬间,也发生在人的工作流感知里。AI Coding 会产生大量后台状态,Tachi 试图把这些状态变成低打扰、可理解的环境信号。

它对应的知识节点是 Codex、Claude Code、Local-first、macOS、Session Awareness 和 AI Coding Workflow。

项目群之间的关系

这些项目可以组成一条完整链路:

  1. sac-agent4j 解释 Agent Loop 的最小模型。
  2. sac-agent 加入安全边界和审批模型。
  3. openai-agentic-rag 补上知识库和答案验证。
  4. ddia-skill 把专家判断固化成可复用 skill。
  5. agent-lab 对 skill 和 Agent 行为做评估。
  6. sure 把 Agent 交付到真实业务和生产运行环境。
  7. k12 和 Tachi 扩展到垂直场景和工作流感知。

这条链路也解释了 架构师知识图谱 里的 AI 工程判断:先能执行,再能被约束;先能观测,再谈优化;先能评估,再谈规模化。