Skip to content
个人学习网站

Agent Sandbox OSS

给长时间运行、数据密集型 AI Agent 用的 Kubernetes 运行时

为什么做

把 Agent 放进生产环境时会撞上三件事:隔离每个 Agent 就容易 OOM,临时拉 pod 冷启动要等 40 秒以上,节点一挂正在跑的中间状态就没了。这个项目是我把这三个问题逐个拆开、一层层验证的过程。

主要功能

亚 100ms 冷启动

维护一个预热的 pod 池,请求进来直接认领,不用等调度和镜像拉取。

持久化工作区

工作目录挂在 PVC 上,pod 崩溃或被驱逐后状态还在,可以接着往下跑。

异步调度

用 Redis 做任务队列,流量尖峰时排队而不是互相抢资源把集群拖垮。

7 个渐进式 lab

从最朴素的实现开始,每个 lab 只解决上一版暴露出来的一个问题,架构演进过程都留在仓库里。

为什么拆成 7 个 lab

直接看最终架构的话,很多设计会显得没必要——预热池、PVC、队列,单看每一个都像过度设计。所以我把它拆成 7 步,每一步只解决上一步暴露出来的问题,读的人能看到每个组件是被什么逼出来的。

现在的状态

在写。接口还会变,也还没有 release。代码全部开源,欢迎在仓库里提 issue 讨论设计上的问题。