Agent Sandbox OSS
给长时间运行、数据密集型 AI Agent 用的 Kubernetes 运行时
为什么做
把 Agent 放进生产环境时会撞上三件事:隔离每个 Agent 就容易 OOM,临时拉 pod 冷启动要等 40 秒以上,节点一挂正在跑的中间状态就没了。这个项目是我把这三个问题逐个拆开、一层层验证的过程。
主要功能
亚 100ms 冷启动
维护一个预热的 pod 池,请求进来直接认领,不用等调度和镜像拉取。
持久化工作区
工作目录挂在 PVC 上,pod 崩溃或被驱逐后状态还在,可以接着往下跑。
异步调度
用 Redis 做任务队列,流量尖峰时排队而不是互相抢资源把集群拖垮。
7 个渐进式 lab
从最朴素的实现开始,每个 lab 只解决上一版暴露出来的一个问题,架构演进过程都留在仓库里。
为什么拆成 7 个 lab
直接看最终架构的话,很多设计会显得没必要——预热池、PVC、队列,单看每一个都像过度设计。所以我把它拆成 7 步,每一步只解决上一步暴露出来的问题,读的人能看到每个组件是被什么逼出来的。
现在的状态
在写。接口还会变,也还没有 release。代码全部开源,欢迎在仓库里提 issue 讨论设计上的问题。