面向企业内部 AI 推理任务(文本生成等)的算力资源调度场景:多个业务方提交推理任务,系统按队列积压情况自动扩缩 CPU/GPU 推理 worker,解决"人工扩缩容不及时、GPU 资源利用率低"的痛点。
点击空白处退出提示
面向企业内部 AI 推理任务(文本生成等)的算力资源调度场景:多个业务方提交推理任务,系统按队列积压情况自动扩缩 CPU/GPU 推理 worker,解决"人工扩缩容不及时、GPU 资源利用率低"的痛点。
自研 Kubernetes 弹性控制器(类 KEDA):基于 NATS 消息队列积压指标,通过自定义 CRD 定义扩缩容策略,自动动态扩缩 CPU/GPU 两档推理 worker 池。GPU 侧接入 HAMi 实现显存切分,单卡支持多 worker 共享。配套完整 GitOps(Gitea+Argo CD+容器镜像仓库)与可观测体系(VictoriaMetrics+Grafana+日志采集),实现 AI 推理资源的全链路自动化调度与监控。
搭建本地算⼒集群,实现可靠任务调度、弹性伸缩与可观测,为上层 AI 业务提供稳定的算⼒基础设施。
技术栈: Go, PostgreSQL, K3s, NATS, Victoria Metrics, Categraf, Grafana, Nightingale, Gitea, Argo cd, Zot, Qlora, Victoria Logs
设计并实现 Pull-based 分布式任务调度系统,以 PostgreSQL 作为任务状态唯⼀权威 ,引⼊ Transactional Outbox、幂等控制、Lease 超
时回收、Pending 补偿及 attempt 乐观锁,保障 Worker 宕机、消息重复及迟到回传等异常场景下的任务最终⼀致性。
基于 Go 构建通⽤ Worker 执⾏链路,使⽤ 1000+ 条业务数据进⾏ QLoRA 微调,集成 llama.cpp + GGUF 本地推理,通过 Claim/Lease 管
理任务⽣命周期,⽀持 Ack/Nak 重投、失败重试与多 Worker 竞争消费,实现计算节点⽔平扩展与异构推理后端接⼊。
基于 controller-runtime ⾃研 Elastic Scaling Controller,结合 NATS 任务积压与节点资源指标动态决策 Worker 副本数;将副本决策与
节点调度解耦,通过 Kubernetes Scheduler 的资源声明与节点亲和机制完成 CPU/GPU 异构资源调度。
搭建 私有化 GitOps 链路,实现镜像构建、Commit 版本追踪、Deployment ⾃动更新;构建可观测体系,覆盖基础设施指标、⽇志与告
警。



评论