大模型研发团队的训练、推理、开发机、GPU 配额和评测往往分散在多套系统里:提交训练、上线服务、申请资源要切换不同平台,配额靠人工协调,评测结果与数据、模型的血缘难以追溯,实验也不易复现。Eden 对标业界成熟的机器学习平台,把从数据、训练、评测到推理上线的全生命周期收进一个平台,面向算法工程师和平台运维人员,解决资源分散、流程割裂、配额争抢和实验不可复现的问题。平台同时为 AI Agent 设计了可安全调用的 API,便于用智能体自动化操作训练与推理任务。
点击空白处退出提示
大模型研发团队的训练、推理、开发机、GPU 配额和评测往往分散在多套系统里:提交训练、上线服务、申请资源要切换不同平台,配额靠人工协调,评测结果与数据、模型的血缘难以追溯,实验也不易复现。Eden 对标业界成熟的机器学习平台,把从数据、训练、评测到推理上线的全生命周期收进一个平台,面向算法工程师和平台运维人员,解决资源分散、流程割裂、配额争抢和实验不可复现的问题。平台同时为 AI Agent 设计了可安全调用的 API,便于用智能体自动化操作训练与推理任务。
平台由 6 个后端服务、约 800 个接口组成,主要功能模块:
1. 训练:任务模板与版本、任务/Trial 状态机、失败自动重启、DAG 流水线、代码仓库与镜像构建、指标曲线自动采集、定时触发、告警规则;
2. 推理:在线服务部署、灰度发布与回滚、弹性伸缩、批量推理;
3. 开发机:交互式开发环境、闲置自动停止、端口与文件分享;
4. 资源配额:集群与分组配额的分配、转移、预约与看门狗;
5. 评测:评测集与任务、多模型对比(含置信区间和显著性检验)、能力树、人工评估;
6. 身份权限:用户、组、角色、RBAC、个人访问令牌、权限审批、多租户;
7. 数据与实验追踪:数据集注册与血缘、实验看板;
8. 模型管理:模型卡与版本。
训练脚本只要在标准输出打印 loss、acc 等指标,平台就能自动生成曲线,无需接入 SDK。
个人独立项目,负责产品规划、整体架构设计与前后端全栈开发。
技术栈:后端 Go(net/http + Connect/gRPC),前端 React 18 + TypeScript + Arco Design;以 Protobuf 为唯一接口定义,一份 IDL 同时生成 Go 与 TS 代码;数据库 SQLite / PostgreSQL,对象存储 MinIO(S3),可观测性 OpenTelemetry + Prometheus + Jaeger,Docker Compose 一键拉起全栈。
亮点:① 端口-适配器架构,调度器(本地模拟 / K8s+Volcano)、对象存储、数据库、身份认证(开发令牌 / OIDC)均可通过环境变量切换,本地零依赖即可跑通;② 任务与服务状态由协调循环驱动收敛,而非命令式调用链;③ 制定面向 AI Agent 的 API 规范:每个接口标注授权动作、风险等级和幂等性,失败返回结构化错误,由 CI 门禁强制执行。
质量:约 19 万行 Go 代码、2200 余个后端测试函数,CI 覆盖 Postgres 语义测试、生成代码新鲜度与接口兼容性检查、容器栈端到端冒烟测试。



评论