1. 立项原因、解决的问题:
企业在使用生成式AI进行产品设计、营销素材制作和创意验证时,通常需要在多个模型平台之间切换,存在数据上传至外部平台、企业设计资产泄露、模型调用成本不可控、GPU资源利用率低以及生成任务缺乏统一管理等问题。因此建设企业级多模态AI平台,将图像、视频、三维模型生成和LoRA训练能力统一整合,并支持在公司内网或私有服务器中部署。
2 行业场景、业务背景:
项目主要应用于汽车设计、工业设计、产品效果图、营销内容制作及企业内部创意生产场景。设计师和业务人员可以通过统一Web界面使用多种开源模型或第三方商业模型,完成图像、视频和三维资产生成。平台支持企业私有化部署,使原始设计图、训练图片、提示词和生成结果保留在企业内部,降低核心资产外流风险
1 具体功能模块:
平台主要包括文生图、图生图、文生视频、图生视频、首尾帧视频生成、图生3D、五视图生成、图像超分辨率、提示词智能扩写、LoRA模型训练、基础模型管理、生成任务管理、任务排队、GPU资源调度、生成结果管理、素材库和第三方模型接口管理等功能模块。
2 主要功能描述:
用户可以选择不同基础模型,输入提示词及负向提示词,并配置分辨率、采样器、迭代步数、引导系数、随机种子和LoRA权重等参数完成图像生成。视频模块支持文本、单张图片及首尾帧生成视频;五视图模块可根据一至多张参考图生成正面、侧面、背面和俯视等标准视图;训练模块支持上传企业自有图片并创建LoRA训练任务。
平台同时维护统一任务队列,根据任务类型、模型显存需求和GPU运行状态分配计算资源。用户可以查看排队位置、执行进度、失败原因和历史生成结果。除本地开源模型外,系统还通过统一接口接入商业图像及视频模型,业务层无需针对不同供应商重复开发。
1 “我”负责的具体任务:
我主要负责平台整体技术架构设计以及服务端核心功能研发,包括上游业务系统、下游AI推理引擎、模型训练服务和任务调度流程的设计与实现。我负责将图像、视频、三维生成能力封装为统一接口,完成生成参数校验、任务创建、任务排队、进度查询、异常处理、结果回传和GPU资源分配等功能,并参与不同开源模型及第三方商业模型的集成。
在模型训练方面,我负责接入AI-Toolkit LoRA训练流程,实现训练图片管理、Caption生成、训练参数配置、任务启动、训练进度获取及模型文件管理。同时负责相关服务在Ubuntu、NVIDIA GPU和企业内网环境中的部署、调试与运行维护。
2 技术栈、架构、亮点和难点:
上游业务系统采用Java、Spring Boot和Spring Cloud Alibaba构建微服务架构,结合MySQL、Redis、消息队列、Nginx及对象存储完成用户、模型、任务和生成资产管理。下游推理服务使用Python、FastAPI、PyTorch和Diffusers,将不同图像、视频及三维模型封装为统一API;LoRA训练使用AI-Toolkit,部分工作流通过ComfyUI完成图像处理和训练数据标注。
系统采用业务服务与GPU推理解耦的架构。业务系统负责权限、任务、参数、队列及结果管理,推理节点负责模型加载和实际计算。调度模块根据GPU空闲状态、显存容量、模型类型和任务优先级进行资源分配,支持多张GPU并行处理不同任务。
项目的主要难点包括不同模型输入参数不统一、大模型加载时间长、显存占用差异明显、长时间任务状态管理、多GPU资源竞争,以及第三方接口与本地模型之间的结果格式统一。实现亮点是通过统一任务协议屏蔽不同模型差异,并支持开源模型私有化运行和商业模型接口扩展,在保障企业数据安全的同时提高GPU资源利用率和系统扩展能力。
声明:本文仅代表作者观点,不代表本站立场。如果侵犯到您的合法权益,请联系我们删除侵权资源!如果遇到资源链接失效,请您通过评论或工单的方式通知管理员。未经允许,不得转载,本站所有资源文章禁止商业使用运营!

下载安装【程序员客栈】APP
实时对接需求、及时收发消息、丰富的开放项目需求、随时随地查看项目状态
评论