项目 A:AI 效能中台(AI 测试工作台)行业场景
> AI 业务迭代速度快,传统测试工具割裂分散,接口、UI、性能、测试用例管理相互独立,缺少面向 AI 场景一体化测试工作台。测试人员需要在多个系统来回切换,测试数据构造繁琐,用例维护成本高,版本回归耗时长。本中台面向测试工程师,集成测试知识库、需求评审、数据工厂、用例生成、接口自动化、UI 自动化、性能测试、测试套件、执行历史、质量报告,解决 AI 项目测试链路碎片化,提升 AI 产品整体测试执行效率。
项目 B:AI 质量评测平台(RAG‑Eval)行业场景
> RAG 大模型知识库项目上线时,普遍缺少标准化评测能力。大多依靠人工抽样打分,评测结果不可复现,幻觉、召回错误难以批量发现。本平台面向 RAG、Agent 业务,支持企业自有题库与标准评测集两种数据源,完成批量 RAG 评测任务,可配置推理、并发、重试参数,输出评测指标与全链路追踪,解决 RAG 应用质量评估难、手工评测效率低下的行业痛点。
# 项目 A:AI 效能中台(AI 测试工作台)
AI 效能中台:
平台包含测试知识库、需求评审师、数据工厂、用例生成、接口测试、UI 自动化、性能测试、测试套件、执行历史、测试报告十大模块。支持 RAG 知识加载、AI 辅助需求评审、自动生成测试数据与测试用例;完成接口脚本编排、Web UI 回放、服务压测;支持测试用例套件批量执行,留存全部运行追踪记录,最后输出汇总质量测试报告,覆盖 AI 应用从需求阶段到回归测试完整测试流程。
AI 质量评测平台:
专为 RAG 大模型应用打造质量评测系统。支持两种数据源模式:企业自有导入题库、平台标准评测集;支持预览样本、配置推理参数、并发数、失败重试;发起批量评测任务,采集 RAG 回答结果,完成指标打分;记录全链路调用追踪,留存评测历史记录,区分严格质检、快速测试两套评测模板,输出预估 token、耗时等预估信息,用于 RAG 版本迭代回归校验。
项目 A:AI 效能中台:
本人独立完成前后端整体设计与开发。后端使用 FastAPI 搭建服务,前端基于 Vue3 开发,对接测试执行引擎。难点在于多类型测试任务调度,兼顾接口、UI、压测多种任务类型;实现任务队列管理、执行状态持久化;设计统一报告输出组件,解决不同测试类型数据格式差异,实现一站式测试工作台能力。
项目 B:AI 质量评测平台:
本人独立完成整套平台开发。后端 FastAPI,Milvus 向量库,集成 Langfuse 做链路追踪。难点是批量评测任务并发控制,防止大模型接口限流;兼容外部 RAG 服务接入;区分工具评分与人工复核流程;处理评测数据集导入解析,对评测任务做状态持久化,保证大批量评测任务稳定运行。
声明:本文仅代表作者观点,不代表本站立场。如果侵犯到您的合法权益,请联系我们删除侵权资源!如果遇到资源链接失效,请您通过评论或工单的方式通知管理员。未经允许,不得转载,本站所有资源文章禁止商业使用运营!

下载安装【程序员客栈】APP
实时对接需求、及时收发消息、丰富的开放项目需求、随时随地查看项目状态
评论