浪矢海狮
34分钟前在线
全职 · 1800/日  ·  39150/月
工作时间: 工作日20:00-07:00、周末00:00-00:00工作地点: 远程
服务企业: 0家累计提交: 0工时
聊一聊

APP聊一聊

个人介绍

LLM / RAG / AI Agent / Robotics / ROS 2 / Evaluation / Automation

我是一名能够构建并交付生成式 AI 系统的 AI 工程师,专注于多智能体编排、带重排序的 RAG 流水线、安全防护机制,以及判断系统是否达到上线标准的评估体系。

近期项目包括:基于 LangGraph 和 pgvector 构建双语智能体,在 CI 测试中实现 100% 的诈骗识别召回率;同时通过基于消融实验的评估,判断大语言模型是否能够替代品牌命名流程中的人工步骤,实验覆盖 6 个模型和 23 份真实客户简报。

我也独立负责过客户交付:作为独立顾问,我与医疗和零售行业客户共同定义问题,明确项目范围和边界,交付完整的流水线与实验方案,并提供客户无需依赖我即可运行和维护的技术文档。

工作经历

  • 2026-04-01 -至今MonikaAI ENGINEER

    - 为在线品牌命名流程构建自动化品牌简报提取系统;基于 23 份客户简报对 6 个模型进行了评测,共完成 12,298 次评估调用,总成本仅 3.05 美元,并将结构化结果交付给下游决策流程。 - 围绕 23 份客户简报设计提示词实验,明确品牌命名线索的提取逻辑,识别出最少必要的简报信息,减少无关上下文和 Token 使用量。 - 通过针对 6 个模型的统计实验完成生产模型选型,共执行 12,298 次评估调用,总成本 3.05 美元,在质量、延迟和成本之间取得平衡。 - 将工作流工程化并投入生产,确保运行稳定、可恢复且成本可控;加入输出校验、并发控制、失败重试、断点续跑、预算上限和 CI 回归门禁。 - 基于 18,500 多条商标相似度结果设计实验,评估第三方 API 的风险、延迟和承载能力,为是否将该工具集成到产品中提供决策依据。

  • 2025-06-01 -2026-01-31阿斯顿大学AI 工程师——大语言模型规划与机器人

    - 负责基于大语言模型的电池拆解系统可靠性评估,将自然语言指令转换为 ROS 2/MoveIt 2 动作,并驱动 Kinova Gen3 机械臂执行。 - 设计并集成端到端流程,包括基于 RAG 的技能检索、结构化动作生成、安全校验和真实机器人执行。 - 完成 2,000 多次受控实验和消融实验;RAG 将规划准确率从 44.1% 提升至 52.9%,18 条可执行指令中成功执行 17 条。 - 构建包含 48 项测试的评估框架,发现并修正被高估的安全召回率,将其校正为 2.5%(Kappa = 0.690);同时修复数据流水线中将失败的大模型调用错误标记为完成的缺陷,提升后续开发中的评估完整性与可信度。

教育经历

  • 2025-01-25 - 2027-08-31阿斯顿大学人工智能硕士

  • 2021-09-01 - 2023-09-30利兹大学数据科学硕士

语言

中文母语水平
英语专业级流畅
0
1
2
3
4
5
0
1
2
3
4
5

技能

Python熟练
0
1
2
3
4
5
作品
AI 反诈核实平台:LLM Agent + RAG + 评测门禁(线上运行中)

一、我的职责个人独立项目,需求、架构、开发、测试到上线运维全流程一人完成。二、技术栈Python+Flask+Gunicorn;PostgreSQL+pgvector;Redis;前端Next.js+TypeScript;DockerCompose部署(应用+数据库+缓存+Caddy自动HTTPS)

0
2026-08-23 22:40
更新于: 1小时前 浏览: 1