这个项目主要面向智慧交通场景。随着交通数据来源越来越多,像公共 API、内部数据和实时业务数据如果处理不及时,就容易出现数据分散、响应慢、分析效率低的问题。因此项目搭建了一套基于 AWS 的数据处理流程,把不同来源的数据统一采集、处理和存储,并通过 Redis、Spark 等技术提升实时处理和大规模分析能力,为后续交通分析、监控和 AI 模型提供更稳定的数据支持。
点击空白处退出提示
这个项目主要面向智慧交通场景。随着交通数据来源越来越多,像公共 API、内部数据和实时业务数据如果处理不及时,就容易出现数据分散、响应慢、分析效率低的问题。因此项目搭建了一套基于 AWS 的数据处理流程,把不同来源的数据统一采集、处理和存储,并通过 Redis、Spark 等技术提升实时处理和大规模分析能力,为后续交通分析、监控和 AI 模型提供更稳定的数据支持。
项目主要包括数据采集、消息处理、数据存储、缓存优化、大数据处理和权限管理几个模块。系统会从内部数据集和公共 API 获取交通数据,通过 SQS 进行消息传递,再由部署在 EC2 上的服务完成数据处理和客户信息整合。处理后的数据会保存到 S3,并通过 Redis 缓存高频访问内容来降低延迟。后续使用 EMR 和 Spark 对大规模数据进行并行处理,再将结果写入 Elasticsearch,方便后续查询、分析以及 AI 模型使用。
我主要负责开发一个 Python 数据处理插件,用于对采集到的数据进行分类、读取、增加、删除和整理,并按照预设的数据结构汇总后传入后续模型。项目主要使用 Python、Requests、AWS SQS、EC2、DynamoDB、S3、Redis、EMR、Spark 和 Elasticsearch 等技术。整体采用分层的数据处理架构,将数据采集、消息传递、数据处理、缓存、存储和模型输入拆分成不同模块,方便后续维护和扩展。结构上的亮点是通过 SQS 解耦数据采集和处理流程,同时利用 Redis 缓存高频数据,并通过 Spark 处理大规模数据,从而提升整体处理效率和系统稳定性。










评论