Hadoop

项目背景:离线链路只能T+1、业务看不到「现在卖得怎么样」,故补分钟级实时链路,与离线集群同机共存构成Lambda架构雏形|▪实时ETL与数据质量验证:高仿真订单生产者模拟真实生产:泊松到达+21点峰值波峰+8品类加权+二八用户分布,注入1%脏数据验证清洗拦截与巡检不误报;FlinkSQL事件时间+
250Python云计算
项目背景:基于淘宝公开订单数据集(99,457行×9列、39个月)从零搭建离线数仓,为报表与自助分析提供统一口径销售指标|▪分层建模与ETL:ODS→DWD→DWM→DWS→DM五层+dim;针对尾逗号、日期混乱、浮点噪声(16%行受影响)等脏数据,DWD八步清洗(去重、缺失值、异常过滤、round
250Python电商
本项目为基于Hadoop生态的大数据平台集群部署实践,涵盖从单节点到多节点高可用集群的完整搭建流程,并集成Sqoop、Azkaban、Hive等核心生态组件,适配CentOS、Debian与Ubuntu三种主流Linux环境。主要功能模块包括:1.集群基础环境配置:在CentOS、Debian和Ub
1090Hadoop企业服务
自动化环境初始化:使用Bash脚本完成yum源切换(vault.centos.org)、基础工具安装(vim/git/net-tools)、内核参数优化;容器化服务部署:基于DockerCompose编排Nginx+PythonFlask+MySQL三件套,实现服务解耦与快速扩缩容;安全加固模块:配
920Java云计算
数据中台产品产品系统
旨在帮助企业快速构建面向业务应用的数据中台。平台覆盖数据全生命周期管理,提供从数据集成、研发、运维到服务与治理的一站式解决方案。数据集成方面,支持在复杂网络环境下对丰富的异构数据源进行高速稳定的数据采集与同步。平台内置数据源管理功能,支持MySQL、Oracle、PostgreSQL、Kafka、H
2260Java企业服务
项目名称:项目三:基于头条巨量引擎,百度营销和阿里汇川爬虫软件架构:python3,cv2(open-cv),muggle-ocr,pyppeteer项目描述:主要运用多进程和多协程通过opencv和muggle-ocr绕过滑动验证码以及复杂图片的验证,实现自动化入库投放渠道信息,通过spark和p
1830Python云计算
软件架构:python3,scala,spark,flink,实时数仓,离线数仓项目描述:主要通过spark构建离线数仓和flink构建实时数仓来实现风险监控、风险预警和风险数仓,通过监控指标和归因指标以及数仓建模实现自动预警,高效反馈关键考核指标的变化因素,支持风险团队的快速分析,高效定位问题,以
2140Python云计算
大数据平台产品系统
项目名称:项目一:开发大数据平台,基于大数据平台做用户画像软件架构:flink,hadoop,spark,presto,java,python3,mapreduce,shell,kafka,sklearn,doplinscheduler项目描述:每天从百度上百亿数据刻画用户画像来提高用户续费率。责任
1880Python云计算
1、源数据采集,轻度汇总,为数据分析师出分析报表2、定时执行潜在目标用户筛选模型,为营销部门做营销活动传输用户数据3、广告合作方效果数据汇总,为市场部投放广告提供关键词优化数据参考
3260Python游戏
当前共9个项目more
×
寻找源码
源码描述
联系方式
提交