Hadoop

项目背景:离线链路只能T+1、业务看不到「现在卖得怎么样」,故补分钟级实时链路,与离线集群同机共存构成Lambda架构雏形|▪实时ETL与数据质量验证:高仿真订单生产者模拟真实生产:泊松到达+21点峰值波峰+8品类加权+二八用户分布,注入1%脏数据验证清洗拦截与巡检不误报;FlinkSQL事件时间+
250Python云计算
项目背景:基于淘宝公开订单数据集(99,457行×9列、39个月)从零搭建离线数仓,为报表与自助分析提供统一口径销售指标|▪分层建模与ETL:ODS→DWD→DWM→DWS→DM五层+dim;针对尾逗号、日期混乱、浮点噪声(16%行受影响)等脏数据,DWD八步清洗(去重、缺失值、异常过滤、round
250Python电商
本系统涉及三类用户角色,各角色功能需求如下:(1)普通用户:注册登录、浏览商品、搜索商品、加入购物车、创建订单、查看订单、评价商品、收藏商品、账户充值、修改个人资料、修改密码、浏览闲置广场、发布闲置商品、购买闲置商品、闲置聊天、发布求购信息、使用AI助手等。(2)商家用户:申请开店(含上传营业执照和
340Java人工智能
项⽬简单描述:通过前端埋点收集⽤⼾⾏为数据数据,业务数据采集采⽤同步策略存储在Mysql,⽤户⾏为数据采集使⽤flume通道,设置ELT拦截器获取⽇志时间戳,通过kafka消息队列暂存⽇志⽂件,业务数据通过Maxwell暂存kafka,所有数据经过⼀系列操作最终流⼊Mysql,通过数据接⼝可以⽣成可视化报表 技术栈:Hadoop,Zookeeper,Kafka,Flume,Spark,Hive等 项⽬总结:本项⽬主要采集电⼦商务平台的⽤⼾⾏为数据和业务数据,业务数据通过调研最晚可到达200天,每次可抽取 处理200天的数据,通过⼤数据组件分析⽤⼾⾏为,利⽤分析结果达到推测⽤⼾喜好,推荐类似商品的效果
3010Python大数据
当前共4个项目more
×
寻找源码
源码描述
联系方式
提交