面向量化研究和回测准备场景,解决行情数据时间口径不一致、字段缺失、重复记录、复权信息混乱等问题。项目用于把分散数据整理成可重复使用的标准数据集,降低回测因数据质量问题产生错误结论的风险。
点击空白处退出提示
面向量化研究和回测准备场景,解决行情数据时间口径不一致、字段缺失、重复记录、复权信息混乱等问题。项目用于把分散数据整理成可重复使用的标准数据集,降低回测因数据质量问题产生错误结论的风险。
项目包含字段标准化、时间排序、重复值清理、缺失值与异常值检查、复权因子校验、数据质量报告和 CSV/Parquet 输出。系统会记录处理前后的行数、字段状态和异常明细,使每次数据更新都可追溯、可复验。
我负责字段规范、清洗逻辑、质量检查规则和数据集输出。技术栈使用 Python、Pandas、NumPy、CSV/Parquet;通过字段字典和校验配置统一不同来源的数据口径。难点是时区、交易日和复权规则差异,因此加入时间标准化、异常标记和质量报告。



评论