← 返回项目列表
AI驱动云资源自动扩展系统
项目介绍
基于GRU(门控循环单元)的多任务时间序列预测系统,用于预测服务器的CPU使用率、内存使用率和响应时间(RT)。系统包含完整的数据处理、模型训练和可视化流程,能够处理大规模集群数据并提供准确的性能预测。
功能
- 大规模数据处理 — 支持CSV分块读取、Parquet高效存储,Dask+CuDF GPU加速并行处理
- 数据合并对齐 — 多数据源(RT/RES/NODE)基于时间戳的合并与对齐
- 多任务预测 — 同时预测CPU使用率、内存使用率和响应时间(t+1, t+2)
- 特征工程 — 正弦/余弦时间特征编码,log1p变换处理长尾分布
- 断点续训 — 支持训练中断后从检查点恢复
- 早停机制 — patience=5 防止过拟合,ReduceLROnPlateau 学习率调度
- 多指标评估 — MAE、RMSE、MAPE、R² 全方位评估模型性能
- 可视化输出 — 指标柱状图、真实vs预测散点图、时序预测样例图
技术架构
数据处理
Pandas + Dask + CuDF
↓
深度学习
PyTorch + GRU
↓
数据存储
Parquet 列式存储
↓
可视化
Matplotlib + Seaborn
↓
我的工作
- 数据处理 — 设计CSV→Parquet增量转换流程,分块读取避免内存溢出,实现流式合并
- 数据融合 — 基于 msinstanceid 和 timestamp 的多源数据时间对齐合并,支持GPU加速
- 模型构建 — 搭建多任务GRU网络(7维输入→128隐藏层→3任务头),使用HuberLoss + Adam优化
- 特征工程 — 提取周期性时间特征(sin_hour/cos_hour),对响应时间进行log1p变换
- 评估可视化 — 实现多指标评估体系,生成高分辨率图表分析模型性能