目录

智科导论大作业

智能科学与技术专业导论课程(大二上)的两次课程作业:并行程序加速比数据可视化、Titanic 乘客生存预测(随机森林)。

任务背景

课程介绍了机器学习的四大类型(有监督、无监督、半监督、强化学习)与线性回归、决策树、随机森林、神经网络四种经典算法,作业要求自选方向完成小项目(见《导论III作业说明》)。

  • 导论II(数据可视化):对两个 x86 服务器(SR650、SR668)上以最小至最大线程数运行 NPB 基准测试程序(bt、cg、dc、ep、ft、is、lu、mg)得到的性能计数数据做加速比可视化,分析最优线程数靠近中值还是最大线程数,为后续随机森林分类提供依据。
  • 导论III(一种算法):选定随机森林算法,以 Kaggle Titanic 公开数据集为例,做特征预处理、手动网格搜索调参并预测乘客生存率。

内容结构

路径 说明
data-visualization/ 导论II:加速比可视化项目
data-visualization/draw perf pic.py 画图脚本,读取 *_merged.csv 计算加速比并绘制曲线
data-visualization/sample-data/ 3 份 perf 计数数据示例(bt/cg/dc,B 规模,各 64 行)
data-visualization/Readme.md 该子项目的分析与结论
random-forest-titanic/ 导论III:随机森林 Titanic 生存预测项目
random-forest-titanic/Predicting the survival rate of Titanic passengers.py 完整训练与预测脚本
random-forest-titanic/train.csv / test.csv Kaggle Titanic 训练/测试数据
random-forest-titanic/Readme.md 随机森林算法原理介绍

注:全部结果图(18 张加速比曲线 PNG、1 张 Titanic 结果图)体积较小但为生成产物,不入库,可由脚本重新生成;原始 perf 汇总数据仅保留 3 份示例。

运行方法

导论II(在 data-visualization/ 目录下):

pip install seaborn matplotlib
# 把 sample-data 下的 *_merged.csv 与脚本放同一目录后运行
python "draw perf pic.py"

导论III(在 random-forest-titanic/ 目录下):

pip install numpy pandas scikit-learn
python "Predicting the survival rate of Titanic passengers.py"

来源声明

  • Titanic 数据集来自 Kaggle 公开比赛数据(train.csv/test.csv),非本人制作。
  • NPB 基准程序与 perf 性能计数数据来源于课程实验环境(SR650/SR668 服务器),本仓库只含本人整理的 3 份示例数据。
  • 两份子项目 Readme 与全部脚本为本人独立完成;导论III 的 Readme 部分文字经 AI 大模型辅助润色。
关于

智科导论两个小项目:加速比数据可视化、Titanic 生存预测(随机森林)

126.0 KB
邀请码
    Gitlink(确实开源)
  • 加入我们
  • 官网邮箱:gitlink@ccf.org.cn
  • QQ群
  • QQ群
  • 公众号
  • 公众号

版权所有:中国计算机学会技术支持:开源发展技术委员会
京ICP备13000930号-9 京公网安备 11010802047560号