目录
和Yibo零基础学习数据科学

和 Yibo 零基础学习数据科学

一部数据科学家的「认知觉醒指南」

License Python Jupyter Chapters

作者:Yibo翊博 · GitHub: yibohere · GitLink: 翊博在这里吖

📺 Data Science 视频课程:点击关注,学习不迷路


📖 教程简介

这不仅是一本技术手册,更是一部帮助你建立数据科学思维方式的认知指南。我们不教「调包侠」技能,而是培养真正的数据思维。

项目 说明
目标读者 完全零基础的入门者,无需编程或数学背景
学习方式 Jupyter Notebook 交互式学习
工具要求 Jupyter Lab + Python 3.8+
预计时长 10–12 周(每周 3–5 小时)

🧭 学习路线

不必从头学到尾——按你的目标和时间,选一条出发即可:

学习路线图

路线 适合人群 天数
🟠 全套学习路线 想系统掌握全貌 30
🔵 数据科学家路线 想成为专业数据科学家 20
🟢 数据分析师路线 想做日常数据分析与汇报 18
🟣 AI/大模型路线 想往大模型与 Agent 方向走 15
🟠 职场加分路线 想快速提升职场竞争力 10
🔴 周末速览路线 想先建立整体认知 3

教程目录

一、认知篇

  • 第 0 章 · 正本清源:数据科学 vs 数据分析 — ch00
  • 第 1 章 · 数据科学生态全景图 — ch01

二、工具篇

  • 第 2 章 · 环境搭建与 Jupyter Lab 指南 — ch02
  • 第 3 章 · Python 速成:够用就好 — ch03

三、数据篇

  • 第 4 章 · 数据获取:从哪里找数据? — ch04
  • 第 5 章 · 数据清洗:脏数据终结者 — ch05
  • 第 6 章 · 探索性数据分析(EDA) — ch06

四、可视化篇

  • 第 7 章 · 数据可视化:一图胜千言 — ch07

五、分析篇

  • 第 8 章 · 统计分析基础:用数据说话 — ch08
  • 第 9 章 · 从分析到报告:讲好数据故事 — ch09

五点五、数学篇

  • 第 9.5 章 · 数据科学数学基础:直觉优先 — ch-math

六、预测篇

  • 第 10 章 · 机器学习概览 — ch10
  • 第 11 章 · 回归分析:预测连续值 — ch11
  • 第 12 章 · 分类分析:预测类别 — ch12

七、实战篇

  • 第 13 章 · 综合实战:从零到一完成项目 — ch13
  • 第 14 章 · 拥抱 AGI 时代 — ch14

附录 术语表 · 数据集索引 · 数学速查表

🚀 快速开始

# 1. 克隆仓库
git clone https://github.com/yibohere/Data-Science-For-Beginners.git
cd Data-Science-For-Beginners

# 2. 创建虚拟环境(推荐)
python -m venv .venv
# Windows: .venv\Scripts\activate
# macOS/Linux: source .venv/bin/activate

# 3. 安装依赖
pip install -r requirements.txt

# 4. 启动 Jupyter Lab
jupyter lab

第 0 章 开始,按顺序学习即可。

每章结构

每章 Notebook 均遵循统一模板:

  • 🎯 学习目标 —— 本章学完后能做什么
  • 📝 内容讲解 —— 图文并茂的理论与代码
  • ✏️ 动手练习 —— 在 Jupyter 中实时编码
  • 🤔 思考留白 —— 开放式问题,引导深度思考
  • 本章小结 —— 核心知识点回顾

设计理念

设计原则 具体体现
认知先行 第 0 章讲透「数据科学 ≠ 数据分析」
思维 > 技能 每章「思考留白」刻意训练数据思维
循序渐进 认知 → 工具 → 数据 → 分析 → 预测 → 实战
实战驱动 每章可运行代码,最终完成完整项目
社区融合 开源社区学习路径 + AGI 视野

🤝 参与贡献

欢迎提交 Issue 和 Pull Request!详见 CONTRIBUTING.md

许可证

本项目采用 MIT License 开源。


Made with ❤️follow ⭐Star for Data Science Beginners · 作者:Yibo翊博

关于

大家,我是Yibo。这是一份面向零基础读者的数据科学开源教程,从开篇即着意厘清“DS”与“DA”的学科边界,帮助学习者建立清晰而准确的认知框架。全书以Jupyter Notebook为载体,围绕数据获取、清洗、探索性分析、可视化、统计推断、回归与分类建模及综合实战展开,并专辟一章探讨大模型时代下数据科学的新可能。每章配有真实数据集与可运行的代码示例,辅以动手练习与思考留白,力求兼顾学术严谨

15.7 MB
邀请码
    Gitlink(确实开源)
  • 加入我们
  • 官网邮箱:gitlink@ccf.org.cn
  • QQ群
  • QQ群
  • 公众号
  • 公众号

版权所有:中国计算机学会技术支持:开源发展技术委员会
京ICP备13000930号-9 京公网安备 11010802047560号