Data Science for Beginners 课程使用指南从环境搭建、Notebook 实战到测验应用的完整学习工作流【免费下载链接】Data-Science-For-Beginners10 Weeks, 20 Lessons, Data Science for All!项目地址: https://gitcode.com/GitHub_Trending/da/Data-Science-For-Beginners导读本指南以Data Science for Beginners10 周、20 课、面向所有零基础学习者的数据科学课程为核心完整讲解该课程的使用方法包括单课的标准学习流程课前测验 → 书面教程 → Jupyter Notebook 实战 → 作业 → 课后测验、Jupyter Notebook 与测验应用的本地运行方式、四种常见学习路径、教师端的 10 周排课方案与离线部署以及多语言翻译内容的访问方式。读完本文你将掌握从零开始按需使用这门课程、复现其全部练习与作业的完整操作方案。课程的总体结构20 课、6 大模块课程遵循「10 Weeks, 20 Lessons」的设计全部 20 课按主题被组织进 6 个部分每部分对应一个数据科学核心能力阶段入门Introduction第 1-4 课涵盖数据科学定义、伦理、数据定义、概率与统计基础对应目录1-Introduction/数据处理Working with Data第 5-8 课涵盖关系数据库、非关系数据库、Python、数据准备对应目录2-Working-With-Data/数据可视化Data Visualization第 9-13 课涵盖数量、分布、占比、关系与有意义的可视化对应目录3-Data-Visualization/数据科学生命周期Data Science Lifecycle第 14-16 课对应目录4-Data-Science-Lifecycle/云端数据科学Data Science in the Cloud第 17-19 课对应目录5-Data-Science-In-Cloud/现实世界应用Data Science in the Wild第 20 课对应目录6-Data-Science-In-Wild/。从仓库目录结构见 README.md 与各模块下的课程子目录可以看到每一课都独立成目录内部统一包含README.md书面教程、assignment.md作业说明、notebook.ipynb动手练习等文件这种「一课一目录」的组织方式正是整套课程可以被灵活切片、按需学习的结构基础。如何使用本课程四种学习模式本课程被设计为高度灵活官方 USAGE.md 明确支持以下四种使用方式自学Self-paced learning按自己的节奏独立完成全部课程课堂教学Classroom instruction作为结构化课程配合教师引导使用学习小组Study groups与同伴协作学习工作坊Workshop format短时集中的高强度学习。无论选择哪种模式仓库内的资源都是同一套书面教程、可运行的 Notebook、数据集、测验应用、涂鸦笔记Sketchnotes存放于 sketchnotes/ 目录提供视觉化的概念总结适合视觉型学习者。单课学习标准工作流七步结构每一课都遵循一致的结构以最大化学习吸收率课前测验Pre-lesson Quiz检验既有知识涂鸦笔记Sketchnote可选关键概念的视觉总结视频可选补充视频内容书面教程Written Lesson核心概念讲解Jupyter Notebook动手编码练习作业Assignment实践所学内容课后测验Post-lesson Quiz巩固理解。以一课为例完整工作流命令如下以第一课为例# 1. 进入课程目录 cd 1-Introduction/01-defining-data-science # 2. 阅读 README.md在浏览器或编辑器中打开 # 3. 完成课前测验点击 README 中的测验链接 # 4. 打开 Jupyter notebook如该课提供 jupyter notebook # 5. 完成 notebook 中的练习 # 6. 完成作业参考 assignment.md # 7. 完成课后测验仓库中每一课目录如1-Introduction/01-defining-data-science/、1-Introduction/04-stats-and-probability/均包含上述文件部分课程还提供solution/子目录存放参考解答如1-Introduction/01-defining-data-science/solution/与3-Data-Visualization/09-visualization-quantities/solution/供完成练习后对照。Jupyter Notebook 实战指南Notebook 是整套课程的核心动手载体仓库在多个课程目录中直接提供了.ipynb文件例如2-Working-With-Data/07-python/notebook.ipynb、2-Working-With-Data/08-data-preparation/assignment.ipynb等。启动 Jupyter# 激活虚拟环境 source venv/bin/activate # macOS/Linux # 或 venv\Scripts\activate # Windows # 在仓库根目录启动 Jupyter jupyter notebook环境搭建的完整步骤Git 安装、Python 3.7、虚拟环境、依赖包安装参见 INSTALLATION.md其中明确要求安装的核心数据科学库为pip install jupyter pandas numpy matplotlib seaborn scikit-learn运行 Notebook 单元格执行单个单元格按Shift Enter或点击工具栏「Run」按钮执行全部单元格菜单选择「Cell」→「Run All」重启内核遇到异常时选择「Kernel」→「Restart」。Notebook 中的数据操作示例课程中的 Notebook 普遍使用 pandas / numpy / matplotlib 完成「加载 → 探索 → 可视化」三步走。以下模式在仓库各 Notebook 中反复出现import pandas as pd import numpy as np import matplotlib.pyplot as plt # 加载数据集 df pd.read_csv(data/sample.csv) # 探索数据 df.head() df.info() df.describe() # 创建可视化 plt.figure(figsize(10, 6)) plt.plot(df[column_name]) plt.title(Sample Visualization) plt.xlabel(X-axis Label) plt.ylabel(Y-axis Label) plt.show()实操提示上述sample.csv是示意路径。本仓库 data/ 目录内置了可直接使用的真实数据集包括birds.csv鸟类与飞机撞击数据、diabetes.tsv、taxi.csv、emails.csv、mushrooms.csv、honey.csv、form.csv、SOCR_MLB.tsv、UID_ISO_FIPS_LookUp_Table.csv以及COVID/子目录下的新冠全球时间序列数据。练习时可把加载路径替换为这些文件例如pd.read_csv(data/birds.csv)。如果希望看到一条完整的数据科学流水线代码仓库 examples/ 目录提供了从01_hello_world_data_science.py到05_real_world_example.py的递进式脚本。以 examples/05_real_world_example.py 为例它用鸟击数据分析演示了完整流程定义问题 → 加载数据pd.read_csv(../data/birds.csv)→ 探索结构 → 检查缺失值 → 分析value_counts()统计最常涉及的鸟类→ 可视化柱状图、直方图并保存 PNG→ 得出结论 → 提出后续建议与课程的「生命周期」理念完全一致是自学时极佳的对照脚本。保存工作进度Jupyter 会自动定期保存手动保存按Ctrl SmacOS 为Cmd S所有进度保存在.ipynb文件中关闭浏览器后重新启动 Jupyter 即可继续。测验应用40 道测验的本地运行与编号规则课程配套一个 Vue 编写的测验应用位于 quiz-app/ 目录。本地启动测验应用# 进入测验应用目录 cd quiz-app # 启动开发服务器 npm run serve # 浏览器访问 http://localhost:8080从源码看该应用基于 Vue 2 vue-router vue-i18n 构建见 quiz-app/package.json其scripts提供了三个命令serve: vue-cli-service serve, build: vue-cli-service build, lint: vue-cli-service lint即npm run serve启动本地开发服务npm run build产出生产构建npm run lint执行代码规范检查。路由配置quiz-app/src/router/index.js显示测验页面使用/quiz/:id路径动态加载因此浏览器中可通过http://localhost:8080/quiz/0之类的地址直接访问指定编号的测验。测验的取值方式与编号规则课前测验链接在每课顶部课后测验链接在每课底部每套测验包含3 道题设计目的是巩固学习而非穷尽考核测验编号从0 到 39 共 40 套每课通常配有课前、课后各一套。从测验数据源码如 quiz-app/src/assets/translations/en/group-1.json可以看到每道题的实际数据结构包含id、title如 Defining Data Science - Pre Quiz、questionText以及带isCorrect标记的answerOptions数组。翻译资源按语言分组en/、fr/、es/由 quiz-app/src/assets/translations/index.js 统一汇总这也解释了测验为何支持多语言展示。四种常见学习路径官方提供了四条推荐路径覆盖不同的学习目标路径 1完整新手路径# 1. 搭建环境参见 INSTALLATION.md # 2. 从第 1 课开始 cd 1-Introduction/01-defining-data-science # 3. 每课依次 # - 完成课前测验 # - 阅读课程内容 # - 完成 notebook 练习 # - 完成作业 # - 完成课后测验 # 4. 顺序学完全部 20 课路径 2专题学习只关注某一领域时直接进入对应模块# 示例聚焦数据可视化 cd 3-Data-Visualization # 学习第 9-13 课 # - 第 9 课数量可视化Visualizing Quantities # - 第 10 课分布可视化Visualizing Distributions # - 第 11 课占比可视化Visualizing Proportions # - 第 12 课关系可视化Visualizing Relationships # - 第 13 课有意义的数据可视化Meaningful Visualizations路径 3项目制学习以「完整走通一个数据科学项目」为目标# 1. 学习数据科学生命周期第 14-16 课 cd 4-Data-Science-Lifecycle # 2. 通过第 20 课的真实世界案例演练 cd ../6-Data-Science-In-Wild/20-Real-World-Examples # 3. 将所学方法应用到自己的项目中路径 4云端数据科学# 学习云端数据科学第 17-19 课 cd 5-Data-Science-In-Cloud # 17云端数据科学导论 # 18低代码 ML 工具 # 19Azure 机器学习工作室自学者建议保持条理# 创建学习日志 mkdir my-learning-journal # 每课建立笔记文件 echo # Lesson 1 Notes my-learning-journal/lesson-01-notes.md规律练习每天或每周预留固定学习时间至少每周完成一课定期回顾之前学过的课程。加入社区加入项目社区频道参与讨论分享学习进度、提出疑问从源码贡献视角看也可参考 CONTRIBUTING.md 了解如何提交 Issue 或参与贡献。创建自己的项目完成课程后把概念应用到个人项目上import pandas as pd # 加载自己的数据 my_data pd.read_csv(my-project/data.csv) # 应用课程中学到的技术 # - 数据清洗第 8 课 # - 探索性数据分析第 7 课 # - 可视化第 9-13 课 # - 分析第 15 课教师指南课堂环境搭建查阅 for-teachers.md 获取详细指引其中介绍了使用 GitHub Classroom 拆分为逐课仓库、或直接使用当前仓库配合线上教学的模式搭建共享环境GitHub Classroom 或 Codespaces建立沟通渠道Discord、Slack 或 Teams。建议的 10 周排课计划第 1-2 周入门第 1-4 课第 3-4 周数据处理第 5-8 课第 5-6 周数据可视化第 9-13 课第 7-8 周数据科学生命周期第 14-16 课第 9 周云端数据科学第 17-19 课第 10 周现实世界应用与期末项目第 20 课使用 Docsify 提供离线访问仓库根目录自带 Docsify 配置index.html与 docs/_sidebar.md教师可本地起服务供课堂使用# 在仓库根目录本地服务文档 docsify serve # 学生访问 localhost:3000 # 初始设置完成后无需联网Docsify 的全局安装方式参见 INSTALLATION.mdnpm install -g docsify-cli。作业评估检查学生 notebook 中的练习完成情况通过测验成绩检验理解程度使用数据科学生命周期原则评估期末项目。自定义作业模板 作业[主题] 目标[学习目标] 数据集[提供或让学生自行寻找] 任务 1. 加载并探索数据集 2. 清洗与准备数据 3. 创建至少 3 个可视化 4. 执行分析 5. 沟通结论 交付物 - 含代码与说明的 Jupyter notebook - 结论的书面总结 离线使用获取仓库资源通过git clone将整个仓库克隆到本地绝大多数数据集已包含在仓库 data/ 目录中无需另行下载本地运行文档docsify serve访问localhost:3000本地运行测验应用cd quiz-app npm run serve访问多语言翻译内容课程翻译覆盖 40 种语言统一存放于 translations/ 目录每种语言保持与英文版完全一致的结构70 个 md 25 个 ipynb如 translations/fr、translations/es、translations/de 等# 访问翻译版课程 cd translations/fr # 法语 cd translations/es # 西班牙语 cd translations/de # 德语 # ... 更多语言此外仓库 translated_images/ 目录按语言存放了各课示意图的翻译版本如zh-CN/、ja/、ko/等子目录保证多语言学习体验一致。获取帮助与故障排查查看 TROUBLESHOOTING.md 解决常见问题在 SECURITY.md、SUPPORT.md 中了解安全与支持策略通过提交 Issue 报告问题参考 CONTRIBUTING.md加入项目社区频道提问交流。后续学习方向完成本课程后官方还提供了同一系列的姊妹课程AI 入门、机器学习入门、Web 开发入门、生成式 AI 入门等它们共享本课程的模块化结构与「20 课」式教学法若想继续深入可结合 examples/ 目录中的完整示例脚本与 data/ 目录中的真实数据集将数据科学全流程定义问题 → 加载 → 清洗 → 分析 → 可视化 → 结论迁移到自己的业务问题上。说明本指南基于仓库根目录的 USAGE.md 编写本文档对应的保加利亚语翻译版位于 translations/bg/USAGE.md内容与英文版一致。【免费下载链接】Data-Science-For-Beginners10 Weeks, 20 Lessons, Data Science for All!项目地址: https://gitcode.com/GitHub_Trending/da/Data-Science-For-Beginners创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考