数据科学场景推演实战:从 Data-Science-For-Beginners 第一课作业掌握数据科学流程设计
2026/9/10 2:35:41 网站建设 项目流程

数据科学场景推演实战:从 Data-Science-For-Beginners 第一课作业掌握数据科学流程设计

【免费下载链接】Data-Science-For-Beginners10 Weeks, 20 Lessons, Data Science for All!项目地址: https://gitcode.com/GitHub_Trending/da/Data-Science-For-Beginners

本篇技术指南以开源课程 Data-Science-For-Beginners 第一课《定义数据科学》的配套作业(场景作业参考答案)为核心,完整拆解"如何为一个真实业务问题设计数据科学方案"的四步方法论:收集什么数据、如何收集、如何存储、能得出什么洞察与决策。读完本文,你将掌握跨领域(教育、公共卫生、个人生产力)的数据方案设计套路,并理解它如何与课程第一课讲授的数据旅程(数据获取、存储、处理、可视化、建模)一一对应。

作业背景:用数据科学思维改造真实流程

本作业出现在课程第一课《定义数据科学》(见 1-Introduction/01-defining-data-science/README.md)末尾,属于课程开篇的第一项实战任务(Task 2)。它的目标不是写代码,而是训练学习者"像数据科学家一样思考":面对任意一个业务领域中的真实流程或问题,能否提出一套可落地的数据改进方案。

作业要求围绕任意 3 个不同的领域,逐一回答以下 4 个核心问题:

  1. 收集什么数据(Which data can you collect)——该问题有哪些可观测、可量化的信号?
  2. 如何收集(How would you collect it)——通过传感器、摄像头、日志、问卷还是既有系统数据库?
  3. 如何存储,体量有多大(How would you store the data? How large the data is likely to be)——结构化还是非结构化?需要关系型数据库、NoSQL 还是数据湖?
  4. 能获得什么洞察、做出什么决策(Which insights / decisions)——数据能验证什么假设、支撑什么业务动作?

作业还给出三个可直接入手的建议领域:

  • 如何用数据改进学校中面向儿童的教育流程;
  • 如何用数据在大流行期间管控疫苗接种流程;
  • 如何用数据确保自己在工作中的产出效率。

参考答案拆解:教育场景的完整推演

作业提供了一行"教育(Education)"领域的完整参考答案,作为理解预期产出的示范。将其关键信息还原如下:

领域问题可收集的数据数据如何存储可获得的洞察 / 决策
教育大学课堂出勤率通常偏低;假设"经常出勤的学生考试表现更好"。目标:激励出勤并验证该假设。通过教室内监控摄像头拍摄的照片追踪出勤,或通过追踪学生在教室内的手机蓝牙/Wi-Fi 地址;考试成绩数据已存在于学校数据库中。若采用监控摄像头照片方案——每节课只需存储少量(5–10 张)照片(非结构化数据),随后用 AI 进行人脸识别,将数据转化为结构化形式。计算每名学生的平均出勤数据,检验其与考试成绩之间是否存在相关性(相关性将在课程概率与统计一节深入讨论);为激励出勤,可在学校门户发布每周出勤排名,并在出勤率最高的学生中抽奖。

这一行示例看似简单,实则暗含了完整的数据科学流程设计,值得逐项拆解:

数据收集层面,它给出了两条可选的采集路径:被动视觉采集(监控摄像头照片)与主动无线信号采集(蓝牙/Wi-Fi 地址),并指出考试成绩这类关键数据"已存在"于既有数据库中——这对应课程第一课数据旅程的第一步"数据获取(Data Acquisition)"(见 1-Introduction/01-defining-data-science/README.md),即数据可能来自传感器、既有系统,也可能来自日志、调查问卷等渠道。

数据存储层面,它清晰地区分了非结构化与结构化数据:摄像头照片属于非结构化数据(对应课程中"非结构化数据"的概念),需要先借助 AI(人脸识别)"转换为结构化形式"后才能进入表格化的分析流程。这与课程第一课强调的"数据科学需要同时处理结构化与非结构化数据"完全一致——课程后续的关系数据库、非关系型数据库等章节正是围绕存储问题展开。

洞察与决策层面,它示范了两类典型产出:一是验证性分析——计算平均出勤率并与考试成绩求相关性(相关性分析是后续课程 04 统计与概率 的核心主题之一);二是业务动作——通过发布每周出勤排名、对高出勤学生抽奖来激励行为改变,这正是课程所强调的"可执行的洞察(actionable insights)"。

方法论底座:数据旅程与数据类型

这个参考答案不是凭空设计的,它的每一步都能在课程第一课的方法论中找到对应:

数据旅程五步(见 1-Introduction/01-defining-data-science/README.md):

  1. 数据获取(Data Acquisition):直接从应用数据库取数最简单;IoT 传感器数据量大时,宜用 IoT Hub 等缓冲端点先行汇聚。
  2. 数据存储(Data Storage):按未来查询方式决定——关系型数据库用 SQL 查询、以 schema 组织;NoSQL(如 CosmosDB)不强加 schema、可存层级化 JSON 文档或图结构,但查询能力和引用完整性较弱;数据湖(Data Lake)用于原始非结构化大数据集群,常搭配 Parquet 格式。
  3. 数据处理(Data Processing):把原始形式转换为可用于可视化/模型训练的形式,非结构化文本、图像常需 AI 提取特征(feature)。
  4. 可视化与人工洞察(Visualization / Human Insights):多角度可视化数据、寻找关系,并用统计手段检验假设或证明相关性。
  5. 训练预测模型(Training a Predictive Model):用机器学习技术构建预测模型,应用于新的同构数据。

三类数据类型(见 1-Introduction/01-defining-data-science/README.md):

  • 结构化(Structured):以表格形式组织,如"带电话号码的联系人列表""过去 20 年每分钟各房间温度""进入大楼人员的年龄与性别数据";
  • 半结构化(Semi-structured):有一定结构但差异大,如带链接的维基百科页面、JSON 格式的论文集合、网页;
  • 非结构化(Unstructured):文件集合,如百科全书的正文文本、企业共享文件、监控摄像头的原始视频流。

教育场景参考答案中"监控照片(非结构化)→ AI 人脸识别 → 结构化表格"的转化路径,正是这三类数据之间流转的典型范例。

从示例到实战:补全你自己的三个场景

作业要求学习者自行填充下方表格(可替换建议领域),至少覆盖 3 个领域:

领域问题可收集的数据如何存储可获得的洞察 / 决策
教育(示例已给出)
疫苗接种
生产力

若想高质量完成,可以套用第一课 README 中归纳的数据来源清单来打开思路(见 1-Introduction/01-defining-data-science/README.md):

  • 结构化来源:IoT 传感器(温度、压力等)可用于自动控制楼宇供暖照明以降低成本;购买后/访问网站后的调查问卷;用户行为分析(如用户深入站点的程度、离开站点的典型原因)。
  • 非结构化来源:文本可提取情感得分(sentiment)与关键词;图像/视频(如监控视频估算道路车流、预警拥堵);Web 服务器日志可分析哪些页面最常被访问及停留时长。
  • 半结构化来源:社交网络图谱可用于刻画用户性格与信息传播效力;聚会照片集可构建"谁与谁合影"的关系图,提取群体动力学(Group Dynamics)信息。

以作业给出的另外两个领域为例,可以这样沿四步框架推演(以下为结合课程数据来源清单的引导性思路,非作业原文结论):

  • 疫苗接种(Vaccination):可考虑收集接种登记记录、疫苗库存与冷链温度传感器数据、预约与到场数据等;存储上可用关系型数据库管理预约与接种记录,用半结构化/时序存储承载传感器流;洞察层面可分析不同人群、地区的接种率与流失环节,从而指导疫苗调配、开放临时接种点或定向通知提醒。
  • 生产力(Productivity):可考虑收集时间追踪工具日志、任务完成记录、专注时段数据等;结合服务器日志、行为分析类数据源;洞察层面可找出低效时段或干扰源,支撑作息调整、任务重排等决策。

评分时,参考答案只要求方案"合理"即可,重点是每个领域都要覆盖数据源、存储方式与决策/洞察三要素

评分标准解读

作业官方评分表(Rubric)如下:

优秀(Exemplary)合格(Adequate)待改进(Needs Improvement)
能为所有问题领域识别出合理的数据源、数据存储方式以及可能的决策/洞察方案的部分方面不够详细,未讨论数据存储,且至少描述了 2 个问题领域只描述了数据方案的一部分,且只考虑了 1 个问题领域

对照可见,最容易被忽略的是**"数据存储"这一列**——作业明确指出,未讨论存储方式即最多只能算"合格"。因此在填表时,务必为每个场景明确数据形态(结构化/非结构化)与存储选型(关系型、NoSQL、数据湖或纯文件),并估计数据体量。

延伸:配套文本挖掘挑战中的同款流程

作业之外,第一课还提供了一项可选的 🚀 Challenge(见 notebook.ipynb),用一段真实代码完整演示了上述数据旅程,可作为设计作业方案时的参照:

  1. 数据获取:用requests.get(携带自定义User-Agent)下载维基百科 Data Science 页面 HTML;
  2. 数据处理:用 BeautifulSoup 解析 HTML,并借助一组选择器(.mw-jump-link.navbox.reflistsup.reference.mw-editsection.hatnote.metadata.infobox#toc.sidebar等)剥离导航、参考列表等噪音元素,仅保留正文文本;
  3. 洞察提取:用nlp_rake.Rake(max_words=2, min_freq=3, min_chars=5)做关键词抽取——最短关键词 5 个字符、文档内最少出现 3 次、关键词最多 2 个词;并用matplotlib绘制关键词重要度柱状图;
  4. 可视化:用WordCloud(background_color='white', width=800, height=600)分别以generate_from_frequencies(基于 RAKE 结果)和generate(基于原始文本)生成词云,输出为1-Introduction/01-defining-data-science/images/ds_wordcloud.png

notebook 最后还指出一个关键观察:直接用原始文本生成词云会混入大量噪音(如 "Retrieved on" 这类无意义词),而 RAKE 抽取的关键词质量明显更高——这直观印证了"数据预处理与清洗"的重要性,也正是作业表格中"如何存储/如何处理"一列要回答的问题。挑战还预留了延伸任务:将同样的代码应用到Big DataMachine Learning两个领域的维基百科词条上,对比相关概念词云。

小结

本作业是 Data-Science-For-Beginners 课程给学习者的第一块"思维磨刀石":不写代码,却要求你完整走一遍"定义问题 → 设计数据采集 → 规划存储 → 预判洞察与决策"的数据科学方案设计闭环。掌握这四步框架后,无论面对教育、公共卫生还是个人效率问题,你都能快速产出一份结构完整、可评估、可讨论的数据方案——这正是后续所有数据获取、存储、可视化与建模课程的地基。

【免费下载链接】Data-Science-For-Beginners10 Weeks, 20 Lessons, Data Science for All!项目地址: https://gitcode.com/GitHub_Trending/da/Data-Science-For-Beginners

创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考

需要专业的网站建设服务?

联系我们获取免费的网站建设咨询和方案报价,让我们帮助您实现业务目标

立即咨询