免费公开数据集大全:Awesome Public Datasets 的 978 个数据源怎么用
【免费下载链接】awesome-public-datasetsA topic-centric list of HQ open datasets.项目地址: https://gitcode.com/GitHub_Trending/aw/awesome-public-datasets
Awesome Public Datasets 是一份按主题组织的免费公开数据集大全:35 个领域、978 条数据源,每条都标注了当前可用性,列表由工具自动更新。它解决的问题很简单——你不需要再到处搜"哪里有 XX 数据",按领域翻一遍 README 就能定位到带说明的数据入口。适合刚开始做数据分析的学生、找公开样本的研究者,以及需要演示数据练手的开发者。
清单里装了什么
- 数据按主题分成 35 类,从 Agriculture、Biology、Climate+Weather 到 Finance、Transportation,全部索引在 README.rst 里。
- 每条数据源一行:名称、一句话说明、数据入口链接,外加一个 Meta 配置文件链接。
- 整个列表由 apd-core 工具自动生成,README 本身不接受手工修改,条目因此能持续保鲜。
- 项目孵化于上海交通大学 OMNILab,许可证为 MIT(见 LICENSE)。
- 绝大多数数据源免费,少数不是,原文在开头单独提示过这一点。
先手练:仓库自带的泰坦尼克号数据
- Datasets/ 目录下有一个 titanic.csv.zip(约 22KB),解压即可用。
- 它适合走第一遍完整流程:查看乘客字段、统计整体生还率、按船舱等级分组对比。
- 同一份数据在清单的 SocialSciences 分类里也有登记(Titanic Survival Data Set),可以对照条目确认数据来源与出处。
按主题找数据,看三个例子
- 要气象数据:Climate+Weather 分类下有 NOAA 的长期气候观测,以及 Open-Meteo 这个免费的历史与预报天气 API。
- 要网络数据:ComputerNetworks 分类收录了印第安纳大学 10 万用户的 535 亿次网页点击记录,以及 CAIDA 的互联网结构与流量数据。
- 要生物医学数据:Biology 分类下有 1000 Genomes 项目、帕尔默企鹅形态测量数据(偏教学向)、Broad 研究所的 CCLE 癌症细胞系数据。
- 用法就一种:在 README 里定位分类标题,顺着条目往下读,找到说明和你需求匹配的那一条。
对勾和扳手:怎么判断数据源可用
- 每条数据源前面有一个状态图标:✅ 表示 "I am well",可直接使用;🔧 表示 "Please fix me",链接或内容可能已失效,需要修复。
- 当前清单中 ✅ 共 752 条,🔧 共 226 条,可用比例超过七成。
- 挑数据时优先看 ✅ 条目;确需要某条 🔧 数据时,先手动验证其链接是否还能打开。
拿到数据后的两步检查
- 查许可:清单里多数数据免费,但部分带有使用限制,引用或商用前先读数据提供方页面的条款。
- 查入口形式:有的条目是 CSV/JSON 直接下载,有的是 FTP 仓库,有的平台本身是 API(如 Open-Meteo),拿到后第一步是确认数据怎么落地到本地。
把清单同步到本地
列表通过 apd-core 自动更新,本地仓库拉一次就能得到最新版本:
git clone https://gitcode.com/GitHub_Trending/aw/awesome-public-datasets- 之后定期
git pull即可,不需要也不应该手工改 README。 - 想给清单新增数据源,走项目的贡献流程提交配置文件,由工具重新生成页面。
下一步做什么
- 打开 README.rst 的目录,挑一个和你工作最相关的分类,先取 1 到 2 个 ✅ 标记的数据集试跑一遍。
- 第一次操作就用自带的 Datasets/titanic.csv.zip 走通下载、解析、统计的完整链路,再换目标数据集。
【免费下载链接】awesome-public-datasetsA topic-centric list of HQ open datasets.项目地址: https://gitcode.com/GitHub_Trending/aw/awesome-public-datasets
创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考