抖音主页备份到本地,一次到位:用 douyin-downloader 建立自己的内容存档
【免费下载链接】douyin-downloaderA practical Douyin downloader for both single-item and profile batch downloads, with progress display, retries, SQLite deduplication, and browser fallback support. 抖音批量下载工具,去水印,支持视频、图集、合集、音乐(原声)。项目地址: https://gitcode.com/GitHub_Trending/do/douyin-downloader
把别人主页上的内容只留在链接里,等于把书存在别人家的书架上。我给自己立了条规矩:看重的内容,必须做一次抖音批量下载,把主页备份到本地硬盘——链接哪天失效,书还在我手里。这套流程靠开源项目 douyin-downloader 实现:它是个本地运行的抖音批量下载工具,视频、图集、合集、音乐都能带走,还自带进度展示、失败重试和 SQLite 去重。
准备工作:依赖安装与 Cookie 自动获取
开始之前,只办两件事。
装好依赖。需要 Python 3.8 以上。克隆仓库后执行
pip install -r requirements.txt,国内网络慢就给 pip 挂个镜像源。git clone https://gitcode.com/GitHub_Trending/do/douyin-downloader cd douyin-downloader pip install -r requirements.txt后面还想用浏览器兜底,就再补两步:
pip install playwright,然后python -m playwright install chromium。让工具替你拿 Cookie。抖音不少接口要登录态,Cookie 就是一张限时"代读授权"——你授权它一次,它替你翻书。不必手拼字段:
python -m tools.cookie_fetcher --config config.yml终端会弹出一个浏览器窗口,扫码登录一次,回到终端按 Enter,Cookie 自动写回 config.yml,全程五分钟。Cookie 有有效期,哪天下载大面积提示"需要登录",重跑这条命令就行(实现在 tools/cookie_fetcher.py)。
首次全量配置:只动 4 个键
搬家之前,先量好家具再拆箱。把仓库里的config.example.yml复制一份改名config.yml,只需动四处:
- link:填入博主主页链接,形如
https://www.douyin.com/user/xxxxx; - mode: [post]:锁定作品列表这一栏,
like(点赞)、mix(合集)、music(音乐)也可以按需加进去; - number.post:这一栏要下多少条。
0表示全量,首跑建议先填2试水——确认保存路径和命名都符合预期,再放开成0,免得一次把磁盘吃满; - thread / retry_times / database:并发设
5、重试设3、数据库记史设true,三者是稳妥的起步组合。
验证运行:
python run.py -c config.yml不想改配置文件,也可以python run.py -u "主页链接"临时追加一条链接。跑完后打开保存目录,结构长这样:
Downloaded/ └── user_作者名/ └── post/ └── 2024-12-30 19.37.12_标题/ ├── 视频.mp4 ├── 封面.jpg ├── 音乐.mp3 └── data.json在文件管理器切平铺视图,一排作品缩略图就是整个主页的快照。另外提一句:不想碰命令行的话,同一套后端还做了个桌面应用 Douzy,任务状态、失败重试都有图形界面(README 里有说明)。
让存档自己长:增量开关与无人值守
同一份配置跑两次,结果可以天差地别。
- 不打开 increase.post 和 database:每次运行都从头重扫、把下过的内容再拉一遍,磁盘和流量被反复消费,越存越乱;
- 两个都打开,thread 维持
5、retry_times 设3:重跑时工具翻过已保存的作品就划掉,偶发超时交给自动重试,重复运行变成一次廉价的巡检。
想完全不管它,给 Linux 的 crontab 挂一行就行:
0 4 * * * cd /path/to/douyin-downloader && python run.py配合increase.post: true,博主当天新发的作品会在半夜自动补进库。只想收某个时间段的内容?start_time/end_time(YYYY-MM-DD格式)可以限定范围,不必把博主的全部历史都搬回来。
出问题时,先查这三处
批量任务闹脾气,九成是下面三种之一。
如果大批量失败、报错都在喊"登录",多半是 Cookie 过期了。别手改字段,重跑一次python -m tools.cookie_fetcher --config config.yml刷新即可。
如果只下了几条就停,先翻自己的配置:number.post是不是限制了数量?确认它设了0再跑一次;若 API 分页被抖音卡住,把浏览器兜底策略打开(browser_fallback段,默认已开启),它会启动真实浏览器接着翻页。
如果重跑又在重复下载,通常是database没开,或者中途挪过保存目录。保持database: true,path定下来就别动,本地账本才记得住哪些条目已经收过。
顺带一提:全量 + 音乐 + 封面 + 元数据全开时体积涨得很快,磁盘吃紧就用时间窗或调小number收窄单次任务的口径。
最后提醒:下载到的内容请只用于个人学习、研究与备份,尊重内容创作者的权益,不商用、不侵权。
【免费下载链接】douyin-downloaderA practical Douyin downloader for both single-item and profile batch downloads, with progress display, retries, SQLite deduplication, and browser fallback support. 抖音批量下载工具,去水印,支持视频、图集、合集、音乐(原声)。项目地址: https://gitcode.com/GitHub_Trending/do/douyin-downloader
创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考