- AI 技能
- 深度研究
- 网页爬虫
【免费下载链接】last30days-skill-cn
last30days-cn 是一个 AI Agent 技能(Skill),能够自动搜索中国互联网 8 大主流平台最近 30 天的内容,综合分析后生成有据可查的研究报告。
last30days-skill-cn 是一款面向中文互联网的 AI Agent 爬虫技能,能让 AI Agent 自动搜索微博、小红书、B站、知乎等 8 大平台最近 30 天的内容,综合打分后生成有据可查的研究报告。但它比"能爬"更重要的能力,是懂合规:你的登录 Cookie 会被锁死在本地私有文件里,API 密钥一旦权限过宽就会主动警告,请求被限流(429)时会老老实实退避,而不是硬闯。本文带你看完它的 4 条法律边界和 3 层凭据保护机制。
一、先看这张图:last30days-skill-cn 研究的是哪些平台
它聚合微博、小红书、B站、知乎、抖音、微信公众号、百度、今日头条的公开数据与登录态数据,按"相关性 + 时效 + 互动"打分排序。所有数据路径都设计为"API → 登录态 → 公开接口 → 公开搜索"逐级降级——拿不到就如实标注,绝不越权硬爬。
二、爬虫的 4 条合规红线,新手最容易踩中
对照 README.md 免责声明 与《网络安全法》《数据安全法》《个人信息保护法》,国内爬虫的法律边界可以浓缩成 4 条:
| # | 红线 | 典型后果 |
|---|---|---|
| 1 | 高频大规模抓取,干扰平台正常运营 | 违反《反不正当竞争法》,账号封禁甚至民事索赔 |
| 2 | 绕过登录墙、破解加密签名 | 可能触及《刑法》第 285 条(非法获取计算机信息系统数据) |
| 3 | 收集、存储、传播他人个人信息 | 违反《个人信息保护法》 |
| 4 | 数据倒卖或对外提供采集服务 | 商业牟利,责任加倍 |
last30days-skill-cn 的合规设计基本就是围绕这 4 条红线的"防御性工程"。
三、Cookie 保护:登录态文件只对你一个人可读
Cookie 相当于你的账号密码,一旦泄露,别人可以直接登录你的微博和知乎。这个项目做了 3 件事:
- 本地私有目录:所有扫码登录的会话统一存放在
~/.config/last30days-cn/browser_cookies/,每个平台一个独立 JSON 文件,不出本地。 - 强制 0600 权限:写入前通过临时文件落盘并执行
os.chmod(tmp, 0o600),保证只有当前用户可读,同机其他用户、备份工具都读不到。见_write_private。 - 浏览器模式驱动真实浏览器:复用你本人已登录的会话,由页面自己发出请求,不涉及逆向加密算法或破解安全机制——这本身就避开了"破解技术措施"的高危行为。
💡 无图形界面的服务器上,也可以手动导入 Cookie:
python scripts/last30days.py login zhihu --cookie "...",写入后同样享受 0600 保护。
四、API 密钥保护:配置读一次,就查一次权限
各平台的 API Key(如TIKHUB_API_KEY、BAIDU_API_KEY)写在配置文件中,加载逻辑集中在 env.py:
- 权限体检:每次读取
.env都会调用_check_file_permissions。只要文件对其他用户可读(检测到0o044位),就会立即在终端打印警告并提示执行chmod 600修复——密钥权限过宽,你第一时间就会知道。 - 三级隔离:优先级为"进程环境变量 > 项目级
.claude/last30days-cn.env> 全局~/.config/last30days-cn/.env",避免把密钥误提交进代码仓库。 - 运行时开关与密钥分离:
EXCLUDE_SOURCES、LAST30DAYS_DISABLE_BROWSER这类非敏感开关与密钥分开管理,配置文件模板里密钥项默认留空(见 setup 生成的配置说明)。
五、请求行为合规:把"礼貌"写进 HTTP 层
爬虫被追责的案例里,"高频请求导致平台服务异常"是最常见罪名。last30days-skill-cn 的 http.py 在传输层内置了 3 道保险:
- 尊重 429 限流:收到 HTTP 429 时读取
Retry-After头并等待指定时长后才重试,而不是立即打回去; - 指数退避:其他网络错误按递增延迟重试,上限封顶,杜绝死循环轰炸;
- 并发与频率约束:浏览器默认并发为 2,弱机可设
LAST30DAYS_BROWSER_CONCURRENCY=1;官方明确建议每次搜索间隔 ≥ 5 秒。
另外,各平台有独立超时,一个平台卡住不会拖累其他平台;登录墙平台拿不到数据时,降级为"热榜匹配 + 公开搜索",并在报告里注明"只有公开链接,缺少互动数据"——它选择"少数据"而不是"硬破解",这正是对第 2 条红线的尊重。
六、使用清单:3 步确认你处于安全区
- ✅ 只用于学习和研究,不做商业采集、不对外提供数据服务(README.md 明确禁止);
- ✅ 检查密钥文件权限:
chmod 600 ~/.config/last30days-cn/.env,运行python scripts/last30days.py --diagnose可随时体检各平台可用状态与修复方法; - ✅ 遵守各平台服务条款与 robots.txt,控制频率,不采集、不传播他人个人隐私信息。
把凭据锁在本地、把频率压在礼貌区间、把越权行为设计成"不可用"——这 3 个工程决策,就是 last30days-skill-cn 守住法律边界的方式。想深入了解它的检索流水线与打分机制,可以阅读 SPEC.md 和 SKILL.md。
- AI 技能
- 深度研究
- 网页爬虫
【免费下载链接】last30days-skill-cn
last30days-cn 是一个 AI Agent 技能(Skill),能够自动搜索中国互联网 8 大主流平台最近 30 天的内容,综合分析后生成有据可查的研究报告。
创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考