1. 从一份日报说起:为什么我要做 AI 日报这件事
每天早上打开手机,AI 圈的信息就像开了闸的水龙头,公众号推文、技术社区热帖、开源项目更新、模型榜单变动、融资消息、监管动态……光是扫一遍标题就得花掉半小时,更别提逐条点进去看细节了。我做 AI 日报这个项目,最初的动机特别朴素:给自己省时间。后来发现身边不少同行也有同样的困扰,于是干脆把它做成了一套可以稳定运转的流程,每天固定时间产出一份结构化的 AI 日报。
这份 2026-09-29 的日报,是我连续更新的第 N 期。它不是什么大厂出品,也没有团队协作,就是一个人、一套脚本、几个固定信息源,加上一套自己摸索出来的筛选和编排逻辑。它能解决的问题很明确:把一天内 AI 领域真正值得关注的信息,压缩成一份 10 分钟内能读完的摘要,并且保证不遗漏关键事件、不被标题党带偏、不浪费时间在重复内容上。
适合谁来参考?三类人。第一类是想自己做信息聚合但不知道从哪下手的独立开发者;第二类是团队里被安排做技术周报、行业简报的同学,可以把日报思路平移到周报;第三类是对 AI 行业保持关注但没精力深挖的产品、运营、投资岗从业者,直接看成品就行。下面我把整套东西拆开讲,包括信息源怎么选、筛选逻辑怎么定、编排格式怎么设计、踩过哪些坑,全部是实操层面的东西。
2. 日报的整体设计与信息源选型
2.1 为什么是"日报"而不是"周报"或"实时流"
先说一个最容易被忽略的决策:更新频率。我试过实时流推送,也试过周报,最后锁定日报,原因有三个。
第一,AI 领域的信息半衰期很短。一个大模型发布、一个开源项目冲上热榜、一条重要政策落地,基本 24 小时内就会发酵完毕,等到周末再回顾,热度已经过去了,很多讨论上下文也找不到了。日报的节奏刚好卡在"信息已经沉淀但还没凉透"的窗口期。
第二,日报的心理负担低。周报容易拖,因为总觉得"还有几天可以补",结果堆到最后一天手忙脚乱。日报是强制性的每日闭环,今天的事今天清,反而更容易坚持。我自己的经验是,任何需要"攒着做"的信息整理项目,最后大概率会烂尾。
第三,日报天然适合结构化模板。每天的内容板块基本固定——模型动态、开源项目、行业新闻、论文精选、工具推荐,变的是内容,不变的是框架。这种稳定性让脚本自动化变得可行,也让我在状态不好的时候依然能保证基本质量。
提示:如果你刚开始做信息聚合,不要一上来就追求实时。实时流的维护成本极高,而且对筛选能力要求苛刻,很容易变成"什么都推"的噪音源。从日报起步,跑顺了再考虑提频。
2.2 信息源的取舍逻辑:少而精,宁缺毋滥
信息源的选择直接决定日报质量的上限。我前后试过大概四十多个源,最后稳定保留的只有十来个。筛选标准就三条:信噪比高、更新稳定、有独家价值。
具体分类是这样的:
| 信息源类型 | 代表渠道 | 保留理由 | 淘汰原因 |
|---|---|---|---|
| 官方博客 | 各大模型厂商、云厂商官方发布 | 一手信息,准确度高 | 更新频率低,需搭配其他源 |
| 开源社区 | 代码托管平台趋势榜、模型仓库 | 能发现早期项目 | 榜单噪音大,需二次筛选 |
| 技术社区 | 开发者论坛、问答社区热帖 | 有真实讨论和踩坑经验 | 水帖多,需按热度阈值过滤 |
| 行业媒体 | 垂直科技媒体、财经媒体 | 覆盖融资、并购、人事 | 标题党严重,需交叉验证 |
| 学术渠道 | 论文预印本平台、顶会收录 | 前沿方向风向标 | 数量爆炸,必须限量 |
| 社交平台 | 从业者聚集的讨论区 | 一手爆料、现场感强 | 真假混杂,只作线索不作结论 |
这里有个反直觉的经验:信息源不是越多越好。我早期贪多,接了三十多个源,结果每天光去重和判断优先级就耗掉两小时,而且大量内容重复——同一个模型发布,五个源都在报。后来砍到十来个,反而覆盖更全,因为每个源都有明确的"职责边界",不重叠。
还有一个细节:给每个源打信任分。官方源信任分最高,可以直接引用;社区源信任分中等,需要交叉验证;社交平台信任分最低,只能当线索。这个信任分在后续筛选环节会直接影响内容的处理方式。
2.3 日报的板块结构设计
一份日报的骨架决定了读者的阅读路径。我最终定下来的板块是这样的:
- 头条聚焦:当天最重要的一件事,通常 1 条,配 2-3 句点评
- 模型与产品动态:新模型发布、版本更新、能力变化,3-5 条
- 开源项目精选:值得关注的新项目或重大更新,2-4 条
- 行业与资本:融资、并购、合作、人事,2-3 条
- 论文速览:挑 1-2 篇有代表性的,一句话讲清楚贡献
- 工具与技巧:实用向的小工具或使用技巧,1-2 条
这个结构不是拍脑袋定的,是根据读者注意力曲线排的。头条放最重的,因为大家刚打开日报时注意力最集中;工具技巧放最后,因为这类内容轻松、可随时中断,适合收尾。中间几个板块按"硬信息在前、软信息在后"排列。
注意:板块数量不要超过 6 个。超过 6 个之后,读者会产生"这日报怎么这么长"的压迫感,打开率会明显下降。我试过 8 个板块的版本,数据反馈是完读率掉了将近三成。
3. 核心细节解析:筛选、去重与编排的实操要点
3.1 筛选逻辑:三道漏斗把噪音挡在门外
信息从"抓取"到"进日报",中间要过三道漏斗。这套逻辑是我踩了无数坑之后总结出来的,核心思想是逐层收紧,而不是一次性判断。
第一道漏斗:关键词初筛。抓取阶段用一组关键词做粗过滤,比如模型名称、技术术语、公司名、产品名。这一步的目的是把明显不相关的内容(比如纯广告、无关领域新闻)先扔掉。关键词表需要定期维护,因为 AI 领域新词层出不穷,上个月还没有的词这个月可能就火了。
第二道漏斗:热度与质量评分。对初筛后的内容打分,评分维度包括:来源信任分、讨论热度(评论数、转发数)、内容完整度(是否有实质信息而非标题党)、时效性。综合得分低于阈值的直接淘汰。这一步能过滤掉大量"看起来相关但没营养"的内容。
第三道漏斗:人工终审。前两道是脚本自动跑的,最后一道必须人工。原因很简单:机器判断不了"重要性"。一个开源项目 star 数很高,但可能只是营销刷的;一条新闻热度一般,但可能是某个重要趋势的起点。人工终审就是做这个价值判断,通常花 15-20 分钟。
三道漏斗跑下来,每天从几百条原始信息里最终留下 10-15 条进日报,淘汰率大概 95%。这个比例听起来夸张,但实际跑起来你会发现,真正值得读的确实就这么点。
3.2 去重:同一件事只讲一遍
去重是日报质量的关键。同一件事被多个源报道,如果不去重,日报就会变成"复读机"。我的去重策略分两层:
第一层是标题相似度匹配。用简单的文本相似度算法,把标题高度相似的内容聚成一簇。这一步能解决大部分"同一新闻多源报道"的问题。
第二层是事件级去重。有些内容标题不一样,但讲的是同一件事。比如"某模型发布新版本"和"某公司更新旗舰模型能力",其实是同一件事。这一层需要靠实体识别——提取内容里的核心实体(公司、产品、人物、事件),实体重合度高的归为一簇。
去重之后,每一簇只保留信息最全的那一条作为主条目,其他源作为补充引用。这样既保证了信息完整,又避免了重复。
实操心得:去重阈值不要设得太激进。我早期把相似度阈值调得很高,结果把"某模型发布"和"某模型开源"这种其实是两件事的内容合并了,闹过笑话。后来把阈值调低,宁可少合并也不要错合并,人工终审时再补一刀。
3.3 编排:让日报读起来像"人写的"
脚本生成的日报容易有一个毛病:信息堆砌,没有节奏。每条都是"标题 + 摘要 + 链接"的三段式,读起来像机器人在念清单。我在编排上做了几个调整,让日报更像人写的。
第一,头条要有观点。头条不只是复述新闻,还要加 2-3 句点评,说清楚"这件事为什么重要""对谁有影响"。这个点评是我自己写的,也是日报里最有价值的部分——信息谁都能聚合,判断力才是稀缺的。
第二,条目之间要有过渡。同一板块内的条目,按重要性或逻辑关系排序,必要时加一句串联的话。比如"除了上面提到的模型更新,今天还有两个开源项目值得一看",这种过渡句能让阅读更顺。
第三,控制单条长度。每条摘要控制在 80-120 字,超过就砍。读者的耐心有限,一条超过 150 字就会开始跳读。宁可少说,不要啰嗦。
第四,链接放在最后。每条末尾附原文链接,但不要放在开头。开头放链接会让读者分心,先看完摘要再决定要不要点进去,体验更好。
3.4 格式与排版:Markdown 是性价比最高的选择
日报的载体我试过好几种:邮件、网页、PDF、Markdown 文档。最后锁定 Markdown,理由是通用性最强。Markdown 可以一键转成网页、PDF、邮件正文,也可以直接贴到各种协作工具里,不挑平台。
排版上有几个固定规则:
- 板块标题用二级标题,条目用无序列表
- 关键术语加粗,方便扫读
- 每条末尾用引用块或斜体标注来源
- 全文控制在 2000-3000 字,超过就说明筛选没做到位
注意:不要用花哨的排版元素。我试过加表格、加代码块、加各种符号,结果发现读者根本不看,反而增加了视觉负担。日报的核心是信息密度,不是设计感。
4. 实操过程:从抓取到发布的完整流程
4.1 抓取环节:稳定比快更重要
抓取是整个流程的起点,也是最容易出问题的环节。我的原则是稳定优先,速度其次。具体做法:
第一,错峰抓取。不要所有源同时抓,容易触发限流。我把源分成几组,每组间隔几分钟,分散在凌晨到早上的时间段。这样既避免了限流,也保证了早上出日报时数据已经齐了。
第二,失败重试。任何抓取都可能失败,网络抖动、源站维护、格式变化都会导致失败。我设置了三次重试,间隔递增。三次都失败就跳过,记录日志,人工检查。
第三,原始数据落盘。抓到的原始内容先存下来,不要直接进处理流程。这样万一后续处理出错,可以回溯原始数据,不用重新抓。这个习惯帮我省了很多事。
抓取工具的选择上,我用的是最基础的 HTTP 请求加解析库,没有上重型框架。原因是维护成本——重型框架功能多但配置复杂,出问题排查困难。基础工具虽然要自己写解析逻辑,但可控性强,出问题一眼就能定位。
4.2 处理环节:清洗、打分、去重
抓到的原始数据是脏的,需要清洗。清洗包括:去 HTML 标签、去广告文本、去重复段落、统一编码。这一步看起来简单,但细节很多。比如有些源站的正文里混着推荐阅读、相关链接,这些都要识别出来去掉。
清洗之后是打分。打分公式大概是这样:
总分 = 来源信任分 × 0.3 + 热度分 × 0.3 + 完整度分 × 0.2 + 时效分 × 0.2权重是我根据实际效果调的。来源信任分权重最高,因为一手信息最可靠;热度分次之,反映关注度;完整度和时效分作为辅助。这个公式不完美,但够用,而且容易调整。
去重前面讲过了,这里补充一个细节:去重要在打分之后做。因为同一件事的多个报道里,要保留分数最高的那条作为主条目。如果先去重再打分,可能会把高质量的那条误删。
4.3 人工终审:15 分钟决定日报质量
人工终审是整套流程里唯一不能自动化的环节,也是决定日报质量的关键。我的终审流程是这样的:
第一步,扫头条候选。从打分最高的几条里挑头条,判断标准是"影响面"——这件事影响多少人、影响多深、是不是趋势性事件。
第二步,过一遍各板块。每个板块快速扫一遍,删掉明显不行的,补上遗漏的。这一步靠的是对行业的熟悉度,没有捷径。
第三步,写点评。给头条和重要条目写点评,这是最花时间但也最值钱的部分。点评要短,2-3 句,说清楚"是什么"和"为什么重要"。
第四步,通读一遍。从头到尾读一遍,检查错别字、逻辑不通、重复内容。这一步经常能发现脚本没抓出来的问题。
15 分钟是熟练之后的时长,刚开始做的时候可能要 40 分钟以上。随着对信息源的熟悉和判断标准的固化,速度会越来越快。
4.4 发布与归档:让日报可检索
日报发布之后不是就完了,还要归档。归档的目的是可检索——过一段时间想找某条信息,能快速定位到是哪天的日报。
我的归档方式是:按日期命名文件,同时维护一个索引文件,记录每天的日报里有哪些关键条目。索引文件用简单的文本格式,方便搜索。这样即使过了几个月,想找某个模型发布的信息,搜一下索引就能定位到具体日期。
发布渠道上,我主要用文档协作工具和邮件。文档协作工具方便分享和评论,邮件方便订阅。两个渠道的内容是一样的,只是格式略有调整。
5. 常见问题与排查技巧实录
5.1 抓取失败怎么办
抓取失败是最常见的问题,原因五花八门。我整理了一个排查表:
| 现象 | 可能原因 | 排查方法 | 解决方式 |
|---|---|---|---|
| 全部源失败 | 网络问题或脚本崩溃 | 检查网络、看日志 | 重启脚本,检查网络 |
| 单个源失败 | 源站维护或改版 | 手动访问源站 | 临时跳过,改版则更新解析规则 |
| 部分内容缺失 | 解析规则失效 | 对比原始数据和解析结果 | 更新解析规则 |
| 抓取变慢 | 源站限流 | 看响应时间 | 降低频率,错峰抓取 |
这里有个经验:源站改版是常态。不要指望一套解析规则用一年,能稳定用三个月就不错了。所以解析规则要写得模块化,改版时只改对应模块,不要牵一发动全身。
5.2 日报内容重复或遗漏
重复和遗漏是筛选环节的典型问题。重复的原因通常是去重没做好,遗漏的原因通常是关键词表没覆盖到。
解决重复:检查去重阈值,看是不是设得太高导致该合并的没合并。同时检查实体识别是否准确,有些内容实体提取错了,导致去重失效。
解决遗漏:定期回顾关键词表,把新出现的术语加进去。另外,人工终审时要主动想"今天有没有什么大事没进日报",靠记忆和直觉补漏。
实操心得:我每周会花 10 分钟做一次"漏报复盘",把这一周错过的重大事件找出来,分析是哪个环节漏的。坚持了几个月之后,漏报率明显下降。
5.3 坚持不下去怎么办
这是最现实的问题。信息聚合项目最大的敌人不是技术难度,是持续性。我见过太多人做了两周就放弃了。我的应对方法有三个:
第一,降低单日成本。把流程尽量自动化,人工环节压缩到 15 分钟以内。成本越低,越容易坚持。
第二,允许"简版"。状态不好的时候,出简版日报,只保留头条和最重要的几条。宁可出简版,不要断更。断更一次就会有第二次。
第三,找到反馈。有人看、有人反馈,是坚持下去的最大动力。我早期把日报发给几个朋友,他们的反馈让我知道这件事有价值,才撑过了最难的起步期。
5.4 质量波动的控制
日报质量会有波动,状态好时点评精彩,状态差时就是干巴巴的复述。控制质量波动的方法:
- 建立模板:固定板块、固定格式,减少临时决策
- 设定底线:比如头条必须有点评,每条摘要不超过 120 字,这些底线不能破
- 定期回顾:每周挑一天回顾本周日报,看哪些做得好、哪些做得差,持续优化
质量波动的根源往往是输入质量波动——某天信息源本身就没啥好东西,日报自然平淡。这种情况要接受,不要硬凑。宁可日报短一点,也不要为了凑数塞垃圾信息。
6. 工具选型与自动化程度的权衡
6.1 自建脚本 vs 现成工具
做信息聚合,第一个决策就是自建还是用现成工具。我两个都试过,最后选了自建脚本为主、现成工具为辅。
现成工具的优势是上手快,配置几个源就能跑。但劣势也很明显:定制化程度低。筛选逻辑、去重规则、排版格式都是固定的,想改很难。而且很多工具是订阅制,长期成本不低。
自建脚本的优势是完全可控。筛选逻辑想怎么调就怎么调,排版想怎么改就怎么改。劣势是前期投入大,要写代码、要维护。但从长期看,自建的成本更低,因为一次投入、长期使用。
我的建议是:先用现成工具跑通流程,验证需求,再决定要不要自建。如果只是临时用用,现成工具够了;如果打算长期做,自建更划算。
6.2 自动化程度的把握
自动化程度不是越高越好。我的原则是:能自动化的自动化,不能自动化的不要硬自动化。
能自动化的:抓取、清洗、打分、去重、排版。这些环节规则明确,脚本能做得比人好。
不能自动化的:价值判断、点评撰写、终审。这些环节需要人的判断力,硬自动化只会降低质量。
我见过有人试图用大模型全自动生成日报,结果出来的东西看着像模像样,但仔细一看全是正确的废话,没有观点、没有判断、没有价值。信息聚合的核心价值在于筛选和判断,不在于搬运。搬运可以自动化,判断不行。
6.3 成本核算:时间都花在哪了
做日报的时间成本,我算过一笔账:
| 环节 | 自动化程度 | 每日耗时 |
|---|---|---|
| 抓取 | 全自动 | 0(后台跑) |
| 清洗打分去重 | 全自动 | 0(后台跑) |
| 人工终审 | 手动 | 15 分钟 |
| 点评撰写 | 手动 | 10 分钟 |
| 排版发布 | 半自动 | 5 分钟 |
| 归档 | 全自动 | 0 |
总计每天 30 分钟左右。这个成本是可以接受的,关键是把时间花在刀刃上——终审和点评是价值最高的环节,其他环节尽量自动化。
提示:如果你的日报每天要花超过 1 小时,说明自动化没做到位,或者筛选标准太松导致信息量过大。先优化流程,再考虑坚持。
7. 内容价值的延伸:日报之外还能做什么
7.1 从日报到周报、月报
日报跑顺之后,可以自然延伸出周报和月报。周报是把一周的日报做二次聚合,提炼出趋势和主线;月报是更高维度的总结,看整个月的走向。
这个延伸的价值在于不同时间尺度的洞察。日报看单点,周报看趋势,月报看格局。三个尺度结合起来,对行业的理解会立体很多。
做周报的方法很简单:把一周的日报条目汇总,按主题聚类,找出重复出现的主题和趋势。月报同理,只是聚合周期更长。
7.2 从信息聚合到知识库
日报积累久了,就是一个天然的知识库。每条日报都是一个信息点,时间长了这些点会连成线、织成网。
我的做法是:定期把日报里的重要条目抽出来,按主题归档。比如"模型发布"一个文件夹,"开源项目"一个文件夹,"行业动态"一个文件夹。这样过一段时间回头看,能清晰看到某个方向的发展脉络。
这个知识库的价值在于可追溯。想了解某个技术方向的演进,翻一翻归档就能看到完整的时间线,比临时搜索高效得多。
7.3 从个人使用到团队共享
日报最初是给自己用的,后来发现团队里也有需求,就扩展成了团队共享。团队共享和个人的区别在于:
- 内容侧重不同:个人关注自己感兴趣的,团队关注与业务相关的
- 格式要求不同:团队共享需要更规范,方便不同角色阅读
- 反馈机制不同:团队共享有评论和讨论,能形成信息闭环
团队共享的日报,我建议增加一个"与我们的关系"板块,说明每条信息对团队业务的影响。这个板块是团队日报区别于个人日报的核心价值。
8. 我踩过的坑与最后的经验
做 AI 日报这段时间,踩的坑不少,挑几个最有代表性的说说。
第一个坑:贪多求全。早期想把所有信息都覆盖,结果日报越做越长,自己累,读者也累。后来明白,日报的价值在于筛选,不在于覆盖。宁可漏掉一些,也要保证留下的都是精品。
第二个坑:过度自动化。试过全自动生成,结果质量惨不忍睹。后来明白,判断力是人的核心价值,不能交给机器。自动化应该用在重复劳动上,不是用在价值判断上。
第三个坑:忽视反馈。早期闷头做,不看读者反馈,结果做了很多无用功。后来开始收集反馈,才发现读者真正关心的是什么。做内容一定要有反馈闭环,否则就是自嗨。
第四个坑:追求完美。早期每条都要精雕细琢,结果每天花两小时,坚持不下去。后来接受"完成比完美重要",先保证每天出,再慢慢优化质量。持续性比单次质量更重要。
最后分享一个我觉得最有用的经验:把日报当成一个产品来做,而不是一个任务。任务是做完就完了,产品是要持续迭代的。用做产品的心态做日报,你会主动去想怎么优化、怎么提升价值、怎么让读者更满意。这个心态的转变,是我能坚持下来的根本原因。
至于 2026-09-29 这一期日报本身,它记录的只是那一天 AI 圈的切片。但做日报这件事,记录的是我对这个行业持续的关注和理解。信息会过时,但筛选信息的能力和判断力,是会一直积累的。