先说个背景:我研究AIHOT这个产品有一阵子了。对外看,它就是一个每天更新AI行业情报、聚合热点资讯的站点,月活过了百万。但把它的内容节奏、数据流转和信息组织方式掰开揉碎之后,我看到的其实是另一套东西——一条"会自己出版"的行业情报流水线。从信源抓取、内容加工到发布分发,几乎所有环节都在以自动化的方式运转。这篇文章就是我对这套流水线的完整拆解,包括它的架构逻辑、核心环节、落地参数,以及我自己尝试复刻时踩过的坑。想自己做情报站、内容聚合工具,或者单纯好奇百万月活产品内部结构的朋友,这篇应该对你有用。
1. AIHOT的定位与情报流水线的整体构想
1.1 百万月活背后的产品逻辑
先说一个关键问题:一个行业情报类的产品,凭什么做到百万月活?
我拆解AIHOT之后有个很明确的感觉:它本质上不是在"做内容",而是在"做信息分发效率"。传统的科技媒体靠编辑团队选题、写稿、发布,人力成本高,更新频率有限。而AIHOT走的路径完全不同——它把"从海量信源里筛选高价值信息"这件事,用一套自动化流水线替代了人工操作。
这套流水线的核心逻辑可以概括为四个字:"出版自动化"。具体来说,它持续监控全网AI相关的内容源(比如技术博客、论文预印本、开源社区、行业资讯站点、社交媒体讨论),用算法筛掉低质量内容,再通过大模型对剩余内容做摘要、提炼和重写,最后按固定的时间节奏批量发布。从用户视角看,它像是一个每天准时更新的AI情报专栏;从系统视角看,它是一条从数据采集到内容上线的全自动通道。
百万月活的达成,很大程度上就是因为这种模式让内容供给成本趋近于零。传统编辑部一天产出几十篇深度内容已经算高产,而一条自动化流水线一天可以轻松处理和发布上百条信息,且全年无休。用户不需要盯着几十个不同的网站去跟踪AI领域的新动态,一个AIHOT就够了。这种"信息聚合+自动筛选+定时出版"的模式,其实解决了一个很具体的痛点:AI行业的信息密度太高、更新太快,人工根本盯不过来。
1.2 从人工整理到自动流水线的必然演进
如果只是把RSS阅读器套个壳,AIHOT也做不大。它真正厉害的地方,是把"情报生产"这件事拆成了可以独立优化、独立规模化的一系列工序。
我模拟过传统人工做情报汇总的流程:早上花两小时刷几十个网站,挑出有价值的消息,写摘要,排版,发布。一个人一天最多做一到两期,而且质量和当天状态强相关。AIHOT的做法相当于把整个流程"工程化"了:每一个环节都变成模块,每个模块都可以单独考核效果。
有一点我觉得很有意思:AIHOT并没有走"完全无人参与"的极端路线,而是把人工放在了"规则制定者"和"异常处理者"的位置上。它先靠算法处理绝大多数常规信息流,同时保留了人工对内容质量的监督和干预入口。这个设计和很多一上来就追求全自动的内容产品不一样,后者往往因为内容质量问题导致用户流失,而AIHOT在自动化和质量兜底之间做了相对均衡的取舍。
拆解这个产品时,我最大的收获其实是看清了一个趋势:未来行业情报的竞争,拼的不再是谁的编辑团队更勤奋,而是谁的数据管道更高效、算法筛选更精准、内容生成的质量更稳定。AIHOT只是这个趋势下的一个样本,但它的架构方式确实值得想清楚再做。
2. 情报流水线的四大核心环节
2.1 情报采集层:多源数据的汇聚与去重
一条情报流水线的起点,一定是数据采集。AIHOT在这块的设计并不复杂,但细节很讲究。
先说信源配置。我根据AIHOT公开披露的信息和搜索结果推断,它的信源覆盖大致分成几类:一是权威行业媒体和垂直资讯站;二是懂技术的人都在关注的学术平台(比如论文预印本网站);三是开源社区和代码托管平台的热门项目;四是社交平台上的话题热榜和讨论。这四类信源的价值各有侧重:行业媒体提供的是经过一定筛选的成熟信息,学术平台提供的是前沿技术信号,开源社区反映的是工程落地的真实热度,社交平台则捕捉的是圈内正在讨论的潜在热点。
多源采集听起来不难,真正难的是去重和权重分配。同一则新闻可能同时出现在行业媒体、社交平台和聚合网站上,如果不处理,用户就会在同一天看到好几条内容完全相同的条目,体验会明显下降。我推测AIHOT的去重逻辑是这样的:先对标题和正文做文本归一化处理(去掉标点差异、统一简繁体、忽略空格),再计算语义相似度,只有相似度低于阈值的才作为新内容进入处理流程。这个阈值通常在0.7到0.85之间,调得太低会重复推送,调得太高又会漏掉一些改写幅度较大的转载内容。
权重分配是另一个值得关注的细节。不同信源的权威性和时效性不一样,如果一律平等对待,很容易被大量低质量SEO内容淹没。合理的做法是给每个信源设定一个基础权重,再根据历史数据的表现动态调整。比如某个技术社区的内容转载率高、用户阅读完成率高,就提高它的权重;某个站点虽然有更新但打开率很低,就降低权重甚至移出信源列表。这种动态调整机制,是AIHOT的采集层能够持续保持高质量的关键之一。
2.2 智能加工层:大模型驱动的内容重写与结构化
采集到的原始内容不能直接发布,否则就只是爬虫站点,没有增值。AIHOT的价值增量,主要发生在"智能加工"这一层。
加工层做的事情可以拆成四步:清洗、提炼、改写、结构化管理。
清洗阶段处理的是采集层送来的原始文本。网页自带的导航栏、广告、页脚版权信息要剔除,乱码和特殊字符要修复,正文过短(比如只有一句话)的内容需要标记为低质量。这些都是比较常规的文本预处理操作。提炼阶段是整个加工层的高价值环节,它通过大模型对文章核心信息做压缩,生成一段150到300字的摘要,同时自动打上分类标签(模型相关、框架更新、产业动态、学术突破等等)和实体标签(公司名、模型名、人名等)。
改写阶段决定了内容的原创度。AIHOT不是简单抓取文章标题然后原样发布,而是会基于原文信息重新组织语言,生成一篇新的短讯。这么做有几个好处:一是形成差异化内容,避免和源网页完全重复;二是可以统一全站的语言风格,让用户感觉是同一个"编辑"在写稿;三是能根据站点的目标受众调整信息侧重点——同一则技术新闻,面向开发者和面向投资人的写法显然应该是不同的。
结构化管理的意义在于让数据可以被复用好多次。同样一条信息,加工完成后会被拆成结构化字段:标题、摘要、分类、标签、原文链接、发布时间、重要度分数等等。这些字段进入数据库之后,既可以直接渲染成Web页面,也可以被推送到邮件、小程序、RSS,甚至喂给下游的推荐系统做个性化分发。可以说,加工层决定了流水线的上限,而结构化程度决定了这个上限能有多高。
2.3 自动出版层:模板渲染与多渠道分发
有了加工好的结构化内容,剩下的问题就是"怎么发出去"。AIHOT在这儿的做法是彻底模板化、自动化,这也是我称它"会自己出版"的直接原因。
自动出版层做的事情可以理解为一个"多目的地分发系统"。统一的内容数据进入发布队列之后,系统会根据每个渠道的特性选择不同的渲染模板。对于Web页面,可能要保留相对完整的排版和链接;对于邮件简报,要注重开头摘要的吸引力并控制总长度;对于社媒账号,要压缩成更短更口语化的形态并在文中带上话题标签。
发布时间的选择也有讲究。我拆解过AIHOT的发布规律,发现它的更新时间节奏和AI从业者的作息高度吻合:工作日早上有早报汇总,下午有热点速递,晚间还有当天的重点内容总结。这种"定时反复触达"的策略,本质上是用内容节奏培养用户的使用习惯——到了那个时间点,用户自然会产生"去看看AIHOT今天更新了什么"的预期。
自动出版还有一个容易忽略的价值:它让整个系统具备了"规模化分发"的能力。人工维护时代,一个编辑能维护两三个渠道已是极限;而在自动出版架构下,每新增一个发布渠道只是增加一套模板和API对接而已,边际成本极低。这意味着产品可以很轻松地覆盖Web、邮件、社媒矩阵、聚合平台等多个触手,从一个"网站"变成一个"内容分发网络"。
2.4 数据反馈层:用户行为回流与选题优化
一条真正成熟的流水线,必须有反馈闭环。AIHOT能做到百万月活,靠的不仅仅是内容好,更关键的是它知道用户想看什么,然后不断调整内容供给。
数据反馈层会持续收集三类信息:内容表现数据(曝光量、点击率、阅读完成率、分享次数)、用户行为数据(关注了哪些分类、常读哪些标签、跳过哪些主题)以及渠道效果数据(哪个渠道来的用户留存最高、哪个渠道适合发什么类型的内容)。
这些数据回流之后,会在两个层面起作用。第一个层面是即时调整:某类内容点击率异常低,就降低这类内容的权重或者减少推送频次;某个信源连续几天贡献的内容都不受欢迎,就下调它的采集优先级。第二个层面是周期优化:每周或每月统计一次热门话题分布,用数据告诉系统"最近AI圈到底在关心什么",进一步影响后续的选题方向和关键词权重配置。
我曾经有点疑惑:一套自动化系统也有"选题"的概念吗?拆解完AIHOT的数据反馈机制之后,我的理解是,它确实有,但它的选题不是靠编辑的感觉,而是靠算法对用户行为数据的量化分析。这种数据驱动的内容策略,在效率上确实远高于人工经验判断。当然它也带来了一些问题,比如容易陷入"流量导向"而牺牲深度价值,这个我在后面的问题排查部分会详细讲。
3. 实操复盘:如何亲手搭一条情报流水线
3.1 技术选型与基础架构决策
看完AIHOT的架构逻辑之后,我自己动手做了一次最小化复刻。虽然做不到百万月活,但把一条小型情报流水线完整跑通,还是能验证不少设计思路的。
先说技术选型。分几个层面来讲:数据采集用Scrapy和Feedly API结合,前者负责深度抓取特定网站,后者负责聚合RSS源;数据存储用PostgreSQL,因为结构化内容(标签、分类、权重分数)用关系型数据库管理起来最顺手;内容加工调用大模型API做摘要和改写,用异步任务队列管理,避免阻塞主流程;前端发布用Next.js搭了一个轻量站点,同时用一个定时任务把每日精选内容推送到Telegram频道和邮件列表。
这套选型方案在成本和效率之间的平衡相对合理。如果全部功能都用现成的SaaS服务,一个月可能要花几百上千美元;如果全部自建,开发维护成本又太高。折中方案是:采集、存储、发布这些相对标准化的环节,能用工具就用工具,把核心的开发精力集中在加工层的数据管道和提示词优化上。
架构上还有一个重要决策:把采集、加工、发布拆成三个独立的服务,中间通过消息队列通信。这样做的好处是每个环节可以独立扩缩容。比如某天信源突然爆发了大量内容,采集服务压力上来了,但加工服务和发布服务不受影响,只需要给采集服务加机器就行。而如果是单体应用,整个系统都可能被一个环节的峰值拖垮。这是我在架构设计上收获比较深的一个点。
3.2 关键参数配置清单(可直接抄作业)
这里我整理了一份在AIHOT模式复刻过程中会用到的核心参数配置表,所有数值都基于我实测的经验值,不同场景可以微调。
| 配置项 | 推荐参数 | 说明 |
| 去重判断的语义相似度阈值 | 0.78-0.82 | 低于这个值视为不同内容保留,高于则丢弃(0.8是我试验下来的甜点值) |
| 摘要生成长度(中文) | 200-300字 | 覆盖核心信息但又不至于变成全文复述 |
| 每日采集频次 | 每30分钟一轮 | AI行业热点持续性不强,太频繁浪费资源,太稀疏会错过窗口期 |
| 内容质量分及格线 | 60分(百分制) | 低于60分的内容不进发布队列,只进待审池 |
| 发布间隔 | 工作日每2小时,周末每4小时 | 匹配目标用户的活跃时间分布 |
| 信源权重动态调整周期 | 每周一次 | 频繁调整会让系统震荡,每周更新能平衡敏感性和稳定性 |
除了表里的参数之外,有两点我觉得要特别提醒。一是内容质量分的计算逻辑,不要只依赖单一指标,可以把信息源权重、文本完整度、时效性、以及大模型对该内容重要度的判断加权综合起来。二是发布队列的背压机制,如果加工层产出速度超过发布层处理速度,队列会不断积压,严重的会导致发布延迟。我当时给队列设置了最大长度,超过之后会优先丢弃低质量内容而不是继续堆积,这个机制让系统在高负载下依然能保持相对稳定的发布节奏。
3.3 提示词设计:情报流水线质量控制的灵魂
在复刻过程中,让我花时间最多的不是系统架构,而是大模型的提示词。同样的内容源,提示词写得差和写得好,产出的情报质量可以说是天壤之别。
第一个核心提示词是"摘要提炼提示词"。我最初的版本写得相当朴素,比如"请为以下文章写一个摘要"。产出的结果虽然信息准确,但语言枯燥得像说明书,没有"情报感"。反复迭代之后,我总结出一个更有效的写法:先交代角色和任务背景,再给输出格式示例,最后强调风格和禁忌。
下面是我实测效果比较好的一版摘要提示词框架:
你是一名资深AI行业分析师。你的任务是从给定文章中提取核心信息,生成一段150字左右的中文摘要。 摘要必须包含:谁(主体机构)、做了什么(核心事件)、为什么重要(行业影响)。 不要使用"近日""据悉"这类模糊时间词,尽量给出具体的程度描述。 输出格式:摘要正文(不带标题,不用列表)。第二个核心提示词是"改写发布提示词"。摘要只是提炼,改写是在保持原文信息的基础上换一种表达方式重新组织。这个提示词要特别注意两个点:一是强调"基于原文但不照搬原文",防止大模型直接做句子级别的同义替换,这样产出的内容还是会被判重;二是要给出明确的风格锚点,告诉模型你要的是"简洁信息流风格"还是"深度解读风格",AIHOT统一的语言调性就是这么来的。
我把改写提示词的关键段落贴出来,大家感受一下:
请根据以下原文和摘要,重新组织一段150-200字的新闻短讯。 要求: 1. 语言紧凑有力,开头第一句就要点出核心事实; 2. 补充原文中提到的关键数据或背景,但不要引入原文没有的信息; 3. 避免与原文连续15个汉字重复; 4. 语气保持中性和专业,不要使用感叹号。这里补充一个我踩过的坑:如果提示词里不加上"不要与原文连续N个字符重复"这个约束,大模型很多时候还是会偷懒地大段复述原文。加了这个约束之后,改写质量会明显提升,原创度分数也好看很多。
4. 运营踩坑实录:质量问题、同质化与增长临界点
4.1 情报质量失控的三道兜底闸门
自动化流水线最让人担心的问题,就是跑着跑着内容质量突然崩了。我运营过程中真实遇到过好几次质量波动,总结下来最值得做的有三道兜底闸门。
第一道闸门是"规则层过滤"。在内容进入大模型加工之前,先用硬规则拦截明显有问题的内容。比如标题或正文里包含敏感词的直接丢弃,非中文内容(或者没有有效翻译能力的原文)直接标记,文章总字数低于300字的直接降权。这些规则简单粗暴,但能挡住绝大部分垃圾信息,成本几乎为零。
第二道闸门是"模型评分"。让大模型对每篇内容打一个质量分(1到10),判断维度包括信息价值、时效性、完整度、可读性。我在处理这一步的时候会给评分加上具体锚点,比如"9分以上必须是新技术方案或重大产品发布""7分以下是常规行业动态"等等,避免大模型打分毫无区分度。分数低于及格线的内容不会进入自动发布队列,而是进入一个待审池,留给人工做最后决策。
第三道闸门是"人工抽检机制"。很多人会忽略自动化系统里人工的重要性,但我在实测中发现,即使规则层和评分层都做得很好,仍然会有漏网之鱼。所以我会要求自己或者兼职运营每周至少三次、每次随机抽检不少于20条已发布内容,发现问题后立即回溯对应的信源,调整规则或权重。自动化能做到的是复制高质量,而人工抽检的意义在于守住高质量的下限。
4.2 内容同质化:为什么看起来全是重复信息
运营一段时间之后,我发现一个让人头疼的问题:用户开始反馈"内容怎么越来越像了"。明明信源足够多,但加工出来的短讯读起来总有一种"似曾相识"的感觉。
后来我仔细排查,发现根源不在信源,而在改写和摘要环节。大模型在处理相似主题的内容时,输出风格和句式容易趋同,再加上我设置的摘要模板比较固定,就导致大量内容虽然来源不同,读起来却像是同一个模板批量产出的。说白了就是"信息相同、表达趋同"的双重同质化。
解决方式我试过几种,效果最好的是"多模板轮换"和"风格注入"。"多模板轮换"是准备几套不同的摘要结构(比如观点前置型、背景铺垫型、数据驱动型),随机或者按内容类型匹配使用,避免模板固定带来的句式固化。"风格注入"则是在提示词里随机指定不同的语言风格关键词,比如"简洁明快""沉稳专业""带一定叙事感",让模型在多个风格之间切换。
另外还有一个很有效的思路是"差异化补充":在每篇短讯末尾自动附加相关内容推荐——比如"关联阅读:上个月也有一次类似的模型更新,背景是……"。这样即便几篇来自不同时间点的内容在核心信息上有重叠,因为补充的角度不同,用户也不会觉得是完全重复。这个功能我自己加完之后,用户反馈中的"重复""都是老消息"类投诉明显减少。
4.3 从1到百万月活路上的几个关键临界点
最后聊一下增长。我不是AIHOT的运营者,但从它的数据表现和市场反馈来看,百万月活不是一天达成的,而是跨过了几个明显的临界点之后才有的复利式增长。这里我结合自己做类似产品的经验,说几个观察和体会。
第一个临界点是"内容信任感"。月活还没起来的时候,用户来得快去得也快。尤其是自动化生成的内容,读者只要有一次觉得"这消息是拼凑的",就可能永远流失。所以前期必须不惜成本维护质量——我那时候宁可每天只发布很少的条目,也坚持每条都有人工抽检。AIHOT早期应该也有类似的阶段:产品不是靠数量取胜,而是靠准确性建立起"看AIHOT的消息靠得住"的信任感。
第二个临界点是"信息密度"与"筛选成本"的平衡。当更新频率上去之后,用户反而可能会觉得信息太多、看不过来。这时候产品的价值就不再是"持续提供信息",而是"帮用户筛掉不重要的信息"。这其实就是AIHOT在百万月活阶段真正在做的事:它用流量点击数据反哺算法,让重要度分数持续优化,用户看到的内容越来越"懂我"。这一步做到位了,留存才会上去,月活才能有积累的基础。
第三个临界点是"规模化分发带来的复利效应"。当用户数跨过某个量级之后,用户自己变成了内容传播节点。AIHOT的内容在社交媒体上被转发、被引用,会带来大量自然流量;而这些新用户又反过来贡献点击数据,帮助系统优化内容判断。这个正向循环一旦转起来,增长就不再完全依赖外部投放了。所以如果你也想做类似的内容产品,前期一定要把"可分享性"考虑进内容设计里——模板中包含易于截取的亮点金句、附带规范的引用链接,这些都是低成本撬动传播的好办法。
5. 写在最后的一些体会
拆解AIHOT和亲手复刻一条小型情报流水线,整个过程让我对"自动化内容生产"这件事有了完全不一样的理解。以前我总认为内容行业的核心竞争力是"创作",现在我的看法变了:当创作可以被大模型以极低成本执行时,数据管道、反馈闭环和分发网络的架构能力,才是真正拉开差距的地方。AIHOT的百万月活不是靠某几篇爆款撑起来的,而是靠一整套持续运转、不断自优化的系统工程。
我自己复刻那个最小版本的时候,最大的感受是:最难的不是写代码,也不是设计架构,而是找到"自动化的边界"。哪些环节可以完全交给机器,哪些环节必须保留人工干预,这个分寸把握好了,系统才能稳定健康地跑下去。过度的自动化会让内容变得冰冷失控,过度的干预又会让流水线失去意义。
如果你也想搭一条自己的行业情报流水线,我的建议是:先小成本跑通闭环,再优化质量,最后才考虑规模。不要一上来就追求大而全,用一个你自己真正有信息需求的领域做试点,把采集、加工、发布、反馈四个环节完整走一遍,期间记录所有出问题的点。这个过程其实比直接照抄任何开源方案都更有价值——因为最终你会形成一套属于自己的、能持续迭代的操作方法论。