做"计算机视觉与生成式内容创作"的调研,最让我头疼的不是读,而是"对":谁用了什么数据、做到什么结果、留下什么局限,得一篇篇对照着看。我手动做过一版对比表,几篇论文抄了一下午,还总怕漏。对齐标准得自己定,这篇重实验、那篇重理论,指标口径还不一样。之前用UniResearch做过单篇论文解读,觉得还行,看到它还有多文献对比解读,就把从BigGAN到Imagen Video的8篇一起传了上去,想试试看他的这个功能怎么样。
多维对比矩阵:把散落在多篇论文的数据汇总成表
UniResearch的多文献解读依旧是在完成后会输出一份报告。
报告拿到手,我先对着自己那版手动表核了一遍,看看AI有没有漏掉关键信息。报告先把8篇论文按研究背景、数据集、核心方法、研究成果、局限统一排成矩阵表,我一页页对着自己整理的内容进行核查,结果发现AI整理的比我整理的更加细致。StyleGAN2-ADA只靠约一万张图就追平了别人十万张的效果,我当时重点记了它在FFHQ上的表现,把这个数据效率的点漏了;DDPM在CIFAR-10上FID做到3.17、是当时SOTA,我笔记里只写了"效果不错",没留数字。
但对于这些内容我也没就此全信 , 报告里的关键数字,我还会返回原文进行核验。AI 生成的内容能不能用,说到底是个验证问题,就像《生成式 AI 时代的学术引用验证:跳出文献真伪,筑牢完整证据链》讲的:引用要验证,结论也要验证。
梳理技术演进,提炼共识与路线分歧
第二个想弄明白的,是这个领域怎么走到今天的、各派到底在争什么。报告把我上传的文献从2018到2022年拆成四段:GAN的规模化探索,DDPM让扩散模型站上主流,LDM用潜在空间解决效率,最后扩展到视频和多模态。
顺着这条线,共识和分歧都摆在明面上:共识是扩散模型全面超越GAN、规模扩展至关重要;分歧同样具体,GAN派强调推理速度,扩散派强调训练稳定;Imagen认为文本编码器的规模比扩散模型本身更重要,unCLIP则押注CLIP潜空间。
以前我只知道"扩散模型是主流",现在能说出它从哪一步、因为什么成了主流,也明白了这些分歧意味着什么:读一篇新论文,先看它站在哪条路线上的,就知道它想解决什么、会忽略什么。这让我想起《科学的本质是连接:当文献、数据与思想不再孤立,新的认知便自然涌现》里说的:文献一旦连起来,认知就不再是孤立的摘要。让 AI 梳理多篇文献的脉络和观点异同,这事其实已经不新鲜,36 氪的《AI 改写后文章不通顺?看 Kimi 如何破解重写困局》就报道过有产品在几十篇文献里捕捉脉络、生成综述初稿。
从文献局限里,寻找潜在研究缺口
最后一个问题,也是我最关心的:这些工作还留下什么没解决,我能不能接着做。报告列出了几个开放问题——长视频时间一致性、细粒度可控生成、多模态统一框架,并按高、中可行性分了方向,每个方向还给了技术路线和预期贡献。按《研究空白如何形成:类型、识别方法与判断标准》里的说法,识别缺口的前提是先看清领域现状,这一步报告替我做了。我把"高可行性"那几条整理进开题草案的候选列表,选题范围一下子具体了。
我还是不能完全依赖它 ,关键数字和方向性结论都还需要回原文核验。AI 整合文献本身不新鲜,《30 分钟整合 550 篇文献,生物学多智能体 Robin 跑通自主科研闭环》里报道过三十分钟整合五百多篇文献的系统。但工具的价值不在 "多",在于能不能针对你选定的文献集把对比做细。就像《效率神话下的科学困局:AI 赋能科研的隐形悖论与人机协同真相》提醒的:效率越高,越要警惕背后的问题。工具越快,越要自己把住方向和判断。这次之后我的态度是:结论不能全信,但能核验的东西,用它先排好,省下的时间归自己。