这周刷论文,最让我意外的不是哪个模型又刷了榜,而是两条看似不搭界的工作:Vidu S2把数字人生成做到了实时720P,NCP-ArchPreview把大语言模型的预训练拉进了隐空间。一个来自视觉生成,一个来自LLM预训练,但本质上都在回答同一个问题:我们能不能不沿着“离散化+逐步堆料”的老路做生成?这个念头一旦冒出来,后面再刷LLM推理、Agent、RAG知识库的论文,我都带着同一把尺子去量。
如果你也在做AI视频应用,或者正在折腾LLM预训练、微调、RAG这类工程,这周的清单值得花十分钟扫一遍。我会把两篇主菜的来龙去脉拆开讲,最后再聊几个我在实际项目里踩过坑的方向。
1. 这周的论文筛选逻辑,为什么单把Vidu S2和NCP-ArchPreview拎出来讲
先说一个我做周报的习惯:只记录那些会改变我下一次技术选型的论文,而不是把新奇事物全塞进去。做AI应用半年多,你会发现真正影响项目走向的工作并不多,多数是参数量升级或者某个模块的小修小补。这周不一样,两篇论文都动到了“生成方式”的底层假设。
1.1 从“能用”到“实时可用”:一条硬门槛
Vidu S2最显眼的标签是“实时720P数字人”。过去几年我做数字人项目,最头疼的不是口型对齐,也不是表情驱动,而是“延迟不可控”。传统流程通常是:先离线渲染一段高分辨率视频,再靠WebRTC推流,用户看到的数字人永远慢半拍。哪怕单帧画质做到1080P,只要端到端延迟超过两秒,互动体验立刻崩塌。
所以Vidu S2的技术指标里,我最关心的不是Pixel质量,而是“实时”这两个字。它意味着整个生成链路必须能在单卡或小规模并行条件下,以视频帧率跑通前向推理。这对模型结构、蒸餾策略、甚至底层算子优化都是硬约束。如果真能做到,等于把数字人从“录播工具”变成了“实时交互终端”。
1.2 LLM预训练的新范式:不吐token,直接在隐空间里做文章
NCP-ArchPreview这个缩写,我的第一反应是“Architecture Preview”,再结合“隐空间预训练”的描述,它很可能在做一个非常高层的探索:在猜最终架构之前,先让模型在连续隐空间里学习语义结构。传统LLM预训练是把文本切碎成token,然后让模型预测下一个离散token。这条路被验证了无数次,但它有两个天花板:token化会丢掉细粒度语义,自回归生成的高延迟也来自“一个一个词往外蹦”。
这篇工作如果真是沿着“在隐空间里直接做预训练”的方向走,那它瞄准的就是这两个天花板。不是说不吐token了,而是把离散token当成一种“便于对齐”的中间产物,让模型内部真正理解的是连续语义。这个思路一旦走通,后续微调、推理、Agent工具调用都会跟着变。
1.3 为什么这周热词里LLM浓度这么高
顺带一提,这周各大社区的热搜词被LLM相关词几乎占满了:llm wiki知识库、yolo预训练模型下载、llm框架、rag graphrag llm wiki本体rag、本地erp + rag + llm 产品检索……我扫了一眼,发现大家真正焦虑的已经不是“哪个模型更强”,而是“怎么把模型接进现有系统”。Vidu S2解决的是“生成怎么实时落地”,NCP-ArchPreview解决的是“预训练怎么换引擎”,而每天刷屏的RAG、Agent、LLM网关,解决的是“模型怎么跟业务对话”。这四条线其实是一件事:AI生成正在从“展示能力”进入“生产可用”阶段。
2. Vidu S2:实时720P数字人不只是“画质升级”,而是把生成和编辑揉进了同一套管线
如果你只看标题,会觉得Vidu S2是一次普通的视频模型迭代:分辨率到720P,支持实时生成,还能编辑视频。但放在数字人这个细分场景里,这三件事合起来的杀伤力远大于单个指标的提升。
2.1 数字人实时生成的核心技术点拆解
拍脑袋想,720P数字人实时生成至少需要三个模块协同:人脸/姿态编码器、时序扩散模型、以及轻量化的流匹配采样器。
人脸/姿态编码器负责把输入音频和驱动信号压缩成隐向量。关键不是提取特征本身,而是如何把不同模态的信息对齐到同一个空间。早期方案是直接用wav2vec或HuBERT提音频特征,再拼上参数化人脸系数,问题在于音频特征和渲染参数之间隔着一道“语义鸿沟”。
时序扩散模型负责在隐空间里生成连续的帧片段。实时数字人最怕的“漂移”就发生在这个模块。如果模型只看单帧,很容易出现五官位置微移、面部纹理闪烁。Vidu S2这类前沿工作通常会用3D VAE或者时序注意力强制相邻帧共享潜在结构。
采样器是延迟的命门。传统DDIM要迭代几十步,实时场景根本扛不住。目前主流做法是用few-step consistency模型或者整流流(Rectified Flow),把采样步数压到4步以内。我两年前做实时驱动时,还在用“先渲20帧再补帧”的野路子,现在看到4步采样器跑720P,确实有代差感。
2.2 视频编辑能力意味着什么:从“生成一段”到“改一段”
更让我在意的是“视频编辑”这四个字。它意味着你不需要重新生成整段视频,只需要输入指令或者框选区域,模型就能在保持原视频时序结构的前提下修改局部内容。这个能力落到数字人场景,价值非常直接:昨天生成的镜头,角色说错了一句台词,你不需要让模型重新演一遍,而是直接改音频对应的那几帧口型和表情。
这背后用到的技术大概率和“掩码传播”有关:先在空间维度定位要改的区域,再沿着时间维度传播编辑信号。难点在于编辑完的片段要和前后未编辑片段保持光照、肤色、纹理的一致。很多公开Demo看起来很强,但放到长镜头里很容易出现“编辑段和未编辑段肉眼可分辨”的割裂感。所以我对这类工作的评价标准只有一条:能不能在30秒以上的连续视频里做局部编辑而不穿帮。
2.3 工程落地层面的个人体会
我跑过不少视频生成模型,想给想试Vidu S2的同学三个建议:
不要只看Demo视频里的画质,要问清楚端到端延迟是多少。很多模型跑单帧只要50毫秒,但加上音频编码、排队、推流,整体延迟直接翻十倍。
重点测“长镜头稳定性”。数字人生成的第一个5秒通常很惊艳,第五个5秒就开始出现“隐形人”效果——也就是面部逐渐偏离开局特征。如果模型没有隐式的身份保持机制,再高的分辨率都是虚的。
编辑功能一定要放到完整工作流里测。比如从1分钟视频里摘出5秒进行重编辑,再拼回去看接缝。我试过好几个号称支持编辑的模型,只要跨过两三个场景切换,接缝处就会突然“变脸”。
提示:实时720P对推理显存和缓存带宽要求很高,服务端部署建议先用TensorRT或者ONNX Runtime做算子融合,纯PyTorch的优化空间非常有限。
3. NCP-ArchPreview:LLM隐空间预训练到底在预训练什么
如果说Vidu S2是把视觉生成“工程化”了,那NCP-ArchPreview就是在把LLM预训练“重新定义”了。这篇工作的名字本身就很耐人寻味:ArchPreview像是“架构预览”,而NCP可能指向Neural Continuous Process一类的东西。不管缩写具体指什么,核心思路是绕开离散token,在连续隐空间里学语义。
3.1 传统LLM预训练范式回顾与痛点
Transformer语言模型的预训练本质是:“给定前N个token,预测第N+1个token”。这个目标简单粗暴,也极其有效,但用多了你会发现三个问题:
- 信息瓶颈:Token化把文本切碎后,每个token携带的信息量极不均匀。像“的”和“了”这种功能词占据大量训练位次,但语义贡献很低。
- 采样成本:自回归生成必须逐个token解码,无法并行。即使Speculative Decoding能加速一些,长文本生成还是慢,尤其在Agent场景里,每次工具调用都要“想半天”。
- 架构固化:为了适配离散token,模型必须把连续语义“硬编码”成词表索引。这导致后续加视觉、语音、激光雷达等信号时,都要专门训练一个编码器把所有模态压进同一个离散空间,非常费劲。
我做LLM微调项目时,最痛的一点就是tokenizer的边界:同一个实体被切碎后,RAG召回时经常命中一半,导致再好的embedding模型也白搭。这不是工程优化能解决的,是“离散表示”这个底层设计带来的天然缺陷。
3.2 隐空间预训练的新范式逻辑
NCP-ArchPreview如果真如标题所说,是把预训练放到连续隐空间里做,那它的逻辑大概是这样的:
- 先用一个编码器把文本(或图文混合)映射成连续向量序列,这一步得到的不是一个离散ID,而是一组在高维空间中排列的“语义向量”。
- 模型在这个连续向量空间里做自回归或扩散生成,每次预测的不是“下一个词”,而是“下一个语义块”。
- 下游任务需要文本时,再通过一个解码器把连续向量映射回token或者直接映射到任务输出。
这个范式的优点一眼就能看到:
- 信息无损:连续向量理论上可以保留所有细粒度语义,不会因为“一个实体拆成三个token”而丢失信息。
- 多模态友好:一切输入都变成连续向量,不存在“语言、视觉、语音各说各话”的离散接口问题。
- 生成可并行:如果使用扩散或流匹配而不是自回归,那么生成过程天生可以并行采样,长文本延迟能大幅降低。
我特别感兴趣的是“ArchPreview”这个词。如果它不是“架构预览”,而是“先预览架构再训练”,那可能还涉及一个自动架构搜索环节:先在隐空间里快速训练各种“预架构”的代理模型,选优后再把完整模型展开。这相当于把NAS(神经网络架构搜索)和预训练结合起来了,想象空间很大。
3.3 让“隐空间预训练”落到工程可用的差距
不过必须泼一盆冷水:目前这个范式离大规模落地还差好几步。
- 隐空间的几何性质:连续向量空间里的距离并不天然等于语义距离。如果编码器训练不好,隐空间里方向混乱,模型学着学着就崩了。
- 解码器设计:从连续向量映射回文本,如果直接映射到token概率分布,那还是绕回了离散面;如果走“生成原始文本”的路,又需要额外的生成网络,等于把预训练和生成拆成了两截。
- 评估体系:传统LLM的困惑度、下游任务分数,能不能迁移到隐空间模型上?如果评估指标还是“下一个token准确性”,那隐空间预训练的优势根本体现不出来。
我自己试过在一个小规模任务上用连续表示替换离散ID,最直观的感受是“收敛快了,但可控性差了”。离散token虽然笨,但它有一个巨大优势:每一步的可解释性和可控性都很强。你清楚知道模型输出了哪个词,而连续向量空间里,你怎么观测中间状态?这是个工程化难题。
提示:如果你正在做LLM微调或者RAG知识库,可以先不用急着追隐空间预训练,但一定要关注编码器与解码器的设计报告。一旦优秀方案出现,它会重塑整个上下游:tokenizer、LLM网关、向量数据库、Agent工具调用协议全都得换。
4. 本周其余AI前沿论文速览:LLM推理、Agent、RAG知识库三个方向
除了上面两篇主菜,这周值得扫一眼的工作还集中在三个方向,都跟热搜词里大家常搜的东西强相关。
4.1 LLM网关与工具调用:provider拒绝背后是协议设计问题
最近社区里有个高频报错:“llm request failed: provider rejected the request schema or tool payload”。意思是模型服务商拒绝了工具调用的schema或tool payload。这周我看到的几篇Agent相关论文,基本都在解决同一个问题:怎么设计工具调用的协议,才能让LLM既不出格式错误,又不陷入死循环。
我的实践经验是,工具调用的Schema不要设计得太复杂。很多项目一开始就上“嵌套JSON+多种类型参数”,结果模型生成的payload不是多了字段就是少了括号。更稳的做法是先给一个平铺的、最多两层的参数结构,等模型能稳定遵循了,再渐进式地引入嵌套。RAG场景里,函数调用的入参越简单,召回率越稳定。
4.2 RAG与LLM Wiki知识库:本体和关系建模开始回到台前
热搜词里“rag graphrag llm wiki 本体rag”反复出现。这周有一类论文在试图把本体(Ontology)和RAG结合起来:不再用纯向量相似度做召回,而是先构建一个领域知识图谱,再用LLM把用户问题映射成图查询。这个思路对“本地ERP + RAG + LLM产品检索”这类项目很有参考价值。
我自己的判断是,纯向量RAG在窄领域里天花板很低:产品型号、参数、关联关系,这些信息用向量表达很容易出现“语义相似但事实无关”的误召回。引入本体以后,至少能保证“型号-系列-参数”这类关系是准确可追踪的。但代价是需要人工梳理知识结构,项目初期的投入会明显变大。
4.3 LLM框架和本地化部署:onnx部署预训练模型的工程题
另一个高频热词是“onnx部署llm模型”“yolov8预训练权重下载”。这周看到的工程向论文,更多是围绕“如何在受限设备上跑LLM”展开。说实话,这类论文技术深度不如前几篇,但它们解决的是真实项目里的“最后一公里”。
如果你手头有业务要用onnx跑LLM,我的建议是:先量化再剪枝,最后才考虑论文里那些复杂的蒸馏方案。量化时优先用INT8动态量化,因为它对模型效果的影响最小,而且CPU上能直接加速矩阵运算。我这里提一句“动态量化”就够了,具体细节可以自己去查,核心思路是:先跑通,再优化,不要一步到位。
5. 混一周论文之后,我个人的筛选方法
最后分享一个很朴素的判断方法,可能比论文本身更值钱。
我在看Vidu S2和NCP-ArchPreview时,用的是一套“摘要核验三步法”:
先看摘要有没有一个“反常识”的结论。比如Vidu S2说“实时720P数字人”,这反常识的点就是“实时不是离线加速”;NCP-ArchPreview说“隐空间预训练”,反常识的点是“不预测下一个token”。如果摘要只是把ResNet换成了RegNet,那大概率不值得精读。
再看方法里有没有“新约束”或“新变量”。Vidu S2把编辑和生成揉在一起,相当于给生成加了一个“局部编辑一致性”约束;NCP-ArchPreview引入连续隐空间,相当于给预训练加了一个“重构解码”的变量。没有新约束的工作,通常只是超参数调优。
最后看结论的“可复现性”。如果一篇论文只给了效果对比,没给失败案例和资源开销,我会直接跳过。真做过项目的人都知道,资源开销、失败边界这些信息,才是决定你能不能复现的关键。
这周刷完,我自己的感受是:视频生成和LLM预训练这两个表面不搭界的领域,正在同时走向“连续表示”和“实时反馈”。Vidu S2让你盯着屏幕看数字人实时说话,NCP-ArchPreview让你开始怀疑“词表”这个设计是不是太大了。对我这种做应用落地的人来说,最重要的是别在旧范式里待太久。下一次做项目选型,我会优先看看有没有能用上“连续隐空间”和“流匹配采样”的新方案,哪怕现在还不够成熟,至少方向是对的。