☰
AI和大模型—循环深度技术
2026/10/7 15:15:40 网站建设 项目流程

一、介绍

在最新的GPT-6中,其强大的功能让大家感觉它又行了。GPT6之所以强大,是因为它采用了两项新技术,即自发符号建模和循环深度技术。这两项技术可以认为是AI技术发展过程中的一项重要突破。
本文将重点分析一下其中的循环深度技术,指出其内在的运行机制并加以分析说明。

二、循环深度技术

循环深度技术,Recurrent Depth或loop transformers。它是大模型技术中一项新的推理架构。即通过参数共享的循环迭代机制,在不增加参数量的前提下大幅提升模型的有效推理深度。其本质是利用时间换深度。
它一般分为三个部分:

  1. 预处理层
    以少量的Transforemr层将输入数据映射到隐藏空间,为后续的循环计算做准备
  2. 循环模块
    是一个可反复执行的共享模块,它们共享同一套参数,每迭代一轮则更新一次隐藏的状态
  3. 输出层
    在循环结束后,通过少量的层将最终的解码并输出相关的结果

常见的主流技术有:

  1. 循环Transformer
    Looped Transformer。让隐藏状态走完一整组Transformer层后,直接回到层的起点再跑一轮
  2. 循环深度Transformer
    Recurrent-Depth Transformer)‌。独立设计相关的轻量核心循环块,预处理和输出层只做嵌入和解码,循环块可独立控制迭代次数
  3. 混合递归
    结合混合专家(MoE)架构,循环块内集成动态路由的专家子模块,不同任务自动选择不同专家组合迭代,进一步提升算力效率

三、区别loop engineering

在前面分析过循环工程,它是在Agent上应用的。不过它和循环深度技术长得有点相似,所以拿出来专门对比一下:

  1. 应用层面不同
    循环深度技术是在大模型内部使用的,是一种模型架构推理机制,应用在底层算法上;而循环工程则在Agent上应用,是一种应用层的技术,它处理与大模型交互的机制
  2. 循环的目标不同
    循环深度技术循环的是模型内部的计算层;而循环工程循环的则是Agent中的应用工作流。一内一外,互相配合
  3. 解决的问题不同
    循环深度技术的循环是为了大模型利用更少的参数实现更强的推理;而循环工程则是为了实现Agent应用的自动化机制
  4. 优化的目标不同
    循环深度技术优化的大模型的计算能力和效率;而循环工程则提高的是工作效率,重点是自动化

循环深度技术和循环工程其实可以看作是大模型和Agent应用的一种选择性配合。前者通过循环深度技术让大模型学会反复深度思考的能力,而循环工程则让模型可以让大模型运行时不需要过多的人工干预,跑得更有效率。

四、分析说明

循环深度技术由于在内部的循环处理,即在Transfermor层形成一个专有的模块,反复执行多次(从依赖深度到依赖迭代,参数不增加)。此时,内存的需求量开始被压缩(包括参数的减少等,有些测试场景下,内存减少了四分之三),这对于当下内存价格疯涨来说,还是非常有价值的。
由于可以反复自循环,这样它就可以进行一些更加抽象的思考,此时更接近于人类的的大脑的想法,特别是对那些很难用语言描述的推理过程(想想沟通成本就明白了)。这也可以称谓潜在空间推理。由于其在模型内部循环,不与外部打交道,所以其更节约Token。但这不意味着节省算力(所以GPT6价格并不低)。它有点类似于人类的直觉判断,这样就可以摆脱语言描述的瓶颈。典型的如多跳推理非常有用,比如从A可推出B,从B可推出C,而是否从A可推出C,这对于循环深度技术就拥有了强大的优势(系统性泛化和组合泛化)。另外深度外推也是一个重要的机制,它在训练时推理的层次比实际推理时的推理的层次要小很多,这就需要推理层依赖规则继续外推。这就意味着循环深度技术的外沿扩展能力的大幅提高。
所以,循环深度技术的优势非常明显,首先就是极低的参数成本。在参数几乎不增长的前提下获得更大的推理深度,降低了内存的占用和训练成本;其次还可以根据算力进行动态分配管理,根据任务的情况进行循环次数的控制。它特别适合隐式推理的场景,即不需要和用户进行反复的文字沟通,如代码测试或数学证明等需要反复迭代的情况。
当然,缺点也相对明显。循环深度技术由于在模型内进行“思考”,不与外界进行交互,无法进行监督。这就导致大模型的工作不透明、不可控。这意味着隐患风险的放大(比如幻觉可能更真实)。这和人类的直觉不一定能靠得住的原因是一样的,都没有理性的推理过程。这就对AI和大模型的相关监管机制可能提出了更高的要求。另外,其对硬件要求也相对较高,训练稳定性还需要进一步的验证,特别是反复循环有可能带来的计算冗余问题,目前仍然无法解决。
其实结合前面对JEV的分析可以发现,大模型的发展正从混合在一起狂堆层正在朝着专业模块的拆分方向发展。JEV拆出判断模块,而循环深度技术拆出了思考模块。有没有看到类似软件工程的发展的苗头?毕竟大模型也是软件,其设计思想是保持一致的。

五、总结

技术的发展就是在不断的自我否定和自我革新的前提下不断进行的。没有任何一项技术一出现,就可以把前面的所有的技术都推翻,它需要一个循徐渐进的过程。
AI大模型也是如此,和前面的区块链一样,它内部的技术风起云涌,几乎每天都在变化,新名词术语满天飞。不过不要想得太多,这才是机会。

需要专业的网站建设服务?

联系我们获取免费的网站建设咨询和方案报价,让我们帮助您实现业务目标

立即咨询