AI集群互连新选择:e-Tube介质波导如何平衡铜缆与光模块的取舍
2026/9/23 4:23:09 网站建设 项目流程

1. 铜与光的两难:AI集群互连到底卡在哪

做AI集群的人这两年普遍有一种感觉:GPU算力还在往上冲,但真正让人睡不踏实的已经不是“显卡够不够强”,而是机柜里那堆连接。千卡集群时代,很多人还可以用铜缆将就着过;等集群冲到万卡、甚至几万卡,卡与卡之间要交换参数的量越来越大,“连不起来”“连不起”“连了之后不稳”这三个问题开始同时爆发。

e-Tube™技术就是在这样的背景下进入视野的。它被媒体概括成“不用铜也不用光的塑料路线”,单看这句话容易误解成天方夜谭,但拆开看你会发现,它其实是用一根高分子材料做的管子,把高频电磁波约束在管道里走,绕开了铜缆的衰减和光模块的成本。这篇文章我会把这条“塑料”路线的原理、工程部署、选型场景和现实风险一次说清楚,适合正在做集群网络规划的数据中心工程师、AI基础设施负责人,以及所有被线缆折腾过的同行参考。

1.1 铜缆这个“老伙计”为什么先撑不住了

铜缆在数据中心里服役时间非常长,从万兆时代的SFP+直连铜缆,到25G、100G时代的DAC铜缆,它一直是机柜内短距离互连的主力。核心优势不用我多说:没有光电转换,延迟低,价格便宜,即插即用。问题是,随着SerDes单lane速率从25Gbps推到56Gbps、112Gbps,铜缆的物理短板越来越藏不住。

速率越高,铜缆里传输的高频分量衰减越严重。为了保证接收端信号质量,DAC铜缆的实际有效长度被一压再压,112G/lane时代通常只能做到两三米,再长就需要用有源铜缆AEC去补偿,可一加上驱动和均衡芯片,功耗和延迟优势就打了折扣。另一个直接被忽视的麻烦是线径和重量。你去看一个满载的AI机柜,后面几十根铜缆摞在一起,又粗又硬,别说理线,连机柜门能不能关上都要画个问号。弯曲半径大意味着走线要绕开障碍弯,可你越弯它,插入损耗和串扰越严重。

我在实际维护中踩过最典型的坑就是:NVIDIA训练集群里有一对机箱间距刚好超过五米,图纸上算的是DAC两米够用,结果实际因为机柜间走线绕了一圈,长度不够,被迫换成AEC。换线那天下着雨,机房湿度大,线槽里还塞着旧缆,拔出来的时候几个人累得满头大汗。那一刻我特别理解为什么有人会想“能不能有根又轻又软又便宜的线把这事解决了”。铜缆在短距离内的延迟优势仍然在,但工程体感已经越来越差。

1.2 光模块不是不能上,是某些场景太“贵娇费电”

光模块当然是另一种解法,也是眼下长距离互连不可替代的方案。光通信的核心本事是损耗极低,单模光纤每公里损耗可以做到0.2dB左右,几米和几百米几乎没有区别,带宽潜力也远大于铜缆。但问题出在“贵”和“娇”上。

光模块的贵分两个层面:一个是器件本身的成本。可调激光器、高速调制器、光电探测器、TIA、DSP、高精度的封装对准,这些环节都需要极高工艺良率,尤其到了800G、1.6T时代,模块里的DSP芯片功耗动不动就是十几瓦,每个端口还要配一对。另一个层面是用起来贵:光纤跳线端面非常怕灰尘和油污,插拔前要用专业清洁笔擦拭,测试要带光功率计,一个不太合格的接头就可能让误码率飙上去,排查时候能把人磨到没脾气。

我并不是说光模块不好,而是想说:光纤的“长距离低损耗”这个最大优点,恰恰在机柜内两三米、三五米这个区间用处不大。在一个GPU到TOR交换机通常只有几米到几十米的AI集群里,你为光纤的超低损耗付了钱,但真正享受到的只是它“不生锈、不受电磁干扰”的次要优点。这就造成了很尴尬的局面:短距离用光方案,成本体验双输;但用铜缆,速率和距离又频临极限。中间这层空档,成了新技术的突破口。

1.3 “成本拐点”和“规模拐点”撞在一起

为什么一定要把这个问题单拎出来?因为AI集群和传统云数据中心的互连模型完全不同。传统业务南北向流量为主,服务器到交换机的距离相对固定,带宽增长也相对线性。AI训练集群不一样,它是典型的东西向流量风暴,一个训练任务要在成千上万张卡之间反复同步梯度,互连端口数量大、密度高、距离短。

这几年集群规模从千卡冲上万卡,互连数量不是线性增长,而是近乎平方级地往上滚。当互连数量巨大时,每个端口的成本差出几十美元,整个集群的互连成本就是一笔看得见的巨大开销;每个端口功耗差出几瓦,散热系统的压力也会成倍放大。所有这些现实压力叠加起来,大家都在等一个不需要光模块、又能比铜缆跑得更远更稳的方案。e-Tube就是在这种背景下被推到台前的一条“第三路线”。

2. e-Tube的“塑料”思路:一根管子里怎么跑数据

我第一次看到“不用铜也不用光”这个说法的时候,第一反应是:这该不会是某种无线传输吧?后来把技术细节捋了一遍才发现,它不是凭空发射信号到空气里,而是借了一根塑料管做导波结构。这个思路本质上是把“有线”和“无线”结合了一下:电磁波不需要导体,但也别在全向空间里乱跑,让它在管子内部沿固定路径走。

2.1 它不是光,也不是无线——介质波导的底层逻辑

要理解e-Tube,先要理解一个概念:介质波导。光纤也是一种介质波导,但它导的是光波段的电磁波,靠的是纤芯和包层之间的折射率差,让光在芯层里不断全反射前进。e-Tube导的不是光,而是频率更高频段——毫米波甚至更高频段的电磁波。它用的材料是某种低损耗高分子聚合物,介电常数比周围的空气高,当电磁波从发射端耦合进这根管子后,大部分能量会被“约束”在塑料管内部以及管子表面很薄的一层区域里,沿着管轴方向传播。

这背后的物理机制不完全等同于光纤的全反射,更接近“表面波导”或“介质导波”:被导波的能量并没有全部关在管子正中间,而是有一部分贴合在介质表面附近。你可以把它想成:一块铁板不会导光,但一根塑料管对高频电磁波来说,就像一条“轨道”,波一旦进入轨道,就会顺着轨道跑而不会轻易挣脱。这就是它既不用铜、又不用光的含义——它用的是电磁波,但波是被介质材料约束着走的,本质上还是有线传输。

这里要特别强调一个容易被转述带偏的点:e-Tube不是说颠覆了电磁理论,而是把已经很成熟的介质波导理论工程化了。早期雷达系统里就有人研究过介质棒天线和介质波导,但那时工艺、材料、工作频率跟今天的数据中心需求完全对不上。现在AI集群所需的极高带宽、极短距离、极低成本和低功耗,刚好给了这类技术重新落地的窗口。

2.2 为什么偏偏是“塑料管”而不是实心棒

既然介质波导可以做成不同形状,为什么e-Tube选择的是“管”?这里有几个很实际的工程理由。

第一是弯曲柔性。实心介质棒一旦做得太粗就难弯,数据中心布线需要的是能贴着机柜、线槽走的柔性线缆,实心棒在密集场景下没法拐弯。管状结构给弯曲变形留出了空间,同样外径下,管的弯折性能通常比实心结构好很多。

第二是成本与重量。高分子聚合物注塑或挤塑成型的成本远低于光纤的预制棒拉丝和光模块的精密封装,也更低。管内部是空的,单位长度材料用量更少,整根线缆的重量甚至可以做到比相同外径的铜缆轻很多,这对布线工人来说是个实实在在的福音。

第三是“介质中包含空气”这种结构本身可能带来更低的等效介电常数,从而影响电磁波的传播速度。介质材料里的电磁波速度比光速慢,但通常还是快于铜缆中的电信号传播,所以端到端延迟做的非常低。管状设计还能在一定程度上降低材料用量和损耗,可以说是性能和成本权衡之后的折中方案。

2.3 和塑料光纤(POF)别搞混

很多同行一听“塑料”,第一反应是塑料光纤。这里必须划一条界线:POF导的是可见光或近红外光,核心机制还是光子,衰减很大,通常只能跑几十米百来米,速率上限也低,主要用在车载和家庭网络。e-Tube导的是毫米波频段的电磁波,不是光,不需要光发射/接收组件,传输速率提升依赖的是毫米波芯片的发展,这跟POF完全是两个物种。

理解这个区别对后续选型很重要。如果你拿“塑料光纤”的印象去套它,会觉得“塑料导波肯定损耗巨大、带宽有限”,这会误判它的实际定位。在AI集群短距互连这个具体区间里,它的带宽潜力来自后端的毫米波电路和调制方式,而不是“塑料”本身的固有极限。

3. 链路怎么搭:部署形态、连接器与损耗控制

聊完概念,再说点能落地的。不少朋友关心的是:就算这技术听起来不错,到了机房现场到底怎么装?需要熔纤机吗?接头要不要清洁?走线有什么禁忌?我结合近年来看到的一些介质波导测试方案和传统工程经验,梳理一下大概率会遇到的问题。

3.1 端到端链路都有什么部件

一条e-Tube链路,大致会由几个部分组成:交换芯片/GPU侧的高速SerDes、毫米波收发前端、过渡耦合器、一段塑料介质管,以及接收端的类似结构。关键不同在于,传统光模块的端口是一个可插拔的光收发组件,而e-Tube链路更像是“电信号直接激励一个毫米波前端,再由耦合器把波导入介质管内”。

这意味着你在交换机面板上看到的可能不再是一个个密集的光口,而是一组专门设计的波导口,类似一个射频法兰或低剖面的专用连接器。从工程角度讲,这类连接器不需要像光纤连接器那样做纳米级对准,因为毫米波的波长比光波长几个数量级,对机械偏差的容忍度要高得多。你插一个LC跳线时端面脏了会出大事,波导口上沾点灰尘通常还不会立刻让链路中断,这是它在运维体验上一个不容忽视的好处。

但要说完全不维护也不现实。耦合器、连接器结构仍然要求端面没有明显异物,布放时也要防止介质管被压扁或者出现硬折。我比较担心的是机房巡检工人如果不了解这种线缆特性,随手一压、一踩,管壁变形导致驻波变化,链路误码率就会悄悄劣化。

3.2 现场布放要盯的几个工程细节

介质波导虽然比光纤皮实,比铜缆轻软,但它还是有自己的脾气。以下几个细节是我认为在做试点或正式部署时必须盯住的。

一是弯曲半径。虽然它比同轴线和铜缆好弯,但也不是无限弯。每个角度都是损耗,弯得越急,能量就越容易从波导里“甩出去”变成辐射,导致插损增大。施工规范里一定要给工人明确的弯曲半径下限,最好现场用护管和弯头做引导,而不是让工人凭手感来。

二是机械挤压。管子一旦被机柜脚轮压过、被扎带勒太紧、被其他线缆长期压住,截面形状改变会直接影响电磁波传输,而且这种问题是渐变的,从误码率升高到最终链路中断可能持续几天,非常难定位。布放时最好走独立线槽,和高压电缆、大电流母线保持距离。

三是环境温湿度。塑料材料的介电常数会对温度和湿度敏感。传统光纤对温度变化相对钝感,而介质波导在温度变化时,损耗和传播常数都可能轻微漂移。如果部署地域的机房做不到恒温恒湿,必须做高低温老化测试再看结果,而不是直接大规模铺开。

四是端面防护。连接器不使用时尽量戴防尘帽,这个习惯和光纤一样。虽然没有光端面那么娇贵,但长期裸露积灰会造成插损漂移,影响链路一致性。

3.3 链路预算怎么估算

介质波导不是零损耗传输,部署前需要做链路预算。虽然我不能替厂商给出精确数字,但工程估算的框架是通用的,你可以按这个逻辑去推。

先拿到几个基础参数:发射端输出功率、接收端灵敏度、介质管每米损耗、每个连接器的插入损耗、弯曲损耗罚值。然后列出链路从A端到B端经过多少米管子、多少个连接器、多少个弯,把这些加起来,再留出至少3dB的工程余量,看总预算是否在收发端动态范围内。

举个例子。假设一条链路长10米,每米介质损耗0.3dB,这里要声明,这个数值纯粹是示意,实际要参考具体材料和频率;两头各有一个连接器,每个插入损耗0.5dB;中间有两个弯,每个弯折损耗0.2dB。那么总损耗就是3dB加1dB加0.4dB,约4.4dB。如果收发端动态范围有6dB,那这条链路可以做,但余量只有1.6dB,偏紧,我通常会把余量要求提到3dB以上,这种链路就会被打回重做。

链路预算的意义不只是判断能不能通,更是给运维留一个基线。系统上线前测一次总插损,记入台账;后续如果出现误码,再测一次,对比差值就能快速锁故障点。传统光链路大家都这么干,介质波导链路也一样,别因为它“不是光纤”就不做测试。

4. 真刀真枪选型:e-Tube和铜缆、光模块怎么放到一张表里

看一个新技术不能只看它自己怎么夸,要和现有方案拉到同一张表上比。我习惯从成本、功耗、延迟、距离、布线性、可维护性和生态成熟度这几个维度来打分,定了框架后再去看自己的实际场景。

4.1 六大维度横向对比

下面这张表我尽量做得直白,打分是相对定性,不同厂家的产品会有差异,但方向不会变。

维度无源铜缆(DAC)有源铜缆(AEC)光模块方案e-Tube介质波导
端口成本最低中低预期中等
功耗近零中等较高(DSP占大头)低至中等
端到端延迟极低低(但SerDes+DSP有附加延迟)极低
有效距离短(高速率时仅2-3m)中短(5-7m)长(几十米到几十公里)中等(几米到几十米)
重量与柔韧性粗重硬比无源略轻仍有源轻但接头娇贵轻、软、可弯曲
接头敏感性较好较好差,怕尘怕脏,需对准较好,容差大
生态成熟度早期,生态不完整
标准化程度IEEE成熟成熟成熟弱,厂商各自为战

这种对比看完,它的定位就很清楚:铜缆做不到长度,光模块做不到低成本维护和低功耗,e-Tube瞄准的是中间那一段“短距但不短到贴脸、高速但不想上光”的空间。它不是光模块的全能替代品,更像是一个特定距离区间内的最优解候选人。

4.2 哪些场景适合先落地

根据上面的表格,我认为最值得先试点的场景有三个。

第一类是机柜内GPU到TOR交换机的垂直连接。现在很多AI集群的GPU服务器机柜和网络机柜并排,TOR可能就在同一个或者隔壁一个机柜里,链路长度5到10米,正好是铜缆勉强、光模块浪费的距离。用e-Tube替代这一段的优势最大,能同时降成本、降功耗、简化布线。

第二类是Scale-up域的卡间互联替代。卡间互联目前很多是专用铜缆或者背板传输,随着单卡功耗和互联带宽提升,铜缆在板卡面板后面的管理越来越痛苦。介质波导因为轻软、散热负担小,有机会在下一代机箱内部互连里占一块地。

第三类是临时扩容和故障应急。机房现场经常遇到“差一条几米的高速线,但光模块价格离谱、DAC长度不够”的情况。如果介质波导线缆能做成长度可裁剪、接头现场安装的形态,应急响应会非常快。不过目前这个场景依赖连接器是否支持现场端接,这还要看后续产品形态。

4.3 混合部署的过渡路径

我不认为e-Tube会一夜之间把光模块扫出数据中心,更现实的路径是混合部署。机柜内外结构可以这样切:骨干层和跨楼层链路继续用光,保证管理和距离冗余;机柜末端从交换机到服务器的最后一跳逐步切换成介质波导,把成本大头啃下来。

这种混合架构的好处是,不同技术栖身在自己最擅长的区间里,互不拖累。光模块继续做长距离传输的主力,e-Tube在短距密集区把端口成本和功耗降下来。更重要的一点是,网络架构不需要伤筋动骨,交换机的管理协议、路由体系、监控体系都不用变,只要底层物理口变了,它天然兼容。这对现网运维来说,迁移平滑度是极高的。

5. 服务器/交换机侧要改什么:接口形态、信号完整性与运维习惯

选型问题之后,真正干过工程的人会关心更实质的问题:我现有的交换机和服务器能用吗?面板要改成什么样?运维习惯要不要推翻重来?这几件事直接决定部署成本。

5.1 信号从PCB走到波导的耦合方式

从硬件设计角度看,最需要关注的是“最后一厘米”。现在服务器主板上走的是高速差分信号,而介质波导里走的是单端形式的毫米波电磁场,中间需要一个过渡结构完成这两种形态的转换。

业界这类研究一般分两种耦合路径:一是探针/贴片天线耦合,在PCB上做一个小型化的天线或过渡结构,把差分信号转换成向介质管辐射的电磁波,再通过机械卡扣把管子对准天线区域;二是波导模式转换器,信号通过一段微带线、共面波导,再过渡到介质波导。无论哪种方式,这对主板布线、板边连接器形态都会带来调整,不可能在现有光模块笼子上一插就完事。

不过它的好处同样明显:不需要激光器对准,不需要透镜系统。耦合结构对机械偏差的容忍度远大于光纤。我看到的这类结构中,连接器可以做成类似“把管子插进一个卡座”的形式,甚至可以实现非接触式耦合。注意是非接触,不是无限无接触,管子和天线之间可以留一个小间隙,但必须在一个固定范围内,这对热插拔和维护拆卸极其友好。

5.2 功耗、延迟和散热端的真实收益

为什么AI集群愿意关心这种新接口?核心还是功耗和延迟。光模块在800G时代功耗已经很难压,每根光纤收发两端可能各需要十瓦以上,一个T级交换机几十个光口,加起来就是个发热大户。e-Tube的毫米波前端主要由CMOS或SiGe工艺的射频芯片实现,这类芯片在毫米波频段的功耗虽然不低,但它省掉了激光器驱动、TIA、DSP中大量高功耗环节,所以整体链路功耗有希望做到比光模块低一个量级。

延迟方面,它的优势也很明显。光模块链路里信号要经过电-光、光-电两次转换,每经过一次转换和DSP,就有几纳秒到几十纳秒的额外延迟。e-Tube本质上是在“电域”传输,只是把电信号变成电磁波在塑料管里跑,收端直接由检波电路还原,没有光电转换的几轮握手。在分布式训练这类对延迟极其敏感的同步场景里,哪怕每跳省下几百纳秒,累加起来对训练效率都有帮助。

散热收益听起来不如功耗数字直观,但在AI机柜里却是刚性的。机柜功率密度越做越高,风口都被GPU加热了,交换机和线缆如果还不断发烫,整体散热压力巨大。用e-Tube把端口功耗压下去,折合到整柜散热量,可能在单机柜面临供电和散热瓶颈时,成为压垮骆驼的最后一根稻草变救命的稻草。

5.3 热插拔和维护性:不如无线方便,但比光容易

运维习惯上最重要的一条:你不一定需要像伺候光纤一样伺候它。光纤业界有条铁律,插接前必须检查清洁端面,因为一个微米级的灰尘就可能导致链路光功率掉几个dB。介质波导的工作波长远大于光的波长,对灰尘颗粒的敏感度低得多,插接时对准容差也更大。这意味着在汗流浃背的机柜后面,运维人员可以少一层心理压力。

但别高兴太早。它比光好伺候,但还是有线缆的基本约束:不能折死、不能长期受压、不能利器划伤。我说一个具体的场景:某条链路告警,值班人员现场排查,如果看到是光纤,第一反应是拿光功率计测光口和清洁端面。换到e-Tube,应该先目测管身有没有明显压扁或锐弯,再看接头有没有松脱,最后才上设备误码测试。维护思路是“机械优先”,而不是“光学优先”,这一点一定要提前培训和写进手册,不能拿光纤的运维习惯硬套。

6. 我判断这条路线值不值得跟

技术路线分析到最后,总要回答一句“我到底该不该现在关注它”。我的观点比较折中:现在还不到大规模押注的时候,但绝对到了必须开始了解和试点的阶段。

6.1 先看你的集群“平均互连距离”

判断自己适不适合这条路线,第一步是拉一把网线长度的分布。统计一下整个集群里,所有从服务器网卡到交换机端口的物理链路长度,按区间分桶。如果大量链路集中在3到20米,基本就是e-Tube的精准目标区。如果核心链路都超过50米,那暂时不必焦虑,光模块的地位在短时间里很难被撼动。

别忘了,还要看未来的速率计划。如果你的集群下一代SerDes就要上224G/lane,铜缆在一个机柜内的有效长度可能被压到一米多,那时候机柜间任何一点跳线长度都会变成噩梦。这种时候,哪怕e-Tube目前还是早期产品,也有充分理由去推动厂商做联合测试。

6.2 POC试点的四件事

我建议有条件的同行现在就开始做小规模POC,四个测试项我认为是绕不开的。

第一是链路损耗和误码率基线测试,在不同线缆长度和弯折形态下跑24到72小时高负载流量,记录误码、重启、告警的全过程。第二是高低温循环测试,机房虽然不是户外,但空调故障时温升可能很猛,一定要确认介质材料在温度漂移时的稳定性。第三是和现有交换芯片的兼容性测试,重点看毫米波前端的时钟恢复和SerDes自适应均衡能否正常训练,这种物理层适配问题最容易在早期暴雷。第四是实际布线密度测试,找一个满载机柜,按真实走线路由放一遍,看看线缆弯曲占用空间、固定方式、后续加线方便性。

6.3 说点不好听的:标准化与生态风险

技术很诱人,但作为从业者我必须泼一盆冷水。当前最大的风险不是物理层能不能通,而是生态碎片化。光模块之所有有今天的主导地位,除了性能,更重要的是它有完整的MSA标准、IEEE定义、多厂商互通验证和成熟的测试仪表产业链。e-Tube技术目前能看到的更多是单一厂商或个别实验室推动,连接器形态、管材规格、测试方法都还没形成事实标准。

这意味着你今年选了一家厂商的管子,明年可能被绑在这家的产品版本上,没办法像LC跳线那样随处在市场上买到替换件。另一点是故障诊断工具缺失,光链路有OTDR、光功率计、显微镜,介质波导链路能用的普遍仪器还很有限,出了问题主要靠网管业务误码侧写,远程定位能力弱。

所以我的建议是:项目组内可以立项跟进、联合测试、小范围试点,但在标准成熟前不要把它写进大园区、大批量的网络基线规范里。尽量选择那些“即使不成功也不影响存量”的试点区域,比如某一个新建机柜、某一条备份链路,这样既拿到了第一手数据,又不至于把自己绑上一辆生态尚未成熟的战车。

最后说一点个人体会:从铜到光,再从光到介质波导,数据中心互连技术的演进从来不是谁完全替代谁,而是在每一个距离区间里找到成本和性能的最优解。e-Tube这类“塑料”路线,真正让我看好的不是它“不用铜也不用光”这个营销噱头,而是它逼着整个产业链重新思考一个问题:短距离高速互连,我们到底有没有必要付出光模块那么高的代价?只要这个问题被提出来,并且有厂商愿意去回答它,这条路线就值得你花时间关注。

需要专业的网站建设服务?

联系我们获取免费的网站建设咨询和方案报价,让我们帮助您实现业务目标

立即咨询