☰
共封装光学CPO深度解析:原理、落地挑战与产业链格局
2026/10/7 10:38:26 网站建设 项目流程

1. 共封装光学(CPO)到底是什么:先从“光模块”说起

如果你过去两年一直在关注AI算力集群、数据中心网络或者高端交换芯片,那“共封装光学(CPO)”这个词几乎不可能没听过。从NVIDIA、博通、Marvell,到台积电、Intel、AMD,再到国内的各大设备和芯片厂商,从2023年开始把CPO当作下一代互联的核心路线来推。我自己的感觉是,这个词的热度上升得非常快,但真正能把CPO讲透、讲明白的人其实不多。

很多人一看到“共封装光学”这样的术语,会觉得它特别高深。说白了,CPO的概念其实就一句话:把光模块组件(尤其是光学引擎)从可插拔的模块盒子里拿出来,直接和交换芯片或者计算芯片封装在一起,让光信号从芯片附近就能进出。它要解决的是传统可插拔光模块在带宽密度、功耗、信号完整性这几个维度上快要撑不住的问题。

我在实际接触这个方向的时候,要说适应它,确实有个过程。因为咱们做传统网络硬件的时间太长,思维惯性就是“芯片管电、模块管光、线缆管连接”,层与层之间分得很清。CPO把这个边界直接打穿了——封装、硅光、半导体工艺、网络协议、散热设计全搅在一起,一个人很难再从头管到尾。

这篇文章里头,我会把CPO的技术原理、关键设计思路、实际落地中的测试验证问题,以及产业链各个环节的情况都拆开聊一遍。不管你是做网络架构的、做芯片封装验证的、做数据中心运维的,还是刚入门想转方向的学生,只要想搞明白“共封装光学到底解决了什么问题、用了什么手段、落地难在哪”,这篇文章应该能帮你建立一个比较完整的认知框架。

2. 为什么非要搞CPO:可插拔光模块的瓶颈已经到极限了

2.1 传统可插拔光模块的“三重困境”

理解CPO的价值,得先回到现在的可插拔光模块到底遇到什么问题。我在搭建网络设备时,最直观的感受就是机箱面板上密密麻麻的笼子端口,交换芯片往外走高速SerDes信号,PCB走线,再进连接器,再进光模块内部,光模块里的Driver和TIA(跨阻放大器)处理完电信号后,再由激光器和探测器完成光电转换。

这套体系出现到现在,链路已经非常成熟稳定,甚至可以说被验证得很好。但在速率往上爬的过程中,物理限制越来越明显:

  • 功耗问题:可插拔光模块的功耗在QSFP-DD或者OSFP这种形态下,单模块做到400G的时候大约是12W左右,到了800G能到15W到18W,1.6T形态如果还走可插拔路线,单模块功耗可能直奔25W以上。一台64口交换机的光模块总功耗可能超过1000W,这个数字对整机散热系统是巨大的负担。更要命的是,信号从交换芯片出来到光模块,要经过封装基板、PCB走线、连接器、模块内部柔性板这么长的物理路径,每一段都在消耗能量、引入噪声和抖动。

  • 带宽密度不够:机箱面板的数量是有限的,交换机前面板就那么宽,能塞下的端口笼子数量有上限。速率往上提,端口数就得往下减,或者模块的形态就得越做越宽。带宽密度的提升速度,直接受制于可插拔模块的物理尺寸。

  • 信号完整性的极限:交换芯片的高速SerDes速率从最初的10G一路涨到112G,甚至在向224G SerDes演进。在PCB上走100G以上速率的信号,损耗控制、抗串扰设计、连接器选型变得非常艰难。每往前一步,板材、过孔阻抗、链路预算都要重新来一遍,代价是成倍增加的。

我做过一个很粗略的链路预算对比:一颗51.2T交换芯片,如果用OSFP可插拔方案,芯片到模块的SerDes走线长度大概在6到10英寸这个范围,往往需要Retimer或重新定时芯片来放大信号,额外功耗非常可观;而Cpo方案把光学引擎封装在芯片同一基板上,走线长度缩短到毫米级别,信号质量完全不一样。

2.2 CPO的核心思路:缩短电信号路径,延长光信号路径

CPO的思路恰恰是把物理规律利用到极致:电信号在PCB上传输损耗大、速率受限,那就让它走最短路径。把光模块的“心脏”——光学引擎(Optical Engine),也就是包含调制器、探测器、光波导、耦合结构的硅光芯片——放到和主交换芯片或计算芯片同一个封装基板上,或者距离芯片非常近的位置上,让高速电信号从ASIC出来,几乎不出封装就完成了光电转换,进入光纤传输。

这里有个关键点:不是所有模块功能都挪进去了。激光器可以有不同选择,有的方案采用外置光源(External Light Source),通过光纤把光送到CPO封装内部的光引擎上,再经过调制器调制后输出;有的方案把激光器也集成到封装里。两种路线各有取舍,后面章节我会详细讲。

光信号一旦进入光纤,传输距离就不是问题了。数据中心的机柜间、服务器集群之间,几十米到几百米的传输,单模光纤完全能够覆盖,而且几乎没有信号质量损耗的烦恼。CPO的本质,就是把“光电转换的节点”向芯片靠近了一大步,用一个“不可插拔”的牺牲,换来了功耗、密度和信号质量的大幅提升。

2.3 CPO的收益用数字说话

光说理论没感觉,我来算一笔账。假设一颗51.2Tbps的交换芯片,采用传统可插拔方案,单片OSFP模块功耗按15W算,整机64个端口就是960W的光模块功耗;再加上SerDes链路上的额外功耗、Retimer芯片的电能消耗,总功率相当可观。

换CPO方案呢?由于链路缩短,SerDes驱动可以大幅降低功耗,光学引擎的Driver和TIA因为距离ASIC更近、走线短且阻抗可控,功耗也能降下来。行业内普遍的数据是,CPO方案在同等交换容量下,系统级功耗比可插拔方案降低30%到50%。在AI集群动辄几万台服务器互联的场景下,这个功耗缩减的绝对值非常可怕。

另一个收益是延迟。电信号走线缩短,光电转换节点减少,端到端交互延迟进一步降低。虽然光信号在光纤中的传播延迟没法省,但节点上节省的几十纳秒到几百纳秒,对大规模分布式训练中的集合通信操作还是有实际意义的。

3. CPO的整体设计与技术实现:不是“把模块塞进去”那么简单

3.1 三种路径:片间(Near-Package)、片上(In-Package)与混合

“共封装”这个词涵盖了几种不同的集成深度。严格意义上,CPO通常指把光学引擎和计算/交换芯片放在同一个封装基板上,封装尺寸较大,但Al的光电共封就在芯片内部集成光学器件;还有业界经常说的近封装光学(NPO)形态,把光学引擎放在与主芯片非常接近的有机基板上。

  • 近封装光学(NPO):光学引擎和ASIC共享同一个基板,但距离比较远,还在同一个封装内部。这种方案封装难度相对低一些,对硅光引擎的集成度要求没那么苛刻,是很多传统光模块厂商比较容易切入的路线。
  • 共封装光学(CPO):光学引擎和ASIC紧密耦合在同一基板,甚至通过硅桥、Interposer实现更高密度的互连。对封装工艺、热管理、信号完整性设计要求极高。
  • 片上光学(PIC集成进ASIC):直接把光学器件做进计算芯片的制造流程里,这个难度最高,目前还没有大规模商用的产品出现,更多是在研究和早期验证阶段。

还有一个粗划分维度是有没有集成激光器。合封激光器的方案功耗密度高,热管理压力大,但模块化程度高;外置光源方案把激光器放到封装外可插拔的位置,封装内部只做调制和接收,热源分散,可靠性管理更容易,是当前CPO商用产品的主流选择。我目前接触的主流交换机CPO方案基本都是外置光源路线。

3.2 核心技术点:硅光调制器、光电探测器与光纤耦合

硅光引擎是CPO里最核心的组成部分。它是在硅基板上用半导体工艺做出光波导、调制器、探测器、耦合器等光学和电学元件。我们平时讲“硅光”,本质上就是用CMOS工艺来造光学器件,这带来的好处是可以用大规模半导体制造能力来生产光学组件,成本有希望大幅下降。

硅光调制器负责把高速电信号“写”到光信号上去。目前MZM(马赫-曾德尔调制器)和微环调制器是两个主要流派。MZM带宽高、线性度好、温度敏感性相对较低,但是占芯片面积大、功耗高;微环调制器面积小、功耗低,但对波长和温度极其敏感,需要闭环控制,否则稍有热漂移就把工作点跑飞了。我没有亲自做过微环的流片验证,但听在硅光代工厂做过的朋友讲,温度控制那部分调试起来确实非常痛苦,也有体会。在100G/lane甚至更高速率的CPO产品里,MZM因为稳定性更好,目前是很多公司的首选;微环则更多用在追求极致功耗和密度的场景里。

光纤耦合是另一个让人头大的环节。硅光芯片上的波导尺寸在亚微米级别,和标准单模光纤的模场直径差了差不多十倍。直接端面对接的话,耦合效率会低到没法用。业界常用的是通过光栅耦合器或者边耦合器来做。光栅耦合器直接在芯片表面垂直耦合,对准精度要求相对低,但耦合带宽窄;边耦合器耦合带宽大、损耗低,但是对准精度要求极高,通常需要在亚微米级别。CPO封装里面的光纤阵列(Fiber Array)对准工艺,是整个制造环节中良率损失和成本的主要来源之一。

3.3 CPO交换机的物理形态:一个整机视角

我们平时看到的“800G或1.6T可插拔交换机”,前面板是一排光模块笼子。而一台CPO交换机看起来很奇怪的地方在于:前面板可能找不到多少光口,光纤直接通过面板上的MPO连接器进到机器内部,连到封装里的光纤耦合处。可插拔模块形态被替换成了“光缆跳线+连接器面板”,光模块不再是一个独立的可插拔单元。

这种形态变化对整机设计的影响非常大。首先散热结构完全变了,光模块不再是独立风道里的独立热源,而是变成了封装内部的局部热点;其次维护方式变了,传统光模块坏了抽出来换一个就行,CPO坏了整个线卡都要换;再次,光纤管理的复杂度上来了,面板前可能密密麻麻全是光缆,整理起来挑战不小。从可维护性角度说,这是从“模块级维护”退化到了“板卡级维护”,这是CPO在实际部署中非常重要的一个心理门槛。

4. 实操中的关键环节:CPO测试设备与验证流程

这部分是我最想多聊一点的,因为恰恰是很多人会忽略的地方。CPO不是光设计出来就完事的,能不能大规模量产,良率是多少,测试环节的效率和准确性几乎决定了产品能不能真正落地。我注意到最近“珈蓝特的CPO测试设备”这个热词在业内传播度上升,它反映的正是这个需求:CPO对精密测试设备的依赖,到了前所未有的高度。

4.1 为什么CPO的测试比传统光模块困难得多

传统可插拔光模块是独立成品,做成一个独立标准形态,测试时插到误码仪、光功率计上就行,完全是成熟标准件测试,各自独立,不互相牵扯。

CPO测试的核心难点在于,光学引擎和ASIC已经封装在一起了,你不能把它拆开来单独测光器件。在封装前,硅光晶圆可以在晶圆级测试设备上做检测,比如用垂直耦合的方法测试波导和调制器性能;但一旦完成CPO封装,光纤已经和硅光引擎对准耦合,再要单独验证ASIC的功能和光电协同的性能,只能用系统级的测试手段。这里牵扯到几类测试设备:

  • 光学测试仪器:可调谐激光器、光功率计、光谱分析仪、高速示波器、误码仪、光衰减器。
  • 晶圆级/封装级光学测试系统:主要包括耦合对准系统、自动光纤阵列对准设备、晶圆级光电测试探针台。
  • 热管理和可靠性测试设备:温度循环箱、高低温测试系统、湿热老化试验箱、激光器老化测试系统。
  • 系统级网络性能测试设备:高速数据流发生器、网络测试仪,验证整体交换性能。

珈蓝特这种公司做的CPO测试设备,正是在后面那几类里,尤其是耦合对准与光电联合测试这类自动化设备。没有这类设备,CPO的量产就是纸上谈兵。

4.2 CPO晶圆测试:在封装之前把坏的找出来

CPO的测试流程在封装前后有不同的侧重点。封装之前做的是硅光裸片测试,也叫芯片测试,目的在于筛掉有明显缺陷的硅光引擎,避免浪费后续昂贵的封装资源。

在这个过程中用到的最核心设备是探针台和光学测试系统,它们把光纤阵列或者透镜光纤悬停在硅光芯片的耦合区上方,通过精密的六轴对准系统,找到耦合效率最高的位置,然后执行光功率扫描、调制器带宽测试、探测器响应度测试等。这个过程非常耗时——所以自动化的光纤对准设备显得格外重要。一个工位如果全靠人工手动对准,一天的吞吐量可能只有几十颗芯片,配上自动对准与快速扫描算法,才可能做到每小时几百颗的规模。

还有个细节是在片加热系统。硅光器件的性能对温度非常敏感,测试时需要把晶圆控制在稳定温度,比如25摄氏度和70摄氏度两种条件下分别测一遍,用来评估器件的温度稳定性。这就意味着探针台不仅要带光学对准模块,还要集成温度控制系统,复杂度进一步上升。

4.3 CPO封装后测试:真实应用场景的性能验证

芯片完成封装之后,整个光学和ASIC的联合体已经成为一个系统,这时候的测试目标是确认“合在一起还能不能正常干活”。

常见做法是做光回环测试:从CPO封装的发射端口发出特定波长的光信号,通过外部光纤环回,进入该封装的接收端口,然后验证整体误码率。这种测试可以绕开外部交换网络,只验证封装内部的光电链路。如果误码率超标,需要进一步排查是激光器退化、调制器带宽不足、光耦合损耗过大,还是ASIC侧接收端的TCK电路问题。

在实际测试中,一个反复出现的坑是DSP的均衡能力不足。CPO链路内部的光电信号质量比传统模块好,坏的就更少,所以有些系统在设计时对DSP的均衡要求放得比较松。但如果温漂导致光模块工作点偏移,光信号质量会急剧下降,超出DSP均衡能力的上限,误码率瞬间飙升。我们后来在测试方案里专门加了一项“温度扫描下的误码率测试”,把封装置于不同温度环境下跑通无误码,才算通过。

4.4 测试设备选型要注意什么

结合珈蓝特这类厂商的CPO测试设备,我能给的建议主要是以下几点:

  • 精度和重复性优先:CPO耦合对准的精度通常在亚微米级别,一台测试设备如果本身的运动控制重复精度不够,测得的数据就没法参考。选设备时不要只看厂商标称的指标,要看实测重复性数据。
  • 支持混测和自动化:CPO的光电测试往往包含多个环节,设备要支持在同一平台上做多种测试,尽量减少工序间搬运带来的误差和时间损耗。
  • 温度和湿度控制:硅光测试对环境的敏感性非常高,测试设备自身要有温湿度补偿机制或测试环境的闭环控制系统,否则光谱测试数据根本没法对比。
  • 软件和算法能力:自动寻光算法、波导对准算法、校准流程的效率,决定了整条产线的吞吐量。同样一台对准平台,软件算法的优劣可以让产线效率拉开3倍以上的差距。

5. 常见问题与故障排查:CPO落地中的“头疼时刻”

5.1 光信号功率异常偏低

应用中最常见的现象就是“光口信号光功率不对劲”。如果CPO模块的发射光功率比预期低好几个dB,大概率是光纤耦合区出了状况。先检查外部光缆的连接器,再考虑内部耦合。

在测试中遇到的耦合恶化,往往是封装过程中引入微粒或湿气,导致耦合端面有污染;或者在热循环中封装基板变形,导致光纤阵列和硅光芯片之间的相对位置发生了细微偏移。前者需要背靠背的老化测试来暴露,后者则对封装材料的热膨胀系数匹配提出了硬性要求。说实话,这两个问题如果在设计阶段没有留足容差,后端的返修几乎不可能,整个器件只能报废。

5.2 激光器光源漂移与闭环控制失效

外置光源方案的激光器位于CPO封装外部,相对好更换一些,但它和封装内部调制器之间的波长匹配却是一个非常关键的稳定性问题。硅光调制器的工作窗口是固定的,而激光器的中心波长受温度影响会漂移,一旦波长跑出调制器的带宽范围,调制效率就会直线下降。

解决思路是加闭环控制:封装内设计有波长锁定器,实时检测激光器波长的偏移量,反馈给光源控制模块,通过调整激光器温度或者驱动电流,把波长拉回目标值。如果在测试中发现“系统在启动稳定后光功率慢慢爬升或下跌”的现象,多半就是这个控制环路没调好,需要重新调PID参数或者检查波长锁定器的校准状态。

5.3 热管理不当导致的性能劣化

CPO的整形难点是单点热密度非常高。交换ASIC本身就是大功率热源,光学引擎又紧贴着它放置。硅光器件的折射率随温度变化很大,微环调制器尤其娇气——只要温度变化超过几摄氏度,工作曲线就完全偏了。

实际项目中我们验证过不同散热方案的差异:风冷方案在机柜环境中,封装表面的局部温差可以达到10摄氏度以上,对光学性能的影响非常明显;液冷方案则可以把温差控制在3摄氏度以内,系统的光谱稳定性和误码率表现明显更好。所以坦白讲,CPO的大规模落地,从物理层面就已经需要液冷来做配合。如果你所在的数据中心连单机柜10千瓦以上的液冷能力都没有,CPO方案的可部署性就很堪忧了。

5.4 维修与返修的尴尬处境

这是CPO对比可插拔方案最尴尬的地方。传统光模块坏了,直接把模块拔下来,用备件替换,间隔不会超过几分钟。CPO封装坏了,只能换整个线卡或整个光引擎模组,代价非常高,操作时间段也长得多。

应对思路是设计上增加冗余:给CPO封装设计更大余量,减少故障率;系统层面做链路冗余,一个封装故障时自动切换流量到备用路径;备件策略上储备线卡而不是光模块。但说白了,这些手段降低了运营事故的影响,却没有改变运维体验变差的事实。

6. 产业链格局与影响:谁能吃到CPO的红利

6.1 从交换机与芯片厂商看

CPO最先落地的领域一定是从交换芯片和AI加速器开始的。博通早在2022年就发布了Tomahawk 5交换芯片的CPO版本,51.2T的交换能力配合CPO光引擎,算是个里程碑式的产品。NVIDIA的Quantum-X系列也布局了CPO方案。国内方面,华为、新华三、锐捷等厂商的CPO原型机已经有过多次展出,但距离大规模商用还有距离。

对芯片厂商来说,最大的变化在于:他们不再只是“把芯片卖出去就行了”,还得提供整套CPO光引擎的参考设计、封装方案、甚至配套测试方案。生意模式的复杂度完全不一样了。

6.2 从封测厂看

CPO对封装能力的需求,是检验半导体公司与传统光器件公司能否合作的一个重要标准。高密度2.5D/3D封装、硅桥互联、共基板的光电混合集成——这是传统封测大厂擅长的领域;而硅光芯片的设计、加工、测试则是光器件厂商的老本行。CPO正好把这两个阵营拧到了一起,台积电、日月光、长电科技都在布局这项能力,有不少和硅光公司合资建产线的例子。

6.3 从测试设备厂商看

回到珈蓝特这类测试设备厂商。CPO测试设备的门槛一点都不比芯片测试设备低。一台全自动CPO测试平台,要同时具备高精度运动控制、光学对准算法、光电信号测试能力、热管理系统和数据分析软件。过去光模块测试设备市场相对分散,哪家都能做一点;但CPO测试设备市场,技术壁垒明显提升,可以说是一门精细活。

整个产业链都在为CPO做技术储备,测试设备是其中不可或缺但又容易被低估的一环。测试设备不只是扮演验证和出厂检查的角色,它在研发阶段帮助快速迭代设计方案、量产阶段帮助提高良率,这种反向价值往往才是最大的。

6.4 CPO的可能应用场景

除了数据中心交换机的经典场景,CPO在AI大模型训练集群里的需求也极其迫切。一方面,AI服务器集群的Scale-Up(纵向扩展)和Scale-Out(横向扩展)网络对带宽密度的要求比传统云数据中心高一个数量级;另一方面,单GPU功耗已经在700W以上,再加光模块功耗,整机柜的供电和散热压力就会非常大。

还有高性能计算(HPC)、云服务商自研交换芯片、光互连背板、边缘计算节点,这些都是CPO短期内最可能落地的应用场景。更远一点看,如果有天光电共封装能延伸到光互连存储、光计算领域,那整个计算体系的结构都会发生很大变化。但那属于更远景了,现阶段的注意力还是应该放在把CPO的良率、测试、可靠性跑通这件事上。

7. 我对CPO发展的一点个人判断

接触CPO这一路,个人体会最深的不是具体的技术参数,而是“物理规律和工程博弈”这两个词的重量。CPO本质上是在跟“信号损耗”“功耗密度”“封装良率”这些物理和工艺极限硬碰硬,每一次性能提升,都是用更复杂的工艺和更大的试错成本换来的。

很多人问我到底该不该现在上CPO。我的看法很直接:如果你的业务对功耗极度敏感、对带宽密度有刚性要求,而且你能接受“整卡替换”这种运维模式,那CPO确实值得认真评估;如果你的部署场景还在800G速率以内、机柜内有比较充裕的功耗预算,那传统可插拔方案短期内仍然够用,可以先等一代。

落到个人层面,我觉得现在开始补硅光基础、信号完整性设计、先进封装工艺相关知识,是一个非常跟得上趋势的投资。测试设备的自动化和算法化能力,在未来三五年的需求量会持续上升。最后一个小建议:如果你在一个正在搞CPO的团队里,一定要把散热设计和光纤耦合细节盯死,那才是决定CPO项目真正成败的两个命门。

需要专业的网站建设服务?

联系我们获取免费的网站建设咨询和方案报价,让我们帮助您实现业务目标

立即咨询