2. 为什么所有旗舰机都在卷 Remosaic:从像素合并的物理瓶颈说起
聊到 Remosaic,得先从手机影像的物理瓶颈说起。传感器就那么指甲盖大的一块,想在有限面积里塞进更多像素,唯一办法就是把每个像素的尺寸做小。早年的 1200 万像素,单像素能做到 1.4μm 甚至更大;到了 5000 万像素时代,单像素被迫压到 1.0μm 左右;而 1 亿像素、2 亿像素的传感器,单像素只剩 0.6μm 上下。
物理尺寸缩小带来的直接问题就是进光量骤减。像素感光面积和边长平方成正比,0.6μm 像素的进光量相比 1.2μm 像素,直接差了四倍。四倍是什么概念?同样一个场景,用小像素传感器拍出来,噪点会明显多一档到两档,动态范围也会被压缩。为了解决这个矛盾,供应商给了一个折中方案:像素合并,也就是大家熟悉的四合一(Binning)技术。
四合一的做法听起来很粗暴:把相邻四个同色像素的输出电压合并在一起,当成一个“大像素”来读数。这样一来,5000 万像素的传感器默认输出 1250 万像素照片,单像素等效尺寸翻倍到 1.2μm 左右,进光量和信噪比都回来了。代价是分辨率没了,5000 万像素的传感器实际只输出 1250 万像素画面。
这时候 Remosaic 的作用就凸显出来了。它要做的事情,简单来说就是:在四合一模式下,把已经“融合”成一个像素的信号,按照某种算法重新“拆开”,恢复出原始 5000 万甚至更多独立像素各自应有的颜色和亮度信息。这就是 Remosaic 算法在手机影像链路中最核心的定位——高像素模式下,从合并后的数据里把细节“重新算回来”。
理解了这点,你就明白为什么 2023 年之后几乎所有旗舰机的“高像素模式”都依赖 Remosaic 了。三星一亿像素传感器、豪威 OV50H、索尼 IMX989 这类大底传感器,默认场景几乎全部走四合一输出,只有用户在专业模式或高像素模式下,才会触发 Remosaic 流程生成全分辨率样张。换句话说,Remosaic 不是“锦上添花”的滤镜,而是超高像素传感器能落地为真实拍照体验的必经之路。
那 Remosaic 到底是不是“真像素”?严格来说,它输出的每一个像素并不像传统拜耳阵列那样是物理像素直接读出来的,而是通过算法重建出来的。但重建质量足够高的时候,物理像素和重建像素之间已经没有肉眼可分辨的差异。后面我会详细拆解它是怎么做到的。
3. 从拜耳阵列到 Remosaic:核心原理与三种主流实现路径
3.1 一张图看懂拜耳阵列和 CFA 插值
要真正理解 Remosaic,必须先搞懂传感器的颜色采样机制。绝大多数手机传感器用的都是拜耳阵列(Bayer Array),也就是每个物理像素上覆盖着一层滤色片,只让红、绿、蓝三色之一的光通过。最常见的排列是 RGGB:每四个像素一组,其中两个绿色、一个红色、一个蓝色。理由很直接,人眼对绿色最敏感,所以绿色采样点数量占一半。
传感器输出的原始数据,每像素只有一通道颜色值,这就是所谓的 RAW 图。要得到一张正常的彩色照片,得靠 ISP 里的 demosaic(去马赛克)算法,根据相邻像素的颜色信息,把缺失的两个通道猜测出来。比如有一个像素只有绿色值,它的红色和蓝色值就要参考附近红、蓝像素的读数插值得到。这个插值过程,业内叫 CFA 插值。
传统 demosaic 算法已经非常成熟,从最朴素的双线性插值,到后来的方向自适应插值、基于梯度的边缘感知算法,再到基于深度学习的 demosaic 模型,都能在“脑补”颜色上取得不错效果。但 Remosaic 和普通 demosaic 有个本质区别:普通 demosaic 处理的是一张已经保持了拜耳排列完整结构的 RAW 图,而 Remosaic 处理的是已经被四合一“砸碎”了空间关系的数据。
这个区别非常关键。四合一之后,四个相邻同色像素的信号被合成一个输出,它们的空间位置信息全部丢失。比如原本位于(0,0)、(1,1)两个绿色像素各自不同的亮度值,合并后只剩一个平均值。Remosaic 的任务,就是在只有平均值的情况下,把这两个像素可能的原始值还原出来。这就不是一个简单的插值,而是一个病态逆问题(ill-posed problem),因为可以用无数种组合得到同一个平均值,算法必须通过先验知识和模型来选出最合理的一组。
3.2 三次实现路径:从纯工程反推到深度学习一步到位
先说第一种,也是最经典的做法:反向四合一(Reverse Binning)。原理上,它把四个像素的合并值,按空间均匀分布再拆回四个像素。比如一个 2x2 的平均值,直接复制成四个相同值。然后,再用专门设计的色彩分离矩阵(一个 3x3 或更大的线性矩阵),把这个“伪拜耳”数据变成 RGB 全彩。这类方案的优势在于计算量极小、完全可硬件化,基本不消耗额外的处理时间。缺点也很明显,细节恢复能力弱,合并过程中丢失的高频信息是找不回来的,拍出来的高像素照片放大看容易有涂抹感。
第二种是目前主流的方案:基于信号模型的单帧重建。它利用四合一模式下的多帧信息(有些传感器支持在四合一采样时同时记录低分辨率下的高动态信息,或者利用多个相邻合并块之间的关系),建立信号模型来估计原始像素的统计分布。典型做法是先对合并后的图像做频域分析,利用同色像素之间的强相关性,设计一组频域恢复滤波器,从低频分量中推测出高频分量。因为自然图像的能量主要集中低频,高频信息占比重但感知重要,所以只要能合理恢复出边缘方向上的高频,视觉观感就有质的提升。这类方案在计算复杂度上比反向四合一高一两个数量级,但如今旗舰机的 ISP 或 AP 的 NPU 算力足以支撑,因此已经成为各家影像系统的标配。
第三种是近两年才逐渐落地的高端方案:端到端深度学习重建。直接把四合一 RAW 图输入到一个卷积神经网络里,网络输出高分辨率全彩图。这里有个很有意思的设计思路——不再区分“几个阶段”,而是在一个模型里同时完成去马赛克和超分辨率。通过大量成对的低分辨率RAW和高分辨率全彩GT数据训练,网络实际上学到了自然图像中边缘、纹理、噪点分布的先验知识,所以输出结果在感知质量上往往比前两种都好。缺点是需要额外占用大量算力,且模型体积大、对温升和功耗有压力,这也是为什么很多手机在普通高像素模式下默认不是端到端 Remosaic,而是把深度学习方案留给“AI高像素”或夜景高感模式。
3.3 为什么说 Remosaic 是“有损重建”,但观感可以超越无损
要接受一个现实:Remosaic 的物理本质决定了它输出的信息量不可能超过四合一之前 RAW 图的信息量。合并过程本身就是一次有损压缩,四个像素变一个,高频细节和随机噪声混在一起,后期怎么恢复都很难做到“完美”。但这不代表 Remosaic 没有价值。
关键在于,图像感知质量的瓶颈往往不在“绝对信息量”,而在“噪声结构”和“边缘过渡”。如果算法能非常准确地估计边缘方向和纹理走向,再配合多帧堆栈技术(同一场景快速拍摄多张四合一 RAW,在重建时一起送进算法),就可以在保持高像素输出的同时大幅降低噪点。这也是为什么现在很多旗舰机的 5000 万高像素模式,不再是单张拍摄,而是“多帧RAW融合+Remosaic”的组合。
换句话说,Remosaic 算法发展到现在,更多是在“物理丢失的信息”和“人眼感知的需求”之间找平衡。物理上丢掉的细节无法完全还原,但感知上关键的边缘锐度、纹理清晰度、色彩过渡,却可以通过合理建模补回来,最终呈现的观感反而能超越早期“硬拼物理像素”的直出效果。
4. 从像素到尺寸:Remosaic 的工程实现与系统优化细节
4.1 整体流程拆解:RAW域 vs RGB域的选择
Remosaic 在手机上落地,通常摆在 ISP 流程的什么位置?这个顺序直接影响最终的图像质量。
最简单粗暴的做法是在 RGB 域做。先把四合一 RAW 图做普通 demosaic 得到一个低分辨率彩色图,然后通过超分辨率算法恢复到目标分辨率。这种方案的缺点是,超分辨率算法面对已经是彩色的图像,很难区分哪些细节是真实结构、哪些是 demosaic 引起的伪彩,结果就是边缘容易出现紫边或锯齿。
更工程化的做法是在 RAW 域直接做 Remosaic。四合一 RAW 图输入后,先在 RAW 格式下完成像素拆分,得到一张完整的拜耳排列高分辨率 RAW 图,然后再走标准 demosaic 流程。这个顺序的好处是,计算过程始终跟原始数据保持最近距离,噪声特性和色度分离也更容易建模。实测下来,RAW 域重建在边缘自然度和细节保真度上明显优于 RGB 域方案,代价是算法实现的复杂度更高,尤其是滤波器的设计要和具体传感器的噪声模型强相关。
4.2 工程优化这些坑,我踩过的都在这儿
第一点是存储带宽。一亿像素的传感器,单帧 Bayer RAW 数据量可能超过 100MB。如果用多帧堆叠的话,内存带宽和存储延迟会成为瓶颈。工程上常用的手段是“分块处理”,把一帧数据切成 8x8 或 16x16 的块,每个块单独做 Remosaic,块与块之间留几个像素的重叠区,避免拼接痕迹。
第二点是时延控制。用户在按下快门的一瞬间到预览出图,如果耗时超过 1 秒,体验会非常糟糕。高端方案通常会走“预览路径和成片路径分离”:预览时快速出图(用轻量级反向四合一甚至直接四合一输出),按下快门后才启动高质量 Remosaic 全流程。中间还有一个细节,当时延超过 300~400ms 时,需要同时显示一个进度动画,不然用户会怀疑快门没生效。
第三点,也是我觉得最值得强调的,是关于参数标定。Remosaic 算法的核心模型参数,比如色彩分离矩阵、频域恢复滤波器的系数,并不是通用的,必须针对每一颗传感器单独标定。换了传感器型号一定要重新跑一遍标定流程。我见过有团队为了省事,直接把上一颗传感器的参数拷贝到新传感器上,结果绿色通道出现明显色偏,而且这个问题在某种特定光线下尤其严重,反而是室内混合光源下看不太出来。这类 bug 特别坑,因为不是每个测试场景都能复现的。
还有一点调试心得值得写下来:评估 Remosaic 输出画质时,不能只看最终 JPEG 或预览图,要看中间层。把 Remosaic 后的 RAW 图导出来,用同样的 demosaic 参数处理,再对比四合一后直接 demosaic 的结果。这样你能清晰看出 Remosaic 算法到底恢复了多少细节,也方便定位问题是出在重建阶段还是后续的降噪模块把细节抹掉了。
4.3 如何验证一张高像素照片真的“重建成功”
测 Remosaic 有没有做好,业内常用的客观指标有几个。中心/边缘的 MTF50 值(模量传递函数,值越高表示锐度越好)是基础,另一个值得关注的是伪彩面积占比,一般的测试卡里都有专门的彩色条纹区域,重建算法最容易在密集条纹处产生颜色溢出。再有就是摩尔纹出现的频率:在细小纹理区域如果经常出现彩虹色波纹,说明算法在高频区域的约束不够,需要调整频域恢复的权重。
主观评价上,经验法则是把照片在 100% 时放大,找几个关键区域扫一眼:发丝边缘是不是有锯齿、建筑边缘有没有彩边、草坪或树叶的颗粒感是不是均匀。如果这三个区域都没有明显异常,基本可以认为 Remosaic 流程图达到了可用状态。再往上抠细节,就得靠专业实验室的视觉盲评了。
5. 设备端落地实测与调参经验:我用三颗传感器的对比记录
实话说,纸上谈兵终觉浅。我前前后后调过三颗不同品牌的传感器做 Remosaic 适配,分别是 5000 万像素、1 亿像素和 2 亿像素的型号,中间踩了很多坑,这篇把关键经验写下来给同行参考。
5.1 实测:三颗传感器的重建质量差异
同样是 5000 万像素输出,三颗传感器的表现差异很大。小像素的传感器信号读取噪声更高,尤其是暗光环境下,四合一 RAW 的噪声协方差模型会比大像素传感器复杂得多。如果用同一套频域恢复系数去套,暗部区域会出现一种非常典型的“网状结构噪声”:噪点在 Remosaic 后被排列成整齐的格子,看起来特别像 JPEG 压缩的块效应。这是我最开始没预料到的。
对比数据更直观。用标准 ISO 12233 测试卡,在 D65 光源下,1 亿像素传感器的中心 MTF50 比 5000 万像素高约 12%,边缘部分差距缩小到 6% 左右。但 2 亿像素传感器的优势主要体现在放大裁剪的场景:100% 裁切中心画质依然扎实,低频纹理过渡很自然。反过来,2 亿像素在弱光场景如果不开多帧,重建后的噪点会非常辣眼睛。这个现象背后的原因不难理解:像素尺寸越小,每个像素收集的光子越少,量子噪声对信号的干扰比例就越高。
这三组实测提醒我一个重要原则:Remosaic 的参数调优不能只盯明亮光线的表现,一定得给暗光场景预留专用的参数分支。否则就算白天成像再锐利,夜间模式一开就露馅。
5.2 调参心法:不要迷信单一指标
在调参过程中,我试过只优化 MTF50 数值,结果出来一张处处是伪彩和振铃效果的照片,数字好看但观感一塌糊涂。原因是 MTF50 反映的是对比度恢复程度,并不关心过冲和振铃。所以我的建议是:优化目标里必须同时包含锐度、伪彩面积、摩尔纹频率三项目标,再辅以人眼主观盲评。
具体到系数调节,有几个可以实操的技巧。频域恢复滤波器的通带频率建议先从传感器的 MTF 曲线反推一个初始值,不要拍脑袋设。噪声模板的建模要用“多帧平均值法”:对着均匀灰卡拍几十张,计算各位置的亮度方差,这样得到的空间噪声分布比单张估计更稳定。色彩分离矩阵的系数,用 X-Rite ColorChecker 色卡做最小二乘拟合,比手动调色准得多。
最后提一个偶发但致命的坑:某些传感器在四合一模式下,像素合并并非严格的四个同色像素相加,而是采用了一种 Foveon-like 的排列,也就是相邻像素读出的信号会混合相邻通道的部分响应。这时候如果还用标准的反向四合一模型,重建出来的颜色会偏得很离谱。遇到这类传感器,唯一靠谱的方法是用一个带高分辨率彩色参考图的场景去拟合一个颜色解耦矩阵。这种问题在供应商文档里经常写得含糊其辞,一定要靠实测数据反向验证。
5.3 各厂商工程实现差异:三星、豪威、索尼的路线对比
圈内做影像的人都知道,不同传感器厂商的 Remosaic 工程路线差异不小。
三星是推得最激进的,从 HM1 到 HM3,以及最新的 ISOCELL HP2,都在传感器端直接集成了硬件 remosaic 单元,也就是在读出电路层面就完成部分重建,AP 只需做后续的 demosaic 和调优。硬件方案的好处是速度快、功耗低,缺点是可编程性差,算法升级得靠传感器固件配合。
豪威的路线更偏向让 AP 端发挥算力,传感器本身只提供四合一模式所需的排列和数据架构。这种方案灵活性高,不同手机品牌可以做出差异化的重建效果,但对芯片算力和工程师水平要求更高。
索尼相对保守,很长时间里都坚持大像素路线,IMX989 这类传感器即使是全尺寸输出也更多依赖传统 demosaic,而不是激进的 Remosaic。不过索尼最近也推出了支持高像素输出的方案,只是相比三星更加谨慎,更强调在暗光下的非线性优化。
这三种路线没有绝对优劣。硬件方案稳定高效但后期升级空间小,AP 方案灵活但调试成本高。对于中小团队来说,选择豪威这类对 AP 开放的方案更可控;如果追求极致的出图速度和低功耗,三星的一体化方案自然是首选。
6. 常见问题与排查技巧实录
6.1 高像素模式下边缘出现“锯齿迷宫”怎么办
现象:垂直或接近垂直的边缘线上,重建后的像素呈锯齿状,而且锯齿不是规则的阶梯,而是相互交错的迷宫状图案。这是典型的边缘方向估计失败:四合一后边缘方向信息丢失,重建算法无法判断边缘朝哪个方向延展,只能用局部统计模型猜,猜错就产生这种“错位狗牙”。
排查思路:先确认是否只在特定颜色通道出现。如果是红色边缘有迷宫锯齿而绿色边缘正常,大概率是色彩分离矩阵和频域滤波器之间不匹配,导致某个通道的高频被过度增强。解决方案是把该通道的频域增益降下来,或者引入一个跨通道的边缘一致性约束。如果所有通道都有问题,重点检查你的方向自适应滤波器是否在强边缘处没有正确切换方向,考虑改用更稳健的各向异性扩散模型。
6.2 Remosaic 处理时间突然翻倍,帧率掉了一半
现象:同一台设备、同一个版本,某天开始 Remosaic 处理时间从 300ms 跳到 600ms 以上。
排查路径:先查存储带宽,大概率是内存碎片或缓存命中率下降。如果分块处理时块尺寸设置不当,比如块之间的重叠区太大,重叠区的重复计算会指数级增加。另外别忽略温升:NPU 连续高负载后温度上来,变频降频导致算力下降,这种问题在夏天室外尤其明显。建议在代码里加一个温控感知的分级策略,温度超过阈值时切换到轻量重建路径,保证预览不断流。
6.3 重建后的照片出现全局色偏,但白平衡参数是正确
现象:拍灰卡,RawRGB 三通道均值都接近,白平衡增益也正确,但 Remosaic 输出仍然偏黄绿。
原因:色彩分离矩阵在低照度下发散。四合一模式下暗部信号的随机噪声比例高,线性矩阵会把噪声放大到某个色彩分量上,造成色偏。我之前调过的一颗传感器,在 ISO 1600 以上如果不加噪声正则化项,绿色通道的噪声放大倍数比其他通道高约 40%,整个画面就发绿。
解法:在色彩分离矩阵中加入一个噪声感知的收缩项,或者提前对 RAW 图做一层轻量去噪,把噪声方差降下来再进重建,色偏会明显减弱。另外检查一下矩阵是否用了 float16 精度,低照度下的小信号很容易被浮点数精度吃掉,改成 float32 有时也能解决问题。
6.4 一个速查表:常见 Remosaic 画面问题对照
| 画面异常 | 可能原因 | 排查方向 | 常用缓解手段 |
|---|---|---|---|
| 边缘锯齿/迷宫纹 | 边缘方向估计失败 | 检查边缘检测阈值、滤波器方向切换逻辑 | 引入各向异性扩散、降低高频增益 |
| 绿色通道色彩偏亮 | 色彩分离矩阵对不同通道增益不平衡 | 检查矩阵系数、噪声放大倍数 | 加入噪声感知收缩项、约束矩阵行和 |
| 暗部块状噪点 | 噪声模型不匹配 | 检查传感器噪声协方差标定 | 增加暗部去噪预滤波、调低重建增益 |
| 摩尔纹过多 | 高频恢复过冲 | 检查频域滤波通带是否过宽 | 收窄滤波器通带、添加抗混叠约束 |
| 画面整体发糊 | 重建后降噪力度过大 | 检查降噪强度与重建参数联动 | 降低后续降噪强度、改用保边降噪 |
7. 收尾:Remosaic 的未来与一点个人心得
从纯技术层面看,Remosaic 的本质是在像素合并的有损信息里插入先验知识,把物理丢掉的细节尽量修复回来。这种“我比你更知道这里本该是什么”的思路,其实和超分辨率、图像修复、去噪这些底层视觉问题是同一条线索上的不同分支。随着 AI 模型在移动端算力上的持续跃迁,我判断未来高端机会越来越倾向端到端深度学习方案,统一的模型同时完成重建、降噪、色彩还原,最终目标可能是在单帧 RAW 输入下获得接近物理原生高像素的成像质量。这个方向的关键不只是网络结构本身,还在于高质量的训练数据准备,特别是真实场景下带精确对齐的 RAW 对数据。
最后分享一个自己反复验证过的小技巧:评估 Remosaic 效果时,条件允许的话就做一个两次拍摄对比,第一次用高像素模式,第二次用普通四合一模式,拍摄同一个静态场景,然后在 Photoshop 里把两张图各放大到 300% 以上,来回切换对比细节。四合一直出的图噪声更少、色调更稳,但边缘信息是软的;Remosaic 的图边缘更硬、细节更丰富,但同时也能暴露出算法用力过猛导致的伪纹理。你在对比时重点关注头发丝、建筑栏杆、树叶缝隙这三类容易被算法“瞎编”的区域,只要这些地方不过度扭曲,这张重建结果就能打高分。