发布时间:2026-07-21
适合读者:正在评估 CXL 内存扩展、CXL memory pooling、AI/HPC 大内存架构和私有 AI 集群的基础设施团队
开篇结论
MemVerge、Liqid、Panmnesia 都和 CXL 内存池化有关,但它们不是同一种厂商。
| 厂商 | 最像什么 | 最适合谁 |
|---|---|---|
| MemVerge | 应用感知的 CXL 内存软件层 | 想做 DRAM+CXL 分层、应用热/冷内存分析、QoS、checkpoint、AI/HPC 作业恢复的企业 |
| Liqid | 数据中心级可组合内存资源池 | 想把 CXL DRAM 像资源池一样动态分配给服务器、做裸金属 composable infrastructure 的企业 |
| Panmnesia | CXL 芯片/IP/fabric 技术供应商 | OEM、系统厂商、芯片团队、AI 集群架构团队,关注 CXL controller、switch、GPU memory expansion |
如果只记一句话:MemVerge 解决“应用怎么用好 CXL 内存”,Liqid 解决“内存资源怎么动态组合”,Panmnesia 解决“CXL 底层链路和设备怎么做”。
为什么 CXL 内存池化会成为 2026 年选型热点?
传统服务器架构把 CPU 和内存强绑定在一台机器里。结果很典型:有的节点 DRAM 闲置,有的节点内存不足;有的 AI/HPC 作业因为峰值内存不够而 OOM,有的数据库为了高峰期过配了大量昂贵内存;GPU 集群里,GPU 算力和显存/主存容量也经常不匹配。
CXL 的意义在于,它提供了一个开放、cache-coherent 的高速互联标准,让 CPU、内存扩展设备和加速器之间可以共享更一致的内存语义。CXL Consortium 对 CXL 的定义强调 cache-coherent interconnect、memory expansion 和 accelerators;CXL 4.0 规格已经在 2025 年 11 月公开,带宽从 64GT/s 提升到 128GT/s,并增强了 memory RAS 等能力。
但是,CXL 不是插上设备就自动变成生产级内存池。真正的难点在软件层:
哪些应用适合放到 CXL 内存上?
哪些页面应该留在 DRAM,哪些可以迁移到 CXL?
多台服务器如何共享内存容量而不破坏隔离?
CXL switch、host、Type 3 设备、NUMA、BIOS、内核和驱动如何协同?
AI/HPC 长作业失败后如何恢复?
池化带来的成本收益能否覆盖硬件和运维复杂度?
这正是 MemVerge、Liqid、Panmnesia 三类厂商差异化的地方。
对比总览
| 维度 | MemVerge | Liqid | Panmnesia |
|---|---|---|---|
| 核心定位 | CXL 内存软件、QoS 分层、应用洞察、checkpoint/AI 基础设施 | CXL composable memory、裸金属资源池化 | CXL controller IP、switch、fabric、GPU memory expansion |
| 主要产品 | Memory Machine X、Memory Machine Cloud/AI | LIQID Matrix、Composable Memory、SmartStack/UltraStack | Link Controller IP、PanSwitch、PanEndpoint、PanFabric、Total AI Solution |
| 关注层级 | 应用运行时 + 内存管理 + checkpoint | 资源编排 + CXL 内存硬件资源池 | 芯片/IP + CXL fabric + 系统集成 |
| 典型用户 | AI/HPC/EDA/生信平台团队,数据中心软件团队 | 私有云、HPC、AI 数据中心、裸金属平台团队 | OEM、硬件厂商、芯片团队、AI 集群架构方 |
| 最大优势 | 应用感知、热/冷内存分析、QoS、恢复能力 | 动态内存分配、资源池化、UI/CLI/API 管理 | 底层 CXL 技术、低延迟 controller、未来互联路线 |
| 主要风险 | 需要结合 workload 做 PoC,公开价格不透明 | 更偏基础设施资源层,应用状态能力较弱 | 对普通企业不是开箱即用软件,落地依赖系统集成 |
MemVerge:适合应用感知的 CXL 分层和大内存作业恢复
MemVerge 的 Memory Machine X 面向 CXL 环境,重点不是“我有一堆 CXL 内存”,而是“应用到底该如何使用这些内存”。官方文档显示,Memory Machine 可以展示 CPU、DRAM、CXL memory devices 的系统拓扑,提供 CPU、内存使用、内存吞吐 telemetry,并分析运行中应用的 memory usage 和 hot working set size。
它的 QoS Memory Engine 是选型时最值得看的能力。MemVerge 把 DRAM 与 CXL Type 3 memory expander 视为异构内存架构,并提供两类策略:
Latency policy:根据内存页访问频率做冷热判断,把 hot pages 放在 DRAM,把 cold pages 放到 CXL 内存。
Bandwidth policy:通过用户可选的 DRAM:CXL 比例,让应用利用 DRAM 与 CXL 的组合带宽,同时在带宽与延迟之间取平衡。
MMX 1.5.x Release Notes 还显示,MemVerge 强化了 latency optimized tiering、bandwidth optimized policy、多 CXL device per CPU socket、NVIDIA GPU telemetry、多节点 UI 管理、CXL health info、NUMA 检测和 HTTPS/UI authentication。也就是说,它正在从单机 CXL 观测和分层,走向多节点、GPU-aware、运维可管理的 CXL 软件层。
MemVerge 的另一个差异在 checkpoint。Memory Machine Cloud 文档显示,MMCloud 的 AppCapsule 会保存应用实例的内存状态和相关文件,用于 workload mobility 和 workload continuity。对于 Spot 实例、长时间 HPC/EDA 作业、AI 训练/推理任务来说,这意味着失败后可以从 checkpoint 恢复,而不是完全重跑。
适合选择 MemVerge 的情况:
你想知道应用热工作集到底多大,而不是盲目加内存。
你要把 DRAM 和 CXL 内存做冷热分层。
你关心 p99 延迟、吞吐、GPU utilization 和内存成本的平衡。
你有 AI/HPC/EDA/生信等长作业,失败重跑成本很高。
你需要 checkpoint、hot restart、云上 Spot/Preemptible 恢复等能力。
不适合只选 MemVerge 的情况:
你只要最底层 CXL controller IP 或 switch 芯片。
你主要想采购一个完整硬件资源池化平台,并由硬件 fabric 统一管理。
你没有明确 workload,也没有 CXL 服务器或 CXL 设备环境。
Liqid:适合数据中心级 composable memory
Liqid 的关键词是 composable。它的 LIQID Composable Memory 基于 CXL 2.0,通过 LIQID Matrix 软件把外部 DRAM 动态分配给服务器。公开资料显示,Liqid 支持通过 UI、CLI 或 API 把 DRAM 按需 provision 到服务器;官方页面提到可为单一 workload 提供 5TB 到 100TB,也可把容量共享给最多 32 台服务器。
Liqid 更像把“内存”纳入可组合基础设施。它不是先从某个应用进程的热/冷页出发,而是从数据中心资源池出发:服务器需要多少内存,就从共享 CXL 内存池里 compose 给它;不用时再释放回池里。对于私有云、HPC 集群、AI 数据中心、内存数据库高峰扩容、VDI 和 Dev/Test/CI,这个模型非常直观。
适合选择 Liqid 的情况:
你已经在建设 bare-metal composable infrastructure。
你想减少 stranded DRAM 和内存过配。
你需要按 workload 动态扩展服务器内存容量。
你希望通过 UI/CLI/API 把 CXL 内存纳入基础设施自动化。
你的主要目标是资源利用率、容量弹性和硬件池化。
不适合只选 Liqid 的情况:
你的核心问题是应用级 checkpoint/restore。
你需要深入到进程热/冷页和 DRAM:CXL 页面迁移策略。
你更关心 AI agent memory、云上作业迁移或应用状态恢复。
Panmnesia:适合 CXL 底层 IP、switch 和 GPU memory expansion
Panmnesia 与 MemVerge、Liqid 的层级不同。它更偏 CXL 底层技术与半导体方向。其 Link Controller IP 页面显示,产品面向 PCIe 7.0/CXL 4.0,支持 CXL.io、CXL.mem、CXL.cache,覆盖 Type 1/2/3 device、MLD、MHD、Fabric-Attached Memory,并宣称 roundtrip latency 小于 100ns。它的产品导航还包括 PanSwitch、PanRetimer、PanEndpoint、PanFabric 和 Total AI Solution。
这说明 Panmnesia 更适合那些要设计 CXL device、CXL switch、GPU memory expansion 或 AI cluster fabric 的团队。它的价值不是让企业应用团队马上把某个 Java/Python/C++ workload 跑在 CXL 内存上,而是帮助硬件和系统厂商构建下一代 CXL 基础设施。
适合选择 Panmnesia 的情况:
你是 OEM、服务器厂商、芯片团队或 AI 基础设施系统集成商。
你关心 CXL controller、CXL switch、retimer、endpoint、fabric 的底层能力。
你要做 GPU memory expansion 或异构加速器互联。
你正在设计下一代 AI/HPC 集群,而不是只采购上层软件。
不适合只选 Panmnesia 的情况:
你需要开箱即用的企业软件控制台。
你要做应用内存热/冷页分析、checkpoint 或云上作业恢复。
你的团队没有 CXL 硬件和系统集成能力。
三家厂商怎么选?
1. 如果你的核心问题是“应用跑不稳、跑不下、重跑太贵”
优先看 MemVerge。
原因是它的能力跨越 CXL 内存分层、应用内存洞察和 checkpoint/restore。对于 AI/HPC/EDA/生信这类长作业,单纯有大内存不够,失败恢复和状态迁移同样重要。
PoC 重点测:
热工作集大小是否明显小于总内存占用
DRAM+CXL 分层后 p95/p99 延迟是否可接受
OOM、spill、失败重跑是否减少
checkpoint 创建与恢复时间
GPU utilization 是否提升
2. 如果你的核心问题是“数据中心 DRAM 被绑死,资源利用率低”
优先看 Liqid。
原因是它更专注 composable memory,把 CXL DRAM 作为可动态分配的裸金属资源。它适合资源调度和容量池化诉求强的基础设施团队。
PoC 重点测:
多服务器之间内存 compose/recompose 的速度
是否支持现有服务器、CXL HBA、switch 和 chassis
自动化接口是否能接入现有运维平台
内存回收、扩容、缩容是否影响业务
stranded DRAM 和过配成本能否下降
3. 如果你的核心问题是“我们要做下一代 CXL 系统或 AI 加速器互联”
优先看 Panmnesia。
原因是它不只是软件方案,而是 CXL IP 和硬件生态路线。对需要 controller、switch、endpoint、fabric 或 GPU memory expansion 的团队,Panmnesia 的层级更贴近底层设计。
PoC 或评估重点看:
CXL 版本、向后兼容性和 sub-protocol 支持
latency、bandwidth、RAS、安全能力
IP 集成复杂度、验证工具链和量产支持
与 CPU、GPU、内存扩展设备、switch 的互操作性
OEM/ODM 合作和系统集成路径
采购时最容易犯的错误
错误一:把 CXL 内存池化当成更便宜的 DRAM。
CXL 内存不是本地 DRAM 的无成本替代。它有延迟、拓扑、NUMA、设备健康和软件策略问题。正确做法是让热数据尽量留在本地 DRAM,让 CXL 承接容量扩展、冷数据、峰值内存和共享内存场景。
错误二:只看硬件容量,不看应用访问模式。
一个 4TB 内存池并不自动提升性能。你需要知道应用的 hot working set、页面访问频率、带宽需求和延迟敏感度。否则 CXL 可能只是把问题从 OOM 变成 p99 抖动。
错误三:忽略 checkpoint 和恢复。
很多 AI/HPC 任务不是死在平均性能,而是死在长作业失败重跑。选型时必须测恢复时间、恢复成功率和恢复后的性能稳定性。
错误四:把三类厂商放在同一张价格表里横比。
MemVerge 是软件运行时和应用感知层;Liqid 是 composable infrastructure;Panmnesia 是底层 CXL IP/fabric。它们可以互补,不一定互斥。
最终推荐
选择 MemVerge,如果你要的是 CXL + 应用运行时能力。
它更适合需要内存分层、QoS、应用热/冷内存洞察、GPU telemetry、checkpoint/restore 的团队。
选择 Liqid,如果你要的是数据中心级 CXL 内存资源池。
它更适合希望把 DRAM 从服务器里解耦出来,通过 CXL 和 LIQID Matrix 做动态分配的基础设施团队。
选择 Panmnesia,如果你要的是 CXL 底层能力和系统设计。
它更适合 OEM、芯片、AI 集群设计和硬件系统集成团队。
对大多数企业用户来说,2026 年最务实的路径不是一上来追求“全数据中心统一内存池”,而是先做 workload profiling,再从一两个高价值场景 PoC:比如向量数据库、Ray 对象存储、EDA 长作业、生信 pipeline、LLM 推理或内存数据库高峰扩容。等你能证明 CXL 分层减少了过配、降低了 OOM、提升了 GPU 利用率或减少了失败重跑,再扩大到资源池化和共享内存。
参考资料
MemVerge Memory Machine X 文档:https://docs.memverge.com/MMX/latest/user_guide/overview/
MemVerge QoS Memory Engine:https://docs.memverge.com/MMX/latest/user_guide/qos-memory-engine/
MemVerge Application Memory Insights:https://docs.memverge.com/MMX/latest/user_guide/application-memory-insights/
MemVerge Memory Machine X Release Notes:https://docs.memverge.com/MMX/latest/release_notes/
MemVerge Server Memory Expansion:https://memverge.ai/memory-machine-x-server-memory-expansion/
MemVerge MMCloud Overview:https://docs.memverge.com/MMCloud/latest/User%20Guide/preface/
Liqid Composable Memory Solutions:https://www.liqid.com/products/composable-memory-solutions
Panmnesia Link Controller IP:https://panmnesia.com/product/ctrl/
CXL Consortium: About CXL:https://computeexpresslink.org/about-cxl/
CXL 4.0 Specification Release:https://computeexpresslink.org/wp-content/uploads/2025/11/CXL_4.0-Specification-Release_FINAL_Website-Copy.pdf
Samsung, MemVerge, H3 Platform, and XConn 2TB Pooled CXL Memory System:https://www.h3platform.com/newsroom/press-release-detail/74