MiniCPM-o 4.5 的原始、GGUF、AWQ 版本如何按显存大小选择?
【免费下载链接】MiniCPM-VA Pocket-Sized MLLM for Ultra-Efficient Image and Video Understanding on Your Phone项目地址: https://gitcode.com/GitHub_Trending/mi/MiniCPM-V
MiniCPM-o 4.5 是 MiniCPM-V 仓库中最新的端到端全模态模型(基于 SigLip2、Whisper-medium、CosyVoice2 和 Qwen3-8B,总参数 9B),官方开放了三类权重:原始 PyTorch 版本、GGUF 版本和 AWQ 量化版本。在自己显卡上部署时,第一个问题就是显存装得下哪个版本。本文依据 README.md 中 Model Zoo 的显存数据和各部署路径的最低要求给出选择判据,并给出原始 PyTorch 版本完整可执行的安装、初始化与输出验证步骤。
三个版本与文档给出的显存数据
README 的 Model Zoo 表格对 MiniCPM-o 4.5 的三个版本给出了如下记录:
| 版本 | 模型标识 | 设备 | 显存(文档数值) | 文档描述 |
|---|---|---|---|---|
| 原始 | openbmb/MiniCPM-o-4_5 | GPU | 19 GB | The latest version, strong end-side multimodal performance for vision, speech and omni-modal live streaming on end-side devices. |
| GGUF | openbmb/MiniCPM-o-4_5-gguf | GPU | 10 GB | The gguf version, lower memory usage and faster inference. |
| AWQ | openbmb/MiniCPM-o-4_5-AWQ | GPU | 11 GB | The AWQ quantized version, lower GPU memory usage. |
README 的 "Easy Usage" 部分同时说明了三个版本各自的定位:"Basic usage, recommended for 100% precision: PyTorch inference with Nvidia GPU",其余端侧适配包括 "(1) llama.cpp and Ollama support for efficient CPU inference on local devices, (2) int4 and GGUF format quantized models in 16 sizes, (3) vLLM and SGLang support for high-throughput and memory-efficient inference"。也就是说:原始版本走 PyTorch + Nvidia GPU,精度基准;GGUF 版本走 llama.cpp / Ollama,主打低内存占用和更快推理;AWQ 是量化版本,用于降低 GPU 显存占用。
按显存大小对号入座
结合 Model Zoo 的显存数值和 README 中各部署路径明确写出的最低要求,选择判据如下:
- 显存 28 GB 及以上:选原始 PyTorch 版本。README 的 Web Demo 部署一节("PyTorch + Nvidia GPU, lossless performance (Recommended)")明确要求 "Nvidia GPU with at least 28GB GPU memory",并附注 "We are working on optimizing the model for lower GPU memory usage"。这是文档中唯一针对 MiniCPM-o 4.5 完整功能(full-duplex omnimodal live streaming 等)给出的 GPU 显存门槛。
- 显存约 19 GB 一档:Model Zoo 标注原始版本显存为 19 GB,因此 19 GB 及以上显存的显卡是原始版本的参考区间;但要注意它达不到上述 28 GB 的完整 Web Demo 要求。
- 显存 10~12 GB:选 GGUF(10 GB)或 AWQ(11 GB)。README 的 llama.cpp-omni 部署一节写明,低资源 Nvidia GPU 的要求是 "low-resource Nvidia GPU with at least 12GB GPU memory",即可运行 half-duplex speech realtime conversation 和 full-duplex omnimodal live streaming。12 GB 显卡跑 GGUF 版本是该路径的文档依据。
- 显存低于 10 GB:README 中没有给出 MiniCPM-o 4.5 的更低显存部署版本或路径,文档不支持这一档,不建议自行降档运行。
没有 Nvidia GPU 的 Mac 用户,文档给出的判据基于内存而非显存(llama.cpp-omni 一节):half-duplex 语音实时对话需要 Apple M3/M4/M5 芯片且至少 16GB RAM;full-duplex 全模态直播流需要 Apple M4 Max 芯片且至少 24GB RAM。
原始 PyTorch 版本:安装、初始化与验证
1. 安装依赖
README 说明该部分要求在 Python 3.10 上测试,并特别提示必须使用transformers==4.51.0:"Please ensuretransformers==4.51.0is installed, as other versions may have compatibility issues (under investigation)"。
不带 TTS 或流式推理:
pip install "transformers==4.51.0" accelerate "torch>=2.3.0,<=2.8.0" "torchaudio<=2.8.0" "minicpmo-utils>=1.0.5"需要 TTS 或流式推理时([all]会额外安装 TTS/流式相关依赖):
pip install "transformers==4.51.0" accelerate "torch>=2.3.0,<=2.8.0" "torchaudio<=2.8.0" "minicpmo-utils[all]>=1.0.5"可选:视频抽帧(get_video_frame_audio_segments传use_ffmpeg=True)和视频生成(generate_duplex_video)依赖系统包 FFmpeg。README 给出的安装命令需要 root 权限(sudo),会修改系统环境:
# Ubuntu/Debian(需要 sudo 权限) sudo apt update && sudo apt install ffmpeg验证安装:
ffmpeg -version2. 初始化模型
import torch from transformers import AutoModel # Load omni model (default: init_vision=True, init_audio=True, init_tts=True) # For vision-only model: set init_audio=False and init_tts=False # For audio-only model: set init_vision=False model = AutoModel.from_pretrained( "openbmb/MiniCPM-o-4_5", trust_remote_code=True, attn_implementation="sdpa", # sdpa or flash_attention_2 torch_dtype=torch.bfloat16, init_vision=True, init_audio=True, init_tts=True, ) model.eval().cuda() # Initialize TTS for audio output model.init_tts()注释来自 README 原代码:默认加载全模态模型;只要视觉时设init_audio=False和init_tts=False,只要音频时设init_vision=False。attn_implementation在sdpa和flash_attention_2之间二选一。
3. 运行双工全模态示例并观察输出
README 提供了一段 duplex omni mode 示例:模型转成双工模式(model.as_duplex())后,对每个视频/音频分片调用model.streaming_prefill(...)和model.streaming_generate(...),逐轮打印:
listen...或
speak> <模型回复的文本>看到这两类轮次化输出、且文本与画面内容对应,即说明加载的模型可以正常流式推理。示例代码中的video_path = "assets/omni_duplex1.mp4"与ref_audio_path = "assets/HT_ref_audio.wav"是文档示例路径,需替换为你本地的视频文件和参考音频(文档用librosa.load(ref_audio_path, sr=16000, mono=True)以 16 kHz 单声道加载)。若get_video_frame_audio_segments传入use_ffmpeg=True,需先完成上一步的 FFmpeg 安装。
可选分支:若要用generate_duplex_video生成带 AI 回复字幕的输出视频,文档提示需安装中文字体(fonts-noto-cjk或fonts-wqy-microhei)才能正确渲染中日韩字幕。
限制与边界
- 文中三组显存数字对应不同部署路径,不要混用:19 GB / 10 GB / 11 GB 是 Model Zoo 对各版本显存占用的记录;28 GB 是 PyTorch Web Demo 的显存门槛;12 GB 是 llama.cpp-omni 低资源 GPU 的门槛。
- GGUF 与 AWQ 版本在本仓库文档中没有给出可直接运行的加载命令,官方框架部署指南指向外部 Cookbook(vLLM、SGLang、llama.cpp、Ollama 均分模型提供指南链接)。落在 GGUF/AWQ 版本时,先按上表核对框架支持范围与显存档位,再按对应框架指南操作。
- README 的 Limitations 一节列出的已知问题与版本选择直接相关时需要留意:full-duplex omni-modal live streaming 模式下语音合成可能读错字符;speech 与 omni 模式下模型有时会中英混合回复;部署在海外服务器上的 Web Demo 可能出现高延迟甚至丢失部分输出片段,官方建议本地部署或保证网络良好。
选型的落地结果:28 GB 以上跑原始版本并按上述步骤验证流式输出;10~12 GB 显卡改用 GGUF 或 AWQ 版本;低于 10 GB 则文档不支持 MiniCPM-o 4.5 的本地 GPU 部署。
【免费下载链接】MiniCPM-VA Pocket-Sized MLLM for Ultra-Efficient Image and Video Understanding on Your Phone项目地址: https://gitcode.com/GitHub_Trending/mi/MiniCPM-V
创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考