RWKV-LM 生态图谱:700+社区项目、GGUF与移动端WebGPU部署一站式指南
【免费下载链接】RWKV-LMRWKV (pronounced RwaKuv) is an RNN with great LLM performance, which can also be directly trained like a GPT transformer (parallelizable). We are at RWKV-7 "Goose". So it's combining the best of RNN and transformer - great performance, linear time, constant space (no kv-cache), fast training, infinite ctx_len, and free sentence embedding.项目地址: https://gitcode.com/gh_mirrors/rw/RWKV-LM
RWKV-LM是当今最活跃的 RNN 大语言模型(LLM)开源仓库之一。它既是 RWKV(读音 "RwaKuv")从 v1 到 v8 全部参考实现的家,也汇聚了700+ 社区项目,覆盖 GGUF 量化、移动端推理、WebGPU 浏览器部署、PEFT 微调、RLHF 强化学习等方向。无论你是想在消费级硬件上跑 LLM,还是想训练自己的 RWKV 模型,这份生态图谱都能帮你快速找到入口 🧭。
RWKV-LM 是什么:RNN 与 Transformer 的"全能混合体"
RWKV 是一个线性时间、恒定显存(无 KV-Cache)、100% 无注意力的纯 RNN 架构,却能达到 Transformer 级别的 LLM 性能。更妙的是它有两种运行模式:
- GPT 模式(并行):像训练 Transformer 一样并行训练,速度快
- RNN 模式(自回归):推理时逐 token 计算,速度恒定、显存恒定
这意味着它同时拿到了两者的好处:高性能、快训练、无限上下文长度,以及免费的句子嵌入(直接用最终隐状态做 embedding)。
RWKV-7 "Goose" 是当前的主力版本,它还是一个meta-in-context learner——在每个 token 上通过上下文内梯度下降来训练自己的状态。下图展示了它在 NIAH(大海捞针)长上下文测试中的表现:只用 4K 上下文训练的模型,就能自动外推到 32K+ 上下文 ✅
700+ 社区项目:一个如何长大的生态
RWKV-LM 仓库本身按版本组织,完整保留了从 v1 到 v8 的演进历史:
| 版本 | 目录 | 亮点 |
|---|---|---|
| v1 / v2 | RWKV-v1/、RWKV-v2-RNN/ | 最早的并行 RNN 原型,附 CUDA kernel |
| v3 / v4 | RWKV-v3/、RWKV-v4/、RWKV-v4neo/ | 预训练大模型时代的主力,附 20B tokenizer |
| v5 / v6 | RWKV-v5/ | 多头化 + 动态衰减(Dynamic Decay),附完整训练管线 |
| v7 "Goose" | RWKV-v7/ | 当前主力:稳定无尖峰、可数学推理、7.2B 旗舰 |
| v8 "Heron" | RWKV-v8/ | 引入 ROSA(快速在线后缀自动机)记忆组件 |
在同等参数量下,RWKV 在 LAMBADA、PIQA 等基准上表现亮眼,下图是 RWKV-6.0 "Finch" 与多款同规模模型的横评:
社区项目正是围绕这些版本生长出来的,README 中列出的 700+ 项目横跨训练、推理、量化、多模态、工具链等所有环节,是理解生态的最佳索引:README.md。
GGUF 量化:让 RWKV 模型跑在消费级硬件上
GGUF 是目前 LLM 社区最通用的量化格式(llama.cpp 生态)。RWKV 生态拥有专门的 GGUF 权重集合(如社区维护的 rwkv7 GGUF 系列),让你可以:
- 用llama.cpp 风格的推理引擎加载 RWKV 模型
- 选择 Q4/Q8/F16 等不同量化级别,平衡速度与精度
- 在纯 CPU 或低显存设备上流畅推理
配合 RWKV 本身无 KV-Cache 的特性,长上下文推理时的显存占用是恒定的——这正是 GGUF 量化场景下最被看重的能力之一 🚀
移动端与 WebGPU 部署:LLM 装进口袋和浏览器
RWKV 的 RNN 特性(只做矩阵-向量乘法、无 KV 缓存)对端侧设备极其友好,生态中有几条成熟的部署路线:
| 部署方式 | 代表项目 | 特点 |
|---|---|---|
| 移动端推理库 | rwkv-mobile | 专为 iOS/Android 优化的移动端推理库 |
| WebGPU 推理 | ai00_rwkv_server | 支持 NVIDIA/AMD/Intel 显卡的浏览器最快推理 |
| WebGPU 后端 | web-rwkv | 浏览器端后端,配套 Gradio 聊天演示 |
| 桌面 GUI | RWKV-Runner | 开箱即用的图形化运行工具(带 Release) |
| C++ 高性能推理 | rwkv.cpp | 支持 int4/int8/fp16/fp32 的 CPU/cuBLAS/CLBlast 推理 |
RWKV Chat 应用(RWKV_APP)则提供了手机/桌面本地推理的完整产品形态,下图是 RWKV 14B 模型在 8K 上下文下的长对话效果:
此外,RWKV 运行时已经进入了 Windows 与 Office 生态,端侧 LLM 不再是概念。
快速上手:从 Clone 到第一次问答
git clone https://gitcode.com/gh_mirrors/rw/RWKV-LM克隆后,最快的体验路径是 RWKV-7 的三个 demo 脚本(只需下载对应权重文件即可运行):
- RWKV-v7/rwkv_v7_demo.py — GPT 模式
- RWKV-v7/rwkv_v7_demo_rnn.py — RNN 模式
- RWKV-v7/rwkv_v7_demo_fast.py — 双模式混合,最快
如果你更喜欢纯 Python 体验,RWKV-v7/rwkv_v7_numpy.py 提供了不依赖任何自定义 CUDA kernel 的实现,任何 CPU/GPU 都能跑。官方 pip 包rwkv也支持直接安装使用。下图是官方 demo 的经典问答效果:
训练与微调:7GB 显存就够起步
RWKV-7 的参考训练实现位于 RWKV-v7/train_temp/,默认配置只需 1 张 7G 显存的显卡即可测试。整个流程只需两个脚本:
- RWKV-v7/train_temp/demo-training-prepare.sh — 准备 MiniPile 数据、生成初始权重
- RWKV-v7/train_temp/demo-training-run.sh — 加载权重开始训练
RWKV-7 以训练稳定著称(0.1B~2.9B 规模均验证过无 loss 尖峰),下图是 MiniPile 上的典型 loss 曲线:
其他关键工具:
- RWKV-v5/make_data.py:把 jsonl 数据转成训练用的 binidx 格式
- RWKV-v5/compute_magic_prime.py:为已有数据计算采样参数
- 数据规模化到 Pile(332G tokens):见 RWKV-v5/demo-training-run-v7-pile.sh
- 模型数学能力验证:Research/rwkv7-g0-7.2b.md
生态项目清单:按需求选型
| 类别 | 代表项目 | 适用场景 |
|---|---|---|
| 高效推理 | Albatross | 旗舰推理引擎:7.2B fp16 在 RTX5090 上 bsz1 解码 145+ token/s,bsz960 可达 10250+ token/s,显存速度恒定制 🏎️ |
| 高效推理 | faster-rwkv、wind_rwkv、faster3a 系列 | 更快的社区 kernel 实现 |
| 训练 | nanoRWKV | 无需自定义 CUDA kernel,任意 GPU/CPU 可训练 |
| 训练 | RWKV-PEFT | LoRA/DoRA/状态微调等参数高效微调 |
| 训练 | RWKV-LM-RLHF | 强化学习人类反馈对齐 |
| 训练 | RWKV-infctx-trainer | 无限上下文长度训练 |
| 多模态 | Vision-RWKV、Diffusion-RWKV | 视觉语言模型、扩散模型 |
| 多模态 | SpikeGPT | 脉冲神经网络(SNN)方向探索 |
| 工具链 | json2bin / rwkv-tokenizer | 大数据集的高速 tokenization |
| 评测 | rwkv_mmlu_eval.py | MMLU 等基准评测(仓库内附 RWKV-v7/rwkv_mmlu_eval.py 与 MMLU 数据集) |
| 服务化 | ai00_server | 把 RWKV 包装成 API 服务 |
| 前沿探索 | ROSA 系列(rosa_soft、rosa-plus 等) | 为 RWKV-8 训练/扩展 ROSA 记忆组件 |
💡 提示:社区项目的完整清单持续更新中,建议以 README.md 中的 "Cool Community RWKV Projects" 一节为准。
总结
RWKV-LM 不只是一个模型仓库,而是700+ 项目组成的完整 LLM 生态:
- 想体验→ GGUF 量化版 + Albatross 推理,消费级硬件即可跑
- 想端侧→ rwkv-mobile 上手机,ai00_rwkv_server 进浏览器
- 想训练→ train_temp 参考实现,7GB 显存起步、无尖峰
- 想研究→ v1 到 v8 的完整演进史 + 多模态与 SNN 前沿方向
RWKV 用"RNN 的性能 + Transformer 的训练方式"证明了一条不同的 LLM 路线,而其真正的护城河是这套持续生长、人人可参与的开源生态 🔥
【免费下载链接】RWKV-LMRWKV (pronounced RwaKuv) is an RNN with great LLM performance, which can also be directly trained like a GPT transformer (parallelizable). We are at RWKV-7 "Goose". So it's combining the best of RNN and transformer - great performance, linear time, constant space (no kv-cache), fast training, infinite ctx_len, and free sentence embedding.项目地址: https://gitcode.com/gh_mirrors/rw/RWKV-LM
创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考