大家好,我们整理了近期 RWKV 生态中新增的一些多模态工作,包含:RWKV-SAM(图像分割模型)、RWKV-CLIP(视觉语言表示学习)、point-RWKV(3D 点云学习框架)……
RWKV-SAM
- 相关论文: Mamba or RWKV: Exploring High-Quality and High-Efficiency Segment Anything Model
- 论文地址:https://arxiv.org/abs/2406.19369
- GitHub 仓库:https://github.com/HarborYuan/ovsam
论文设计了基于 RWKV 的图像分段切割方法“RWKV-SAM”(Segment Anything Model)。
下图为 RWKV-SAM 架构:
与 Transformer 模型相比,RWKV-SAM 实现了 2 倍以上的加速,且可以在各种数据集上实现更好的图像分割性能。
此外,RWKV-SAM 的分类和语义分割结果优于最新的视觉 Mamba 模型。