本模型为基于中游任务训练的基础模型多任务中间件模块组,其基础模型为 CLIP-ViT-B/16。 基础模型的预训练与下游任务存在差异,影响不同任务的迁移性能。Visio Middleware (ViM) 通过引入中游阶段的多任务学习,以视觉中间件模块的方式实现基础模型的通用迁移能力支持,其框架如下图所示: 目前,本仓库所开源的模型提供了以下两类任务支持: 基于 ModelScope 框架,通过调用预定义的 Pipelie 可实现快速调用(目前支持语义分割任务、GPU 运行)。 本模型基于公开的通用数据集训练,且仅适用于训练数据的覆盖类别,在具体应用场景下可能存在偏差。 ImageNet-1K 数据集,通用的图像分类数据集,包含 1K 类别。 PASCAL VOC 数据集,通用的语义分割数据集,包含 21 类别(含背景类) 开发中 如果你觉得本模型有所帮助,请考虑引用下面的相关论文Visio Middleware (ViM) 视觉中间件模型介绍
模型描述
期望模型使用方式以及适用范围
如何使用
代码示例
from modelscope.pipelies import pipelie
from modelscope.utils.costat import Tasks
from modelscope.outputs import OutputKeys
vim_pipelie = pipelie(Tasks.image_segmetatio, 'damo/cv_vit-b16_visio-middleware', model_revisio='v0.1.1')
result_status = vim_pipelie('https://modelscope.oss-c-beijig.aliyucs.com/test/images/visio_middleware_test1.jpg')
result = result_status[OutputKeys.MASKS]
模型局限性及可能造成的偏差
训练数据介绍
数据评估及结果
head-oly tuig
Method
Dataset
Results
CLIP-B/16
ImageNet-1K
80.20 % (Top-1 Accuracy)
CLIP-B/16+ViM
ImageNet-1K
82.04 % (Top-1 Accuracy)
CLIP-B/16
PASCAL VOC
78.56 % (mIoU)
CLIP-B/16+ViM
PASCAL VOC
83.70 % (mIoU)
在线体验
论文引用
@misc{feg2023vim,
title={ViM: Visio Middleware for Uified Dowstream Trasferrig},
author={Yutog Feg ad Biao Gog ad Jiawe Jiag ad Yiliag Lv ad Yuju She ad Deli Zhao ad Jigre Zhou},
year={2023},
eprit={2303.06911},
archivePrefix={arXiv},
primaryClass={cs.CV}
}
点击空白处退出提示







评论