ARTICLE DETAIL

资讯详情

深耕网站视觉设计与运营推广的一线实战洞察。

ModelScope 和 Hugging Face 做模型推理部署与模型训练,我最终选了哪个?完整决策指南

ModelScope 和 Hugging Face 做模型推理部署与模型训练,我最终选了哪个?完整决策指南 ModelScope 和 Hugging Face 做模型推理部署与模型训练我最终选了哪个完整决策指南【免费下载链接】modelscopeModelScope: bring the notion of Model-as-a-Service to life.项目地址: https://gitcode.com/GitHub_Trending/mo/modelscope先给结论什么场景选 ModelScope什么场景选 Hugging Face先把结论摆出来如果你的业务主要做中文场景中文 NLP、语音、工业 CV且要接国内云上部署选 ModelScope更省心如果你想跟进国际开源模型的最新进展、团队习惯英文技术栈Hugging Face 很难被替代。我自己的项目里这两个平台是按场景分的不是按喜好分的。维度ModelScopeHugging Face上手难度pip 安装后 3 行代码跑通推理pip 安装后 2 行代码跑通推理中文支持中文文档、中文模型与数据集为主英文为主中文资源零散模型数量700重质量与垂直领域300,000重数量与长尾模型训练Trainer 统一接口原生支持数据/模型/混合并行Trainer Accelerate生态成熟推理部署内置 Exporter一键导出 ONNX 等格式依赖社区工具与云平台背后维护阿里云 / 达摩院生态开源社区 商业公司许可协议Apache 2.0库为 Apache 2.0各模型自定下面拆开讲为什么我会这么说。上手体验两个模型平台从 0 到跑通第一个 Demo 的时间线ModelScope 这边 ⚡ 第一天pip install modelscope跟着官方 README 三行代码跑通中文分词第二天做肖像抠图第三天按官方示例接上 GPT3 诗歌微调trainer.train()一路走通。坑基本都在环境部分 CV 模型要额外装 mmcv-full音频模型要 libsndfile我卡了一个下午最后拉官方 Docker 镜像一步解决仓库里还有对应的 安装脚本。Quick Start 是中文的这点对国内团队太友好了——报错大概率是环境问题而不是你代码写错。想读源码的话git clone https://gitcode.com/GitHub_Trending/mo/modelscope。Hugging Face 那边第一天pip install transformers两行代码 sentiment-analysis 出结果速度是最快的第三天用 Accelerate 多卡训练也走通了。坑在于一开始就用中文模型报错全是英文issue 里同类问题一搜一片得自己判断哪个还适用。官方文档很全但全英文对中文业务的理解成本是实打实的。# ModelScope三行跑通中文分词 from modelscope.pipelines import pipeline seg pipeline(word-segmentation, modeldamo/nlp_structbert_word-segmentation_chinese-base) print(seg(今天天气不错适合出去游玩)[output]) # Hugging Face两行跑通英文情感分类 from transformers import pipeline clf pipeline(sentiment-analysis) print(clf(I love this API))真正拉开差距的两件事中文模型生态与训练部署链第一件事中文模型和数据集。 场景你要做中文 ASR 或者中文文本理解。差异在于ModelScope 里MsDataset.load(chinese-poetry-collection)一行加载中文数据集中文模型、模型卡、预处理配置都在一起很多中文 SOTA 模型是先在 ModelScope 开源的HF Datasets 覆盖国际数据集很全但中文资源散落在各处经常得自己下载再拼 split。我的判断中文业务我倾向 ModelScope模型、数据、文档都在一处试错成本低一个量级。第二件事模型训练到推理部署的链路。场景你要多卡训练训完想导出格式直接推生产。差异在于ModelScope 的 Trainer 原生支持数据并行、模型并行和混合并行适合大模型训完之后内置导出模块可以把模型一键转成 ONNX 这类部署友好格式from modelscope.exporters import build_exporter exporter build_exporter(stable-diffusion-onnx, modeldamo/stable-diffusion-v1-5) exporter.export(sd_onnx/)HF 没有统一的导出层TorchScript 要自己 trace或者用社区工具转换再交给云平台部署训练环节它非常成熟但部署侧是碎片化的。我的判断如果要一个框架从训练一路推到部署ModelScope 顺如果训练是重点、部署交给平台团队HF 够用。生态与隐性成本护城河和半年后才会显现的账单 护城河方面说实话两边都不弱ModelScope 背靠阿里云700 模型里不少是独家首发后台连着 Notebook 和云上部署链路数据集也是国内托管HF 是社区驱动30 万 模型第三方工具链极丰富——WandB、MLflow、DVC 开箱就接复现论文基本默认走 HF 流程。隐性成本才是重点这些现在看不见半年后会显现一是锁定模型权重多是标准格式能带走但任务定义、配置、数据集切分两边不一样将来换平台要重写预处理和评估代码通常占总工作量的三成二是版本节奏两边的 release 节奏完全独立把 HF 模型接进 ModelScope 时要盯紧 transformers 版本兼容仓库里虽有 兼容性工具也建议锁死版本三是工具链依赖你围绕哪个平台的 MLOps 搭得越深切换成本越高。一张清单帮你做决定五条 if-then 规则如果你的业务主要面向国内用户以中文 NLP 和语音为主且团队熟悉阿里云生态 → 选 ModelScope。如果你需要复现国际开源的最新论文、跟进新模型的首发版本团队习惯英文文档 → 选 Hugging Face。如果你要做大模型多卡训练并且训完要一键导出 ONNX 推生产 → ModelScope 的 Trainer Exporter 链路更顺。如果你的模型权重要和国际社区共享或要接第三方 MLOps 工具 → Hugging Face。如果你两者都想要 → 可以混合用 HF 加载基础模型转成 ModelScope 格式做部署但一定要固定 transformers 版本每次升级后把评估集完整跑一遍再合入。没有银弹但有适合你的那一个。写在最后最值得关注的一个变化两个平台的模型仓库正在互相打通HF 格式的模型在 ModelScope 上架得越来越多跨平台迁移的成本在持续下降。你在生产里用的是哪个踩过什么坑欢迎留言聊聊。【免费下载链接】modelscopeModelScope: bring the notion of Model-as-a-Service to life.项目地址: https://gitcode.com/GitHub_Trending/mo/modelscope创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
返回列表