码农知识堂 - 1000bd
  •   Python
  •   PHP
  •   JS/TS
  •   JAVA
  •   C/C++
  •   C#
  •   GO
  •   Kotlin
  •   Swift
  • transformer大语言模型(LLM)部署方案整理


    说明

    大模型的基本特征就是大,单机单卡部署会很慢,甚至显存不够用。毕竟不是谁都有H100/A100, 能有个3090就不错了。

    目前已经有不少框架支持了大模型的分布式部署,可以并行的提高推理速度。不光可以单机多卡,还可以多机多卡。
    我自己没啥使用经验,简单罗列下给自己备查。不足之处,欢迎在评论区指出。

    框架名称出品方开源地址
    FasterTranaformer英伟达FasterTransformer github
    TGIhuggingfacehuggingface/text-generation-inference
    vLLM伯克利大学 LMSYS 组织github-vllm
    deepspeed微软github.com/microsoft/DeepSpeed
    lmdeployopen-mmlabInternLM/lmdeploy
    TurboTransformers腾讯Tencent/TurboTransformers

    FasterTranaformer/TensorRT-LLM

    faster transformer是英伟达的大模型推理方案,但是后续可能不再维护,因为英伟达推出了一个更新的框架TensorRT-LLM,它目前还在申请使用阶段,未来应该会全面开源吧。

    FasterTransformer支持的模型

    ModelsFrameworkFP16INT8 (after Turing)Sparsity (after Ampere)Tensor parallelPipeline parallelFP8 (after Hopper)
    BERTTensorFlowYesYes----
    BERTPyTorchYesYesYesYesYes-
    BERTTriton backendYes--YesYes-
    BERTC++YesYes---Yes
    XLNetC++Yes-----
    EncoderTensorFlowYesYes----
    EncoderPyTorchYesYesYes---
    DecoderTensorFlowYes-----
    DecoderPyTorchYes-----
    DecodingTensorFlowYes-----
    DecodingPyTorchYes-----
    GPTTensorFlowYes-----
    GPT/OPTPyTorchYes--YesYesYes
    GPT/OPTTriton backendYes--YesYes-
    GPT-MoEPyTorchYes--YesYes-
    BLOOMPyTorchYes--YesYes-
    BLOOMTriton backendYes--YesYes-
    GPT-JTriton backendYes--YesYes-
    LongformerPyTorchYes-----
    T5/UL2PyTorchYes--YesYes-
    T5TensorFlow 2Yes-----
    T5/UL2Triton backendYes--YesYes-
    T5TensorRTYes--YesYes-
    T5-MoEPyTorchYes--YesYes-
    Swin TransformerPyTorchYesYes----
    Swin TransformerTensorRTYesYes----
    ViTPyTorchYesYes----
    ViTTensorRTYesYes----
    GPT-NeoXPyTorchYes--YesYes-
    GPT-NeoXTriton backendYes--YesYes-
    BART/mBARTPyTorchYes--YesYes-
    WeNetC++Yes-----
    DeBERTaTensorFlow 2Yes--On-goingOn-going-
    DeBERTaPyTorchYes--On-goingOn-going-

    参考资料:

    FasterTransformer github

    H100推理飙升8倍!英伟达官宣开源TensorRT-LLM,支持10+模型

    英伟达发布 TensorRT-LLM 模型,性能最高提升 8 倍,何时能正式发售?对此你有哪些期待?

    TGI(huggingface/text-generation-inference)

    huggingface官方的框架,根据小记:主流推理框架在Llama 2 的上性能比较的数据,TGI跑LLAMA-13b的性能好于vllm。

    Optimized architectures
    • BLOOM
    • FLAN-T5
    • Galactica
    • GPT-Neox
    • Llama
    • OPT
    • SantaCoder
    • Starcoder
    • Falcon 7B
    • Falcon 40B
    • MPT
    • Llama V2
    • Code Llama

    Other architectures are supported on a best effort basis using:

    AutoModelForCausalLM.from_pretrained(, device_map="auto")

    or

    AutoModelForSeq2SeqLM.from_pretrained(, device_map="auto")

    参考资料:

    huggingface/text-generation-inference

    vllm

    vLLM 是伯克利大学 LMSYS 组织开源的大语言模型高速推理框架,极大地提升了实时场景下的 LLM 服务的吞吐与内存使用效率。

    vllm支持的模型

    vLLM seamlessly supports many Huggingface models, including the following architectures:

    • Aquila (BAAI/Aquila-7B, BAAI/AquilaChat-7B, etc.)
    • Baichuan (baichuan-inc/Baichuan-7B, baichuan-inc/Baichuan-13B-Chat, etc.)
    • BLOOM (bigscience/bloom, bigscience/bloomz, etc.)
    • Falcon (tiiuae/falcon-7b, tiiuae/falcon-40b, tiiuae/falcon-rw-7b, etc.)
    • GPT-2 (gpt2, gpt2-xl, etc.)
    • GPT BigCode (bigcode/starcoder, bigcode/gpt_bigcode-santacoder, etc.)
    • GPT-J (EleutherAI/gpt-j-6b, nomic-ai/gpt4all-j, etc.)
    • GPT-NeoX (EleutherAI/gpt-neox-20b, databricks/dolly-v2-12b, stabilityai/stablelm-tuned-alpha-7b, etc.)
    • InternLM (internlm/internlm-7b, internlm/internlm-chat-7b, etc.)
    • LLaMA & LLaMA-2 (meta-llama/Llama-2-70b-hf, lmsys/vicuna-13b-v1.3, young-geng/koala, openlm-research/open_llama_13b, etc.)
    • MPT (mosaicml/mpt-7b, mosaicml/mpt-30b, etc.)
    • OPT (facebook/opt-66b, facebook/opt-iml-max-30b, etc.)
    • Qwen (Qwen/Qwen-7B, Qwen/Qwen-7B-Chat, etc.)

    参考资料:

    github-vllm

    有人使用vLLM加速过自己的大语言模型吗?效果怎么样?

    比HuggingFace快24倍!伯克利神级LLM推理系统开源,碾压SOTA,让GPU砍半

    deepspeed

    DeepSpeed是微软推出的大规模模型分布式训练的工具,主要实现了ZeRO并行训练算法。
    这个框架可以做训练,也可以推理。我同事使用这个框架对baichuan-13进行推理,功能正常。

    DeepSpeed has been used to train many different large-scale models, below is a list of several examples that we are aware of (if you’d like to include your model please submit a PR):

    • Megatron-Turing NLG (530B)
    • Jurassic-1 (178B)
    • BLOOM (176B)
    • GLM (130B)
    • xTrimoPGLM (100B)
    • YaLM (100B)
    • GPT-NeoX (20B)
    • AlexaTM (20B)
    • Turing NLG (17B)
    • METRO-LM (5.4B)

    参考资料:

    github.com/microsoft/DeepSpeed

    deepspeed入门教程

    lmdeploy

    LMDeploy 由 MMDeploy 和 MMRazor 团队联合开发,是涵盖了 LLM 任务的全套轻量化、部署和服务解决方案。
    支持的模型:

    Note

    W4A16 推理需要 Ampere 及以上架构的 Nvidia GPU

    模型模型并行FP16KV INT8W4A16W8A8
    LlamaYesYesYesYesNo
    Llama2YesYesYesYesNo
    InternLMYesYesYesYesNo
    QWen-7BYesYesYesNoNo
    Baichuan-7BYesYesYesYesNo
    Baichuan2-7BYesYesNoNoNo
    Code LlamaYesYesNoNoNo

    参考资料:

    LLM 低成本 GPU 部署方案 lmdeploy 开源

    InternLM/lmdeploy

    TurboTransformers

    TurboTransformers是腾讯开源的模型加速推理框架。

    当前支持的模型种类不算多:

    • BERT [Python] [C++]
    • ALBERT [Python]
    • Roberta [Python]
    • Transformer Decoder [Python]
    • GPT2 [Python]

    参考资料:

    Tencent/TurboTransformers

    腾讯开源TurboTransformers,推理加速性能超越TensorRT等主流优化引擎

    参考资料

    LLM推理优化技术综述:KVCache、PageAttention、FlashAttention、MQA、GQA

    小记:主流推理框架在Llama 2 的上性能比较

    vllm vs TGI 部署 llama v2 7B 踩坑笔记

    目前业界大模型推理框架很多,各有什么优缺点,应该如何选择?

  • 相关阅读:
    CCF-CSP 202012-2 期末预测之最佳阈值
    深入浅出了解MYSQL8特性注入是什么
    力扣刷题 day49:10-19
    你还在找淘宝商品信息查询的接口吗?
    uview 组件 u-form-item 点击事件
    slam学习
    【Ubuntu on windows】Package ‘xxxx‘ has no installation candidate
    python内置函数 R
    泰山OFFICE技术讲座:上标研究2:上标的大小
    列表页优化思路
  • 原文地址:https://blog.csdn.net/yuanlulu/article/details/132848794
  • 最新文章
  • 沪漂五周年了:我越来越迷茫了
    Agentic Skill Routing 实战:别再把所有 Skill 塞进 AI Agent 上下文
    MySQL-Seconds_behind_master的精度误差
    [MAF预定义ChatClient中间件-03]CachingChatClient——利用缓存省钱省时间
    AI的至暗历史:从万众期待到被政府撤资,AI的两次死亡徘徊
    Agent OS :五种驯服不确定性的范式
    PortSwigger SQL注入LAB11
    数据库即时编译JIT
    [Begin]AI Learn Data Day 0
    深度学习进阶(二十七)现代 LLM 的核心架构设计其二:SwiGLU
  • 热门文章
  • 十款代码表白小特效 一个比一个浪漫 赶紧收藏起来吧!!!
    奉劝各位学弟学妹们,该打造你的技术影响力了!
    五年了,我在 CSDN 的两个一百万。
    Java俄罗斯方块,老程序员花了一个周末,连接中学年代!
    面试官都震惊,你这网络基础可以啊!
    你真的会用百度吗?我不信 — 那些不为人知的搜索引擎语法
    心情不好的时候,用 Python 画棵樱花树送给自己吧
    通宵一晚做出来的一款类似CS的第一人称射击游戏Demo!原来做游戏也不是很难,连憨憨学妹都学会了!
    13 万字 C 语言从入门到精通保姆级教程2021 年版
    10行代码集2000张美女图,Python爬虫120例,再上征途
小工具 小游戏
Copyright © 2022 侵权请联系2656653265@qq.com    京ICP备2022015340号-1

京公网安备 11010502049817号