企业微信
悟空CRM  >   公司新闻  >  比HuggingFace快24倍!伯克利神级LLM推理系统开源,碾压SOTA,让GPU砍半

比HuggingFace快24倍!伯克利神级LLM推理系统开源,碾压SOTA,让GPU砍半

悟空软件 阅读次数:335 次浏览

CRM客户管理系统
悟空CRM是以客户为中心,围绕客户实现营销、销售、服务、分析的全流程管理,从市场线索的获取、线索识别、客户跟进、客户签约、客户持续服务的客户全生命周期管理,帮助企业高效线索获取,提升客户转化、提高客户满意度,全面赋能企业销售管理,提升销售业绩,从而为企业带来持续的利润。 悟空CRM客户管理全生命周期管理体系的建立与健全... 查看更多

过去2个月,来自UC伯克利的研究人员给大语言模型们安排了一个擂台——Chatbot Arena。

GPT-4等大语言模型玩家打起了「排位赛」,通过随机battle,根据Elo得分来排名。

这一过程中,每当一个用户访问并使用网站,就需要同时让两个不同的模型跑起来。

他们是如何做到的?

这不,就在今天,UC伯克利重磅开源了世界最快LLM推理和服务系统vLLM。

简之,vLLM是一个开源的LLM推理和服务引擎。它利用了全新的注意力算法「PagedAttention」,有效地管理注意力键和值。

配备全新算法的vLLM,重新定义了LLM服务的最新技术水平:

与HuggingFace Transformers相比,它提供高达24倍的吞吐量,而无需进行任何模型架构更改。

值得一提的是,「小羊驼」Vicuna在demo中用到的就是FastChat和vLLM的一个集成。

正如研究者所称,vLLM最大的优势在于——提供易用、快速、便宜的LLM服务。

这意味着,未来,即使对于像LMSYS这样计算资源有限的小型研究团队也能轻松部署自己的LLM服务。

项目地址:github.com/vllm-project

现在,所有人可以在GitHub仓库中使用一个命令尝试vLLM了。论文随后也会发布。

性能全面碾压SOTA

今天,这个由UC伯克利创立的开放研究组织LMSYS介绍道:

「一起来见证vLLM:Chatbot Arena背后的秘密武器。FastChat-vLLM的集成使LMSYS使用的GPU数量减少了一半,同时每天平均提供3万次请求。」

vLLM的性能具体如何?

UC伯克利团队将vLLM的吞吐量与最受欢迎的LLM库HuggingFace Transformers(HF),以及HuggingFace文本生成推理(TGI),先前的最新技术水平进行了比较。

团队在两个设置中进行评估:在NVIDIA A10G GPU上运行LLaMA-7B模型,在NVIDIA A100 GPU(40GB)上运行LLaMA-13B模型。

然后,研究人员从ShareGPT数据集中抽样请求的输入/输出长度。

在实验中,vLLM的吞吐量比HF高达24倍,并且比TGI高达3.5倍。

在每个请求只需要一个输出完成时的服务吞吐量。vLLM比HF的吞吐量高出14倍-24倍,比TGI的吞吐量高出2.2倍-2.5倍

在每个请求需要3个并行输出完成时的服务吞吐量。vLLM比HF的吞吐量高出8.5倍-15倍,比TGI的吞吐量高出3.3倍-3.5倍

秘密武器:PagedAttention

在vLLM中,团队发现LLM服务的性能受到内存的限制。

在自回归解码过程中,LLM的所有输入token都会生成注意力键(key)和值(value)张量,并且这些张量被保留在GPU内存中以生成下一个token。

这些缓存的键和值张量通常被称为KV缓存。KV缓存具有以下特点:

1. 内存占用大:在LLaMA-13B中,单个序列的KV缓存占用高达1.7GB的内存。

2. 动态化:其大小取决于序列长度,而序列长度高度易变,且不可预测。

因此,有效管理KV缓存是一个重大挑战。对此,研究团队发现现有系统由于碎片化和过度保留而浪费了60%至80%的内存。

用团队的导师Joey Gonzalez的一句话来讲:GPU内存碎片化=慢。

为了解决这个问题,团队引入了PagedAttention,一种受到操作系统中虚拟内存和分页经典概念启发的注意力算法。

与传统的注意力算法不同,PagedAttention允许在非连续的内存空间中存储连续的键和值。

具体来说,PagedAttention将每个序列的KV缓存分为若干块,每个块包含固定数量token的键和值。在注意力计算过程中,PagedAttention内核能够高效地识别和提取这些块。

动图封面
 

PagedAttention:KV缓存被分割成块,这些块在内存中不需要连续

由于这些块在内存中不需要连续,因此也就可以像操作系统的虚拟内存一样,以更灵活的方式管理键和值——将块看作页,token看作字节,序列看作进程。

序列的连续逻辑块通过块表映射到非连续的物理块。随着生成新的token,物理块会按需进行分配。

动图封面
 

使用PagedAttention的请求生成过程示例

PagedAttention将内存浪费控制在了序列的最后一个块中。

在实践中,这带来了接近最优的内存使用——仅有不到4%的浪费。

而这种内存效率的提升,能让系统将更多的序列进行批处理,提高GPU利用率,从而显著提高吞吐量。

此外,PagedAttention还具有另一个关键优势:高效的内存共享。

比如在并行采样中,就能从相同的提示生成多个输出序列。在这种情况下,提示的计算和内存可以在输出序列之间共享。

动图封面
 

并行采样的示例

PagedAttention通过块表自然地实现了内存共享。

类似于进程共享物理页的方式,PagedAttention中的不同序列可以通过将它们的逻辑块映射到相同的物理块来共享块。

为了确保安全,PagedAttention会跟踪物理块的引用计数,并实现了写时复制机制。

动图封面
 

采样多个输出的请求示例生成过程

PagedAttention的内存共享极大减少了复杂采样算法(如并行采样和束搜索)的内存开销,将它们的内存使用量减少了高达55%。这可以将吞吐量提高多达2.2倍。

总结而言,PagedAttention是vLLM的核心技术,它是LLM推断和服务的引擎,支持各种模型,具有高性能和易于使用的界面。

GitHub上,团队也介绍了vLLM能够无缝支持的HuggingFace模型,包括以下架构:

- GPT-2(gpt2、gpt2-xl等)

- GPTNeoX(EleutherAI/gpt-neox-20b、databricks/dolly-v2-12b、stabilityai/stablelm-tuned-alpha-7b等)

- LLaMA(lmsys/vicuna-13b-v1.3、young-geng/koala、openlm-research/open_llama_13b等)

- OPT(facebook/opt-66b、facebook/opt-iml-max-30b等)

小羊驼和排位赛的「幕后英雄」

4月初,UC伯克利学者联手UCSD、CMU等,最先推出了一个开源全新模型——130亿参数的Vicuna,俗称「小羊驼」。

从那时起,Vicuna已在Chatbot Arena为数百万用户提供服务。

最初,LMSYS的FastChat采用基于HF Transformers的服务后端来提供聊天demo。

但随着demo变得越来越受欢迎,峰值流量猛增了好几倍,而HF后端也因此成了一个重大的瓶颈。

为了解决这一挑战,LMSYS与vLLM团队紧密合作,全力开发出了全新的FastChat-vLLM集成——通过将vLLM作为新的后端,来满足不断增长的需求(最多增加5倍的流量)。

根据LMSYS内部微基准测试的结果,vLLM服务后端可以实现比初始HF后端高出30倍的吞吐量。

4月-5月期间,Chatbot Arena的后端已经部落了FastChat-vLLM的集成。实际上,有超过一半的Chatbot Arena请求都使用FastChat-vLLM集成服务的

自4月中旬以来,最受欢迎的语言模型,如Vicuna、Koala和LLaMA,都已成功使用FastChat-vLLM集成提供服务。

FastChat作为多模型聊天服务前端,vLLM作为推理后端,LMSYS能够利用有限数量的GPU(学校赞助的),以高吞吐量和低延迟为数百万用户提供Vicuna服务。

现在,LMSYS正在将vLLM的使用扩展到更多的模型,包括Databricks Dolly、LAION的OpenAsssiant和Stability AI的StableLM等。

vLLM使用教程

使用以下命令安装vLLM(另可查看安装指南了解更多信息):

$ pip install vllm

vLLM可用于离线推理和在线服务。要使用vLLM进行离线推理,你可以导入vLLM并在Python脚本中使用LLM类:

from vllm import LLMprompts = ["Hello, my name is", "The capital of France is"]  # Sample prompts.

要使用vLLM进行在线服务,你可以通过以下方式启动与OpenAI API兼容的服务器:

$ python -m vllm.entrypoints.openai.api_server --model lmsys/vicuna-7b-v1.3

你可以使用与OpenAI API相同的格式查询服务器:

$ curl http://localhost:8000/v1/completions \-H "Content-Type: application/json" \-d '{

有关使用vLLM的更多方法,请查看快速入门指南:

vllm.readthedocs.io/en/

悟空CRM产品更多介绍:www.5kcrm.com

相关内容

外贸客户管理软件能解决企业哪些实际问题?

随着中国经济的持续发展,各种企业竞争逐渐的加剧,特别是外贸行业企业的竞争同样非常激烈。外贸行业企业在既需要成长又面临激烈竞争的情况下,就需要自己的专业外贸客户管理软件。那么外贸客户管理软件能解决企业哪些实际问题?附外贸客户管理软件解决方案。▋解决销售问题外贸客户管理软件解决企业销售方面的问题。外贸企业的主要的工作之一就是销售,可以说销售对于外贸公司来说至关重要。销售做的好的外贸企业才能够持续的成长
相关文章

有哪些免费的客户管理系统可供选择?

有哪些免费的客户管理系统可供选择?在现今竞争激烈的商业环境中,客户管理成为了企业成功的关键因素之一。通过高效的客户管理系统,企业可以更好地了解和满足客户需求,提升客户满意度并实现持续增长。然而,为了引入优秀的客户管理系统,企业通常需要付出昂贵的费用。对于小型企业或初创企业来说,这可能是一个不小的负担。然而,幸运的是,有许多免费的客户管理系统可供选择。本文将介绍几个值得考虑的免费客户管理系统,并探讨
相关文章

CRM试用指南,CRM试用的几个注意事项

CRM是客户关系管理的缩写,是一种通过IT技术手段,对客户数据进行收集、整理、分析、应用和管理,以实现客户关系的维护和发展的管理思想和方法。随着企业对于客户关系管理的需求不断增长,CRM系统也逐渐成为企业必备的工具之一。对于初次接触CRM系统的用户,试用是了解CRM系统功能和性能的重要方式。本文将介绍CRM试用的几个注意事项。附CRM试用地址。1.确定试用目的和需求在进行CRM试用之前,需要先明确
相关文章

客户营销管理系统能解决企业哪些实际问题?

随着IT技术与经济的持续发展,营销技术与模式也在持续创新。传统的市场营销技术与模式已经严重落后于时代。企业在这种情况下,就需要使用先进的客户营销管理系统来满足企业生存与发展的需求。那么客户营销管理系统能解决企业哪些实际问题?▋解决销售效率问题客户营销管理系统的使用帮助企业解决销售效率问题。传统的销售过程看似简单,实际对于销售人员是比较繁杂的,特别是一些企业新招聘的销售人员,开第一单实际甚至长达三五
相关文章

如何登录海信CRM系统?海信CRM系统的功能和特点是什么?

海信CRM系统是一款功能强大的客户关系管理软件,它为企业提供了一套完整的解决方案,帮助企业实现客户信息的管理、销售业绩的提升和市场营销的精细化。那么,如何登录海信CRM系统呢? 首先,打开浏览器,输入海信CRM系统的网址。一般来说,海信CRM系统的网址会以“https://www.5kcrm.com”开头。在浏览器的地址栏中输入该网址,并按下回车键。 接下来,会跳转到海
相关文章

营销CRM系统能解决哪些实际工作问题?

随着IT技术的高速发展与商业理念的变化,企业营销与销售工作也在快速的变化升级,也就要求企业可以跟上市场营销环境的变化,这个时候就要求企业使用营销CRM系统。那么营销CRM系统能解决哪些实际工作问题?下面从五个方面详细的介绍。▋提升效率营销CRM系统提升企业销售团队的工作效率。传统的销售方式需要销售人员使用大量的时间来进行线索的管理、客户信息的管理、销售过程的管理、合同的管理、回款的管理、回头客户的
相关文章

医疗器械销售管理系统可以解决工作中哪些实际问题?

医疗器械销售管理系统可以解决工作中哪些实际问题?对于医疗器械企业来讲,医疗器械销售工作一直都是公司核心工作之一,而好的医疗器械销售管理系统就像人使用挖掘机与使用铁锹干活一样差距巨大,可以从量到质的提升医疗器械销售的工作效率,提升企业的运营能力与销售收入等。那么医疗器械销售管理系统可以解决工作中哪些实际问题?第一,医疗器械销售管理系统解决繁杂销售管理问题。医疗器械销售看似简单,其实隐藏着繁杂的工作内
相关文章

CRM管理系统的六个主要功能

  CRM管理系统的功能有哪些?  CRM管理系统是什么?它有哪些功能呢?许多企业都在使用CRM管理系统,那么它到底是什么呢?简单来说,CRM管理系统可以帮助企业管理销售流程和客户信息,提高销售效率和客户满意度。  在没有CRM管理系统之前,客户信息的记录和分析、销售线索的分配和跟进、销售过程的规范化管理都是非常困难的。企业需要花费大量时间和人力来整理这些数据。然而,CRM管理系统的出现可以解决这
相关文章

一分钟带您了解CRM客户管理系统!

  大家好,今天我要给大家介绍一个神奇的系统,它就是我们的CRM客户管理系统!这个系统可以帮你轻松管理客户,让你在市场竞争中占据优势。  首先,我们来看看这个系统能够做些什么。它可以帮助你收集、整理和管理客户信息,包括客户基本信息、历史交易记录、沟通记录等等,让你随时随地掌握客户动态,轻松应对各种挑战。  除此之外,CRM客户管理系统还可以自动化客户沟通,让你省去繁琐的手动操作,提高工作效率。例如
相关文章

CDP与CRM的区别

  CDP与CRM的区别  说完 CDP,我们来分析一下CRM的定位和作用,还是从我个人的经历来分享,大家更容易理解。  20多年前我加入华润超市工作,参与的第一个项目就是会员系统,那时候还叫积分卡系统。那时候的积分卡系统就是记录会员姓名生日等很简单的用户信息,作用就是消费有积分,积分能换礼品。那个年代条件有多差?兑换只能一个月一次,而且是采用离线的方式进行。后来网络条件好了,可以实现在线兑换积分
相关文章
最新文章

客户营销管理系统能解决企业哪些实际问题?

随着IT技术与经济的持续发展,营销技术与模式也在持续创新。传统的市场营销技术与模式已经严重落后于时代。企业在这种情况下,就需要使用先进的客户营销管理系统来满足企业生存与发展的需求。那么客户营销管理系统能解决企业哪些实际问题?▋解决销售效率问题客户营销管理系统的使用帮助企业解决销售效率问题。传统的销售过程看似简单,实际对于销售人员是比较繁杂的,特别是一些企业新招聘的销售人员,开第一单实际甚至长达三五
最新文章

外贸客户管理软件能解决企业哪些实际问题?

随着中国经济的持续发展,各种企业竞争逐渐的加剧,特别是外贸行业企业的竞争同样非常激烈。外贸行业企业在既需要成长又面临激烈竞争的情况下,就需要自己的专业外贸客户管理软件。那么外贸客户管理软件能解决企业哪些实际问题?附外贸客户管理软件解决方案。▋解决销售问题外贸客户管理软件解决企业销售方面的问题。外贸企业的主要的工作之一就是销售,可以说销售对于外贸公司来说至关重要。销售做的好的外贸企业才能够持续的成长
最新文章

营销CRM系统能解决哪些实际工作问题?

随着IT技术的高速发展与商业理念的变化,企业营销与销售工作也在快速的变化升级,也就要求企业可以跟上市场营销环境的变化,这个时候就要求企业使用营销CRM系统。那么营销CRM系统能解决哪些实际工作问题?下面从五个方面详细的介绍。▋提升效率营销CRM系统提升企业销售团队的工作效率。传统的销售方式需要销售人员使用大量的时间来进行线索的管理、客户信息的管理、销售过程的管理、合同的管理、回款的管理、回头客户的
最新文章

快速注册,立即使用

仅需一分钟,立即注册悟空云。悟空CRM免费试用。