在当今数字化飞速发展的时代,大模型技术的兴起正深刻地改变着各个领域。服务器作为数据中心的核心组成部分,在大模型重塑数据中心架构的过程中发挥着至关重要的作用。以下将详细探讨服务器在这一变革中的具体影响和推动作用。
生成式AI的发展对全球IT支出产生了显著影响。根据Gartner的预测,2024年全球IT支出预计将达到5.26万亿美元,较2023年增长7.5%,中国IT支出预计将达到5890亿美元,较2023年增长8.5%。而在众多受影响的领域中,数据中心系统和服务器产业率先从生成式AI中获益。数据中心系统市场从2023年仅增长4%,到2024年猛增24.1%,大模型与生成式AI功不可没。
从服务器市场的具体数据来看,2024年前三季度全球服务器销售额1515.6亿美元,同比增长65.0%,出货量887.1万台,同比增长6.4%,其中元脑服务器出货量达100.2万台,同比增长20.7%,以11.3%的市占率蝉联全球前二,中国第一。2024年全球服务器市场规模预计可突破2000亿美元大关,达到2164亿美元,2023 - 2028年整体市场规模将以20%的复合年增长率保持高速增长,2028年预计将超3329亿美元。其中AI服务器增长强劲,将占近7成市场份额,通用服务器在AI的带动下也将持续稳定增长,全球将进入AI算力主导的全新智能时代。这一系列数据充分表明,大模型的发展促使企业加大对服务器的投入,从而推动了整个数据中心产业的蓬勃发展。
随着大模型的不断发展,其对服务器性能的要求也越来越高。大模型的训练和推理需要大量的计算资源和高速的数据传输能力。传统的数据中心架构可能无法满足这些需求,因此需要进行变革。
在计算能力方面,大模型通常需要处理海量的数据和复杂的算法,这就要求服务器具备强大的CPU和GPU性能。例如,像OpenAI的GPT - 3模型训练,微软专门推出的超级计算机拥有28.5万个CPU核心、1万个GPU,以满足其算力需求。为了适应这种高计算需求,数据中心需要采用更高效的服务器配置和架构,如采用多核处理器、分布式计算等技术,以提高计算效率和并行处理能力。
在数据传输方面,大模型的数据交互频繁,需要高速、低延迟的网络连接。传统的三层网络架构已无法满足云数据中心对东西向流量的处理需求。叶脊架构通过将服务器连接到高效的叶交换机网络,再通过脊交换机进行汇聚,显著减少了延迟和带宽消耗,使得数据中心能够更好地应对大数据和分布式计算,实现低延迟的通信。这种架构的变革有助于提高服务器之间的数据传输效率,从而更好地支持大模型的运行。
大模型所需的大算力需求带来了严重的能耗和散热问题。以ChatGPT为例,国盛证券报告估算,GPT - 3训练一次的成本约为140万美元,若用ChatGPT服务用户,以2023年1月的独立访客平均数1300万计算,每日电费在5万美元左右。数据中心的能耗问题成为云计算提供商面临的重大挑战。
为了解决服务器的散热问题,液冷技术逐渐成为研究和应用的热点。服务器“泡澡”是一种比喻,实际上代表的是服务器散热液冷技术中的浸没方式,液冷技术包含了冷板、喷淋、浸没式等。虽然液冷技术并非一个特别新的技术,但此前业界的使用率并不高。主要原因包括国内许多冷板液冷设计缺乏规范的验证标准,使得每个厂家设计都有差异,系统设计成本、验证成本比较高,对于最终用户而言方案较贵;此外,高性能应用环节可能才需要液冷,而大量应用并非高功耗应用,在国家提出“双碳”战略之前,紧迫性和必要性没有那么高。
然而,随着CPU和GPU功耗的不断增加,如现在CPU的功耗可能高达270W、300W,未来可能达到350W,GPU现在都400W、500W,应用液冷技术变得越来越必要。目前,微软Azure、阿里云等都早已让数据中心的服务器用“泡澡”的方式来散热,以提升IDC的能源效率。英特尔市场营销集团副总裁、中国区数据中心销售总经理兼中国区运营商销售总经理庄秉翰表示,ChatGPT会加速液冷的发展,目前液冷几乎已经成为一个潮流。这种散热技术的创新不仅有助于解决服务器的散热问题,还能降低数据中心的能耗,符合环保和可持续发展的要求。
大模型的训练和应用需要大量的数据存储和快速的数据访问。全闪存阵列凭借其无与伦比的读写速度和近乎零延迟,正在数据中心存储领域占据主导。NVMe技术和全闪存的结合,使得数据访问几乎瞬间完成,这对于实时分析和高并发工作负载来说是革命性的。大模型在运行过程中需要频繁地读取和写入数据,传统的机械硬盘存储方式难以满足其速度要求,而全闪存阵列能够提供高速的数据读写性能,大大提高了大模型的运行效率。
不过,全闪存阵列也存在一些问题,如高昂的成本和复杂管理。企业在采用全闪存阵列时需要平衡性能与成本效益。尽管如此,随着技术的不断进步和成本的逐渐降低,全闪存阵列在数据中心的应用将越来越广泛。同时,为了满足不同规模和需求的企业,数据中心也可能采用混合存储架构,即同时使用传统硬盘和全闪存阵列,以在成本和性能之间找到最佳平衡点。这种存储架构的改变有助于更好地支持大模型的数据存储和处理需求。
大模型的发展促使数据中心的布局发生变化。传统的数据中心布局可能无法满足大模型对服务器的特殊需求。为了更好地支持大模型的运行,数据中心需要进行更加合理的规划和布局。
一方面,数据中心需要根据服务器的性能和功能进行分区布局。例如,将高性能的AI服务器集中放置在特定区域,以便于管理和维护,同时提供更好的网络和散热条件。另一方面,边缘数据中心的部署也变得更加重要。边缘数据中心可以更靠近数据源和用户,减少数据传输延迟,提高数据处理的实时性。大模型在一些实时应用场景中,如自动驾驶、智能监控等,对数据处理的实时性要求很高,边缘数据中心能够更好地满足这些需求。通过在边缘部署服务器,将部分数据处理任务放在边缘进行,可以减轻核心数据中心的负担,提高整个系统的运行效率。
服务器在大模型的推动下,也促使数据中心向智能化和自动化方向发展。大模型可以通过对服务器运行数据的分析和学习,实现对服务器的智能管理和优化。例如,通过实时监测服务器的性能指标,如CPU使用率、内存使用率、网络带宽等,大模型可以预测服务器的故障风险,并提前采取措施进行预防和修复。
在自动化方面,服务器可以实现自动配置、自动部署和自动调整。当数据中心的业务需求发生变化时,服务器可以根据预设的规则自动调整资源分配,以提高资源利用率和系统性能。此外,服务器还可以与其他设备和系统进行自动化交互,实现整个数据中心的协同工作。例如,服务器可以与网络设备、存储设备等进行自动化通信,根据业务需求自动调整网络带宽和存储容量。这种智能化和自动化的发展不仅提高了数据中心的运行效率和可靠性,还降低了人工管理成本。
综上所述,服务器在大模型重塑数据中心架构的过程中扮演着关键角色。从带动产业增长到推动架构变革,从解决散热问题到改变存储架构,从优化布局到促进智能化与自动化发展,服务器的作用无处不在。随着大模型技术的不断发展和创新,服务器也将不断升级和优化,以更好地适应数据中心架构的变革,为数字化时代的发展提供坚实的支撑。