DeepFloodbeta

阿里云新系统据称将AI模型所需的的 Nvidia GPU 使用量削减 82%

阿里巴巴集团旗下阿里云推出了一项计算资源池化解决方案,声称能将服务人工智能模型所需的英伟达(Nvidia)图形处理器(GPU)数量削减 82%。这项名为 Aegaeon 的系统在阿里云的模型市场进行了三个多月的 Beta 测试,成功将服务数十个参数高达 720 亿的模型所需的 Nvidia H20 GPU 数量从 1,192 个降至 213 个。该成果在本周于韩国首尔举行的第 31 届操作系统原理研讨会(SOSP)上发表。
研究人员指出,Aegaeon 是首个揭示市场中并发大型语言模型(LLM)工作负载相关过度成本的成果。该解决方案通过在 token 级别进行“自动扩缩容”,使单个 GPU 能够支持多达七个模型,并将模型切换的延迟降低了 97%。此举也反映了中国科技公司在日益严格的出口管制下,通过优化软件来减少对美国芯片依赖的努力。
云服务提供商,如阿里巴巴云和字节跳动的火山引擎,同时为成千上万的 AI 模型提供服务,意味着大量应用程序接口调用需并行处理。
然而,少数模型如阿里巴巴的 Qwen 和 DeepSeek 在推理任务中最为流行,而其他大多数模型仅偶尔被调用。研究人员发现,这导致了资源利用效率低下——在阿里巴巴云的市场中,17.7%的 GPU 仅用于处理 1.35%的请求。
全球研究人员一直致力于通过整合 GPU 算力来提升效率,例如让单个 GPU 同时服务多个模型。
在 Aegaeon 系统下,研究人员设计了一种在token级别实现“自动扩缩容”的解决方案,这意味着 GPU 可以在生成token的过程中,切换为服务不同的模型。
研究人员表示,该方案使单个 GPU 能够支持多达七个模型,而其他替代系统最多仅能支持两到三个模型,并将模型间切换的延迟降低了 97%。

来源:南华早报(https://www.scmp.com/business/article/3329450/alibaba-cloud-claims-slash-nvidia-gpu-use-82-new-pooling-system)

  • 那为什么高端GPU价格降不下来?

  • 要钱吗

  • 👍好消息