通过模型缓存减少 Amazon SageMaker HyperPod 上的推理冷启动
AWS ML Blog · · 发布于 2026-09-11 · 1 分钟阅读
当您在 Amazon SageMaker HyperPod 上部署用于推理的大型语言模型 (LLM) 时,您请求 Pod 和准备好提供流量之间存在时间间隔。这一差距主要由两个连续下载造成:来自 Amazon Elastic 的推理服务器容器映像
要点 1
当您在 Amazon SageMaker HyperPod 上部署用于推理的大型语言模型 (LLM) 时,您请求 Pod 和准备好提供流量之间存在时间间隔。
要点 2
这一差距主要由两个连续下载造成:来自 Amazon Elastic 的推理服务器容器映像
SOURCES
共 1 个来源