通过 Amazon SageMaker Inference 上的前缀感知路由减少 LLM 延迟
AWS ML Blog · · 发布于 2026-09-11 · 1 分钟阅读
当您在大型语言模型 (LLM) 之上构建应用程序时,发送到模型的提示通常包含两部分。有一个固定部分用于设置上下文(说明、参考文档、对话历史记录),还有一个可变部分包含实际用户
要点 1
当您在大型语言模型 (LLM) 之上构建应用程序时,发送到模型的提示通常包含两部分。
要点 2
有一个固定部分用于设置上下文(说明、参考文档、对话历史记录),还有一个可变部分包含实际用户
SOURCES
共 1 个来源