리소스연구 노트

KV cache offloading:
긴 컨텍스트 LLM 서빙에서 GPU 메모리 확보하기

KV cache offloading 도입 시점을 판단하는 실무 프레임워크

LLM 추론 워크로드는 동시 사용자 수, 컨텍스트 길이, 트래픽 패턴에 따라 KV 캐시가 GPU 메모리에 가하는 부담이 달라집니다. 이 가이드에서는 워크로드 유형별 오프로딩 도입 효과 매트릭스, 효과를 결정하는 세 가지 비용 변수, 그리고 오프로딩이 오히려 성능을 저하시키는 조건을 정리합니다.

리소스 다운로드

아래 양식을 작성해 주세요.

Backend.AI는 VAST Data 등 RDMA 스토리지 벤더와의 통합 테스트를 마쳤습니다.

추론 인프라를 Backend.AI 위에서 구성해 보세요.

Backend.AI 살펴보기

도움이 필요하신가요?

내용을 작성해 주시면 곧 연락 드리겠습니다.

문의하기
lablup

본사 및 HPC 연구소

KR Office: 서울특별시 강남구 선릉로 577 CR타워 8층 US Office: 3003 N First st, Suite 221, San Jose, CA 95134

  • facebook
  • youtube
  • Linkedin
  • GitHub

© Lablup Inc. All rights reserved.

개인정보를 소중히 여깁니다

쿠키는 사이트 트래픽 분석, 방문자 이용 방식 파악, 서비스 개선에 사용됩니다. 사이트 기본 동작에 필요한 필수 쿠키는 항상 활성화됩니다. 자세히 보기

"모두 수락"을 클릭하면 분석 쿠키가 기기에 저장되는 것에 동의하게 됩니다. 필수 쿠키만 허용하시려면 "모두 거부"를, 직접 선택하시려면 "상세 설정"을 눌러주세요. 설정은 언제든지 변경할 수 있습니다.