Backend.AI + VAST Data:
스토리지로 완성하는 KV 캐시 오프로딩
벤치마크로 알아본 고부하 에이전트 워크로드에서의 KV 캐시 오프로딩 효과
Backend.AI 세션이 GPUDirect Storage로 VAST Data 스토리지에 KV 캐시를 직접 오프로딩(KV Cache Offloading)해 반복 프리필 없이 이전 컨텍스트로 재진입하는 방법과, 벤치마크로 알아본 응답 시간 개선 폭을 확인해보세요.
에이전트 워크로드의 TTFT를 절반으로 줄이는 KV 캐시 오프로딩
코딩 에이전트처럼 여러 턴에 걸쳐 같은 작업 맥락으로 되돌아오는 워크로드는, 방대한 코드베이스와 도구 호출 맥락이 담긴 긴 프리필(Prefill)을 턴마다 재사용합니다. 여러 세션이 하나의 추론 서버를 번갈아 점유하면 GPU 메모리의 KV 캐시(KV cache) 블록이 밀려나고, 다음 턴에서 프리필을 다시 수행하게 되어 첫 토큰 응답 시간(TTFT)이 늘어납니다. 사용자 체감 성능은 단순 토큰 처리량보다 동일한 컨텍스트에 얼마나 빠르게 재진입하는지에 좌우됩니다.
Backend.AI 세션은 Storage Proxy를 통해 VAST KV 캐시 폴더를 마운트하고, 세션 안에서 실행되는 vLLM과 LMCache가 VAST 마운트를 직접 참조합니다. NVIDIA Magnum IO GPUDirect Storage를 활용해 KV 블록이 호스트 RAM을 거치지 않고 GPU 메모리와 스토리지 사이를 직접 이동하므로, 당장 쓰지 않는 컨텍스트는 스토리지 계층으로 옮기고 GPU 메모리에는 활성 컨텍스트만 남길 수 있습니다.
벤치마크 측정 조건과 턴별 상세 결과, 오프로딩이 효과를 내는 워크로드 판단 기준은 브리프 전문에서 확인해보세요.
관련 서비스
Backend.AI는 자체 개발한 오케스트레이션 및 작업 스케줄러를 기반으로 하는 벤더 중립적 가속 워크로드 호스팅 플랫폼으로, 클라우드 또는 온프레미스(에어갭) 클러스터 위에서 실행됩니다.
서비스 살펴보기 →VAST Data는 AI 운영체제(AI Operating System) 기업입니다. VAST AI OS는 데이터 서비스, 컴퓨트 서비스, 에이전트 실행 기능을 하나의 확장 가능한 플랫폼으로 통합하며, 성능·확장성·단순성·복원성 간의 트레이드오프를 제거하도록 설계된 DASE 병렬 분산 아키텍처를 기반으로 합니다.
자세히 보기 →