Backend.AI + VAST Data:
스토리지로 완성하는 KV 캐시 오프로딩
벤치마크로 알아본 고부하 에이전트 워크로드에서의 KV 캐시 오프로딩 효과
Backend.AI 세션이 GPUDirect Storage로 VAST Data 스토리지에 KV 캐시를 직접 오프로딩(KV Cache Offloading)해 반복 프리필 없이 이전 컨텍스트로 재진입하는 방법과, 벤치마크로 알아본 응답 시간 개선 폭을 확인해보세요.
관련 서비스
Backend.AI는 자체 개발한 오케스트레이션 및 작업 스케줄러를 기반으로 하는 벤더 중립적 가속 워크로드 호스팅 플랫폼으로, 클라우드 또는 온프레미스(에어갭) 클러스터 위에서 실행됩니다.
서비스 살펴보기 →VAST Data는 AI 운영체제(AI Operating System) 기업입니다. VAST AI OS는 데이터 서비스, 컴퓨트 서비스, 에이전트 실행 기능을 하나의 확장 가능한 플랫폼으로 통합하며, 성능·확장성·단순성·복원성 간의 트레이드오프를 제거하도록 설계된 DASE 병렬 분산 아키텍처를 기반으로 합니다.
자세히 보기 →