여러 LLM을 하나의 게이트웨이로

Continuum은 상용 API 모델과 자체 GPU에서 서빙하는 모델을 하나의 엔드포인트로 통합합니다.

Continuum Hub Observatory

한눈에 보기.

단일 API 통합

상용 API 모델과 자체 호스팅 모델(예: Backend.AI 클러스터)을 동일한 엔드포인트로 호출합니다.

모든 상표는 각 소유자의 재산입니다.

도입 배경

모델이 늘수록 함께 늘어나는 관리 지점

모델이 늘수록 함께 늘어나는 관리 지점

Continuum Router 백엔드 화면. 관리 화면은 바이너리에 내장되어 있습니다.

조직이 운영하는 LLM은 단일 모델에서 용도별 다중 모델로 바뀌는 경우가 많습니다. 모델이 늘면 관리 지점이 함께 늘어나, 키 발급과 별도 콘솔, 장애 추적, 모델 교체, 사용량 정산을 모델마다 따로 처리해야 합니다. Continuum은 늘어난 관리 지점을 한 곳으로 통합하므로, 모델 수가 늘어도 키 발급과 장애 추적, 모델 교체, 사용량 정산을 한 곳에서 처리할 수 있습니다.

구조

요청을 처리하는 Router, Router를 관리하는 Hub

추론 요청은 데이터 플레인인 Continuum Router만 지나갑니다. Continuum Hub는 그 경로 밖에서 여러 Router를 한곳에서 관리하는 관리 플레인입니다.

Continuum Hub관리 플레인키·권한 중앙 관리 · 팀별 한도 집행 · 사용량·비용 집계 · 정책 무중단 배포플랫폼 관리자정책 담당정책 정의정책·키 배포사용량 전송서비스 A서비스 B서비스 CContinuum Router데이터 플레인멀티 백엔드 통합 · 라우팅 정책폴백·헬스체크 · 가드레일레이트리밋 · 캐시클라우드 프로바이더OpenAIAzure OpenAIAnthropicGeminiAWS Bedrock로컬·자체 호스팅Backend.AIvLLMSGLangOllamallama.cppMLxcel

모든 상표는 각 소유자의 재산입니다.

Continuum Router

어떤 백엔드든 하나의 호환 API로

클라우드 프로바이더 API와 자체 호스팅 엔진을 하나의 호환 API로 통합합니다. 전용 백엔드 유형 12종을 지원하며, Backend.AI를 포함 OpenAI 및 Anthropic 호환 엔드포인트를 제공하는 서비스는 자유롭게 등록할 수 있습니다.

  • 대화(chat·responses·messages)
  • 임베딩·리랭크
  • 이미지 생성·편집
  • 파일 전송·배치
  • 실시간 음성
  • 모델 목록

캐시 최적화

모델 호출과 재계산을 줄이는 캐시 구조

Router는 캐시된 응답이 있으면 모델 호출 없이 바로 반환하고, 없으면 프리픽스 캐시를 보유한 레플리카로 라우팅해 프리픽스를 다시 계산하지 않습니다.

  1. 응답 캐시

    같은 요청이 다시 들어오면 모델 호출 없이 저장된 응답을 그대로 반환하는 캐시입니다.

  2. 공유 외부 캐시

    여러 Router 인스턴스가 함께 쓰는 외부 캐시 저장소입니다. 저장소가 중단되면 각 인스턴스의 로컬 응답 캐시로 폴백합니다.

  3. 프리픽스 인지 라우팅

    모델명과 프롬프트 프리픽스를 해싱해, 캐시를 보유할 가능성이 높은 레플리카로 요청을 보내는 라우팅입니다.

  4. KV 인덱스

    모델 서버가 보고한 실제 KV 캐시 보유 현황을 실시간으로 조회하는 인덱스입니다.

토큰 절감

질문에 맞는 모델 선택과 유사 질문의 답변 재사용

스마트 라우팅과 시맨틱 캐시가 각각 상위 모델 호출과 반복 호출을 줄여 토큰 사용량과 응답 시간을 낮춥니다.

요청에 모델을 지정하지 않거나 지정을 허용하지 않는 환경에서 Router가 요청 내용의 복잡도와 특성에 맞는 모델을 선택합니다. 특정 상위 모델에 요청이 집중되지 않습니다.

  • Flagship, Standard, Lightweight 세 티어에 모델 등록
  • 정책이 지정한 티어 범위 안에서 라우팅
  • Playground에서 라우팅 결과 사전 확인

의미가 유사한 질문에는 Router가 저장해 둔 답변을 재사용해 모델 호출을 생략합니다. 별도의 벡터 데이터베이스 없이 동작합니다.

  • API 키, 시스템 프롬프트, 모델, 도구 설정이 모두 같은 요청끼리만 캐시 공유
  • 가드레일에 차단된 질문은 캐시 조회 제외

장애 대응

기본 모델이 실패해도 예비 모델이 반환하는 응답

모델마다 예비 모델을 우선순위로 지정해 둘 수 있습니다. 기본 모델이 실패하면 Router가 요청을 다음 순위 모델로 라우팅해 응답을 반환합니다. 사용자에게는 기존 모델 이름이 그대로 보이기 때문에, 작업의 일관성을 보존할 수 있습니다.

  • 임계치 초과 백엔드 차단 후 일부 요청으로 복구 확인
  • 헬스체크 기반 장애 백엔드 제외와 자동 복귀
기본 모델gpt-oss-120b실패예비 모델 1claude-sonnet-5응답예비 모델 2gemini-2.5-flash

운영 통제

요청 경로의 통제부터 조직 단위 정산까지

Router는 지나가는 요청을 그 자리에서 통제하고, Hub는 그렇게 모인 사용량을 조직 단위로 정산하고 설정을 한곳에서 배포합니다.

Backend.AI와의 관계

Backend.AI와 함께, 또는 단독으로 동작하는 Continuum

Continuum은 다른 제품의 도입 여부와 무관하게 단독으로 사용할 수 있습니다. Backend.AI 클러스터를 운영 중이라면 해당 클러스터의 서빙 엔드포인트를 백엔드로 바로 등록할 수 있습니다.

Continuum

조직 단위 통제Continuum Hub

단위별 LLM 거버넌스와 과금

키·권한 중앙 관리팀별 한도 집행사용량·비용 집계정책 무중단 배포

LLM 요청 운영Continuum Router

라우팅, 접근 정책, API 키, 한도, 사용량, 비용 관리

멀티 백엔드 통합라우팅 정책폴백·헬스체크가드레일레이트리밋캐시
외부 LLM API
OpenAIAzure OpenAIAnthropicGeminiAWS Bedrock
자체 호스팅
Backend.AI

추론 엔진

vLLMSGLangOllamallama.cppMLxcel

도입 순서

손쉽게 도입하는 Continuum Enterprise

  1. Router 설치

    Linux(x86-64 / ARM64), macOS(Apple Silicon), Windows 어디에나 설치할 수 있습니다.

    • 릴리스 바이너리
    • .deb 패키지
    • 컨테이너 이미지
    • Kubernetes(Kustomize / Helm)
  2. Endpoint 연결

    기존 코드를 수정하지 않고 애플리케이션의 엔드포인트 주소와 키만 바꿔 연결할 수 있습니다.

    • OpenAI 호환 형식
    • Anthropic 네이티브 형식
  3. Hub 확장

    Router를 다중화하거나 조직·팀 단위 정산이 필요해지면 Hub를 추가할 수 있습니다.

    • Continuum Hub
    • Redis / Valkey
    • S3 호환 스토리지
  • 폐쇄망·망분리 지원: Router에서 Hub로의 통신은 아웃바운드 전용이며, 관리 화면은 바이너리에 내장되어 있습니다.
  • Prometheus 메트릭을 노출하고, OpenTelemetry 수집기로 트레이스를 내보낼 수 있습니다.

설치 요구 사양

적은 자원으로 운영하는 Continuum

단일 설치 기준 사양으로, 고가용성 구성 시 Router 2대 이상과 Redis 또는 Valkey를 권장합니다.

구성 요소최소 사양권장 사양
Router1CPU 1코어 / RAM 64 MiBCPU 2코어 이상 / RAM 1 GiB 이상
Hub2CPU 1코어 / RAM 128 MiBCPU 2코어 / RAM 4 GiB
공유 상태 저장소3불필요Redis 또는 Valkey
디스크4100 MB-
  1. 실행 중 실제 사용 메모리 31~37 MiB(Continuum Router 1.22, 2026년 8월 자체 측정)
  2. PostgreSQL 동일 노드 설치 시 권장 사양
  3. Router 다중화 시 레이트리밋·캐시 공유. 단독 구성은 레이트리밋·동시성 제어에 외부 데이터베이스 불필요
  4. Files API 사용 시 저장 용량 별도 산정

솔루션 브리프

Continuum Hub와 Router 솔루션 브리프

제품별 아키텍처와 기능, 비교 측정 결과, 도입 판단 기준을 각 브리프에서 확인할 수 있습니다.

게이트웨이 하나로 통합된 LLM 운영을 확인해 보세요

운영 중인 서비스에 Continuum을 연결하면 여러 모델을 하나의 엔드포인트로 호출할 수 있습니다.

기술 문서 보기

도움이 필요하신가요?

내용을 작성해 주시면 곧 연락 드리겠습니다.

문의하기
lablup

본사 및 HPC 연구소

KR Office: 서울특별시 강남구 선릉로 577 CR타워 8층 US Office: 3003 N First st, Suite 221, San Jose, CA 95134

  • facebook
  • youtube
  • Linkedin
  • GitHub

© Lablup Inc. All rights reserved.

개인정보를 소중히 여깁니다

쿠키는 사이트 트래픽 분석, 방문자 이용 방식 파악, 서비스 개선에 사용됩니다. 사이트 기본 동작에 필요한 필수 쿠키는 항상 활성화됩니다. 자세히 보기

"모두 수락"을 클릭하면 분석 쿠키가 기기에 저장되는 것에 동의하게 됩니다. 필수 쿠키만 허용하시려면 "모두 거부"를, 직접 선택하시려면 "상세 설정"을 눌러주세요. 설정은 언제든지 변경할 수 있습니다.