SOFTWARE
RedGX
Redis GPU eXchange
서비스 서버가 GPU 응답을 기다리지 않고, AI 요청은 대기열에 맡겨 준비되는 대로 받습니다.
Architecture
제품 개요
RedGX는 AI 요청을 대기열에 저장하고 독립된 작업기가 외부 추론 엔진으로 전달합니다. 처리 결과를 별도로 보관해 AI 연산 부하를 게이트웨이와 분리합니다.
사용 예시
GPU 임베딩 비동기 요청 흐름
# 1) 임베딩 작업 접수
POST <GPU 작업 엔드포인트>
API key: <도입 환경에서 발급한 키>
Content-Type: application/json
{"texts": ["문장 1", "문장 2"]}
# → 202 Accepted + 요청 ID
# 2) 상태와 결과 조회
GET <GPU 결과 엔드포인트>/{요청 ID}
API key: <도입 환경에서 발급한 키>
# → 완료 상태 + 벡터 결과 도입 환경에서 발급한 API 키로 인증하고 네임스페이스별 읽기·쓰기 권한을 적용합니다. 실제 엔드포인트와 응답 구조는 도입 구성에 맞춰 제공합니다.
API 인터페이스
- Embedding 문장·문서 벡터화 요청
- Generation 텍스트 생성·요약·분류 요청
- Translation 다국어 번역 요청
- Speech-to-Text 음성 파일의 텍스트 변환 요청
- OCR 문서 이미지의 텍스트 인식 요청
- OpenAI 호환 채팅·임베딩 호환 인터페이스
- 비동기 제어 상태 조회·일괄 조회·취소·대기
- 운영 관리 작업기·모델 연결·서비스 지표 관리
RedGX는 GPU 작업 API와 OpenAI 호환 채팅·임베딩 인터페이스를 제공하며, RedGW와는 독립적으로 운영됩니다.
AI 작업 중계
- embedding → TEI문장 · 문서 임베딩 (검색 · RAG)
- generation → vLLM텍스트 생성 · 요약 · 분류
- translation → NLLB (커스텀)다국어 번역
- stt → faster-whisper음성 → 텍스트
- ocr → PaddleOCR (커스텀)문서 이미지 → 텍스트
POST 요청으로 접수 번호를 받고 GET 요청으로 결과를 조회합니다.
모델과 자원 수치는 연동 예시이며, 운영 환경에 필요한 엔진을 선택해 구성합니다.
추론 엔진 분리
RedGX 작업기는 AI 모델을 직접 적재하지 않고 외부 추론 엔진으로 요청을 전달합니다.
- 장애 격리 — 추론 오류와 GPU 메모리 부족의 영향을 게이트웨이에서 분리합니다.
- 빠른 운영 변경 — 모델을 다시 적재하지 않고 게이트웨이 설정을 반영합니다.
- 추론 성능 활용 — 전용 엔진의 배치 처리와 가속 기능을 활용합니다.
- 모델 교체 유연성 — 게이트웨이 변경 없이 추론 엔진을 교체할 수 있습니다.
vLLM, TEI 또는 별도 추론 서버를 연결할 수 있습니다. 표시된 모델은 연동 예시입니다.
요청은 대기열에, 응답은 준비되는 대로
서비스 서버가 GPU 응답을 기다리지 않습니다. 요청을 대기열에 맡기고 처리가 끝나면 결과를 가져갑니다.
접수 요청을 받습니다
- 태스크별 API — 임베딩, 생성, 번역, STT와 OCR 요청을 독립적으로 제공합니다.
- OpenAI 호환 API — 기존 도구를 폐쇄망의 채팅·임베딩 추론에 연결합니다.
처리 대기열에서 돌립니다
- 단계별 처리 — 요청 접수, 작업 처리, 결과 보관 흐름으로 운영합니다.
- 자동 배치 — 요청량과 대기 시간에 따라 작업을 묶어 처리합니다.
- 과부하 보호 — 대기열 상태에 따라 신규 요청을 제어합니다.
보호 문을 지킵니다
- 접근 제어 — 네임스페이스별 API 키와 허용 IP를 관리합니다.
- 전송·트래픽 보호 — HTTPS와 호출 제한을 적용합니다.
- 통합 모니터링 — Prometheus와 Grafana로 대기열과 처리 상태를 확인합니다.
모델은 RedGX 안에서 실행하지 않습니다 — 추론은 별도 추론 서버에 위임합니다.
제품 사양
- 버전
- 0.x
- 제품 구조
- RedGW와 독립된 형제 제품
- 실행 방식
- 웹 API와 백그라운드 작업 분리
- 저장소
- AI 작업 대기열·상태·결과를 Redis에 저장
- AI 엔진 연동
- vLLM, TEI 등 외부 추론 엔진 연동
- 보안·중계
- Nginx 기반 HTTPS와 호출 제한
- 상태 감시
- 서비스 지표와 대기열 모니터링
- 모델 격리
- AI 모델은 외부 추론 엔진에서 실행
보안 · 컴플라이언스
- 폐쇄망 운영
- AI 모델과 실행 이미지를 내부망에 반입해 구성
- 인증 · 권한
- API 키 인증과 네임스페이스별 읽기·쓰기 권한
- 작업 격리
- AI 연산을 외부 추론 엔진에서 실행
- 전송 · 제한
- Nginx 기반 HTTPS와 호출 제한
- 문의
- info@cubiware.co.kr
도입 · 시작하기
- 용도 정의 — 대상 AI 기능과 모델 선정
- 환경 구성 — 실행 이미지와 AI 모델 반입 및 연결
- 운영 점검 — 요청량과 처리 상태 모니터링
사용 패턴에 맞춰 배치 크기와 최대 대기 시간을 조정합니다.
도입을 검토하고 계신가요?
고객 요건과 운영 환경에 맞춰 구성·도입 절차를 안내해 드립니다. 데모·제안 요청은 문의로 받습니다.