인프라, 개발도구
AI 추론 비용이 모듈로 쪼개지는 시대, 누가 라우팅을 결정하는가
게시일: 2026-05-23
해결할 문제
AI 서비스를 굴리는 팀에게 추론 비용은 원가에서 가장 큰 덩어리다. 그런데 어느 모델을, 어느 칩에, 어느 지역으로 보내야 싼지를 한 화면에서 볼 방법이 없다.
왜 지금인가
Cerebras IPO를 기점으로 추론 칩이 다변화되면서, 단일 벤더가 아닌 라우팅 의사결정이 새로운 비용 절감 레버가 되었다.
추천 인재
LLM API를 직접 운영해 본 엔지니어 + AWS/GCP cost analyzer 같은 비용 분석 도구를 만들어 본 사람
어떤 문제인가
AI 서비스 운영팀은 지금 두 가지 문제를 동시에 풀고 있다. 첫째, 추론 비용이 매출의 30~60%를 차지하는 비중까지 올라왔다. 둘째, 어디에 요청을 보낼지가 단순한 OpenAI vs Anthropic 선택을 넘어섰다. Cerebras IPO 이후 Groq, SambaNova, Nvidia Inference Cloud, Together AI, Fireworks AI까지 옵션이 폭발했고, 같은 모델이라도 백엔드별 latency, 비용, throughput이 다르다.
기존 API 게이트웨이는 라우팅을 정적으로 처리한다. 트래픽이 적을 때 만든 규칙을 트래픽이 많은 시점까지 그대로 쓴다. 정작 매시간 단가가 바뀌고, 칩 공급 상황이 흔들리는데도 라우팅 결정은 사람이 분기마다 한 번씩 손으로 조정한다.
왜 지금인가
Cerebras 660억 달러 시총은 단순 IPO 성공이 아니다. 자본 시장이 “추론 칩 다변화”를 검증했다는 의미다. 이미 OpenAI, G42, MBZUAI, AWS가 동시에 Cerebras를 쓰고 있고, Anthropic, Google도 자체 칩(TPU, Trainium)을 외부에 개방하고 있다. 6개월 이내 라우팅 의사결정이 비용 절감의 가장 큰 레버가 될 것이다.
또 다른 신호는 OpenAI가 Cerebras에 의존하면서도 자체 데이터센터를 짓는다는 점이다. 가장 큰 LLM 회사조차 단일 벤더로 가지 않는다는 건, 작은 팀일수록 다중 벤더 운영의 복잡성을 해결해줄 도구가 필요하다는 의미다.
어떻게 만들 수 있나
flowchart LR
A[애플리케이션 요청] --> B[라우터 SDK]
B --> C{정책 엔진}
C -->|비용 최적화| D[Cerebras]
C -->|latency 우선| E[Groq]
C -->|품질 보장| F[Anthropic Claude]
C -->|배치/대량| G[OpenAI Batch]
D & E & F & G --> H[관측 레이어]
H --> I[비용/품질 대시보드]
I --> C
MVP는 3가지 컴포넌트로 시작한다:
- OpenAI 호환 SDK: 기존 코드를 한 줄만 바꿔 라우터를 끼울 수 있게 한다.
client = OpenAI()→client = MultiRouter() - 정책 엔진: 요청 metadata(모델, max_tokens, 예상 latency, SLA)와 실시간 단가표를 보고 백엔드 선택. 초기에는 룰 기반, 데이터 쌓이면 ML 기반 예측으로 전환.
- 관측 레이어: 요청별 실제 latency, 비용, 품질 점수(eval API) 기록. 분기별 자동 리포트.
가격: 처리한 토큰 1M당 $0.05 ~ $0.10 (= LLM 호출 비용의 1~5%). 매월 100K 달러 이상 쓰는 팀에게는 ROI가 명확하다.
성공 조건
- 핵심 가정: 백엔드 간 가격 격차가 30% 이상 유지된다. → Cerebras, Groq의 초기 공격적 가격 정책이 검증된다면 성립.
- 검증 방법: 베타 고객 5팀에게 1개월 무료 도입 → 비용 절감액의 20%를 수수료로 받는 성과형 계약. 5팀 중 3팀이 월 $5K 이상 절감하면 시장이 있다.
- 리스크: 주요 LLM 벤더가 자체 통합 API를 출시해 라우팅 레이어를 흡수할 가능성. 그러나 단일 벤더 록인을 피하려는 수요는 본질적으로 다른 시장이다.
함께 만들어 보세요
함께할 인재 보기