블로그 목록으로

기술 노트2025년 5월 18일

OpenRouter로 멀티 AI 모델 라우팅 구현 — 비용 최적화 전략

작성: Hiramise 팀

Hiramise는 레이아웃 생성, 카탈로그 이미지 분석, 법규 검증 등 여러 AI 작업을 처리합니다. 모든 호출에 같은 모델을 쓰면 비용이 급격히 늘어납니다. OpenRouter를 활용해 작업별로 모델을 분리한 경험을 공유합니다.

왜 OpenRouter인가

OpenRouter는 OpenAI 호환 API 단일 엔드포인트로 수십 개의 모델에 접근할 수 있습니다. 프로바이더를 바꿔도 코드 변경 없이 모델 ID만 교체하면 됩니다.

  • 단일 API 키로 Anthropic, Google, Meta 등 모델 통합 관리
  • Fallback 라우팅 지원 — 주 모델 과부하 시 자동 대체
  • 토큰 단위 비용 모니터링 대시보드 내장

작업별 모델 분리 전략

모든 AI 호출을 하나의 클라이언트 래퍼(app/ai/client.py)를 통과하도록 설계했습니다. 모델 ID는 별도 상수(app/ai/models.py)로 분리해 전환 비용을 최소화했습니다.

  • 레이아웃 생성 (복잡한 추론 필요): claude-opus-4.7 — 정확도 우선
  • 카탈로그 이미지 분석 (Vision): claude-sonnet-4.6 — 속도+비용 균형
  • 간단한 텍스트 요약·태깅: claude-haiku (최저 비용)
  • 법규 체크 (캐시 가능한 긴 컨텍스트): Opus + 프롬프트 캐싱

비용 최적화 결과

모든 호출을 Opus로 처리할 때와 비교해 월 AI 비용이 약 40% 감소했습니다. 레이아웃 생성 품질은 Opus를 유지하면서, 빈번한 Vision 호출은 Sonnet으로 처리한 것이 주효했습니다.

  • Vision 분석 호출: 전체의 65% → Sonnet 전환으로 최대 5× 비용 절감
  • 레이아웃 생성: 전체의 20% → Opus 유지 (품질 타협 불가)
  • 캐시 히트율: 법규 컨텍스트 약 70% 캐시 적중 → 추가 30% 절감
OpenRouter의 프롬프트 캐싱은 Claude Opus와 Sonnet 모두 지원하지만, 지원 여부와 가격은 시점에 따라 다를 수 있습니다. 대규모 컨텍스트 사용 전 반드시 OpenRouter 대시보드에서 확인하세요.
기술 노트발행일: 2025년 5월 18일
작성: Hiramise 팀
OpenRouter로 멀티 AI 모델 라우팅 구현 — 비용 최적화 전략 | Hiramise | Hiramise