AX· 읽는 데 3분
모델 가격이 또 내려갔다: AI 기능의 운영비를 설계하는 법
Claude Sonnet 5가 낮은 가격으로 출시됐습니다. 가격이 계속 변하는 상황에서 AI 기능의 운영비를 예측 가능하게 만드는 방법을 정리했습니다.
6월 30일 Anthropic이 Claude Sonnet 5를 출시했습니다. 출시와 함께 기본 모델이 됐고, 입력 100만 토큰당 2달러, 출력 100만 토큰당 10달러의 도입 가격이 적용됩니다.
모델은 계속 좋아지고 가격은 계속 내려갑니다. 좋은 소식이지만, AI 기능을 서비스에 넣으려는 회사는 여전히 같은 질문을 합니다. "한 달에 얼마가 나올지 모르겠어요."
왜 예측이 어려운가
AI 비용은 사용량에 비례합니다. 고객이 얼마나 쓸지, 한 번에 얼마나 긴 내용을 주고받을지에 따라 달라집니다. 서버 비용처럼 고정되어 있지 않습니다.
게다가 비용의 대부분은 눈에 보이지 않는 곳에서 나옵니다. 사용자가 입력한 한 줄짜리 질문 뒤에, 시스템이 붙이는 수천 자의 지시문과 참고 문서가 있습니다.
비용을 예측 가능하게 만드는 방법
1. 기능 한 번당 비용을 잽니다
"문의 한 건 답변에 얼마", "문서 한 건 요약에 얼마"처럼 기능 단위로 실제 비용을 측정합니다. 여기에 예상 사용 횟수를 곱하면 월 비용의 범위가 나옵니다. 추정이 아니라 실제 호출 기록으로 재야 합니다.
2. 일에 맞는 크기의 모델을 씁니다
모든 요청에 가장 좋은 모델을 쓸 필요는 없습니다.
| 작업 | 적합한 모델 |
|---|---|
| 분류, 태그 달기, 간단한 추출 | 가장 작은 모델 |
| 일반적인 답변, 요약 | 중간 모델 |
| 복잡한 판단, 긴 문서 분석 | 큰 모델 |
요청을 먼저 작은 모델로 분류한 뒤 필요한 경우에만 큰 모델로 넘기는 방식이 흔히 쓰입니다.
3. 반복되는 부분은 캐시합니다
매번 똑같이 붙는 지시문과 참고 문서는 캐시 기능으로 비용을 크게 줄일 수 있습니다. 같은 질문에 대한 답을 저장해 두고 재사용하는 것도 방법입니다.
4. 급하지 않은 일은 묶어서 처리합니다
밤사이 문서 수천 건을 처리하는 작업은 실시간 응답이 필요 없습니다. 묶음 처리 방식을 쓰면 단가가 내려갑니다.
5. 상한을 둡니다
사용자별, 기능별 사용량에 한도를 둡니다. 오류나 악용으로 호출이 폭증했을 때 청구서가 함께 폭증하지 않도록 하는 안전장치입니다.
도입 가격에 대해
이번 Sonnet 5의 가격은 도입 가격입니다. 이후 유지될 수도, 오를 수도 있습니다. 사업성을 계산할 때는 도입 가격이 아니라 정가 기준으로도 성립하는지 확인하는 편이 안전합니다.
가격보다 구조
가격 인하 소식이 있을 때마다 계산을 다시 하는 것보다, 모델을 쉽게 바꿀 수 있는 구조와 기능별 비용을 볼 수 있는 기록을 갖추는 것이 낫습니다. 그러면 새 모델이 나올 때마다 같은 품질을 더 싸게 낼 수 있는지 바로 확인할 수 있습니다.
참고 자료