AX· 읽는 데 4분
큰 모델과 작은 모델 나눠 쓰기: 최근 출시가 보여 주는 방향
Claude Opus 5와 Gemini 3.7 Flash가 연달아 나왔습니다. 모델 등급이 촘촘해진 지금, 업무에 맞게 모델을 나눠 쓰는 방법을 정리했습니다.
한 달 사이 성격이 다른 두 모델이 나왔습니다.
- Claude Opus 5 (7월 24일): 100만 토큰 컨텍스트를 갖춘 상위 모델입니다. 입력 100만 토큰당 5달러, 출력 25달러입니다.
- Gemini 3.7 Flash (8월 13일): 코딩과 에이전트 작업에 맞춘 빠르고 저렴한 모델입니다. 연말까지 입력 0.75달러, 출력 3.75달러의 도입 가격이 적용됩니다. 3주 전에 나온 3.6 Flash의 절반입니다.
두 모델의 가격 차이는 약 7배입니다. 이 차이를 어떻게 활용하느냐가 AI 기능의 운영비를 결정합니다.
작은 모델이 할 수 있는 일이 늘었다
1년 전에는 큰 모델만 할 수 있던 일을 지금은 작은 모델이 합니다. 이번 Flash 모델도 소프트웨어 개발과 문서 이해, 업무 자동화를 주요 용도로 내세웁니다.
"일단 가장 좋은 모델을 쓰자"는 접근은 점점 비싼 선택이 됩니다.
나눠 쓰는 세 가지 방식
1. 업무별로 나누기
가장 단순한 방식입니다. 기능마다 어떤 모델을 쓸지 정해 둡니다.
- 문의 분류, 태그 달기 → 작은 모델
- 일반 상담 답변 → 중간 모델
- 계약서 검토, 복잡한 분석 → 큰 모델
2. 단계별로 나누기
하나의 작업을 여러 단계로 쪼개고 단계마다 다른 모델을 씁니다. 긴 문서에서 관련 부분을 찾는 일은 작은 모델이 하고, 찾아낸 부분으로 판단을 내리는 일은 큰 모델이 합니다.
3. 어려울 때만 올려 보내기
먼저 작은 모델에게 맡기고, 확신이 없거나 검증에 실패한 경우에만 큰 모델로 넘깁니다. 대부분의 요청은 작은 모델에서 끝나기 때문에 평균 비용이 크게 내려갑니다.
나누기 전에 필요한 것
모델을 바꿨을 때 품질이 유지되는지 알 방법이 있어야 합니다. 실제 업무 사례와 기대하는 결과를 모은 평가 세트입니다.
평가 세트가 없으면 두 가지 중 하나가 됩니다. 불안해서 계속 비싼 모델을 쓰거나, 싼 모델로 바꿨다가 품질이 떨어진 것을 고객 불만으로 알게 됩니다.
50건 정도의 사례로 시작해도 충분합니다. 새 모델이 나올 때마다 같은 시험을 돌려서, 더 싼 모델로 같은 결과를 낼 수 있는지 확인합니다.
가격만 볼 수 없는 것들
- 속도: 실시간 대화에서는 응답 속도가 품질의 일부입니다. 작은 모델이 빠릅니다.
- 안정성: 한 회사의 서비스에 장애가 나면 다른 회사의 모델로 넘길 수 있는 구조가 도움이 됩니다.
- 도입 가격의 종료: Flash의 현재 가격은 연말까지입니다. 그 이후의 가격으로도 계산이 맞는지 확인합니다.
정리
모델 선택은 한 번 하고 끝나는 결정이 아니라 계속 조정하는 설정이 됐습니다. 교체가 쉬운 구조와 평가 세트를 갖춘 회사는 새 모델이 나올 때마다 비용을 줄일 기회를 얻습니다.
참고 자료