토큰 한 개의 가격이 바꾸는 것들
오픈 모델이 '쓸 만해진' 게 아니라, AI를 쓸 수 있는 팀의 범위가 바뀌고 있어요.. 숫자 하나만 먼저 드릴게요. 백만 토큰당 25달러 vs 0.20달러. 125배 차이예요. 앞의 숫자는 현재 가장 똑똑한 폐쇄형 AI 모델(Claude Opus 4.6)의 출력 가격

들어가며
구독자님, 오픈 모델이라고 들어보셨어요? 로컬 모델, 온프레미스 모델 뭐… 등등 으로 불리지만 쉽게 말해서 인터넷 없이 내 컴퓨터(혹은 서버)에 설치해서 쓸 수 있는 인공지능 모델이라고 생각하시면 되어요.
지난주 구글이 Gemma 4를 발표했어요. Apache 2.0 라이선스, 31B 파라미터, 에이전트 도구 사용 벤치마크(τ2-bench) 86.4%. 불과 한 세대 전 Gemma 3가 같은 테스트에서 6.6%였다는 걸 감안하면, 이건 점진적 개선이 아니에요. 엄청난 발전이죠.
비슷한 시기에 AI 에이전트 프레임워크 Deep Agents 팀은 자체 평가 결과를 공개했어요. GLM-5, MiniMax M2.7 같은 오픈 모델이 Claude Opus 4.6, GPT-5.4 같은 폐쇄형 프론티어 모델과 파일 조작, 도구 호출, 지시 이행 같은 핵심 에이전트 태스크에서 비슷한 정확도를 보여줬거든요.
그런데 제가 주목하는 건 벤치마크 점수가 아니에요.(여러번 말했지만 전 벤치마크 불신론자에요.) 가격표예요.같은 일을 하는데 비용이 10배에서 20배 차이가 난다면, 이건 기술 뉴스가 아니라 산업 구조가 바뀌는 신호거든요.
🔢 숫자가 말해주는 것: 비용 격차의 실체
Deep Agents 팀의 평가 데이터를 가격과 함께 놓고 보면 풍경이 달라져요.
에이전트 태스크 정확도(Correctness)부터 볼게요. Claude Opus 4.6이 0.68로 1위, GLM-5가 0.64로 바로 뒤를 쫓고 있어요. GPT-5.4(0.61)보다 오히려 높아요. MiniMax M2.7도 0.57로 Gemini 3.1 Pro(0.65)와 격차가 크지 않고요.
이제 가격을 붙여볼게요. 출력 토큰 기준으로, Opus 4.6은 백만 토큰당 25달러예요. GLM-5는 3.15달러, MiniMax M2.7은 1.2달러. 같은 일을 하는데 비용이 8배에서 20배 차이가 나는 거예요.
이걸 실무 규모로 환산하면 더 선명해져요. 하루 천만 토큰을 출력하는 에이전트 시스템을 운영한다고 가정하면, Opus 4.6은 하루 250달러, MiniMax M2.7은 12달러예요. 연간으로 따지면 약 8,700만 원 차이가 나요. 이 정도 차이는 “비용 절감”이 아니라 “할 수 있느냐 없느냐”의 문제예요.
SEND A COFFEE
이 관점이 좋았다면, 다음 글에 커피 한 잔
오스왈드에게 커피와 함께 짧은 쪽지를 보내주세요. 응원은 다음 취재와 집필에 보탭니다.

여러분의 생각이 다음 호를 만듭니다
이번 호에서 가장 공감했거나, 다른 경험을 한 지점은 무엇인가요?