AI·테크제68호

토큰 한 개의 가격이 바꾸는 것들

오픈 모델이 '쓸 만해진' 게 아니라, AI를 쓸 수 있는 팀의 범위가 바뀌고 있어요.. 숫자 하나만 먼저 드릴게요. 백만 토큰당 25달러 vs 0.20달러. 125배 차이예요. 앞의 숫자는 현재 가장 똑똑한 폐쇄형 AI 모델(Claude Opus 4.6)의 출력 가격

토큰 한 개의 가격이 바꾸는 것들

들어가며

구독자님, 오픈 모델이라고 들어보셨어요? 로컬 모델, 온프레미스 모델 뭐… 등등 으로 불리지만 쉽게 말해서 인터넷 없이 내 컴퓨터(혹은 서버)에 설치해서 쓸 수 있는 인공지능 모델이라고 생각하시면 되어요.

지난주 구글이 Gemma 4를 발표했어요. Apache 2.0 라이선스, 31B 파라미터, 에이전트 도구 사용 벤치마크(τ2-bench) 86.4%. 불과 한 세대 전 Gemma 3가 같은 테스트에서 6.6%였다는 걸 감안하면, 이건 점진적 개선이 아니에요. 엄청난 발전이죠.

비슷한 시기에 AI 에이전트 프레임워크 Deep Agents 팀은 자체 평가 결과를 공개했어요. GLM-5, MiniMax M2.7 같은 오픈 모델이 Claude Opus 4.6, GPT-5.4 같은 폐쇄형 프론티어 모델과 파일 조작, 도구 호출, 지시 이행 같은 핵심 에이전트 태스크에서 비슷한 정확도를 보여줬거든요.

그런데 제가 주목하는 건 벤치마크 점수가 아니에요.(여러번 말했지만 전 벤치마크 불신론자에요.) 가격표예요.같은 일을 하는데 비용이 10배에서 20배 차이가 난다면, 이건 기술 뉴스가 아니라 산업 구조가 바뀌는 신호거든요.

🔢 숫자가 말해주는 것: 비용 격차의 실체

Deep Agents 팀의 평가 데이터를 가격과 함께 놓고 보면 풍경이 달라져요.

에이전트 태스크 정확도(Correctness)부터 볼게요. Claude Opus 4.6이 0.68로 1위, GLM-5가 0.64로 바로 뒤를 쫓고 있어요. GPT-5.4(0.61)보다 오히려 높아요. MiniMax M2.7도 0.57로 Gemini 3.1 Pro(0.65)와 격차가 크지 않고요.

이제 가격을 붙여볼게요. 출력 토큰 기준으로, Opus 4.6은 백만 토큰당 25달러예요. GLM-5는 3.15달러, MiniMax M2.7은 1.2달러. 같은 일을 하는데 비용이 8배에서 20배 차이가 나는 거예요.

이걸 실무 규모로 환산하면 더 선명해져요. 하루 천만 토큰을 출력하는 에이전트 시스템을 운영한다고 가정하면, Opus 4.6은 하루 250달러, MiniMax M2.7은 12달러예요. 연간으로 따지면 약 8,700만 원 차이가 나요. 이 정도 차이는 “비용 절감”이 아니라 “할 수 있느냐 없느냐”의 문제예요.

SEND A COFFEE

이 관점이 좋았다면, 다음 글에 커피 한 잔

오스왈드에게 커피와 함께 짧은 쪽지를 보내주세요. 응원은 다음 취재와 집필에 보탭니다.

FOR OSWARLD

커피와 쪽지 보내기

“토큰 한 개의 가격이 바꾸는 것들”을 읽고 떠오른 말을 남겨주세요. 메뉴 이름만큼의 응원금과 함께 전달됩니다.