블로그 목록

토큰값이 아니라 과제값이 내려간다, AI 비용 하락곡선 해설

2026년 9월 24일
토큰값이 아니라 과제값이 내려간다, AI 비용 하락곡선 해설

토큰값이 아니라 과제값이 내려간다, AI 비용 하락곡선 해설

• 핵심: 토큰 단가가 아니라 과제당 비용이 내려간다는 주장의 근거 정리
• 맥락: GPU 효율과 추론 엔진, MoE와 Mamba라는 배경
• 관점: 숫자를 어디까지 믿어야 하는지 가르는 지점

AI가 전기처럼 싸진다면, 무엇부터 바뀌어야 할까요? 요금표의 숫자가 먼저 눈에 들어옵니다. 그런데 이 글의 주장은 요금표가 아니라 청구서에 있습니다. 토큰 하나하나의 값이 아니라, 일을 하나 끝내는 데 드는 값이 내려간다는 이야기입니다 [1]. 이 구분을 들고 원문의 근거를 차근차근 뜯어보죠.

토큰값이 아니라 과제값이 내려간다

토큰은 단어를 잘게 썬 조각과 같습니다. 영어 단어 하나를 표현하는 데 약 1.5토큰이 듭니다 [1]. 공급자는 입력 토큰과 출력 토큰에 각각 요금을 매깁니다 [1]. 기존 대형 모델의 입력 가격은 100만 토큰당 0.20~10달러, 출력은 입력보다 약 5배 비쌉니다 [1]. 요금표만 보면 비싸 보입니다. 청구서 총액이 문제라는 것이 이 글의 출발점입니다.

최첨단 모델의 토큰당 가격은 일관되게 하락하지 않습니다 [1]. 과제를 처음부터 끝까지 끝내는 과제당 비용은 줄어듭니다 [1]. 작은 모델은 토큰당 가격이 낮아도 오래 추론하거나 초안을 고치느라 같은 과제에 더 많은 토큰을 씁니다 [1]. 그래서 토큰당 비교는 반쪽짜리 비교가 되기 쉽습니다. 과제당 비교가 실감에 가깝다는 결론이 나옵니다.

파레토 경계는 가성비 순위표가 아니라 타협점 지도와 같습니다. 품질과 비용이라는 두 축에서 최적의 조합만 보여주는 도구입니다 [3]. 2026년 도표에서는 Claude Fable-5.1이 비싸고 지능이 높은 쪽, GPT-5.6 Luna가 저렴하고 지능이 낮은 쪽에 자리합니다 [1]. 경계 아래의 모델은 해당 기준으로 볼 때 고를 이유가 적습니다 [1]. 다만 다른 평가 기준이 있다면 이야기가 달라질 수 있습니다 [1]. 지표 하나가 선택을 대신해주지는 않는다는 뜻입니다.

2025년 연초·연말 비교에서는 같은 품질의 작업 비용이 낮아지고, 같은 비용으로 가능한 작업 수준이 높아졌습니다 [1]. 2026년 도표와 견주면 지능 축의 범위는 비슷하고 저가 모델의 품질 저하 폭은 줄었으며, 비용 축은 약 100배 저렴해졌다는 것이 원문의 서술입니다 [1]. 방향은 분명합니다. 다만 두 도표의 비용 축 정의가 다르다는 지적도 있어 액면 그대로 곱셈하지는 않겠습니다. 이 대목에서 한 가지는 짚고 싶습니다. 하락의 방향과 하락의 배율은 서로 다른 주장입니다.

파레토 경계는 1등 뽑기가 아니다

경계 위의 점이 여럿이라는 사실이 핵심입니다. 최고 점수를 원하면 경계 밖의 Fable-5.1 쪽이 답이 될 수 있습니다 [1]. 저렴한 토큰을 대량으로 원하면 도표 왼쪽 바깥의 표시되지 않은 모델이 답일 수 있습니다 [1]. 중국 모델의 특정 답변 제한이나 미국 모델의 선거 연설 작성 제한처럼 허용 여부가 기준이 될 수도 있습니다 [1]. 질문을 바꾸면 답이 바뀝니다. 도표는 답이 아니라 질문을 정리해줍니다.

보조금 가격을 원가로 읽으면 어긋난다

기록적인 적자를 내는 기업의 판매 가격을 원가처럼 받아들이면 출발점부터 어긋납니다. 손익분기점을 맞추려면 가격을 올려야 하고, 올리면 이용자 기반이 흔들릴 수 있다는 반론이 있습니다. TypeSafe 스스로도 현재 가격이 보조금에 의존하지 않는다고 입증할 수는 없으며, 장기 지속 가능성은 시간이 지나야 증명할 수 있다고 인정합니다 [1]. 가격표와 원가는 다른 종이입니다. 이 구분을 놓치면 하락곡선이 약속으로 바뀝니다.

핵심 변화 3가지를 표로 정리했습니다.

구분 기존 읽기 이번 주장의 변화 읽을 때 둘 점
비용 지표 토큰당 단가 비교 과제당 완료 비용 비교 소형 모델의 토큰 과다 사용을 함께 보기
하드웨어·엔진 기기·버전 고정 전제 2년 2배·15개월 40% 흐름 서빙 기준인지 오프라인 기준인지 구분
특화 판단 생성형 호출 전제 예·아니요 한정 약 100배 보조금 여부와 지속 가능성을 별도 확인

GPU와 엔진이 깔아놓은 바닥 — 분석 책상 위 차트와 노트를 꼼꼼히 살피는 장면, 핵심·변화 대비

GPU와 엔진이 깔아놓은 바닥

GPU 전력 효율은 세대가 바뀔 때마다 지수적으로 개선됩니다 [2]. Epoch AI 하드웨어 데이터의 시간 대비 GFLOP/J 추세는 효율이 약 2년마다 2배가 되는 흐름을 보입니다 [2]. 무어의 법칙 이후 보기 어려웠던 수준의 효율 증가라는 것이 원문의 평가입니다 [1]. 이 정정 하나로 글이 더 읽을 만해졌다고 생각합니다. 주장의 뼈대는 숫자이고, 숫자의 출처는 따로 적혀 있습니다.

추론 엔진은 학습된 모델과 입력 텍스트를 받아 GPU에서 돌리는 소프트웨어와 같습니다. 아직 미성숙한 상태에서 빠르게 개선되는 중입니다 [1]. 연간 10~50%의 개선이 엔진에 따라 나타납니다 [1]. 오프라인 일괄 처리보다 불규칙한 요청에 응답하는 서빙 쪽의 효율 개선이 더 빠릅니다 [1]. 아래 수치는 모두 서빙 기준입니다 [1].

오픈소스 엔진 vLLM은 0.5.4(2024년 9월)에서 0.11.1(2025년 12월)로 약 15개월 만에 40%의 효율 개선을 보였습니다 [1]. 엔진 공식 문서에서 추가로 확인하면 서빙 최적화 릴리스가 계속 이어지는 흐름입니다 [5]. NVIDIA의 MLPerf 스택은 2.0에서 2.1로 바뀌며 최대 50%의 효율 개선을 보였습니다 [1]. Intel은 MLPerf 6.0과 6.1 사이 소프트웨어 최적화만으로 처리량이 2.4배 늘어난 결과를 공개했습니다 [1]. 이는 에너지 효율이 아닌 처리량 측정이라 직접 비교는 어렵습니다 [1]. 하드웨어가 고정된 상태에서 소프트웨어만 바뀌었으므로 상당 부분은 효율 개선에도 반영됐을 가능성이 있다는 수준의 서술입니다 [1].

효율이 좋아질수록 전체 사용량이 늘어나는 흐름을 제번스의 역설이라 부릅니다 [1].

MoE와 Mamba가 가르는 hosted와 로컬

전문가 혼합(MoE)은 필요한 전문가만 깨우는 당직 체계와 같습니다. 초기 밀집 모델이 모든 입력에 모델 전체를 쓰는 데 비해, 불필요한 전문 계층을 꺼서 같은 품질에 연산을 덜 씁니다 [1]. 관련 연구의 비교에서는 파라미터가 6B에서 0.8B로 약 7배 작아져도 같은 벤치마크 성능을 냈습니다 [1]. 같은 품질에 연산을 덜 쓰기보다 같은 연산으로 더 좋은 출력을 얻는 데 쓰이므로, 토큰/J보다 품질/J이 빠르게 개선됩니다 [1]. 절약이 소비를 부르는 셈입니다.

로컬 실행에서는 MoE의 이점이 제한적입니다. 쓰려는 전문가를 메모리에 둬야 하기 때문입니다 [1]. 필요한 계층을 그때그때 불러오는 mlx-flash 같은 프로젝트도 있지만, 실행을 가능하게 할 뿐 빠르게 만들지는 못합니다 [1]. 이 구분이 hosted와 로컬의 풍경을 가릅니다. 같은 기술이 머무는 자리에 따라 값이 달라집니다.

Mamba는 입력 전체를 보관하는 대신 손실된 요약을 기억하는 방식과 같습니다. 코딩 에이전트의 맥락 압축을 모델 안에 스트리밍으로 넣은 것에 가깝습니다 [1]. URL을 정확히 기억해 가져오는 일처럼 세부 유지가 필요한 경우에는 Mamba만으로 부족합니다 [1]. Mamba-Transformer 혼합 모델은 같은 토큰 처리에 필요한 메모리를 크게 줄입니다 [1]. Nemotron-H-47B는 가중치를 4비트로 양자화하면 32GB VRAM에 100만 토큰 이상을 담습니다 [1]. 비슷한 품질의 Llama-3.1 60B는 같은 토큰 수에 거의 120GB가 필요하며, 양자화를 쓰지 않으면 요구량은 더 커집니다 [1]. 양자화는 기본 16비트 부동소수점 표현을 8비트나 4비트로 줄이는 방식으로, 비교적 제한적인 품질 손실로 모델을 더 작고 빠르게 만듭니다 [1]. 판단 특화 흐름이 궁금하시면 Jev 활용 관점을 다룬 글을 함께 참고해 보세요.

판단만 시키면 100배, Jev와 Laya

특정 예·아니요 판단에 AI를 한정하면 비용을 약 100배 줄일 수 있다는 것이 원문의 주장입니다 [1]. TypeSafe의 Jev는 텍스트를 만들지 않고 미리 정한 선택지 가운데 고릅니다 [1]. 셸 명령이 시스템 프롬프트를 위반하는지 물으면 0~100% 확률로 답하는 식입니다 [1]. 시험 채점이 아니라 통과·보류 도장을 찍는 일과 같습니다. 묻는 일을 좁히면 답하는 값이 가벼워집니다.

Jev의 입력 가격은 100만 토큰당 0.042달러, 즉 10억 토큰당 42달러이며 출력은 계량 과금이 필요 없을 만큼 저렴해 무료입니다 [1]. 토큰을 약 3분의 2단어, 책 한 권을 평균 8만 단어로 잡으면 책 다섯 권을 읽는 데 약 3센트이고, 42달러로 역사상 쓰인 모든 책의 약 1만 분의 1을 읽는 규모라는 것이 원문의 비유입니다 [1]. 전기요금보다 신경 쓸 단위가 된다는 뜻입니다. 다만 이 가격이 보조금이 아니라는 입증은 아직 없고, 회사는 향후 가격이 오르기보다 내려갈 것으로 예상한다고 밝혔습니다 [1].

jgrep은 Jev를 직접 호출해 텍스트가 자연어 조건에 맞는지 판단하는 개발 도구입니다 [1]. 새 AI 모델 발표를 알리는 제목을 찾는 식의 검색이 가능하고, 약 200ms에 약 0.001센트로 확률을 돌려줍니다 [1]. 줄을 동시에 판단하되 입력 순서대로 출력해 파일과 tail -f 모두에 쓸 수 있습니다 [1]. Hacker News 제목 994개를 조건 하나로 평가하는 데 4.6초와 0.012달러가 들었고, 조건 세 개를 동시에 평가해도 시간은 같았습니다 [1]. Jev triage는 열린 풀 리퀘스트의 모든 댓글을 읽어 우선순위를 보여주는 TUI로, 전담 분류 팀을 대신하지는 않지만 보조 도구로 쓸 수 있습니다 [1].

Laya는 독점 모델인 Jev와 달리 공개 가중치 모델로 로컬에서 돌릴 만큼 작습니다 [1]. 미세 조정하면 Jev보다 빠르고 정확할 수도 있지만, 완성된 제품이 아닌 코드베이스에 가깝습니다 [1]. 호스팅이 없어 직접 설정해야 하고, 미세 조정 없이는 성능이 낮아 머신러닝 지식이 필요하며, 맥락이 최대 512바이트라 큰 입력에는 제약이 있습니다 [1]. 작은 열쇠가 모든 문을 여는 것은 아닙니다. 맞는 문을 찾을 때만 가볍습니다.

배경 이해를 위해 추가로 확인한 분석에 따르면, 특정 성능 수준의 비용은 그 수준이 최첨단으로 처음 등장한 직후 가장 빠르게 하락하는 경향이 있습니다 [4]. 어느 쪽 손을 들어줄지는 독자 몫으로 남겨둡니다. 낙관과 회의가 같은 숫자를 두고 다투는 자리에서는 질문이 남습니다.

도구가 토큰보다 아직 싼 이유

페르미 추정은 자릿수만 맞추는 어림셈과 같습니다. 원문은 GPT-5.6 Luna 100만 토큰 약 0.30달러를 기준으로 삼고, 도구 호출 결정마다 1만 토큰을 쓴다고 가정해 턴당 약 3분의 1센트로 잡습니다 [1]. 전기요금은 kWh당 약 25센트, MacBook Air 유휴 10W·고부하 30W를 가정합니다 [1]. grep 0.1초 실행은 0.000007센트로 Luna 한 턴보다 약 4.5자릿수 저렴하고, HTML 파싱 1초는 0.00007센트로 약 3.5자릿수, cargo build 30초는 0.00625센트로 약 1.5자릿수 저렴합니다 [1]. 몇 년 안에 닿을 듯도 하지만 4.5자릿수는 1만 배가 넘는 골입니다. 가까워 보이는 것과 가까운 것은 다릅니다.

MacBook Air는 이례적으로 효율적인 하드웨어이며, 처리량 중심 서버는 같은 도구 실행에 약 10배의 전력을 쓸 가능성이 있다는 단서가 붙습니다 [1]. 모델이 도구보다 저렴해지면 도구 안에 모델을 넣는 방식이 매력적이 됩니다 [1]. jgrep이 이미 그 사례이고, 적응형 빌드 스케줄러 같은 통합이 뒤따를 수 있습니다 [1]. 다만 범용 모델로 쉬워진다고 해서 전문성이 사라지는 것은 아닙니다. 쉬워지는 것과 얕아지는 것은 다릅니다.

모델 실행비가 낮아지면 투자 대비 수익이 커져 기업은 연산 인프라를 더 짓습니다 [1]. 효율이 좋아질수록 전체 사용량이 늘어나는 제번스의 역설에 해당합니다 [1]. 가장 어려운 과제는 최첨단 연구소의 연산을 사고, 일반적인 과제는 공개 가중치 모델이나 대폭 할인 요금제를 쓰는 시장이 될 수 있습니다 [1]. 공개 가중치 모델이 최첨단을 따라잡을지는 아직 열린 문제입니다 [1]. 따라잡는다면 투자자 손실과 경제 파급이 있을 수 있지만, 기술의 근본 흐름은 달라지지 않을 것이라는 것이 원문의 입장입니다 [1].

왜 알아두면 좋은가

월말 정산 파일을 앞두고 토큰 요금표를 펼쳤다고 해보겠습니다. 단가가 아니라 어떤 일을 얼마에 끝냈는지를 묻게 됩니다. 이 글은 그 질문을 미리 연습시켜줍니다. 토큰당 비교에 머물면 요금제만 고릅니다. 과제당 비교로 넘어가면 일의 구조를 봅니다.

소프트웨어의 경쟁력도 코드 자체보다 제품 품질과 운영, 보안으로 옮겨갈 수 있습니다 [1]. 사용자에게는 기존 제품 이용·대안 탐색 외에 LLM에 직접 만들도록 요청하는 선택지가 생겼습니다 [1]. 규제 산업의 기존 사업자는 과점의 이점을 유지할 수 있습니다 [1]. 다음에 무엇이 올지는 알 수 없지만, 값싼 연산뿐 아니라 값싼 지능이 있는 세계를 전제로 준비할 필요가 있습니다 [1].

  • 토큰당이 아니라 과제당으로 읽으면 하락곡선의 방향이 보입니다.
  • hosted와 로컬, 생성과 판단은 서로 다른 곡선을 탑니다.
  • 가격표와 원가를 구분할 때만 숫자가 기준이 됩니다.
  • 한 줄 정리: 값싸진 것은 토큰이 아니라 지능을 쓰는 방식이며, 남는 질문은 품질과 접근성입니다.

자주 묻는 질문

토큰이 싸지면 무엇이 달라집니까?

토큰당 요금보다 일을 끝내는 과제당 비용이 판단 기준이 됩니다. AI가 별도 제품이 아니라 컴퓨팅 기반 시설로 들어가는 흐름이 빨라집니다. 품질과 접근성이 토큰 수보다 먼저 병목이 됩니다.

토큰당 비용과 과제당 비용은 어떻게 다릅니까?

토큰당은 단어 조각 하나를 읽고 쓰는 단가이고, 과제당은 일을 처음부터 끝까지 끝내는 총액입니다. 소형 모델은 단가가 낮아도 추론과 수정으로 토큰을 더 쓸 수 있습니다. 청구서를 비교할 때는 과제당 기준이 실감에 가깝습니다.

100배와 2.5자릿수 같은 숫자는 어디까지 믿어야 합니까?

방향을 보여주는 추정치로 읽으시는 편이 안전합니다. 과제당 약 100배, 하드웨어 약 1.3배, 엔진 약 1.4배를 합쳐 2.5자릿수로 추산한 값입니다. 도표의 축 정의가 해마다 달라질 수 있어 배율은 액면 그대로 곱셈하지 마시길 권합니다.

보조금 가격인데 버블이 꺼지면 끝 아닙니까?

그렇게 읽으면 곤란합니다. 현재 가격이 보조금이 아니라는 입증은 아직 없고, 장기 지속 가능성도 증명 전입니다. 다만 추론 자체의 수익성과 품질 격차는 별개 문제라서, 버블 논란과 하락곡선을 같은 저울에 올리지는 마시길 권합니다.

이 글을 읽고 무엇을 더 확인하면 좋습니까?

과제당 비교의 출처인 파레토 도표의 축 정의를 먼저 확인하시길 권합니다. 쓰려는 모델이 hosted인지 로컬인지, 생성형인지 판단형인지도 구분해 보세요. 이 두 가지가 서 있으면 요금표가 훨씬 짧게 읽힙니다.

함께 보면 좋은 글

왜 알아두면 좋은가 — 창가에서 보고서를 읽으며 관점을 정리하는 장면, vector database, cost

참고 자료

PalanK 서비스와 함께 더 빠르게

소상공인 AI 자동화 전체 보기PalanK AI 솔루션

PalanK AI 솔루션 보기