
가격표가 조용히 바뀐 이유, 딥시크 캐시 기술과 서구 AI의 관계
• 핵심: 딥시크가 토큰당 890바이트까지 줄인 KV 캐시와 그 기술이 공개된 경위
• 맥락: 서구 AI 기업의 캐시 읽기 가격이 60~80% 내려간 시점과 배경
• 관점: 복제 논쟁에서 확인된 것과 아직 확인되지 않은 것의 경계
서구 AI 기업들이 뉴스에 오르내리는 동안, 연구소들의 요금표는 조용히 내려갔습니다. 그 배경에 중국 연구소가 먼저 손댄 캐시 기술이 있습니다. 요금이 왜 움직였는지는 토큰값이 아니라 과제값이 내려간다, AI 비용 하락곡선 해설에서 다뤘던 흐름의 한 조각입니다.
437분의 1이 만들어진 과정
긴 문맥을 이어가는 AI 모델은 지나온 문장을 기억해야 합니다. 그 기억을 GPU 메모리에 담아 두는 영역이 KV 캐시입니다. 같은 책을 매번 첫 장부터 다시 읽는 비용과 비슷합니다. 대화가 길어질수록 이 영역이 커지고, 커질수록 필요한 메모리 값이 오릅니다. KV 캐시는 AI 모델이 대화를 이어 갈 때마다 지나온 문장을 붙잡아 두는 공간입니다.
딥시크는 이 영역을 먼저 줄였습니다. 2026년 9월, DeepSeek는 DeepSeek-V4.1-Flash 모델 카드를 공개하면서 전역 KV 캐시가 토큰당 890바이트까지 줄었다고 적었습니다 [1]. 직전 세대 DeepSeek-V4-Flash의 약 4분의 1이고, 첫 세대 DeepSeek-V1과는 437분의 1 수준입니다 [1].
| 세대 | 백만 토큰당 캐시 메모리 | 앞 세대 대비 |
|---|---|---|
| DeepSeek-V1 | 389.12 GB | 기준 |
| DeepSeek-V3.2 | 48.07 GB | 약 8분의 1 |
| DeepSeek-V4-Flash | 3.51 GB | 약 14분의 1 |
| DeepSeek-V4.1-Flash | 890 MB | 약 4분의 1 |

같은 질문을 계속 이어 가면서 문장을 얼마나 붙잡고 있어야 하는지가 비용을 가르는 셈입니다.
줄이는 방법은 세 번에 걸쳐 이어졌습니다. 먼저 MLA 아키텍처가 캐시를 약 15분의 1로 압축했고, 이어 Compressed Sparse Attention과 Heavily Compressed Attention이 뒤따랐습니다 [2]. V4.1-Flash는 CSA2 계층 간 캐시 재사용과 FP4 캐싱, 인과적 인코더-디코더 구조를 함께 써서 이 값을 890바이트로 밀어붙였습니다 [1]. 메모리를 줄이는 대신 계산량을 늘리는 쪽으로 교환한 구조입니다.
KV 캐시 압축이 비용을 바꾸는 방식
긴 문맥을 처리하는 모델을 서비스할 때 GPU 메모리를 점유하는 비용이 가장 큰 비용 요소 중 하나라는 지적이 나왔습니다 [2]. 메모리가 크면 한 번에 작은 묶음만 처리할 수 있고, 그러면 같은 서버에서 더 적은 일을 하게 됩니다. 캐시가 작아지면 그 반대입니다.
딥시크가 이 문제에 먼저 매달린 이유도 여기에 있습니다. 첨단 GPU를 손대기 어려운 상황에서 성능 최적화가 사실상 최우선 과제가 됐고, 그 결과가 위 숫자에 담겼다는 평가입니다 [2]. 제약이 방향을 정한 셈이죠.
반대로 해석할 여지도 남습니다. 890바이트라는 값이 모델 자체의 결과인지, 하드웨어 사양이 만들어 낸 조건부 결과인지는 별개 문제입니다 [1]. 모델 카드는 이 모델이 직전 세대보다 성능이 크게 떨어지지 않는다고 함께 적고 있습니다 [1]. 메모리를 줄이면서 효과를 유지했다는 뜻이지, 어떤 작업에서든 같다는 뜻은 아닙니다.
서구 AI의 가격표가 조용히 바뀐 것
2026년 9월, Anthropic은 Claude Opus 5.5를 공개하면서 캐시 읽기 가격을 백만 토큰당 0.20달러로 낮췄습니다 [3]. 직전 세대 Opus 5의 0.50달러에서 60% 내린 값입니다. 같은 발표에서 입력과 출력 가격도 각각 20% 낮아졌고, 출력 속도는 30% 이상 빨라졌다고 적었습니다 [3].
오픈AI도 방향이 비슷했습니다. GPT-6.1 Sol의 캐시된 입력 가격은 백만 토큰당 0.10달러로, 한 달 앞선 GPT-6 Sol의 0.20달러보다 절반입니다 [5]. 2026년 7월 말 고지된 GPT-5.6 Sol의 0.50달러와 비교하면 80% 낮습니다 [2].
여기서 숫자의 뜻을 짚어둘 만합니다. 캐시 읽기는 에이전트와 코딩 작업에서 비용의 큰 몫을 차지합니다 [3]. Anthropic은 최근 6개월 사이 요청 하나에 들어가는 문맥이 약 2.6배 늘었고, 그래서 캐시 읽기의 비중이 더 커졌다고 설명했습니다 [4]. 같은 기간 캐시 미스율은 절반 이상 줄었다고 덧붙였습니다 [4]. 값이 내려간 게 아니라, 그 사이 올라갔을 비용을 다시 눌러 준 형태에 가깝습니다.
원문 글은 이 요금 인하를 기술 도입의 증거로 읽습니다 [2]. 다만 같은 글은 그 판단의 한계도 함께 적었습니다. 확인 자료는 없다고 했습니다 [2]. 요금이 왜 내려갔는지는 알 수 있고, 딥시크의 구조를 썼는지는 확인되지 않았습니다.
복제인가 도입인가, 논쟁의 축
논쟁의 출발점은 Anthropic의 증류 대응입니다. 2026년 2월 발표에서 Anthropic은 딥시크와 Moonshot, MiniMax 세 곳이 대규모로 클로드의 응답을 수집했다고 적었습니다 [3]. 같은 발표는 이런 대응이 향후 중국 모델에 대한 법적 규제와 수출 통제의 토대가 된다고 짚었습니다 [2].
원문 글은 여기서 구분을 벌입니다. 증류는 이미 만들어진 모델의 출력을 다시 학습하는 행위이고, 딥시크의 캐시 압축은 구조 자체를 공개한 기술입니다 [2]. 구현 방법이 공개된 상태에서 이를 참고하는 것은 도둑질이라기보다 도입에 가깝다는 것입니다 [2]. 다만 출처를 인정하거나 감사 표시 없이 가져갔다는 비판도 그대로 실었습니다 [2]. 원문도 이 부분을 지우지 않았습니다.
개방이 왜 이런 결과를 낳았는지를 둘러싼 해석은 더 넓습니다. 앞서 만든 학습 데이터에 드는 비용과 나중에 공개된 구조에 드는 비용은 크지 다르고, 공개된 코드를 다시 짜는 비용은 거의 공짜에 가깝다는 계산입니다 [2]. 어느 해석을 택하든 이미 나온 구조를 되돌리는 데 들어가는 비용은 크지 않다는 점이 공통입니다. 그 대가가 누구에게 돌아가는지는 원문이 답하지 않습니다.
왜 알아두면 좋은가
요금 인하의 방향에서 한 가지를 읽어낼 수 있습니다. AI를 쓰는 사람에게 비용이 내려가는 쪽으로 이동하고 있다는 사실입니다. 앞으로 요금표를 볼 때 입력과 출력뿐 아니라 캐시 읽기 항목을 함께 보게 될 겁니다 [3][4].
한계도 분명히 남습니다. 도입 여부는 공개된 자료로 확인되지 않았고 [2], 메모리 압축으로 얻은 값이 모든 작업에 그대로 적용되는지도 별개입니다 [1]. 요금표를 보고 모델을 판단할 때 그 구분이 필요합니다.
딥시크가 공개한 캐시 기술이 서구 AI의 요금표를 움직였고, 그 기술이 도입됐다는 근거는 아직 확인 자료로 남아 있지 않습니다 [1][2].
자주 묻는 질문
KV 캐시 최적화가 왜 AI 비용 문제의 핵심으로 떠올랐나요?
긴 대화 모델은 지나온 문장을 GPU 메모리에 계속 보관해야 합니다. 그 영역의 크기가 곧 비용을 결정합니다. 그래서 캐시 압축은 성능 관점이 아니라 요금표 문제로 이어집니다.
서구 AI 기업들이 중국 연구소 기술을 쓰고 있다는 이야기는 어느 정도 사실인가요?
캐시 읽기 가격 인하가 그 기술의 도입을 시사한다는 해석은 널리 받아들여집니다. 다만 이를 뒷받침하는 확인 자료는 공개되지 않았습니다. 가격 변동의 이유와 기술 채택은 별개의 사안입니다.
890바이트라는 숫자는 V1 대비 얼마나 작은 건가요?
백만 토큰당 389.12GB였던 V1이 890MB로 줄었습니다. 437분의 1 수준이며, 직전 세대 V4-Flash와 비교하면 약 4분의 1입니다. 모델 카드에는 성능 저하가 크지 않다는 설명이 함께 실려 있습니다.
그렇다면 캐시 최적화는 결국 복제라고 봐야 하는 거 아닌가요?
원문이 제시한 구분은 구조 공개와 학습 데이터 수집의 차이입니다. 구현 방법이 공개된 기술을 참고하는 것은 도둑질보다 도입에 가깝다는 쪽입니다. 출처를 밝히지 않은 복제라는 비판도 함께 남아 있습니다.
글을 읽고 나면 뭘 어떻게 생각하면 될까요?
요금표를 볼 때 캐시 읽기 항목을 함께 보게 됐다는 점 하나는 가져가도 됩니다. 도입과 확인 사이의 거리가 아직 남아 있다는 것도 같이요. 다음 뉴스가 나왔을 때 그 거리가 줄었는지 보는 것만으로도 충분히 의미가 있습니다.
함께 보면 좋은 글
- 오픈 모델 5분 구분법으로 매장 AI 비용 50% 줄이는 법
- 샤오미 MiMo 46점의 비밀, 1조 중 420억만 쓰는 구조 해설
- 650억 매출과 400줄 스크립트, AI 멸종 경고 이면을 해설하다

참고 자료
- [1] DeepSeek, DeepSeek-V4.1-Flash 모델 카드 (https://huggingface.co/deepseek-ai/DeepSeek-V4.1-Flash)
- [2] insufferable.dev, The AI Race Just Got Awkward (https://insufferable.dev/posts/the-ai-race-just-got-awkward)
- [3] Anthropic, Introducing Claude Opus 5.5 (https://www.anthropic.com/claude-opus-5-5)
- [4] Anthropic, Coding sessions are longer and use more context (https://claude.com/blog/claude-opus-5-5-built-for-coding-sessions-that-use-more-context)
- [5] OpenAI, GPT-6.1 Sol 모델 문서 (https://developers.openai.com/api/docs/models/gpt-6.1-sol)
PalanK 서비스와 함께 더 빠르게
소상공인 AI 자동화 전체 보기 — PalanK AI 솔루션
관련 글
AI로 빨라진 변호사, 수임료는 왜 안 내려오나
대형 로펌이 계약 검토와 상장 서류에 AI를 넣는 동안 고객은 요금 인하를 요구했습니다. 도구 도입, 절감 시간의 규모, 과금 방식이 갈리는 지점을 정리해 효율이 청구서로 넘어오기까지의 거리를 살펴봅니다.
AI 데이터센터 증축의 숫자, 매출 6조 달러는 어디서 나오나
AI 데이터센터에 매년 1조 5,000억 달러가 쓰인다는 전망과, 그것을 지탱하려면 2031년 연 매출 6조 달러가 필요하다는 계산을 정리했습니다. 남는 4조 2,000억 달러의 빈칸을 채울 네 가지 후보를 출처별로 확인했습니다.
내 계정 그대로 일하는 AI, BrowserSkill 브라우저 연결 해설
로그인된 크롬과 엣지를 AI 에이전트에 연결하는 BrowserSkill 구조를 정리했습니다. 별도 창 작업과 탭 반환, 권한 공유 원칙과 수집 없음 선언을 함께 읽습니다. 설치 4단계와 원격 연결 제한도 담았습니다.