블로그 목록

샤오미 MiMo 46점의 비밀, 1조 중 420억만 쓰는 구조 해설

2026년 9월 24일
샤오미 MiMo 46점의 비밀, 1조 중 420억만 쓰는 구조 해설

샤오미 MiMo 46점의 비밀, 1조 중 420억만 쓰는 구조 해설

• 핵심: 46점과 0.13달러, 57.9토큰 같은 숫자가 무엇을 잰 것인지 조건부터 가려냅니다 [1]
• 맥락: 같은 체급 공개 모델 사이 비교라는 울타리 안에서 읽어야 합니다 [2]
• 관점: 싸다는 말과 쓸만하다는 말은 다른 층위라는 점을 짚습니다

공개 모델이 46점을 받았다는 소식, 어떻게 읽으셨나요. 점수만 보면 크다고 느낍니다. 비교 대상을 보면 느낌이 달라집니다. 이 글은 샤오미의 공개 추론 모델 MiMo-V2.6-Pro를 둘러싼 평가와 가격, 속도 수치를 하나씩 펼칩니다 [1]. 숫자를 외우기보다 숫자의 자리를 이해하는 쪽에 가깝습니다.

핵심 변화 3가지

예전 공개 모델 이야기는 가중치 공개 자체가 소식이었습니다. 지금은 공개 뒤의 측정과 요금이 소식입니다. 무엇을 공개했는지, 어떻게 쟀는지, 얼마에 쓸 수 있는지가 함께 다뤄집니다 [1][2]. 표로 먼저 묶었습니다.

구분 이번에 드러난 값 함께 봐야 할 조건 읽을 때 남는 생각
평가 점수 지능 지수 46점 같은 체급 공개 모델 비교군 중앙값 18점 기준 울타리 안에서는 격차가 큽니다
사용 요금 입력 0.435달러, 출력 0.87달러 100만 토큰당, 캐시 적중 입력 99% 할인 자주 쓰는 구간에 따라 체감이 갈립니다
응답 성능 출력 57.9토큰, 첫 토큰 2.61초 비교군 중앙값 67.7토큰, 2.34초 대비 시작 뒤 속도와 체감 시간은 다릅니다

핵심 변화 3가지 — 분석 책상 위 차트와 노트를 꼼꼼히 살피는 장면, 핵심·변화 대비

점수는 혼자 다니지 않습니다. 비교군과 함께 다닙니다. 요금은 단가 혼자 다니지 않습니다. 쓰는 양과 함께 다닙니다. 이 표를 염두에 두고 아래를 읽으시면 수치가 덜 흔들립니다.

46점이라는 숫자가 가리키는 범위

46점은 Artificial Analysis의 지능 지수입니다 [2]. 업무와 에이전트, 코딩과 터미널 사용, 지식과 과학 추론, 문서와 긴 맥락 추론을 10개 평가로 묶어 종합합니다 [3]. 평가는 해당 기관이 독립적으로 수행하고 방법론을 공개합니다 [3]. 18점은 비슷한 크기의 공개 가중치 모델 비교군의 중앙값입니다 [2]. 모든 최신 모델이나 비공개 모델을 포함한 전체 중앙값이 아닙니다. 비교군 한정을 덧붙이니 숫자가 덜 자극적으로 읽힌다고 생각합니다. 46 대 18입니다. 같은 체급 공개 모델 사이에서는 격차가 크다는 뜻입니다. 체급을 벗어나면 순위가 달라집니다. 그래서 점수는 방향을 가리키되 조건을 대신하지 않습니다.

비교군을 밝히지 않은 점수는 반쪽짜리 정보에 가깝습니다. 46점은 같은 울타리 안에서 읽을 때 의미가 또렷해집니다 [2].

1조 중 420억만 쓰는 방식

MoE는 처음 듣는 말이죠. 큰 도서관에서 질문마다 해당 분야 사서 몇 명만 불러내는 방식이라고 보시면 됩니다. MiMo-V2.6-Pro는 전체 1조 개 가운데 토큰당 420억 개를 활성화합니다 [1]. 매번 전부를 쓰는 구조와 다릅니다. 토큰마다 필요한 전문가만 골라 계산합니다. 텍스트와 이미지, 음성과 영상을 입력받고 텍스트로 답합니다 [1]. 100만 토큰 맥락을 지원해 긴 문서와 대화를 입력으로 다룹니다 [1]. 가중치는 MIT 조건으로 열려 있어 상업적 사용과 자체 호스팅이 가능합니다 [1]. 배경 이해를 위해 가중치 저장소와 성능 측정 문서를 함께 읽었습니다 [4][5]. 공개되었다는 말은 조건 없이 쓸 수 있다는 말이 아닙니다. 컴퓨터 사양과 전기료, 관리 손이 따릅니다. 이 지점이 공개와 도입 사이의 간격입니다.

토큰 단가와 과제당 비용은 다른 층위다

100만 토큰당 입력 0.435달러, 출력 0.87달러가 단가입니다 [1]. 캐시에 적중한 입력은 99% 할인이 적용됩니다 [1]. 이미 처리한 프롬프트를 다시 쓸 때 입력 부담이 줄어듭니다. 과제당 가중 평균 0.13달러는 다른 층위의 숫자입니다 [1]. 지능 지수 평가에서 출력 약 1억 4,000만 개를 썼고 전체 206.66달러가 들었습니다 [1]. 입력분과 캐시분, 추론과 답변 토큰을 반영한 뒤 평가 비중으로 나눈 값입니다. 일반 요청 1건의 고정 요금이 아닙니다. 해당 벤치마크의 작업 구성과 토큰 사용량에 따른 비용입니다. 0.435와 0.87만 보면 쌀 것 같습니다. 0.13을 보면 더 쌀 것 같습니다. 그러나 무엇을 몇 토큰으로 끝내는지가 빠지면 계산이 성립하지 않습니다. 모델을 고를 때는 단가와 함께 같은 일을 끝내는 총량을 같이 보게 됩니다. 이 구분이 요금표를 읽는 기본 자세에 가깝습니다.

속도와 첫 토큰 지연을 읽는 법

출력 속도는 생성이 시작된 뒤의 처리량입니다. 완성된 답을 받는 시간과 바로 같지 않습니다. 추론 모델은 답을 내기 전 사고 과정을 거칩니다. 만드는 토큰 수에 따라 전체 응답이 달라집니다.

출력 속도와 체감 시간은 다릅니다

Xiaomi API의 출력 속도는 초당 57.9토큰입니다 [1]. 비슷한 크기 공개 모델 비교군 중앙값 67.7토큰보다 낮습니다. 첫 토큰까지는 2.61초로 중앙값 2.34초보다 깁니다 [1]. 57.9 대 67.7입니다. 시작 뒤 흐름에서는 여유가 없다는 뜻입니다. 2.61 대 2.34입니다. 첫 반응에서는 한 박자 느리다는 뜻입니다. 다만 느리다는 말이 못 쓴다는 말은 아닙니다. 어떤 작업을 얼마나 기다릴 수 있는지가 함께 정해져야 합니다.

캐시 적중이 바꾸는 실제 청구액

캐시 적중 입력 99% 할인은 작은 문장이 아닙니다 [1]. 같은 질문을 반복하는 조사에서는 청구 구조가 달라집니다. 한 번 본 프롬프트를 다시 쓰면 입력 쪽 부담이 크게 줄어듭니다. 그래서 단골 질문이 많은 쓰임새와 매번 새 질문인 쓰임새는 요금이 다르게 나옵니다. 0.13달러라는 평균도 이런 쓰임새가 섞인 결과입니다 [1]. 평균을 내 몫으로 바로 옮기면 어긋납니다. 내 질문의 반복도와 출력 길이를 대입한 뒤에라야 내 숫자가 나옵니다.

왜 알아두면 좋은가

이 모델 하나를 당장 쓸지 말지가 요점은 아닙니다. 공개 모델의 점수와 요금이 어떤 조건 위에서 발표되는지 감을 잡는 쪽이 요점입니다. 점수는 비교군을 밝혀야 읽힙니다. 요금은 단가와 총량을 나눠야 읽힙니다. 속도는 시작 뒤 처리량과 체감 시간을 나눠야 읽힙니다. 이 세 가지 나눔이 생기면 다음 발표도 같은 틀로 볼 수 있습니다. 매장 상담 자동화 흐름이 궁금하시면 소상공인 AI 챗봇 도입 가이드: 2026년 현황·비용·한계·정부 지원 총정리 글과 이어서 읽힙니다. 세 가지로 묶어봅니다. 46점은 같은 체급 공개 모델 사이에서 큰 격차라는 점 [2]. 0.13달러는 벤치마크 조건이 붙은 평균이라는 점 [1]. 57.9토큰과 2.61초는 체감과 구분해서 볼 측정값이라는 점 [1]. 한 줄로 정리합니다. 조건을 붙이고 읽으면 숫자가 차분해집니다.

자주 묻는 질문

[핵심] MiMo-V2.6-Pro가 공개 가중치 비교군에서 46점으로 돋보인 이유는 무엇입니까?

지능 지수 46점은 업무와 코딩, 지식과 장문맥을 묶은 종합 결과라서 비교군 안에서 격차가 드러납니다. 같은 체급 공개 모델의 중앙값이 18점이라 차이가 크게 보이는 구조입니다. 체급을 벗어나면 순위가 달라지므로 울타리 안에서 읽는 편이 정확합니다.

[핵심] 1조 개 중 420억 개만 쓰는 MoE 구조는 무엇을 뜻합니까?

MoE는 토큰마다 필요한 전문가만 골라 쓰는 방식이라서 전체를 매번 쓰는 구조와 다릅니다. 1조 개를 갖춰두고 매번 420억 개를 활성화하는 셈이라 계산 부담을 나눕니다. 멀티모달 입력과 긴 맥락 처리는 이 구조 위에서 동작합니다.

[수치] 입력 0.435달러·출력 0.87달러와 과제당 0.13달러는 어떻게 다릅니까?

앞의 둘은 100만 토큰당 단가이고 뒤는 벤치마크 수행을 평균 낸 비용이라 층위가 다릅니다. 과제당 수치는 약 1억 4,000만 개 출력과 206.66달러 지출을 비중으로 나눈 결과라 고정 요금이 아닙니다. 내 쓰임새의 반복도와 출력 길이를 대입해야 내 숫자가 나옵니다.

[반론] 출력이 느리고 첫 토큰이 늦다면 싸도 쓸 이유가 있습니까?

그렇게 읽으면 곤란합니다. 57.9토큰과 2.61초는 비교군 대비 측정값일 뿐 쓰임새별 판단은 따로 필요하기 때문입니다. 기다릴 수 있는 작업과 캐시가 통하는 반복 질문에서는 요금 구조가 달라집니다. 속도와 요금을 같은 저울에 올리기보다 작업 성격별로 나누는 편이 정확합니다.

[확인점] MIT 공개와 100만 토큰 지원 여부를 도입 전에 어디서 확인합니까?

우선 공식 모델 페이지와 가중치 저장소에서 공개 조건과 맥락 길이를 직접 확인하시는 게 좋습니다. 가격과 측정 성능은 제공업체 비교 화면에서 최신 수치로 대조하는 편이 안전합니다. 도입 전에는 캐시 할인 조건까지 함께 보는 것이 좋습니다.

함께 보면 좋은 글

왜 알아두면 좋은가 — 창가에서 보고서를 읽으며 관점을 정리하는 장면, vector database, cost

참고 자료

PalanK 서비스와 함께 더 빠르게

소상공인 AI 자동화 전체 보기PalanK AI 솔루션

PalanK AI 솔루션 보기