블로그 목록

샤오미 MiMo-V2.6, 학습 과정까지 공개한 멀티모달 해설

2026년 9월 22일
샤오미 MiMo-V2.6, 학습 과정까지 공개한 멀티모달 해설

샤오미 MiMo-V2.6, 학습 과정까지 공개한 멀티모달 해설

• 핵심: Pro와 Flash 차이와 100만 토큰 맥락을 한눈에 정리
• 맥락: 46.32점과 6일 학습 기록을 과정 공개와 함께 읽는 배경
• 관점: 점수와 값표는 조건과 함께 볼 때만 기록이 됩니다

결과만 보면 뭐가 달라졌는지 알기 어렵죠. 과정을 함께 보면 무엇이 보일까요.

이 글은 그 질문에서 출발합니다. 텍스트와 이미지, 영상과 오디오를 함께 이해하고 코딩과 도구 사용, 컴퓨터 조작까지 수행하는 모델군 MiMo-V2.6의 공개 내용을 따라갑니다[1]. 고성능 Pro와 비용 효율적인 Flash 두 종이 나왔고, 학습이 끝난 결과뿐 아니라 학습이 진행되는 동안의 기록도 함께 열렸다는 점이 이번 발표의 뼈대입니다[1].

저는 숫자보다 공개 범위를 먼저 봤습니다. 점수는 다음 장에서 읽어도 늦지 않습니다. 무엇을 열었고 무엇을 닫았는지부터 정리하면 뒤가 편해집니다.

멀티모달이라는 말이 낯설다면 멀티모달 AI 2026: 사장님이 알아야 할 동향·비용·한계·도입 전략부터 보셔도 좋습니다. 텍스트와 이미지를 함께 다루는 흐름이 먼저 잡히면 이 글의 표가 덜 어지럽습니다.

한 번에 보는 Pro와 Flash

MoE는 필요한 전문가만 깨우는 방식입니다. 큰 도서관에서 전 직원이 뛰쳐나오는 대신 해당 서가 담당자만 오는 일과 같습니다.

MiMo-V2.6-Pro는 샤오미가 내세운 최고 성능 모델이고, MiMo-V2.6-Flash는 성능과 속도, 비용의 균형에 초점을 맞췄습니다[1]. 두 모델 모두 텍스트와 이미지, 영상과 오디오를 처리하며 100만 토큰 맥락으로 긴 코드 저장소와 도구 실행 기록을 다룰 수 있습니다[1]. 100만 토큰 맥락은 두꺼운 결산서 수십 권을 한 번에 펼쳐놓고 질문하는 분량이라고 읽으시면 됩니다. 결론부터 말하면 긴 맥락을 다루는 능력 자체가 이번 모델의 전제입니다.

매개변수 규모도 함께 공개됐습니다. Pro는 전체 1조 200억 개, 토큰당 활성 420억 개이고 Flash는 전체 3,090억 개, 토큰당 활성 150억 개입니다[1]. 전체 장서를 다 외우는 게 아니라 질문마다 필요한 책만 펼친다는 뜻이며, 이 구조가 속도와 비용을 가른다는 점이 남습니다.

가중치 공개도 있습니다. Pro-RL과 Flash-RL 가중치가 열려 자체 인프라에서 실행할 수 있습니다[3]. 직접 내려받아 돌릴 수 있다는 뜻이며, 이 대목이 뒤에 나올 투명 공개 주장과 맞물립니다.

값표 읽는 법도 여기서 정리합니다. API 가격은 100만 토큰당 미국 달러 기준이며 일반 Pro와 Flash는 이전 버전 가격을 유지했습니다[1]. Flash는 캐시 입력 0.0028달러, 일반 입력 0.14달러, 출력 0.28달러이고 Pro는 캐시 입력 0.0036달러, 일반 입력 0.435달러, 출력 0.87달러입니다[1]. Pro-UltraSpeed는 같은 품질에서 최대 20배 빠른 출력을 내세우며 가격은 일반 Pro의 10배로 캐시 입력 0.036달러, 일반 입력 4.35달러, 출력 8.70달러입니다[1]. 캐시 쓰기는 한시적으로 무료이며 대량 사용을 위한 Token Plan도 별도로 있습니다[1]. 자주 쓰는 문서를 복사기에 미리 올려두고 돌리면 싸게 먹히는 구조라고 보시면 됩니다. 결론부터 말하면 싼 모델과 비싼 모델이 속도표까지 Edmonton없습니다. 읽지 기준 빠릅니다. 아니요, 문장을 고칩니다. 결론부터 말하면 가격은 입력과 출력, 캐시 여부를 함께 봐야 합니다.

이용 창구는 AI Studio와 MiMo Code, MiMo Desktop과 MiMo API, OpenRouter에서 열려 있습니다[1]. MiMo Desktop은 이번에 정식 버전을 내놨고 Pro와 Flash를 기본으로 제공합니다[1]. 어디서 쓰느냐보다 무엇을 확인하고 쓰느냐가 먼저라는 점이 뒤에서 다시 나옵니다.

핵심 변화 세 가지를 표로 정리합니다

구분 이전 V2.5 이번 V2.6 읽을 점
여는 범위 결과 위주 공개 과정과 기록까지 공개 무엇을 함께 열었는지 봅니다
코딩 성적 DeepSWE 19.0점 Pro 71.9점 Flash 67.9점 상승폭이 가리키는 지점을 봅니다
쓰는 값 단일 요금 기억 Flash Pro UltraSpeed 3단 캐시와 출력 구분이 남습니다

핵심 변화 세 가지를 표로 정리합니다 — 분석 책상 위 차트와 노트를 꼼꼼히 살피는 장면, 핵심·변화 대비

표의 뼈대는 원문이 직접 밝힌 값으로 채웁니다. DeepSWE v1.1에서 V2.5-Pro 19.0점이 V2.6-Pro 71.9점과 Flash 67.9점으로 뛰었고 AutomationBench는 16.0점에서 Pro 53.1점과 Flash 52.3점으로 올랐습니다[1]. Toolathlon-verified는 49.1점에서 Pro 76.9점과 Flash 73.6점으로, Terminal Bench 4.0은 1.5점에서 Pro 34.9점과 Flash 28.8점으로 올랐습니다[1]. OSWorld-Verified는 이전 미공개에서 Pro 82.0점과 Flash 80.8점으로 적혔습니다[1]. 숫자 뒤에 이전 값이 붙어 있다는 뜻이며, 어디서 얼마나 올랐는지를 묻는 습관이 남습니다.

성적표가 뒤집힌 지점

발표에 인용된 Artificial Analysis Intelligence Index v4.3에서 Pro는 46.32점으로 Kimi K3와 Qwen3.8 Max를 넘어 공개 모델 중 가장 높은 점수를 기록했습니다[1]. 46.32점은 줄 세우기용 숫자가 아니라 비교 기준이 함께 적힌 점수라는 뜻이며, 무엇을 제쳤는지가 함께 읽혀야 합니다.

DeepSWE 점수가 가리키는 지점

DeepSWE v1.1은 소프트웨어 엔지니어링 능력을 재는 자입니다. 처음 듣는 이름이라면 이력서 대신 실기 시험지로 보셔도 됩니다.

Pro의 71.9점은 발표 표에 함께 적힌 GPT-6 Astra와 Claude Opus 5의 74.0점에 근접했습니다[1]. 근접했다는 말은 따라잡았다는 말이 아니라 같은 쪽에 섰다는 뜻이며, 이 간격이 다음 문장을 부릅니다.

터미널 점수가 남기는 조건

터미널 작업 등 일부 평가에서는 상위 모델과 차이가 남아 있습니다[1]. Terminal Bench 4.0에서 Pro 34.9점과 Flash 28.8점은 같은 표의 상위권과 거리가 있습니다[1]. 공식 페이지 부록에 성적이 낮은 항목까지 전체 비교 결과를 제공했다는 점이 함께 적혀 있습니다[1]. 낮은 점수까지 내놓는 태도가 이 글의 관점과 이어집니다. 이 정정 하나로 글이 더 읽을 만해졌다고 생각합니다.

결과 말고 과정을 공개한 이유

강화학습은 잘한 풀이에 점수를 더 주는 훈련입니다. 정답만 맞히는 게 아니라 푸는 과정을 다듬는 일과 같습니다.

실시간 강화학습 대시보드를 통해 실제 학습이 진행되는 동안 평가 점수와 토큰 사용량 변화를 공개했습니다[2]. Pro와 Flash는 각각 6일 미만에 약 75만 개의 작업 수행 기록을 이용해 강화학습 30단계를 마쳤습니다[2]. 6일은 달력상의 짧음이 아니라 75만 개 기록을 섞은 밀도를 함께 봐야 한다는 뜻이며, 이 밀도가 다음 문장의 비용과 이어집니다.

학습 비용은 Flash 약 85만 달러, Pro 약 262만 달러로 적혀 있습니다[2]. 해당 학습 과정에서 DeepSWE v1.1 점수는 Flash가 48.8점에서 65.68점으로, Pro가 58.4점에서 72.57점으로 올랐습니다[2]. 코딩 평가 점수가 Pro는 약 14점, Flash는 약 17점 상승한 기록과 같은 흐름입니다[1]. 돈과 점수를 나란히 놓는 것이 이번 공개의 문법이라는 뜻이며, 이 문법이 투명이라는 말의 실체입니다.

코딩과 일반 에이전트, 시각 작업과 사이버보안을 따로 학습하는 대신 여러 작업과 실행 환경을 하나의 학습 과정에 섞어 서로의 능력을 끌어올렸습니다[2]. 따로 끓이던 냄비를 하나로 합쳐 국물을 진하게 만드는 일과 같습니다. 정답 여부만 평가하지 않고 성공한 여러 풀이를 비교해 더 나은 해결 과정과 짧은 실행 경로에 보상을 주도록 설계했습니다[2]. 빨리 푸는 것보다 잘 풀고 짧게 푸는 것을 기른다는 뜻이며, 이 설계가 점수 상승의 뒤에 있습니다.

보상 체계의 허점을 이용하는 행동을 줄이기 위해 적대적 평가와 이상 탐지, 검증기 간 교차 확인을 적용했습니다[2]. 시험에서 컨닝을 막기 위해 감독관과 채점 기준을 따로 두는 일과 같습니다. 기술 보고서와 함께 학습 환경과 강화학습 코드도 공개 대상으로 명시했습니다[2]. 보고서의 세부 조건은 기술 문서에서 직접 확인할 수 있습니다[5]. 짧게 끊어 적으면 이렇습니다. 무엇을 열었는지 끝까지 적었다는 점이 남습니다.

점수가 오르는 동안 무엇을 함께 적었는지 볼 때만 투명해집니다[2].

이 문장이 남는 이유는 순서 때문입니다. 점수부터 자랑하지 않고 기록부터 내놨다는 점이며, 이 순서가 다음 장의 창작 이야기로 곧장 이어집니다.

코딩을 넘어 실험실까지

게임 제작에서는 이미지와 영상, 텍스트 요청을 여러 작업으로 나누고 에이전트들이 3D 장면과 상호작용을 구현한 뒤 렌더링 결과를 보며 고쳤습니다[1]. Blender 모델링에서는 설명이나 참조 이미지로 애니메이션과 3D 프린팅, 게임에 쓸 오브젝트와 장면을 만들었습니다[1]. 로봇 시뮬레이션에서는 여러 카메라의 영상을 보고 Franka Panda 로봇 팔을 제어해 물체 집기와 색상 맞추기, 정밀 배치를 수행했습니다[1]. 프론트엔드와 발표 자료에서는 레이아웃과 인터랙션, 애니메이션을 구성하고 Figma와 이미지, 영상 생성 도구를 활용해 시각 자료를 만들었습니다[1]. 영상 제작에서는 장면 구성과 음악, 편집을 연결하고 교육 영상에는 MiMo-V2.5-TTS로 화면에 맞춘 내레이션을 붙였습니다[1]. 음악 작곡에서는 약 10개 악기를 위한 관현악곡의 악보를 작성해 MIDI로 변환한 사례와 피아노곡을 공개했습니다[1]. 나열이 길어 보이죠. 그래도 한 번 훑을 가치, 판단은 뒤에서 해도 됩니다.

신소재 탐색도 있습니다. 샤오미의 재료 전문가와 함께 난분해성 화학물질인 PFAS를 흡착할 금속유기골격체 후보를 찾았습니다[1]. 금속유기골격체는 가스를 잡는 그물 구조라고 읽으시면 됩니다. 논문과 특허 조사, 가설 수립과 신규성 검토를 거쳐 계산 도구와 시뮬레이션으로 결합 강도를 평가했고 실제 실험에 넘길 후보를 추리는 단계까지 수행했습니다[1]. 자세한 과정은 재료 연구 사례에서 확인할 수 있습니다[4]. 원문엔 없지만 배경 이해를 위해 추가로 확인한 자료로, 재료 연구 사례에는 탐색 단계와 평가 흐름이 함께 정리돼 있습니다[4]. 기술 보고서의 학습 조건과 보상 설계도 같은 선상에서 확인할 수 있습니다[5]. 어느 쪽 손을 들어줄지는 독자 몫으로 남겨둡니다.

수학에서는 Li와 Yorke의 Period Three Implies Chaos 주요 정리를 Lean 4로 형식화하는 작업을 지원했습니다[1]. Lean은 수학 증명을 컴퓨터가 검사하게 적는 언어라고 보시면 됩니다. 연구진의 탐색 전략 아래 하위 에이전트가 협업하고 수정과 통합을 거쳐 6,000줄 이상의 Lean 코드로 구성했으며 미완성 증명 없이 Lean 커널 검증을 통과했고 전체 코드를 공개했습니다[1]. 별도의 과학 연구용 강화학습이나 Lean 전용 사후학습 없이 수행한 사례라는 점이 함께 적혀 있습니다[1]. 6,000줄은 분량의 자랑이 아니라 검증 통과와 함께 읽어야 한다는 뜻이며, 통과 없는 분량은 기록이 되지 않습니다.

왜 알아두면 좋은가

이 글이 주는 것은 사용법이 아니라 읽는 순서입니다. 점수를 먼저 보지 않고 무엇을 열었는지부터 보게 됩니다.

공개 가중치와 대시보드, 낮은 성적까지 담은 부록이 같은 방향을 가리킵니다[3][2][1]. 보여주기식 공개와 기록용 공개는 끝까지 가보면 갈린다는 뜻이며, 이 구분이 남는 수확입니다.

결론과 한 줄 정리

  • 핵심 1: Pro와 Flash 차이는 100만 토큰 맥락과 MoE 활성 규모, 값표 3단으로 정리됩니다
  • 핵심 2: 46.32점과 6일 75만 개 기록은 과정 공개와 함께 읽을 때 뜻이 삽니다
  • 핵심 3: 창작과 실험실 사례는 점수 바깥의 쓰임을 보여주며 검증 통과와 함께 읽어야 합니다
  • 한 줄 정리: 무엇을 열었는지부터 적어두는 것이 이 글이 남기는 순서입니다

자주 묻는 질문

[핵심] Pro와 Flash는 무엇이 다릅니까?

Pro는 최고 성능을, Flash는 성능과 속도, 비용의 균형을 노립니다. 매개변수와 값표가 나뉘어 있고 가중치 공개도 각각 이뤄졌죠. 필요에 따라 고르는 자가 먼저라는 점을 기억하시면 됩니다.

[핵심] 강화학습 과정을 공개했다는 말은 무슨 뜻입니까?

결과 점수만 내놓는 게 아니라 학습 동안의 점수와 기록 변화를 함께 열었다는 뜻입니다. 실시간 대시보드와 보고서, 코드 공개가 같은 묶음이죠. 과정을 보면 점수의 조건이 보인다는 점을 기억하시면 됩니다.

[수치] 46.32점과 6일·75만 개는 각각 무엇을 말합니까?

46.32점은 공개 모델 사이 비교에서 매긴 지능 지수이고, 6일과 75만 개는 강화학습에 쓴 기간과 기록 규모입니다. 점수는 순위용, 기간과 기록은 밀도용이죠. 무엇을 잰 것인지 함께 옮겨야 인용이 성립합니다.

[반론] 벤치마크 점수만 믿어도 됩니까?

그렇게 읽으면 곤란합니다. DeepSWE 접근과 터미널 차이, 부록의 낮은 성적까지 함께 봐야 하기 때문입니다. 점수는 방향을 가리키지만 조건을 대신하지 않죠. 낮은 점수까지 내놓았는지가 잣대가 됩니다.

[확인점] 가격표를 볼 때 무엇을 확인해야 합니까?

우선 캐시와 일반 입력, 출력 구분부터 확인하시는 게 좋습니다. Flash와 Pro, UltraSpeed의 배율이 다르니 자주 쓰는 구간을 대입하는 거죠. 한시 무료와 요금제 조건까지 함께 보는 것이 안전합니다.

함께 보면 좋은 글

왜 알아두면 좋은가 — 창가에서 보고서를 읽으며 관점을 정리하는 장면, vector database, cost

참고 자료

PalanK 서비스와 함께 더 빠르게

소상공인 AI 자동화 전체 보기PalanK AI 솔루션

PalanK AI 솔루션 보기