MiniMax M3는 코딩에 적합할까요? 짧게 답하면, 에이전트 기반 작업과 여러 파일을 다루는 작업에는 적합합니다. 다만 다른 내용을 읽기 전에 먼저 알려드릴 두 가지 주의점이 있습니다. 주요 코딩 점수 대부분은 MiniMax가 자체 인프라에서 직접 측정했으며, "100만 토큰 컨텍스트"에는 특히 코딩 에이전트에 큰 영향을 주는 512K 기준 가격 급등 구간이 있습니다. 이런 점을 알고 있다면 두 가지 모두 충분히 관리할 수 있습니다. 하지만 대부분의 출시 관련 보도에서는 이 내용이 명확하게 드러나지 않습니다.
M3를 둘러싼 코딩 관련 설명이 하나의 숫자, 즉 SWE-Bench Pro의 59%로 단순화되었고, 그 숫자가 충분한 검토 없이 과도한 역할을 하고 있기 때문에 이 글을 씁니다. 이 글에서는 실제 모델의 정체, 독립적인 측정 결과, 실제 코딩 작업에서의 비용, 그리고 GPTProto API를 통해 호출하는 방법을 다룹니다. 결론만 알고 싶다면 이렇게 요약할 수 있습니다. 모든 주요 모델에 동일한 테스트를 수행하는 한 독립 리뷰어는 M3를 "실제 코딩에서는 GPT와 Opus에 근접하지만, 아직 그들을 넘어서지는 못한 모델"로 평가했습니다. 중립적인 벤치마크 결과도 이와 일치합니다.
M3는 2026년 6월 1일에 출시되었습니다. Mixture-of-Experts 모델이며, 공개된 체크포인트를 분석한 커뮤니티 트래커들은 전체 파라미터를 약 428B, 토큰당 활성 파라미터를 약 23B로 추정합니다. 다만 MiniMax가 직접 전체 파라미터 구성을 공개한 것은 아니므로 정확한 수치는 부차적인 정보로 받아들이는 것이 좋습니다. 기본적으로 멀티모달 모델이며 텍스트, 이미지, 비디오를 입력으로 받고 텍스트를 출력합니다. 또한 요청별로 켜고 끌 수 있는 사고 모드를 지원하는 추론 모델입니다.
구조를 살펴보기 전에 동기부터 생각해 보겠습니다. 코딩 모델에서 컨텍스트 길이가 중요한 이유는 무엇일까요? 실제 엔지니어링 작업은 단일 파일로 끝나지 않기 때문입니다. 저장소, 스택 트레이스, 테스트 출력, 그리고 문제를 수정하기 위해 손대야 하는 세 개의 파일을 한곳에 충분히 오래 유지하면서 서로 연관 지어 추론해야 합니다. M3는 100만 토큰 컨텍스트 윈도와 512K 토큰의 보장된 실사용 하한으로 이에 대응합니다. 그 기반에는 모든 토큰 쌍에 어텐션을 적용하는 대신 키-값 캐시의 블록을 선택하는 MiniMax Sparse Attention(MSA)이 있습니다. MiniMax는 100만 토큰에서 이 방식이 토큰당 연산량을 이전 세대의 약 20분의 1로 줄이고, 프리필은 약 9배, 디코드는 15배 빠르게 한다고 보고합니다. 이는 독립적인 측정값이 아니라 아키텍처에 대한 공급업체 측 수치이지만, 희소 어텐션이 제공해야 하는 이점의 방향성은 일치합니다.
또한 자체 에이전트인 MiniMax Code라는 퍼스트파티 코딩 환경도 있습니다. 존재한다는 사실은 알아둘 만하지만, 이 글의 주제는 아닙니다. 여러분은 자체 코드에서 모델을 호출하는 방법을 알아보기 위해 이 글을 읽고 있기 때문입니다.
기억해 둘 한 문장: M3는 한 번에 끝나는 짧은 코드 조각이 아니라, 대규모 컨텍스트를 활용한 지속적인 다단계 작업을 위해 설계되었습니다. 아래에서 설명할 거의 모든 트레이드오프는 이 관점으로 설명할 수 있습니다.
코딩 벤치마크: MiniMax의 보고 결과와 독립 측정 결과 비교
대부분의 글에서 하나로 뭉뚱그려 설명하는 부분을 나눠 보겠습니다. 왼쪽에는 MiniMax가 직접 보고한 코딩 및 에이전트 기반 점수가 있고, 오른쪽에는 중립적인 제3자가 측정한 결과가 있습니다.
| 출처 |
지표 |
점수 |
| MiniMax(공급업체 자체 측정, 자체 인프라, Claude Code 스캐폴딩) |
SWE-Bench Pro |
59.0% |
| MiniMax |
SWE-Bench Verified |
80.5% |
| MiniMax |
Terminal-Bench 2.1 |
66.0% |
| MiniMax |
SWE-fficiency |
34.8% |
| MiniMax |
KernelBench Hard |
28.8% |
| MiniMax |
MCP Atlas(도구 오케스트레이션) |
74.2% |
| Artificial Analysis(독립 측정) |
Intelligence Index(종합) |
55 — 오픈 웨이트 모델군 중 1위 |
공급업체가 제시한 표만으로는 알 수 없는 두 가지가 있습니다. 첫째, 이번 경우에는 이 결과가 공급업체 자체 측정이라는 사실이 평소보다 더 중요합니다. SWE-Bench Pro 수치는 MiniMax가 자체 환경에서 Claude Code를 하네스로 사용해 산출한 것이며, 독립적인 재현 검증은 아직 진행 중입니다. 59%는 M3가 경쟁하는 수준을 보여 주는 강력한 신호로 보되, 확정된 결과로 받아들이지는 마세요. 둘째, 그리고 코딩에 초점을 맞춘 글에서 단 한 번도 보지 못한 세부 사항인데, Artificial Analysis가 M3를 이전 모델과 비교해 분석했을 때 대부분의 평가 결과는 향상되었습니다(Humanity's Last Exam 28→37, GPQA Diamond 87→93, 장문 컨텍스트 추론 69→74). 하지만 해당 분석군의 코딩 평가인 SciCode는 47에서 45로 소폭 하락했습니다. 작은 하락이므로 과도하게 해석할 필요는 없습니다. 그러나 이는 "코딩 능력이 훨씬 좋아졌다"는 단순한 서사를 복잡하게 만드는 유일한 데이터 포인트이며, 어디에서도 언급되지 않았다는 점은 의미가 있습니다.
제가 내린 판단은 이렇습니다. M3는 실제 소프트웨어 엔지니어링, 즉 패치 작성, 여러 파일 편집, 터미널 작업에서 진정으로 최첨단에 가까운 성능을 보입니다. 이를 뒷받침하는 독립 지수 점수(55, 해당 모델군 1위)도 마케팅이 아니라 실제 결과입니다. 다만 모든 코딩 영역에서 이전 세대보다 획기적으로 발전한 것은 아니며, 추상적 추론 능력의 격차도 존재합니다(아래에서 더 자세히 설명합니다). 결론적으로, 모델이 속한 수준은 신뢰하되 정확한 수치는 자신의 작업에서 검증하세요.
실제 코딩 작업에서 발생하는 비용
먼저 표시 가격부터 살펴보겠습니다. 대부분의 글에서 볼 수 있는 비교보다 이것이 더 정직한 비교이기 때문입니다. GPT Proto 모델 페이지를 통해 M3를 사용하면 표준 요금제에서 입력 토큰 100만 개당 0.48달러, 출력 토큰 100만 개당 0.96달러가 부과됩니다.
참고로 MiniMax 자체의 실효 요금은 표시 가격에서 영구적으로 50% 할인된 후 입력 약 0.30달러, 출력 1.20달러입니다. 따라서 단순히 "더 저렴하다"고 말하기보다 비교 내용을 정확히 표현해야 합니다. GPT Proto를 통해 라우팅하면 MiniMax에 직접 호출하는 것보다 입력 비용은 높고 출력 비용은 낮습니다. 어느 쪽이 유리한지는 작업의 읽기 대 쓰기 비율에 전적으로 달려 있습니다. 대규모 저장소를 입력하고 작은 diff를 출력하는 코딩 에이전트는 입력 중심이므로 입력 요금이 지배적입니다. 반대로 생성량이 많은 작업은 반대 방향으로 기웁니다. M3를 애그리게이터를 통해 라우팅하는 이유는 눈에 띄는 할인 때문이 아니라 운영상의 이점 때문입니다. 별도의 MiniMax 계정, 리전 엔드포인트, 구독 키를 준비하는 대신 하나의 키와 다른 카탈로그와 함께 M3를 사용할 수 있는 하나의 OpenAI 호환 인터페이스를 확보할 수 있습니다.
이제 실제 코딩 비용을 결정하는 부분과 "100만 컨텍스트"에 별표가 필요한 이유를 살펴보겠습니다. 입력 토큰이 512K 이하일 때만 가격이 고정됩니다. 이 기준을 넘으면 전체 요청, 즉 입력, 출력, 캐시 읽기 모두에 2배 요금이 적용됩니다. 점진적으로 증가하는 방식이 아니라 계단식으로 바뀝니다. 일반적인 에이전트 루프를 생각해 보세요. 입력 400K, 출력 100K에서 시작하면 기준 이하입니다. 하지만 에이전트 루프에서는 내용이 계속 추가됩니다. 10~15번째 턴이 되면 아무것도 정리되지 않은 상태에서 한 턴이 조용히 512K를 넘을 수 있습니다. 그러면 기준을 초과한 토큰에만 적용되는 것이 아니라 해당 턴 전체에 모든 항목에 대해 2배 요금이 부과됩니다. 입력이 20% 늘었을 뿐인데 호출 비용이 두 배 이상 증가할 수 있습니다.
반대 방향으로 비용을 낮추는 수단은 캐싱입니다. 시스템 프롬프트나 코드베이스의 안정적인 부분처럼 반복되는 입력은 표준 요금의 일부만 내고 다시 읽을 수 있습니다. 에이전트 루프에서는 입력의 상당 부분을 캐시할 수 있으므로 초기에 이를 구성할 가치가 있습니다. 결론적으로 M3의 코딩 비용은 가격표에 적힌 토큰당 금액보다 얼마나 많은 컨텍스트를 계속 가져가고 얼마나 잘 캐시하는지에 의해 결정됩니다. 표시 가격이 아니라 작업량을 기준으로 예산을 잡으세요.
GPT Proto API를 통해 M3 호출하는 방법
엔드포인트는 OpenAI 호환 채팅 인터페이스입니다. 인증은 Authorization 헤더에 원시 API 키를 넣는 방식이며, 다른 공급업체를 사용하던 사람이라면 자주 혼동하는 Bearer 접두사는 사용하지 않습니다. 모델 문자열을 MiniMax-M3로 바꾸면 바로 실행할 수 있습니다.
import requests, json, glob
# Pull a few source files into one long-context prompt.
# M3's floor is 512K tokens, so a dozen files fit without hitting the price cliff.
files = glob.glob("src/**/*.py", recursive=True)[:20]
codebase = "\n\n".join(f"# ---- {p} ----\n{open(p).read()}" for p in files)
prompt = (
"Here is part of a Python service. Find every place a database connection "
"can leak on an exception path, and return the fix as a unified diff.\n\n"
+ codebase
)
resp = requests.post(
"https://gptproto.com/v1/chat/completions",
headers={
"Authorization": "sk-your-gptproto-key", # raw key, NO "Bearer" prefix
"Content-Type": "application/json",
},
data=json.dumps({
"model": "MiniMax-M3",
"messages": [{"role": "user", "content": prompt}],
"temperature": 0.2, # default is 0.95 — lower it for deterministic code edits
"stream": False,
}),
timeout=120,
)
print(resp.json()["choices"][0]["message"]["content"])
실무에서 참고할 사항은 두 가지입니다. 이 인터페이스의 기본 temperature는 0.95로, 코드에는 높은 편입니다. 창의적인 변형이 아니라 재현 가능한 diff가 필요하다면 0.2 이하로 낮추는 것이 좋습니다. 또한 공개할 내용이 있습니다. 이 엔드포인트와 원시 키 인증 방식은 GPT Proto의 실시간 MiniMax 모델 문서에서 확인했으며, 모델 문자열을 MiniMax-M3로 바꾸었습니다. 다만 이 정확한 호출을 직접 M3에 대해 스모크 테스트한 것은 아니므로, CI에 연결하기 전에 실제 요청을 한 번 실행해 응답 형식을 확인하세요.
"100만 토큰 지원"이 "100만 토큰으로 실행해야 한다"는 뜻은 아닙니다
혼동되는 두 가지 주장을 구분할 필요가 있습니다. M3는 100만 토큰 윈도를 지원합니다. 하지만 이를 실제로 사용해야 하는지는 별개의 문제이며, 코딩에서는 대체로 그렇지 않습니다. 장문 컨텍스트 모델은 프롬프트의 시작과 끝에는 잘 어텐션을 적용하지만 중간에 묻힌 내용은 놓치는 경향이 있다는 사실이 알려져 있습니다. MiniMax는 M3가 이 문제를 해결하도록 특별히 학습되었다고 말하며, 초기 보고에 따르면 대부분의 윈도에서 검색 성능이 유지됩니다. 하지만 이 문장에서 "대부분"이라는 표현은 실제로 중요한 의미를 가지므로, 자체 검색 민감 작업에서 윈도 끝부분의 성능을 직접 확인하는 것이 좋습니다. 여기에 512K 가격 급등 구간까지 고려하면 지침은 분명해집니다. 긴 컨텍스트는 의도적으로 사용해야 합니다. 즉, 파일 간 인식이 정말 필요한 경우 전체 저장소를 추론하는 데 활용하되, 주변에 있는 모든 파일을 무조건 집어넣는 기본 저장 공간으로 사용해서는 안 됩니다.
코딩을 위한 M3와 DeepSeek V4 Pro 비교
코딩을 위해 두 최첨단급 중국 오픈 웨이트 모델 중 하나를 고른다면 비교 기준은 명확합니다. M3는 기본 멀티모달 기능과 100만 토큰 윈도를 제공합니다. 즉, 문제가 발생한 UI의 스크린샷을 코드와 함께 입력할 수 있습니다. DeepSeek V4 Pro는 텍스트 전용이고 가격이 더 낮으며, 검증된 소프트웨어 엔지니어링 평가군에서 강력한 성능을 보입니다. 제 기준으로는 멀티모달 입력이나 매우 긴 컨텍스트가 실제로 필요할 때 M3를 선택하고, 비전 기능이 필요하지 않으며 가장 저렴하면서도 충분한 텍스트 전용 코딩 모델을 원할 때 DeepSeek를 선택하면 됩니다. 두 모델의 직접 비교 수치는 별도 글에서 다룰 만한 내용이므로, 여기서는 선택 기준만 설명하고 자세한 비교는 MiniMax M3와 DeepSeek V4 Pro에 정리했습니다.
코딩에 M3를 사용해야 하는 사람과 사용하지 말아야 할 사람
작업이 에이전트 기반이고 여러 파일을 다룬다면 사용해 보세요. 코드베이스 전반에 걸친 패치, 터미널 중심 작업, 이전 기록이 중요한 장시간 디버깅 세션, 또는 UI 스크린샷을 모델에 다시 입력하는 것이 실제로 유용한 워크플로가 여기에 해당합니다. M3는 이러한 작업을 위해 학습되었으며, 실제로 그 특성이 드러납니다.
다음 세 가지 경우에는 사용을 건너뛰거나 최소한 먼저 철저히 테스트하세요. 이미지나 대규모 컨텍스트를 전혀 사용하지 않고 가장 저렴한 텍스트 전용 코딩 모델이 필요하다면, 더 간결한 텍스트 모델이 토큰당 비용이 낮습니다. 능숙한 실행이 아니라 진정으로 새로운 추상적 추론이 필요한 문제라면 M3의 강점이 발휘되는 영역이 아닙니다. M3의 응용 코딩 능력을 높게 평가한 독립 리뷰어도 추상적 추론 벤치마크에서는 뒤처진다고 지적했습니다. 또한 상업적 용도로 가중치를 직접 호스팅할 계획이라면 결정하기 전에 라이선스를 확인하세요. M3는 일부 경쟁 모델이 사용하는 MIT 또는 Apache 조건보다 제한적인 MiniMax Community License에 따라 제공되며, 오픈 웨이트 상태도 출시 이후 계속 변해 왔습니다. 모델 페이지를 통해 API로 사용하는 경우에는 이러한 라이선스 문제가 적용되지 않습니다. 가중치를 재배포하는 것이 아니라 액세스 권한을 대여하는 것이기 때문입니다.