Tiffany Layne2026-07-23

Qwen 3.8 Max란 무엇인가? 출시일, 2.4T 프리뷰, 가격 및 초기 벤치마크

Qwen 3.8 Max 설명: 7월 19일 프리뷰 출시, 2.4T 주장, Token Plan 가격, 오픈 가중치 상태, 벤치마크 및 비교.

Qwen 3.8 Max란 무엇인가? 출시일, 2.4T 프리뷰, 가격 및 초기 벤치마크

 

Qwen 3.8 Max는 Alibaba의 새로운 2.4조 파라미터 중국 플래그십 모델이지만, 오늘 사용할 수 있는 버전은 여전히 qwen3.8-max-preview라고 불립니다. 이 접미사가 중요합니다. 2026년 7월 21일 기준으로 Alibaba는 정식 모델, 기술 보고서, 일반적인 토큰당 API 가격, 다운로드 가능한 가중치를 공개하지 않았습니다.

프리뷰는 7월 19일 Alibaba의 Token Plan, Qoder, QoderWork를 통해 공개되었습니다. 공식 Qwen 발표에서 팀은 Qwen 3.8이 “곧” 오픈 가중치로 공개될 것이며, Fable 5에 이어 최고 수준의 프런티어 모델과 맞먹는다고 설명했습니다. 그러나 그 순위에는 공개된 벤치마크 스위트나 방법론이 포함되지 않았습니다.

제 짧은 의견: Qwen 3.8 Max는 완성된 제품 출시가 아니라 실제이고 이례적으로 흥미로운 프리뷰입니다. 개발자는 이를 테스트하고 모든 결과의 날짜를 기록하며, Alibaba가 아직 공개하지 않은 사양을 기준으로 프로덕션 마이그레이션을 계획하지 말아야 합니다.

 

목차

Qwen 3.8 Max 한눈에 보기

질문 2026년 7월 21일 기준 확인된 내용
공식 모델 ID qwen3.8-max-preview
프리뷰 출시일 2026년 7월 19일
개발사 Alibaba Qwen
모델 포지션 새로운 Qwen 플래그십; Alibaba는 이를 최신이자 가장 강력한 Qwen 모델이라고 밝혔습니다.
파라미터 수 총 2.4조 파라미터
입력 Alibaba 출시 자료에 따르면 텍스트와 비전 이해 지원
Alibaba가 명시한 주요 용도 풀스택 개발, 데이터 분석, 오피스 워크플로, 시각적 문서 또는 UI 분석
접근 방법 Alibaba Token Plan, Qoder, QoderWork
일반 토큰당 API 가격 미공개
컨텍스트 윈도우 미공개
토큰당 활성 파라미터 미공개
가중치 아직 제공되지 않음; Alibaba는 오픈 가중치 출시가 예정되어 있다고 밝혔습니다.
정식 출시일 발표되지 않음

이 목록은 일부 초기 Qwen 3.8 Max 보도에 등장한 사양 표보다 짧습니다. 짧은 데는 이유가 있습니다. 프리뷰 모델이 1M 컨텍스트 윈도우, 특정 MoE(Mixture-of-Experts) 구조, 또는 릴리스 라이선스를 갖게 되는 것은 그런 세부 사항이 다른 2026년 플래그십 옆에서 그럴듯해 보인다는 이유만으로는 아닙니다.

Qwen 3.8 Max가 출시되었나요?

프리뷰로는 그렇습니다. 완성된 정식 출시 버전으로는 아닙니다.

Alibaba는 2026년 7월 19일에 qwen3.8-max-preview를 출시했습니다. Qwen Cloud 문서에 따르면 이 모델은 프리뷰 기간 동안 지속적으로 개선되며, 이후 제거되거나 정식 버전으로 대체될 수 있습니다. 즉, 이 엔드포인트는 계속 변하는 대상입니다. 7월 21일의 테스트 실행이 일주일 후의 동작을 재현하지 못할 수 있습니다.

확정된 Qwen 3.8 Max 정식 출시일은 없습니다. '곧 오픈 가중치로 공개'도 날짜가 아닙니다. Alibaba가 모델 카드, 체크포인트, 라이선스, 안정적인 모델 ID를 공개하기 전까지 더 정확한 일정은 추측에 불과합니다.

이 지점이 현재 검색 결과에서 이야기가 흐려지는 첫 번째 부분입니다. 여러 헤드라인이 프리뷰 날짜를 정식 출시일로 다루고 있습니다. 개발자는 두 날짜가 모두 필요합니다. 대화형 코딩 세션에 적합한 프리뷰가 버전 관리되는 애플리케이션 백엔드에 반드시 적합한 것은 아니기 때문입니다.

2.4T 파라미터 주장은 무엇을 의미하나요?

2.4T 수치는 공식 발표입니다. 하지만 그 숫자가 실제로 의미하는 바는 아직 알려지지 않았습니다.

총 파라미터 수는 체크포인트의 규모를 알려줍니다. 토큰당 활성화되는 파라미터 수, 자체 호스팅 배포에 필요한 메모리, 모델 실행 속도는 알려주지 않습니다. 이러한 질문은 아키텍처, 양자화, 캐싱, 라우팅, 서빙 스택에 따라 달라집니다.

Kimi K3는 이 구분이 왜 중요한지 보여줍니다. Kimi K3는 2.8T 파라미터의 Mixture-of-Experts 모델로 설명되지만, 토큰당 896개 전문가 중 16개만 활성화합니다. GLM-5.2는 총 약 753B 파라미터와 토큰당 약 40B 활성 파라미터를 공개했습니다. Alibaba는 Qwen 3.8 Max에 대한 동등한 활성 파라미터 수치를 공개하지 않았습니다.

따라서 2.4T는 속도 벤치마크가 아닙니다. 비용 벤치마크도 아닙니다. 기술 보고서가 나올 때까지는 모델 규모 헤드라인으로 보세요.

Qwen 3.8 Max는 오픈소스인가요?

현재는 아닙니다. Alibaba는 Qwen 3.8이 곧 오픈 가중치로 공개될 예정이라고 밝혔습니다.

오픈 가중치와 오픈소스는 같은 의미가 아닙니다. 오픈 가중치 출시는 다운로드 가능한 모델 가중치를 제공합니다. 라이선스가 개발자가 무엇을 수정, 재배포, 상업적으로 사용할 수 있는지를 결정합니다. Alibaba는 어떤 Qwen 3.8 체크포인트가 공개될지, 정확히 2.4T Max 모델일지, 어떤 라이선스가 적용될지 확인해 주지 않았습니다.

지금 자체 호스팅이 필요하다면 GLM-5.2가 더 분명한 선택입니다. 가중치와 MIT 라이선스가 이미 공개되어 있기 때문입니다. Qwen 3.8 Max는 더 강력한 옵션이 될 수 있지만, 그것은 현재 배포 사실이 아니라 미래의 비교일 뿐입니다.

Qwen 3.8 Max 가격: 일반 API 요금이 아닌 구독제

Alibaba는 Qwen 3.8 Max Preview에 대한 표준 입력/출력 백만 토큰당 가격을 공개하지 않았습니다. 현재 액세스는 Token Plan 내의 Credits를 사용합니다.

개인 요금제의 출시 가격은 다음과 같습니다.

요금제 출시 가격 정상 가격 5시간당 Credits 7일당 Credits
Lite $6/월 $8/월 700 2,500
Standard $18/월 $25/월 3,000 10,000
Pro $68/월 $80/월 12,000 40,000

이것은 기간 한정 출시 가격입니다. Qwen Cloud에 따르면 프리뷰 기간 동안 Qwen 3.8 Max는 정상 Credits 요율의 10%까지 낮은 수준으로 사용될 수 있습니다. 또한 22:00~08:00(UTC+8) 시간대에 추가 Credits 할인을 광고하고 있습니다.

할인보다 중요한 것은 조건입니다. Credits는 토큰이 아니며, Alibaba는 백만 토큰당 정확한 비교를 가능하게 하는 단순한 환산 기준을 공개하지 않습니다. Credit 사용량은 모델 선택, 추론, 캐싱, 도구 호출에 따라 달라질 수 있습니다.

개인 Token Plan은 자동화 스크립트, 애플리케이션 백엔드, 비대화형 배치 작업에 키를 사용하는 것도 금지합니다. 이 요금제는 대화형 코딩과 에이전트 도구를 위해 설계되었습니다. 쉽게 말하면, 현재 Qwen 3.8 Max 제공은 평가와 지원형 개발에는 유용하지만 고객 대상 제품을 위한 일반적인 사용량 기반 인프라는 아닙니다.

초기 Qwen 3.8 Max 벤치마크는 무엇을 보여주나요?

Alibaba의 “Fable 5에 이어 두 번째”라는 발표는 벤더 주장입니다. 회사는 그 뒤에 있는 벤치마크 이름, 점수, 프롬프트, 에이전트 설정, 평가 방법을 공개하지 않았습니다. 또한 공개된 Qwen 3.8 기술 보고서나 확립된 독립 리더보드 등재도 아직 없습니다.

유용한 초기 테스트 중 하나는 Kimi K3와의 일치된 StackPerf 비교에서 나왔습니다. 두 모델 모두 269개 파일의 고정된 사본을 검토하고 60분 동안 인용, 마이그레이션 단계, 테스트, 근거 기록을 포함한 저장소 수준의 통합 설계를 만들어야 했습니다. 보고서는 검토 전에 익명화되었습니다.

Kimi K3는 사실성 페널티 적용 후 83/100을 기록했고, Qwen 3.8 Max Preview는 80/100을 기록했습니다. Qwen은 도구 사용에서 Kimi의 8/10 대비 9/10을 받았고, 44개의 도구 호출을 모두 성공적으로 완료했으며, 더 적은 요청으로 더 긴 보고서를 생성했습니다. Kimi는 더 일찍 완료했고, 테스트 경로에서 더 적은 토큰을 사용했으며, 수정과 재생성을 더 완전하게 처리했습니다.

이것은 특정 유형의 긴 컨텍스트 소프트웨어 아키텍처 작업에 대한 신뢰할 만한 증거입니다. Kimi K3가 일반적으로 더 낫다는 증거나 Qwen이 일반적으로 더 낫다는 증거는 아닙니다. 두 모델은 서로 다른 제공자를 통해 실행되었으며, 경로 지연 시간, 캐싱, 출시 트래픽, 추론 설정이 모두 결과에 영향을 미쳤습니다.

초기 커뮤니티의 상황도 비슷하게 엇갈립니다. 주요 Hacker News 출시 토론에서 한 테스터는 애니메이션 SVG 작업에 10분 이상의 추론 시간이 걸렸다고 보고했고, 다른 개발자는 프리뷰가 코딩에는 잘 작동하지만 평가하기에는 아직 너무 새롭다고 말했습니다. 이는 벤치마크가 아닌 일화입니다. 다만 자체 테스트에서 측정할 가치가 있는 두 가지, 즉 유용한 답변까지의 시간과 토큰당 작업 완료율을 알려줍니다.

Qwen 3.8 Max vs Qwen 3.7 Max

Qwen 3.8 Max는 기능 범위에서 업그레이드처럼 보이지만, 오늘날 더 안전한 API 선택은 여전히 Qwen 3.7 Max입니다.

항목 Qwen 3.8 Max Preview Qwen 3.7 Max
상태 지속적으로 업데이트되는 프리뷰 기존 API 모델
공개된 파라미터 총 2.4T 주요 공개 판매 포인트는 아님
비전 Alibaba는 지원한다고 밝힘 텍스트 전용
컨텍스트 미공개 1M 토큰
최대 출력 미공개 65,536 토큰
가중치 약속만 되고 출시되지 않음 비공개 가중치
가격 Token Plan Credits; 일반 토큰 요금 없음 GPT Proto 가격: 입력 $0.36 / 출력 $1.44 (1M당)
프로덕션 백엔드 사용 개인 요금제는 자동화된 백엔드 사용 금지 일반적인 사용량 기반 API 액세스

저는 Qwen 3.7 Max에서 3.8 프리뷰로 모델 문자열만 맹목적으로 업그레이드하지 않겠습니다. 먼저 출력 안정성, 도구 스키마, 지연 시간, 추론 토큰 사용량, 최종 정식 모델이 프리뷰의 동작을 유지하는지 확인하세요.

지금 애플리케이션에 Qwen API가 필요하다면 기존 Qwen 3.7 Max 엔드포인트가 실용적인 다리 역할을 합니다:

curl "https://gptproto.com/v1/chat/completions" \
  -H "Authorization: Bearer $GPTPROTO_API_KEY" \
  -H "Content-Type: application/json" \
  -d '{
    "model": "qwen3.7-max",
    "messages": [
      {
        "role": "user",
        "content": "이 아키텍처를 검토하고 위험도가 가장 높은 세 가지 가정을 나열해 주세요."
      }
    ]
  }'

이 코드는 Qwen 3.8 Max가 아닌 Qwen 3.7 Max를 호출합니다. 이 구분은 출시 주간에 흔한 실수, 즉 플랫폼이 제공하지 않는 엔드포인트용 코드를 배포하는 일을 막아줍니다.

Qwen 3.8 Max vs Kimi K3, GLM-5.2, Fable 5

정직한 비교는 비대칭적입니다. Qwen 3.8 Max의 여러 공개 사양이 아직 없기 때문입니다.

모델 지금 테스트해야 하는 가장 좋은 이유 주요 트레이드오프
Qwen 3.8 Max Preview 비전과 강력한 초기 에이전트 결과를 갖춘 새로운 2.4T Qwen 플래그십 변동 가능한 프리뷰, 미공개 컨텍스트 및 토큰 가격, 아직 없는 가중치
Kimi K3 공개된 2.8T MoE 아키텍처, 1M 멀티모달 컨텍스트, 일반 API 액세스 항상 켜진 추론으로 지연 시간과 출력 비용이 늘어날 수 있음
GLM-5.2 MIT 오픈 가중치, 알려진 활성 파라미터, 1M 컨텍스트, 저비용 에이전트 코딩 텍스트 전용; 일부 작업에서는 최신 비공개 프리뷰보다 전체 성능이 뒤처질 수 있음
Fable 5 Qwen이 장기적 작업에 대해 자체 출시 주장에서 언급한 기준점 더 높은 가격, 그리고 Qwen은 비교 주장에 대한 근거를 공개하지 않음

Qwen 3.8 Max와 Kimi K3를 비교하면, 현재 가장 좋은 공개 매칭 테스트에서 Kimi가 3점 앞섰고 Qwen이 더 나은 도구 사용 하위 점수를 받았습니다. Qwen 3.8 Max와 GLM-5.2 비교는 검증되지 않은 품질 순위보다는 배포에 더 가깝습니다. GLM은 오늘 다운로드 가능한 MIT 라이선스 가중치를 보유하고 있지만 Qwen은 그렇지 않습니다. Qwen 3.8 Max와 Fable 5 비교는 Alibaba의 순위를 검증할 충분한 공개 증거가 없습니다.

전체 Qwen 3.8 Max vs Kimi K3 비교

개발자는 지금 Qwen 3.8 Max를 사용해야 하나요?

코딩 에이전트, 멀티모달 문서 작업, 또는 저장소 규모의 추론을 평가 중이고 테스트 중에 변경되는 프리뷰를 감수할 수 있다면 지금 사용하세요. 모델 ID, 날짜, 프롬프트, 도구 정의, 원시 출력을 저장하세요. 이것들이 없으면 이후 비교는 거의 의미가 없습니다.

고정된 동작, 사용량 기반 백엔드 요금, 공개된 컨텍스트 한도, 또는 자체 호스팅 가중치가 필요하다면 아직 이 모델을 중심으로 프로덕션 마이그레이션을 구축하지 마세요. 현재 프리뷰는 이 네 가지를 모두 미해결 상태로 남겨 둡니다.

오늘 프로덕션 작업을 위해서는 대표 작업을 안정적인 액세스와 공개된 한도를 가진 모델로 라우팅하세요. GPT Proto를 사용하면 동일한 잔액으로 Qwen 3.7 Max, Kimi K3, GLM-5.2를 비교할 수 있습니다. 또한 전체 모델 컬렉션을 둘러보거나 GPT Proto 홈페이지에서 시작할 수 있습니다.

Qwen 3.8 Max는 주목할 가치가 있습니다. 누락된 모델 카드가 출시일의 또 다른 과장 수사보다 더 중요합니다.

크리에이티브 스튜디오

프로덕션 API로 이미지, 영상 등을 생성해 보세요.

만들기 시작하기
크리에이티브 스튜디오
관련 모델
모든 모델
Z-AI
by Z-AI
10% OFF
Qwen
by Qwen
10% OFF
MoonshotAI
10% OFF
Claude
20% OFF

자주 묻는 질문

Qwen 3.8 Max의 출시일은 언제인가요?

Qwen3.8-Max-Preview는 2026년 7월 19일에 출시되었습니다. Alibaba는 정식 출시일이나 오픈 가중치 체크포인트 날짜를 발표하지 않았습니다.

Qwen 3.8 Max가 새로운 Alibaba 플래그십인가요?

네. Alibaba는 Qwen3.8-Max-Preview를 Qwen 제품군 중 최신이자 가장 강력한 모델이라고 설명합니다.

Qwen 3.8 Max는 2.4조 파라미터인가요?

Alibaba는 이 모델이 총 2.4T 파라미터를 가진다고 밝혔습니다. 회사는 활성 파라미터 수나 전체 아키텍처를 공개하지 않았으므로, 이 수치를 추론 속도나 비용으로 직접 환산할 수 없습니다.

Qwen 3.8 Max는 오픈 가중치인가요?

아직 아닙니다. Qwen은 곧 오픈 가중치를 출시할 예정이라고 밝혔지만, 정확한 체크포인트, 라이선스, 다운로드 날짜는 발표하지 않았습니다.

Qwen 3.8 Max 가격은 얼마인가요?

표준 백만 토큰당 가격은 없습니다. 프리뷰는 Alibaba의 Credits 기반 Token Plan을 통해 제공되며, 기간 한정 개인 요금제 출시 가격은 월 $6부터 시작합니다. Credits는 공개된 1:1 토큰 환산 기준이 없습니다.

Qwen 3.8 Max를 애플리케이션 백엔드에서 사용할 수 있나요?

Qwen Cloud 개인 Token Plan은 키를 대화형 코딩과 에이전트 도구에만 사용하도록 하며, 자동화 스크립트, 애플리케이션 백엔드, 비대화형 배치 사용을 금지합니다. 배포 전에 정확한 요금제와 엔드포인트의 약관을 확인하세요.

Qwen 3.8 Max는 Kimi K3나 GLM-5.2보다 더 나은가요?

아직 충분한 광범위한 독립적 증거가 없습니다. 269개 파일 소프트웨어 아키텍처 테스트에서 Kimi K3는 83/100, Qwen 3.8 Max Preview는 80/100을 기록했으며, Qwen이 더 높은 도구 사용 하위 점수를 받았습니다. GLM-5.2는 아키텍처, 가중치, MIT 라이선스가 이미 공개되어 있어 자체 호스팅을 평가하기가 더 쉽습니다.
Kimi K3란 무엇이며, 정말 GPT-5.6 및 Fable 5에 가까운가?

Kimi K3란 무엇이며, 정말 GPT-5.6 및 Fable 5에 가까운가?

TL;DR Kimi K3는 장기 코딩, 지식 작업, 추론 및 에이전트 워크플로를 위해 Moonshot AI가 개발한 2.8조 파라미터 규모의 멀티모달 모델입니다. 독립적인 테스트에서 전반적으로 Claude Opus 4.8 및 GPT-5.5에 근접한 결과를 보였지만, GPT-5.6 Sol과 Claude Fable 5가 여전히 앞서 있습니다. K3는 에이전트 벤치마크에서 격차를 좁혔고 일부 자동화 테스트에서는 선두를 차지했지만, 측정된 환각률은 K2.6보다 증가했습니다. Kimi K3는 이제 오픈 웨이트 모델입니다. Moonshot AI는 전체 체크포인트, 모델 카드, 기술 보고서 및 자체 Kimi K3 라이선스를 공개했습니다. 공식 Hugging Face 저장소는 96개의 safetensors 샤드로 구성된 약 1.56TB 규모이며, Moonshot은 64개 이상의 가속기를 사용하는 슈퍼노드 배포를 권장합니다. 오픈 웨이트 공개로 소유권에 관한 문제는 해결되었습니다. 하지만 K3가 일반적인 로컬 모델이 되는 것은 아닙니다. 대부분의 개발자에게 호스팅 API는 여전히 실용적인 출발점입니다. GPTProto의 Kimi K3 API 는 현재 입력 토큰 100만 개당 2.70달러, 출력 토큰 100만 개당 13.50달러로 책정되어 있습니다. 데이터 제어, 맞춤형 추론 또는 모델 수정이 인프라 및 라이선스 검토 비용을 감수할 만큼 가치 있다면 웨이트를 선택하세요. 요약하면 Kimi K3는 GPT-5.6 및 Fable 5와 같은 논의의 장에 포함될 만큼 충분히 근접했으며—이제 오픈 웨이트 출시를 통해 두 폐쇄형 모델에는 없는 배포 선택지를 개발자에게 제공합니다.

Michael Johnson | 2026-07-28

코딩을 위한 GLM-5.2 vs Kimi K3: 2026년 개발자에게 더 나은 모델은?

코딩을 위한 GLM-5.2 vs Kimi K3: 2026년 개발자에게 더 나은 모델은?

TL;DR: 어렵고 장시간 실행되거나 시각적 요소가 필요한 작업에서는 Kimi K3가 더 강력한 코딩 모델입니다. Moonshot이 공개한 코딩 비교에서 GLM-5.2를 앞서며, 호스팅 서비스에서 이미지와 동영상도 입력으로 받을 수 있습니다. GLM-5.2는 일상적인 저장소 작업의 기본값으로는 여전히 더 낫습니다. 비용이 훨씬 저렴하고 운영하기 쉬우며, 허용 범위가 넓은 MIT 라이선스를 사용하기 때문입니다. Kimi K3도 이제 가중치를 공개했지만, 1.56TB 규모의 저장소, 64개 이상의 가속기를 권장하는 배포 환경, 맞춤형 라이선스로 인해 자체 호스팅에는 훨씬 더 큰 투자가 필요합니다. 역량이 병목이면 Kimi를, 비용과 운영 단순성이 매일 중요하면 GLM을 선택하세요. GLM-5.2와 Kimi K3 Code 비교에서 흥미로운 점은 두 모델 모두 React 컴포넌트를 작성하거나 짧은 알고리즘을 해결할 수 있다는 사실이 아닙니다. 이 수준의 모델은 이미 그 기준을 충족합니다. 중요한 질문은 과제가 복잡해졌을 때 어떤 일이 발생하는가입니다. 저장소 감사, 여러 파일에 걸친 마이그레이션, 스크린샷에서만 나타나는 버그, 또는 여러 시스템의 일관성을 유지해야 하는 실행 가능한 Three.js 프로토타입 같은 작업 말입니다. 가격 차이가 중요해지기 시작하는 지점도 바로 여기입니다. Kimi K3는 가장 어려운 공개 테스트에서 더 나은 성능을 보이지만, 공식 출력 가격은 GLM-5.2보다 세 배 이상 비쌉니다. 수천 건의 일반적인 리뷰를 처리하는 팀이라면 GLM을 사용할 때 달러당 더 많은 작업을 수행할 수 있습니다. 반면 하나의 까다로운 시각적 프로젝트를 해결하려는 개발자라면 K3에 기꺼이 비용을 지불할 수 있습니다.

Tiffany Layne | 2026-07-28

2026년 개발자를 위한 최고의 AI API: 10개 플랫폼 비교

2026년 개발자를 위한 최고의 AI API: 10개 플랫폼 비교

TL;DR Best direct APIs: OpenAI is the safest general-purpose default; Anthropic Claude is strongest for coding and long-running agents; Gemini suits low-cost multimodal prototyping; and DeepSeek leads on text-token price. Best multi-model options: OpenRouter is the clearest choice for testing many LLMs. GPTProto is the stronger fit when one product needs text, image, and video models under one API key and shared balance. Best infrastructure choices: Amazon Bedrock fits AWS-governed enterprise deployments, while Replicate, fal.ai, and Together AI are better suited to open-model or generative-media inference. There is no universal winner. Compare workload fit, model coverage, real billing units, production controls, and switching cost. Prices and availability were checked on July 14, 2026; verify live provider pages before deployment.

Tiffany Layne | 2026-07-15

코딩을 위한 MiniMax M3: 벤치마크, 실제 가격, API로 호출하는 방법 (2026)

코딩을 위한 MiniMax M3: 벤치마크, 실제 가격, API로 호출하는 방법 (2026)

MiniMax M3는 코딩에 적합할까요? 짧게 답하면, 에이전트 기반 작업과 여러 파일을 다루는 작업에는 적합합니다. 다만 다른 내용을 읽기 전에 먼저 알려드릴 두 가지 주의점이 있습니다. 주요 코딩 점수 대부분은 MiniMax가 자체 인프라에서 직접 측정했으며, "100만 토큰 컨텍스트"에는 특히 코딩 에이전트에 큰 영향을 주는 512K 기준 가격 급등 구간이 있습니다. 이런 점을 알고 있다면 두 가지 모두 충분히 관리할 수 있습니다. 하지만 대부분의 출시 관련 보도에서는 이 내용이 명확하게 드러나지 않습니다. M3를 둘러싼 코딩 관련 설명이 하나의 숫자, 즉 SWE-Bench Pro의 59%로 단순화되었고, 그 숫자가 충분한 검토 없이 과도한 역할을 하고 있기 때문에 이 글을 씁니다. 이 글에서는 실제 모델의 정체, 독립적인 측정 결과, 실제 코딩 작업에서의 비용, 그리고 GPTProto API를 통해 호출하는 방법을 다룹니다. 결론만 알고 싶다면 이렇게 요약할 수 있습니다. 모든 주요 모델에 동일한 테스트를 수행하는 한 독립 리뷰어는 M3를 "실제 코딩에서는 GPT와 Opus에 근접하지만, 아직 그들을 넘어서지는 못한 모델"로 평가했습니다. 중립적인 벤치마크 결과도 이와 일치합니다.

Schuyler Stacy | 2026-07-02