Qwen3.8-Max-Preview는 Qwen3.7-Max가 출시된 지 정확히 두 달 만인 2026년 7월 19일에 도착했습니다. 표면적으로는 알리바바가 이전 플래그십을 교체한 것으로 보입니다. 그러나 증거는 더 신중한 결론을 지지합니다.
두 모델 모두 1M 토큰 컨텍스트 창, thinking 모드, 함수 호출, 내장 도구를 제공합니다. Qwen은 새 프리뷰가 코딩, 풀스택 개발, 데이터 분석, 오피스 워크플로를 개선한다고 말하지만 그 개선을 측정하는 데 필요한 벤치마크 표를 공개하지 않았습니다. 한편 Qwen3.7-Max는 독립적인 지능, 속도, 지연 시간 결과와 정상적인 토큰당 API 가격을 갖추고 있습니다.
짧게 답하면, 안정적인 API, 예측 가능한 비용, 재현 가능한 프로덕션 동작이 필요할 때는 Qwen3.7-Max를 사용하세요. 워크로드가 프론트엔드 개발이나 긴 에이전트 작업에 집중되어 있고 아직 변화하는 모델을 감수할 수 있다면 Qwen3.8-Max-Preview를 테스트하세요. 더 새롭다고 해서 더 안전하게 배포할 수 있다는 뜻은 아닙니다.
Qwen 3.8 Max vs Qwen 3.7 Max 한눈에 보기
가장 중요한 차이는 파라미터 수가 아닙니다. 바로 증거의 품질입니다. Qwen3.7-Max는 독립적인 측정 결과가 있는 출시 모델입니다. Qwen3.8-Max-Preview는 프리뷰 기간 동안 동작이 바뀔 수 있는 평가 대상입니다.
| 카테고리 |
Qwen 3.8 Max |
Qwen 3.7 Max |
| 현재 모델 이름 |
qwen3.8-max-preview |
qwen3.7-max |
| 발표일 |
2026년 7월 19일 |
2026년 5월 19일 |
| 출시 상태 |
프리뷰, 대체되거나 오프라인으로 전환될 수 있음 |
표준 API 액세스를 통해 사용 가능 |
| 총 파라미터 |
2.4T |
비공개 |
| 컨텍스트 창 |
1M 토큰 |
1M 토큰 |
| Thinking 모드 |
예 |
예 |
| 함수 호출 |
예 |
예 |
| 내장 도구 |
예 |
예 |
| 공개 입출력 방식 |
현재 영어 문서에 완전히 명시되어 있지 않음 |
텍스트 입력 및 텍스트 출력 |
| 오픈 가중치 |
“곧” 공개 예정, 아직 출시되지 않음 |
아니요, 독점 모델 |
| 독립 종합 점수 |
2026년 7월 27일 기준 확인된 결과 없음 |
Artificial Analysis Intelligence Index에서 46점 |
| 가격 모델 |
Token Plan 구독 및 Credits, 단독 토큰당 가격 없음 |
토큰당 API 가격 제공 |
| GPT Proto 이용 가능 여부 |
사용 불가 |
이용 가능: 1M 토큰당 입력 $0.36 / 출력 $1.44 |
3.8의 1M 컨텍스트 수치는 초기 해설 문서 중 일부가 여전히 이를 알 수 없다고 표기하고 있기 때문에 중요합니다. QwenCloud의 현재 텍스트 생성 모델 표에는 두 모델 모두 1M으로 나와 있습니다. 이로써 사양 공백 하나는 해소되지만, 3.8이 긴 컨텍스트를 더 정확하게 사용하는지 보여주지는 않습니다.
Qwen 3.8 Max는 실제로 무엇을 업그레이드했나?
Qwen은 7월 19일 발표에서 2.4T 파라미터 수를 확인하고 오픈 가중치가 곧 제공될 것이라고 밝혔습니다. 알리바바의 Qoder 릴리스 노트는 3.8을 코딩과 전문 업무 생산성, 특히 풀스택 개발, 데이터 분석, 오피스 작업, 기타 장기적 작업에서 3.7보다 개선된 모델로 위치시킵니다. 이후 Qwen 업데이트는 프리뷰가 웹 프론트엔드 작업에서 눈에 띄는 진전을 보였다고 말합니다.
이는 유용한 신호이지만 측정된 정면 비교 결과라기보다는 공급업체의 주장입니다. 3.8이 저장소 이슈 해결, 도구 기반 작업 완료, 긴 세션에서 요구사항 유지에서 얼마나 더 나은지 알려주는 공개 표는 없습니다. 활성 파라미터 수도 공개되지 않았으므로 2.4T라는 헤드라인은 개발자에게 모델의 서빙 비용이나 지연 시간을 알려주지 않습니다.
따라서 정직한 업그레이드 이야기는 좁습니다. 3.8은 3.7이 이미 겨냥한 워크로드에서 더 나은 실행을 목표로 하면서 더 큰 모델과 더 빠른 릴리스 주기를 추가합니다. 컨텍스트 창 업그레이드가 아니며, 함수 호출 업그레이드도 아닙니다. 품질 업그레이드인지는 합리적인 가설일 뿐 검증된 결과는 아닙니다.
또 다른 비용도 있습니다. Qwen은 프리뷰가 지속적으로 개선되고 있다고 말합니다. 평가 중에는 매력적으로 들리지만, 움직이는 모델은 회귀 테스트를 어렵게 만듭니다. 동일한 프롬프트도 공지 없는 업데이트 후 다르게 동작할 수 있고, 오늘 통과한 테스트가 다음 주에도 같은 결과를 보장하지 않습니다. 프로덕션 팀에게 버전 안정성은 하나의 기능입니다.
코딩을 위한 Qwen 3.8 Max vs Qwen 3.7 Max
Qwen3.7-Max는 저장소 규모 코딩에 있어 간단한 사례를 제공합니다. 최대 1M 토큰을 수용하고, thinking과 도구를 지원하며, 이미 일반 API를 통해 호출할 수 있습니다. 에이전트가 소스 파일, diff, 로그, 도구 결과를 텍스트로 받는다면 텍스트 전용 인터페이스는 제약이 아닙니다.
독립적인 측정도 기준점을 제공합니다. Artificial Analysis는 Intelligence Index에서 Qwen3.7-Max를 46점으로 평가했습니다. 알리바바 API를 통한 출력 속도는 초당 202.2 토큰, 첫 토큰까지의 시간은 2.62초로 측정되었습니다. 이러한 결과는 제공업체와 워크로드에 따라 달라질 수 있지만, 방법론이 없는 순위 주장보다는 여전히 유용합니다.
여기에는 트레이드오프가 있습니다. Qwen3.7-Max는 Intelligence Index 평가에서 비교 그룹 모델의 중앙값 6300만 토큰과 비교해 1억 개의 출력 토큰을 생성했습니다. 쉽게 말해 장황할 수 있습니다. 빠른 토큰 생성이 자동으로 짧은 응답이나 낮은 총 비용을 의미하지는 않으며, 특히 출력 토큰이 입력 토큰보다 비쌀 때 더욱 그렇습니다.
Qwen3.8-Max-Preview는 탐색적 프론트엔드 및 장기 실행 에이전트 작업에 더 흥미롭습니다. Qwen은 웹 프론트엔드에서 광범위한 개선을 구체적으로 언급했고, Qoder는 이를 풀스택 개발에 적합하다고 봅니다. UI 생성, 다단계 디버깅, 코드와 오피스 또는 데이터 작업이 혼합된 작업에서 테스트하겠습니다. 모델 이름만으로 프로덕션 코딩 에이전트를 옮기지는 않겠습니다.
출시 주간 r/ClaudeCode 토론에는 40개 이상의 댓글이 달렸습니다. 이는 수요 신호이지 성능 결과가 아닙니다. 커뮤니티의 열기는 개발자가 어떤 워크로드를 중요하게 여기는지 알려줄 수 있습니다. 통제된 프롬프트와 공개된 출력이 없다면 어떤 모델이 프로덕션 트래픽을 담당해야 하는지는 알 수 없습니다.
공정한 Qwen 3.8 Max vs Qwen 3.7 Max 코딩 테스트를 위해서는 리포지토리 커밋, 시스템 프롬프트, 도구, 권한, 성공 기준을 동일하게 유지하세요. 도구 실패, 통과한 테스트, 인간의 수정, 실제 소요 시간, 토큰 사용량을 기록하세요. 이러한 입력 중 하나라도 다르면 결과는 비교가 아니라 데모입니다.
성능: 측정된 결과 vs 공급업체 주장
알리바바는 Qwen3.8-Max-Preview를 최고 수준의 프런티어 모델 중 하나로 설명하며 내부 평가에서 Fable 5에 이어 2위를 차지했다고 말합니다. 전반부는 그럴듯합니다. 후반부는 알리바바가 그 뒤에 있는 벤치마크 이름, 점수, 프롬프트, 평가 절차를 공개하지 않았기 때문에 독립적으로 검증할 수 없습니다.
| 근거 |
Qwen 3.8 Max |
Qwen 3.7 Max |
| 공급업체 포지셔닝 |
코딩 및 Cowork 개선, 내부 평가에서 Fable 5에 이어 2위 |
코딩, 생산성, 장기 자율 작업을 위한 에이전트 중심 플래그십 |
| 공개 벤치마크 표 |
공개되지 않음 |
공급업체 결과 및 독립 종합 테스트 제공 |
| Artificial Analysis Intelligence Index |
2026년 7월 27일 기준 결과 없음 |
46 |
| 독립 측정 출력 속도 |
사용 불가 |
알리바바 API를 통한 202.2 tokens/s |
| 독립 측정 TTFT |
사용 불가 |
알리바바 API를 통한 2.62초 |
| 재현성 |
평가 기간 중 프리뷰 변경 |
보다 안정적인 출시 엔드포인트 |
이 증거 공백이 3.8이 더 나쁘다는 것을 입증하지는 않습니다. 즉 “어느 쪽이 더 나은가”에는 두 가지 답이 있습니다. 예상되는 성능에서는 3.8이 유력한 승자입니다. 입증되고 재현 가능한 성능에서는 현재 3.7이 더 강력한 근거를 갖고 있습니다.
Qwen 3.8 Max vs Qwen 3.7 Max 가격
Qwen3.7-Max는 일반적인 토큰 가격을 사용합니다. QwenCloud는 1M 입력 토큰당 $2.50, 1M 출력 토큰당 $7.50의 표준 요금을 제시합니다. 현재 페이지에는 프로모션 요금인 $1.25와 $3.75가 표시되지만 프로모션 가격은 시간에 따라 달라집니다.
GPT Proto에서 Qwen3.7-Max는 1M 입력 토큰당 $0.36, 1M 출력 토큰당 $1.44입니다. 이는 GPT Proto를 통해 모델을 배포하는 팀에게 유용한 수치입니다. 토큰 사용량에서 지출을 직접 추정하고 동일한 잔액으로 다른 모델을 라우팅할 수 있습니다.
Qwen3.8-Max-Preview는 다른 상업 구조를 사용합니다. QwenCloud의 Token Plan 문서에는 월 $6, $18, $68의 기간 한정 개인 요금제가 나와 있습니다. 이 요금제는 여러 모델을 포함하고 사용량을 Credits로 측정합니다. Qoder는 프리뷰 기간 동안 임시 Credit 배율도 적용합니다. 어떤 경로에서도 3.8에 대한 토큰 100만 개당 단독 가격을 제공하지 않습니다.
따라서 깔끔한 가격 비교는 불가능합니다. 구독은 반복적인 대화형 사용에 매력적일 수 있지만, 엔지니어링 팀에게 토큰 청구처럼 요청당 비용을 명확히 보여주지는 않습니다. 3.8이 공개된 토큰당 요금을 받을 때까지 3.7보다 저렴하거나 비싸다는 주장은 추측일 뿐입니다.
여기에 정합 출력 표가 없는 이유
나란히 놓은 스크린샷은 설득력 있어 보일 것입니다. 하지만 지금은 오해를 불러일으킬 수도 있습니다.
Qwen3.8-Max-Preview는 GPT Proto에서 사용할 수 없으며, 공식 문서에는 모델이 프리뷰 기간 내내 변경될 수 있다고 나와 있습니다. 새로운 3.7 API 실행 결과를 날짜가 없는 다른 제품의 3.8 스크린샷과 비교하면 모델 버전, 인프라, 도구, 그리고 시스템 프롬프트까지 섞이게 됩니다. 이를 통제된 테스트라고 부르지 않겠습니다.
출판 품질의 테스트는 간단합니다. 같은 날 두 모델에 동일한 저장소 작업을 실행하고 전체 프롬프트와 도구 추적을 보존한 다음 판단 기준과 함께 원시 출력을 공개하는 것입니다. 그러한 실행이 존재하기 전에는 표본이 없는 것이 장식적인 승자 배지보다 더 정직합니다.
어떤 모델을 선택해야 할까?
| 우선순위 |
더 나은 선택 |
이유 |
| 지금 사용할 프로덕션 API |
Qwen 3.7 Max |
안정적인 액세스, 알려진 모델 문자열, 예측 가능한 토큰 가격 |
| 저장소 규모 텍스트 코딩 |
Qwen 3.7 Max |
1M 컨텍스트와 독립적으로 측정된 성능 |
| 실험적 프론트엔드 또는 Cowork 작업 |
Qwen 3.8 Max Preview |
알리바바가 가장 개선되었다고 말하는 워크로드 |
| 고정 회귀 테스트 |
Qwen 3.7 Max |
지속적으로 업데이트되는 프리뷰는 결과 재현을 어렵게 함 |
| 알려진 GPT Proto 최저 비용 |
Qwen 3.7 Max |
1M 토큰당 입력 $0.36, 출력 $1.44 |
| 오픈 가중치 자체 호스팅 |
현재는 둘 다 아님 |
3.7은 독점 모델이고, 3.8 가중치는 약속되었지만 출시되지 않음 |
제 권장 사항은 분명합니다. 3.7을 배포하고 3.8을 평가하세요. 3.8이 안정적인 릴리스, 독립적인 결과, 작업당 비용으로 환산할 수 있는 가격을 갖춘 후에만 프로덕션 워크로드를 옮기세요.
GPT Proto에서 Qwen 3.7 Max 사용 방법
GPT Proto는 OpenAI 호환 API를 통해 Qwen3.7-Max를 제공합니다. 환경 변수에 키를 설정한 다음 모델 문자열 qwen3.7-max로 표준 chat-completions 요청을 보내세요.
export GPTPROTO_API_KEY="your_api_key_here"
curl https://gptproto.com/v1/chat/completions \
-H "Authorization: Bearer $GPTPROTO_API_KEY" \
-H "Content-Type: application/json" \
-d '{
"model": "qwen3.7-max",
"messages": [
{
"role": "system",
"content": "You are a senior software engineer. Return the smallest safe patch and explain each changed file."
},
{
"role": "user",
"content": "Review this function for correctness and propose a tested fix: def divide_total(total, count): return total / count"
}
]
}'
Python 버전은 공식 OpenAI 클라이언트를 사용합니다.
import os
from openai import OpenAI
client = OpenAI(
api_key=os.environ["GPTPROTO_API_KEY"],
base_url="https://gptproto.com/v1",
)
response = client.chat.completions.create(
model="qwen3.7-max",
messages=[
{
"role": "system",
"content": (
"You are a senior software engineer. Return the smallest "
"safe patch and explain each changed file."
),
},
{
"role": "user",
"content": (
"Review this function for correctness and propose a tested fix: "
"def divide_total(total, count): return total / count"
),
},
],
)
print(response.choices[0].message.content)
SDK는 Bearer 인증 헤더를 추가합니다. 다른 호환 모델로 전환하려면 모델 문자열만 변경하면 됩니다. 편리한 전환이 테스트되지 않은 프로덕션 변경이 되지 않도록 별도의 평가 세트를 유지하세요.
안전한 업그레이드 체크리스트
합성 코딩 퍼즐이 아니라 실제 워크로드에서 3.7 기준선을 저장하는 것부터 시작하세요. 프롬프트, 저장소 상태, 도구, 예상 출력, 지연 시간, 토큰 사용량을 보존하세요. 그런 다음 동일한 패키지를 3.8 Preview에 실행하고 가장 좋아 보이는 답변뿐만 아니라 실패도 검토하세요.
결과를 보기 전에 마이그레이션 기준을 설정하세요. 예를 들어, 새 모델이 도구 오류 증가나 허용할 수 없는 비용 변화 없이 동일한 테스트를 통과해야 한다고 요구하세요. 주요 프리뷰 업데이트 후 평가를 다시 실행하세요. 마지막으로 가동 시간이나 예산 약정이 있는 트래픽을 옮기기 전에 안정적인 모델 식별자와 공개된 가격을 기다리세요.
이 과정은 출시 당일에 전환하는 것보다 덜 흥미진진합니다. 그러나 모델 업그레이드가 장애가 되지 않도록 하는 방법이기도 합니다.
최종 결론
Qwen3.8-Max-Preview는 더 나은 모델이 될 수도 있습니다. 하지만 현재는 덜 입증된 제품입니다.
지금 코딩 또는 개발자 워크플로를 배포한다면 GPT Proto를 통해 Qwen3.7-Max를 실행하고 3.8은 별도의 평가 트랙에 두겠습니다. 이 권장 사항은 누락된 증거가 나오면 바뀔 수 있습니다. 3.8의 이름에 더 큰 숫자가 있다는 이유로 바뀌어서는 안 됩니다.