Claude Sonnet 5란 무엇인가?
Sonnet 5는 Anthropic의 최신 중간급 모델로, 지금까지 중 가장 에이전트형(agentic) Sonnet으로 포지셔닝되었습니다. 스스로 계획을 세우고, 브라우저와 터미널을 조작하며, 다단계 작업을 자체적으로 실행합니다. Anthropic이 전면에 내세우는 프레임은 비용 대비 성능입니다. Opus 4.8에 가까운 성능을 Sonnet 가격에 제공한다는 것이죠.
구체적 기술에 들어가기 전에, 이 프레임이 왜 중요한지 짚어보겠습니다. 지난 1년 대부분 동안 에이전트 성능 개선의 가장 큰 부분은 Sonnet이 아니라 Opus 등급에 있었습니다. 그래서 대규모 에이전트 작업을 돌리는 팀은 일부 시간에만 필요한 성능을 위해 Opus 요금을 계속 지불해야 했죠. Sonnet 5는 그 성능의 상당 부분을 더 낮은 가격 등급으로 끌어내리려는 Anthropic의 시도입니다. 그것이 '왜'이고, 뒤따르는 대부분의 설계 선택을 설명합니다.
Anthropic 문서에 따른 기술 사양은 다음과 같습니다. Sonnet 4.6의 드롭인 교체 모델이며, API 모델 ID는 claude-sonnet-5입니다. 기본값이자 최대값인 1M 토큰 컨텍스트 창을 제공하고, 최대 128k 출력 토큰을 지원합니다. 텍스트와 이미지를 입력받아 텍스트를 출력합니다.
| |
Claude Sonnet 5 |
| 출시일 |
2026년 6월 30일 |
| API 모델 ID |
claude-sonnet-5 |
| 컨텍스트 창 |
1M 토큰 (기본값 및 최대값) |
| 최대 출력 |
128k 토큰 |
| 입력 / 출력 |
텍스트 + 이미지 입력, 텍스트 출력 |
| 4.6과의 관계 |
드롭인 교체 |
Sonnet 4.6 대비 새로운 점
이미 Sonnet 4.6을 운영 중이라면, 이번 업그레이드는 단순한 가중치 개선이 아닙니다. Anthropic 문서에 따르면 동작에 영향을 주는 세 가지 변경 사항이 있습니다:
- 적응형 사고(adaptive thinking)가 기본적으로 켜집니다.
- 수동 확장 사고(manual extended thinking)는 이제 400 오류를 반환합니다 (4.6에서 이미 deprecated되었습니다).
- 샘플링 매개변수 — temperature, top_p, top_k —를 기본값이 아닌 값으로 설정하면 400 오류가 반환됩니다.
운영상 더 중요한 변경 사항 두 가지가 더 있습니다. Sonnet 5는 effort 수준(low, medium, high, xhigh)을 제공하며, effort가 높을수록 추론에 더 많은 토큰을 사용해 품질을 높입니다. 물론 비용도 늘어납니다. 또한 Sonnet 등급 모델 중 최초로 실시간 사이버 안전장치가 기본적으로 활성화됩니다. 이 안전장치에는 에이전트에 연결하기 전에 알아둬야 할 특이점이 있습니다. 모델이 플래그된 요청을 거부하면 오류가 아니라 HTTP 200 성공 응답과 함께 stop_reason: "refusal"로 반환됩니다. 거부가 예외를 던진다고 가정한 에러 처리를 쓰고 있다면 그 가정은 성립하지 않습니다.
그러나 영향 범위가 가장 넓은 변경점은 아무도 헤드라인에 쓰지 않는 바로 그 토크나이저입니다. 가격 계산을 바꾸기 때문에 별도 섹션으로 다룹니다.
주요 기능 및 성능
Anthropic은 Sonnet 5를 추론, 도구 사용, 코딩, 지식 작업 전반에서 4.6보다 확실히 개선된 모델이자, effort 다이얼을 통해 비용-성능 곡선에서 원하는 지점을 고를 수 있을 만큼 Opus 4.8에 근접한 모델로 위치시킵니다. 아래 벤치마크 수치는 Anthropic의 출시 자료와 첫날 보도를 기준으로 한 것입니다. 정확한 수치는 직접 System Card에서 확인하기 전까지는 Anthropic 발표 수치로 간주하세요.
| 벤치마크 |
Sonnet 5 |
Sonnet 4.6 |
Opus 4.8 |
| SWE-bench Pro (에이전트 코딩) |
63.2% |
58.1% |
69.2% |
| OSWorld-Verified (컴퓨터 사용) |
81.2% |
78.5% |
— |
| Terminal-Bench 2.1 |
80.4% |
67.0% |
— |
| Humanity's Last Exam (도구 사용) |
57.4% |
46.8% |
57.9% |
| GDPval-AA v2 (지식 작업) |
1,618 |
— |
1,615 |
수치는 Anthropic의 2026년 6월 30일 출시 자료에서 인용한 것입니다. 대시(-)는 제가 확인하지 못한 셀입니다.
이 표를 솔직하게 읽으면 두 가지가 눈에 띕니다. 코딩에서 Sonnet 5는 4.6을 상당한 격차로 앞서지만 여전히 Opus 4.8 — 아래에 있습니다. 격차를 좁히긴 하지만 완전히 메우지는 못하는 것입니다. 지식 작업에서는 Opus 4.8을 아주 근소하게 앞섭니다(1,618 대 1,615). 이것이 '때때로 Opus를 이긴다'는 말의 출처이며, 곳곳에서 반복해서 보게 될 표현입니다. 사실이긴 하지만 한 벤치마크에서의 근소한 차이일 뿐입니다.
여기에는 하이라이트 영상이 생략한 비용이 있습니다. Anthropic의 자체 차트를 보면 Sonnet 5의 최상의 가치는 low 및 medium effort에서 나옵니다. xhigh로 올리면 출시일 보도에 따르면 비슷한 품질에 Opus 4.8보다 더 높은 비용이 들 수 있습니다. 따라서 'Opus보다 저렴하다'는 말에는 별표가 붙습니다. 실제로 Sonnet을 쓸 만한 effort 수준에서는 저렴하지만, 다이얼을 최대로 올리면 반드시 저렴한 것은 아닙니다. 제 생각은 이렇습니다. 작업이 진짜로 xhigh 추론을 요구한다면 기본적으로 Sonnet 5를 선택하기 전에 Opus 4.8의 가격을 먼저 계산해보세요. 더 작은 모델이 항상 더 저렴하다는 직관은 다이얼 최상단에서는 무너집니다.
안전성 측면에서 Anthropic은 4.6보다 환각, 아첨, 바람직하지 않은 행동 비율이 낮아졌고, 악의적 요청과 프롬프트 인젝션 하이재킹에 대한 저항력도 개선되었다고 보고합니다. Anthropic 스스로 공개한 주의사항은 Sonnet 5가 내부 감사에서 Opus 4.8보다 여전히 높은 정합성 오류 비율을 보인다는 것입니다. 사이버 보안 측면에서는 테스트 중 완전한 작동 익스플로잇을 생성한 적이 없습니다. 이는 의도적으로 낮춘 능력으로, 고객 대면 에이전트를 만든다면 장점이고, 공인된 보안 작업이 사용 사례라면 한계입니다.
Claude Sonnet 5 가격: 실제로 더 저렴한가?
공식 가격 — Anthropic 직판과 GPT Proto의 현재 요금:
| |
입력 / 1M |
출력 / 1M |
| Sonnet 5 — 출시 특가 (2026년 8월 31일까지) |
$2 |
$10 |
| Sonnet 5 — 표준 (2026년 9월 1일부터) |
$3 |
$15 |
| Sonnet 5 — GPT Proto 경유 (현재) |
$1.6 |
$8 |
| Sonnet 4.6 |
$3 |
$15 |
| Opus 4.8 |
$5 |
$25 |
표준 가격에서 Sonnet 5는 토큰당 비용이 4.6과 같고 Opus 4.8보다 크게 저렴합니다. 단순하죠. 그런데 토큰당 가격이 전체 비용은 아닙니다.
Sonnet 5는 새 토크나이저를 탑재합니다. Anthropic이 Opus 4.7에서 도입한 것과 같은 토크나이저인데, 같은 텍스트가 콘텐츠 유형에 따라 대략 1.0~1.35× 더 많은 토큰으로 매핑됩니다. Anthropic은 각주에서 이 사실과 그 결과를 솔직하게 밝힙니다. 출시 특가 가격은 4.6에서 전환해도 대략 비용 중립적이 되도록 설정되었습니다. 이 문장을 주의 깊게 읽으세요. $2/$10 출시 가격은 순수한 할인이 아니라는 뜻입니다. 일부는 추가 토큰을 상쇄하는 역할을 합니다. 그리고 9월 1일에 가격이 $3/$15로 돌아오면 — 서류상으로는 4.6과 동일하지만 — 같은 요청이라도 4.6보다 더 많은 비용이 들 수 있습니다. 같은 텍스트에 더 많은 토큰을 청구하기 때문입니다.
그렇다면 Sonnet 5가 4.6보다 저렴한가요? 솔직한 답은 언제, 얼마나 돌리느냐에 달렸다는 것입니다. 8월까지는 사실상 그렇습니다. 이후에는 같은 워크로드에 대해 요청당 비용이 비슷하거나 약간 더 높은 수준으로 계획하세요. 더 저렴하지 않습니다. 그리고 토큰당 가격만 믿지 말고 새 토크나이저에서 자신의 프롬프트를 직접 측정해보세요.
Claude를 직판이 아니라 GPT Proto를 통해 호출한다면 Sonnet 5가 플랫폼에서 출시되었으며 입력 1M당 $1.6, 출력 1M당 $8입니다. 이는 Anthropic의 $2/$10 출시 요금보다 20% 낮은 가격이라, 출시 특가가 유지되는 동안에는 더 저렴한 경로입니다. 같은 플랫폼에서 Sonnet 4.6은 $2.4/$12, Opus 4.8은 $4/$20입니다. 다음 섹션의 실행 가능한 호출 예시는 Sonnet 5를 직접 가리킵니다.
API로 Claude Sonnet 5 사용하기
Sonnet 5는 현재 GPT Proto에서 제공되므로 아래 실행 가능한 예시는 Claude Sonnet 5 모델 페이지에서 직접 호출합니다. 4.6에서 마이그레이션하는 경우, Anthropic이 광고하는 그대로의 드롭인 교체입니다. claude-sonnet-4-6을 claude-sonnet-5로 바꾸고 나머지 호출은 그대로 두면 됩니다.
GPT Proto는 Claude를 Anthropic의 네이티브 Messages 형식으로 https://gptproto.com/v1/messages에 노출하며, Bearer 토큰을 사용합니다. 먼저 cURL입니다:
curl --request POST "https://gptproto.com/v1/messages" \
--header "Authorization: Bearer $GPTPROTO_API_KEY" \
--header "Content-Type: application/json" \
--header "anthropic-version: 2023-06-01" \
--data '{
"model": "claude-sonnet-5",
"max_tokens": 1024,
"messages": [
{ "role": "user", "content": "에이전트 코딩 모델이 무엇을 하는지 두 문장으로 설명하세요." }
]
}'
Python에서 동일한 호출을 requests만 사용해 작성하면 다음과 같습니다:
import os
import requests
resp = requests.post(
"https://gptproto.com/v1/messages",
headers={
"Authorization": f"Bearer {os.environ['GPTPROTO_API_KEY']}",
"Content-Type": "application/json",
"anthropic-version": "2023-06-01",
},
json={
"model": "claude-sonnet-5",
"max_tokens": 1024,
"messages": [
{"role": "user", "content": "에이전트 코딩 모델이 무엇을 하는지 두 문장으로 설명하세요."}
],
},
timeout=60,
)
resp.raise_for_status()
data = resp.json()
print(data["content"][0]["text"])
Sonnet 5로 마이그레이션할 때 반드시 챙겨야 할 두 가지가 있습니다. 첫째, 토크나이저 변경으로 텍스트가 같아도 토큰 수 — 따라서 비용과 max_tokens 여유분 —가 달라집니다. 기존 한도가 여전히 맞는다고 가정하기 전에 다시 측정하세요. 둘째, 현재 코드에서 temperature, top_p, top_k를 사용자 지정 값으로 설정하거나 수동 확장 사고를 켜고 있다면 해당 부분을 제거하세요. Sonnet 5에서는 400을 반환합니다.
GPT Proto의 키 하나로 단일 잔액에서 Claude와 200여 개 다른 모델에 접근할 수 있으므로, 공급자를 오가며 관리할 필요 없이 같은 요청 경로에서 Sonnet 5를 예를 들어 더 저렴한 모델과 벤치마크할 수 있습니다. 전체 목록은 모델 카탈로그에서 확인하세요.
Sonnet 5 vs Sonnet 4.6 (그리고 아직 4.5나 3.5를 쓰고 있다면)
결정에 실제로 사용할 헤드투헤드 비교입니다. Opus 4.8을 기준 상한선으로 포함했습니다:
| |
Sonnet 5 |
Sonnet 4.6 |
Opus 4.8 |
| 포지셔닝 |
Sonnet 가격에 Opus에 가까운 에이전트 작업 |
기존 중간급 표준 |
정확도 상한 |
| 코딩 (SWE-bench Pro) |
63.2% |
58.1% |
69.2% |
| 최상의 가치 |
Low / medium effort |
— |
가장 어려운 작업 |
| 표준 가격 (1M당 입력/출력) |
$3 / $15 |
$3 / $15 |
$5 / $25 |
| 컨텍스트 |
1M |
최대 1M |
200k |
| 비용 주의사항 |
새 토크나이저가 더 많은 토큰을 청구하며, xhigh는 Opus 비용을 초과할 수 있음 |
익숙한 토크나이저 |
최상위 성능에 맞춘 가격 |
제 판단은 이렇습니다. 4.6을 쓰면서 지속적인 에이전트/코딩 작업을 하고 있다면 Sonnet 5로 업그레이드하는 것이 맞습니다. 코딩 및 도구 사용 개선은 실질적이고, 출시 특가 덕분에 시도 비용이 저렴합니다. 워크로드가 최상위에서 정확도가 중요한 작업 — 오답의 비용이 큰 작업 — 이라면 Opus 4.8을 루프에 유지하고 Sonnet 5는 대량의 중간 작업에 예약하세요. 그리고 xhigh effort를 계속 사용하게 된다면, 그것은 Sonnet이 저렴하다고 가정할 이유가 아니라 Opus 4.8의 가격을 계산해보라는 신호입니다.
아직 Sonnet 4.5나 3.5를 쓰고 있나요? 그렇다면 업그레이드 사유는 더 강하지만, '5 vs 3.5' 벤치마크를 깔끔하게 인용하지는 않겠습니다. Anthropic이 그런 비교를 공개하지 않았기 때문입니다. 위의 모든 헤드투헤드 수치는 4.6 기준입니다. 방향성은 말씀드릴 수 있습니다. 3.5와 5 사이에는 두 세대의 에이전트 성능 개선이 있고, 그중 대부분은 이전 Sonnet이 부족했던 도구 사용과 장기 작업 신뢰성에 있습니다. 어디서 시작하든 실질적인 방법은 같습니다. 코드를 GPT Proto의 Sonnet 5에 연결하고 effort 다이얼이 나머지를 하게 하면 됩니다.
가치가 있을까? 솔직한 평가
출시 첫날 반응은 갈렸고, 그 갈림은 정보를 줍니다. 칭찬은 출시 특가의 가격 대비 가치에 집중되었습니다. 의구심은 이 가이드가 계속 돌아보는 같은 질문에 집중되었습니다. 표준 $3/$15 가격이 돌아오고 토크나이저의 토큰 인플레이션이 조용히 작동하기 시작한 뒤에도 성능이 유지될까 하는 것입니다.
제가 본 가장 유용한 신호는 벤치마크가 아니라 실제 작업에 적용한 코드 리뷰 도구 팀의 실사용 리뷰였습니다. 그들의 결과는 양방향으로 해석됩니다. 그래서 제가 신뢰합니다. 코드 작성과 구축에서는 Sonnet 5가 이 등급에서 그들이 사용해본 가장 강력한 모델이었습니다. 코드 리뷰에서는 트레이드오프가 있었습니다. 주석은 더 깔끔하고 예리했지만, 이미 프로덕션에서 돌리는 모델보다 잡아내는 버그 수가 적었고 리뷰당 비용은 약간 더 높았습니다. 그들은 또한 에이전트 루프에서 생산성처럼 보이는 두 가지 습관을 발견했습니다. 기능보다 테스트를 먼저 작성하는 경향, 그리고 긴 작업 중간에 낡은 계획을 끝까지 밀어붙이는 대신 자신의 계획을 다시 작성하는 경향입니다. 그들이 지적한 한계는 Anthropic의 자체 메모와 일치합니다. 새로운 사이버 안전장치가 합법적인 보안 작업에 가끔 작동할 수 있다는 것입니다.
기억할 점: 출시 포스트의 화려한 추천사는 Anthropic의 초기 액세스 파트너에게서 나온 것입니다. 실제 반응이기는 하지만 선별된 것이고, 공급업체가 자신의 추천사를 고르는 것은 중립적 증거가 아닙니다. 독립적인 실사용 평가 — 생성에는 강하고, 리뷰에는 약하고 비싸다 —가 더 정직한 기준입니다.
그렇다면 누가 전환해야 할까요? 대량 코딩, 도구 사용, 브라우저/터미널 자동화, 또는 Opus에 과도한 비용을 지불하고 있던 지식 작업을 하는 팀이라면 전환하세요. 그리고 시도 비용이 저렴한 출시 특가 기간에 전환하세요. 신중한 리뷰나 정확도가 중요한 결정을 핵심 루프로 삼는 팀은 테스트는 해보되, 출시일에 기존 모델을 바로 은퇴시키지 말고 커밋 전에 자체 평가 스위트를 다시 실행하세요.
결론: Sonnet 5는 에이전트 및 코딩 작업에서 확실한 업그레이드이며, 출시 특가 덕분에 시도하기 저렴합니다. 단, '4.6과 동일한 정가'를 '동일한 청구 금액'으로 읽지 말고, effort 다이얼을 올리기 전에 Opus 4.8의 가격을 계산하세요. 오늘 Claude Sonnet 5를 GPT Proto에서 $1.6/$8에 호출할 수 있습니다. 이는 Anthropic 출시 요금보다 20% 저렴하며, 비용에 민감한 호출을 다른 곳으로 보내고 싶다면 하나의 잔액과 하나의 API 키로 200개 이상의 모델에 접근할 수 있습니다.