1M 토큰 멀티모달 컨텍스트
한 번의 요청으로 텍스트, 이미지, 동영상, 오디오, PDF를 처리하세요. 1,048,576토큰 입력 창을 통해 대규모 저장소, 긴 보고서, 녹화된 회의, 여러 파일에 대한 분석을 짧은 발췌문으로 축소하지 않고 처리할 수 있습니다.
curl --request POST "https://gptproto.com/v1/chat/completions" \
--header "Authorization: Bearer $GPTPROTO_API_KEY" \
--header "Content-Type: application/json" \
--data '{
"model": "gemini-3.7-flash",
"messages": [
{
"role": "user",
"content": "Hello"
}
]
}'Chat, coding agents & document work. Priced per 1M tokens — input, cached input and output are billed separately. GPTProto is 40% below official rates.
| 시나리오 | Google 정가 | OpenRouter | GPTProto | 월 절감 |
|---|---|---|---|---|
| Personal10M 토큰 / 월 (4.8M 캐시) | $20.52 | $21.65 | $12.31 | −$8.21≈ $98.50 / 년 |
| Team100M 토큰 / 월 (48M 캐시) | $205.20 | $216.49 | $123.12 | −$82.08≈ $984.96 / 년 |
| Business500M 토큰 / 월 (240M 캐시) | $1026.00 | $1082.43 | $615.60 | −$410.40≈ $4924.80 / 년 |
멀티모달 입력, 1,048,576토큰 컨텍스트 창, 구성 가능한 추론, 그리고 코딩·도구 사용·구조화된 출력·장문서 워크플로를 위한 OpenAI 호환 호출을 지원하는 Google의 최신 Flash 모델을 GPTProto를 통해 실행하세요.
1M 토큰 멀티모달 컨텍스트
한 번의 요청으로 텍스트, 이미지, 동영상, 오디오, PDF를 처리하세요. 1,048,576토큰 입력 창을 통해 대규모 저장소, 긴 보고서, 녹화된 회의, 여러 파일에 대한 분석을 짧은 발췌문으로 축소하지 않고 처리할 수 있습니다.
코딩 및 UI 구현
스크린샷이나 디자인 레퍼런스를 컨텍스트로 활용하면서 코드를 생성하고, 디버깅하고, 리팩터링하세요. Gemini 3.7 Flash는 Google이 공개한 평가에서 Gemini 3.6 Flash보다 첫 시도 코드 정확도와 디자인 준수 성능이 향상되었습니다.
에이전트 도구 및 구조화된 출력
선택한 API 경로에서 지원하는 경우 함수 호출, 구조화된 출력, 코드 실행, 파일 검색, URL 컨텍스트, 검색 기반 그라운딩을 사용하세요. 이를 통해 모델은 여러 단계를 거치며 정보를 검사하고, 작업을 수행하고, 검증된 데이터를 반환해야 하는 에이전트에 적합합니다.
낮음, 중간 또는 높음 수준의 추론
더 빠른 일반 작업에는 낮음, 균형 잡힌 코딩 및 에이전트 작업에는 중간, 어려운 추론과 도구 사용에는 높음을 선택하세요. Gemini 3.7 Flash는 최소 사고 수준을 지원하지 않습니다.
Gemini 3.7 Flash API는 개발자에게 Google'의 최신 정식 출시 Flash 모델에 프로그래밍 방식으로 액세스할 수 있는 기능을 제공합니다. 2026년 8월 13일에 출시된 이 모델은 소프트웨어 엔지니어링, 웹 개발, 멀티모달 문서 작업, 이전 Flash 릴리스보다 강력한 지시 따르기와 안정적인 도구 사용이 필요한 다단계 에이전트를 위해 설계되었습니다.
Gemini 3.7 Flash는 텍스트, 이미지, 동영상, 오디오, PDF 입력을 지원하지만 텍스트만 반환합니다. 따라서 제품 스크린샷 이해, 녹화된 워크플로 검토, 보고서에서 증거 추출, 저장소 전반의 추론에 적합합니다. 기본 이미지, 동영상 또는 오디오 생성 모델은 아닙니다.
GPTProto에서는 개발자가 공급자별로 별도의 잔액을 관리하지 않고 모델에 액세스할 수 있습니다. 하나의 키로 200개 이상의 지원 모델에 요청을 라우팅할 수 있으므로 Gemini를 대안 모델과 비교하거나 다른 공급자 계정을 만들지 않고도 폴백을 추가하기가 더 쉽습니다. 현재 Gemini 3.7 Flash API 가격과 표시된 40% 할인의 기준은 실시간 가격 패널입니다.
| 사양 | Gemini 3.7 Flash |
|---|---|
| 공급자 | |
| 출시 상태 | 정식 출시(GA) |
| 출시일 | 2026년 8월 13일 |
| 공식 모델 ID | gemini-3.7-flash |
| 입력 모달리티 | 텍스트, 이미지, 동영상, 오디오 및 PDF |
| 출력 모달리티 | 텍스트 |
| 입력 토큰 한도 | 1,048,576 토큰 |
| 최대 출력 | 65,536 토큰 |
| 사고 수준 | low, medium (기본값), high |
| 지원되는 업스트림 기능 | 캐싱, 함수 호출, 구조화된 출력, 코드 실행, 파일 검색, URL 컨텍스트, 검색 및 Maps 그라운딩, Computer Use(프리뷰) |
| 업스트림에서 지원되지 않음 | minimal 사고, 기본 이미지 생성, 오디오 생성 및 Live API |
| 업스트림 사용 옵션 | Standard, Batch, Flex 및 Priority |
Gemini 3.7 Flash API는 짧은 단일 답변을 요청하기보다 여러 단계를 결합하는 워크로드에 가장 적합합니다. 코딩 작업에서는 저장소 컨텍스트를 검사하고, 여러 파일에 걸쳐 문제를 추적하며, 최소한의 패치를 제안하고, 변경 사항을 설명할 수 있습니다. 프론트엔드 작업에서는 스크린샷이나 디자인 참조를 요청에 포함하여 모델이 의도한 레이아웃과 구현을 비교하도록 할 수 있습니다.
에이전트 워크플로에서 모델은 함수를 호출할 시점을 결정하고, 도구 결과를 해석하며, JSON 스키마를 따르는 응답을 반환할 수 있습니다. 실제 활용 사례로는 지원 티켓 분류, 문서-데이터베이스 추출, 규정 준수 검토, 내부 조사 및 워크플로 자동화가 있습니다. 시간에 민감한 분류 작업에서는 추론 수준을 낮추고, 어려운 디버깅 및 계획 작업에서는 높일 수 있습니다.
멀티모달 입력은 지식 작업에도 유용합니다. 하나의 워크플로에서 PDF, 차트, 스크린샷, 녹화된 회의 및 서면 지침을 결합할 수 있습니다. 출력은 텍스트로 유지되므로 최종 결과물이 이미지, 동영상 또는 오디오 파일이어야 한다면 전용 생성 모델을 사용하세요.
Gemini 3.7 Flash는 Gemini 3.6 Flash와 동일한 1,048,576 토큰 입력 한도, 65,536 토큰 출력 한도 및 광범위한 입력 모달리티를 유지합니다. 업그레이드하는 이유는 더 큰 컨텍스트 창이 아닙니다. 코딩, 웹 개발, 문서 이해, 지시 따르기 및 에이전트 실행 성능이 향상되었기 때문입니다.
Google'의 출시 평가에서는 다음과 같은 변경 사항을 보고했습니다. 이는 공급자가 보고한 벤치마크 결과이며, GPTProto가 독립적으로 테스트한 결과가 아닙니다.
| 평가 | Gemini 3.7 Flash | Gemini 3.6 Flash | 보고된 변경 |
|---|---|---|---|
| FrontierCode 1.1 Main | 43.6% | 34.4% | +9.2포인트 |
| DeepSWE v1.1 | 65.3% | 49.0% | +16.3포인트 |
| WebDev Arena | 1588 Elo | 1538 Elo | +50 Elo |
| GDP.pdf | 34.0% | 22.0% | +12.0포인트 |
| AutomationBench | 30.4% | 17.0% | +13.4포인트 |
호환성 측면에서 한 가지 절충점이 있습니다. Gemini 3.6 Flash는 minimal, low, medium, high 사고 수준을 지원하지만, 3.7은 low, medium, high만 지원합니다. 기존 워크플로가 단순하고 대량인 요청에 거의 0에 가까운 사고 수준을 사용하는 경우, 모든 트래픽을 마이그레이션하기 전에 3.6을 A/B 테스트에 유지하거나 Flash-Lite 모델과 비교하세요.
모델 이름을 변경하는 것은 첫 단계일 뿐입니다. 기존 애플리케이션에서 Gemini 3.6 Flash, Gemini 3.5 Flash, Gemini 3 Flash Preview 또는 Gemini 3.1 Pro를 교체하기 전에 다음 체크리스트를 사용하세요:
GPTProto 문서에 표시된 정확한 모델 문자열을 사용하세요. Google'의 공식 안정 ID는 gemini-3.7-flash입니다. 게시하거나 배포하기 전에 GPTProto 경로가 동일한 문자열을 사용하는지 확인하세요.
thinking_level: "minimal"을 전송하지 마세요. Google 문서에서는 medium을 기본값으로 설명하며, minimal을 선택하면 유효성 검사 오류를 반환합니다.
기본 Gemini Interactions API를 마이그레이션하는 경우 지원 중단된 temperature, top_p, top_k, candidate_count 설정을 제거하고, thinking_budget을 thinking_level로 교체하며, 미리 채워진 모델 턴을 제거하세요.
멀티모달 관련 기대치를 정확히 설정하세요. 이미지, 오디오, 동영상 및 PDF는 입력 형식이며, 응답은 텍스트입니다.
모든 업스트림 Google 도구를 OpenAI 호환 경로에서 자동으로 사용할 수 있다고 가정하지 마세요. 지원되는 매개변수, 도구, 파일 처리 및 응답 필드는 GPTProto API의 실시간 문서에서 확인하세요.
모든 요청을 이전하기 전에 자체 코딩 작업, 스키마, 도구 호출, 지연 시간 목표 및 토큰 예산으로 카나리 테스트를 실행하세요.
이 마이그레이션 가이드는 단순한 모델 목록과 실제로 사용할 수 있는 Gemini 3.7 Flash API 액세스 페이지의 주요 차이점입니다. 새 모델 ID가 올바르더라도 어떤 기존 요청이 실패할 수 있는지 개발자에게 알려주기 때문입니다.
긴 컨텍스트 창, 여러 입력 형식, 향상된 첫 번째 시도 코딩 또는 대형 플래그십 모델보다 낮은 토큰 가격으로 다단계 도구 오케스트레이션이 필요한 워크로드에는 Gemini 3.7 Flash를 선택하세요. minimal 사고가 중요하거나 기존 애플리케이션이 아직 회귀 테스트를 통과하지 못했다면 Gemini 3.6 Flash를 유지하세요.
Grok 4.6과 Gemini 3.7 Flash 중에서 선택할 때는 판단 기준이 더 구체적입니다. Gemini는 오디오, 동영상 및 PDF 입력을 지원하며 Grok's 컨텍스트 창의 두 배 이상을 제공합니다. Grok 4.6은 xhigh 추론 옵션을 추가하며 SpaceXAI는 고정된 텍스트 출력 한도를 문서화하지 않습니다. 어느 모델도 모든 면에서 더 우수하지는 않으므로 기본 모델을 선택하기 전에 대표 작업을 두 모델 모두에 라우팅해 보세요.
| 결정 요소 | Gemini 3.7 Flash | Gemini 3.6 Flash | Grok 4.6 |
|---|---|---|---|
| 가장 적합한 용도 | 코딩, 디자인 준수, 멀티모달 문서, 다단계 에이전트 | 기존 Flash 워크플로 및 minimal 사고 트래픽 | xhigh 추론 또는 매우 긴 텍스트 출력이 필요한 코딩 및 에이전트
|
| 컨텍스트 창 | 1,048,576 토큰 | 1,048,576 토큰 | 500,000 토큰 |
| 기본 입력 | 텍스트, 이미지, 동영상, 오디오, PDF | 텍스트, 이미지, 동영상, 오디오, PDF | 텍스트, 이미지 |
| 텍스트 출력 한도 | 65,536 토큰 | 65,536 토큰 | SpaceXAI가 문서화한 고정 한도 없음 |
| 추론 제어 | 낮음, 중간, 높음 | 최소, 낮음, 중간, 높음 | 낮음, 중간, 높음, xhigh |
| 공식 단기 컨텍스트 토큰 가격* | 2026년 12월 31일까지 입력 $0.75 / 출력 $3.75 | 2026년 12월 31일까지 입력 $0.75 / 출력 $3.75 | 입력 토큰 200K 미만 시 입력 $2 / 출력 $6 |
*공식 공급자 가격은 모델 선택을 위한 참고용으로만 표시됩니다. GPTProto를 통해 청구되는 요금은 GPTProto's 실시간 가격 패널을 사용하세요.