Gemini 3.6 Flash API는 개발자에게 Google이 일반에 공개한 Flash 모델에 프로그래밍 방식으로 액세스할 수 있는 기능을 제공하며, 코딩 에이전트, 멀티모달 분석, 긴 컨텍스트 지식 작업, 도구 기반 자동화에 사용할 수 있습니다. Google은 안정적인 gemini-3.6-flash 모델을 2026년 7월 21일에 출시했습니다. 이전의 gemini-3-flash-preview와 달리, 이는 지속적인 애플리케이션 사용을 위한 안정적인 모델 ID입니다.
Gemini 3.6 Flash는 텍스트, 이미지, 비디오, 오디오, PDF 파일을 입력으로 받지만 출력은 텍스트만 반환합니다. 1,048,576토큰 입력 창은 대규모 저장소, 긴 문서 세트, 확장된 미디어 입력을 담을 수 있으며, 65,536토큰 출력 한도는 상세한 보고서, 코드, 구조화된 응답을 지원합니다. Google은 기본 모델의 기능으로 캐싱, 구조화된 출력, 함수 호출, 코드 실행, 파일 검색, URL 컨텍스트, Search grounding, Maps grounding, 구성 가능한 thinking을 나열합니다.
기능 경계가 중요합니다. Gemini 3.6 Flash는 이미지나 오디오를 생성하지 않으며 Live API를 지원하지 않습니다. Computer use는 완전히 안정적인 기능이 아닌 프리뷰 기능으로 제공됩니다. 통합이 Google 네이티브 도구에 의존하는 경우 마이그레이션 전에 GPTProto 호환성 레이어가 해당 도구를 노출하는지 확인하세요. 제품에 음성-음성 상호작용, 네이티브 이미지 생성, 또는 데스크톱 자동화를 위한 엄격한 안정성이 필요하다면 해당 작업 부하를 다른 모델로 라우팅하세요.
| 사양 | Gemini 3.6 Flash |
|---|---|
| 제공자 | |
| 상태 | 일반 제공(GA) |
| 안정적인 모델 ID | gemini-3.6-flash |
| 입력 유형 | 텍스트, 이미지, 비디오, 오디오, PDF |
| 출력 유형 | 텍스트 |
| 입력 토큰 한도 | 1,048,576 |
| 출력 토큰 한도 | 65,536 |
| Thinking 수준 | minimal, low, medium, high |
| 기본 thinking 수준 | medium |
| Google 제공 도구 | 함수 호출, 코드 실행, 파일 검색, Search, Maps, URL 컨텍스트 |
| Computer use | 프리뷰에서 지원됨 |
| 지원되지 않음 | 이미지 생성, 오디오 생성, Live API |
Gemini 3.6 Flash가 가장 적합한 분야
Gemini 3.6 Flash는 작업에 큰 작업 컨텍스트와 반복적인 도구 호출이 모두 필요할 때 가장 유용합니다. 모든 짧은 프롬프트에서 자동으로 가장 저렴한 선택은 아니며, 기본 thinking 수준(medium)은 단순 분류에서 비추론(non-reasoning) 모델보다 더 많은 토큰을 사용할 수 있습니다. thinking 수준과 모델 경로를 실제 작업에 맞게 조정하세요.
| 워크로드 | 적합한 이유 | 구현 참고 사항 |
|---|---|---|
| 저장소 코딩 에이전트 | Google의 테스트에서 Gemini 3.5 Flash보다 원치 않는 편집과 실행 루프가 더 적음 | 이 경우 medium 또는 high thinking을 사용하고 변경 사항을 테스트로 검증하세요. |
| 멀티모달 문서 분석 | 동일한 요청에서 PDF, 이미지, 차트, 오디오, 비디오를 읽음 | 다운스트림 시스템에 안정적인 필드가 필요하면 구조화된 출력을 요청하세요. |
| 장문 컨텍스트 리서치 | 1M 입력 토큰 및 지원되는 컨텍스트 캐싱 | 변경되지 않은 파일을 다시 보내는 대신 반복되는 코퍼스를 캐시하세요. |
| 브라우저 또는 데스크톱 자동화 | Google의 평가에서 네이티브 computer-use 툴링과 83.0% OSWorld-Verified | computer use를 프리뷰로 취급하고 중요한 작업에는 승인 게이트를 유지하세요. |
| Grounded 어시스턴트 | 기본 모델은 Search, Maps, 파일 검색, URL 컨텍스트를 지원합니다. | 각 요청에 필요한 도구만 활성화하고 결과 토큰 사용량을 추적하세요. |
Gemini 3.6 Flash 대 Gemini 3.5 Flash
Gemini 3.6 Flash는 더 큰 컨텍스트를 제공하는 대체 모델이라기보다 Gemini 3.5 Flash의 직접적인 효율성 업그레이드입니다. 두 모델 모두 동일한 1M 컨텍스트 클래스와 기본 medium thinking 수준을 유지합니다. 차이는 작업 효율성에 있습니다. Google은 Artificial Analysis 워크로드에서 출력 토큰이 17% 더 적고, 추론 턴과 도구 호출이 더 적으며, 코딩, 머신러닝 엔지니어링, computer use, 장문 컨텍스트 검색에서 더 강력한 결과를 보고했습니다.
공식 입력 요금은 1M 토큰당 $1.50로 유지되며, 공식 출력 요금은 $9.00에서 $7.50로 인하됩니다. GPTProto에서 Gemini 3.6 Flash는 입력 1M 토큰당 $0.90, 출력 1M 토큰당 $4.50입니다. Gemini 3.5 Flash는 현재 $0.90 및 $5.40입니다. 새로운 에이전트 또는 멀티모달 시스템에는 3.6 Flash가 더 나은 기본값입니다. 3.5 Flash는 이미 그 동작을 검증했고 마이그레이션을 회귀 테스트할 시간이 필요할 때만 유지하세요.
| 지표 | Gemini 3.6 Flash | Gemini 3.5 Flash |
|---|---|---|
| 컨텍스트 창 | 1,048,576 | 1,048,576 |
| 최대 출력 | 65,536 | 65,536 |
| 기본 thinking | Medium | Medium |
| Google 표준 입력/출력(1M당) | $1.50 / $7.50 | $1.50 / $9.00 |
| GPTProto 입력/출력(1M당) | $0.90 / $4.50 | $0.90 / $5.40 |
| DeepSWE v1.1 | 49.0% | 37.0% |
| MLE-Bench | 63.9% | 49.7% |
| OSWorld-Verified | 83.0% | 78.4% |
| GDM-MRCR v2 at 1M | 54.0% | 26.6% |
위 벤치마크 수치는 제공업체가 보고한 것입니다. 후보를 선택할 때 참고하고, 프로덕션 트래픽을 전환하기 전에 자체 프롬프트, 도구, 성공 기준으로 두 모델을 모두 실행해 보세요.
마이그레이션 전에 확인해야 할 API 변경 사항
애플리케이션이 Google 네이티브 Interactions API를 사용한다면 3.6 Flash로의 마이그레이션을 단순히 모델 이름 교체로 취급하지 마세요. Google은 최신 모델에 대해 여러 생성 및 대화 필드를 변경했습니다:
- 모델 ID를
gemini-3.6-flash로 변경합니다. - 생성 구성에서
temperature,top_p,top_k를 제거합니다. - 다음과 같이 변경합니다.
thinking_budget→thinking_level로 대체합니다. 지원되는 값은minimal,low,medium,high입니다. - 다음 항목
candidate_count는 Gemini 3.x에서 지원되지 않으므로 제거합니다. - 프리필된 모델 턴을 보내지 마세요. 다중 턴 Interactions API 세션에서는 서버 측
previous_interaction_id를 사용하세요. - 모든 트래픽을 전환하기 전에 도구 스키마, 구조화된 출력, 파일 처리를 회귀 테스트하세요.
GPTProto의 OpenAI 호환 요청 형식을 사용한다면 Google 네이티브 필드를 직접 복사하지 말고 이 페이지의 Quick Start 및 GPTProto 문서를 따르세요. 실질적인 장점은 하나의 GPTProto API 키와 잔액으로 Gemini 3.5 Flash, GPT-5.6 Luna, Claude Opus 4.8, Kimi K3, 그리고 200여 개의 다른 모델도 호출할 수 있어 별도의 제공업체 계정을 열지 않고도 동일한 평가 세트를 실행할 수 있습니다.







