1M 토큰 컨텍스트 창
최대 1,048,576개의 입력 토큰을 처리하고 최대 65,536개의 출력 토큰을 생성할 수 있습니다. 이 용량은 대규모 문서 세트, 긴 대본, 보고서, 저장소, 상세한 하위 에이전트 핸드오프를 지원합니다.
curl --request POST "https://gptproto.com/v1/chat/completions" \
--header "Authorization: Bearer $GPTPROTO_API_KEY" \
--header "Content-Type: application/json" \
--data '{
"model": "gemini-3.5-flash-lite",
"messages": [
{
"role": "user",
"content": "Hello"
}
]
}'Chat, coding agents & document work. Priced per 1M tokens — input, cached input and output are billed separately. GPTProto is 40% below official rates.
Google · ≈ 148M tokens/mo (48M cached)
OpenRouter costs include its ~5.5% credit purchase fee. GPTProto applies a per-model discount (10–30% off) and your bonus credits are also spent at discounted rates — savings compound. Estimates assume a 60% cache hit rate.
GPTProto에서 Google의 가장 빠르고 비용 효율적인 Gemini 3.5 모델을 이용하세요. 입력 토큰 100만 개당 $0.18, 출력 토큰 100만 개당 $1.50으로 Google 표준 API 요금보다 40% 저렴합니다. 하나의 GPTProto 키로 200개 이상의 텍스트, 이미지, 비디오, 오디오 모델에 걸쳐 사용량을 분산하세요.
최대 1,048,576개의 입력 토큰을 처리하고 최대 65,536개의 출력 토큰을 생성할 수 있습니다. 이 용량은 대규모 문서 세트, 긴 대본, 보고서, 저장소, 상세한 하위 에이전트 핸드오프를 지원합니다.
Google은 Artificial Analysis 테스트 기준으로 초당 약 350개의 출력 토큰을 보고합니다. Flash-Lite는 최대 추론 깊이보다 처리량과 응답 시간이 더 중요한 워크로드를 위해 설계되었습니다.
텍스트, 이미지, 비디오, 오디오, PDF 파일을 보낼 수 있습니다. 모델은 텍스트를 반환하므로 문서 파싱, 미디어 이해, 전사 분석, 요약, 멀티모달 데이터 추출에 적합합니다.
추출, 라우팅, 도구 기반 에이전트를 위해 스키마 제약 출력과 함수 호출을 사용하세요. 배포 전에 코드 실행, 파일 검색, URL 컨텍스트, 검색 근거의 경로별 가용성을 확인하세요.
Gemini 3.5 Flash-Lite는 Google의 일반 공급(GA) 효율성 모델로, 대규모 에이전트 작업, 번역, 문서 처리, 분류, 구조화된 추출에 사용됩니다. 2026년 7월 21일에 출시된 이 모델은 Gemini 3.5 시리즈 중 가장 빠른 모델이며, 지연 시간, 처리량, API 비용이 최대 추론 깊이보다 더 중요한 제약 조건인 애플리케이션에 적합합니다.
Google Gemini 3.5 Flash-Lite API는 1,048,576토큰 입력 창 내에서 텍스트, 이미지, 비디오, 오디오, PDF 파일을 허용합니다. 최대 65,536토큰의 텍스트 응답을 생성하며, Google 네이티브 API에서 thinking(추론), 구조화된 출력, 함수 호출, 캐싱, 코드 실행, 파일 검색, URL 컨텍스트, 검색 근거 제공을 지원합니다. 이미지나 오디오는 생성하지 않으며 Live API도 지원하지 않습니다. 공급업체별 도구의 사용 가능 여부는 OpenAI 호환 게이트웨이를 통해 달라질 수 있으므로, Google 네이티브 확장 기능에 의존하기 전에 GPTProto 문서를 확인하세요.
| 사양 | Gemini 3.5 Flash-Lite |
| 공급업체 | |
| 안정적인 모델 ID | gemini-3.5-flash-lite |
| 출시 단계 | 일반 공급(GA) |
| 출시일 | 2026년 7월 21일 |
| 입력 한도 | 1,048,576토큰 |
| 최대 출력 | 65,536토큰 |
| 허용되는 입력 | 텍스트, 이미지, 비디오, 오디오, PDF |
| 출력 | 텍스트 |
| 핵심 기능 | thinking(추론), 구조화된 출력, 함수 호출, 캐싱 |
| 지원되지 않는 기능 | 이미지 생성, 오디오 생성, Live API, 튜닝 |
Flash-Lite는 애플리케이션이 집중된 작업을 대량으로 반복할 때 가장 유용합니다. 더 뛰어난 오케스트레이터 아래에서 저비용 워커 모델로 사용하거나, 결정 범위가 좁고 검증하기 쉬운 전체 워크플로를 처리할 수 있습니다.
분류 및 라우팅: 지원 티켓에 라벨을 지정하고, 의도를 감지하고, 문서를 분류하거나, 모든 요청에 프론티어 모델 비용을 지불하지 않고 다음 도구를 선택하세요.
문서 파싱 및 JSON 추출: PDF, 인보이스, 영수증, 보고서, 제품 기록을 읽고 정의된 스키마에 맞는 필드를 반환합니다.
번역 및 요약: 단가가 총 운영 비용에 영향을 미치는 대량의 다국어 텍스트, 회의 기록, 리뷰, 카탈로그 콘텐츠를 처리합니다.
멀티모달 검토: 이미지, 녹음된 오디오, 비디오, PDF에서 텍스트와 사실을 추출하면서 출력을 텍스트 기반 다운스트림 워크플로에 유지합니다.
특화 서브에이전트: 검색, 정보 검색(retrieval), 코드 편집, 검증, 도구 호출을 전문화된 워커에 위임하고, 더 강력한 모델은 계획이나 최종 검토를 위해 남겨 둡니다.
이 모델은 하나의 어려운 요청에 최고 수준의 코딩 정확도, 장기 계획, 또는 도구 오류로부터의 반복적인 복구가 필요할 때는 덜 적합합니다. 이러한 워크로드에서는 토큰 가격만으로 선택하기 전에 동일한 평가 세트로 Gemini 3.5 Flash 또는 Gemini 3.6 Flash를 테스트하세요.
Gemini 3.5 Flash-Lite는 Google 네이티브 API에서 구성 가능한 thinking(추론)을 지원합니다. Google은 지연 시간에 민감한 분류, 라우팅, JSON 추출에 MINIMAL을 권장합니다. 이 설정은 기본값이며 예측 가능한 작업에서 불필요한 추론 토큰을 제한합니다.
코드를 작성하거나, 터미널 명령을 실행하거나, 여러 API를 호출하거나, 중간 오류에서 복구해야 하는 서브에이전트에는 MEDIUM 또는 HIGH를 사용하세요. thinking 수준을 높이면 다단계 실행이 개선될 수 있지만 출력 토큰 사용량과 응답 시간도 늘어납니다. GPTProto의 OpenAI 호환 엔드포인트를 통해 모델을 호출하는 경우, 공급업체별 필드를 보내기 전에 매핑된 thinking 매개변수에 대한 최신 문서를 확인하세요.
Gemini 3.5 Flash-Lite와 Gemini 3.5 Flash는 1,048,576토큰 컨텍스트 창과 65,536토큰 최대 출력을 공유하지만, 서로 다른 워크로드 경제성을 위해 설계되었습니다. Flash-Lite는 처리량과 낮은 단가를 우선시하고, Flash는 더 복잡한 코딩, 에이전트 계획, 지식 작업을 대상으로 합니다.
| 비교 | Gemini 3.5 Flash-Lite | Gemini 3.5 Flash |
| 최적 용도 | 대규모 서브에이전트, 추출, 번역, 문서 파싱 | 복잡한 코딩, 에이전트 계획, 심층 지식 작업 |
| 모델 포지셔닝 | 3.5 시리즈 중 가장 빠르고 비용이 가장 낮은 모델 | 더 강력한 Flash 등급 모델 |
| 입력 컨텍스트 | 1,048,576토큰 | 1,048,576토큰 |
| 최대 출력 | 65,536토큰 | 65,536토큰 |
| Google 표준 입력 가격 | 1M 토큰당 $0.30 | 1M 토큰당 $1.50 |
| Google 표준 출력 가격 | 1M 토큰당 $2.50 | 1M 토큰당 $9.00 |
| GPTProto Flash-Lite 가격 | 1M 토큰당 입력 $0.18 / 출력 $1.50 | Gemini 3.5 Flash 모델 페이지 참조 |
Google 표준 요금 기준으로 Flash-Lite는 Gemini 3.5 Flash보다 입력 비용이 80%, 출력 비용이 약 72% 저렴합니다. 요청량과 응답 시간이 간헐적인 재시도 비용보다 중요할 때 Flash-Lite를 선택하세요. 더 적은 수의 어려운 작업에서 최저 토큰 요금보다 첫 시도 품질이 더 중요할 때는 Flash를 선택하세요.
GPTProto 는 200개 모델 이상에 사용하는 동일한 계정, API 키, 잔액으로 Gemini 3.5 Flash-Lite API에 액세스할 수 있게 해 줍니다. 이렇게 하면 애플리케이션이 단순 추출은 Flash-Lite로, 복잡한 추론은 Gemini 3.5 Flash 또는 Gemini 3.6 Flash로, 미디어 작업은 별도의 이미지, 비디오, 오디오 모델로 라우팅할 때 계정 및 결제가 분산되는 문제를 줄일 수 있습니다.
기존 OpenAI 호환 애플리케이션의 경우 주변 클라이언트 구조를 유지하고 GPTProto 문서에 표시된 엔드포인트, 인증 방법, 모델 문자열을 사용하세요. 모든 Google 네이티브 필드가 일대일로 매핑된다고 가정하지 마세요. 프로덕션 트래픽을 전환하기 전에 thinking 제어, 캐싱, 근거 제공(grounding), 파일 처리, 도구 스키마, 스트리밍 동작을 테스트하세요.
Google은 이전 Gemini 모델에서 마이그레이션할 때 영향을 줄 수 있는 여러 가지 호환성 차이점을 문서화하고 있습니다. 사용자 지정 temperature, top-K, top-P 값은 무시될 수 있습니다. 사용자 지정 frequency 및 presence 페널티는 오류를 반환할 수 있습니다. 마지막 대화 턴이 model 역할을 가진 요청도 지원되지 않습니다.
대규모 워크플로를 전환하기 전에 대표적인 테스트 세트를 재실행하고 JSON 스키마 준수, 도구 호출 완료, 토큰 사용량, 지연 시간, 재시도 빈도를 확인하세요. 비용 효율적인 Gemini 3.5 Flash-Lite API 배포는 토큰당 비용만이 아니라 성공한 작업당 비용으로 평가해야 합니다. 이는 특히 다단계 에이전트에서 중요합니다. thinking 수준이 너무 낮으면 도구 시퀀스가 너무 일찍 중단될 수 있기 때문입니다.
이 모델과 관련된 가이드, 비교, 업데이트입니다.
모든 글
안전 제한에 막히는 데 지치셨나요? 창작의 자유를 되찾을 최고의 무제한 AI 이미지 생성기를 찾아보세요. 주요 도구를 비교하고 지금 바로 창작을 시작하세요.

Gemini 3.6 Flash와 Gemini 3.5 Flash-Lite의 가격, 속도, 벤치마크 및 사용 사례를 비교하세요. 어떤 새로운 Google 모델이 AI 워크로드에 적합한지 알아보세요.

코딩, API 액세스, 컨텍스트, 가격, 오픈 가중치 측면에서 Qwen 3.8 Max와 GLM 5.2를 비교하세요. 2026년 프로덕션 환경에서 어떤 모델이 더 안전한지 알아보세요.

Kimi K3는 오픈소스인가요? 정말 GPT-5.6과 Fable 5에 근접한 모델인가요? 1M 컨텍스트, API 가격, 독립 벤치마크, Reddit 반응을 살펴보세요.