Gemini 3.5 Flash-Lite는 Google의 일반 공급(GA) 효율성 모델로, 대규모 에이전트 작업, 번역, 문서 처리, 분류, 구조화된 추출에 사용됩니다. 2026년 7월 21일에 출시된 이 모델은 Gemini 3.5 시리즈 중 가장 빠른 모델이며, 지연 시간, 처리량, API 비용이 최대 추론 깊이보다 더 중요한 제약 조건인 애플리케이션에 적합합니다.
Google Gemini 3.5 Flash-Lite API는 1,048,576토큰 입력 창 내에서 텍스트, 이미지, 비디오, 오디오, PDF 파일을 허용합니다. 최대 65,536토큰의 텍스트 응답을 생성하며, Google 네이티브 API에서 thinking(추론), 구조화된 출력, 함수 호출, 캐싱, 코드 실행, 파일 검색, URL 컨텍스트, 검색 근거 제공을 지원합니다. 이미지나 오디오는 생성하지 않으며 Live API도 지원하지 않습니다. 공급업체별 도구의 사용 가능 여부는 OpenAI 호환 게이트웨이를 통해 달라질 수 있으므로, Google 네이티브 확장 기능에 의존하기 전에 GPTProto 문서를 확인하세요.
| 사양 | Gemini 3.5 Flash-Lite |
| 공급업체 | |
| 안정적인 모델 ID | gemini-3.5-flash-lite |
| 출시 단계 | 일반 공급(GA) |
| 출시일 | 2026년 7월 21일 |
| 입력 한도 | 1,048,576토큰 |
| 최대 출력 | 65,536토큰 |
| 허용되는 입력 | 텍스트, 이미지, 비디오, 오디오, PDF |
| 출력 | 텍스트 |
| 핵심 기능 | thinking(추론), 구조화된 출력, 함수 호출, 캐싱 |
| 지원되지 않는 기능 | 이미지 생성, 오디오 생성, Live API, 튜닝 |
Gemini 3.5 Flash-Lite의 주요 사용 사례
Flash-Lite는 애플리케이션이 집중된 작업을 대량으로 반복할 때 가장 유용합니다. 더 뛰어난 오케스트레이터 아래에서 저비용 워커 모델로 사용하거나, 결정 범위가 좁고 검증하기 쉬운 전체 워크플로를 처리할 수 있습니다.
-
분류 및 라우팅: 지원 티켓에 라벨을 지정하고, 의도를 감지하고, 문서를 분류하거나, 모든 요청에 프론티어 모델 비용을 지불하지 않고 다음 도구를 선택하세요.
-
문서 파싱 및 JSON 추출: PDF, 인보이스, 영수증, 보고서, 제품 기록을 읽고 정의된 스키마에 맞는 필드를 반환합니다.
-
번역 및 요약: 단가가 총 운영 비용에 영향을 미치는 대량의 다국어 텍스트, 회의 기록, 리뷰, 카탈로그 콘텐츠를 처리합니다.
-
멀티모달 검토: 이미지, 녹음된 오디오, 비디오, PDF에서 텍스트와 사실을 추출하면서 출력을 텍스트 기반 다운스트림 워크플로에 유지합니다.
-
특화 서브에이전트: 검색, 정보 검색(retrieval), 코드 편집, 검증, 도구 호출을 전문화된 워커에 위임하고, 더 강력한 모델은 계획이나 최종 검토를 위해 남겨 둡니다.
이 모델은 하나의 어려운 요청에 최고 수준의 코딩 정확도, 장기 계획, 또는 도구 오류로부터의 반복적인 복구가 필요할 때는 덜 적합합니다. 이러한 워크로드에서는 토큰 가격만으로 선택하기 전에 동일한 평가 세트로 Gemini 3.5 Flash 또는 Gemini 3.6 Flash를 테스트하세요.
작업 복잡도에 따른 Thinking 수준 선택
Gemini 3.5 Flash-Lite는 Google 네이티브 API에서 구성 가능한 thinking(추론)을 지원합니다. Google은 지연 시간에 민감한 분류, 라우팅, JSON 추출에 MINIMAL을 권장합니다. 이 설정은 기본값이며 예측 가능한 작업에서 불필요한 추론 토큰을 제한합니다.
코드를 작성하거나, 터미널 명령을 실행하거나, 여러 API를 호출하거나, 중간 오류에서 복구해야 하는 서브에이전트에는 MEDIUM 또는 HIGH를 사용하세요. thinking 수준을 높이면 다단계 실행이 개선될 수 있지만 출력 토큰 사용량과 응답 시간도 늘어납니다. GPTProto의 OpenAI 호환 엔드포인트를 통해 모델을 호출하는 경우, 공급업체별 필드를 보내기 전에 매핑된 thinking 매개변수에 대한 최신 문서를 확인하세요.
Gemini 3.5 Flash-Lite와 Gemini 3.5 Flash 비교
Gemini 3.5 Flash-Lite와 Gemini 3.5 Flash는 1,048,576토큰 컨텍스트 창과 65,536토큰 최대 출력을 공유하지만, 서로 다른 워크로드 경제성을 위해 설계되었습니다. Flash-Lite는 처리량과 낮은 단가를 우선시하고, Flash는 더 복잡한 코딩, 에이전트 계획, 지식 작업을 대상으로 합니다.
| 비교 | Gemini 3.5 Flash-Lite | Gemini 3.5 Flash |
| 최적 용도 | 대규모 서브에이전트, 추출, 번역, 문서 파싱 | 복잡한 코딩, 에이전트 계획, 심층 지식 작업 |
| 모델 포지셔닝 | 3.5 시리즈 중 가장 빠르고 비용이 가장 낮은 모델 | 더 강력한 Flash 등급 모델 |
| 입력 컨텍스트 | 1,048,576토큰 | 1,048,576토큰 |
| 최대 출력 | 65,536토큰 | 65,536토큰 |
| Google 표준 입력 가격 | 1M 토큰당 $0.30 | 1M 토큰당 $1.50 |
| Google 표준 출력 가격 | 1M 토큰당 $2.50 | 1M 토큰당 $9.00 |
| GPTProto Flash-Lite 가격 | 1M 토큰당 입력 $0.18 / 출력 $1.50 | Gemini 3.5 Flash 모델 페이지 참조 |
Google 표준 요금 기준으로 Flash-Lite는 Gemini 3.5 Flash보다 입력 비용이 80%, 출력 비용이 약 72% 저렴합니다. 요청량과 응답 시간이 간헐적인 재시도 비용보다 중요할 때 Flash-Lite를 선택하세요. 더 적은 수의 어려운 작업에서 최저 토큰 요금보다 첫 시도 품질이 더 중요할 때는 Flash를 선택하세요.
GPTProto를 통한 Gemini 3.5 Flash-Lite 사용
GPTProto 는 200개 모델 이상에 사용하는 동일한 계정, API 키, 잔액으로 Gemini 3.5 Flash-Lite API에 액세스할 수 있게 해 줍니다. 이렇게 하면 애플리케이션이 단순 추출은 Flash-Lite로, 복잡한 추론은 Gemini 3.5 Flash 또는 Gemini 3.6 Flash로, 미디어 작업은 별도의 이미지, 비디오, 오디오 모델로 라우팅할 때 계정 및 결제가 분산되는 문제를 줄일 수 있습니다.
기존 OpenAI 호환 애플리케이션의 경우 주변 클라이언트 구조를 유지하고 GPTProto 문서에 표시된 엔드포인트, 인증 방법, 모델 문자열을 사용하세요. 모든 Google 네이티브 필드가 일대일로 매핑된다고 가정하지 마세요. 프로덕션 트래픽을 전환하기 전에 thinking 제어, 캐싱, 근거 제공(grounding), 파일 처리, 도구 스키마, 스트리밍 동작을 테스트하세요.
기존 Gemini 워크로드의 마이그레이션 참고 사항
Google은 이전 Gemini 모델에서 마이그레이션할 때 영향을 줄 수 있는 여러 가지 호환성 차이점을 문서화하고 있습니다. 사용자 지정 temperature, top-K, top-P 값은 무시될 수 있습니다. 사용자 지정 frequency 및 presence 페널티는 오류를 반환할 수 있습니다. 마지막 대화 턴이 model 역할을 가진 요청도 지원되지 않습니다.
대규모 워크플로를 전환하기 전에 대표적인 테스트 세트를 재실행하고 JSON 스키마 준수, 도구 호출 완료, 토큰 사용량, 지연 시간, 재시도 빈도를 확인하세요. 비용 효율적인 Gemini 3.5 Flash-Lite API 배포는 토큰당 비용만이 아니라 성공한 작업당 비용으로 평가해야 합니다. 이는 특히 다단계 에이전트에서 중요합니다. thinking 수준이 너무 낮으면 도구 시퀀스가 너무 일찍 중단될 수 있기 때문입니다.











