마지막 수정
Gemini 3.6 Flash·3.5 Flash-Lite 공개: 어떤 작업에 무엇을 쓸까
Gemini 3.6 Flash와 3.5 Flash-Lite의 가격, 토큰 한도, 도구 지원과 벤치마크를 비교하고 에이전트·대량 문서 작업별 선택 기준을 정리했습니다.

결론 먼저
복잡한 코딩·문서 분석·computer use에는 Gemini 3.6 Flash를, 대량 추출·분류·요약에는 3.5 Flash-Lite를 먼저 시험할 만합니다. 3.5 Flash Cyber는 일반 API 모델이 아니라 제한 공개된 CodeMender용 보안 모델입니다.
- 실험 환경
- 2026년 7월 21일 Google 발표문, 7월 22일 Gemini API 모델 사양·가격 문서와 Google DeepMind CodeMender 자료를 대조했습니다. 아직 Daejin Lab 워크로드로 직접 API 비교를 실행하지 않았습니다.
- 누구에게 유용한가
- Gemini API로 코딩 에이전트나 대량 문서 처리 파이프라인을 만들고 있으며, 모델 품질과 호출 비용을 함께 판단해야 하는 개발자와 운영자
확인한 자료와 한계
- Google: Gemini 3.6 Flash, 3.5 Flash-Lite, 3.5 Flash Cyber 발표
- Google AI for Developers 모델 사양과 가격 문서
- Google DeepMind CodeMender 및 Flash Cyber 발표
성능 수치는 Google과 외부 벤치마크 제공자의 공개 결과이며 직접 재현하지 않았습니다. 실제 비용은 thinking 토큰, 도구 호출, 재시도와 캐시 사용에 따라 달라집니다.
이 글에서 다루는 핵심 3가지
세 모델 이름만 놓고 보면 꽤 헷갈립니다. 3.6 Flash가 나왔는데 3.5 Flash-Lite도 함께 공개됐고, Flash Cyber는 일반 Gemini API에서 고르는 모델인지부터 분명하지 않았습니다.
2026년 7월 21일 발표문과 Gemini API 문서를 나란히 놓고 보니 구분은 명확했습니다. 3.6 Flash는 복잡한 작업을 맡는 주력 모델입니다. 3.5 Flash-Lite는 같은 작업을 많이 반복할 때 쓰는 저비용 모델이고, Flash Cyber는 CodeMender 안에서 취약점을 찾고 고치는 제한 공개 모델입니다.
먼저 확인한 숫자는 입력·출력 가격과 출력 토큰 수였습니다. 에이전트는 답을 한 번 만들고 끝나지 않습니다. 계획을 세우고, 도구를 부르고, 결과를 읽은 뒤 실패하면 다시 실행합니다. 한 번의 답변 가격보다 작업을 마칠 때까지 쓴 토큰과 호출 횟수가 더 중요합니다.
이 글은 발표 당일 공개 자료를 비교한 기록입니다. 아직 Daejin Lab의 저장소나 문서로 두 모델을 직접 돌려보지는 않았습니다. 아래 선택 기준은 확정 판정이 아니라 첫 테스트 모델을 고르기 위한 기준으로 봐야 합니다.
결론 먼저
| 하려는 일 | 우선 볼 모델 | 확인한 이유 |
|---|---|---|
| 저장소 수정, 복잡한 코딩, 긴 문서 분석 | Gemini 3.6 Flash | 코딩·지식 작업 개선, 불필요한 수정과 실행 반복 감소를 강조 |
| 브라우저·데스크톱 조작 에이전트 | Gemini 3.6 Flash | API 모델 문서에서 computer use 지원을 Preview로 명시 |
| 영수증·PDF·상품 데이터 대량 추출 | Gemini 3.5 Flash-Lite | 입력 $0.30, 출력 $2.50, 대량 처리와 낮은 지연에 초점 |
| 분류·요약·검색용 하위 에이전트 여러 개 | Gemini 3.5 Flash-Lite | thinking 수준을 낮춰 비용·지연을 줄이거나 높여 다단계 작업 가능 |
| 취약점 탐지와 패치 자동화 | Gemini 3.5 Flash Cyber | 일반 API가 아닌 CodeMender 제한 공개 프로그램 |
현재 기준은 간단합니다. 실패했을 때 되돌리는 비용이 크면 3.6 Flash, 호출량이 많고 결과를 자동 검증할 수 있으면 3.5 Flash-Lite부터 시험합니다. Flash Cyber는 일반 사용자가 선택할 모델 목록에서 뺐습니다.
세 모델은 무엇이 다른가
| 항목 | Gemini 3.6 Flash | Gemini 3.5 Flash-Lite | Gemini 3.5 Flash Cyber |
|---|---|---|---|
| 성격 | 복잡한 에이전트·코딩용 주력 모델 | 대량·저지연 처리 모델 | 보안 취약점 탐지·검증·패치 특화 |
| 일반 API 모델 ID | gemini-3.6-flash |
gemini-3.5-flash-lite |
일반 공개 API 없음 |
| 입력 가격 | $1.50 / 100만 토큰 | $0.30 / 100만 토큰 | 공개 가격 없음 |
| 출력 가격 | $7.50 / 100만 토큰 | $2.50 / 100만 토큰 | 공개 가격 없음 |
| 입력 한도 | 1,048,576 토큰 | 1,048,576 토큰 | 공개 사양 없음 |
| 출력 한도 | 65,536 토큰 | 65,536 토큰 | 공개 사양 없음 |
| computer use | Preview 지원 | 문서 간 표기 불일치 | CodeMender 내부 운영 |
| 공개 상태 | 안정 버전(Stable) | 안정 버전(Stable) | 정부·신뢰 파트너 대상 제한 파일럿 |
가격은 유료 등급의 텍스트·이미지·영상·오디오 입력 기준입니다. 두 일반 API 모델 모두 텍스트, 이미지, 영상, 오디오, PDF를 입력으로 받고 텍스트를 출력합니다. 캐싱, 코드 실행, 파일 검색, 함수 호출, 검색 grounding, 구조화 출력과 thinking도 지원합니다.
3.6 Flash는 작업 루프를 줄이는 쪽에 초점을 맞췄다
Google은 3.6 Flash가 3.5 Flash보다 Artificial Analysis Index 기준 출력 토큰을 17% 적게 사용한다고 설명합니다. 일부 DeepSWE 측정에서는 감소 폭이 최대 65%였다고 적었습니다. 다단계 작업에서도 reasoning 단계와 도구 호출 수를 줄였다는 설명이 붙었습니다.
에이전트 운영에서는 이 차이가 큽니다. 출력 단가가 낮아도 같은 파일을 여러 번 고치고 필요 없는 도구를 반복 호출하면 작업당 비용은 올라갑니다. 3.6 Flash는 완료까지 필요한 실행 루프를 줄이는 것에 초점을 맞췄습니다.
Google이 공개한 비교 수치는 다음과 같습니다.
| 평가 | 3.6 Flash | 3.5 Flash |
|---|---|---|
| DeepSWE | 49% | 37% |
| MLE Bench | 63.9% | 49.7% |
| OSWorld-Verified | 83.0% | 78.4% |
| GDPval-AA v2 | 1421 | 1349 |
DeepSWE에서는 원하지 않은 코드 변경과 실행 반복을 줄였다고 설명합니다. OSWorld-Verified 상승은 computer use 작업과 연결됩니다. 현재 Gemini API 모델 문서에서도 3.6 Flash의 computer use를 Preview 지원으로 표시합니다.
다만 이 표는 제 저장소에서 재현한 결과가 아닙니다. 같은 모델도 프롬프트, thinking 수준, 도구 정의, 컨텍스트 크기와 에이전트 실행기가 달라지면 실제 완료율이 크게 달라질 수 있습니다.
3.5 Flash-Lite는 대량 반복 작업용이다
3.5 Flash-Lite는 3.5 계열에서 가장 빠르고 저렴한 모델입니다. Google 발표문은 Artificial Analysis 측정 기준 초당 350개 출력 토큰을 제시합니다. 유료 API 가격은 입력 100만 토큰당 $0.30, thinking을 포함한 출력 100만 토큰당 $2.50입니다.
입력 한도는 3.6 Flash와 같은 1,048,576 토큰이고 thinking과 함수 호출, 구조화 출력도 지원합니다. Google은 agentic search, 문서 처리, 상품 정보 추출, 영수증 번역·요약 같은 대량 작업을 예로 들었습니다.
이전 3.1 Flash-Lite와 비교한 공개 수치도 폭이 큽니다.
| 평가 | 3.5 Flash-Lite | 3.1 Flash-Lite |
|---|---|---|
| Terminal-Bench 2.1 | 54% | 31% |
| GDM-MRCR v2 | 72.2% | 60.1% |
| GDPval-AA v2 | 1140 | 642 |
공식 발표에는 3.6 Flash를 상위 에이전트로 두고 3.5 Flash-Lite가 웹 디자인 후보 25개를 만드는 예시가 나옵니다. 판단과 검수는 3.6 Flash에 맡기고, 반복 생성은 Flash-Lite에 맡기는 식입니다.
computer use 지원은 실제 API에서 다시 확인해야 한다
공식 자료 사이에 한 가지 불일치가 있습니다.
Google 발표문은 3.5 Flash-Lite에 computer use가 내장됐다고 설명합니다. 하지만 2026년 7월 22일 확인한 Gemini API 모델 사양 페이지는 Computer use: Not supported로 표시합니다. 같은 페이지에서 3.6 Flash는 **Supported (Preview)**로 표시됩니다.
문서 반영 시차인지, 특정 제품이나 API에서만 지원하는지는 현재 공개 페이지로 확정하기 어렵습니다. 따라서 Flash-Lite의 computer use를 전제로 프로덕션 구조를 만들면 안 됩니다. 모델 목록과 실제 API 호출에서 도구 지원을 확인한 뒤 사용해야 합니다.
신모델 공개 직후에는 발표문과 API 문서의 반영 시점이 어긋날 수 있습니다. 발표문은 제품 방향을 설명하고, API 사양은 지금 호출할 수 있는 기능을 적습니다. 운영 코드는 API 사양을 기준으로 잡고 작은 요청으로 다시 확인하는 편이 안전합니다.
가격 차이는 작업량이 커질수록 선명해진다
입력 100만 토큰과 출력 20만 토큰을 처리하는 가상의 작업을 계산해봤습니다. 캐시, Batch API, 무료 등급과 별도 도구 비용은 제외했습니다.
| 모델 | 입력 비용 | 출력 비용 | 합계 |
|---|---|---|---|
| Gemini 3.6 Flash | $1.50 | $1.50 | $3.00 |
| Gemini 3.5 Flash-Lite | $0.30 | $0.50 | $0.80 |
같은 토큰 양이면 Flash-Lite가 $2.20 저렴합니다. 3.6 Flash가 재시도와 불필요한 출력을 줄여준다면 실제 차이는 이 표보다 작아질 수 있습니다. 반대로 결과를 쉽게 검증할 수 있는 추출·분류 작업이라면 Flash-Lite의 낮은 단가가 그대로 이점이 됩니다.
그래서 모델 선택 전에 아래 값을 먼저 남겨야 합니다.
성공한 작업 수
작업당 입력·출력·thinking 토큰
도구 호출 횟수
재시도 횟수
사람이 수정한 항목 수
전체 처리 시간
토큰 단가만 비교하면 에이전트가 여러 번 실패한 비용을 놓칩니다. 벤치마크 점수만 비교하면 단순 작업에 비싼 모델을 계속 쓰게 됩니다.
Flash Cyber는 일반 보안 도우미가 아니다
Gemini 3.5 Flash Cyber는 3.5 Flash를 기반으로 보안 취약점을 찾고 고치도록 특화한 모델입니다. CodeMender는 여러 Flash Cyber 에이전트를 함께 실행해 탐지, 검증, 패치 결과를 하나의 보고서로 합칩니다.
접근 범위가 가장 중요한 조건입니다. Google은 이 모델을 정부와 신뢰할 수 있는 파트너에게 CodeMender를 통해 제공하는 제한 파일럿으로 운영한다고 밝혔습니다. 일반 Gemini API에서 모델 ID를 골라 호출하는 제품이 아닙니다.
보안 모델은 공격과 방어에 함께 쓰일 수 있습니다. Google도 이 이중 용도 때문에 공개 범위를 제한했다고 설명합니다. 따라서 현재 단계에서 Flash Cyber를 개인 프로젝트의 자동 보안 리뷰 모델로 계획하거나, 공개 가격을 추정해서는 안 됩니다.
지금 어떤 모델부터 시험할까
| 상황 | 먼저 시험할 모델 | 측정할 항목 |
|---|---|---|
| 여러 파일을 수정하고 테스트까지 수행 | 3.6 Flash | 불필요한 변경, 테스트 통과율, 도구 호출 반복 |
| 긴 PDF에서 표와 필드를 추출 | 3.5 Flash-Lite | 누락률, JSON 형식 오류, 문서당 비용 |
| 브라우저에서 반복 작업 수행 | 3.6 Flash | computer use 성공률, 확인 단계, 잘못된 클릭 |
| 검색 결과를 대량 분류·요약 | 3.5 Flash-Lite | 처리량, 중복, 근거 링크 보존 |
| 중요한 최종 보고서 작성 | 3.6 Flash | 근거 일치, 계산 오류, 사람 수정 시간 |
| 취약점 자동 패치 | 현재 일반 사용 불가 | Flash Cyber 공개 범위가 바뀐 뒤 재검토 |
직접 비교한다면 두 모델에 같은 작업을 넣고 정답률보다 완료 비용을 봐야 합니다. 짧은 코딩 수정, PDF 표 추출, 구조화 JSON 생성, 함수 호출, computer use를 따로 측정해야 결과가 섞이지 않습니다. 출력 토큰과 도구 호출 수까지 남겨야 Google이 강조한 효율 개선을 확인할 수 있습니다.
현재 결론
세 모델을 한 줄로 줄이면 이렇습니다. 3.6 Flash는 복잡한 판단과 실행, 3.5 Flash-Lite는 대량 반복 작업, Flash Cyber는 제한된 보안 환경용입니다.
API를 바로 고른다면 복잡한 코딩·문서 분석·computer use는 gemini-3.6-flash, 대량 추출·분류·요약은 gemini-3.5-flash-lite부터 시작할 만합니다. 두 모델 모두 100만 토큰이 넘는 입력 한도와 thinking, 함수 호출을 지원하지만 가격과 computer use 지원이 다릅니다.
남은 질문은 직접 돌려봐야 답할 수 있습니다. 공개 벤치마크의 개선이 한국어 문서와 실제 저장소에서도 유지되는지, 출력 토큰 17% 감소가 작업 전체 비용을 얼마나 줄이는지, Flash-Lite의 computer use가 실제 API에서 언제 열리는지는 아직 모릅니다. 지금은 기존 파이프라인을 통째로 바꾸기보다 작업 하나를 골라 두 모델의 완료 비용부터 비교하는 것이 맞습니다.
같이 읽을 글
- AI 코딩 도구 비용이 실제로 커지는 순간
- AI 에이전트에게 잘 맞는 일과 맡기기 어려운 일
- 짧은 작업에서도 AI 코딩 에이전트에 필요한 안전장치
- 로컬 AI와 클라우드 AI 사이에서 초보자가 정해야 할 기준
참고 자료
- Google: Introducing Gemini 3.6 Flash, 3.5 Flash-Lite, and 3.5 Flash Cyber
- Gemini API: Gemini 3.6 Flash 모델 사양
- Gemini API: Gemini 3.5 Flash-Lite 모델 사양
- Gemini API pricing
기준일은 2026년 7월 22일입니다. 모델 가격, 지원 도구와 공개 범위는 바뀔 수 있으므로 실제 적용 전 공식 모델 사양과 가격 문서를 다시 확인해야 합니다.