Gemini 3.6 Flash, 더 똑똑하다기보다 더 빨라졌다…실사용 평가는 엇갈려

Gemini 3.6 Flash, 3.5 Flash-Lite, 3.5 Flash Cyber 이름이 적힌 Google 공식 발표 이미지
Google이 7월 21일 공개한 Gemini 3.6 Flash, 3.5 Flash-Lite, 3.5 Flash Cyber. 이미지: Google

Google이 7월 21일 Gemini 3.6 Flash, Gemini 3.5 Flash-Lite, Gemini 3.5 Flash Cyber를 공개했다. 발표 직후 벤치마크와 개발자 반응을 종합하면 3.6 Flash의 가장 분명한 변화는 ‘더 높은 지능’보다 ‘같은 수준의 작업을 더 빨리, 더 적은 토큰으로 처리하는 능력’이다. 웹 화면의 색상·레이아웃을 고치는 짧은 코딩 작업과 문서 추출에서는 호평이 나왔지만, 여러 도구를 연속 호출하는 코딩 에이전트 작업에서는 환각과 조기 종료가 보고됐다.

3.6 Flash는 출력 가격 17% 인하, Flash-Lite는 오히려 인상

Gemini 3.6 Flash의 API 가격은 입력 100만 토큰당 $1.50, 출력 100만 토큰당 $7.50이다. 입력 가격은 3.5 Flash와 같고 출력 가격은 $9에서 16.7% 내렸다. Google은 Artificial Analysis 평가에서 출력 토큰을 전작보다 17% 적게 사용했으며, DeepSWE에서는 최대 65%까지 줄었다고 밝혔다. 다만 65%는 특정 벤치마크의 결과이지 모든 작업에 적용되는 절감률은 아니다.

3.5 Flash-Lite는 입력 100만 토큰당 $0.30, 출력 100만 토큰당 $2.50이다. 직전 3.1 Flash-Lite의 $0.25·$1.50과 비교하면 입력은 20%, 출력은 66.7% 올랐다. 더 오래된 2.5 Flash-Lite의 출력 가격 $0.40과 비교하면 6.25배다. Google은 이를 ‘가장 비용 효율적인 3.5급 모델’이라고 부르지만, 이전 Lite 사용자의 청구서까지 가벼워진 것은 아니다.

신형 Flash의 API 가격: 3.6은 출력 단가 인하, Lite는 인상

Gemini Flash 계열의 100만 토큰당 입력·출력 API 가격 비교
모델입력출력직전 모델 대비
Gemini 3.5 Flash$1.50$9.00기준
Gemini 3.6 Flash$1.50$7.50출력 16.7% 인하
Gemini 3.1 Flash-Lite$0.25$1.50기준
Gemini 3.5 Flash-Lite$0.30$2.50입력 20%·출력 66.7% 인상
Gemini 2.5 Flash-Lite$0.403.5 Lite 출력이 6.25배
100만 토큰당 API 가격이다. 2.5 Flash-Lite의 입력 가격은 이 기사에서 비교하지 않았다.출처: Google [1], Ars Technica [5]

3.6 Flash와 3.5 Flash-Lite는 Gemini API, Google AI Studio, Android Studio와 Gemini 앱에서 제공된다. 3.6 Flash는 Google Antigravity와 Gemini Enterprise 앱에도 들어가며, 3.5 Flash-Lite는 Google 검색에 순차 배포된다. 두 모델 모두 100만 토큰 컨텍스트를 지원한다.

지능 점수는 그대로, 속도는 거의 두 배

독립 모델 평가기관 Artificial Analysis의 ‘high’ 추론 설정에서 3.6 Flash의 Intelligence Index는 50으로 186개 모델 중 21위였다. 3.5 Flash도 50으로 20위다. 종합 지능 점수만 보면 세대 교체라고 부를 변화는 없다.

반면 출력 속도는 초당 165.4토큰에서 303.6토큰으로 83.6% 빨라졌다. 평가 전체에서 사용한 출력 토큰도 7,500만 개에서 5,900만 개로 줄었고, Intelligence Index 실행 비용은 $1,040.88에서 $726.70으로 내려갔다. 같은 평가 묶음을 더 빠르고 간결하게 끝냈다는 뜻이다. Google이 공개한 개별 수치도 DeepSWE 37%에서 49%, OSWorld-Verified 78.4%에서 83.0%, MLE Bench 49.7%에서 63.9%로 올랐다. 다만 이 개별 수치는 Google이 발표한 결과로, 외부 기관이 같은 조건에서 다시 확인한 값은 아니다.

Gemini 3.6 Flash, 지능 점수는 같고 처리 효율은 개선

출력 속도
Gemini 3.5 Flash165.4토큰/초
Gemini 3.6 Flash303.6토큰/초
Intelligence Index50 → 50동일
평가 전체 출력 토큰7,500만 → 5,900만21.3% 감소
평가 실행 비용$1,040.88 → $726.7030.2% 감소
Artificial Analysis의 ‘high’ 추론 설정 결과다. 3.6 Flash는 같은 지능 점수를 기록하면서 출력 속도가 83.6% 높아졌고, 평가에 사용한 토큰과 비용은 줄었다.출처: Artificial Analysis [3], [4]

Ars Technica의 미국 기술 기자 라이언 휘트웜은 OSWorld의 4.6%포인트 상승을 “완만한 개선”으로 평가했다. Google의 수치를 같은 조건에서 다시 검증한 기사는 아니지만, 이번 릴리스가 능력의 큰 도약보다 효율 개선에 가깝다는 해석과 맞닿아 있다.

문서 이해와 짧은 코딩은 빠르다…정확도 향상은 일관되지 않아

LlamaIndex 공동창업자 겸 최고경영자 제리 류(Jerry Liu)는 3.6 Flash와 3.5 Flash-Lite를 문서 이해 작업에 투입해 이전 세대와 비교했다. 3.6 Flash의 평균 점수는 66.8로 3.5 Flash의 69.9보다 낮았다. 표 인식은 91.1에서 89.5로, 차트 이해는 45.0에서 31.0으로 떨어졌고 레이아웃 규칙 통과율은 65.1에서 67.3으로 소폭 올랐다. 류는 “대체로 비슷하지만 차트 이해는 14%포인트 내려갔다”고 평가했다.

문서 이해 평가에서 3.6 Flash의 개선은 일관되지 않았다

평균 점수
3.5 Flash69.9
3.6 Flash66.8
표 인식
3.5 Flash91.1
3.6 Flash89.5
차트 이해
3.5 Flash45.0
3.6 Flash31.0
레이아웃 규칙 통과율
3.5 Flash65.1
3.6 Flash67.3
0–100 축으로 표시한 Jerry Liu의 문서 이해 시험 결과다. 3.6 Flash는 레이아웃 규칙 통과율만 소폭 높았고 평균·표 인식·차트 이해 점수는 낮았다. 한 차례 시험이므로 전체 성능으로 일반화할 수 없다.출처: Jerry Liu·X [8]

같은 시험에서 3.5 Flash-Lite의 평균 점수는 57.1로 3.1 Flash-Lite의 59.7보다 낮았고, 페이지당 평균 비용은 $0.29에서 $0.56으로 늘었다. 한 번의 벤치마크를 전체 성능으로 일반화할 수는 없지만, 신형이 모든 문서 작업에서 더 정확하거나 더 싸다고 보기는 어렵다는 반례다.

미국 스탠퍼드 선형가속기센터(SLAC)에서 물리학·컴퓨터과학을 공부하고 Browser Use에서 에이전트를 개발하는 알렉산더 유(Alexander Yue)는 BrowserCode 평가에서 3.6 Flash가 79%, 3.5 Flash가 75%, 3.5 Flash-Lite가 61%를 기록했다고 공개했다. 유는 3.6의 개선 폭이 비용에 비해 작다고 평가했고, Flash-Lite는 점수는 낮지만 초당 100토큰이 넘는 속도로 아주 쉬운 작업에는 쓸 만하다고 봤다.

에이전트 코딩은 ‘계획 후 실행’이 안전하다는 반응

출시 직후 Hacker News의 공식 발표 스레드는 조사 시점 620점과 댓글 492개를 기록했다. 가장 일관된 호평은 속도였다. Flash-Lite를 직접 시험한 사용자는 “말도 안 되게 빠르다(crazy fast)”고 평가했고, Antigravity에서 3.6 Flash와 3.5 Flash를 비교한 Reddit 사용자는 코딩과 지시 이행이 개선됐다고 적었다.

반대 사례도 곧바로 나왔다. 같은 Reddit 스레드에서는 1만 토큰도 안 된 대화에서 조건을 잊고 존재하지 않는 도구 호출 데이터셋을 추천했다는 보고가 나왔다. 다른 사용자는 모호한 원샷 지시보다 계획 모드가 낫다며, 복잡한 작업은 Pro 모델로 계획한 뒤 Flash로 실행하는 방식을 제안했다.

Hacker News에서는 Antigravity에서 3.6 Flash가 “도구 호출을 지금 중단하고 대기하라”는 내부 지시로 보이는 문구를 반복 출력했다는 사례가 올라왔다. 기존 특징 추출 파이프라인과 30분간 비교한 다른 사용자는 3.6의 정확도가 3.5보다 0.1~0.2% 낮았다고 보고했다. 모두 개인 환경의 단기 시험이지만, 복잡한 도구 사용에서 벤치마크 향상이 그대로 재현되지 않을 수 있음을 보여준다.

오픈소스 코딩 에이전트 OpenCode의 엔지니어 루크 파커(Luke Parker)는 이번 릴리스의 주된 변화가 여러 차례 대화한 뒤 반복 루프에 빠지거나 이상하게 동작하는 장기 세션 문제를 줄이는 데 있다고 설명했다. 이는 모델의 지능 상한을 높이기보다 에이전트를 오래 돌릴 때의 안정성을 다듬었다는 평가다.

Flash Cyber는 아직 직접 써볼 수 없다

Gemini 3.5 Flash Cyber는 3.5 Flash를 취약점 탐지·검증·패치에 맞게 조정한 모델이다. 일반 API로 공개하지 않고 CodeMender 안에서 여러 에이전트가 함께 하나의 보고서를 만드는 방식으로 제공한다. 대상도 정부와 Google이 인정한 신뢰 파트너로 제한되며, 제한 파일럿은 “곧” 시작될 예정이다.

Google DeepMind의 V8 자바스크립트 엔진 평가에서 Flash Cyber는 확인된 고유 취약점 55개를 찾았다. 기본 3.5 Flash는 47개, Claude Opus 4.6은 36개였다. 그러나 이 비교는 Flash Cyber를 최대 다섯 번 호출해 결과를 합친 CodeMender 에이전트 성능이다. 경쟁사 수치 일부는 업체 자체 보고값이며, Opus 4.6 이후 모델은 안전장치 때문에 요청을 거부해 차트에서 빠졌다. ‘단일 Flash 모델이 최신 경쟁 모델보다 강하다’고 읽을 수 없는 이유다.

V8 평가에서 확인한 고유 취약점 수

모델별 V8 평가에서 발견한 고유 취약점 수 Claude Opus 4.6은 36개, Gemini 3.5 Flash는 47개, Gemini 3.5 Flash Cyber 기반 CodeMender 에이전트는 55개의 고유 취약점을 확인했다. 0204060 36개47개55개 ClaudeOpus 4.6 Gemini 3.5Flash Flash CyberCodeMender 모델 종류 발견한 취약점 수
X축은 모델 종류, Y축은 Google DeepMind의 V8 평가에서 확인한 고유 취약점 수다. Flash Cyber 수치는 모델을 최대 다섯 번 호출해 결과를 합친 CodeMender 에이전트 성능으로, 단일 모델끼리의 동일 조건 비교가 아니다. 일부 경쟁사 수치는 업체 자체 보고값이다.출처: Google DeepMind [2]

공개 접근이 제한된 만큼 X, Reddit, Hacker News에서 검증 가능한 Flash Cyber 직접 사용기는 확인되지 않았다. 현재 커뮤니티 반응은 Google의 벤치마크 구성과 제한 공개 정책에 대한 논평이며, 외부에서 같은 조건으로 다시 확인한 결과는 아니다.

빠른 Flash는 나왔지만 3.5 Pro는 나오지 않았다

이번 발표에서 빠진 모델도 중요하다. Google은 Gemini 3.5 Pro가 파트너 테스트 중이며 준비되는 대로 널리 제공하겠다고 밝혔다. Gemini 4는 사전학습을 시작한 단계다. TechCrunch의 미국 AI 담당 선임기자 레베카 벨런은 이번 출시가 ‘무엇을 내놓았는지뿐 아니라 무엇을 내놓지 않았는지’ 때문에 주목된다고 평가했다. 뉴욕타임스는 Google이 Flash Cyber를 더 큰 모델보다 낮은 비용으로 보안 취약점을 찾아 패치할 수 있는 모델로 내세웠다고 전했다.

현재 자료만 놓고 보면 3.6 Flash는 복잡한 문제의 정답률을 크게 끌어올린 모델이라기보다, 전작 수준의 종합 성능을 훨씬 빠르고 간결하게 실행하도록 조정한 모델에 가깝다. 짧은 수정과 대량 문서 처리처럼 지연시간이 중요한 작업에는 분명한 이점이 있다. 여러 파일과 도구를 오가는 장기 에이전트 작업이라면 계획 단계와 결과 검증을 더 강한 모델이나 별도 테스트에 맡기는 편이 안전하다. 빠른 것과 끝까지 제대로 하는 것은 아직 같은 말이 아니다.

원문 출처