Claude Fable 5$22.000/MClaude Opus 5$11.000/MClaude Opus 4.8$11.000/MClaude Opus 4.7$11.000/MClaude Opus 4.6$11.000/MClaude Opus 4.5$33.000/MClaude Sonnet 3.7$6.600/MClaude Opus 3$33.000/MClaude 2.1$12.800/MClaude 2$12.800/MGPT-5.6 Sol$12.500/MGPT-5.6 Terra$5.000/MGPT-5.5$12.500/MGPT-5.2$5.425/MGPT-5.2-Codex$5.425/MGPT-5$3.875/MGPT-4.5$97.500/MGPT-4 Turbo Preview$16.000/MGPT-4$39.000/MGPT-4-32k$78.000/Mo3$19.000/Mo3-mini$2.090/Mo4-mini$2.090/Mo1$28.500/Mo1-mini$5.700/Mo1-preview$28.500/MGemini 3.5 Pro$5.000/MGemini 3.1 Pro$5.000/MGemini 3 Pro$5.000/MGemini 2.5 Pro$3.875/MClaude Fable 5$22.000/MClaude Opus 5$11.000/MClaude Opus 4.8$11.000/MClaude Opus 4.7$11.000/MClaude Opus 4.6$11.000/MClaude Opus 4.5$33.000/MClaude Sonnet 3.7$6.600/MClaude Opus 3$33.000/MClaude 2.1$12.800/MClaude 2$12.800/MGPT-5.6 Sol$12.500/MGPT-5.6 Terra$5.000/MGPT-5.5$12.500/MGPT-5.2$5.425/MGPT-5.2-Codex$5.425/MGPT-5$3.875/MGPT-4.5$97.500/MGPT-4 Turbo Preview$16.000/MGPT-4$39.000/MGPT-4-32k$78.000/Mo3$19.000/Mo3-mini$2.090/Mo4-mini$2.090/Mo1$28.500/Mo1-mini$5.700/Mo1-preview$28.500/MGemini 3.5 Pro$5.000/MGemini 3.1 Pro$5.000/MGemini 3 Pro$5.000/MGemini 2.5 Pro$3.875/M
Google
Google
Efficient

Gemini 1.5 Flash-8B

Nano

Smallest Gemini 1.5, 8B parameters, distilled for ultra-cheap inference. Punches above its size on routing/classification.

Gemini 1.5 Flash-8B is a efficient AI model from Google. It costs $0.037 per million input tokens and $0.150 per million output tokens (blended $0.071/M), with a 1,000,000-token context window.

INPUT
$0.037/M
per million input tokens
OUTPUT
$0.150/M
per million output tokens
BLENDED 70/30
$0.071/M
unchanged since 3 May
CONTEXT
1,000,000
tokens
What it is good at
  • Very cheap
  • Sub-100ms latency on most tokens
  • 1M context
Typical use cases
  • Routing layer
  • Bulk classification
  • Edge-style inference

Benchmarks

vs. best public score
MMLU70%
Multitask academic knowledge across 57 subjects.
Graduate-level science questions, "Google-proof".
MATH58%
High-school competition math problems.
Python function synthesis from docstrings.
LMArena Elo1175 Elo
Crowd-sourced head-to-head preference Elo rating.
Hand-curated from each provider's published reports and public leaderboards. Methodology varies across sources, treat as directional rather than authoritative.

More from Google

See all 24

Frequently asked questions

How much does Gemini 1.5 Flash-8B cost?

Gemini 1.5 Flash-8B costs $0.037 per million input tokens and $0.150 per million output tokens, for a blended reference rate of $0.071 per million tokens.

What is Gemini 1.5 Flash-8B's context window?

Gemini 1.5 Flash-8B supports up to 1,000,000 tokens of context in a single request.

What is Gemini 1.5 Flash-8B best for?

Gemini 1.5 Flash-8B is well suited to Very cheap, Sub-100ms latency on most tokens and 1M context.

Who makes Gemini 1.5 Flash-8B?

Gemini 1.5 Flash-8B is developed and served by Google. It was released in Oct 2024.

Terms used on this page