返回开发者专区

Google 模型

探索 Google 的所有 10 个模型,包括详细定价、优缺点和开发者推荐。

10
模型
$0.0000
最低输入价格
1.0M
最大上下文
3
质量层级

快速推荐

最佳性价比: DiffusionGemma ($0.0000/1M)
最佳质量: Gemini 3.1 Pro

Gemini 3.7 Flash

新增Mid-tier

Coding, instruction following

官方定价

适用场景: Best pick for high-volume coding assistants, agentic pipelines and tool-calling workloads on a budget.

核心升级

  • GA on August 13, 2026 — three weeks after Gemini 3.6 Flash
  • Priced at half of Gemini 3.6 Flash: $0.75 input / $3.75 output per 1M
  • 1,048,576-token context, 65,536-token max output
输入价格
$0.750
per 1M tokens
输出价格
$3.75
per 1M tokens
缓存输入
per 1M tokens
批量输入
per 1M tokens
上下文窗口: 1.0M
最大输出: 65,536 tokens
知识截止日期: 2026-01
视觉函数调用微调JSON 模式免费层级

优点

  • Google's most intelligent Flash model (GA Aug 13, 2026)
  • Purpose-built for coding and agents
  • 1M context at $0.75/$3.75 — half the price of Gemini 3.6 Flash

缺点

  • Below Pro-tier reasoning on the hardest tasks
  • Very new — ecosystem tooling still catching up

性能

输出速度~120 tok/s
速率限制

多模态能力

图像输入图像输出音频输入音频输出

Gemini 3.1 Pro

Flagship

高级推理、编程

官方定价

适用场景: 最适合复杂推理和专业编程任务的Google模型。

核心升级

  • MMLU: 89.2% — 相比Gemini 2.5 Pro推理能力显著提升
  • 100万上下文,65K输出 — 相同上下文,更高质量
  • 批量折扣50%($1/$6) — 最便宜的批量旗舰模型
  • 上下文缓存:$0.50/M — 重复前缀节省75%成本
  • 仅付费预览 — 无免费层级,但具备生产级可靠性
输入价格
$2.00
per 1M tokens
输出价格
$12.00
per 1M tokens
缓存输入
$0.500
per 1M tokens
批量输入
$1.00
per 1M tokens
上下文窗口: 1M
最大输出: 65,536 tokens
知识截止日期: 2025-06
视觉函数调用微调JSON 模式

优点

  • 100万上下文,65K输出
  • 相比3.0推理能力显著提升
  • 批量折扣50%

缺点

  • 无免费层级(仅付费预览)
  • 长上下文输入超过200K时成本翻倍
  • 仍在完善中

性能

输出速度~55 tok/s
速率限制5,000 RPM

多模态能力

图像输入图像输出音频输入音频输出

基准测试

MMLU
89.2%
SWE-bench Verified
68.0%
GPQA
74.5%

Gemini 3.5 Pro

Flagship

复杂编码、高级数学、深度推理

官方定价

适用场景: 最适合复杂编码、高级数学和深度推理任务,准确性至上的Google旗舰模型。

核心升级

  • 最新旗舰,推理能力较3.1 Pro提升
  • 1M上下文,分层定价:$1.25/$10(≤200K),$2.50/$15(>200K)
  • 提供免费层级(有速率限制)——唯一免费访问的旗舰
  • 50%批量折扣($0.625/$5)——最便宜的批量旗舰
  • 上下文缓存:$0.315/M——重复前缀节省75%
输入价格
$1.25
per 1M tokens
输出价格
$10.00
per 1M tokens
缓存输入
$0.315
per 1M tokens
批量输入
$0.625
per 1M tokens
上下文窗口: 1M
最大输出: 65,536 tokens
知识截止日期: 2026-06
视觉函数调用微调JSON 模式免费层级

优点

  • 1M上下文,分层定价
  • 同类最佳推理基准
  • 免费层级,有速率限制
  • 提供50%批量折扣

缺点

  • 长上下文(>200K)价格翻倍
  • 不支持微调
  • 输出包含思考令牌

性能

输出速度~50 tok/s
速率限制5,000 RPM

多模态能力

图像输入图像输出音频输入音频输出

基准测试

MMLU
90.5%
SWE-bench Verified
72.0%
GPQA
78.0%

使用此模型的智能体

4

Gemini Omni Flash

Mid-tier

多模态生成:文本、图像、音频和视频

官方定价

适用场景: 最适合在单一模型中进行涵盖文本、图像、音频和视频的多模态创意工作。

核心升级

  • 首个原生统一文本、图像、音频和视频的顶级模型
  • 输入:所有模态(文本/图像/视频/音频)$1.50/M
  • 文本输出:$9/M — 视频输出:$17.50/M(720p约$0.10/秒)
  • 支持代理式创意工作流和实时视频编辑
输入价格
$1.50
per 1M tokens
输出价格
$9.00
per 1M tokens
缓存输入
per 1M tokens
批量输入
per 1M tokens
上下文窗口: 1M
最大输出: 65,536 tokens
知识截止日期: 2026-06
视觉函数调用微调JSON 模式

优点

  • 首个原生统一文本/图像/音频/视频模型
  • 实时视频操作
  • 所有模态输入$1.50/M
  • 代理式创意工作流

缺点

  • 视频输出$17.50/M价格昂贵
  • 无免费套餐
  • 预览版——可能更改

性能

输出速度~60 tok/s
速率限制3,000 RPM

多模态能力

图像输入图像输出音频输入音频输出

Gemini 3.5 Flash

Mid-tier

快速、智能的生成

官方定价

适用场景: 对于需要多模态能力的生产应用,速度和智能的最佳平衡。

核心升级

  • 中端价格的前沿智能——匹配Gemini 2.5 Pro质量
  • 1M上下文 + 65K输出,$1.50/$9——比旗舰便宜8倍
  • 提供带速率限制的免费套餐——Google最佳免费模型
  • 上下文缓存:$0.375/M——缓存输入节省75%
  • 多模态(文本+视觉)以flash速度——典型延迟低于1秒
输入价格
$1.50
per 1M tokens
输出价格
$9.00
per 1M tokens
缓存输入
$0.375
per 1M tokens
批量输入
$0.750
per 1M tokens
上下文窗口: 1M
最大输出: 65,536 tokens
知识截止日期: 2025-06
视觉函数调用微调JSON 模式免费层级

优点

  • 中端价格的前沿智能
  • 1M上下文 + 65K输出
  • 带速率限制的免费套餐

缺点

  • 比3.1 Flash-Lite更贵
  • 输出成本$9/M在规模下显著
  • 不支持微调

性能

输出速度~95 tok/s
速率限制10,000 RPM

多模态能力

图像输入图像输出音频输入音频输出

基准测试

MMLU
86.5%
HumanEval
85.0%
MATH
73.0%

Gemini 3.1 Flash-Lite

Lite

高吞吐量、低延迟任务

官方定价

适用场景: 高吞吐量分类、提取和轻量生成任务的最佳预算模型。

核心升级

  • 100万上下文,输入每百万仅$0.25 — 比Gemini 2.5 Flash便宜6倍
  • 最大输出65K — 与Pro级别相同,价格仅为Lite
  • 上下文缓存:每百万$0.0625 — 节省90%,最佳缓存价值
  • 批量API:$0.125/$0.75 — 异步处理节省50%
  • 免费层有速率限制 — 零成本无限原型设计
输入价格
$0.250
per 1M tokens
输出价格
$1.50
per 1M tokens
缓存输入
$0.063
per 1M tokens
批量输入
$0.125
per 1M tokens
上下文窗口: 1M
最大输出: 65,536 tokens
知识截止日期: 2025-04
视觉函数调用微调JSON 模式免费层级

优点

  • 100万上下文,输入每百万仅$0.25 — 超值
  • 最大输出65K
  • 上下文缓存节省90%

缺点

  • 复杂任务质量低于3.5 Flash
  • 不支持微调
  • 较新模型,实战检验较少

性能

输出速度~130 tok/s
速率限制15,000 RPM

多模态能力

图像输入图像输出音频输入音频输出

基准测试

MMLU
79.0%
HumanEval
74.5%

Gemini 2.5 Pro

Flagship

复杂推理、长上下文

官方定价

适用场景: 最具性价比的旗舰模型——100万上下文,成本低于GPT-4.1或Claude Sonnet。

核心升级

  • 最便宜的旗舰输入:1.25美元/百万——比GPT-4.1便宜40%
  • 100万上下文窗口,65K输出——旗舰模型中最大输出
  • 上下文缓存:0.315美元/百万——重复前缀节省75%
  • 提供免费套餐——唯一免费访问的旗舰模型
  • MMLU:85.4%——与GPT-4.1竞争,成本仅一半
输入价格
$1.25
per 1M tokens
输出价格
$10.00
per 1M tokens
缓存输入
$0.315
per 1M tokens
批量输入
per 1M tokens
上下文窗口: 1.0M
最大输出: 65,536 tokens
知识截止日期: 2025-01
视觉函数调用微调JSON 模式免费层级

优点

  • 100万上下文窗口
  • 最便宜的旗舰输入,仅需1.25美元
  • 最大输出65K

缺点

  • 无批量API
  • 无微调
  • 输出成本较高

性能

输出速度~50 tok/s
速率限制5,000 RPM

多模态能力

图像输入图像输出音频输入音频输出

基准测试

MMLU
85.4%
SWE-bench Verified
63.8%
MATH
72.0%

使用此模型的智能体

2

Gemini 2.5 Flash

Mid-tier

快速高效的生成

官方定价

适用场景: 生产级应用的绝佳价值——100万上下文仅需$0.15/100万输入token。

核心升级

  • 与Pro相同的100万上下文,输入价格仅为1/8($0.15 vs $1.25/百万)
  • 最大输出65K——与Pro层级生成能力相同
  • 上下文缓存:$0.0375/百万——缓存前缀节省97%
  • 免费层级慷慨的速率限制——零成本即可投入生产
  • 亚秒级延迟——Google最快的实时应用模型
输入价格
$0.150
per 1M tokens
输出价格
$0.600
per 1M tokens
缓存输入
$0.037
per 1M tokens
批量输入
per 1M tokens
上下文窗口: 1.0M
最大输出: 65,536 tokens
知识截止日期: 2025-01
视觉函数调用微调JSON 模式免费层级

优点

  • 与Pro相同的100万上下文,价格仅为1/8
  • 最大输出65K
  • 最佳缓存输入节省

缺点

  • 无批量API
  • 复杂任务质量低于Pro
  • 无微调

性能

输出速度~100 tok/s
速率限制10,000 RPM

多模态能力

图像输入图像输出音频输入音频输出

基准测试

MMLU
83.0%
HumanEval
82.5%
MATH
68.0%

使用此模型的智能体

4

Gemini 2.0 Flash

Lite

超快速,低成本

官方定价

适用场景: 高容量提取、分类和微调模型的最佳预算选择。

核心升级

  • 最便宜的1M上下文模型:输入$0.10/M — 市场最低
  • 唯一支持微调+视觉的轻量模型 — 完整功能集
  • 上下文缓存:$0.025/M — 重复前缀节省97.5%
  • 最大输出8K较低 — 升级到2.5 Flash可获得65K输出
  • 支持微调 — 最适合领域特定分类模型
输入价格
$0.100
per 1M tokens
输出价格
$0.400
per 1M tokens
缓存输入
$0.025
per 1M tokens
批量输入
per 1M tokens
上下文窗口: 1.0M
最大输出: 8,192 tokens
知识截止日期: 2024-08
视觉函数调用微调JSON 模式免费层级

优点

  • 市场上最便宜的模型,拥有1M上下文
  • 唯一支持微调+视觉的轻量模型
  • 完整功能集

缺点

  • 最大输出8K较低
  • 知识截止日期较旧
  • 质量低于2.5 Flash

性能

输出速度~140 tok/s
速率限制15,000 RPM

多模态能力

图像输入图像输出音频输入音频输出

基准测试

MMLU
78.5%
HumanEval
75.0%
MATH
62.0%

DiffusionGemma

Mid-tier

快速本地文本生成,并行解码

官方定价

适用场景: 当您需要在消费级GPU上快速本地生成文本,并且可以牺牲一些质量换取4倍速度时。

核心升级

  • 26B总MoE,3.8B活跃——可在单块24GB GPU上运行
  • 通过基于扩散的并行解码实现4倍文本生成速度
  • Apache 2.0开源——可随处部署,自由微调
  • 双向上下文支持自我修正
  • 权衡:与标准Gemma 4相比基准分数较低
输入价格
$0.0000
per 1M tokens
输出价格
$0.0000
per 1M tokens
缓存输入
per 1M tokens
批量输入
per 1M tokens
上下文窗口: 262K
最大输出: 32,768 tokens
知识截止日期: 2025-06
视觉函数调用微调JSON 模式免费层级

优点

  • 通过并行扩散解码,比标准Gemma快4倍
  • 26B MoE,仅3.8B活跃参数——适配24GB VRAM
  • Apache 2.0开源——完整权重可用
  • 双向上下文实现自我修正

缺点

  • 在所有基准测试中落后于标准Gemma 4
  • 不支持视觉或音频
  • 不支持函数调用
  • 实验性——不适用于生产关键型工作负载

性能

输出速度~200 tok/s
速率限制

多模态能力

图像输入图像输出音频输入音频输出

基准测试

MMLU
72.0%
HumanEval
68.0%

并排比较

模型层级输入输出上下文
Gemini 3.7 FlashMid-tier$0.750$3.751.0M
Gemini 3.1 ProFlagship$2.00$12.001M
Gemini 3.5 ProFlagship$1.25$10.001M
Gemini Omni FlashMid-tier$1.50$9.001M
Gemini 3.5 FlashMid-tier$1.50$9.001M
Gemini 3.1 Flash-LiteLite$0.250$1.501M
Gemini 2.5 ProFlagship$1.25$10.001.0M
Gemini 2.5 FlashMid-tier$0.150$0.6001.0M
Gemini 2.0 FlashLite$0.100$0.4001.0M
DiffusionGemmaMid-tier$0.0000$0.0000262K