Gemini 2 Pro

entitystableCreated: 2026-07-24Updated: 2026-07-24Source: deepmind.google/technologies/gemini/
googlepartially-openmultimodaltext-generationvisionlong-context

Gemini 2 Pro

Gemini 2 Pro is Google DeepMind's flagship multimodal model, succeeding Gemini 1.5 Pro. It offers a 1M token context window — the largest among frontier models.

Key Specifications

  • Context window: 1,048,576 tokens (1M)
  • Max output tokens: 8,192
  • Architecture: Transformer (proprietary)
  • Modalities: Text, image, audio, video input; text output
  • Pricing: $2.50 / $10.00 per 1M input/output tokens
  • Availability: Google AI Studio, Vertex AI

Capabilities

  • Ultra-long context — 1M tokens enables book-length document processing
  • Native multimodal — Processes images, audio, and video natively
  • Code generation — Strong coding across languages
  • Function callingTool use support
  • Grounding — Google Search integration for factual accuracy

Architecture

Built on Google's transformer architecture with MoE routing. Gemini 2 Pro uses advanced multi-head-attention with optimized KV cache management for the 1M context window.

Unique Features

  • Video understanding — Can process video frames as input
  • Audio understanding — Native audio processing
  • Google ecosystem — Deep integration with Google Cloud, Workspace

Comparison