Компания Google представила новое семейство моделей Gemini 3 — самое интеллектуальное поколение ИИ на сегодняшний день. Gemini 3 создано для работы с комплексными задачами, включая автономное кодирование, мультимодальные сценарии и агентные рабочие процессы. В свежем руководстве разработчика подробно раскрываются ключевые функции моделей и даются рекомендации по их эффективному использованию.
Что нового в Gemini 3
Gemini 3 Pro — первая модель серии, оптимизированная для сложных задач, где требуется обширное знание мира и способности к глубокому анализу различных тем. В модели реализованы несколько уникальных возможностей:
- Динамическое мышление. По умолчанию Gemini 3 Pro использует высокий уровень анализа (high). Нейросеть глубоко анализирует запросы. Для быстрых ответов с минимальной задержкой можно установить low, чтобы снизить нагрузку и ускорить обработку.
- Мультиформатное распознавание. Модель умеет работать с изображениями, видео и PDF-документами, а для контроля качества распознавания используют параметр media_resolution. Для изображений рекомендуется media_resolution_high, для стандартных PDF — medium, для видео — low или medium, а для видео с большим количеством текста — high.
- Контроль температуры генерации. Рекомендуемое значение температуры — 1.0. Оптимальное соотношение креативности и точности рассуждений.
Сохранение контекста и смысла
Gemini 3 использует так называемые «мыслительные подписи» (thoughtSignature) для сохранения контекста рассуждений между запросами. Они особенно важны при последовательных вызовах функций: отсутствие подписи ухудшает качество ответа или вызывает ошибки.
Новые возможности API
Разработчики получают больше контроля над задержкой, точностью и стоимостью мультимодальных запросов:
- Уровень мышления (thinking_level) регулирует глубину рассуждений модели.
- Разрешение мультимедиа (media_resolution) управляет количеством токенов, выделяемых для анализа изображений, видео или PDF.
- Структурированные результаты и инструменты. Gemini 3 поддерживает интеграцию с поиском Google, URL-контекстом и выполнением кода. Вывод можно получать в виде структурированных данных для дальнейшей обработки.
Переход с Gemini 2.5
Gemini 3 значительно мощнее предыдущей версии. Разработчикам, переходящим с Gemini 2.5, стоит учесть:
- Использовать thinking_level: high для сложных рассуждений вместо старых цепочек подсказок.
- Удалить прежние настройки температуры и оставить значение по умолчанию 1.0.
- Проверить новые параметры media_resolution для PDF и видео, чтобы сохранить точность распознавания и оптимизировать токены.
Совместимость и рекомендации
Gemini 3 поддерживает совместимость с OpenAI API на уровне параметров, пакетный API и кэширование контекста. Для максимальной эффективности:
- давайте модели точные и лаконичные инструкции;
- размещайте ключевые вопросы в конце длинных запросов, чтобы привязать рассуждения к нужным данным;
- используйте явные инструкции, если нужен разговорный стиль ответа.
Итог
Gemini 3 сочетает глубокое мышление, мультимодальные возможности и расширенные инструменты для разработчиков. Новое руководство подробно объясняет, как использовать все функции модели и оптимизировать работу с токенами, мультимедиа и API.С более подробной документацией и примерами работы с Gemini 3 можно ознакомиться в официальном гайде разработчика.