Место #4 Повседневная экосистема — Ведущие ИИ-помощники
Google DeepMind

Gemini 3.1 Pro

Gemini 3.1 Pro—специалист Google по глубокому мышлению: уже не новый флагман, но всё ещё силён в науке, незнакомой логике, длинных документах и мультимодальном исследовании. Семейство Flash быстрее и дешевле; 3.1 Pro нужен там, где качество анализа важнее скорости.

Обновлено 14 августа 2026 Multi-modalReasoningLong context
Лучше всего для

Gemini 3.1 Pro—специалист Google по глубокому мышлению: уже не новый флагман, но всё ещё силён в науке, незнакомой логике, длинных документах и мультимодальном исследовании. Семейство Flash быстрее и дешевле; 3.1 Pro нужен там, где качество анализа важнее скорости.

Почему он побеждает

На старте: 77,1% ARC-AGI-2, 94,3% GPQA Diamond, 44,4% Humanity's Last Exam без инструментов и 80,6% SWE-Bench Verified. Он принимает текст, изображения, аудио, видео и PDF в контексте до миллиона токенов.

Обратите внимание

Через полгода модель всё ещё Preview по цене $2/$12 за миллион токенов до 200k контекста. Обещанный 3.5 Pro пропустил июнь и, возможно, уступил место планам Gemini 4; роль рабочей модели взял 3.7 Flash.

01

Что это на самом деле

Представьте, что одну сложную папку получают три коллеги. Первый читает каждую страницу, сверяет сноски и графики и возвращает продуманный вывод. Второй быстро вызывает нужные инструменты и к обеду превращает папку в панель. Третий одновременно обрабатывает тысячу таких папок, извлекая из каждой двенадцать полей без разорения бюджета.

Так удобно понимать нынешнее семейство Gemini. 3.1 Pro—вдумчивый аналитик, 3.7 Flash—быстрый строитель и агент, 3.5 Flash-Lite—дешёвая производственная линия. Слово Pro не делает первый вариант лучшим всегда; оно описывает компромисс, под который тот создавался.

Флагман, который старел на виду

Google выпустил Gemini 3.1 Pro в Preview 19 февраля 2026 года. Главное улучшение касалось рассуждений. В ARC-AGI-2—задачах, где нужно открыть незнакомые визуальные правила—результат вырос с 31,1% до 77,1%. Добавились 94,3% GPQA Diamond и 44,4% HLE без инструментов.

Artificial Analysis увидел похожую картину: 57 баллов, первое место и лидерство в шести из десяти компонентов. Скорость около 114 токенов в секунду была высокой для крупной рассуждающей модели того времени, а цена $2/$12 выгодно смотрелась рядом с тогдашними флагманами.

Полной победы не было. В таблице Google модель уступала тогдашним Claude в GDPval-AA, а прежний Gemini 3 Pro был чуть выше в MMMU-Pro. Точнее называть 3.1 Pro сильным универсалом с особым талантом к науке и абстракции, а не лучшим во всём. И любой публичный тест менее полезен, чем оценка на ваших документах, языке и допустимой цене ошибки.

Дата важна. Рейтинг—фотография, не вечный чемпионский пояс. За шесть месяцев поле изменилось. 3.1 Pro не стал глупее; новые модели улучшили длинное программирование, работу с компьютером и корпоративные процессы.

Где 3.1 Pro сохраняет ценность

Он хорош, когда задача трудна до того, как становится повторяющейся. Учёный объединяет статью и микроскопию; расследователь—интервью, хронологию и финансовый отчёт; продуктовая команда—запись экрана и код. Всё помещается в мультимодальный запрос до миллиона токенов.

Это анализ, не генерация медиа. 3.1 Pro отвечает текстом. Veo создаёт видео, Nano Banana—изображения, Lyria—музыку. Связь внутри одного продукта не превращает их в способности одной модели, как дирижёр не играет сам на каждом инструменте.

Инструменты делают его шире обычной системы вопросов к PDF: он вызывает функции, возвращает JSON, ищет и исполняет код. Но в длинной агентной цепочке новые Flash обычно быстрее и реже застревают в неудачных циклах. Поэтому 3.1 Pro разумно использовать как старшего специалиста для трудного этапа, а не обязательно как робота, который самостоятельно ведёт весь конвейер.

Контекст—огромный стол, не фотографическая память. В MRCR Google падает с 84,9% в среднем при 128k до 26,3% в точечном тесте 1M. Если ответ зависит от строки на странице 4000, загрузить всё и надеяться—плохая архитектура. Сужайте корпус, именуйте источники, просите страницы и проверяйте.

Долгое ожидание Gemini 3.5 Pro

19 мая Google сказал, что 3.5 Pro уже используется внутри и выйдет «в следующем месяце». Июнь закончился без релиза. 16 июля Bloomberg сообщил о задержке на месяцы: попытки улучшить модель, особенно код, не достигали внутренних целей.

Через пять дней Google выпустил 3.6 Flash и 3.5 Flash-Lite. Теперь Pro «тестировался с партнёрами» и должен был появиться «как только будет готов». В том же сообщении компания объявила о начале самого амбициозного предобучения Gemini 4. В августе публичная страница по-прежнему обещает “3.5 Pro coming soon” над старым 3.1 Pro.

SemiAnalysis утверждает, что проект тихо отменён. Обстоятельства делают это правдоподобным, но Google не подтвердил. Модель могла быть отменена, переименована, поглощена Gemini 4 или отправлена на глубокую переработку. Практический вывод: не покупайте подписку и не проектируйте систему вокруг обещания без endpoint.

Здесь точность формулировки важна. Назвать отмену фактом—значит пойти дальше официальных данных; сказать, что всё идёт по плану,—значит игнорировать пропущенный срок и отраслевые сообщения. Честная середина такова: исходный план выпуска провалился, а будущее публичного продукта именно под названием 3.5 Pro остаётся неопределённым.

Экосистема не ждала

Gemini 3.7 Flash доступен GA с 13 августа и рекомендован для миграции многих задач 3.1 Pro. У него 1M контекста, 64k выхода, инструменты и три уровня мышления. Google публикует 43,6% FrontierCode, 65,3% DeepSWE, 85,8% Terminal-Bench и 34% GDP.pdf. Индекс AA—56, скорость около 340 токенов/с. Цена до декабря $0,75/$3,75, затем $1,50/$7,50.

3.5 Flash-Lite занимает другой слой. Стабильный, мультимодальный, с 1M контекста, ценой $0,30/$2,50 и скоростью около 350 токенов/с, он предназначен для разбора документов, классификации, чеков, поисковых субагентов и параллельных вариантов. Он заметно обходит 3.1 Flash-Lite в Terminal-Bench, длинном контексте и GDPval-AA. Lite не становится Pro—он становится удивительно способным конвейером.

Практический выбор

Берите 3.1 Pro, если ваши тесты показывают лучшую науку, исследование или новую логику. Делайте 3.7 Flash стандартом для новых агентов, UI, автоматизации и объёма. Ставьте 3.5 Flash-Lite за кулисами на малые чёткие задачи.

А для 3.5 Pro дождитесь настоящего endpoint. Названия моделей—обещания; endpoints—продукты.

02

Сильные стороны и честные ограничения

Ключевые преимущества

  • Отличное абстрактное и научное мышление: 77,1% ARC-AGI-2, 94,3% GPQA и 44,4% HLE сделали модель одной из сильнейших в феврале. Тесты—карта, не территория, но вместе они показывают уверенность в новой логике, технике и исследованиях.
  • Разные виды доказательств в одном анализе: Модель совместно понимает текст, изображения, аудио, видео и PDF. Можно связать тон интервью с графиком и демонстрацией. Выход текстовый; Veo, Nano Banana и Lyria—отдельные модели.
  • Большой стол для документов и кода: Миллион токенов вмещает дела, научные подборки и репозитории. Это не идеальная память—в точечном MRCR на 1M Google сообщает 26,3%—поэтому источники нужно сужать и требовать цитаты.
  • Сильные код и инструменты своего поколения: На старте были 80,6% SWE-Bench Verified, 68,5% Terminal-Bench 2.0, 85,9% BrowseComp и 69,2% MCP Atlas. Есть вызов функций, структурированный вывод, Google Search и выполнение кода.
  • Широкий доступ в рабочих продуктах Google: Gemini, AI Studio, API, Enterprise, AI Mode, Antigravity и NotebookLM. Для организации в Workspace и Cloud управляемый доступ может быть важнее небольшого преимущества в рейтинге.

Честные ограничения

  • Обещанный преемник застрял: В мае Google пообещал 3.5 Pro в июне. Срок прошёл; Bloomberg сообщил о месяцах задержки и недостигнутых целях в программировании. Затем Google перешёл к формулировке о тестировании с партнёрами и выпуске ‘когда будет готов’.
  • Отмена правдоподобна, но не подтверждена: SemiAnalysis сообщил о тихой отмене. Два новых Flash и уже начатое обучение Gemini 4 делают версию логичной, однако страница Google всё ещё говорит ‘coming soon’. Отмена, переименование и глубокая переделка—варианты, не факты.
  • Flash лучше для многих производственных задач: 3.7 Flash доступен GA, сильнее во многих новых тестах и временно стоит $0,75/$3,75. 3.5 Flash-Lite стоит $0,30/$2,50 и предназначен для документов и параллельных субагентов.
  • Preview и падение длинного контекста требуют осторожности: Жизненный цикл менее надёжен, а миллион токенов не гарантирует поиск каждого факта. Нужны закреплённые версии, запасная модель, ссылки на источники и независимая проверка важных ответов.
03

Результаты тестов

ARC-AGI-2 — 77,1%

Проверенный Google результат на задачах с новыми визуальными правилами против 31,1% у Gemini 3 Pro. Самое ясное свидетельство скачка в абстрактном мышлении.

GPQA Diamond — 94,3%

Сложные научные вопросы уровня аспирантуры без инструментов. Аргумент для науки, но не разрешение верить факту без источника.

SWE-Bench Verified — 80,6%

Сильный результат на реальных проблемах репозиториев. Новые тесты показывают: модель способна, но уже не задаёт границу программирования.

Artificial Analysis Intelligence Index — 57 на старте

Первое место в феврале и около 114 выходных токенов в секунду. Важный исторический снимок, не текущий рейтинг.

04

Вердикт

Gemini 3.1 Pro остаётся хорошим специалистом для сложного мышления, науки и синтеза разных доказательств. Для нового производства обычно разумнее 3.7 Flash; 3.5 Flash-Lite—экономичный мотор для извлечения и субагентов. Про 3.5 Pro не предполагайте ничего до появления endpoint: задержки, сообщение об отмене и Gemini 4 означают, что продукт под этим именем может не выйти.

05

Часто задаваемые вопросы