
21 июля я обновлял ленту в ожидании Gemini 3.5 Pro. Флагман анонсировали ещё в мае на I/O, обещали «в следующем месяце» – и вот уже почти два месяца это следующий месяц переезжает вправо третий раз подряд. А вместо флагмана Google выкатила… три модели тира Flash. Ни одна из них не Pro.
Знакомое чувство, да? Как будто ждал новый сезон, а прислали спин-офф про второстепенного персонажа. И вдруг – спин-офф оказался неожиданно толковым!
Разберёмся, что именно вышло, почему цифра 17% важнее любого бенчмарка в этом релизе, где новая модель откровенно проседает (спойлер: она хуже читает графики, чем её предшественница, да-да, именно так), и что вообще происходит с Gemini 3.5 Pro и обучением Gemini 4.
Что вообще случилось 21 июля
Google одним заходом выпустила сразу три модели:
-
Gemini 3.6 Flash – основная рабочая лошадка, замена Gemini 3.5 Flash;
-
Gemini 3.5 Flash-Lite – самая быстрая и дешёвая модель серии 3.5;
-
Gemini 3.5 Flash Cyber – узкоспециализированная для поиска уязвимостей, доступная только правительствам и доверенным партнёрам.
И тут же, почти между делом, в конце анонса – что компания уже тестирует Gemini 3.5 Pro с партнёрами и параллельно запустила «самый амбициозный претрейн» за свою историю для Gemini 4. То есть Google одновременно закрывает вопрос «а что там с моделями среднего тира» и намекает: следующий большой прыжок будет нескоро.
Что ж, обещанного флагмана нет, зато то, что реально выкатили, для 90% практических задач полезнее, чем ещё одна строчка в лидерборде.
|
Модель |
Роль |
Цена (вход / выход, $ за 1M токенов) |
Доступ |
|---|---|---|---|
|
Gemini 3.6 Flash |
Основная модель для агентов, кода, мультимодальных задач |
$1,50 / $7,50 |
Все пользователи, API, Gemini App |
|
Gemini 3.5 Flash-Lite |
Максимальная скорость и дешевизна для потоковых задач |
$0,30 / $2,50 |
Все пользователи, API, Google Поиск |
|
Gemini 3.5 Flash Cyber |
Поиск и патчинг уязвимостей внутри CodeMender |
Не раскрыта |
Только госорганы и доверенные партнёры |
Цифра, которая на самом деле важна: 17%
Забудьте на секунду про бенчмарки. Главное число этого релиза скромное: Gemini 3.6 Flash тратит на 17% меньше выходных токенов, чем 3.5 Flash, при решении тех же задач (по данным Artificial Analysis).

А в отдельных сценариях, вроде теста DeepSWE на автономное исправление кода, экономия доходит до 65% – там модель обходится 97 тысячами токенов вместо 276 тысяч у предшественницы.

Почему это важнее сырого интеллекта? Да потому, что общий индекс интеллекта у 3.6 Flash и 3.5 Flash – одинаковые 50 баллов. Модель не стала умнее. Ни на йоту! Она стала экономнее и реже ходит кругами – и это, как ни странно, более редкое достижение.

Для человека, который просто печатает один запрос в чат, разница почти незаметна. А вот для агента, который внутри одной задачи открывает файл, гуглит, снова открывает файл, зовёт инструмент, думает, пишет ответ – каждый лишний шаг это токены, а каждые токены это деньги. И тут экономия начинает работать как сложный процент.
Есть удобный способ понять, почему это важнее ценника на обёртке. Стоимость выполненной задачи – не одна переменная, а произведение трёх:
цена за токен × токенов на задачу × попыток до успеха
Google снизила первую переменную примерно на 17% (цена на выход упала с $9 до $7,5 за миллион). Но собственные данные компании говорят, что вторая переменная упала как минимум настолько же. Перемножьте – и для типового рабочего сценария получаем примерно 31% дешевле за выполненную задачу, а для агентного кодинга (там, где токены раньше улетали в бесконечные циклы «правка → тест → провал → снова правка») – реальные оценки доходят до 65–71% экономии. Google, кстати, не уменьшила при этом длину и качество ответов – оценка на DeepSWE выросла с 37% до 49% параллельно с падением расхода токенов, а это редкое сочетание: обычно экономия и качество тянут в разные стороны.

Третья переменная – «попыток до успеха» – вообще нигде не публикуется вендорами, хотя именно она чаще всего определяет реальный счёт. Модель, которая стабильно решает с первого раза по более высокой цене за токен, обычно выходит дешевле «дешёвой» модели, которой нужно три попытки. Проверить это можно только на своих задачах.
Где 3.6 Flash реально выигрывает – и где нет
Полез в бенчмарки – и вот…
|
Бенчмарк |
Что измеряет |
Gemini 3.5 Flash |
Gemini 3.6 Flash |
|---|---|---|---|
|
DeepSWE |
Автономное исправление кода |
37% |
49% |
|
MLE-Bench |
ML-исследования |
49,7% |
63,9% |
|
OSWorld-Verified |
Управление компьютером |
78,4% |
83,0% |
|
GDPval-AA v2 |
Реальные офисные задачи |
1349 |
1421 |
|
GDM-MRCR v2 (1M токенов) |
Поиск в длинном контексте |
~27% |
54,0% |
Прирост по управлению компьютером и длинному контексту – не косметика, а самый серьёзный скачок во всём релизе. Модель реально находит нужный кусок информации в документе на миллион токенов вдвое надёжнее прежней версии. Учитывая, что окно контекста в 1 048 576 токенов давно продаётся как фича, а по факту у некоторых моделей «теряется» середина длинного документа, – это тот самый случай, когда цифра важнее ценника.
А вот на прямых боях с конкурентами Gemini 3.6 Flash уже не безоговорочный лидер. На SWE-Bench Pro у неё 58,7% против 64,7% у Grok 4.5 и 63,2% у Claude Sonnet 5. На DeepSWE – 49% против 67% у GPT-5.6 Luna. На знаниевых задачах GDPval-AA её 1421 Elo заметно уступает 1607 у Sonnet 5. Никто не подметает стол целиком: Google уверенно держит лидерство в компьютерном управлении, работе с графиками и длинным контекстом – и заметно отстаёт в чистом кодинге и научных задачах от топовых моделей конкурентов.
Вывод: это рабочая лошадка, а не чемпион. Если ваша задача – сложная, нетривиальная разработка с нуля, фронтир-модели (Claude 5, ChatGPT 5.6, Gemini 3.1 Pro) всё ещё впереди. Если задача прогнать много рутинных, инструментально-насыщенных операций дёшево – 3.6 Flash сейчас одна из лучших сделок на рынке по соотношению цена/результат.

Модель стала хуже видеть
А вот это уже интереснее любого официального анонса – и почему-то почти никто про это не написал громко!
Джерри Лю, CEO компании LlamaIndex, прогнал Gemini 3.6 Flash через собственный бенчмарк ParseBench – тест на распознавание документов, таблиц и графиков, а не на код и рассуждения. И нашёл обратную сторону медали: на графиках новая модель проседает на 14 баллов относительно предшественницы – с 45,0% до 31,0% по метрике прохождения правил чтения графиков. Таблицы тоже слегка просели, с 91,1 до 89,5. Общий средний балл по документам упал с 69,9 до 66,8.

Почему это произошло, объясняется довольно прозаично, но метко: пока модель дообучали под код, рассуждения и агентные задачи, зрение для документов «застряло» – грубо говоря, веса модели конкурируют друг с другом за ограниченный ресурс и прирост в одном месте иногда покупается ценой просадки в другом. Не какая-то мистика, просто у этой модели ограниченная «ёмкость», и post-training распределяет её не поровну.
Для практики это значит следующее: если ваш пайплайн вытаскивает данные из счетов, распознаёт диаграммы в финансовых отчётах или работает с таблицами – апгрейд до последней версии по имени gemini-flash-latest может тихо сломать именно ту часть системы, которую вы меньше всего проверяете. Разработчики, которые работают с документами, знают этот страх: всё вроде обновилось, тесты прошли, а через неделю саппорт заваливают жалобами на «неправильно распознанные суммы».
Практический совет прост – закрепляйте версию модели явно (gemini-3.6-flash, а не «последнюю»), гоняйте одни и те же промпты через старую и новую версии на реальных документах, считайте точные совпадения по полям. Если работаете со счетами и суммами, оборачивайте вывод модели в схему (Pydantic или аналог) и добавляйте детерминированную проверку – например, что сумма позиций сходится с итогом. Пусть модель читает, а код – перепроверяет.
Как выстроить архитектуру вокруг новой линейки
Google фактически официально благословила паттерн, который и так уже используют многие команды в продакшене: разделение на «планировщика» и «рабочих».
Идея простая. Тяжеловесная модель придумывает план и разруливает финальный ответ. Дешёвые и быстрые модели выполняют промежуточные шаги – ищут, суммаризируют, кликают по интерфейсам, вытаскивают данные.
-
Планировщик: Gemini 3.6 Flash
-
Агенты извлечения данных: Gemini 3.5 Flash-Lite
-
Агенты суммаризации: Gemini 3.5 Flash-Lite
-
Агенты работы с интерфейсом: Gemini 3.5 Flash-Lite
-
Формирование финального ответа: Gemini 3.6 Flash
Это держит расходы низкими, но сохраняет качество там, где оно реально нужно, – в финальном решении.
Flash-Lite: тихий MVP этого релиза
Если 3.6 Flash – это заголовок анонса, то по-настоящему интересная модель здесь, возможно, Flash-Lite. Она не такая эффектная в презентации, но по соотношению цена/качество самая радикальная штука во всём релизе.
Скорость – 350 выходных токенов в секунду, самая быстрая модель линейки 3.5. Цена – $0,30 за миллион входных и $2,50 за миллион выходных токенов, то есть в разы дешевле старшей сестры. И при этом качество выросло не косметически:
|
Бенчмарк |
Gemini 3.1 Flash-Lite |
Gemini 3.5 Flash-Lite |
|---|---|---|
|
Terminal-Bench 2.1 |
31% |
54% |
|
GDM-MRCR v2 (длинный контекст) |
60,1% |
72,2% |
|
GDPval-AA v2 |
642 |
1140 |
По отдельным метрикам, вроде SWE-Bench Pro (54,2% против 49,6%) и OSWorld-Verified (74,0% против 65,1%), Flash-Lite даже обгоняет более старую и более крупную Gemini 3 Flash. Самая дешёвая модель линейки обходит по некоторым тестам вчерашний мидл-тир – вот это уже действительно смешно в хорошем смысле.

Для сравнения с конкурентами: Claude Haiku 4.5 стоит $1 за вход и $5 за выход (заметно дороже) и по большинству опубликованных метрик уступает Flash-Lite. GPT-5.4 mini местами выигрывает отдельные бенчмарки вроде Terminal-Bench, но Flash-Lite стоит примерно треть его цены. Для задач вроде массовой классификации обращений, перевода или разбора каталогов товаров цена за вызов почти всегда важнее пары лишних процентов на бенче.
Flash Cyber: модель, которую не дадут потрогать
А вот эта история, пожалуй, самая любопытная из трёх!
Gemini 3.5 Flash Cyber построена поверх 3.5 Flash и дообучена специально на поиск, проверку и патчинг уязвимостей в коде. Работает она внутри агента безопасности CodeMender – там сразу несколько экземпляров модели параллельно анализируют разные участки кода, затем сводят находки в единый отчёт. Идея похожая на код-ревью в команде: несколько человек смотрят на один PR с разных углов, потом сверяют выводы.
По официальным данным Google, на V8 (движок JavaScript в Chrome) модель нашла 55 уникальных реальных проблем против 47 у обычной 3.5 Flash и 36 у Claude Opus 4.6, причём 10 из этих проблем не нашла ни одна другая модель. Команда Google по исследованию уязвимостей в облаке отчиталась, что с помощью Flash Cyber нашла уязвимость типа memory corruption в продакшен-сервисе и собрала рабочую цепочку эксплойта (с обходом ASLR и W^X) всего за два часа.
На бенчмарке CyberGym картина честнее, чем кажется на первый взгляд:
|
Система |
Результат CyberGym |
|---|---|
|
GPT-5.5-Cyber в агенте OpenAI |
85,6% |
|
Claude Mythos 5 в агенте Anthropic |
83,8% |
|
GPT-5.6 Sol в агенте OpenAI |
83,6% |
|
Gemini 3.5 Flash Cyber в CodeMender (до 5 вызовов) |
83,2% |
|
Claude Mythos Preview в агенте Anthropic |
83,1% |

Читаем честно: Flash Cyber не возглавляет эту таблицу. Она четвёртая из пяти, отстаёт от специализированной модели OpenAI на 2,4 балла и от Mythos 5 – на 0,6. Заявление Google звучит как «конкурентоспособный результат на уровне фронтира», и это правда – но это заявление про цену, а не про безоговорочное первенство.
Из-за очевидной двойственности применения (то, что находит уязвимости для защиты, точно так же годится и для атаки) Google открывает доступ крайне осторожно – сначала только госорганизациям и доверенным партнёрам. Обычным разработчикам эту модель остаётся разве что оценивать по опубликованным метрикам. Google фактически повторяет подход Anthropic к моделям Mythos.
Почему именно сейчас – и что с Gemini 3.5 Pro прямо сегодня
Запуск случился прямо перед квартальным отчётом Alphabet – и незадолго до этого акции Google просели почти на 4% на новостях о задержке флагмана. Три конкретных релиза среднего тира вместо пустых рук на звонке с инвесторами – решение, которое сложно назвать случайным совпадением по датам.

По сообщениям СМИ, задержка Gemini 3.5 Pro связана с внутренними бенчмарками по кодингу. Модель не дотянула до планки компании и отправилась на переобучение.
И тут важная деталь: похожая история происходит не только у Google. Флагманские модели у нескольких лабораторий одновременно упираются в одну и ту же стену – качественного, ещё не использованного текста для претрейна становится физически меньше, а обучение на синтетических данных склонно к деградации по цепочке, когда сеть учится повторять привычки «учителя» вместо того, чтобы находить что-то новое. Отрасль постепенно смещается от простого «больше данных, больше параметров» к тест-тайм-compute – трате вычислений уже во время ответа модели, а не только во время обучения. И для такого подхода нужна как раз дешёвая, быстрая модель для генерации множества вариантов ответа с последующей проверкой – то есть ровно то, чем является Flash.
На сегодняшний день, 25 июля 2026 года, Gemini 3.5 Pro всё ещё не вышла публично. Компания подтверждает, что тестирует модель с партнёрами, и обещает «выпустить, как только будет готова», без конкретной даты. Прогнозные рынки склоняются к концу июля – началу августа. Параллельно DeepMind подтвердила старт «самого амбициозного претрейна» – для Gemini 4.
Что делать прямо сейчас
Если вы уже сидите на Gemini 3.5 Flash – переход почти не требует раздумий. Модель дешевле, быстрее и лучше почти по всем опубликованным метрикам, кроме одной оговорки про распознавание графиков и таблиц (см. выше). На уровне API миграция минимальна: сменить строку модели на gemini-3.6-flash, заменить параметр thinking_budget на thinking_level, убрать из запроса больше не поддерживаемые temperature, top_p и top_k.
Если вы выбираете между семействами моделей… Для глубокой разработки – фронтир-модели вроде GPT-5.6, Grok 4.5 или Claude 5 пока держат преимущество. Для работы с документами, экраном и большими объёмами данных 3.6 Flash – один из лучших вариантов по соотношению цена/результат.
Если же нагрузка потоковая – присмотритесь к Flash-Lite, разница в цене там буквально в разы.
Google не дала нам того флагмана, которого ждали в мае. Зато дала три модели, которые для большинства реальных рабочих сценариев решают задачу лучше, чем ещё одна строчка в таблице интеллектов.
ссылка на оригинал статьи https://habr.com/ru/articles/1062994/