Эта статья — перевод оригинальной статьи «Introducing Grok 4.6».
Также я веду телеграм канал «Frontend по‑флотски», где рассказываю про интересные вещи из мира разработки интерфейсов и AI.
Вступление
Сегодня мы выпускаем Grok 4.6. Новая версия развивает возможности Grok 4.5, уделяя особое внимание долго работающим агентам, а также более сложным интерактивным и визуальным задачам.
Grok 4.6 лучше справляется с комплексными задачами, требующими множества последовательных шагов: от исследования темы и анализа информации до работы с большой кодовой базой и превращения идеи в полноценное, отполированное приложение или готовый рабочий материал.
Grok 4.6 демонстрирует передовой уровень возможностей в ряде бенчмарков, оценивающих агентное программирование и интеллектуальные рабочие задачи. В Artificial Analysis Intelligence Index — сводном рейтинге, объединяющем результаты девяти бенчмарков, модель показывает результат на уровне GPT-5.6 Sol.
AA Intelligence

GDPVal-AA

DeepSWE 1.1

CursorBench 3.2

FrontierCode 1.1

Grok 4.6 уже доступен в Cursor и Grok Build. В течение первой недели мы удваиваем включённый объём использования Grok 4.6 в Grok Build и Cursor, чтобы вы могли сразу начать тестировать новую версию.
Обучение Grok 4.6
Grok 4.6 прошёл более длительный этап дополнительного обучения, чем Grok 4.5. Для него использовались тщательно отобранные данные, сгенерированные моделями, в том числе для развития рассуждений и понимания сложных технических концепций, а также высококачественные инженерные данные, улучшенный оптимизатор и обновлённая методика обучения. Всё это позволило создать более прочную основу для последующих этапов SFT и RL.
Затем мы использовали Grok 4.5, чтобы заново сгенерировать SFT-траектории для различных уровней сложности рассуждений, агентных окружений и таких областей, как STEM, разработка ПО и интеллектуальная работа. Проблемные цепочки при этом отфильтровывались с помощью автоматических проверок на базе моделей. Полученный после SFT чекпоинт показал высокую производительность и более качественное поведение модели.
Grok 4.6 также обучался с помощью reinforcement learning на широком наборе агентных задач: от интеллектуальной работы и программирования общего назначения до специализированных сред, связанных с оптимизацией ядер, веб-разработкой, системами автоматизированного проектирования (CAD) и другими областями.
От амбициозной идеи к работающему проекту
Мы протестировали Grok 4.6 на проектах, специально подобранных так, чтобы проверить широту его возможностей и способность последовательно работать над задачей на протяжении большого количества шагов. Особенно хорошо модель показала себя в превращении общей продуктовой идеи в первую рабочую версию. Она может самостоятельно изучить незнакомую предметную область, продумать структуру приложения, реализовать ключевые сценарии взаимодействия, а затем продолжать улучшать результат в несколько итераций с учётом обратной связи.
На более длинных последовательностях работы мы также стали чаще замечать элементы самопроверки и верификации: прежде чем двигаться дальше, модель проверяет результаты собственной работы.
В визуальных и интерактивных проектах Grok 4.6 уже с первой попытки выдаёт более качественный результат, чем мы обычно наблюдали у Grok 4.5. Получив конкретную продуктовую идею, модель способна за один проход сформировать как структуру приложения, так и его визуальный язык. Это делает её особенно полезной в проектах, где быстрее всего прийти к хорошему результату можно, сразу начав с достаточно полноценной версии, а затем последовательно улучшая её в процессе итераций.
Безопасность и возможности
Механизмы защиты Grok 4.6 были улучшены и откалиброваны с учётом возросших возможностей модели.
Наша система безопасности спроектирована так, чтобы максимально сочетать полезность и защищённость в легитимных сценариях использования. Благодаря этому Grok 4.6 может эффективно и безопасно применяться, например, для устранения уязвимостей, ускорения инженерного проектирования и поддержки исследований в области ИИ.
Подход к оценке безопасности также был расширен в соответствии с новыми возможностями Grok 4.6. Перед выпуском модель прошла самый широкий набор тестов за всю нашу историю, как на сами возможности, так и на корректность настройки защитных механизмов. После запуска мы также проводим масштабное дополнительное тестирование, включая проверки со стороны независимых третьих сторон.
Оценка качества
|
Benchmark |
Grok 4.6 High |
Grok 4.5 High |
GPT-5.6 Sol Max |
Fable 5 Max |
|---|---|---|---|---|
|
AA Intelligence Index |
61 |
56 |
61 |
62 |
|
GDPVal-AA v2 |
1753 |
1526 |
1728 |
1741 |
|
CursorBench v3.2 |
69.9% |
66.7% |
67.2% |
70.5% |
|
DeepSWE v1.1 |
65.9% |
54% |
73% |
70% |
|
FrontierCode v1.1 (Extended) |
61.3% |
56.6% |
60.6% |
63.6% |
|
APEX-Agents |
57.5% |
47.1% |
56.7% |
59.2% |
|
Terminal-Bench v3.0 |
26% |
15.7% |
34.6% |
34.1% |
|
APEX-SWE |
56.4% |
53.6% |
— |
58.8% |
|
AA-Briefcase |
1577 |
1313 |
1502 |
1574 |
|
Harvey LAB (Vals) |
15.8% |
12.9% |
2.5% |
11.3% |
Начало работы с Grok 4.6
Grok 4.6 уже доступен в Cursor и Grok Build. Модель также можно использовать через API, а также на платформах партнёров, включая OpenRouter, Vercel и Cloudflare.
Стоимость начинается от $2 за миллион входных токенов и $6 за миллион выходных токенов. Кроме того, доступна ускоренная версия модели, которая стоит в два раза дороже.
В течение первой недели мы удваиваем включённый объём использования Grok 4.6 в Grok Build и Cursor, чтобы вы могли сразу начать знакомство с новой версией.
ссылка на оригинал статьи https://habr.com/ru/articles/1069844/