Основной апгрейд пришёлся на агентное программирование, длинные задачи и повседневную работу с документами, таблицами и презентациями.
По данным Anthropic, Sonnet 5.5 генерирует ответы 30 с лишним процентов быстрее Sonnet 5. При этом цена токенов осталась прежней, но сама задача обычно обходится дешевле: модель тратит меньше токенов и делает меньше шагов. В тестах Anthropic экономия достигала 30% на задачу.
Самый заметный прирост — в программировании:
|
Бенчмарк |
Sonnet 5.5 |
Sonnet 5 |
|
Terminal-Bench 4.0 |
70,6% |
10,3% |
|
CursorBench 4.0 |
55,5% |
34,1% |
|
FrontierCode 1.1 |
46,2% |
42,4% |
|
GDPval-AA v2.1 |
1844 |
1449 |
|
OSWorld 2.1 |
80,1% |
57,0% |
|
Humanity’s Last Exam, с инструментами |
64,5% |
54,9% |
В агентном кодинге модель стала экономнее. По словам Anthropic и ранних тестеров, Sonnet 5.5 быстрее разбирается в больших кодовых базах, умеет объединять вызовы инструментов и завершает задачи за меньшее число шагов. Например, Lovable зафиксировала примерно на треть меньше tool calls и почти вдвое меньше shell-вызовов.
Сильнее стала и работа с компьютером и визуальными данными. На OSWorld 2.1 модель набрала 80,1%, на Chartography — 61,6% против 15,6% у Sonnet 5. Anthropic также заявляет заметный прогресс на длинных knowledge-work задачах и в создании документов, презентаций и таблиц.
При этом API-тариф не изменился:
$2 / 1 млн входных токенов
$10 / 1 млн выходных токенов
$0,20 / 1 млн cache reads
Есть и отдельное изменение по безопасности: из-за роста возможностей в кибербезопасности Sonnet 5.5 впервые для линейки Sonnet получила защитные механизмы, близкие к тем, что используются в старших моделях. Для части высокорисковых киберзадач модель может откатываться на Sonnet 5.
Claude Sonnet 5.5 уже доступна в Claude и API, а также через AWS, Google Cloud и Microsoft Azure. API ID — claude-sonnet-5-5. Anthropic также готовит Claude Haiku 5.5, который должен выйти в ближайшие недели.
ссылка на оригинал статьи https://habr.com/ru/articles/1087782/