Еще один день без Le Chaton Fat

от автора

Толстый котик

Толстый котик

TL;DR. 4 августа Mistral выложил Shieldstral — 3B-классификатор безопасности с открытыми весами под Apache 2.0. Главная идея: политика модерации задаётся не весами, а вопросом в промпте, а вердикт читается из логитов двух токенов. Модель в 7 раз меньше конкурентов и при этом не хуже. А заодно это отличный повод поговорить о том, почему европейские лабы уверенно делают OCR и TTS и так же уверенно не делают фронтир-LLM.


Проблема, которую все обходят стороной

Если вы когда-нибудь ставили guardrail перед своим LLM-приложением, то знаете эту боль. Берёте Llama Guard (или любой другой guard-модель), а он приходит с зашитой в веса таксономией вреда: насилие, оружие, селфхарм, ещё десяток категорий, спасибо, до свидания.

Дальше выясняется, что ваша конкретная таксономия не совпадает с их конкретной таксономией. Потому что «небезопасный контент» — это не свойство текста, а функция от продукта, аудитории и момента. Обсуждение эксплойта — норма для пентест-платформы и катастрофа для приложения с подростковой аудиторией. Разговор про дозировки — норма для медицинского ассистента и красный флаг для чат-бота поддержки.

И вот тут начинается веселье: чтобы перетаргетить guard-модель под новый контекст, её надо дообучать. Каждый раз. Под каждый продукт. Под каждое изменение политики.

Плюс более фундаментальная проблема, которую Mistral честно проговаривает в блогпосте: единственно правильного набора категорий не существует в принципе. Не потому что до него ещё не додумались, а потому что определения безопасности расходятся между доменами по сути, а не по формулировкам.

Решение: модерация как бинарный QA

Shieldstral переворачивает задачу. Вместо «классифицируй контент по N категориям» — «ответь да или нет на вот этот вопрос».

Запрос состоит из трёх блоков:

<Instruct>  — контекст оценки, строгость, опционально определение              того, что считать небезопасным<Query>     — один вопрос с ответом да/нет              («Does this content promote physical violence?»)<Document>  — то, что судим: промпт, ответ модели,              пара промпт-ответ, картинка или картинка + текст

На инференсе модель ничего не генерирует. Она делает один forward pass, берёт логиты токенов yes и no, нормализует их софтмаксом — и отдаёт непрерывный скор от 0 до 1. Порог вы выставляете сами, под свою цену ошибки первого и второго рода.

Что это даёт на практике:

  1. Политика живёт в промпте, а не в весах. Изменились требования комплаенса — переписали вопрос. Файнтюн не нужен, один чекпоинт обслуживает произвольное число политик.

  2. Одна модель вместо четырёх. Классификация входящих промптов, модерация ответов, детекция отказов и детекция токсичности — теперь это одна и та же задача с разным текстом в <Query>.

  3. Текст и картинки — один интерфейс. Мультимодальность здесь не отдельный пайплайн, а просто другой тип контента в <Document>.

  4. Скор вместо метки. Можно ранжировать по уверенности, строить очереди на ручную проверку, крутить пороги под разные поверхности продукта. С дискретным лейблом так не получится.

  5. Дёшево. Один токен на решение. Не 50 токенов chain-of-thought, не JSON-ответ, который надо парсить.

Последний пункт недооценивают. Если вы гоняете guardrail на каждый запрос и каждый ответ в проде, разница между «один forward pass» и «сгенерируй структурированный вердикт» — это разница в стоимости инференса в разы.

Статистика

Статистика

Как это обучали

Тут самое интересное, потому что архитектурного волшебства нет — вся работа сделана в данных. Основной тезис авторов прямолинеен: маленькая модель бьёт большие, если правильно приготовить данные. Правильно приготовить пришлось по четырём направлениям.

1. Унификация несовместимых датасетов

Публичные safety-датасеты не согласуются между собой ни по таксономиям, ни по лейблам, ни по конвенциям разметки: где-то бинарный флаг safe/unsafe, где-то многоуровневая мультилейбл-иерархия.

Всё это конвертировали в единый формат instruct–query–document через отдельный процессор на каждый датасет. Дальше — важная деталь: специально варьировали формулировки инструкций, вопросов и разделителей промпт-ответ, чтобы модель обобщала по смыслу вопроса, а не переобучалась на один конкретный стиль фразы.

И ещё одна: калибровали строгость по источникам. Строго для адверсариальных джейлбрейков, мягко для данных о качестве ответов. Смысл в том, чтобы модель училась не бинарной границе «плохо/хорошо», а калиброванной — той, которая потом осмысленно ложится на порог.

Итого около 54.1 млн сэмплов.

2. Учить различению, а не запоминанию

Вот это главный трюк, ради которого стоит читать техрепорт.

Если обучать на фиксированном наборе политик, модель научится классифицировать ровно эти политики. Она выучит «текст про оружие → unsafe», а не «этот текст нарушает именно политику А и именно не нарушает политику Б». На новые, пользовательские политики такое не переносится.

Поэтому авторы конструируют наборы намеренно похожих, легко путаемых политик и просят LLM переписать безопасный текст в контрастивные пары: каждая переписка сделана так, чтобы нарушать одну политику и не нарушать её соседку.

Модель вынуждена учиться проводить границу между близкими политиками, а не запоминать список запрещённых тем. Этот навык и переносится на политики, которых в трейне не было вообще — что, собственно, и есть заявленная policy adaptability.

3. Заземление на картинках

С визуальной безопасностью беда: небезопасную картинку нельзя насинтезировать LLM-кой так же дёшево, как небезопасный текст. Данных мало.

Что делали: добивали ограниченные модерационные датасеты обычными image-датасетами в качестве качественных негативов, мутировали запросы для аугментации и прогоняли каждую пару картинка–вопрос через vision-language реранкер, чтобы отсеять мислейблы и галлюцинации.

4. Мердж чекпоинтов

Файнтюн через LoRA, дальше — слияние трёх чекпоинтов через SLERP:

  • чекпоинт, калиброванный на публичных данных;

  • чекпоинт с тонкой дискриминацией политик, обученный на сгенерированных данных;

  • базовая instruct-модель.

Мердж собирает в одну модель и общую калибровку, и адаптивность к политикам, а instruction following из базовой модели переносится на задачу модерации. Обучали на собственной платформе Forge.

Что получилось

  • 3B параметров, влезает в одну карту на 16 GB.

  • Совпадает или обходит открытые guard-модели до 7× большего размера на текстовой безопасности, детекции отказов и адаптивности к политикам.

  • Заявлен новый SOTA на мультимодальной модерации.

  • Веса под Apache 2.0.

Оговорка для честности: конкретных чисел по бенчмаркам в блогпосте нет — только названия четырёх осей оценки и множитель 7×. За таблицами надо идти в техрепорт. Оценочные сэмплы, по заявлению авторов, held out из обучения.

Из ограничений, которые Mistral признаёт сам: многоязычность, устойчивость на длинных документах и более широкая мультимодальная безопасность — это всё в разделе «что дальше», то есть пока не решено.


А теперь про грустное: чем вообще занимается Mistral

Быстрый прогон по релизам за последний год:

Что

Когда

Mistral 3

декабрь 2025

Devstral 2 + Vibe CLI

декабрь 2025

Mistral OCR 3

декабрь 2025

Voxtral Transcribe 2

февраль 2026

Mistral Small 4, Leanstral, партнёрство с NVIDIA

март 2026

Forge (платформа кастомного обучения)

март 2026

Voxtral TTS

март 2026

Mistral Medium 3.5 + remote-агенты

май 2026

Physics AI (после покупки Emmi)

май 2026

Mistral OCR 4

июнь 2026

Leanstral 1.5 (Lean-пруверы)

июль 2026

Robostral Navigate (навигация для роботов)

июль 2026

Shieldstral

август 2026

Плюс ребренд Le Chat в Vibe и покупка инфраструктурного стартапа Koyeb. Пахали как черти, вопросов нет.

Теперь посмотрите на список ещё раз. Голос, зрение, документы, доказательства теорем, навигация роботов, мелкие модели, гардрейлы.

Всё, кроме фронтир-LLM.

Это не случайность и не моя интерпретация — это признал сам Arthur Mensch, сооснователь и CEO Mistral, в июльском посте:

у нас пока нет лучших языковых моделей, но мы постоянно сокращаем этот разрыв. В доменах, которые меньше упираются в компьют — голос, зрение, обработка документов — у нас state-of-the-art решения.

Ключевые слова — «меньше упираются в компьют». Это, по сути, вся аналитика в одном предложении, произнесённом человеком, который в тот же момент закрывает раунд на десятки миллиардов оценки.

Почему так

Деньги. Mistral поднял за всю историю порядка $4 млрд, сейчас закрывает раунд по оценке около €20 млрд. ARR — около $400 млн с прицелом на миллиард к концу года. Для Европы это выдающийся результат: рост с $20 млн за год. Для гонки — не тот масштаб. Anthropic сообщает о run-rate около $30 млрд. Годовой burn у американских лидеров измеряется величинами, сопоставимыми со всем историческим фандрейзингом Mistral.

Компьют. €4 млрд в дата-центры во Франции и Швеции, цель — выйти на гигаваттные мощности. По европейским меркам это огромные капвложения. По меркам гонки, где счёт идёт на гигаватты и десятки миллиардов ежегодно, это входной билет, а не преимущество.

Структура капитала. И это, мне кажется, недооценённый фактор. У OpenAI за спиной Microsoft (пусть отношения там и непростые), у Anthropic — Google и Amazon. У Mistral — ASML с долей около 11% и Nvidia в партнёрах. ASML прекрасная компания, но модель «гиперскейлер с огромным свободным денежным потоком спонсирует лабу компьютом в обмен на долю и доступ» в Европе просто не воспроизводится. Некому играть роль патрона такого размера.

Отсюда и разница в риск-профиле. Когда компьют фактически субсидирован стратегом, можно позволить себе спалить пару миллиардов на неудачный трейн-ран и пожать плечами. Когда каждый ран — это ваши собственные деньги из раунда, вы очень внимательно выбираете, где именно тратить FLOPs. И выбираете домены, где данные и инженерия решают больше, чем масштаб.

Shieldstral — идеальная иллюстрация. Там нет ни одного архитектурного прорыва. Есть очень аккуратная постановка задачи и очень аккуратная работа с данными. И этого хватило, чтобы 3B обошла модели в 7 раз крупнее. В доменах такого типа европейцы конкурентоспособны хоть завтра. В доменах, где решает грубый масштаб, — увы.

Стратегический вывод

Есть ощущение, что Mistral сознательно строит не «европейский OpenAI», а компанию, которая не разойдётся по швам, если в индустрии что-нибудь схлопнется (а пузыря, разумеется, никакого нет — что вы). Китайские лабы при этом методично ломают юнит-экономику снизу, выкладывая сильные открытые веса, что дополнительно обесценивает стратегию «догоняем фронтир и продаём подписку».

Выбранный путь напоминает Palantir: forward-deployed инженеры, развёртывание на инфраструктуре клиента, кастомные модели на данных заказчика, суверенитет как продуктовое свойство, а не как лозунг. Немецкий банк может держать модель целиком внутри своего периметра — с закрытыми американскими API так не получится. На фоне того, как в июне 2026 года экспортный контроль США временно повлиял на доступность передовых моделей, аргумент «данные не покидают Европу» перестал быть теоретическим.

Скучно? Возможно. Но это выглядит как бизнес, который переживёт коррекцию. Чего не скажешь про половину сегодняшних заголовков.


Источники:


Пишу про такое регулярно в телеграме: @techn0danya

ссылка на оригинал статьи https://habr.com/ru/articles/1067954/