Всем привет, на связи команда HiveTrace!
Мы уделяем много времени разработке собственных моделей и часто задаемся вопросом: «какой из двух гардрейлов лучше?».
Если вы когда-нибудь выбирали guardrail-модель для LLM, то знаете: одни модели блокируют безобидные запросы, другие пропускают явные угрозы. Хуже всего то, что нет прозрачного стандарта сравнения. Авторы оценивают свои решения субъективно, не публикуют методологию, а результаты замеров одних и тех же моделей на одинаковых бенчмарках в разных статьях часто отличаются.
Поэтому мы создали CLI, который назвали GuardRateTools — это автоматизированный пайплайн оценки guardrail-моделей. Его интерфейс – HiveTrace GuardRate Leaderboard, уже открыт для просмотра. GuardRateTools интегрирован в CI/CD процесс дообучения внутренних guardrail-моделей и обеспечивает честное сравнение моделей в равных условиях.
CLI запускает проверку одной командой: подтягивает датасеты и конфигурацию модели из YAML, разворачивает изолированную среду, которая создается индивидуально для каждой модели, прогоняет модель по фиксированному набору бенчмарков и считает метрики. Сырые ответы от модели, логи и итоговые метрики сохраняются в артефакты, поэтому любой результат можно проверить и воспроизвести. Автоматизация исключает ручной труд, снижает влияние человеческого фактора и сокращает время оценки новых решений в области гардрейлов.
HiveTrace GuardRate Leaderboard уже доступен для всех! В третьем квартале 2026 года мы выложим исходный код CLI. Если хотите протестировать свою модель, свяжитесь с нами. Контакты вы найдёте в конце статьи.
Это первая из двух статей. Здесь — зачем нужна арена,и как пользоваться лидербордом наши инсайты из первого аудита. Во второй части — методология отбора бенчмарков, формулы метрик и как устроен пайплайн.
Навигация по лидерборду: от сводной таблицы до методологии
Мы понимаем, что у всех разные задачи и уровень подготовки. Поэтому мы разделили информацию на три понятных уровня — от быстрого выбора модели до глубокого технического анализа.
1. Агрегированный рейтинг и визуализация (разделы «Рейтинг» и «Визуализация»)
Здесь всё просто и понятно. Не нужно быть экспертом в области машинного обучения, чтобы разобраться, какая модель лучше.
На главном экране лидерборда вы увидите сводную таблицу моделей в порядке их ранжирования. А во вкладке визуализации найдете интерактивные дашборды для быстрого сравнения.
Integral Score — это главная оценка качества. Чем выше балл, тем надёжнее модель. Используйте его как «рейтинг в магазине», чтобы быстро сравнить модели..
Метрики производительности (latency p95) — это время ответа от модели и стабильность работы и стабильность работы. Ключевые показатели, чтобы понять, потянет ли модель вашу нагрузку в продакшене.
Визуализация — это графики и схемы вместо сухих таблиц. Помогают за секунды определить сильные и слабые стороны модели.
2. Детальные технические отчёты (раздел «Детали»)
Глубокий разбор для тех, кто внедряет модель и отвечает за её работу в продакшене. Содержит полные метрики по сплитам, анализ поведения модели в сложных сценариях, выявленные «слепые зоны» и кейсы, где модель показывает наилучшие результаты.
3. Раздел «Методология»
В этом разделе мы честно и открыто объясняем, как формируем оценки и почему им можно доверять. Здесь вы найдёте формулы метрик и детали их расчёта. Вся информация доступна для независимой проверки.
Метрики: почему F1 не подходит
Модели guardrail нельзя «судить» только по точности (accuracy) или F1. Эти показатели зависят от баланса классов, поэтому их нельзя объективно сравнивать между разными бенчмарками. Если просто блокировать всё подряд, то можно получить как идеальный результат так и нулевой. Всё зависит от датасета.
Например, на HarmBench (p≈1, почти все промпты вредоносные) блокировка всего подряд даст F1 = 1.0. А на OverRefusalBench or-bench-hard-1k (где все метки 0 — только безопасные промпты) эта же стратегия обрушит F1 до нуля.
Поэтому мы сфокусировались на двух, по нашему мнению важных, показателях:
-
FPR (False Positive Rate) — как часто модель ошибочно блокирует хороший контент.
-
FNR (False Negative Rate) — как часто она пропускает реальную угрозу.
Эти метрики считаются внутри каждого класса, поэтому они объективно отражают качество модели и не зависят от пропорции классов в бенчмарке.
Для ранжирования моделей мы агрегируем оценки по сплитам, затем по бенчмаркам и в конечном итоге приводим к единому показателю — Integral Score. Формулы агрегации, анализ «слепых зон» и ноутбук с расчётами — во второй части.
Как выбирать модель: практические советы
Во-первых, если вы хотите обеспечить максимальную безопасность, то в первую очередь следует обратить внимание на FNR — показатель пропуска угроз. Лучшие модели — Qwen3Guard, Alibaba-AAIG XGuard и Llama.
Во-вторых, обратите внимание на FPR — это процент ложных блокировок. Если он высокий, то пользователи будут жаловаться.
В-третьих, для систем реального времени важна задержка. Маленькие модели (0,6B) работают быстро, но не так точно, как большие (8B+).
И ещё одно важное правило: проверьте слабое звено модели. Если ваш проект уязвим к определённому типу атак, не берите модель, которая плохо справляется с этим типом атак, даже если у неё высокий общий рейтинг. Лучше использовать ансамбль моделей, чтобы компенсировать слабые стороны.
Инсайты (snapshot 24 июля 2026 г.)
Архитектура и размер моделей
1. Архитектура важнее размера.
YuFeng-XGuard-Reason-8B (0.761) — лидер по интегральному скору, но её преимущество объясняется не только 8B параметрами, а специализацией на рассуждениях и защите от сложных jailbreak’ов, сохраняя баланс безопасности и полезности (11.1% FNR на MultiJail, FPR 21.1% и FNR 3.1% на OR-Bench).
2. Малые модели могут быть сильнее крупных
HiveTraceGuard-Pro (0.6B) (0.743) обходит OpenGuardrails-Text-2510 (15B) (0.738) и Qwen3Guard-Gen-8B (0.726) по интегральному скору. Это доказывает, что оптимизация под безопасность важнее масштаба.
3. NVIDIA Nemotron — мощная, но медленная.
Llama-3.1-Nemotron-Safety-Guard-8B-v3 имеет интеграл 0.712, но p95 = 398.3 мс — худший показатель среди топ-10. Архитектура даёт точность, но ценой высокого latency.
4. Среди лидеров — decoder-base модели
Первые 19 мест занимают LLM-based guardrails (генеративные модели), которые используют reasoning и генерацию вердиктов. Первый классификатор (HiveTraceLite, 0.3B) появляется только на 20 с интегралом 0.618, отставая от лидера на 19%.
Метрики и компромиссы
5. FNR vs FPR — ключевой компромисс
Что касается метрик и компромиссов, то у лидера (YuFeng-8B) FNR (пропуск риска) равен 12,2 % (это низкий показатель), но FPR (блокировка легитимного запроса) — 21,8 % (высокий). У Qwen3Guard-Gen-8B FNR равен 10,6 % (лучше), но FPR — 24,7 % (хуже). Это говорит о разных стратегиях: «не пропустить вред» против «не блокировать легитимное».
6. Дефолтные LLM-судьи часто «переотказывают»
Модели типа Llama-Guard-3-8B имеют высокий FNR (34.7%) — они слишком осторожны и часто блокируют даже полностью безопасные запросы.
7. «Идеальная» модель на графике FPR×FNR почти не существует
Все точки отстоят от (0,0); лучшая — YuFeng-8B (FPR=0.218, FNR=0.122), но даже она допускает >12% пропусков вреда. Реальная безопасность — это управление риском, а не достижение нуля.
8. Критическая уязвимость у ultra-light моделей
Llama-Prompt-Guard-2-22M (0.022B) деградирует до тривиального классификатора (интеграл ≈0.000, FNR 98.9% при низком FPR 0.4%), пропуская почти все атаки. Nandi-Mini-150M (0.15B) ошибается в обе стороны (высокие FPR 22.2% и FNR 53.1%) при аномально высокой задержке p95 = 323.5 мс.
Задержка и эффективность
9. Низкая задержка ≠ низкое качество
YuFeng-XGuard-Reason-0.6B (0.6B) имеет p95 = 24.7 мс и интеграл 0.719; флагманская YuFeng-XGuard-Reason-8B (8B) — p95 = 102.6 мс и интеграл 0.761. Лёгкие модели достигают ~95% производительности лидеров, работая в 7.8 раза быстрее и занимая в 13.3 раза меньше параметров.
Языки и культурный контекст
10. Язык и культурный контекст важны
HiveTracePro (raft-security-lab 0.6B) демонстрирует яркий пример «культурной специализации»: на радар-чарте его область покрытия сильно смещена в сторону Robustness Test (real) и локальных датасетов, но имеет значительный провал в секторе jailbreak и чрезмерного отказа (OR-Bench, StrongReject++, MultiJail, XSTest). Обратная ситуация у модели WildGuard (AllenAI): высокий балл в XSTest, HarmBench, MultiJail, но критическое падение на русском и код-свитчинге.
Методология оценки
11. Специализированные классификаторы доминируют в узких задачах
DeBERTa-v3-base-prompt-injection-detection набирает 1.0 F1 на S-Eval, CSRT, Aya Red Teaming и XSafety — но её интегральный балл = 0, потому что она не универсальна (плохо работает на HarmBench, ToxicChat и др.).
Результаты: что изменилось
Когда мы замеряли этот процесс у себя внутри, полный аудит одной модели по 19 бенчмаркам занимал у инженера примерно 5 часов активного участия. Baseline замерялся на middle+ ML-инженере при 3+ повторениях. С появлением GuardRate это время сократилось до 30 минут. Таким образом, стоимость цикла (ставка 3 000 ₽/ч) снизилась с ~15 000 ₽ до ~1 500 ₽ (−90%). Разработка GuardRate окупается на 30-м прогоне.
|
Метрика |
Ручной аудит |
GuardRate |
Эффект |
|
Scope |
1 модель × 19 групп бенчмарков |
1 модель × 19 групп бенчмарков |
без изменений |
|
Активное время инженера |
~5 ч |
~30 мин |
−90% |
|
Подготовка данных |
~30 мин |
0 (авто) |
−100% |
|
Время подготовки модели – инференс |
~2.5 ч |
~20 мин |
−87% |
|
Анализ и отчётность |
~2 ч |
~10 мин |
−87% |
|
Стоимость труда (3 000 ₽/ч) |
~15 000 ₽ |
~1 500 ₽ |
−90% |
|
Ошибки человека |
2–3 |
0 |
исключены |
|
Воспроизводимость |
низкая |
высокая (Docker + версионируемые конфиги) |
гарантирована |
Hardware: A100 80GB, стоимость VPS без изменений (~840₽)
Что изменилось:
Теперь выбор моделей осуществляется на основе эмпирических показателей FPR и FNR, а не по статьям. Собрали единый eval-pipeline с метриками и описанием методологии. А визуализации на дашборде вскроет слабые стороны и проявит сильные.
При этом поддержка зоопарка Dockerfile требует дополнительных усилий: для моделей без поддержки vLLM приходится писать совместимый инференс и отдельно описывать зависимости в Docker-окружении. Кроме того, остаётся проблема, связанная с агрегированием метрики. Существует так называемая слепая зона, которая требует учета min(Sds). Кроме того, разница мест в топ-3 рейтинга часто укладывается в шум однократного прогона, поэтому для устойчивых выводов необходимы повторные замеры.
Что дальше?
Во второй части — как мы отбирали бенчмарки для проверки, как устроена архитектура, описание пайплайна и setup для проведения эксперимента, формула Integral Score. А ещё там есть про проблему, когда метрика не видит всей картины, и как мы всё это проверили.
А пока — заходите на публичный HF Space, пробуйте, смотрите, выбирайте лучшую guard-модель под ваш проект.
Предложения, о добавлении вашей модели на наш лидерборд, мы ждём на почту — sofya.balaba@raftds.com
Автор статьи и создатель этого лидерборда — Софья Балала из HiveTrace & AI Security Lab.
Я хотела бы поблагодарить Антона Малыхина и Никиту Облакова за их помощь в создании этого замечательного инструмента.
ссылка на оригинал статьи https://habr.com/ru/articles/1067854/