Имаго для больших компаний

—

от автора

В первой части я описал имаго-подход для малого и среднего бизнеса: харнесс собирает знания, RAG приносит факты, а LoRA-адаптер приносит привычки. Сразу после публикации мне задали вопрос: «А что делать большому предприятию, у которого не один проект, а сотни репозиториев, десятилетия истории и своя инфраструктура? Неужели тоже адаптер?»

Этим вопросом задался крупный международный медиахолдинг Thomson Reuters. Чтобы понять размеры этого мамонта, скажу, что капитализация компании превышает 80 миллиардов долларов, а работают в ней более 24 000 сотрудников по всему миру. Компания предоставляет профессиональную информацию, аналитику и программное обеспечение для юристов, налоговых и бухгалтерских служб, а также владеет всемирно известным новостным агентством Reuters.

Вместо того чтобы взять облачную фронтир-модель, компания наняла три десятка ученых мужей и за три месяца используя 368 GPU B200 они создали собственную модель Thomson. Это не кодовая модель, она сделана для права, налогов и журналистики. По замыслу это тот же имаго-подход: сделать модель частью организации, а не арендовать фронтир-модель, которая выдает среднее по больнице в их сфере.

За основу взяли два открытых чекпойнта: Qwen3.5-397B (MoE, 17B активных параметров) и Qwen3.6-35B. Получились Thomson-1.0-Large и Thomson-1.0-Small. Финальный прогон Large оценивается меньше чем в 450 тысяч долларов и занял три недели. Вся разработка, с людьми, экспертами и вендорами, обошлась в 40 миллионов долларов, причем большую часть авторы относят на переиспользуемые исследования и инфраструктуру.

По агрегированным бенчмаркам (включая кодинг, где Thomson заметно слабее!) Thomson Large набрал 78.5% против 75.7% у Claude Sonnet 5. Лидером тестов стал Claude Opus 4.8 с 79.5%.

Казалось бы, результат хороший: дообученный Qwen работает на уровне фронтир-моделей, чистый имаго. Но какой смысл тратить 40 млн долларов, чтобы встроиться между двумя моделями от Антропик?

Смысл на самом деле есть. Большая часть этой суммы ушла не на обучение, а на систему, которую авторы назвали фабрикой моделей. Это воспроизводимый конвейер, который превращает открытый чекпойнт и закрытые данные организации в управляемую систему. Важна не конкретная модель, а методология, которая позволяет корпорации владеть своей моделью, данными и инструментами.

Это тот же имаго-подход, что я использую в кодинге, только в масштабе большой корпорации. Я беру веса на ~30-35B, они берут 397B веса той же архитектуры. У меня переобучение под новую модель занимает пару дней, у них пару недель. Моя адаптация стоит копейки, у них не больше 450 тысяч долларов, что тоже копейки для такой корпорации.

Структурно их система состоит из трех этапов: ценности, знания и навыки (поведение).

На первом этапе модель переучивают под свою конституцию. Сначала нежелательное поведение убирается прямой правкой весов без обучения, затем закрепляется дополнительным обучением. В ходе поиска эти правки были реализованы через LoRA-адаптацию (чистый имаго-кодинг).

На втором этапе идет продолжение предобучения на закрытых данных. Авторы называют его промежуточное обучение (mid-training), потому что оно идет поверх уже инструктированной модели. Из корпуса размером больше 19 трлн токенов, собранного в компании, оставили всего 200 млрд, то есть отбросили более 98%.

Именно так в имаго подходят к обучающим данным. Даже состав выборки одинаков: она состоит примерно из трех равных частей. Это отобранные проприетарные документы, их синтетические пересказы (документ превращается в самодостаточный урок с вопросами и ответами) и реплей общих данных против забывания. Дальше идет то, до чего я еще не додумался: после обучения полученный чекпойнт смешивается по весам с чекпойнтом до обучения. Подход интересный, нужно будет проверить его на средних моделях.

На третьем этапе идет окончательная полировка и обучение агента глубокого исследования с помощью двух этапов, прямой оптимизации предпочтений (DPO) и обучения с подкреплением (RL). Это позволяет модели работать с собственным набором инструментов организации.

Отдельного обучения с учителем (SFT) нет: авторы указывают, что он слишком быстро портит остальные способности, даже с реплеем. Это совпадает с моими экспериментами над средними моделями.

Авторы модели сравнивали слияние весов из второго этапа с несколькими способами регуляризации на той же смеси данных: с низкоранговой адаптацией, с пониженным learning rate и с более короткими расписаниями. Каждый из них уменьшал потерю общих способностей, но настолько же ослаблял адаптацию к домену. После постобучения ни один такой чекпойнт не превзошел модель, обученную без промежуточного обучения. Слияние с агрессивным обучением, наоборот, оказалось лучше сразу по обеим осям.

Для имаго-кодинга из этого следует важное уточнение. Мой режим из первой части представляет собой инструктивное дообучение на сотнях или тысячах отобранных примеров, и именно там LoRA работает хорошо. Режим Thomson представляет собой продолженное предобучение на сотнях миллиардов токенов, а там низкий ранг упирается в потолок. То есть LoRA лишь первый этап имаго для больших моделей. Дальше идет слияние полученного чекпойнта с исходным и окончательная полировка. Это дает лучший результат из возможных на текущий момент.

На самом деле совпадений даже больше:

Модель является частю организации. В имаго строитель знает проект, его сущности и конвенции. В Thomson модель знает корпус организации и ее ценности. Это одна и та же идея в разном масштабе.

Концепция трех слоев остается на месте: в моей схеме это харнесс, RAG и адаптер. У Thomson это глубокое исследование с собственными инструментами, знания в весах и обучение работе с этими инструментами. Обратите внимание: авторы обучают модель пользоваться именно своим набором инструментов. Это прямая параллель с тем, как я обучаю строителя вместе с найденным контекстом (идея RAFT).

Данные по-прежнему важнее объема. Авторы отбрасывают 98% корпуса и пересказывают остальное в форме «урока». Это то же самое «больше не значит лучше» из моей первой части, только в промышленном исполнении. Также для Thomson тезис «данные не покидают контур» является одним из основополагающих принципов. Для меня он тоже был одной из двух причин отказаться от фронтира.

Наличие «вкуса» у модели. Я писал, что адаптер, обученный на прошедших проверку решениях, дает модели вкус к отбору. Thomson делает то же на предпочтениях: пары «выбранный / отклоненный» строятся так, чтобы модель училась отличать верное правдоподобное от неверного правдоподобного. Это более строгий механизм, чем мой, и я думаю, что его стоит перенять.

При всем этом у нас абсолютно разные домены. Авторы специально не затачивали модель под работу с кодом, поэтому перераспределение весов произошло в том числе за счет ухудшения навыков написания кода. Кодинг остается единственным доменом, который сами авторы называют пострадавшим от забывания, но он и не был целью обучения. При этом улучшилась работа с длинным контекстом, а агентные задачи тоже стали решаться лучше.

Thomson также отказался от изолированного обучения с учителем из-за забывания. Для меня это повод попробовать LoRA-DPO вместо чистого SFT в схеме из первой части.

Чем больше информации появляется о подобных подходах, тем лучше выстраивается схема имаго-подхода. Сейчас она выглядит так:

Начинать стоит с адаптеров: один общий адаптер на корпоративные конвенции и отдельные адаптеры на команды или уровни доступа. Слой знаний нужно оставить в RAG, потому что версии, схемы и документация меняются слишком быстро, чтобы держать их в весах. Затем идет подготовка обучающих данных: пересказ документов в самодостаточные «уроки», восстановление вопросов из документов и небольшой датасет. Затем используется верификатор, но с нюансами: в юридической области отчеты нельзя проверить детерминированно, поэтому приходится строить сложные механизмы наград для обучения с подкреплением. У кода же есть тесты, компилятор и линтеры, поэтому тут с верификацией все гораздо проще.

Заключение

Thomson показывает, что идея «модель как часть организации» масштабируется вплоть до создания моделей фронтир-класса за разумные для крупной компании деньги. Для имаго-кодинга это подтверждение общего принципа: разные знания меняются с разной скоростью, и хранить их надо в разных слоях. Быстрые факты лежат в RAG, привычки команды в адаптерах, медленные знания предметной области в весах.

Если вы одиночка или небольшая команда, адаптер и RAG остаются вашей рабочей лошадкой. Если вы предприятие со своим языком, десятилетиями кода и людьми, которые могут собрать датасет, полные веса становятся реальной опцией. Но даже тогда начинать стоит с датасета организации: он переживет любую базовую модель.

ссылка на оригинал статьи https://habr.com/ru/articles/1088296/