Mistral выпустила модели машинного обучения для кода и математики

от автора

Mistral представила модели машинного обучения MathΣtral и Codestral, предназначенные для решения математических задач и генерации кода соответственно. Обе нейросети опубликованы под лицензией Apache 2.0.

MathΣtral представляет собой базовую языковую модель Mistral 7B, дополнительно обученную на математических данных и полном курсе STEM (Science, Technology, Engineering, Mathematics). Нейросеть создавали вместе с исследователями из Project Numina, которые специализируются на разработке математических моделей.

Нейросеть Codestral предназначена для генерации кода и построена на архитектуре Mamba V2. Модель с 7 млрд параметрами бесплатная и доступна всем пользователям, также есть версия с 22 млрд параметрами, но для неё надо приобрести коммерческую лицензию.

В тестах MathΣtral превосходит другие открытые нейросети, но пока уступает проприетарным моделям машинного обучения. Codestral также не дотягивает до производительности Llama 3 8B и других закрытых моделей.

Обе нейросети открыты и доступны на платформе Hugging Face (1, 2). Там же можно найти инструкции по установке и запуску.


ссылка на оригинал статьи https://habr.com/ru/articles/829884/


Комментарии

Добавить комментарий

Ваш адрес email не будет опубликован. Обязательные поля помечены *