
Компания AMD официально объявила о намерении приобрести стартап Taalas, разрабатывающий принципиально иной класс ускорителей для выполнения инференса нейросетей. Подавляющее большинство современных решений — от GPU NVIDIA® H200 и ускорителей AMD Instinct™ до специализированных тензорных процессоров — проектируются как программируемые вычислители. Они загружают веса модели из стеков HBM в регистры и вычисляют тензорные операции на универсальных исполнительных блоках. Подход Taalas несколько иной: архитектура чипа и веса конкретной модели «запекаются» непосредственно в структуру КМОП-кристалла.
Архитектура без HBM и первые показатели Taalas HC1
Снижение энергопотребления достигается за счет отказа от выборки из памяти. В традиционных системах на прокачку гигабайтов весов через шину HBM тратится больше энергии, чем на сами математические операции. Чипы Taalas реализуют архитектуру прямого потока данных: связи и веса зафиксированы на уровне межсоединений между транзисторами. Сигнал идет последовательно через логические блоки, а шина памяти и циклы чтения HBM отсутствуют.
Чип Taalas HC1 изготовлен по техпроцессу TSMC 6 нм. Кристалл площадью 815 мм² содержит 53 миллиарда транзисторов и сконфигурирован под работу с моделью Llama® 3.1 8B. По заявлениям разработчиков, HC1 способен выдавать до 17 000 токенов в секунду на пользователя, опережая по показателям производительности и плотности вычислений такие системы, как NVIDIA® H200, NVIDIA® B200, а также ускорители от Groq, SambaNova и Cerebras.
Проблема гибкости
Главный инженерный и экономический компромисс такой архитектуры — полная потеря гибкости. Если вам требуется запустить в серверной стойке другую модель или кардинально обновить текущую, придется буквально менять физические ускорители. Более того, для размещения крупных современных LLM потребуется не один, а сразу несколько кристаллов предельного размера сетки фотошаблона, соединенных в единый модуль.
На первый взгляд, необходимость проектировать и производить отдельные серии микросхем под каждую модель выглядит экономически нецелесообразной. Однако инженеры Taalas нашли компромисс в производстве. Для обновления весов и значений параметров в рамках зафиксированной архитектуры модели не требуется делать полный перезапуск производства. Достаточно перепроектировать лишь два верхних слоя фотошаблонов. Это сильно дешевле и быстрее, чем проектирование нового GPU с нуля, где счет масок идет на десятки слоев.
Зачем это AMD
Сделка с Taalas отлично вписывается в долгосрочную стратегию AMD. Компания не отказывается от универсальных графических ускорителей AMD Instinct™. Для гибких задач, экспериментов и обучения продолжит использоваться линейка AMD Instinct™ с программной платформой AMD ROCm™ и процессорами AMD EPYC™. В свою очередь, технологические наработки Taalas будут интегрированы в архитектуру серверных стоек Helios для обслуживания базовых, статичных нагрузок (base-load inference).
Когда модель доказывает свою эффективность, обрастает инфраструктурой и внедряется в миллионы продакшен-сервисов, экономика масштаба начинает требовать максимальной оптимизации стоимости владения. В таких сценариях узкоспециализированный кремний от Taalas позволит AMD предложить облачным провайдерам наименьшую стоимость токена на рынке.
ссылка на оригинал статьи https://habr.com/ru/articles/1067958/
