Квантизация языковых моделей с помощью дифференцируемого поиска архитектуры нейронной сети
Получена: 26.04.2026 Принята: 29.04.2026
Опубликована: 2026 год, том 30, выпуск 3, С. 88–112
Аннотация
Поиск архитектуры нейронной сети – это метод, позволяющий автоматически подобрать наилучшую архитектуру нейронной сети для данной задачи на представленном алгоритму наборе данных. Одной из разновидностей поиска архитектуры нейронной сети является DARTS – differentiable neural architecture search. DARTS позволяет перейти от дискретного пространства поиска к непрерывному и использовать метод градиентного спуска для подбора параметров, отвечающих за архитектуру сети. В статье будет рассмотрена возможность использования метода DARTS для подбора схемы квантизации и разрядности различных компонентов генеративных языковых моделей и описаны результаты проведенных экспериментов. Код для обучения и оценки квантизованной модели доступен по ссылке: https://github.com/daria1d/Darts-QAT.
Ключевые слова: обработка естественного языка, поиск архитектуры нейронной сети, квантизация, DARTS.
BibTeX
@article{IS-Davydova2026,
author = {Давыдова, Дарья Николаевна},
title = {{Квантизация языковых моделей с помощью дифференцируемого поиска архитектуры нейронной сети}},
journal = {Интеллектуальные системы. Теория и приложения},
year = {2026},
volume = {30},
number = {3},
pages = {88--112},
}
AMSBIB
\RBibitem{IS-Davydova2026}
\by Д.\,Н.~Давыдова
\paper Квантизация языковых моделей с помощью дифференцируемого поиска архитектуры нейронной сети
\jour Интеллектуальные системы. Теория и приложения
\yr 2026
\vol 30
\issue 3
\pages 88--112
EN
