Квантизация языковых моделей с помощью дифференцируемого поиска архитектуры нейронной сети

Аннотация

Поиск архитектуры нейронной сети – это метод, позволяющий автоматически подобрать наилучшую архитектуру нейронной сети для данной задачи на представленном алгоритму наборе данных. Одной из разновидностей поиска архитектуры нейронной сети является DARTS – differentiable neural architecture search. DARTS позволяет перейти от дискретного пространства поиска к непрерывному и использовать метод градиентного спуска для подбора параметров, отвечающих за архитектуру сети. В статье будет рассмотрена возможность использования метода DARTS для подбора схемы квантизации и разрядности различных компонентов генеративных языковых моделей и описаны результаты проведенных экспериментов. Код для обучения и оценки квантизованной модели доступен по ссылке: https://github.com/daria1d/Darts-QAT.

Ключевые слова: обработка естественного языка, поиск архитектуры нейронной сети, квантизация, DARTS.

BibTeX
@article{IS-Davydova2026,
  author  = {Давыдова, Дарья Николаевна},
  title   = {{Квантизация языковых моделей с помощью дифференцируемого поиска архитектуры нейронной сети}},
  journal = {Интеллектуальные системы. Теория и приложения},
  year    = {2026},
  volume  = {30},
  number  = {3},
  pages   = {88--112},
}
AMSBIB
\RBibitem{IS-Davydova2026}
\by Д.\,Н.~Давыдова
\paper Квантизация языковых моделей с помощью дифференцируемого поиска архитектуры нейронной сети
\jour Интеллектуальные системы. Теория и приложения
\yr 2026
\vol 30
\issue 3
\pages 88--112
Опубликовано на условиях лицензии Creative Commons Attribution 4.0 International (CC BY 4.0)

← К номеру журнала