Использование иерархического поиска ближайших соседей для заполнения пропущенных значений в табличных данных

Аннотация

Пропущенные значения являются распространённой проблемой в анализе данных, для решения которой разработано множество методов. Одним из наиболее популярных подходов является заполнение пропущенных значений с использованием метода k-ближайших соседей (KNN), основанного на информации от схожих наблюдений. Данный подход широко применяется в анализе больших данных, где объёмы выборок могут достигать миллиардов объектов, что делает задачу ускорения KNN особенно актуальной из-за его линейной сложности. В данной работе предлагается алгоритм ускоренного заполнения пропущенных значений на основе методов приближённого поиска ближайших соседей (ANN) и анализируется соотношение между скоростью работы и качеством заполнения. Экспериментальные результаты показывают, что использование ANN позволяет существенно сократить время вычислений при сохранении высокого качества заполнения пропущенных значений.

Ключевые слова: заполнение пропущенных значений в табличных данных, приближенный поиск ближайших соседей.

BibTeX
@article{IS-Artamonov-Mironov2026,
  author  = {Артамонов, Сергей Александрович and Миронов, Андрей Михайлович},
  title   = {{Использование иерархического поиска ближайших соседей для заполнения пропущенных значений в табличных данных}},
  journal = {Интеллектуальные системы. Теория и приложения},
  year    = {2026},
  volume  = {30},
  number  = {3},
  pages   = {8--29},
}
AMSBIB
\RBibitem{IS-Artamonov-Mironov2026}
\by С.\,А.~Артамонов, А.\,М.~Миронов
\paper Использование иерархического поиска ближайших соседей для заполнения пропущенных значений в табличных данных
\jour Интеллектуальные системы. Теория и приложения
\yr 2026
\vol 30
\issue 3
\pages 8--29
Опубликовано на условиях лицензии Creative Commons Attribution 4.0 International (CC BY 4.0)

← К номеру журнала