Библиографическое описание:Компьютерное моделирование как инструмент анализа художественного текста : научное издание / А. В. Колмогорова, Е. Д. Залевская. - Текст : непосредственный // Филологический класс. - 2023. - Т. 28, № 2. - С. 22-33. - В данной научной работе использованы результаты проекта «Текст как Big Data: моделирование конвергентных процессов в языке и речи цифровыми методами», выполненного в рамках Программы фундаментальных исследований НИУ ВШЭ в 2023 году. - ISSN 2071-2405. - ISSN 2658-5235.
Аннотация:Статья посвящена проблеме эвристической продуктивности использования метода компьютерного тематического моделирования для филологического анализа художественного текста. Анализируются результаты применения алгоритма Латентного размещения Дирехле (LDA) для поиска интертекстуальных связей мотивов в двух подкорпусах художественных текстов: 62 текстах разного жанра (рассказы, очерки, повести, критические статьи), принадлежащих перу С. Довлатова, с одной стороны, и 35 художественных произведениях, которые в одном из писем Т. Уржумовой писатель перечислил как произведения, которые оказали на него воздействие и которые должен прочитать каждый. Примененный алгоритм выявил 20 тем (топиков), по которым были распределены все тексты. Каждый полученный топик - это цепочка слов с весами значимости для реализации данной темы. В результате сопоставления текстов и тем были выявлены три соответствия «текст - тема». Одной общей теме принадлежат тексты в каждой из трех следующих групп: 1) роман Б. Пильняка «Голый год» и рассказ С. Довлатова «У реки»; 2) роман Г. Уэльса «Машина времени», повесть Э. Хемингуэя «Старик и море» и рассказ С. Довлатова «Эмигранты»; 3) рассказ А. Грина «Комендант порта» и очерк С. Довлатова «Мы говорим на разных языках». Дальнейший филологический анализ позволил выявить пересечения мотивов в данных группах произведений. Проведенное пилотное исследование показало, что методы компьютерного анализа текста, в том числе на основе машинного обучения, могут стать для филолога инструментом разведывательного поиска, направляя экспертную интуицию по пути, намеченному алгоритмом за счет обработки больших корпусных массивов.
The article investigates the issue of heuristic productivity of using the method of computer-assisted topic modeling for philological analysis of fiction text. The study analyzes the results of applying the algorithm of Latent Placement Dirichlet (LDA) for searching intertextual connections of motifs in two sub-corpora of fiction texts: 62 texts of different genres (stories, essays, novels, critical articles) belonging to S. Dovlatov, on the one hand, and 35 fiction works, which the writer listed in one of the letters to T. Urzhumova as the works that had deeply influenced him and should be read by everybody. The algorithm has revealed 20 themes (topics), into which all the texts were distributed. Each topic obtained was a chain of words with weights of significance for the realization of that topic. As a result of the comparison of the texts and the topics, three “text - topic” correspondences were discovered. The texts in each of the following three groups belong to one common topic: 1) B. Pilyniak’s novel “The Bare Year” and Dovlatov’s story “By the River”; 2) G. Wells’s novel “The Time Machine”, E. Hemingway’s story “The Old Man and the Sea” and Dovlatov’s story “Emigrants”; 3) A. Grin’s story “The Commandant of the Port” and Dovlatov’s essay “We Speak Different Languages”. Further philological analysis demonstrated the intersection of motifs in these groups of works of fiction. The pilot study under consideration has shown that methods of computer-assisted text analysis, including those based on machine learning, can become a philologist’s tool for experimental search, guiding the expert intuition along the path outlined by the algorithm via processing large corpus arrays.