Дерево решений — это один из алгоритмов машинного обучения, у которого есть ряд преимуществ (хорошая интерпретация, возможность работы с разными типами данных, автоматическое формирование правил и пр.). В некоторых задачах, где набор данных ограничен, а признаки связаны между собой (например, в задаче атрибуции текстов), можно при построении условий в узлах модели использовать не одиночные признаки, а их линейные комбинации. С учетом этого в статье изложено развитие метода «дерево решений», которое заключается в том, что к старым k признакам добавляются новые признаки как линейные комбинации двух исходных: xij = αxi ± (1 − α)xj, где i, j = 1,…, k и параметр α ∈ [0, 1]. Для проведения численных экспериментов на примере задачи атрибуции текстов выполнена реализация построения линейных комбинаций признаков в информационной системе СМАЛТ («Статистические методы анализа литературного текста»). Результаты классификации дореволюционных текстов из журналов «Время», «Эпоха» и еженедельника «Гражданин» с использованием разных видов n-грамм показали, что данное улучшение повышает точность метода, при этом несущественно снижает интерпретацию полученного результата.
В работе рассматривается теоретико-графовый подход, который применяется для анализа русских народных волшебных сказок. Подобное формальное описание структуры анализируемых фольклорных текстов опирается на закономерности, изложенные В. Я. Проппом в ряде своих работ и, в частности, в его известной книге «Морфология сказки». Это позволяет систематизировать и анализировать ключевые события, происходящие в текстах. Вершины теоретико-графовой модели представляют персонажей сказки, которые классифицируются на определенные фиксированные группы, а ребра обозначают встречи между персонажами, сопровождающиеся значимыми для сказочного сюжета действиями. На примере текста «Терешечка» из сборника А. М. Афанасьева показано, как строится модель и вычисляются числовые характеристики графов. Для этого в том числе используются инструменты информационной системы «Фольклор». С помощью этой программы можно не только хранить тексты коллекции и их теоретико-графовые модели, но также в автоматизированном режиме создавать формальные структуры, выполнять их визуализацию, агрегацию и сравнение. Дискриминантный анализ показал, что по формальным параметрам можно идентифицировать сюжет сказки о молодце-удальце, молодильных яблоках и живой воде. Значение коэффициента Лямбда Уилкса (Wilks’ Lambda) равно 0,0275781 (меньше 0,05), что говорит о хорошем качестве классификатора. Исходя из этого следует заключить, что для систематизации и сравнения сюжетов русских народных сказок можно применять математические модели, основанные на графах. При этом открываются перспективы изучения как вариативности сказок, так и выделения наиболее значимых и типичных для определенной географической местности или временного периода сюжетов.
В статье рассматривается теоретико-графовая модель сюжета русской волшебной сказки. Вершинам модели соответствуют действующие лица сказки, распределенные по группам, а ребрам - встречи между персонажами, которые сопровождаются значимыми с точки зрения развертывания сказки действиями. Построение теоретико-графовой модели показано на примере двух известных сказок: «Никита Кожемяка» и «Гуси-лебеди» из сборника А.Н. Афанасьева.