<?xml version="1.0" encoding="UTF-8"?>
<article xmlns:xlink="http://www.w3.org/1999/xlink" xmlns:xsi="http://www.w3.org/2001/XMLSchema-instance" xsi:noNamespaceSchemaLocation="JATS-archive-oasis-article1-4.xsd" article-type="research-article" dtd-version="1.4" xml:lang="ru">
  <front>
    <journal-meta>
      <journal-title-group>
        <journal-title>Журнал Современные наукоемкие технологии</journal-title>
      </journal-title-group>
      <issn>1812-7320</issn>
      <publisher>
        <publisher-name>Общество с ограниченной ответственностью &amp;quot;Издательский Дом &amp;quot;Академия Естествознания&amp;quot;</publisher-name>
      </publisher>
    </journal-meta>
    <article-meta>
      <article-id pub-id-type="doi">10.17513/snt.40059</article-id>
      <article-id pub-id-type="publisher-id">ART-40059</article-id>
      <title-group>
        <article-title>МОДЕЛИ И МЕТОДЫ АНАЛИЗА ТЕКСТА В ЗАДАЧЕ ОЦЕНКИ КОНСПЕКТОВ ОБУЧАЮЩИХСЯ</article-title>
      </title-group>
      <contrib-group>
        <contrib contrib-type="author">
          <name-alternatives>
            <name xml:lang="ru">
              <surname>Колотов</surname>
              <given-names>М.А.</given-names>
            </name>
          </name-alternatives>
          <name-alternatives>
            <name xml:lang="en">
              <surname>Kolotov</surname>
              <given-names>M.A.</given-names>
            </name>
          </name-alternatives>
          <email>mi-sha-9@mail.ru</email>
          <xref ref-type="aff" rid="aff1"/>
        </contrib>
        <contrib contrib-type="author">
          <name-alternatives>
            <name xml:lang="ru">
              <surname>Косачев</surname>
              <given-names>И.С.</given-names>
            </name>
          </name-alternatives>
          <name-alternatives>
            <name xml:lang="en">
              <surname>Kosachev</surname>
              <given-names>I.S.</given-names>
            </name>
          </name-alternatives>
          <email>ilyastalk@bk.ru</email>
          <xref ref-type="aff" rid="aff1"/>
        </contrib>
        <contrib contrib-type="author">
          <name-alternatives>
            <name xml:lang="ru">
              <surname>Сметанина</surname>
              <given-names>О.Н.</given-names>
            </name>
          </name-alternatives>
          <name-alternatives>
            <name xml:lang="en">
              <surname>Smetanina</surname>
              <given-names>O.N.</given-names>
            </name>
          </name-alternatives>
          <email>smoljushka@mail.ru</email>
          <xref ref-type="aff" rid="aff1"/>
        </contrib>
      </contrib-group>
      <aff id="aff1">
        <institution xml:lang="ru">ФГБОУ ВО Уфимский университет науки и технологий</institution>
        <institution xml:lang="en">Federal State-Funded Educational Institution of Higher Education Ufa University of Science and Technology</institution>
      </aff>
      <pub-date date-type="pub" iso-8601-date="2024-06-01">
        <day>01</day>
        <month>06</month>
        <year>2024</year>
      </pub-date>
      <issue>6</issue>
      <fpage>25</fpage>
      <lpage>29</lpage>
      <permissions>
        <license xlink:href="https://creativecommons.org/licenses/by/4.0/">
          <license-p>This is an open-access article distributed under the terms of the CC BY 4.0 license.</license-p>
        </license>
      </permissions>
      <self-uri content-type="url" hreflang="ru">https://top-technologies.ru/article/view?id=40059</self-uri>
      <abstract xml:lang="ru" lang-variant="original" lang-source="author">
        <p>В статье рассматривается возможность применения анализа текстовых данных в задачах оценки конспектов обучающихся на английском языке по двум параметрам: содержание и формулировка. В первой части статьи отражены результаты исследований, решающих схожие задачи. В качестве набора данных взяты изложения учеников 3–12-х классов англоязычных школ, которые были предоставлены в рамках соревнования на Kaggle. В исследовании рассматривается возможность для решения задачи применения методов natural language processing для векторизации данных, а именно – использование feature-engineering, извлечение эмбеддинга текста с помощью TF-IDF и языковых моделей на основе BERT (RoBERTA, DeBERTA). В качестве моделей для оценивания работ обучающихся использованы линейная регрессия и градиентный бустинг в реализации catboost. Для оценки качества работы моделей выбраны метрики «средняя среднеквадратическая ошибка по столбцам» и «среднеквадратичная ошибка для каждого целевого признака». С использованием предложенных моделей и методов проведены эксперименты и получены оценки качества моделей по k-fold кросс-валидации. На основании полученных результатов обоснованы возможность их применения на практике, а также потенциальные возможности развития данной темы.</p>
      </abstract>
      <abstract xml:lang="en" lang-variant="translation" lang-source="translator">
        <p>The article discusses the possibility of using text data analysis in the tasks of assessing students’ notes in English according to two parameters: content and wording. The first part of the article reflects the results of studies that solve similar problems. The following is the purpose of the study, analysis of the initial data and methods for solving the problem. The data set was taken from the summaries of students in grades 3–12 in English-language schools, which were provided as part of a competition on Kaggle. The study examines the possibility of solving the problem of using natural language processing methods for data vectorization, namely, the use of feature-engineering, text embedding extraction using TF-IDF and language models based on BERT (RoBERTA, DeBERTA). Linear regression and gradient boosting in the catboost implementation were used as models for evaluating students’ work. To assess the quality of the models, the mean columnwise root mean squared error and root mean square error metrics were selected for each target feature. Using the proposed models and methods, experiments were carried out and estimates of the quality of the models were obtained using k-fold cross-validation. Based on the results obtained, the possibility of their application in practice, as well as potential opportunities for the development of this topic, is substantiated.</p>
      </abstract>
      <kwd-group xml:lang="ru">
        <kwd>обработка естественного языка</kwd>
        <kwd>информационный анализ данных</kwd>
        <kwd>анализ текста</kwd>
        <kwd>схожесть текстов</kwd>
        <kwd>градиентный бустинг</kwd>
        <kwd>машинное обучение</kwd>
        <kwd>языковая модель</kwd>
      </kwd-group>
      <kwd-group xml:lang="en">
        <kwd>natural language processing</kwd>
        <kwd>information data analysis</kwd>
        <kwd>text analysis</kwd>
        <kwd>text similarity</kwd>
        <kwd>gradient boosting</kwd>
        <kwd>machine learning</kwd>
        <kwd>language models</kwd>
      </kwd-group>
    </article-meta>
  </front>
  <back>
    <ref-list>
      <ref>
        <note>
          <p>1. Некрасова Э.В., Гусев П.Ю. Анализ текста на соответствие заданной теме с применением методов машинного обучения // Научный аспект [Электронный ресурс]. URL: https://na-journal.ru/4-2022-informacionnye-tekhnologii/3612-analiz-teksta-na-sootvetstvie-zadannoi-teme-s-primeneniem-metodov-mashinnogo-obucheniya (дата обращения: 01.03.2024).</p>
        </note>
      </ref>
      <ref>
        <note>
          <p>2. Система организации конкурсов по исследованию данных аспект [Электронный ресурс]. URL: https://www.kaggle.com/competitions/commonlit-evaluate-student-summaries (дата обращения: 03.03.2024).</p>
        </note>
      </ref>
      <ref>
        <note>
          <p>3. Bai X., Stede M. A Survey of Current Machine Learning Approaches to Student Free-Text Evaluation for Intelligent Tutoring // International Journal of Artificial Intelligence in Education. 2023. Vol. 33, No. 4. P. 992-1030. DOI: 10.1007/s40593-022-00323-0.</p>
        </note>
      </ref>
      <ref>
        <note>
          <p>4. Automatic Text Scoring Using Neural Networks/ Dimitrios Alikaniotis, Helen Yannakoudakis, Marek Rei. [Электронный ресурс]. URL: https://arxiv.org/abs/1606.04289 (дата обращения: 01.03.2024).</p>
        </note>
      </ref>
      <ref>
        <note>
          <p>5. Fei Dong, Yue Zhang, and Jie Yang. Attention-based Recurrent Convolutional Neural Network for Automatic Essay Scoring // 21st Conference on Computational Natural Language Learning (CoNLL 2017) Vancouver, Canada, 2017. Р. 153–162.</p>
        </note>
      </ref>
      <ref>
        <note>
          <p>6. Rahul Sharma An NLP-based technique to extract meaningful features from drug SMILES. [Электронный ресурс]. URL: https://www.sciencedirect.com/science/article/pii/S2589004224003481 (дата обращения: 06.04.2024).</p>
        </note>
      </ref>
      <ref>
        <note>
          <p>7. Савченко Т.Ю. Обработка естественного языка для использования в машинном обучении: частотная векторизация, TF-IDF, word2vec // Аллея науки. 2018. Т. 4, № 6(22). С. 1000-1002.</p>
        </note>
      </ref>
      <ref>
        <note>
          <p>8. Liu Y., Ott M., Goyal N., Du J., Joshi M., Chen D., Levy O., Lewis M., Zettlemoyer L., Stoyanov V. RoBERTa: A Robustly Optimized BERT Pretraining Approach [Электронный ресурс]. URL: https://arxiv.org/abs/1907.11692 (дата обращения: 04.03.2024).</p>
        </note>
      </ref>
      <ref>
        <note>
          <p>9. Pengcheng He, Xiaodong Liu, Jianfeng Gao, Weizhu Chen. DeBERTa: Decoding-enhanced BERT with Disentangled Attention [Электронный ресурс]. URL: https://arxiv.org/abs/2006.03654 (дата обращения: 03.03.2024).</p>
        </note>
      </ref>
      <ref>
        <note>
          <p>10. Bird S., Klein E., Loper E. Natural Language Processing with Python: Analyzing Text with the Natural Language Toolkit. O’Reilly Media, Inc. [Электронный ресурс]. URL: https://github.com/nltk/nltk (дата обращения: 01.03.2024)</p>
        </note>
      </ref>
    </ref-list>
  </back>
</article>
