<?xml version="1.0" encoding="UTF-8"?>
<article xmlns:xlink="http://www.w3.org/1999/xlink" xmlns:xsi="http://www.w3.org/2001/XMLSchema-instance" xsi:noNamespaceSchemaLocation="JATS-archive-oasis-article1-4.xsd" article-type="research-article" dtd-version="1.4" xml:lang="ru">
  <front>
    <journal-meta>
      <journal-title-group>
        <journal-title>Журнал Современные наукоемкие технологии</journal-title>
      </journal-title-group>
      <issn>1812-7320</issn>
      <publisher>
        <publisher-name>Общество с ограниченной ответственностью &amp;quot;Издательский Дом &amp;quot;Академия Естествознания&amp;quot;</publisher-name>
      </publisher>
    </journal-meta>
    <article-meta>
      <article-id pub-id-type="doi">10.17513/snt.40617</article-id>
      <article-id pub-id-type="publisher-id">ART-40617</article-id>
      <title-group>
        <article-title>РОБАСТНОЕ ТЕМАТИЧЕСКОЕ МОДЕЛИРОВАНИЕ В ТЕКСТОВЫХ ПОТОКАХ НА ОСНОВЕ ГИБРИДНОГО ПОДХОДА</article-title>
      </title-group>
      <contrib-group>
        <contrib contrib-type="author">
          <name-alternatives>
            <name xml:lang="ru">
              <surname>Родионов</surname>
              <given-names>Д.Г.</given-names>
            </name>
          </name-alternatives>
          <name-alternatives>
            <name xml:lang="en">
              <surname>Rodionov</surname>
              <given-names>D.G.</given-names>
            </name>
          </name-alternatives>
          <email>drodionov@spbstu.ru</email>
          <xref ref-type="aff" rid="aff1"/>
        </contrib>
        <contrib contrib-type="author">
          <name-alternatives>
            <name xml:lang="ru">
              <surname>Поляков</surname>
              <given-names>П.А.</given-names>
            </name>
          </name-alternatives>
          <name-alternatives>
            <name xml:lang="en">
              <surname>Polyakov</surname>
              <given-names>P.A.</given-names>
            </name>
          </name-alternatives>
          <email>prohor@polyakov-box.ru</email>
          <xref ref-type="aff" rid="aff1"/>
        </contrib>
        <contrib contrib-type="author">
          <name-alternatives>
            <name xml:lang="ru">
              <surname>Конников</surname>
              <given-names>Е.А.</given-names>
            </name>
          </name-alternatives>
          <name-alternatives>
            <name xml:lang="en">
              <surname>Konnikov</surname>
              <given-names>E.A.</given-names>
            </name>
          </name-alternatives>
          <email>konnikov_ea@spbstu.ru</email>
          <xref ref-type="aff" rid="aff1"/>
        </contrib>
      </contrib-group>
      <aff id="aff1">
        <institution xml:lang="ru">Федеральное государственное автономное образовательное учреждение высшего образования «Санкт-Петербургский политехнический университет Петра Великого»</institution>
        <institution xml:lang="en">Federal State Autonomous Educational Institution of Higher Education \"Peter the Great St. Petersburg Polytechnic University\"</institution>
      </aff>
      <pub-date date-type="pub" iso-8601-date="2025-12-19">
        <day>19</day>
        <month>12</month>
        <year>2025</year>
      </pub-date>
      <issue>12</issue>
      <fpage>151</fpage>
      <lpage>157</lpage>
      <permissions>
        <license xlink:href="https://creativecommons.org/licenses/by/4.0/">
          <license-p>This is an open-access article distributed under the terms of the CC BY 4.0 license.</license-p>
        </license>
      </permissions>
      <self-uri content-type="url" hreflang="ru">https://top-technologies.ru/article/view?id=40617</self-uri>
      <abstract xml:lang="ru" lang-variant="original" lang-source="author">
        <p>В данной работе рассматривается задача автоматического выявления и прогнозирования тематических трендов в потоке новостных текстов на примере ядерной энергетики. Цель исследования состоит в разработке и экспериментальной верификации гибридной методологии робастного тематического моделирования потоков новостных текстов по проблематике ядерной энергетики, объединяющей классическую модель Latent Dirichlet Allocation с семантически обогащённой фильтрацией корпуса по ключевым доменным терминам и ориентированной на повышение интерпретируемости и устойчивости выделяемых тематических структур для последующего прогнозирования тематических трендов. Предлагается гибридный метод, сочетающий классическое тематическое моделирование Latent Dirichlet Allocation и семантически обогащенную фильтрацию документов по ключевым доменным терминам, направленный на повышение устойчивости (робастности) и интерпретируемости результатов. Проведен эксперимент на корпусе из 1000 новостных документов об атомной энергетике. Baseline-модель (стандартная Latent Dirichlet Allocation) сравнивается с robust-моделью (с применением предлагаемого подхода). Для оценки результатов использовалась симуляция Монте-Карло – 25 повторных прогонов тематического моделирования с разными инициализациями. Ключевые метрики включают интерпретируемость тем (доля ядерных терминов среди топ-N слов темы) и стабильность распространённости тем (стандартное отклонение доли темы в корпусе между прогонами). Полученные результаты демонстрируют, что гибридный подход значительно повышает интерпретируемость с 0.05 до 0.27. Таким образом, предложенный метод позволяет более надёжно и осмысленно выявлять тематические структуры в новостных текстовых потоках, что важно для последующего прогнозирования тематических трендов. Это создает основу для построения устойчивых систем мониторинга и аналитики отраслевых информационных потоков в реальном времени.</p>
      </abstract>
      <abstract xml:lang="en" lang-variant="translation" lang-source="translator">
        <p>This paper considers the problem of automatic detection and prediction of thematic trends in a stream of news texts using the example of nuclear energy. A hybrid method is proposed that combines classical Latent Dirichlet Allocation thematic modeling and semantically enriched filtering of documents by key domain terms, aimed at improving the robustness and interpretability of the results. An experiment was conducted on a corpus of 1,000 news documents about nuclear energy. The baseline model (standard Latent Dirichlet Allocation) is compared with the robust model (using the proposed approach). Monte Carlo simulation was used to evaluate the results-25 repeated runs of thematic modeling with different initializations. Key metrics include topic interpretability (the proportion of nuclear terms among the top N words of a topic) and topic prevalence stability (the standard deviation of the proportion of a topic in the corpus between runs). The results demonstrate that the hybrid approach significantly increases interpretability from 0.05 to 0.27. Thus, the proposed method allows for more reliable and meaningful identification of thematic structures in news text streams, which is important for subsequent forecasting of thematic trends. This creates a basis for building robust systems for real-time monitoring and analysis of industry information flows.</p>
      </abstract>
      <kwd-group xml:lang="ru">
        <kwd>тематическое моделирование</kwd>
        <kwd>Latent Dirichlet Allocation</kwd>
        <kwd>интерпретируемость тем</kwd>
        <kwd>стабильность тем</kwd>
        <kwd>симуляция Монте-Карло</kwd>
        <kwd>семантическое обогащение</kwd>
        <kwd>гибридный метод</kwd>
        <kwd>ядерная энергетика</kwd>
      </kwd-group>
      <kwd-group xml:lang="en">
        <kwd>thematic modeling</kwd>
        <kwd>Latent Dirichlet Allocation</kwd>
        <kwd>interpretability of topics</kwd>
        <kwd>stability of topics</kwd>
        <kwd>Monte Carlo simulation</kwd>
        <kwd>semantic enrichment</kwd>
        <kwd>hybrid method</kwd>
        <kwd>nuclear energy</kwd>
      </kwd-group>
    </article-meta>
  </front>
  <back>
    <ref-list>
      <ref>
        <note>
          <p>1. Blei D.M., Ng A.Y., Jordan M.I. Latent Dirichlet Allocation // Journal of Machine Learning Research. 2003. Vol. 3. P. 993–1022. URL: https://www.jmlr.org/papers/volume3/blei03a/blei03a.pdf (дата обращения: 25.11.2025). DOI: 10.1162/jmlr.2003.3.4-5.993.</p>
        </note>
      </ref>
      <ref>
        <note>
          <p>2. Kim S.-H., Cho H.-G. User–Topic Modeling for Online Community Analysis // Applied Sciences. 2020. Vol. 10. № 10. Art. 3388. DOI: 10.3390/app10103388.</p>
        </note>
      </ref>
      <ref>
        <note>
          <p>3. Waheeb S.A., Khan N.A., Shang X. Topic Modeling and Sentiment Analysis of Online Education in the COVID-19 Era Using Social Networks Based Datasets // Electronics. 2022. Vol. 11. № 5. Art. 715. DOI: 10.3390/electronics11050715.</p>
        </note>
      </ref>
      <ref>
        <note>
          <p>4. Papadia G., Pacella M., Giliberti V. Topic Modeling for Automatic Analysis of Natural Language: A Case Study in an Italian Customer Support Center // Algorithms. 2022. Vol. 15. № 6. Art. 204. DOI: 10.3390/a15060204.</p>
        </note>
      </ref>
      <ref>
        <note>
          <p>5. Chen W., Rabhi F., Liao W., Al-Qudah I. Leveraging State-of-the-Art Topic Modeling for News Impact Analysis on Financial Markets: A Comparative Study // Electronics. 2023. Vol. 12. № 12. Art. 2605. DOI: 10.3390/electronics12122605.</p>
        </note>
      </ref>
      <ref>
        <note>
          <p>6. Ogunleye B., Maswera T., Hirsch L., Gaudoin J., Brunsdon T., Boateng K.A. Comparison of Topic Modelling Approaches in the Banking Context // Applied Sciences. 2023. Vol. 13. № 2. Art. 797. DOI: 10.3390/app13020797.</p>
        </note>
      </ref>
      <ref>
        <note>
          <p>7. Röder M., Both A., Hinneburg A. Exploring the Space of Topic Coherence Measures: A Unified Framework and Evaluation // Proceedings of the 8th ACM International Conference on Web Search and Data Mining (WSDM 2015). 2015. P. 399–408. DOI: 10.1145/2684822.2685324.</p>
        </note>
      </ref>
      <ref>
        <note>
          <p>8. Воронцов К.В., Потапенко А.А. Аддитивная регуляризация тематических моделей коллекций текстовых документов // Доклады Академии наук. 2014. Т. 456. № 3. С. 268–271. DOI: 10.1134/S1064562414020185.</p>
        </note>
      </ref>
      <ref>
        <note>
          <p>9. Vorontsov K.V., Potapenko A.A. Additive Regularization of Topic Models // Machine Learning. 2015. Vol. 101. № 1–3. P. 303–323. URL: https://doi.org/10.1007/s10994-014-5476-6 (дата обращения: 25.11.2025). DOI: 10.1007/s10994-014-5476-6.</p>
        </note>
      </ref>
      <ref>
        <note>
          <p>10. Veselova E., Vorontsov K. Topic Balancing with Additive Regularization of Topic Models // Proceedings of the 58th Annual Meeting of the Association for Computational Linguistics: Student Research Workshop. 2020. P. 59–65. URL: https://aclanthology.org/2020.acl-srw.9 (дата обращения: 25.11.2025). DOI: 10.18653/v1/2020.acl-srw.9.</p>
        </note>
      </ref>
      <ref>
        <note>
          <p>11. Bulatov V., Alekseev V., Vorontsov K., Polyudova D., Veselova E., Goncharov A., Egorov E. TopicNet: Making Additive Regularisation for Topic Modelling Accessible // Proceedings of the Twelfth Language Resources and Evaluation Conference (LREC 2020). European Language Resources Association. 2020. P. 6745–6752. URL: https://aclanthology.org/2020.lrec-1.833 (дата обращения: 25.11.2025).</p>
        </note>
      </ref>
      <ref>
        <note>
          <p>12. Greene D., O’Callaghan D., Cunningham P. How Many Topics? Stability Analysis for Topic Models // Machine Learning and Knowledge Discovery in Databases. ECML PKDD 2014. Lecture Notes in Computer Science. Vol. 8724. 2014. P. 498–513. DOI: 10.1007/978-3-662-44848-9_32.</p>
        </note>
      </ref>
      <ref>
        <note>
          <p>13. Agrawal A., Fu W., Menzies T. What Is Wrong with Topic Modeling? And How to Fix It Using Search-Based Software Engineering // Information and Software Technology. 2018. Vol. 98. P. 74–88. DOI: 10.1016/j.infsof.2018.02.005.</p>
        </note>
      </ref>
      <ref>
        <note>
          <p>14. Williams L., Anthi E., Arman L., Burnap P. Topic Modelling: Going Beyond Token Outputs // Big Data and Cognitive Computing. 2024. Vol. 8. № 5. Art. 44. DOI: 10.3390/bdcc8050044.</p>
        </note>
      </ref>
      <ref>
        <note>
          <p>15. Wang Z., Zhou R., Wang Y. DTM-Based Analysis of Hot Topics and Evolution of China’s Energy Policy // Sustainability. 2024. Vol. 16. № 19. Art. 8293. DOI: 10.3390/su16198293.</p>
        </note>
      </ref>
    </ref-list>
  </back>
</article>
