<?xml version="1.0" encoding="UTF-8"?>
<article xmlns:xlink="http://www.w3.org/1999/xlink" xmlns:xsi="http://www.w3.org/2001/XMLSchema-instance" xsi:noNamespaceSchemaLocation="JATS-archive-oasis-article1-4.xsd" article-type="research-article" dtd-version="1.4" xml:lang="ru">
  <front>
    <journal-meta>
      <journal-title-group>
        <journal-title>Журнал Современные наукоемкие технологии</journal-title>
      </journal-title-group>
      <issn>1812-7320</issn>
      <publisher>
        <publisher-name>Общество с ограниченной ответственностью &amp;quot;Издательский Дом &amp;quot;Академия Естествознания&amp;quot;</publisher-name>
      </publisher>
    </journal-meta>
    <article-meta>
      <article-id pub-id-type="doi">10.17513/snt.40482</article-id>
      <article-id pub-id-type="publisher-id">ART-40482</article-id>
      <title-group>
        <article-title>ПРОГРАММНЫЙ КОМПЛЕКС ИДЕНТИФИКАЦИИ ТЕКСТОВ ОПРЕДЕЛЕННОЙ СЕМАНТИЧЕСКОЙ НАПРАВЛЕННОСТИ В ЕСТЕСТВЕННО-ЯЗЫКОВЫХ ПОТОКАХ</article-title>
      </title-group>
      <contrib-group>
        <contrib contrib-type="author">
          <name-alternatives>
            <name xml:lang="ru">
              <surname>Вишняков</surname>
              <given-names>Ю.М.</given-names>
            </name>
          </name-alternatives>
          <name-alternatives>
            <name xml:lang="en">
              <surname>Vishnyakov</surname>
              <given-names>Y.M.</given-names>
            </name>
          </name-alternatives>
          <email>y_vishnyakov@inbox.ru</email>
          <xref ref-type="aff" rid="aff1"/>
        </contrib>
        <contrib contrib-type="author">
          <name-alternatives>
            <name xml:lang="ru">
              <surname>Вишняков</surname>
              <given-names>Р.Ю.</given-names>
            </name>
          </name-alternatives>
          <name-alternatives>
            <name xml:lang="en">
              <surname>Vishnyakov</surname>
              <given-names>R.Y.</given-names>
            </name>
          </name-alternatives>
          <email>renat.vishnyakov@mail.ru</email>
          <xref ref-type="aff" rid="aff1"/>
        </contrib>
      </contrib-group>
      <aff id="aff1">
        <institution xml:lang="ru">ФГБОУ ВО «Кубанский государственный университет»</institution>
        <institution xml:lang="en">Kuban State University</institution>
      </aff>
      <pub-date date-type="pub" iso-8601-date="2025-09-02">
        <day>02</day>
        <month>09</month>
        <year>2025</year>
      </pub-date>
      <issue>9</issue>
      <fpage>29</fpage>
      <lpage>38</lpage>
      <permissions>
        <license xlink:href="https://creativecommons.org/licenses/by/4.0/">
          <license-p>This is an open-access article distributed under the terms of the CC BY 4.0 license.</license-p>
        </license>
      </permissions>
      <self-uri content-type="url" hreflang="ru">https://top-technologies.ru/article/view?id=40482</self-uri>
      <abstract xml:lang="ru" lang-variant="original" lang-source="author">
        <p>В области естественно-языковой обработки актуальную проблему представляет автоматическое выявление текстов определенной семантической направленности с идентификацией их источников. Подобная обработка широко используется в анализе новостных потоков, чатов мессенджеров, социальных сетей, проверке документов на плагиат и других областях. Анализ проблемы и существующих подходов показывает потребность в собственном специализированном инструментарии. Целью работы является практическое обоснование концептуальной модели выявления в естественно-языковых потоках текстов определенной семантической направленности по формальным описаниям их источников. Модель реализована в функционале программного комплекса, и ее образуют формальные методы, модели и алгоритмы, основанные на вычислительной теории семантической интерпретации и формально-грамматическом подходе. Семантическая направленность задается поведенческими сценариями семантического объекта, множество сценариев образует язык формальной грамматики, распознавание строится на положениях вычислительной теории семантической интерпретации. Поскольку язык сценариев потенциально бесконечен и исходный текст заранее не известен, то распознавание сводится к подбору и конструированию гипотетического сценария по предполагаемому семантическому следу. Процедура состоит из последовательного установления семантического сходства токенов потока с заданными характеристиками, сборки сценария, проверки на принадлежность языку грамматики и вычислении оценки доверия к результату. В общем алгоритме решение сводится к построению вывода в формальной грамматике, а в случае регулярных грамматик распознавание выполняется системой переходов. Быстродействие увеличивается при совмещении сборки сценария с грамматическим разбором и использованием механизма бэктрекинга. В работе представлен состав разработанного программного комплекса, обсуждены основные подсистемы и описаны результаты тестирования, которые подтверждают теоретические положения развиваемого подхода. В работе раскрывается практическое применение новых методов математического моделирования в обработке естественного языка и предлагаются эффективные программные решения для проблемно ориентированных систем анализа текстов. Исследование выполнено при финансовой поддержке Кубанского научного фонда в рамках научно-инновационного проекта «НИП-20.1.4».</p>
      </abstract>
      <abstract xml:lang="en" lang-variant="translation" lang-source="translator">
        <p>In natural language processing, a critical challenge involves automated identification of texts with specific semantic orientations along with their source attribution. This processing is extensively used in news feed analysis, messenger chats, social networks, plagiarism detection, and other domains. Examination of existing approaches reveals the need for dedicated specialized tools. The study aims to provide practical validation of a conceptual model for detecting semantically oriented texts in natural language streams using formal source descriptions. Implemented within a software system, the model incorporates formal methods and algorithms based on computational semantic interpretation theory and formal grammar approaches. Semantic orientation is defined through behavioral scenarios of semantic objects, where scenario sets form formal grammar languages, with recognition grounded in computational semantic interpretation theory. Given the potentially infinite nature of scenario languages and unknown source texts, recognition involves constructing hypothetical scenarios from presumed semantic traces. The procedure includes: (1) establishing token-semantic similarity with given characteristics, (2) scenario assembly, (3) grammar language validation, and (4) confidence estimation. The core algorithm reduces to formal grammar derivation, employing transition systems for regular grammars. Performance is enhanced through combined scenario assembly/parsing with backtracking mechanisms. The paper details the software system’s architecture, examines core subsystems, and presents test results validating the theoretical framework. It demonstrates practical applications of novel mathematical modeling methods in NLP and proposes efficient software solutions for domain-specific text analysis systems. The study was carried out with the financial support of the Kuban Science Foundation within the framework of the scientific and innovative project «NIP-20.1.4».</p>
      </abstract>
      <kwd-group xml:lang="ru">
        <kwd>естественно-языковая обработка</kwd>
        <kwd>текстовый поток</kwd>
        <kwd>семантика</kwd>
        <kwd>формальная модель</kwd>
        <kwd>формальная грамматика</kwd>
        <kwd>формальный язык</kwd>
        <kwd>вывод</kwd>
        <kwd>система переходов</kwd>
        <kwd>алгоритм</kwd>
      </kwd-group>
      <kwd-group xml:lang="en">
        <kwd>natural language processing</kwd>
        <kwd>text stream</kwd>
        <kwd>semantics</kwd>
        <kwd>formal model</kwd>
        <kwd>formal grammar</kwd>
        <kwd>formal language</kwd>
        <kwd>derivation</kwd>
        <kwd>transition system</kwd>
        <kwd>algorithm</kwd>
      </kwd-group>
    </article-meta>
  </front>
  <back>
    <ref-list>
      <ref>
        <note>
          <p>1. Rogers A., Kovaleva O., Rumshisky A. A Primer in BERTology: What We Know About How BERT Works // Transactions of the Association for Computational Linguistics. 2020. Vol. 8. P. 842-866. URL: https://direct.mit.edu/tacl/article/doi/10.1162/tacl_a_00349/96482/A-Primer-in-BERTology-What-We-Know-About-How-BERT (дата обращения: 14.07.2025). DOI: 10.1162/tacl_a_00349.</p>
        </note>
      </ref>
      <ref>
        <note>
          <p>2. Pengfei Liu, Weizhe Yuan, Jinlan Fu, Zhengbao Jiang, Hiroaki Hayashi, Graham Neubig Pre-train, Prompt, and Predict: A Systematic Survey of Prompting Methods in Natural Language Processing // ACM Computing Surveys. 2023. Vol. 55. Is. 9. P. 1-35. URL: https://dl.acm.org/doi/10.1145/3560815 (дата обращения: 14.07.2025). DOI: 10.18522/2311-3103-2024-4-110-122.</p>
        </note>
      </ref>
      <ref>
        <note>
          <p>3. Devlin J. Ming-Wei Chang, Kenton Lee, Kristina Toutanova. BERT: Pre-training of Deep Bidirectional Transformers for Language Understanding // Proceedings – of the 2019 Conference of the North American Chapter of the Association for Computational Linguistics: Human Language Technologies. June. 2019. Vol. 1. P. 4171–4186. URL: https://aclanthology.org/N19-1423/ (дата обращения: 14.07.2025). DOI: 10.18653/v1/N19-1423.</p>
        </note>
      </ref>
      <ref>
        <note>
          <p>4. Raffel Colin, Shazeer Noam, Roberts Adam, Lee Katherine, Narang Sharan, Matena Michael, Zhou Yanqi, Li Wei, Liu Peter J. Exploring the Limits of Transfer Learning with a Unified Text-to-Text Transformer // Journal of Machine Learning Research (JMLR). 2020, Vol. 21. Article No. 140. P. 1–67. URL: https://jmlr.org/papers/v21/20-074.html (дата обращения: 14.07.2025).</p>
        </note>
      </ref>
      <ref>
        <note>
          <p>5. Arora Sanjeev, Liang Yingyu, Ma Tengyu. A Simple but Tough-to-Beat Baseline for Sentence Embeddings // Proceedings of the 5th International Conference on Learning Representations. April 2017. P. 1-12. URL: https://openreview.net/pdf?id=SyK00v5xx (дата обращения: 14.07.2025).</p>
        </note>
      </ref>
      <ref>
        <note>
          <p>6. Reimers N., Gurevych I. Sentence-BERT: Sentence Embeddings using Siamese BERT-Networks // Proceedings of the 2019 Conference on Empirical Methods in Natural Language Processing and the 9th International Joint Conference on Natural Language Processing (EMNLP-IJCNLP 2019). November 2019. P. 3982–3992. URL: https://aclanthology.org/D19-1410 (дата обращения: 14.07.2025). DOI: 10.18653/v1/D19-1410.</p>
        </note>
      </ref>
      <ref>
        <note>
          <p>7. Conneau A., Kiela D., Schwenk H., Barrault L., Bordes A. Supervised Learning of Universal Sentence Representations from Natural Language Inference Data // Proceedings of the 2017 Conference on Empirical Methods in Natural Language Processing (EMNLP 2017). September 2017. P. 670–680. URL: https://aclanthology.org/D17-1070 (дата обращения: 14.07.2025). DOI: 10.18653/v1/D17-1070.</p>
        </note>
      </ref>
      <ref>
        <note>
          <p>8. Artetxe M., Schwenk H. Massively Multilingual Sentence Embeddings for Zero-Shot Cross-Lingual Transfer and Beyond // Transactions of the Association for Computational Linguistics (TACL). 2019. Vol. 7. P. 597-610. URL: https://aclanthology.org/Q19-1038/ (дата обращения: 14.07.2025). DOI: 10.1162/tacl_a_00288.</p>
        </note>
      </ref>
      <ref>
        <note>
          <p>9. Agirre E., Cer D., Diab M., Gonzalez-Agirre A., Guo W. SEM 2012 Shared Task: A Pilot on Semantic Textual Similarity // Proceedings of the First Joint Conference on Lexical and Computational Semantics (SEM 2012). June 2012. P. 385-393. URL: https://aclanthology.org/S12-1051/ (дата обращения: 14.07.2025).</p>
        </note>
      </ref>
      <ref>
        <note>
          <p>10. Yin S., Liu Z., Zhang Y., Li H., Wang X., Chen Q. Me-LLaMA: Medical Foundation Large Language Models for Medical Applications // npj Digital Medicine. 2025. Vol. 8. Article 104. URL: https://www.nature.com/articles/s41746-025-01533-1 (дата обращения: 14.07.2025). DOI: 10.1038/s41746-025-01533-1.</p>
        </note>
      </ref>
      <ref>
        <note>
          <p>11. Zhu L., Xing E.P. A Neural Generative Model for Joint Learning Topics and Topic-Specific Word Embeddings // Transactions of the Association for Computational Linguistics (TACL). 2020. Vol. 8. P. 471-485. URL: https://aclanthology.org/2020.tacl-1.31/ (дата обращения: 14.07.2025). DOI: 10.1162/tacl_a_00326.</p>
        </note>
      </ref>
      <ref>
        <note>
          <p>12. Bender E.M., Gebru T., McMillan-Major, A., Shmitchell S. On the Dangers of Stochastic Parrots: Can Language Models Be Too Big? // Proceedings of the 2021 ACM Conference on Fairness, Accountability and Transparency (FAccT ‘21). March 2021. P. 610-623. URL: https://dl.acm.org/doi/10.1145/3442188.3445922 (дата обращения: 14.07.2025). DOI: 10.1145/3442188.3445922.</p>
        </note>
      </ref>
      <ref>
        <note>
          <p>13. Thakur Nandan, Reimers Nils, Rücklé Andreas, Srivastava Abhishek, Gurevych Iryna. BEIR: A Heterogenous Benchmark for Zero-shot Evaluation of Information Retrieval Models // Advances in Neural Information Processing Systems 34 (NeurIPS 2021). December 2021. P. 1-12. URL: https://datasets-benchmarks-proceedings.neurips.cc/paper/2021/hash/65b9eea6e1cc6bb9f0cd2a47751a186f-Abstract-round2.html (дата обращения: 14.07.2025).</p>
        </note>
      </ref>
      <ref>
        <note>
          <p>14. Вишняков Ю.М., Вишняков Р.Ю. Вычислительная семантическая интерпретация текстов научно-технического стиля // Современные наукоемкие технологии. 2016. № 12-2. С. 236-242. URL: https://top-technologies.ru/ru/article/view?id=36428&amp;ysclid=m77urlmrjv786427462 (дата обращения: 14.07.2025).</p>
        </note>
      </ref>
      <ref>
        <note>
          <p>15. Вишняков Ю.М., Вишняков Р.Ю. Формализация распознавания и идентификации семантических объектов в естественно-языковых текстовых потоках // Известия ЮФУ. Технические науки. 2024. № 4. С. 110-122. URL: https://www.izv-tn.tti.sfedu.ru/index.php/izv_tn/article/view/985/1172 (дата обращения: 14.07. 2025). DOI: 10.18522/2311-3103-2024-4-110-122.</p>
        </note>
      </ref>
      <ref>
        <note>
          <p>16. Вишняков Ю.М., Вишняков Р.Ю. Поиск и идентификация текстов определенной семантической направленности в естественно-языковых потоках // Современные наукоемкие технологии. 2025. № 5. С. 32-40. URL: https://top-technologies.ru/ru/article/view?id=40387 (дата обращения: 14.07.2025). DOI: 10.17513/snt.40387.</p>
        </note>
      </ref>
      <ref>
        <note>
          <p>17. Ахо А., Ульман Дж. Теория синтаксического анализа, перевода и компиляции / Пер. с англ. В.Н. Агафонова; Под ред. В.М. Курочкина. М.: Мир, 1978. Т. 1. 612 с. URL: https://rusneb.ru/catalog/000199_000009_007597729/ (дата обращения: 14.07.2025).</p>
        </note>
      </ref>
      <ref>
        <note>
          <p>18. Льюис Ф., Розенкранц Д., Стирнз Р. Теоретические основы проектирования компиляторов / Пер. с англ. В.А. Исаева и др.; Под ред. В.Н. Агафонова. М.: Мир, 1979. 645 с. URL: https://rusneb.ru/catalog/000199_000009_007626193/?ysclid=m77v68mwqf194123846 (дата обращения: 14.07.2025).</p>
        </note>
      </ref>
      <ref>
        <note>
          <p>19. Qi P., Zhang Y., Zhang Y., Bolton J., Manning C.D. Stanza: A Python Natural Language Processing Toolkit for Many Human Languages // Proceedings – 58th Annual Meeting of the Association for Computational Linguistics: System Demonstrations. 2020. P. 101–108. DOI: 10.18653/v1/2020.acl-demos.14.</p>
        </note>
      </ref>
      <ref>
        <note>
          <p>20. Заде Л.А. Понятие лингвистической переменной и его применение к принятию приближённых решений / пер. с англ. Е.Л. Нахмансона, И.Б. Флерова; под ред. С.В. Емельянова. М.: Мир, 1976. 165 с. URL: https://rusneb.ru/catalog/000200_000018_rc_2371686/ (дата обращения: 14.07.2025).</p>
        </note>
      </ref>
    </ref-list>
  </back>
</article>
