<?xml version="1.0" encoding="UTF-8"?>
<article xmlns:xlink="http://www.w3.org/1999/xlink" xmlns:xsi="http://www.w3.org/2001/XMLSchema-instance" xsi:noNamespaceSchemaLocation="JATS-archive-oasis-article1-4.xsd" article-type="research-article" dtd-version="1.4" xml:lang="ru">
  <front>
    <journal-meta>
      <journal-title-group>
        <journal-title>Журнал Современные наукоемкие технологии</journal-title>
      </journal-title-group>
      <issn>1812-7320</issn>
      <publisher>
        <publisher-name>Общество с ограниченной ответственностью &amp;quot;Издательский Дом &amp;quot;Академия Естествознания&amp;quot;</publisher-name>
      </publisher>
    </journal-meta>
    <article-meta>
      <article-id pub-id-type="doi">10.17513/snt.40239</article-id>
      <article-id pub-id-type="publisher-id">ART-40239</article-id>
      <title-group>
        <article-title>ИССЛЕДОВАНИЕ ЭФФЕКТИВНОСТИ МОДЕЛЕЙ НЕЙРОСЕТИ LRCN+LSTM В ЗАДАЧАХ РАСПОЗНАВАНИЯ НАСИЛИЯ НА ВИДЕО</article-title>
      </title-group>
      <contrib-group>
        <contrib contrib-type="author">
          <name-alternatives>
            <name xml:lang="ru">
              <surname>Горяев</surname>
              <given-names>В.М.</given-names>
            </name>
          </name-alternatives>
          <name-alternatives>
            <name xml:lang="en">
              <surname>Goryaev</surname>
              <given-names>V.M.</given-names>
            </name>
          </name-alternatives>
          <email>goryaeff@yandex.ru</email>
          <xref ref-type="aff" rid="aff1"/>
        </contrib>
        <contrib contrib-type="author">
          <name-alternatives>
            <name xml:lang="ru">
              <surname>Мацаков</surname>
              <given-names>Б.В.</given-names>
            </name>
          </name-alternatives>
          <name-alternatives>
            <name xml:lang="en">
              <surname>Matsakov</surname>
              <given-names>B.V.</given-names>
            </name>
          </name-alternatives>
          <email>fiit4.22@mail.ru</email>
          <xref ref-type="aff" rid="aff1"/>
        </contrib>
      </contrib-group>
      <aff id="aff1">
        <institution xml:lang="ru">ФГБОУ ВО «Калмыцкий государственный университет имени Б.Б. Городовикова»</institution>
        <institution xml:lang="en">Kalmyk State University named after B.B. Gorodovikov</institution>
      </aff>
      <pub-date date-type="pub" iso-8601-date="2024-12-20">
        <day>20</day>
        <month>12</month>
        <year>2024</year>
      </pub-date>
      <issue>12</issue>
      <fpage>17</fpage>
      <lpage>24</lpage>
      <permissions>
        <license xlink:href="https://creativecommons.org/licenses/by/4.0/">
          <license-p>This is an open-access article distributed under the terms of the CC BY 4.0 license.</license-p>
        </license>
      </permissions>
      <self-uri content-type="url" hreflang="ru">https://top-technologies.ru/article/view?id=40239</self-uri>
      <abstract xml:lang="ru" lang-variant="original" lang-source="author">
        <p>В данном исследовании целью было изучение эффективности моделей объединенных долгосрочной рекуррентной сверточной сети и сети долгой краткосрочной памяти в задаче распознавания насилия в видеофрагментах. Проводится оценка способности этих моделей обнаруживать и классифицировать насилие на видео. Для обучения был создан пользовательский набор данных из 150 помеченных видео открытого набора данных Violence Detection in Videos и 50 собственных видеофрагментов, размеченных на два класса (насилие и ненасилие). Для обучения использовались два типа сетей долгой краткосрочной памяти: однонаправленная и двунаправленная сети. Далее рассматривается эффективность объединенной архитектуры в распознавании насилия на видео, на базе оценки способности этих моделей обнаруживать и классифицировать насильственный контент в видео, а также анализ влияния различных параметров на их точность и скорость. Результаты исследования показывают, что модели сети долгой краткосрочной памяти совместно с рекуррентной нейросетью могут эффективно распознавать насилие на видео, особенно при использовании длинных и коротких временных масштабов. Для проекта используется модель сверточной сети дальнего действия, которая сочетает в себе преимущества сверточных сетей и рекуррентных нейронных сетей для извлечения объектов из видеокадров и анализа временных связей между ними. Модель сверточной сети дальнего действия с двунаправленной долговременной памятью оказалась более эффективна при получении как пространственной, так и временной информации, а также прошлого и будущего контекста места происшествия, что приводит к улучшению обнаружения признаков насилия. Это исследование способствует разработке более точных и эффективных систем видеоанализа, которые могут быть полезны в различных областях применения, таких как наблюдение и безопасность. Потери при обучении и валидации с использованием нейросетей с архитектурой двунаправленной памяти стремятся к нулю, что подтверждает точность и эффективность данного алгоритма.</p>
      </abstract>
      <abstract xml:lang="en" lang-variant="translation" lang-source="translator">
        <p>This study examines In this study, the aim was to investigate the effectiveness of combined long-term recurrent convolutional networks and long short-term memory networks in the task of violence recognition in video fragments. An evaluation was conducted on the ability of these models to detect and classify violence in videos. A custom dataset was created for training, consisting of 150 labeled videos from the open dataset “Violence Detection in Videos” and 50 of our own video fragments annotated into two classes (violence and non-violence). Two types of long short-term memory networks were used for training: unidirectional and bidirectional networks. The effectiveness of the combined architecture in recognizing violence in videos is examined based on the assessment of these models’ ability to detect and classify violent content, as well as the analysis of the impact of various parameters on their accuracy and speed. The results indicate that LSTM models combined with recurrent neural networks can effectively recognize violence in videos, particularly when using both long and short temporal scales. The project employs a long-range convolutional network model that combines the advantages of convolutional networks and recurrent neural networks for object extraction from video frames and analysis of temporal relationships between them. The long-range convolutional network model with bidirectional long-term memory proved to be more effective in obtaining both spatial and temporal information, as well as past and future context of the incident, which leads to improved detection of violence indicators. This research contributes to the development of more accurate and efficient video analysis systems that can be beneficial in various application areas, such as surveillance and security. The losses during training and validation using neural networks with bidirectional memory architecture approach zero, confirming the accuracy and effectiveness of this algorithm.</p>
      </abstract>
      <kwd-group xml:lang="ru">
        <kwd>рекуррентная нейронная сеть</kwd>
        <kwd>компьютерное зрение</kwd>
        <kwd>распознавание действий человека</kwd>
        <kwd>сети с долговременной и кратковременной памятью и дальнего действия</kwd>
        <kwd>двунаправленная сеть</kwd>
        <kwd>распознавание насилия</kwd>
      </kwd-group>
      <kwd-group xml:lang="en">
        <kwd>recurrent neural networks</kwd>
        <kwd>computer vision</kwd>
        <kwd>long- and short-term memory networks</kwd>
        <kwd>long-range networks</kwd>
        <kwd>and bidirectional networks are used for violence recognition</kwd>
      </kwd-group>
    </article-meta>
  </front>
  <back>
    <ref-list>
      <ref>
        <note>
          <p>1. Tan H.H., Lim K.H. Vanishing Gradient Mitigation with Deep Learning Neural Network Optimization // 7th International Conference on Smart Computing &amp; Communications (ICSCC). Sarawak. Malaysia. 2019. P. 1–4. DOI: 10.1109/ICSCC.2019.8843652.</p>
        </note>
      </ref>
      <ref>
        <note>
          <p>2. Zitnick S., Lawrence C., Dollar P. Edge Boxes. Locating Object Proposals from Edges // Computer Vision-ECCV 2014. Springer International Publishing. 2014. P. 391–405. DOI: 10.1007/978-3-319-10602-1_26.</p>
        </note>
      </ref>
      <ref>
        <note>
          <p>3. Ren S., He K., Girshick R., Sun J. Faster R-CNN: Towards Real-Time Object Detection with Region Proposal Networks // IEEE Transactions on Pattern Analysis and Machine Intelligence. 2017. Vol. 39, Is. 6. P. 1137–1149. DOI: 10.48550/arXiv.1506.01497.</p>
        </note>
      </ref>
      <ref>
        <note>
          <p>4. Goryaev V.M., Basangova E.O. et al. Forecasting steppe fires using remote sensing data of time series // IOP Conference Series: MSE. 2021. Vol. 1047, Is. 1. P. 12092–12098. DOI: 10.1088/1757-899X/1047/1/012092.</p>
        </note>
      </ref>
      <ref>
        <note>
          <p>5. He K., Zhang X., Ren S., Sun J. Deep Residual Learning for Image Recognition// IEEE Conference on Computer Vision and Pattern Recognition (CVPR). Las Vegas NV USA. 2016. P. 770–778. DOI: 10.1109/CVPR.2016.90.</p>
        </note>
      </ref>
      <ref>
        <note>
          <p>6. Hochreiter S., Schmidhuber J. Long short-term memory // Neural Computation. 1997. Vol. 9, Is. 8. P. 1735–1780. DOI: 10.1162/neco.1997.9.8.1735.</p>
        </note>
      </ref>
      <ref>
        <note>
          <p>7. Goryaev V.M., Uchurova E.O., Basangova E.O., Bembitov D.B., Miloshenko A.P. Analysis of digital filters for preprocessing biomedical signals from ECG apparatus // AIP Conference (MIST: Aerospace-IV). AIP publishing. 2023.Vol. 2700 (1). P. 050037–050043. DOI: 10.1063/5.0125057.</p>
        </note>
      </ref>
      <ref>
        <note>
          <p>8. Graves A., Schmidhuber J. Framewise phoneme classification with bidirectional LSTM and other neural network architectures // Neural networks. 2005. Vol. 18, Is. 5–6. P. 602–610. DOI: 10.1016/j.neunet.2005.06.042.</p>
        </note>
      </ref>
      <ref>
        <note>
          <p>9. Guan Y. Abnormal behavior recognition using 3D-CNN combined with LSTM // Multimedia Tools and Applications. 2021. Vol. 80, Is. 8. P. 18787–18801. DOI: 10.1007/s11042-021-10667-9.</p>
        </note>
      </ref>
      <ref>
        <note>
          <p>10. Ling Z.-H., Kang S.-Y., Zen H. Deep learning for acoustic modeling in parametric speech generation: A systematic review of existing techniques and future trends // IEEE Signal Processing Magazine. 2015. Vol. 32, Is. 3. P. 35–52. DOI: 10.1109/MSP.2014.2359987.</p>
        </note>
      </ref>
      <ref>
        <note>
          <p>11. Kim Ji., Kim Ja., Le T., Kim H. Long Short-Term Memory Recurrent Neural Network Classifier for Intrusion Detection // International Conference on Platform Technology and (PlatCon), Jeju Korea. 2016. Is. 2. P. 1–5. DOI: 10.1109/PlatCon.2016.7456805.</p>
        </note>
      </ref>
      <ref>
        <note>
          <p>12. Мацаков Б.В., Горяев В.М. Распознавание признаков насилия с помощью сетей долгой краткосрочной памяти LSTM // Свидетельство о государственной регистрации программы для ЭВМ 2024690113 Российская Федерация. № 2024688048: заявл. 15.11.2024: опубл. 12.12.2024 / заявитель и правообладатель В.М. Горяев. 1 с.</p>
        </note>
      </ref>
    </ref-list>
  </back>
</article>
