<?xml version="1.0" encoding="UTF-8"?>
<article xmlns:xlink="http://www.w3.org/1999/xlink" xmlns:xsi="http://www.w3.org/2001/XMLSchema-instance" xsi:noNamespaceSchemaLocation="JATS-archive-oasis-article1-4.xsd" article-type="research-article" dtd-version="1.4" xml:lang="ru">
  <front>
    <journal-meta>
      <journal-title-group>
        <journal-title>Журнал Современные наукоемкие технологии</journal-title>
      </journal-title-group>
      <issn>1812-7320</issn>
      <publisher>
        <publisher-name>Общество с ограниченной ответственностью &amp;quot;Издательский Дом &amp;quot;Академия Естествознания&amp;quot;</publisher-name>
      </publisher>
    </journal-meta>
    <article-meta>
      <article-id pub-id-type="doi">10.17513/snt.39945</article-id>
      <article-id pub-id-type="publisher-id">ART-39945</article-id>
      <title-group>
        <article-title>СЕМАНТИЧЕСКАЯ СЕГМЕНТАЦИЯ ТЕКСТОВЫХ ПОЛЕЙ И ТАБЛИЦ В ДОКУМЕНТЕ НА ОСНОВЕ ПРИМЕНЕНИЯ АРХИТЕКТУРЫ UNETFORMER</article-title>
      </title-group>
      <contrib-group>
        <contrib contrib-type="author">
          <name-alternatives>
            <name xml:lang="ru">
              <surname>Климов</surname>
              <given-names>А.М.</given-names>
            </name>
          </name-alternatives>
          <name-alternatives>
            <name xml:lang="en">
              <surname>Klimov</surname>
              <given-names>A.M.</given-names>
            </name>
          </name-alternatives>
          <email>ak12wirexia122@gmail.com</email>
          <xref ref-type="aff" rid="aff1"/>
          <xref ref-type="aff" rid="aff2"/>
        </contrib>
        <contrib contrib-type="author">
          <name-alternatives>
            <name xml:lang="ru">
              <surname>Котюжанский</surname>
              <given-names>Л.А.</given-names>
            </name>
          </name-alternatives>
          <name-alternatives>
            <name xml:lang="en">
              <surname>Kotyuzhanskiy</surname>
              <given-names>L.A.</given-names>
            </name>
          </name-alternatives>
          <email>nexus077@gmail.com</email>
          <xref ref-type="aff" rid="aff1"/>
          <xref ref-type="aff" rid="aff2"/>
        </contrib>
        <contrib contrib-type="author">
          <name-alternatives>
            <name xml:lang="ru">
              <surname>Четверкин</surname>
              <given-names>Н.В.</given-names>
            </name>
          </name-alternatives>
          <name-alternatives>
            <name xml:lang="en">
              <surname>Chetverkin</surname>
              <given-names>N.V.</given-names>
            </name>
          </name-alternatives>
          <email>nchetverkin@gmail.com</email>
          <xref ref-type="aff" rid="aff2"/>
        </contrib>
      </contrib-group>
      <aff id="aff1">
        <institution xml:lang="ru">ФГАОУ ВО «Уральский федеральный университет имени первого Президента России Б.Н. Ельцина»</institution>
        <institution xml:lang="en">Ural Federal University named after the first President of Russia B.N. Yeltsin</institution>
      </aff>
      <aff id="aff2">
        <institution xml:lang="ru">ООО «Нексус»</institution>
        <institution xml:lang="en">OOO «Nexus»</institution>
      </aff>
      <pub-date date-type="pub" iso-8601-date="2024-03-02">
        <day>02</day>
        <month>03</month>
        <year>2024</year>
      </pub-date>
      <issue>3</issue>
      <fpage>49</fpage>
      <lpage>55</lpage>
      <permissions>
        <license xlink:href="https://creativecommons.org/licenses/by/4.0/">
          <license-p>This is an open-access article distributed under the terms of the CC BY 4.0 license.</license-p>
        </license>
      </permissions>
      <self-uri content-type="url" hreflang="ru">https://top-technologies.ru/article/view?id=39945</self-uri>
      <abstract xml:lang="ru" lang-variant="original" lang-source="author">
        <p>Аннотация. В статье рассматривается применение архитектуры UNetFormer для решения задачи семантической сегментации текстовых строк и таблиц в документах. Цель исследования – решение задачи семантической сегментации для документов, имеющих особенности, которые могут встречаться на одной странице документа: различные ориентации текста, таблицы, шумы и инородные объекты (печати, подписи). В качестве решения поставленной задачи была выбрана архитектура нейронной сети для семантической сегментации – UNetFormer, которая показывает высокую эффективность в других задачах: семантической сегментации спутниковых и медицинских снимков. Также для более эффективного обучения авторы предлагают использование метода аугментации данных в реальном времени с помощью генерации и преобразования реальных данных. Для определения ориентации текста в обучающих данных использовались карты, соответствующие различным ориентациям текста, а также карты для детекции таблиц (их ребер и узлов) и ядер строк для более точного вырезания текстовых прямоугольников с последующей обработкой моделью распознавания текста. Полученные результаты демонстрируют высокий показатель среднего значения индекса Жаккара (mIoU = 0,833) на датасете из 1230 размеченных документов, собранном авторами.</p>
      </abstract>
      <abstract xml:lang="en" lang-variant="translation" lang-source="translator">
        <p>Annotation. The article discusses the application of the UNetFormer architecture to solve the problem of semantic segmentation of text strings and tables in documents. The purpose of the study is to solve the problem of semantic segmentation for documents that have features that can occur on one page of a document: different orientations of text, tables, noises and foreign objects (seals, signatures). As a solution to this problem, the neural network architecture for semantic segmentation, UNetFormer, was chosen, which shows high efficiency in other tasks: semantic segmentation of satellite and medical images. Also, for more effective training, the authors suggest using the real-time data augmentation method by generating and converting real data. To determine the orientation of the text in the training data, maps corresponding to different orientations of the text were used, as well as maps for detecting tables (their edges and nodes) and string kernels for more accurate cutting of text rectangles with subsequent processing by a text recognition model. The results obtained demonstrate a high indicator of the average value of the Jacquard index (mIoU = 0.833) on a dataset of 1230 marked-up documents collected by authors.</p>
      </abstract>
      <kwd-group xml:lang="ru">
        <kwd>UNet</kwd>
        <kwd>UNetFormer</kwd>
        <kwd>детекция текста</kwd>
        <kwd>семантическая сегментация документов</kwd>
        <kwd>оптическое распознавание текста</kwd>
      </kwd-group>
      <kwd-group xml:lang="en">
        <kwd>UNet</kwd>
        <kwd>UNetFormer</kwd>
        <kwd>text detection</kwd>
        <kwd>documents semantic segmentation</kwd>
        <kwd>optical text recognition</kwd>
      </kwd-group>
    </article-meta>
  </front>
  <back>
    <ref-list>
      <ref>
        <note>
          <p>1. Котюжанский Л.А., Четверкин Н.В., Протасевич А.А., Кочеров Р.В., Рыжкова Н.Г. Классификация сканированных документов с использованием сверточной нейросети // Современные наукоемкие технологии. 2021. № 6. С. 45–49.</p>
        </note>
      </ref>
      <ref>
        <note>
          <p>2. Полюхин Д.А., Сальников И.И. Методы и этапы распознавания рукописного текста // Научное обозрение. Педагогические науки. 2019. № 3. С. 71–74.</p>
        </note>
      </ref>
      <ref>
        <note>
          <p>3. Wong K.Y., Casey R.G., Wahl F.M. Document analysis system // IBM Journal of Research and Development. 1982. Vol. 26, Is. 6. Р. 647–656. DOI: 10.1147/rd.266.0647.</p>
        </note>
      </ref>
      <ref>
        <note>
          <p>4. Wang X., He Z., Wang K., Wang Y., Zou L., Wu Z. A survey of text detection and recognition algorithms based on deep learning technology // Neurocomputing. 2023. Vol. 556. DOI: 10.1016/j.neucom.2023.126702.</p>
        </note>
      </ref>
      <ref>
        <note>
          <p>5. Huang J., Pang G., Kovvuri R., Toh M., Liang K.J., Krishnan P., Yin X., Hassner T. A multiplexed network for end-to-end, multilingual OCR // 2021 IEEE/CVF Conference on Computer Vision and Pattern Recognition. 2021. P. 4547–4557. [Электронный ресурс]. URL: https://ieeexplore.ieee.org/document/9577633 (дата обращения: 17.01.2024).</p>
        </note>
      </ref>
      <ref>
        <note>
          <p>6. Busta M., Neumann L., Matas J. Deep textspotter: An end-to-end trainable scene text localization and recognition framework // 2017 IEEE International Conference on Computer Vision (ICCV). IEEE, 2017. P. 2380–7504. [Электронный ресурс]. URL: https://ieeexplore.ieee.org/document/8237504 (дата обращения: 17.01.2024).</p>
        </note>
      </ref>
      <ref>
        <note>
          <p>7. Wang L., Li R., Zhang C., Fang S., Duan C., Meng X., Atkinson P.M. Unetformer: A unet-like transformer for efficient semantic segmentation of remote sensing urban scene imagery // ISPRS Journal of Photogrammetry and Remote Sensing. 2022. Vol. 190. Р. 196–214. DOI: 10.1016/j.isprsjprs.2022.06.008.</p>
        </note>
      </ref>
      <ref>
        <note>
          <p>8. Hatamizadeh A., Xu Z., Yang D., Li W., Roth H., Xu D. Unetformer: A unified vision transformer model and pre-training framework for 3d medical image segmentation // Cornell University. 2022. [Электронный ресурс]. URL: https://arxiv.org/abs/2204.00631 (дата обращения: 17.01.2024).</p>
        </note>
      </ref>
      <ref>
        <note>
          <p>9. Badrinarayanan V., Handa A., Cipolla R. Segnet: A deep convolutional encoder-decoder architecture for robust semantic pixel-wise labelling // Cornell University. 2015. [Электронный ресурс]. URL: https://arxiv.org/abs/1505.07293 (дата обращения: 17.01.2024).</p>
        </note>
      </ref>
      <ref>
        <note>
          <p>10. Ronneberger O., Fischer P., Brox T. U-net: Convolutional networks for biomedical image segmentation // MICCAI 2015. P. 234–241. [Электронный ресурс]. URL: https://arxiv.org/abs/1505.04597 (дата обращения: 17.01.2024).</p>
        </note>
      </ref>
      <ref>
        <note>
          <p>11. Kingma D.P., Ba J. Adam: A method for stochastic optimization // Cornell University. 2017. [Электронный ресурс]. URL: https://arxiv.org/abs/1412.6980 (дата обращения: 17.01.2024).</p>
        </note>
      </ref>
    </ref-list>
  </back>
</article>
