Вход на сайт

Просмотр новости

Найдите то, что Вас интересует

«Диасофт» разработал продукт для интеллектуального разбора документов

Дата публикации: 29-07-2026 10:07:00

Компания «Диасофт» объявила о расширении функциональности решения «Фабрика данных» (Digital Q.DataFactory) и включении...

Основное содержимое страницы с новостью.

29 Июля 2026 13:07 29 Июл 2026 13:07 |

«Диасофт» разработал продукт для интеллектуального разбора документов

Компания «Диасофт» объявила о расширении функциональности решения «Фабрика данных» (Digital Q.DataFactory) и включении в его состав нового программного продукта «Сервис интеллектуального парсинга документов». Продукт позволяет автоматизировать сквозную обработку неструктурированных данных из файлов различных форматов для последующей аналитики и использования в ИИ-сценариях.

Функциональные возможности «Сервиса интеллектуального парсинга документов»:

Единый HTTP API для приема файлов различных форматов (PDF, DOCX, PPTX, XLSX, HTML, изображения, аудиоформаты) и их преобразования в структурированные данные (JSON, Markdown, HTML) без потери семантики.

Продвинутые алгоритмы OCR: распознавание текста сканированных документов и изображений, включая рукописный ввод, с поддержкой любых языков и кодировок.

Технологии ASR (распознавание речи): автоматическая транскрибация аудиозаписей в текст с разделением по спикерам, определением временных меток и расстановкой знаков препинания.

Извлечение структуры и таблиц: автоматическое определение логической структуры документа и контента (текст, таблицы), что критически важно для корректной работы поисковых движков и ИИ-ассистентов.

«Сервис интеллектуального парсинга документов» помогает в работе с большими объемами неструктурированных данных, которые невозможно использовать для LLM-проектов и RAG-сценариев без качественной подготовки. Продукт позволяет устранить риски зависимости от иностранных библиотек (Docling, Apache Tika), снижает трудозатраты на разработку собственных конвейеров конвертации.

Илья Шуйков, руководитель продукта «Фабрика данных», сказал: «Часто заказчики отказываются от внедрения ИИ-ассистентов из-за «грязных» входных данных: PDF с таблицами или сканы плохо индексируются, нейросеть галлюцинирует. Наш сервис решает это «из коробки»: он не просто распознает символы, а сохраняет логику документа, превращая его в готовый формат для RAG (Markdown/JSON). Это позволяет клиентам в разы быстрее выводить ИИ-продукты в эксплуатацию и закрыть вопрос импортозамещения, заменив зарубежные аналоги безопасным отечественным решением».

Продукт разработан в микросервисной архитектуре. Он поддерживает контейнеризированное развертывание в контуре заказчика и гибко масштабируется при росте нагрузок.

Схожие новости

#Наименование новостиТональностьИнформативностьДата публикации
1Woodside among Where to Retire's Best 50 Master-Planned Communities in nation0004-06-2019
2AutoFAQ обновила цифрового консультанта Xplain Sales07.6205-08-2026
3Ботокс и мигрень. Как вы уже знаете, мигрень считается неизлечим, ...0020-02-2025
4shikaj : nvidia dlss-40021-02-2025
5ABC: Трамп рассматривает возможность отставки главы аппарата Белого дома0013-11-2018
6Багаевская: Утро 18 дек, Вт0017-12-2018
7Спрос на перевозки из Китая и Казахстана в Беларусь вырос в 3 раза0028-01-2025
8ISL | Bengaluru will be keen on regaining consistency as it faces Mohammedan0010-01-2025
9Путин присвоил командующему Черноморским флотом Сергею Пинчуку звание адмирала0021-02-2025
1011/28: Bear Goggles On- Chicago Bears: Bold Predictions for Thanksgiving Game vs Lions0028-11-2019

Классификация: Пресс-релизы. Схожих патентов: 0. Схожих новостей: 10. Тональность: 0. Информативность: 9.03. Источник: www.cnews.ru.