Skip to content

Content Extract

Сервис content-extract отвечает за извлечение чистого текста из сложных и бинарных форматов файлов.

Порты

  • Порт PM2 / контейнера: 8112
  • Опубликованный Docker-порт: 18112

Поддерживаемые форматы

  • PDF (.pdf) — извлечение текстового слоя (без OCR).
  • Word (.docx) — парсинг структуры word/document.xml.
  • Excel (.xlsx, .xls) — извлечение листов и ячеек.
  • PowerPoint (.pptx) — извлечение слайдов, заголовков и списков.
  • EPUB (.epub) — распаковка и парсинг главы HTML/XHTML.
  • RTF (.rtf) — очистка от управляющих последовательностей.

HTTP API

МетодПутьОписание
POST/api/v1/extractПринимает multipart/form-data файл или JSON payload c content_b64 и возвращает извлеченный текст