Appearance
Content Extract
Сервис content-extract отвечает за извлечение чистого текста из сложных и бинарных форматов файлов.
Порты
- Порт PM2 / контейнера:
8112 - Опубликованный Docker-порт:
18112
Поддерживаемые форматы
- PDF (
.pdf) — извлечение текстового слоя (без OCR). - Word (
.docx) — парсинг структурыword/document.xml. - Excel (
.xlsx,.xls) — извлечение листов и ячеек. - PowerPoint (
.pptx) — извлечение слайдов, заголовков и списков. - EPUB (
.epub) — распаковка и парсинг главы HTML/XHTML. - RTF (
.rtf) — очистка от управляющих последовательностей.
HTTP API
| Метод | Путь | Описание |
|---|---|---|
POST | /api/v1/extract | Принимает multipart/form-data файл или JSON payload c content_b64 и возвращает извлеченный текст |