DocInspect API — обработка документов одним вызовом

На входе — файл, задача обычными словами и JSON-схема ответа. На выходе — структурированный результат по этой схеме. Извлечение реквизитов, классификация, сравнение и анализ документов — частные случаи одного вызова.

Формат
REST, JSON
Документы
PDF, сканы, фото
Хранение файлов
Не сохраняются
POST/v1/processJSON
# Запрос
X-API-Key: docai_sk_····

file          = postavka_247.pdf
prompt        = "Извлеки поставщика, номер, дату
                 и сумму счёта с НДС"
output_schema = { "type": "object", … }

# Ответ
{
  "result": {
    "supplier": { "name": "ООО «Поставщик»", "inn": "7701234567" },
    "number": "247/11",
    "date": "2026-11-06",
    "total": 221400.00,
    "vat": 36900.00
  },
  "usage": { "pages": 2 }
}
Вызов и ответ приведены в сокращении. Значения демонстрационные.

Путь документа через сервис

Один вызов проходит пять шагов. Персональные данные не покидают контур в открытом виде ни на одном из них.

ФайлPDF, скан, фотоРаспознаваниеOCR и структураОчисткаПДн → плейсхолдерыМодельзадача + схемаОтветJSON по схемеГРАНИЦА ДАННЫХ
ШагЧто происходитОграничение
1Приём файлаPDF, скан или фотография; тип и структура документа определяются автоматическиФайл не записывается в постоянное хранилище
2РаспознаваниеOCR кириллицы и разбор структуры: таблицы, печати, рукописные пометкиМногостраничные сканы обрабатываются асинхронно
3Очистка данныхРеквизиты, имена, компании и адреса заменяются плейсхолдерами до обращения к моделиЕсли очистка не удалась — вызов останавливается с ошибкой, данные остаются внутри
4Выполнение задачиМодель выполняет задачу из запроса и заполняет поля переданной JSON-схемыПри сбое основной модели запрос переигрывается резервной
5ОтветПлейсхолдеры заменяются обратно на реальные значения, результат валидируется по схемеДанные возвращаются только в теле ответа — сервис не пишет в базы клиента

Один эндпоинт

Вся обработка — единая операция POST /v1/process: файл или текст на входе, вид задачи определяется полями запроса. Бизнес-логика — схемы и инструкции — остаётся на стороне клиента. Авторизация по ключу в заголовке запроса.

РежимПоля запросаНазначение
Извлечение по схемеoutput_schemaРеквизиты счёта, УПД, акта или договора возвращаются по переданной JSON-схеме
Задача по инструкцииoutput_schema + promptКлассификация, сравнение и анализ документа — задача ставится обычными словами
Сверка с реестромmatchИзвлечённый результат сверяется с записями реестра на стороне клиента
Разбиение сканаsplitМногодокументный PDF нарезается на отдельные документы, без обращения к модели
Секции ответаincludeК результату добавляются markdown, фрагменты текста, таблицы и поля с координатами

Длинные документы обрабатываются асинхронно: сервис отвечает номером задачи, результат забирается по GET /v1/process/{task_id}.

Граница данных

Сервис спроектирован под работу с чужими документами: NDA, коммерческая тайна, персональные данные по 152-ФЗ.

Очистка перед каждым внешним вызовом

Реквизиты, имена, названия компаний и адреса заменяются плейсхолдерами до обращения к модели. Если очистка не выполнена, запрос не отправляется — сервис возвращает ошибку.

Документы не сохраняются

Файл обрабатывается и уничтожается; результат существует только в теле ответа. Сервис не ведёт архива документов и не пишет в базы данных клиента.

Развёртывание в закрытом контуре

Для организаций с запретом на передачу данных наружу сервис разворачивается на оборудовании заказчика вместе с моделью.

Модель не видит, чей это документ.

Очистка выполняется перед каждым обращением к модели. Если остаточные персональные данные пережили очистку, вызов блокируется с ошибкой. Граница проверяется в каждом запросе.

Тот же движок работает в платформе

Внутри системы учёта DocInspect этот сервис разбирает входящие счета и закрывающие документы: реквизиты, позиции и ставки НДС подставляются в карточки, сотрудник подтверждает результат. Подключая API, вы получаете тот же механизм для собственных систем.

Файл в DocInspect после обработки: коммерческий инвойс со статусом «Обработан» и вкладками Оригинал, Markdown и JSON — виден текст, который модель прочитала из скана
Обработанный файл в платформе: рядом с оригиналом — Markdown и JSON, которые модель прочитала из скана. Извлечение проверяется глазами до подтверждения. Данные демонстрационные: названия компаний, реквизиты и суммы вымышлены.

Использовать внутри DocInspect

Распознавание уже работает в учётной платформе: входящие счета, УПД и акты заполняются сами. Покажем на демонстрации.

Запросить демонстрацию

Подключить по API

Отдельный сервис, документация, тарифы и ключи доступа — на сайте DocInspect API.

api.docinspect.ru