Pular para o conteúdo principal

PDF Reader

1. Visão Geral

O componente PDF Reader (pdfreader) lê arquivos PDF: extrai o texto, converte páginas em imagens, ou retorna informações do documento (número de páginas, metadados).

Use quando o fluxo precisa ler o conteúdo de um PDF recebido — por exemplo, extrair o texto de um contrato ou gerar imagens das páginas de um documento para exibição. Para PDFs escaneados (imagens sem texto real), use o componente OCR após extrair as páginas como imagem. Só funciona como ação de saída.

2. Pré-requisitos

O arquivo PDF precisa estar disponível na mensagem antes deste componente rodar.

3. Autenticação e Conexão

Não aplicável.

4. Configuração / Operações Suportadas

CampoObrigatórioTipoDescriçãoExemplo
operationSimTexto: EXTRACT_TEXT, PDF_TO_IMAGES ou GET_PDF_INFOOperação a ser executada."EXTRACT_TEXT"
fileSimTextoNome da propriedade da mensagem onde está o arquivo PDF."contrato"

EXTRACT_TEXT — extrair texto do PDF

CampoObrigatórioTipoDescriçãoExemplo
outputFormatNãoTexto: text ou markdownFormato do texto extraído. Valor padrão: "text"."markdown"
startPage / endPageNãoNúmeroIntervalo de páginas a considerar. Valor padrão: da primeira até a última página.1 / 5
contentByPageNãoTexto ("true"/"false")Se true, retorna o texto separado por página em vez de um único bloco. Valor padrão: "false"."true"

PDF_TO_IMAGES — converter páginas em imagens

CampoObrigatórioTipoDescriçãoExemplo
startPage / endPageNãoNúmeroIntervalo de páginas a converter.1 / 3
formatNãoTextoFormato da imagem gerada. Valor padrão: "png"."png"
dpiNãoNúmeroResolução das imagens geradas. Valor padrão: 300.150

GET_PDF_INFO — obter informações do documento

Sem campos extras.

5. Exemplos Práticos

Exemplo simples: extrair o texto de um contrato em PDF.

Entrada:

{
"contrato": "<arquivo .pdf, disponibilizado por um passo anterior>"
}

Configuração do componente:

{
"componentName": "pdfreader",
"configurations": {
"operation": "EXTRACT_TEXT",
"file": "contrato"
}
}

Resposta:

{
"text": "CONTRATO DE PRESTAÇÃO DE SERVIÇOS\n\nEntre as partes...",
"hasText": true,
"pages": 3,
"format": "text",
"startPage": 1,
"endPage": 3
}

Exemplo avançado: converter as duas primeiras páginas de um PDF em imagens, para exibir em uma interface.

Configuração do componente:

{
"componentName": "pdfreader",
"configurations": {
"operation": "PDF_TO_IMAGES",
"file": "contrato",
"startPage": "1",
"endPage": "2",
"format": "png",
"dpi": "150"
}
}

Resposta (as imagens ficam disponíveis como propriedades da mensagem, com os nomes indicados em file de cada item):

{
"totalPages": 3,
"startPage": 1,
"endPage": 2,
"images": [
{ "file": "page_1.png", "page": 1 },
{ "file": "page_2.png", "page": 2 }
]
}

6. Erros Comuns e Troubleshooting

Erro / SintomaCausa provávelComo resolver
"Operation parameter is required"O campo operation não foi preenchido.Preencher operation com um dos valores suportados.
"Invalid operation: [valor]"O valor de operation não é reconhecido.Usar EXTRACT_TEXT, PDF_TO_IMAGES ou GET_PDF_INFO.
"A file is required but has not been configured."O campo file não foi preenchido.Preencher file com o nome da propriedade que contém o PDF.
"File [nome] not found inside the execution context."O arquivo referenciado não está disponível na mensagem com esse nome.Confirmar que um passo anterior disponibilizou o arquivo com esse nome exato.
Texto extraído vazio (hasText: false)O PDF é uma imagem escaneada, sem texto real embutido.Usar PDF_TO_IMAGES seguido do componente OCR para extrair o texto da imagem.