PDF Reader
1. Visão Geral
O componente PDF Reader (pdfreader) lê arquivos PDF: extrai o texto, converte páginas em imagens, ou retorna informações do documento (número de páginas, metadados).
Use quando o fluxo precisa ler o conteúdo de um PDF recebido — por exemplo, extrair o texto de um contrato ou gerar imagens das páginas de um documento para exibição. Para PDFs escaneados (imagens sem texto real), use o componente OCR após extrair as páginas como imagem. Só funciona como ação de saída.
2. Pré-requisitos
O arquivo PDF precisa estar disponível na mensagem antes deste componente rodar.
3. Autenticação e Conexão
Não aplicável.
4. Configuração / Operações Suportadas
| Campo | Obrigatório | Tipo | Descrição | Exemplo |
|---|---|---|---|---|
operation | Sim | Texto: EXTRACT_TEXT, PDF_TO_IMAGES ou GET_PDF_INFO | Operação a ser executada. | "EXTRACT_TEXT" |
file | Sim | Texto | Nome da propriedade da mensagem onde está o arquivo PDF. | "contrato" |
EXTRACT_TEXT — extrair texto do PDF
| Campo | Obrigatório | Tipo | Descrição | Exemplo |
|---|---|---|---|---|
outputFormat | Não | Texto: text ou markdown | Formato do texto extraído. Valor padrão: "text". | "markdown" |
startPage / endPage | Não | Número | Intervalo de páginas a considerar. Valor padrão: da primeira até a última página. | 1 / 5 |
contentByPage | Não | Texto ("true"/"false") | Se true, retorna o texto separado por página em vez de um único bloco. Valor padrão: "false". | "true" |
PDF_TO_IMAGES — converter páginas em imagens
| Campo | Obrigatório | Tipo | Descrição | Exemplo |
|---|---|---|---|---|
startPage / endPage | Não | Número | Intervalo de páginas a converter. | 1 / 3 |
format | Não | Texto | Formato da imagem gerada. Valor padrão: "png". | "png" |
dpi | Não | Número | Resolução das imagens geradas. Valor padrão: 300. | 150 |
GET_PDF_INFO — obter informações do documento
Sem campos extras.
5. Exemplos Práticos
Exemplo simples: extrair o texto de um contrato em PDF.
Entrada:
{
"contrato": "<arquivo .pdf, disponibilizado por um passo anterior>"
}
Configuração do componente:
{
"componentName": "pdfreader",
"configurations": {
"operation": "EXTRACT_TEXT",
"file": "contrato"
}
}
Resposta:
{
"text": "CONTRATO DE PRESTAÇÃO DE SERVIÇOS\n\nEntre as partes...",
"hasText": true,
"pages": 3,
"format": "text",
"startPage": 1,
"endPage": 3
}
Exemplo avançado: converter as duas primeiras páginas de um PDF em imagens, para exibir em uma interface.
Configuração do componente:
{
"componentName": "pdfreader",
"configurations": {
"operation": "PDF_TO_IMAGES",
"file": "contrato",
"startPage": "1",
"endPage": "2",
"format": "png",
"dpi": "150"
}
}
Resposta (as imagens ficam disponíveis como propriedades da mensagem, com os nomes indicados em file de cada item):
{
"totalPages": 3,
"startPage": 1,
"endPage": 2,
"images": [
{ "file": "page_1.png", "page": 1 },
{ "file": "page_2.png", "page": 2 }
]
}
6. Erros Comuns e Troubleshooting
| Erro / Sintoma | Causa provável | Como resolver |
|---|---|---|
| "Operation parameter is required" | O campo operation não foi preenchido. | Preencher operation com um dos valores suportados. |
| "Invalid operation: [valor]" | O valor de operation não é reconhecido. | Usar EXTRACT_TEXT, PDF_TO_IMAGES ou GET_PDF_INFO. |
| "A file is required but has not been configured." | O campo file não foi preenchido. | Preencher file com o nome da propriedade que contém o PDF. |
| "File [nome] not found inside the execution context." | O arquivo referenciado não está disponível na mensagem com esse nome. | Confirmar que um passo anterior disponibilizou o arquivo com esse nome exato. |
Texto extraído vazio (hasText: false) | O PDF é uma imagem escaneada, sem texto real embutido. | Usar PDF_TO_IMAGES seguido do componente OCR para extrair o texto da imagem. |