/parse — o apunta /scrape
a la URL de un documento público — y obtén markdown, contenido por página, bloques de
diseño tipados o JSON estructurado.
- Con reconocimiento del diseño: encabezados, párrafos, tablas y fórmulas organizados en orden de lectura
- Incluye documentos escaneados: extracción de texto nativo con OCR como alternativa para páginas que solo contienen imágenes
- Estructura basada en el documento: bloques de diseño tipados con cuadros delimitadores y enlaces a rangos de caracteres en el markdown (PDF)
- Cualquier formato habitual: PDF, Word, Excel, PowerPoint, OpenDocument, EPUB, CSV, HTML
- Compatible con retención de datos cero
Inicio rápido
¿Tienes una URL pública de un documento en lugar de un archivo?
/scrape
detecta el tipo de archivo y lo procesa de forma idéntica — mismas opciones, misma salida:
firecrawl.scrape("https://example.com/report.pdf").Respuesta
numPages es el número de páginas realmente procesadas; totalPages es el
número real de páginas del documento. Coinciden a menos que maxPages haya truncado el resultado; p. ej., procesar
un PDF de 100 páginas con maxPages: 10 devuelve numPages: 10 y totalPages: 100, por lo que
totalPages > numPages indica que la salida se truncó. totalPages se omite
cuando no se puede determinar el número de páginas.Markdown físico por página (PDF)
pages: true en el parser de PDF y el documento también
incluye un array pages con el markdown de cada página física, útil cuando
necesitas saber de qué página proviene el contenido o procesar las páginas de forma independiente.
Sin costo adicional.
Bloques de diseño (PDF)
blocks: true en el parser de PDF y el documento también
incluye un array blocks: para cada página, los bloques de diseño tipados que detectó
el motor de procesamiento, con geometría y procedencia. Es la contraparte estructurada
del markdown: úsala para la fundamentación de citas, superposiciones de resaltado
o auditar el contenido de un documento. Sin costo adicional.

Todos los bloques que detecta el motor, tipados y posicionados: las mismas regiones que se convierten en markdown.
Campos de bloque
Fundamentación: de una respuesta a la página
markdownSpan vincula cada bloque con la subcadena exacta del markdown que
generó. Esto hace que la fundamentación de las citas sea una búsqueda, no una inferencia: busca el
texto citado en el markdown, encuentra el bloque cuyo intervalo cubre ese desplazamiento
y tendrás el número de página y el cuadro delimitador, sin pedirle nunca
coordenadas a un modelo de lenguaje.
Salida JSON estructurada
Opciones de PDF
parsers, tanto en /parse como en
/scrape:
Al pasar
parsers: [], se omite por completo el procesamiento y se devuelve el PDF en base64
(1 crédito fijo).
Modos de procesamiento
Formatos compatibles
.html, .htm, .xhtml, .pdf, .docx, .doc, .docm, .odt, .ods, .odp, .rtf, .xlsx, .xls, .xlsm, .xlsb, .pptx, .ppt, .pptm, .epub, .csv.
Consulta Document Parsing para saber cómo se
convierte cada formato.
Referencia de la solicitud
multipart/form-data con una parte file obligatoria y una
parte JSON options opcional. options acepta un subconjunto de las opciones de scraping:
formats: array de formatos de salida. El valor predeterminado es["markdown"]. Admitidos:markdown,html,rawHtml,links,images,resumenyjson(con un schema o prompt).onlyMainContent: Solo devuelve el contenido principal del documento. El valor predeterminado estrue.includeTags/excludeTags: Inclusión o exclusión por etiqueta (entradas HTML).redactPII: Redacta la información de identificación personal del markdown devuelto.timeout: Tiempo de espera de la solicitud en milisegundos. El valor predeterminado es30000; el máximo,300000.parsers: Opciones del parser de archivos — consulta las opciones de PDF.
/parse no admite opciones exclusivas del navegador como actions, waitFor, location, mobile o seguimiento de cambios.Consideraciones
- El tamaño máximo de archivo es de 50 MB por solicitud.
- El procesamiento de PDF se factura a 1 crédito por página; las opciones
pagesyblocksno generan ningún costo adicional. - Procesar archivos PDF muy grandes o escaneados en modo
ocrpuede tardar más; aumentatimeouto usamaxPagespara limitar el procesamiento. - Para lotes de archivos, llama a
/parsepor archivo en paralelo; no existe una variante de carga por lote.
¿Eres un agente de IA que necesita una API key de Firecrawl? Consulta firecrawl.dev/agent-onboarding/SKILL.md para ver las instrucciones de incorporación automatizada.

