Skip to main content
Procesar convierte documentos en datos limpios y listos para LLM. Sube un archivo a /parse — o apunta /scrape a la URL de un documento público — y obtén markdown, contenido por página, bloques de diseño tipados o JSON estructurado.
  • Con reconocimiento del diseño: encabezados, párrafos, tablas y fórmulas organizados en orden de lectura
  • Incluye documentos escaneados: extracción de texto nativo con OCR como alternativa para páginas que solo contienen imágenes
  • Estructura basada en el documento: bloques de diseño tipados con cuadros delimitadores y enlaces a rangos de caracteres en el markdown (PDF)
  • Cualquier formato habitual: PDF, Word, Excel, PowerPoint, OpenDocument, EPUB, CSV, HTML
  • Compatible con retención de datos cero

Inicio rápido

¿Tienes una URL pública de un documento en lugar de un archivo? /scrape detecta el tipo de archivo y lo procesa de forma idéntica — mismas opciones, misma salida: firecrawl.scrape("https://example.com/report.pdf").

Respuesta

Los SDK devuelven el objeto de documento directamente. cURL devuelve la carga útil en JSON.
numPages es el número de páginas realmente procesadas; totalPages es el número real de páginas del documento. Coinciden a menos que maxPages haya truncado el resultado; p. ej., procesar un PDF de 100 páginas con maxPages: 10 devuelve numPages: 10 y totalPages: 100, por lo que totalPages > numPages indica que la salida se truncó. totalPages se omite cuando no se puede determinar el número de páginas.
Además del markdown del documento, tres salidas cubren los casos en los que una sola cadena de markdown no es suficiente: markdown por página y bloques de diseño para documentos PDF, y JSON estructurado para todos los formatos.

Markdown físico por página (PDF)

Establece pages: true en el parser de PDF y el documento también incluye un array pages con el markdown de cada página física, útil cuando necesitas saber de qué página proviene el contenido o procesar las páginas de forma independiente. Sin costo adicional.

Bloques de diseño (PDF)

Establece blocks: true en el parser de PDF y el documento también incluye un array blocks: para cada página, los bloques de diseño tipados que detectó el motor de procesamiento, con geometría y procedencia. Es la contraparte estructurada del markdown: úsala para la fundamentación de citas, superposiciones de resaltado o auditar el contenido de un documento. Sin costo adicional.
Una página de PDF procesada con cuadros delimitadores de colores superpuestos sobre cada bloque de diseño detectado: título, texto, encabezados de sección, tabla, figura, leyenda, pie de página y número de página

Todos los bloques que detecta el motor, tipados y posicionados: las mismas regiones que se convierten en markdown.

Campos de bloque

Fundamentación: de una respuesta a la página

markdownSpan vincula cada bloque con la subcadena exacta del markdown que generó. Esto hace que la fundamentación de las citas sea una búsqueda, no una inferencia: busca el texto citado en el markdown, encuentra el bloque cuyo intervalo cubre ese desplazamiento y tendrás el número de página y el cuadro delimitador, sin pedirle nunca coordenadas a un modelo de lenguaje.

Salida JSON estructurada

Proporciona un JSON schema o un prompt para extraer datos estructurados directamente del documento:

Opciones de PDF

Todo el comportamiento relacionado con PDF se controla mediante la opción parsers, tanto en /parse como en /scrape:
Al pasar parsers: [], se omite por completo el procesamiento y se devuelve el PDF en base64 (1 crédito fijo).

Modos de procesamiento

Formatos compatibles

Extensiones: .html, .htm, .xhtml, .pdf, .docx, .doc, .docm, .odt, .ods, .odp, .rtf, .xlsx, .xls, .xlsm, .xlsb, .pptx, .ppt, .pptm, .epub, .csv. Consulta Document Parsing para saber cómo se convierte cada formato.

Referencia de la solicitud

La solicitud es multipart/form-data con una parte file obligatoria y una parte JSON options opcional. options acepta un subconjunto de las opciones de scraping:
  • formats: array de formatos de salida. El valor predeterminado es ["markdown"]. Admitidos: markdown, html, rawHtml, links, images, resumen y json (con un schema o prompt).
  • onlyMainContent: Solo devuelve el contenido principal del documento. El valor predeterminado es true.
  • includeTags / excludeTags: Inclusión o exclusión por etiqueta (entradas HTML).
  • redactPII: Redacta la información de identificación personal del markdown devuelto.
  • timeout: Tiempo de espera de la solicitud en milisegundos. El valor predeterminado es 30000; el máximo, 300000.
  • parsers: Opciones del parser de archivos — consulta las opciones de PDF.
/parse no admite opciones exclusivas del navegador como actions, waitFor, location, mobile o seguimiento de cambios.
¿Usas Firecrawl a través de MCP? Usa firecrawl_parse para archivos locales. El MCP local puede leer el archivo directamente cuando está configurado con FIRECRAWL_API_URL. El MCP remoto alojado primero devuelve un comando de carga de corta duración y luego procesa el uploadRef devuelto. Las URL de documentos públicos deben seguir usando /scrape.

Consideraciones

  • El tamaño máximo de archivo es de 50 MB por solicitud.
  • El procesamiento de PDF se factura a 1 crédito por página; las opciones pages y blocks no generan ningún costo adicional.
  • Procesar archivos PDF muy grandes o escaneados en modo ocr puede tardar más; aumenta timeout o usa maxPages para limitar el procesamiento.
  • Para lotes de archivos, llama a /parse por archivo en paralelo; no existe una variante de carga por lote.
¿Eres un agente de IA que necesita una API key de Firecrawl? Consulta firecrawl.dev/agent-onboarding/SKILL.md para ver las instrucciones de incorporación automatizada.