Extraer imágenes en miniatura de documentos
🤖/document/thumbs genera una imagen para cada página de un archivo PDF o un archivo GIF animado que recorre todas las páginas en bucle.

Aspectos que debes tener en cuenta
- Si conviertes un archivo PDF de varias páginas en varias imágenes, todas las imágenes resultantes se ordenarán de modo que la primera sea la miniatura de la primera página del documento, y así sucesivamente.
- También puedes consultar la clave
meta.thumb_indexde cada imagen resultante para saber a qué página corresponde. Ten en cuenta que estos índices de miniaturas comienzan en 0, no en 1.
Ejemplo de uso
Convierte todas las páginas de un documento PDF en imágenes separadas de 200px de ancho:
{
"steps": {
"thumbnailed": {
"use": ":original",
"robot": "/document/thumbs",
"width": 200,
"resize_strategy": "fit",
"trim_whitespace": false
}
}
}Parámetros
interpolateboolean | Record<string, boolean>Controla si las Assembly Variables se interpolan en campos de instrucciones individuales.
De forma predeterminada, la mayoría de los campos de instrucciones de los Robots interpolan Assembly Variables. Establece esta opción en
falsepara tratar todos los campos de instrucciones como texto literal, o establece la ruta de un campo individual enfalsepara tratar únicamente ese campo como texto literal. En el caso de los campos específicos de un Robot que son literales de forma predeterminada, establece esta opción entrueo la ruta de ese campo entruepara volver a habilitar la interpolación.Usa nombres de campos como
patho rutas con puntos comoffmpeg.vfpara los objetos anidados.output_metaRecord<string, boolean> | boolean | Array<string>Te permite especificar un conjunto de metadatos cuyo cálculo requiere más recursos de CPU y que, por lo tanto, está desactivado de forma predeterminada para que tus Assemblies se procesen rápidamente.
Para imágenes, puedes añadir
"has_transparency": truea este objeto para determinar si la imagen contiene partes transparentes y"dominant_colors": truepara extraer un array de códigos de color hexadecimales de la imagen.Para imágenes, también puedes añadir
"blurhash": truepara extraer una cadena BlurHash, una representación compacta de un marcador de posición para la imagen que resulta útil para mostrar una vista previa desenfocada mientras se carga la imagen completa.Para videos, puedes añadir el parámetro
"colorspace": truepara extraer el espacio de color del video de salida.Para videos, también puedes añadir
"interlaced": truepara detectar si el video está entrelazado. Esto combina el indicadorfield_orderde ffprobe, cuyo costo en recursos de procesamiento es bajo, con una pasada de muestreo limitada medianteidetsobre los primeros fotogramas de la fuente, y exponeinterlaced,field_ordery un objeto de diagnósticointerlace_detectionenfile.meta. Esto requiere muchos recursos computacionales y se factura en consecuencia.Para audio, puedes añadir
"mean_volume": truepara obtener un único valor que represente el volumen promedio del archivo de audio.También puedes establecerlo en
falsepara omitir la extracción de metadatos y acelerar la transcodificación.user_metaRecord<string, any>(valor predeterminado:{})Añade metadatos personalizados a cada archivo emitido por este Robot sin modificar el contenido del archivo.
Los valores se combinan con los
user_metaexistentes en el archivo de entrada. Si ambos objetos contienen la misma clave, el valor de este Robot tiene prioridad. Se admiten Assembly Variables, por ejemplo{ "internal_file_id": "${file.id}" }.resultboolean(valor predeterminado:false)Indica si los resultados de este Step deben aparecer en el Assembly Status JSON
queuebatchEstablecer la cola en «batch» reduce manualmente la prioridad de los Jobs de este Step para evitar consumir cupos prioritarios con Jobs que no necesitan un tiempo de espera cero en la cola
force_acceptboolean(valor predeterminado:false)Forzar a un Robot a aceptar un tipo de archivo que habría ignorado.
De forma predeterminada, los Robots ignoran los archivos que no reconocen. 🤖/video/encode, por ejemplo, ignorará sin problemas las imágenes de entrada.
Si configuras el parámetro
force_acceptcomotrue, puedes forzar a los Robots a aceptar todos los archivos que reciban. Esto normalmente provocará errores y solo debe usarse para depuración o para abordar casos extremos.ignore_errorsboolean | Array<meta | execute>(valor predeterminado:[])Ignorar errores durante fases específicas del procesamiento.
Establecer este parámetro en
["meta"]hará que el Robot ignore los errores durante la extracción de metadatos.Establecer este parámetro en
["execute"]hará que el Robot ignore los errores durante la fase principal de ejecución.Configurar este parámetro como
trueequivale a["meta", "execute"]y hará que se ignoren los errores en ambas fases.usestring | Array<string> | Array<object> | objectEspecifica qué Step o Steps se usarán como entrada.
- Puedes elegir cualquier nombre para los Steps, excepto
":original"(reservado para las subidas de usuarios gestionadas por Transloadit) - Puedes proporcionar varios Steps como entrada mediante arrays:
{ "use": [ ":original", "encoded", "resized" ] } - También puedes etiquetar los Steps de entrada con
aspara comunicar la intención semántica a los Robots:{ "use": [ { "name": ":original", "as": "image" }, { "name": ":original", "as": "mask" } ] }
ConsejoProbablemente eso sea todo lo que necesitas saber sobre
use, pero puedes consultar los casos de uso avanzados.- Puedes elegir cualquier nombre para los Steps, excepto
pagestring | number | null(valor predeterminado:null)La página del PDF que quieres convertir en una imagen. De forma predeterminada, el valor es
null, lo que significa que todas las páginas se convertirán en imágenes.page_rangestring | null(valor predeterminado:null)Un intervalo de páginas que se extraerá, con el formato
"start-end"(p. ej.,"1-20"). La extracción comienza en la primera página del intervalo y continúa secuencialmente; se detiene sin generar errores cuando una página no existe. Esto resulta útil para archivos PDF cuyo número total de páginas no puede determinarse.Este parámetro no puede usarse junto con
pagey no es compatible con el formato GIF. Cuando se establecepage_range, el Robot no necesita conocer de antemano el número total de páginas, lo que lo hace robusto para archivos PDF en los que falla la detección del número de páginas.formatgif | jpeg | jpg | png(valor predeterminado:"png")El formato de las imágenes extraídas.
Si especificas el valor
"gif", se crea un GIF animado que recorre todas las páginas. Consulta esta demo (English) para obtener más información.delaystring | numberSi el formato de salida es
"gif", este parámetro establece el número de centésimas de segundo que deben transcurrir antes de mostrar el siguiente fotograma de la animación. Por ejemplo, establece este parámetro en100para dejar que transcurra 1 segundo entre los fotogramas del GIF animado.Si el formato de salida no es
"gif", este parámetro no tiene ningún efecto.stackghostscript | vips | pdfiumSelecciona la pila de renderizado de PDF. El valor predeterminado es Ghostscript.
Usa
"pdfium"para rasterizar páginas específicas o archivos PDF de una sola página con alta densidad de puntos por pulgada cuando Ghostscript sea demasiado lento o agote el espacio temporal, por ejemplo, con archivos PDF de CAD o planos de alta resolución, o archivos PDF inmobiliarios con capas. Esta pila utiliza PDFium mediante los bindings de Pythonpypdfium2y Pillow para el encoding final de la imagen.Usa
"vips"únicamente cuando quieras explícitamente que los archivos PDF se carguen con libvips. Tiene una menor sobrecarga, pero PDFium fue más rápido en las pruebas de planos de planta con alta densidad de puntos por pulgada y produjo una calidad de salida comparable.Actualmente, la pila
"pdfium"admite salida JPG/PNG,resize_strategy: "fit", un valor específico depageo archivos PDF de una sola página, fondos hexadecimales opacos,antialiasingypdf_use_cropbox.Actualmente, la pila
"vips"admite salida JPG/PNG,resize_strategy: "fit", un valor específico depageo archivos PDF de una sola página, y fondos hexadecimales o transparentes.widthstring | numberAncho de la nueva imagen, en píxeles. Si no se especifica, se usará de forma predeterminada el ancho de la imagen de entrada
heightstring | numberAltura de la nueva imagen, en píxeles. Si no se especifica, se usará de forma predeterminada la altura de la imagen de entrada
resize_strategycrop | fillcrop | fit | min_fit | pad | stretch(valor predeterminado:"pad")Una de las estrategias de redimensionamiento disponibles.
backgroundstring(valor predeterminado:"#FFFFFF")El código hexadecimal o el nombre del color que se utiliza para rellenar el fondo (solo se usa con la estrategia de redimensionamiento pad).
De forma predeterminada, el fondo de las imágenes transparentes se cambia a blanco. Consulta esta demo (English) para obtener información detallada sobre cómo conservar la transparencia en todos los tipos de imagen.
alphaRemove | SetCambia el funcionamiento del canal alfa de la imagen resultante. Los valores válidos son
"Set"para habilitar la transparencia y"Remove"para eliminarla.Consulta aquí la documentación de ImageMagick para ver una lista de todos los valores válidos.
densitystringMientras que la calidad en memoria y la profundidad del formato de archivo especifican la resolución de color, la densidad de una imagen es su resolución espacial. Es decir, es la densidad de una imagen (en píxeles por pulgada) y define la separación entre los píxeles individuales (o su tamaño). Define el tamaño de la imagen en términos reales cuando se muestra en dispositivos o se imprime.
Puedes establecer este valor como
widtho con el formatowidthxheight.Si la imagen convertida tiene baja resolución, prueba a usar el parámetro de densidad para corregirla.
antialiasingboolean(valor predeterminado:false)Controla si se utiliza el suavizado para eliminar los bordes dentados del texto o las imágenes de un documento.
colorspaceCMY | CMYK | Gray | HCL | HCLp | HSB | HSI |Establece el espacio de color de la imagen. Consulta la documentación de ImageMagick para obtener información detallada sobre los valores disponibles.
Ten en cuenta que, si usabas
"RGB", recomendamos usar"sRGB". ImageMagick podría intentar encontrar el valor decolorspacemás eficiente según el color de una imagen y utilizar de forma predeterminada, por ejemplo,"Gray". En ese caso, quizá debas usar este parámetro para forzar los colores.trim_whitespaceboolean(valor predeterminado:true)Determina si el espacio en blanco adicional alrededor del PDF debe recortarse antes de convertirlo en una imagen. Si estableces este parámetro en
true, solo se mostrará en la imagen el contenido real de la página del PDF.Si necesitas reflejar las dimensiones del PDF en la imagen, por lo general conviene establecer este parámetro en
false.pdf_use_cropboxboolean(valor predeterminado:true)Algunos documentos PDF indican dimensiones incorrectas. Por ejemplo, pueden indicar que tienen orientación horizontal, aunque al abrirlos en lectores de escritorio adecuados en realidad tengan orientación vertical. Esto puede ocurrir si el documento tiene definido un cuadro de recorte. Cuando esta opción está habilitada (de forma predeterminada), el cuadro de recorte es el factor principal para determinar las dimensiones de las miniaturas resultantes.
turboboolean(valor predeterminado:true)Habilita el modo de alto rendimiento para procesar documentos más rápido.
Cuando está habilitado, Turbo Mode proporciona dos optimizaciones clave:
-
Extracción de páginas en paralelo: En documentos con más de 5 páginas, se ejecutan varios procesos en paralelo para extraer páginas simultáneamente. La cantidad de procesos paralelos se adapta al tamaño del documento (hasta 4 procesos para documentos con 13 páginas o más).
-
Redimensionamiento distribuido: Las páginas extraídas se redimensionan simultáneamente en varias máquinas, lo que permite procesar documentos grandes hasta 20 veces más rápido.
Los archivos se emiten a medida que están disponibles durante el procesamiento. Si estableces este parámetro en
false, las páginas se extraen secuencialmente mediante un único proceso y los archivos se emiten solo después de que finaliza todo el procesamiento.Turbo Mode aumenta el precio porque el tamaño de archivo del documento de entrada se suma por cada página extraída. En documentos de una sola página, no mejora el rendimiento ni aumenta los cargos.
-
Demos
- Service to convert documents into animated GIFs (English)
- Service to convert a document into separate images (English)
- Service to convert the first page of a doc into an image (English)
- Service to make a screenshot of site using an HTML file (English)
- Overlay videos with dynamic artwork generated with HTML & JS (English)
- Service to take screenshots of a website using a URL (English)
Publicaciones relacionadas del blog
- Introducing new document-to-image conversion Robot (English)
- Animated GIFs from PDFs with frame delays (English)
- Transloadit now offers SVG support for images (English)
- Adding density parameter to our /document/thumbs Robot (English)
- New pricing model for future Transloadit customers (English)
- Tutorial: using /video/merge to develop video slideshows (English)
- Convert Markdown files to HTML or PDF in seconds (English)
- Automatically correct page orientation in documents (English)
- Introducing Turbo Mode for /document/thumbs (English)