Transloadit
Precios
  • Subida de archivos
  • Importación de archivos
  • Encoding de video
  • Encoding de audio
  • Procesamiento de imágenes
  • Procesamiento de documentos
  • Inteligencia artificial
  • Filtrado y seguridad de archivos
  • Catalogación de medios
  • Compresión de archivos
  • Evaluación de código
  • Exportación de archivos
  • Smart CDN
  • Ver todos los servicios
  • Explora integraciones (English)
  • Explora demos en vivo (English)
  • Uppy
  • TransloaditKit
  • Android SDK
  • Node SDK
  • Python SDK
  • Ruby SDK
  • Go SDK
  • Java SDK
  • PHP SDK
  • Zapier
  • MCP Server
  • Terraform
  • Conceptos esenciales
  • Prácticas recomendadas
  • FAQ
  • Robots
  • Endpoints de la API
  • Formatos
  • Crea tu primera app
  • Acerca de Transloadit
  • Comparaciones
  • Código abierto
  • Testimonios
  • Empleos (English)
  • Seguridad
  • Entradas
  • Actualidad para desarrolladores (English)
  • Consejos para desarrolladores (English)
  • Prensa (English)
  • Investigación (English)
  • Casos de éxito
  • Soluciones
  • Guías
  • Glosario (English)
  • Legal (English)
  • Herramientas
  • Cómo ayudamos a Coursera a llevar educación a millones de personas en todo el mundo
  • Soporte de Transloadit
  • Soporte para código abierto
  • Acuerdo de nivel de servicio (English)
Conceptos esencialesRobotsFAQEndpoints de la APIFormatosPrácticas recomendadas
Subida de archivos
  • /upload/handle
    Gestionar subidas
Importación de archivos
  • /azure/importEN (English)
    Importar archivos desde Azure
  • /backblaze/importEN (English)
    Importar archivos desde Backblaze
  • /box/importEN (English)
    Importar archivos desde Box
  • /mega/importEN (English)
    Importar archivos desde el almacenamiento de objetos MEGA S4
  • /cloudfiles/importEN (English)
    Importar archivos desde Rackspace Cloud Files
  • /cloudflare/importEN (English)
    Importar archivos desde Cloudflare R2
  • /digitalocean/importEN (English)
    Importar archivos desde DigitalOcean Spaces
  • /dropbox/importEN (English)
    Importar archivos desde Dropbox
  • /ftp/importEN (English)
    Importar archivos desde servidores FTP
  • /google/importEN (English)
    Importar archivos desde Google Cloud Storage
  • /http/import
    Importar archivos desde servidores web
  • /minio/importEN (English)
    Importar archivos desde MinIO
  • /s3/import
    Importar archivos desde Amazon S3
  • /sftp/importEN (English)
    Importar archivos desde servidores SFTP
  • /supabase/importEN (English)
    Importar archivos desde Supabase Storage
  • /swift/importEN (English)
    Importar archivos desde OpenStack Swift
  • /tigris/importEN (English)
    Importar archivos desde Tigris
  • /vimeo/importEN (English)
    Importar videos desde Vimeo
  • /wasabi/importEN (English)
    Importar archivos desde Wasabi
Encoding de video
  • /video/adaptive
    Convertir videos a HLS, MPEG-Dash y CMAF
  • /video/artworkEN (English)
    Extraer o insertar carátulas de video
  • /video/concat
    Concatenar videos
  • /video/encode
    Transcodificar, redimensionar o añadir marcas de agua a videos
  • /video/merge
    Combinar video, audio e imágenes en un solo video
  • /video/ondemand
    Transmitir videos con encoding bajo demanda
  • /video/splitEN (English)
    Dividir video
  • /video/subtitle
    Añadir subtítulos a videos
  • /video/thumbs
    Extraer miniaturas de videos
  • Ajustes preestablecidos de encoding de video
Encoding de audio
  • /audio/artworkEN (English)
    Extraer o insertar carátulas de audio
  • /audio/concatEN (English)
    Concatenar audio
  • /audio/splitEN (English)
    Dividir audio
  • /audio/encode
    Codificar audio
  • /audio/loopEN (English)
    Reproducir audio en bucle
  • /audio/mergeEN (English)
    Combinar archivos de audio en uno solo
  • /audio/waveformEN (English)
    Generar imágenes de forma de onda a partir de audio
  • Ajustes preestablecidos de encoding de audio
Procesamiento de imágenes
  • /image/bgremove
    Eliminar el fondo de imágenes
  • /image/enhanceEN (English)
    Mejorar imágenes
  • /image/merge
    Combinar varias imágenes en una sola imagen
  • /image/optimize
    Optimizar imágenes sin pérdida de calidad
  • /image/resize
    Convertir, redimensionar o añadir marcas de agua a imágenes
Procesamiento de documentos
  • /document/autorotateEN (English)
    Girar documentos automáticamente
  • /document/convert
    Convertir documentos a distintos formatos
  • /document/extractEN (English)
    Extraer texto e imágenes de documentos
  • /document/merge
    Combinar documentos en uno
  • /document/optimizeEN (English)
    Optimizar el tamaño de archivos PDF
  • /file/readEN (English)
    Leer el contenido de archivos
  • /document/splitEN (English)
    Extraer páginas
  • /document/thumbs
    Extraer imágenes en miniatura de documentos
  • /html/convert
    Tomar capturas de pantalla de páginas web o archivos HTML
Inteligencia artificial
  • /document/ocr
    Reconocer texto en documentos (OCR)
  • /image/describe
    Reconocer objetos en imágenes
  • /image/facedetect
    Detectar rostros en imágenes
  • /image/generate
    Generar imágenes a partir de prompts de texto
  • /image/upscaleEN (English)
    Aumentar la resolución de imágenes
  • /image/ocr
    Reconocer texto en imágenes (OCR)
  • /speech/transcribe
    Transcribir voz en archivos de audio o video
  • /text/speak
    Sintetizar voz a partir de documentos
  • /text/translateEN (English)
    Traducir texto en documentos
  • /ai/chatEN (English)
    Generar respuestas de chat con IA
  • /video/generateEN (English)
    Generar videos a partir de prompts de texto
Filtrado y seguridad de archivos
  • /file/filter
    Filtrar archivos
  • /file/verifyEN (English)
    Verificar el tipo de archivo
  • /file/virusscan
    Escanear archivos en busca de virus
Catalogación de medios
  • /file/hashEN (English)
    Calcular el hash de archivos
  • /file/previewEN (English)
    Generar una miniatura de vista previa
  • /meta/writeEN (English)
    Escribir metadatos en archivos multimedia
Compresión de archivos
  • /file/compress
    Comprimir archivos
  • /file/decompress
    Descomprimir archivos comprimidos
Evaluación de código
  • /http/requestEN (English)
    Llamar a endpoints HTTP
  • /script/run
    Ejecutar scripts en Assemblies
Exportación de archivos
  • Descarga
  • /azure/storeEN (English)
    Exportar archivos a Microsoft Azure
  • /backblaze/storeEN (English)
    Exportar archivos a Backblaze
  • /box/storeEN (English)
    Exportar archivos a Box
  • /mega/storeEN (English)
    Exportar archivos al almacenamiento de objetos de MEGA S4
  • /cloudfiles/storeEN (English)
    Exportar archivos a Rackspace Cloud Files
  • /cloudflare/storeEN (English)
    Exportar archivos a Cloudflare R2
  • /digitalocean/storeEN (English)
    Exportar archivos a DigitalOcean Spaces
  • /dropbox/storeEN (English)
    Exportar archivos a Dropbox
  • /ftp/storeEN (English)
    Exportar archivos a servidores FTP
  • /google/storeEN (English)
    Exportar archivos a Google Cloud Storage
  • /minio/storeEN (English)
    Exportar archivos a MinIO
  • /s3/store
    Exportar archivos a Amazon S3
  • /sftp/storeEN (English)
    Exportar archivos a servidores SFTP
  • /supabase/storeEN (English)
    Exportar archivos a Supabase Storage
  • /swift/storeEN (English)
    Exportar archivos a OpenStack Swift
  • /tigris/storeEN (English)
    Exportar archivos a Tigris
  • /tus/storeEN (English)
    Exportar archivos a servidores compatibles con el protocolo tus
  • /vimeo/storeEN (English)
    Exportar archivos a Vimeo
  • /wasabi/storeEN (English)
    Exportar archivos a Wasabi
  • /youtube/storeEN (English)
    Exportar archivos a YouTube
Smart CDN
  • /file/serve
    Servir archivos a navegadores web
  • /tlcdn/deliver
    Almacenar en caché y entregar archivos globalmente
  • Precios

Transcribir voz en archivos de audio o video

🤖/speech/transcribe transcribe voz en archivos de audio o video.

Robot /speech/transcribe

Puedes usar en tu aplicación el texto que devolvemos o pasarlo a otros Robots para filtrar archivos de audio o video que contengan (o no contengan) determinado contenido o, por ejemplo, incrustar el texto en imágenes o videos.

Otro caso de uso habitual es agregar subtítulos automáticamente a los videos o permitir búsquedas en el contenido de audio.

Establece speaker_labels en true cuando quieras que la salida de transcripción JSON o de metadatos distinga a los hablantes recurrentes:

{
  "steps": {
    "transcribed": {
      "use": ":original",
      "robot": "/speech/transcribe",
      "provider": "aws",
      "format": "json",
      "speaker_labels": true,
      "max_speakers": 3
    }
  }
}

Actualmente, los proveedores aws y gcp admiten etiquetas de hablantes. Si habilitas speaker_labels sin establecer provider, Transloadit usa aws para ese Step. Las etiquetas se normalizan como speaker_1, speaker_2 y así sucesivamente:

{
  "text": "Hello there. Hi!",
  "words": [
    { "text": "Hello", "startTime": 0, "endTime": 0.5, "speaker": "speaker_1" },
    { "text": "there", "startTime": 0.6, "endTime": 1, "speaker": "speaker_1" },
    { "text": "Hi!", "startTime": 1.2, "endTime": 1.8, "speaker": "speaker_2" }
  ],
  "segments": [
    { "text": "Hello there", "startTime": 0, "endTime": 1, "speaker": "speaker_1" },
    { "text": "Hi!", "startTime": 1.2, "endTime": 1.8, "speaker": "speaker_2" }
  ]
}

Ejemplo de uso

Transcribe el habla en francés del audio o video subido y guarda la transcripción en un archivo de texto:

{
  "steps": {
    "transcribed": {
      "robot": "/speech/transcribe",
      "use": ":original",
      "provider": "replicate",
      "target_language": "french",
      "format": "text"
    }
  }
}

Parámetros

  • interpolate

    boolean | Record<string, boolean>

    Controla si las Assembly Variables se interpolan en campos de instrucciones individuales.

    De forma predeterminada, la mayoría de los campos de instrucciones de los Robots interpolan Assembly Variables. Establece esta opción en false para tratar todos los campos de instrucciones como texto literal, o establece la ruta de un campo individual en false para tratar únicamente ese campo como texto literal. En el caso de los campos específicos de un Robot que son literales de forma predeterminada, establece esta opción en true o la ruta de ese campo en true para volver a habilitar la interpolación.

    Usa nombres de campos como path o rutas con puntos como ffmpeg.vf para los objetos anidados.

  • output_meta

    Record<string, boolean> | boolean | Array<string>

    Te permite especificar un conjunto de metadatos cuyo cálculo requiere más recursos de CPU y que, por lo tanto, está desactivado de forma predeterminada para que tus Assemblies se procesen rápidamente.

    Para imágenes, puedes añadir "has_transparency": true a este objeto para determinar si la imagen contiene partes transparentes y "dominant_colors": true para extraer un array de códigos de color hexadecimales de la imagen.

    Para imágenes, también puedes añadir "blurhash": true para extraer una cadena BlurHash⁠, una representación compacta de un marcador de posición para la imagen que resulta útil para mostrar una vista previa desenfocada mientras se carga la imagen completa.

    Para videos, puedes añadir el parámetro "colorspace": true para extraer el espacio de color del video de salida.

    Para videos, también puedes añadir "interlaced": true para detectar si el video está entrelazado. Esto combina el indicador field_order de ffprobe, cuyo costo en recursos de procesamiento es bajo, con una pasada de muestreo limitada mediante idet sobre los primeros fotogramas de la fuente, y expone interlaced, field_order y un objeto de diagnóstico interlace_detection en file.meta. Esto requiere muchos recursos computacionales y se factura en consecuencia.

    Para audio, puedes añadir "mean_volume": true para obtener un único valor que represente el volumen promedio del archivo de audio.

    También puedes establecerlo en false para omitir la extracción de metadatos y acelerar la transcodificación.

  • user_meta

    Record<string, any>(valor predeterminado: {})

    Añade metadatos personalizados a cada archivo emitido por este Robot sin modificar el contenido del archivo.

    Los valores se combinan con los user_meta existentes en el archivo de entrada. Si ambos objetos contienen la misma clave, el valor de este Robot tiene prioridad. Se admiten Assembly Variables, por ejemplo { "internal_file_id": "${file.id}" }.

  • result

    boolean(valor predeterminado: false)

    Indica si los resultados de este Step deben aparecer en el Assembly Status JSON

  • queue

    batch

    Establecer la cola en «batch» reduce manualmente la prioridad de los Jobs de este Step para evitar consumir cupos prioritarios con Jobs que no necesitan un tiempo de espera cero en la cola

  • force_accept

    boolean(valor predeterminado: false)

    Forzar a un Robot a aceptar un tipo de archivo que habría ignorado.

    De forma predeterminada, los Robots ignoran los archivos que no reconocen. 🤖/video/encode, por ejemplo, ignorará sin problemas las imágenes de entrada.

    Si configuras el parámetro force_accept como true, puedes forzar a los Robots a aceptar todos los archivos que reciban. Esto normalmente provocará errores y solo debe usarse para depuración o para abordar casos extremos.

  • ignore_errors

    boolean | Array<meta | execute>(valor predeterminado: [])

    Ignorar errores durante fases específicas del procesamiento.

    Establecer este parámetro en ["meta"] hará que el Robot ignore los errores durante la extracción de metadatos.

    Establecer este parámetro en ["execute"] hará que el Robot ignore los errores durante la fase principal de ejecución.

    Configurar este parámetro como true equivale a ["meta", "execute"] y hará que se ignoren los errores en ambas fases.

  • use

    string | Array<string> | Array<object> | object

    Especifica qué Step o Steps se usarán como entrada.

    • Puedes elegir cualquier nombre para los Steps, excepto ":original" (reservado para las subidas de usuarios gestionadas por Transloadit)
    • Puedes proporcionar varios Steps como entrada mediante arrays:
      {
        "use": [
          ":original",
          "encoded",
          "resized"
        ]
      }
      
    • También puedes etiquetar los Steps de entrada con as para comunicar la intención semántica a los Robots:
      {
        "use": [
          {
            "name": ":original",
            "as": "image"
          },
          {
            "name": ":original",
            "as": "mask"
          }
        ]
      }
      
    Consejo

    Probablemente eso sea todo lo que necesitas saber sobre use, pero puedes consultar los casos de uso avanzados.

  • provider

    auto | aws | gcp | replicate(valor predeterminado: "auto")

    Se selecciona automáticamente el mejor proveedor según tu solicitud.

    Configura este parámetro con "aws", "gcp" o "replicate" para forzar un proveedor específico. Cuando se establece en "auto", Transloadit usa "replicate" de forma predeterminada y usa "aws" cuando speaker_labels está habilitado.

  • granularity

    full | list(valor predeterminado: "full")

    Actualmente, tanto "full" como "list" devuelven la misma respuesta de transcripción completa. "list" sigue aceptándose por compatibilidad con versiones anteriores.

  • format

    json | meta | srt | text | webvtt(valor predeterminado: "json")

    Formato de salida de la transcripción.

    • "text" genera un archivo de texto sin formato que puedes almacenar y procesar.
    • "json" genera un archivo JSON que contiene palabras con marcas de tiempo. Cuando speaker_labels está habilitado, las palabras pueden incluir etiquetas speaker y el JSON también puede incluir segments agrupados por hablante.
    • "srt" y "webvtt" generan archivos de subtítulos de sus respectivos tipos, que pueden almacenarse por separado o utilizarse en otros Steps de encoding.
    • "meta" no devuelve un archivo, sino que almacena los datos dentro del objeto de archivo de Transloadit (en ${file.meta.transcription.text}, ${file.meta.transcription.words} y, cuando hay etiquetas de hablantes disponibles, ${file.meta.transcription.segments}) que se transfiere entre Steps de encoding, para que puedas usar los valores a fin de incrustar los datos en videos, filtrarlos, etc.
  • speaker_labels

    boolean(valor predeterminado: false)

    Cuando está habilitado, Transloadit solicita al proveedor de transcripción que distinga a los diferentes hablantes. Las salidas JSON y de metadatos pueden incluir etiquetas speaker, como "speaker_1", en palabras individuales, además de segments agrupados por hablante. El comportamiento de las salidas de texto, SRT y WebVTT no cambia.

    Las etiquetas de hablantes identifican voces recurrentes, no nombres de personas reales. La precisión depende de la calidad del audio, el ruido de fondo, el habla superpuesta y la cantidad de hablantes.

  • max_speakers

    string | number(valor predeterminado: 10)

    La cantidad máxima de hablantes que se detectarán cuando speaker_labels esté habilitado.

  • source_language

    string(valor predeterminado: "en-US")

    Establece el idioma hablado para los proveedores "aws" y "gcp". La transcripción permanece en el idioma hablado; este parámetro no traduce el habla.

    El idioma debe especificarse en el formato BCP-47⁠, como "en-GB", "de-DE" o "fr-FR". Consulta también la lista de idiomas compatibles con el proveedor gcp⁠ y el proveedor aws⁠.

  • target_language

    string

    Establece una indicación del idioma hablado para el proveedor "replicate". Omite este parámetro para detectar automáticamente el idioma hablado. Cuando conozcas el idioma, configúralo con su nombre completo en inglés y en minúsculas, como "french". A pesar de su nombre, este parámetro no traduce el habla.

    Para los proveedores "aws" y "gcp", usa source_language en su lugar.

Demos

  • Produce a SRT file from audio or video files EN (English)
  • Automatic speech transcription service EN (English)

Publicaciones relacionadas del blog

  • Tech preview: new AI Robots for enhanced media processing EN (English) 17 de febrero de 2020
  • New feature: auto-transcribe videos with subtitles EN (English) 8 de marzo de 2021
  • Building a screen reader plugin with /text/speak Robot EN (English) 3 de junio de 2021
  • Building an AI-powered video dubber with Transloadit EN (English) 9 de julio de 2021
  • Celebrating transloadit’s 2021 milestones and progress EN (English) 31 de enero de 2022
  • Build a Reddit video subtitling bot with Transloadit EN (English) 10 de febrero de 2022
  • Creating engaging audio visualizations with Transloadit EN (English) 2 de abril de 2023
Página anterior ← /image/ocrPágina siguiente /text/speak →
TransloaditVerificando el estado…

Producto

  • Servicios
  • Precios
  • Demos EN (English)
  • Herramientas
  • Seguridad
  • Soporte

Empresa

  • Acerca de Transloadit/Prensa EN (English)
  • Blog/Empleos EN (English)
  • Comparaciones/Matriz de cumplimiento EN (English)
  • Investigación EN (English)
  • Código abierto
  • Soluciones

Documentación

  • Primeros pasos
  • Transcodificación
  • FAQ
  • Endpoints de la API
  • Guías/Consejos para desarrolladores EN (English)
  • Formatos compatibles

Más

  • Estado de la plataforma⁠
  • Foro de la comunidad⁠
  • StackOverflow⁠
  • Uppy EN (English)
  • tus⁠

© 2009–2026 Transloadit-II GmbH

Privacidad EN (English)Términos EN (English)Aviso legal EN (English)
EnglishDeutschEspañol