Cómo traducir subtítulos de YouTube a varios idiomas

Cómo traducir subtítulos de YouTube a varios idiomas

7 de septiembre de 2026

YouTube requiere un archivo de subtítulos por idioma, por lo que un vídeo en ocho idiomas significa ocho archivos. La traducción es la parte fácil. Repetir el proceso ocho veces es lo que hace que la gente se rinda llegando al tercer idioma.

Esta guía cubre ambas formas de hacerlo: haciendo clic manualmente, que está bien para uno o dos idiomas, y entregando todo el conjunto a un agente de IA que ejecute nuestra herramienta de línea de comandos por ti. Esta segunda opción requiere el mismo trabajo para ocho idiomas que para dos.

Lo que YouTube te da y lo que espera recibir

Abre YouTube Studio, ve a los subtítulos del vídeo y podrás descargar la pista que ya tienes. Tendrás varios formatos a elegir: el indicado es .srt, ya que es el formato de subtítulos que lee AI Glot.

Lo que YouTube espera recibir es lo mismo, una vez por idioma: un archivo .srt subido y asignado a un idioma que hayas añadido al vídeo. No existe ningún campo que permita subir ocho idiomas a la vez.

Si tu única pista son los subtítulos automáticos de YouTube, corrígelos antes de traducir. La transcripción automática suele fallar en nombres de productos, nombres de personas y cualquier frase dicha rápidamente. Traducir eso convierte una palabra incorrecta en inglés en la misma palabra incorrecta en ocho idiomas, y tendrás que corregirla ocho veces en lugar de una.

El detalle del archivo de subtítulos que define todo el trabajo

Un SRT es una lista numerada de entradas. Cada entrada tiene un número, un código de tiempo de inicio y fin, y el texto que aparece en pantalla.

Una marca de tiempo antes y después de la traducción. Solo cambia la línea de texto, por lo que el archivo vuelve a encajar en el video en sincronía.

El número y el código de tiempo son la estructura. Se copian intactos: una entrada de entrada genera una entrada de salida, sin fusionar ni dividir nada, para que el archivo traducido encaje en el mismo vídeo y se mantenga sincronizado.

Y aquí está la limitación que condiciona todo lo demás: el archivo contiene exactamente una pista de texto. No hay una segunda columna para el español ni un lugar donde añadirla. Traducir un SRT sustituye el texto de cada entrada en su lugar, que es precisamente la razón por la que los reproductores y YouTube usan un archivo por idioma.

Por lo tanto, ocho idiomas no son un trabajo con ocho resultados. Son ocho trabajos.

Cada archivo de subtítulos contiene un idioma, por lo que ocho idiomas suponen ocho traducciones independientes de las mismas marcas.

Dos ejes, y los idiomas son solo uno de ellos

La mayoría de las personas se enfrentan a ambas cosas a la vez: varios vídeos y varios idiomas. Se comportan de forma distinta, y saber diferenciarlos ahorra muchos clics.

Lo que tienes La estructura del trabajo Cómo ejecutarlo
Un vídeo, ocho idiomas Ocho archivos, ocho trabajos Un trabajo por idioma, en bucle
Doce episodios, un idioma Doce archivos, un trabajo Ponlos todos en un ZIP
Doce episodios, ocho idiomas Ocho ZIPs, ocho trabajos Un ZIP por idioma, en bucle

El ZIP es la parte que la gente suele olvidar. Una serie completa en un solo idioma se sube como un único archivo: hasta 200 archivos, 20 MB para el archivo comprimido y 4 MB por archivo, traducidos en una sola pasada con una instrucción y un glosario aplicados a cada episodio. Los archivos de subtítulos no tienen un esquema compartido que pueda romperse, así que episodios de diferentes duraciones conviven felizmente en el mismo archivo.

Los idiomas nunca se agrupan así. Independientemente de la ruta que elijas, el número de trabajos es igual al número de idiomas.

La ruta del navegador y cuándo es la adecuada

Sube el archivo en la página del traductor de SRT o en la aplicación, escribe una frase sobre lo que necesitas, lee el plan, apruébalo y descarga el resultado. Después, repite el proceso para el siguiente idioma.

Para uno o dos idiomas, esta es genuinamente la opción más rápida disponible, y no hay razón para abrir una terminal. Con ocho, se convierte en ocho subidas, ocho instrucciones, ocho planes, ocho aprobaciones y ocho descargas, y los errores empiezan a ser administrativos: el archivo en alemán se guarda sobre el francés, o falta un idioma sin que te des cuenta.

La ruta del agente: un prompt, el conjunto completo

Si ya trabajas con Claude, ChatGPT, Cursor o cualquier otro agente de IA que pueda ejecutar comandos en tu máquina, no tienes que tocar el navegador para nada. Nuestra herramienta de línea de comandos inicia sesión una vez y procesa un archivo directamente, por lo que un agente puede ejecutar todo el conjunto y dejarte una carpeta con un archivo de subtítulos por idioma.

Los mismos ocho idiomas, procesados uno a uno o enviados a un agente en un único prompt.

Instálalo e inicia sesión una vez:

npm install --global @ai-glot/cli
aiglot auth login

Eso abrirá un navegador para autorizar la máquina. En un servidor sin navegador, aiglot auth login --device te ofrece el flujo de código de dispositivo, y aiglot auth login --key <key> funciona en CI.

El prompt para entregar a tu agente

Pega esto, cambiando la ruta y la lista de idiomas. Está escrito para ser entregado a un agente, no para que lo ejecutes tú mismo.

My English subtitles are at ~/Videos/episode-04.srt, exported from YouTube.

Translate them into Spanish, Portuguese, French, German, Italian, Japanese,
Hindi and Indonesian using the aiglot CLI. Read `aiglot batches create --help`
and `aiglot batches approve --help` first so you use the real flags, and run
`aiglot languages` to confirm each language tag before you start.

An SRT holds one language, so create ONE batch per target language, eight in
total. The source language is English: say so explicitly in every instruction
rather than letting it be inferred.

Use the lite quality tier. Add "keep every subtitle line under 42 characters
and never merge or split cues" as the string-level instruction at approval.

Show me all eight plans and the total word count and cost BEFORE you approve
anything. Then wait for me to confirm.

After I confirm, approve them, poll until each one reaches a terminal status,
and download the results into ~/Videos/subtitles/ as episode-04.<lang>.srt
using the two-letter code for each language. Tell me if any batch failed.

Cuatro elementos de ese prompt realizan el trabajo real, y son las partes que merece la pena copiar en los tuyos.

Le indica al agente que lea la ayuda primero. Un agente que adivina los nombres de los flags falla en la primera llamada y luego inventa una razón plausible de por qué ha ocurrido. Leer la ayuda real, o aiglot help --json para obtener todo el árbol de comandos a la vez, elimina esto por completo.

Dice explícitamente que es un lote por idioma. Un agente que asuma un único trabajo con ocho objetivos escribirá una instrucción que el formato no puede respetar, y un archivo de subtítulos que debía ser en japonés volverá siendo otra cosa.

Nombra el idioma de origen. Sin ello, el motor infiere el origen a partir del contenido, y esa inferencia es menos fiable precisamente donde más importa: líneas cortas, archivos que ya contienen alguna frase traducida perdida y textos llenos de nombres.

Pone un freno antes del gasto. aiglot batches approve es el único comando que consume créditos. Todo lo anterior es gratuito y repetible, por lo que pedir ver ocho planes primero no cuesta nada y evita el tipo de malentendido que resulta costoso.

Lo que el agente ejecuta realmente, por idioma

Los cuatro pasos se repiten por idioma. Solo la aprobación consume créditos, así que cualquier plan permite la lectura gratuita.

Cuatro comandos, repetidos por idioma. Como un bucle de shell se ve así, que es básicamente lo que acabará haciendo tu agente:

# "code:Language" pairs, so the filename gets the code and the instruction
# gets the language name.
for pair in es:Spanish pt:Portuguese fr:French de:German \
            it:Italian ja:Japanese hi:Hindi id:Indonesian; do
  code=${pair%%:*}
  lang=${pair#*:}

  id=$(aiglot batches create ~/Videos/episode-04.srt \
        --instruction "The source language is English. Translate the text of every cue into ${lang}. Leave cue numbers and timecodes exactly as they are." \
        --json | jq -r '.data.id')

  # Read the plan for free, and only then commit.
  aiglot batches get "$id" --json | jq '.data.plan'

  aiglot batches approve "$id" --quality lite \
    --instructions "Keep every subtitle line under 42 characters. Never merge or split cues."

  # Wait for a TERMINAL status, not for a specific one.
  until status=$(aiglot batches get "$id" --json | jq -r '.data.status'); \
    [ "$status" = "completed" ] || [ "$status" = "failed" ] || [ "$status" = "cancelled" ]; do
    sleep 5
  done

  [ "$status" = "completed" ] && \
    aiglot batches download "$id" --output ~/Videos/subtitles/episode-04.${code}.srt
done

Hay un detalle ahí que merece la pena copiar aunque nunca traduzcas un subtítulo. El bucle espera cualquier estado de la terminal en lugar de buscar solo completed. Un script que solo espera el estado que desea esperará eternamente ante un fallo, porque una comparación con un valor que nunca llega no es un error. Simplemente es siempre falso.

También existe un servidor MCP, aiglot mcp, si tu agente prefiere herramientas a una shell. La CLI es el mejor punto de partida: funciona en un script, funciona en CI y puedes leer exactamente qué se ejecutó.

Las dos instrucciones que la gente confunde

Esta distinción es lo único en todo este flujo de trabajo que falla silenciosamente, así que merece treinta segundos de atención.

La instrucción del plan decide qué se traduce. Se lee una vez, basándose en la estructura del archivo, y es donde debe ir el idioma de destino. “Traduce el texto de cada entrada al alemán”.

Las instrucciones a nivel de cadena se aplican mientras se escribe cada línea. El motor ve una línea de subtítulos a la vez, por lo que estas solo pueden describir algo visible dentro de una línea. Longitud de línea, tono, un nombre que no debe tocarse.

Una regla de longitud de línea incluida en el plan no sirve de nada, y una instrucción como “traduce solo la segunda mitad del archivo” puesta a nivel de cadena tampoco hace nada, porque en ese punto no hay ningún archivo a la vista. No hay errores. Simplemente obtienes un resultado que ignora tus indicaciones.

Cómo mantener los nombres idénticos en toda una serie

Ocho idiomas por doce episodios son noventa y seis archivos, y el problema no es la gramática. Es que tu producto se llame de una forma en el episodio dos y de otra en el episodio nueve.

Un glosario define los términos que no deben variar y aplica la misma decisión a cada archivo.

Introduce una sola vez en un espacio de trabajo los términos que no deben variar glosario: nombres de productos, nombres de personajes o la traducción oficial de una frase que repitas en cada introducción. Así se aplicará a cada archivo en cada idioma, incluido el episodio que publiques el mes que viene.

Aquí es donde un traductor automático general tiene dificultades, y la razón es mecánica. Su glosario sustituye un término siempre que coincide, por lo que no se reconsidera la frase que rodea la sustitución. Aquí, el glosario se integra como significado mientras se escribe la línea, de modo que el término se conjuga e integra en la frase en lugar de soltarse simplemente en medio de ella.

Subir el conjunto de nuevo a YouTube

En Studio, añade un idioma al vídeo y luego sube el archivo correspondiente. Hazlo con el primero, mira treinta segundos del vídeo con esa pista activada y comprueba dos cosas: que una línea larga no se haya convertido en un muro de texto y que la sincronización siga siendo correcta aunque el texto sea más largo. El texto traducido suele ser entre un 15% y un 30% más largo que el inglés, que es precisamente de lo que te protege la instrucción de longitud de línea.

Después, sube el resto.

Qué consigues realmente con esto

Dos cosas distintas, y conviene mantenerlas separadas porque las pruebas de cada una son diferentes.

Visibilidad, que es la razón para traducir

Este dato viene directamente de YouTube. “De media, más de dos tercios del tiempo de visualización de la audiencia de un creador procede de fuera de su zona de residencia”. Es la cifra de YouTube, en su propia página de herramientas de traducción, y es el dato más útil de este artículo: la mayor parte de tu audiencia ya está en otro lugar.

El mecanismo se explica en la misma página. Los títulos y descripciones traducidos pueden aparecer en los resultados de búsqueda de YouTube para los espectadores que hablen esos idiomas, y un espectador que busque en su propio idioma puede encontrar y ver cualquier vídeo que tenga subtítulos que pueda leer. Un vídeo con una sola pista en inglés es visible en un idioma. Un vídeo con nueve pistas es visible en nueve.

Así que traduce también el título y la descripción, no solo los subtítulos. Son los elementos que forman el resultado de búsqueda, y son solo tres líneas de texto frente a una hora de locución.

Accesibilidad, que es la razón para poner subtítulos

Los subtítulos no son un extra opcional para un grupo numeroso de personas. La Organización Mundial de la Salud informa que más de 1.500 millones de personas viven con algún grado de pérdida auditiva, de las cuales 430 millones tienen una pérdida lo suficientemente significativa como para necesitar rehabilitación, y prevé que serán 2.500 millones para 2050, es decir, una de cada cuatro personas.

Luego están todos aquellos que oyen perfectamente pero prefieren leer. En una encuesta de YouGov realizada a 1.000 adultos estadounidenses en julio de 2023, el 63% de los menores de 30 años afirmó preferir los subtítulos activados al ver contenido en un idioma que ya conocen. La preferencia aumentaba a medida que bajaba la edad, y el grupo más joven era el que más los quería.

Y hay gente que ve los vídeos en silencio. En un estudio realizado por Verizon Media y Publicis Media en abril de 2019 con 5.616 adultos estadounidenses, el 80% afirmó que es más probable que vean un vídeo completo cuando hay subtítulos disponibles, y la mitad dijo que los subtítulos son importantes porque suelen ver el contenido sin sonido.

Sé preciso sobre lo que demuestran estas dos últimas cifras, porque es fácil malinterpretarlas. Miden los subtítulos en un idioma que el espectador ya habla, por lo que son el argumento a favor de tener una pista de subtítulos en general, no la prueba de que una pista en japonés te consiga espectadores japoneses. La cifra de YouTube mencionada anteriormente es la que justifica la traducción. En conjunto, el argumento es sencillo: una pista de texto atrae la atención, y una pista de texto en el propio idioma de alguien atrae la atención en un mercado en el que actualmente no figuras.

Otras dos cifras que conviene tener en cuenta, basadas en investigaciones sobre compras en lugar de visualizaciones: CSA Research descubrió que el 76% de los compradores online prefieren comprar productos con información en su propio idioma, y el 40% no comprará en absoluto en sitios en otros idiomas. Si tus vídeos venden algo, es el mismo argumento aplicado al proceso de pago.

¿Y la traducción automática de YouTube?

YouTube puede traducir automáticamente una pista de subtítulos para el espectador, directamente en el reproductor. No tiene coste y es una alternativa aceptable para ese grupo reducido de idiomas en los que nunca publicarás contenido de forma profesional.

Tampoco es tuya. Tú no eliges las palabras, no puedes corregir un término que sea incorrecto, no es la misma traducción para todos los espectadores y el archivo no existe en ningún lugar donde puedas reutilizarlo. Una pista subida funciona al revés: aparece en el menú de subtítulos de tu vídeo, dice exactamente lo que tú decidiste y el mismo archivo funciona en cualquier otra plataforma donde publiques ese vídeo.

Usa la traducción automática para los idiomas en los que no estés invirtiendo. Sube pistas reales para aquellos en los que sí lo hagas.

El alcance real de esto

Para un único vídeo corto en un solo idioma, una persona que hable esa lengua hará un mejor trabajo que cualquier herramienta, y deberías recurrir a ella.

Para ocho idiomas en todo un catálogo antiguo, la gestión de archivos es el coste principal, y eso no es trabajo de traducción. Procesa el grueso con AI Glot y luego dedica la revisión a donde realmente aporta valor: los idiomas más importantes para tu audiencia y los vídeos que realmente venden algo. Muchos equipos lo utilizan como primer borrador y luego un hablante nativo revisa el resultado, lo cual es un buen uso de un experto y una forma de evitar pasar una tarde entera renombrando archivos.

Si quieres probarlo en un episodio antes de comprometerte con una serie, el traductor de subtítulos permite procesar un archivo sin necesidad de cuenta. Luego, crea una cuenta gratuita cuando estés listo para procesar todo el conjunto.


Los límites mencionados aquí son los vigentes en el momento de escribir esto: 4 MB por archivo SRT y, para un archivo de subtítulos, 200 archivos y 20 MB. El recuento de palabras, el recuento de entradas y los costes siempre dependen del plan de tu propio archivo, el cual es gratuito de generar y corregir.

10.000 palabras gratis al registrarte

¿Listo para traducir tus archivos grandes?