---
title: "Como traduzir legendas do YouTube para vários idiomas"
description: "O YouTube exige um arquivo de legenda por idioma. Veja como transformar um SRT em oito, seja pelo navegador ou deixando seu agente de IA processar todo o conjunto."
date: 2026-09-07
language: pt
canonical: https://ai-glot.com/pt/blog/translate-youtube-subtitles-multiple-languages
source: AI Glot blog
---
**O YouTube exige um arquivo de legenda por idioma, então um vídeo em oito idiomas significa oito arquivos.** A tradução é a parte fácil. O trabalho repetido oito vezes é o que faz as pessoas desistirem por volta do terceiro idioma.

Este guia cobre as duas formas de fazer isso: clicando manualmente, o que funciona para um ou dois idiomas, e entregando todo o conjunto a um agente de IA que executa nossa ferramenta de linha de comando para você. A segunda opção exige o mesmo esforço para oito idiomas ou para dois.

## O que o YouTube fornece e o que ele espera de volta

Abra o YouTube Studio, acesse as legendas do vídeo e você poderá **baixar a faixa que já possui**. Você terá a escolha de formatos: escolha `.srt`, pois esse é o formato de legenda que o AI Glot lê.

O que o YouTube espera de volta é a mesma coisa, uma vez por idioma: um arquivo `.srt` enviado para um idioma que você adicionou ao vídeo. Não existe nenhum campo que aceite oito idiomas de uma só vez.

**Se a sua única faixa for a legenda automática do YouTube, corrija-a antes de traduzir.** A transcrição automática costuma errar nomes de produtos, nomes de pessoas e qualquer fala rápida. Traduzir isso transforma uma palavra errada em inglês na mesma palavra errada em oito idiomas, e você terá que corrigi-la oito vezes em vez de uma.

## O detalhe do arquivo de legenda que define todo o trabalho

Um SRT é uma lista numerada de marcações. Cada marcação possui um número, um código de tempo de início e fim e o texto que aparece na tela.

*Illustration: Uma deixa antes e depois da tradução. Apenas a linha de texto muda, então o arquivo volta para o mesmo vídeo em sincronia.*

O número e o código de tempo são a estrutura. Eles são copiados intactos: uma marcação de entrada gera uma marcação de saída, sem fusões ou divisões. Assim, o arquivo traduzido se encaixa perfeitamente no mesmo vídeo e permanece sincronizado.

**E aqui está a restrição que molda todo o resto: o arquivo contém exatamente uma faixa de texto.** Não há uma segunda coluna para espanhol nem lugar para adicionar uma. Traduzir um SRT substitui o texto de cada marcação no próprio local, e é precisamente por isso que os players e o YouTube usam um arquivo por idioma.

Portanto, oito idiomas não são um único trabalho com oito saídas. São oito trabalhos.

*Illustration: Um arquivo de legenda contém um idioma, portanto, oito idiomas significam oito traduções separadas das mesmas deixas.*

## Dois eixos, e os idiomas são apenas um deles

A maioria das pessoas lida com ambos simultaneamente: vários vídeos e vários idiomas. Eles se comportam de forma diferente, e saber a distinção economiza muitos cliques.

| O que você tem | A estrutura do trabalho | Como executar |
| --- | --- | --- |
| Um vídeo, oito idiomas | Oito arquivos, oito trabalhos | Um trabalho por idioma, em loop |
| Doze episódios, um idioma | Doze arquivos, um trabalho | Coloque tudo em um ZIP |
| Doze episódios, oito idiomas | Oito ZIPs, oito trabalhos | Um ZIP por idioma, em loop |

**O ZIP é a parte que as pessoas esquecem.** Uma série inteira em um único idioma pode ser enviada como um único arquivo compactado: até 200 arquivos, 20 MB para o arquivo ZIP e 4 MB por arquivo, traduzidos em uma única etapa com uma instrução e um glossário aplicados a cada episódio. Arquivos de legenda não possuem um esquema compartilhado para ser violado, então episódios de durações diferentes convivem tranquilamente no mesmo arquivo.

Os idiomas nunca se consolidam assim. Independentemente da rota escolhida, o número de trabalhos é igual ao número de idiomas.

## A rota via navegador e quando ela é a ideal

Faça o upload do arquivo na [página do tradutor de SRT](/pt/file-formats/srt-translation) ou no app, escreva uma frase sobre o que deseja, leia o plano, aprove-o e baixe o resultado. Depois, repita o processo para o próximo idioma.

Para um ou dois idiomas, esta é genuinamente a opção mais rápida disponível, e não há razão para abrir um terminal para isso. Com oito, tornam-se oito uploads, oito instruções, oito planos, oito aprovações e oito downloads, e os erros passam a ser burocráticos: o arquivo em alemão salvo por cima do francês, um idioma que desaparece silenciosamente.

## A rota do agente: um prompt, o conjunto completo

Se você já trabalha com Claude, ChatGPT, Cursor ou qualquer outro agente de IA que possa executar comandos na sua máquina, você não precisa sequer tocar no navegador. Nossa ferramenta de linha de comando faz login uma única vez e recebe um arquivo diretamente, permitindo que um agente execute todo o conjunto e deixe para você uma pasta com um arquivo de legenda por idioma.

*Illustration: Os mesmos oito idiomas, processados um a um ou enviados a um agente em um único prompt.*

Instale-o e faça login uma vez:

```bash
npm install --global @ai-glot/cli
aiglot auth login
```

Isso abre um navegador para autorizar a máquina. Em um servidor sem navegador, `aiglot auth login --device` fornece o fluxo de código de dispositivo, e `aiglot auth login --key <key>` funciona em CI.

### O prompt para entregar ao seu agente

Cole isto, alterando o caminho e a lista de idiomas. Foi escrito para ser entregue a um agente, não para ser executado por você.

```
My English subtitles are at ~/Videos/episode-04.srt, exported from YouTube.

Translate them into Spanish, Portuguese, French, German, Italian, Japanese,
Hindi and Indonesian using the aiglot CLI. Read `aiglot batches create --help`
and `aiglot batches approve --help` first so you use the real flags, and run
`aiglot languages` to confirm each language tag before you start.

An SRT holds one language, so create ONE batch per target language, eight in
total. The source language is English: say so explicitly in every instruction
rather than letting it be inferred.

Use the lite quality tier. Add "keep every subtitle line under 42 characters
and never merge or split cues" as the string-level instruction at approval.

Show me all eight plans and the total word count and cost BEFORE you approve
anything. Then wait for me to confirm.

After I confirm, approve them, poll until each one reaches a terminal status,
and download the results into ~/Videos/subtitles/ as episode-04.<lang>.srt
using the two-letter code for each language. Tell me if any batch failed.
```

Quatro coisas nesse prompt realizam o trabalho real, e são as partes que valem a pena copiar para o seu próprio.

**Ele instrui o agente a ler a ajuda primeiro.** Um agente que tenta adivinhar nomes de flags falha na primeira chamada e depois inventa um motivo plausível para isso. Ler a ajuda real, ou `aiglot help --json` para toda a árvore de comandos de uma vez, elimina isso completamente.

**Ele especifica um lote por idioma, explicitamente.** Um agente que assume um único trabalho com oito destinos escreverá uma instrução que o formato não pode honrar, e um arquivo de legenda que deveria ser em japonês retorna como outra coisa.

**Ele nomeia o idioma de origem.** Sem isso, o motor infere a origem a partir do conteúdo, e essa inferência é menos confiável justamente onde mais custa caro: linhas curtas, arquivos que já contêm uma frase traduzida perdida e textos cheios de nomes.

**Ele coloca uma trava antes do gasto.** `aiglot batches approve` é o único comando que consome créditos. Tudo antes disso é gratuito e repetível, portanto, pedir para ver oito planos primeiro não custa nada e evita o tipo mais caro de mal-entendido.

### O que o agente realmente executa, por idioma

*Illustration: As quatro etapas, repetidas para cada idioma. Apenas a aprovação consome créditos, então qualquer plano pode ser lido gratuitamente.*

Quatro comandos, repetidos por idioma. Como um loop de shell, fica assim, que é basicamente o que seu agente acabará fazendo:

```bash
# "code:Language" pairs, so the filename gets the code and the instruction
# gets the language name.
for pair in es:Spanish pt:Portuguese fr:French de:German \
            it:Italian ja:Japanese hi:Hindi id:Indonesian; do
  code=${pair%%:*}
  lang=${pair#*:}

  id=$(aiglot batches create ~/Videos/episode-04.srt \
        --instruction "The source language is English. Translate the text of every cue into ${lang}. Leave cue numbers and timecodes exactly as they are." \
        --json | jq -r '.data.id')

  # Read the plan for free, and only then commit.
  aiglot batches get "$id" --json | jq '.data.plan'

  aiglot batches approve "$id" --quality lite \
    --instructions "Keep every subtitle line under 42 characters. Never merge or split cues."

  # Wait for a TERMINAL status, not for a specific one.
  until status=$(aiglot batches get "$id" --json | jq -r '.data.status'); \
    [ "$status" = "completed" ] || [ "$status" = "failed" ] || [ "$status" = "cancelled" ]; do
    sleep 5
  done

  [ "$status" = "completed" ] && \
    aiglot batches download "$id" --output ~/Videos/subtitles/episode-04.${code}.srt
done
```

Um detalhe ali vale a pena ser roubado mesmo que você nunca traduza uma legenda. **O loop aguarda qualquer status do terminal em vez de monitorar apenas o `completed`.** Um script que espera apenas pelo status que deseja esperará para sempre em caso de falha, porque uma comparação contra um valor que nunca chega não é um erro. É apenas sempre falso.

Também existe um servidor MCP, `aiglot mcp`, se o seu agente preferir ferramentas a um shell. A CLI é o melhor ponto de partida: funciona em um script, funciona em CI e você pode ler exatamente o que foi executado.

## As duas instruções que as pessoas confundem

Esta distinção é a única coisa em todo este fluxo de trabalho que falha silenciosamente, então vale a pena dedicar trinta segundos a ela.

**A instrução do plano decide o que será traduzido.** Ela é lida uma vez, com base na estrutura do arquivo, e é onde o idioma de destino deve ser colocado. "Traduza o texto de cada legenda para o alemão."

**As instruções ao nível de string são aplicadas enquanto cada linha é escrita.** O motor vê uma linha de legenda por vez, portanto, estas só podem descrever algo visível dentro de uma linha. Comprimento da linha, tom, um nome que não deve ser alterado.

Uma regra de comprimento de linha colocada no plano não serve para nada, e uma frase como "traduza apenas a segunda metade do arquivo" colocada nas instruções ao nível da string não tem efeito algum, porque não há arquivo visível naquele momento. Nenhum erro ocorre. Você apenas recebe um resultado que ignorou suas instruções.

## Mantendo nomes idênticos em toda uma série

Oito idiomas multiplicados por doze episódios resultam em noventa e seis arquivos, e o problema não é a gramática. É que seu produto é chamado de uma coisa no episódio dois e de outra no episódio nove.

*Illustration: Um glossário define os termos que não podem variar e aplica a mesma decisão a todos os arquivos.*

Coloque os termos que não podem variar em um workspace [glossary](/pt/blog/build-translation-glossary-brand) apenas uma vez: nomes de produtos, nomes de personagens, a tradução padrão de uma frase que você repete em todas as intros. Isso será aplicado a cada arquivo em cada idioma, incluindo o episódio que você publicar no mês que vem.

É aqui que um tradutor automático geral falha, e o motivo é mecânico. O glossário dele substitui um termo sempre que encontra uma correspondência, então a frase ao redor da substituição não é reconsiderada. Aqui, o glossário é incorporado como significado enquanto a linha é escrita, portanto, o termo se ajusta gramaticalmente à frase em vez de ser apenas jogado no meio dela.

## Fazendo o upload do conjunto de volta para o YouTube

No Studio, adicione um idioma ao vídeo e, em seguida, faça o upload do arquivo correspondente. Faça isso com o primeiro, assista a trinta segundos do vídeo com essa faixa ativada e verifique duas coisas: se uma linha longa não se tornou um bloco de texto e se o tempo ainda parece correto mesmo com o texto mais longo. O texto traduzido geralmente é de 15% a 30% mais longo que o inglês, que é exatamente aquilo de que a instrução de comprimento de linha está protegendo você.

Depois, faça o upload do restante.

## O que isso realmente traz para você

Duas coisas distintas, e vale a pena mantê-las separadas, pois as evidências para cada uma são diferentes.

### Descoberta, que é o motivo para traduzir

Esta informação vem diretamente do YouTube. **"Em média, mais de dois terços do tempo de exibição da audiência de um criador vêm de fora de sua região local."** Esse é o dado do próprio YouTube, em sua própria [página de ferramentas de tradução](https://support.google.com/youtube/answer/4792576), e é o número mais útil deste artigo: a maior parte da sua audiência já está em outro lugar.

O mecanismo é detalhado na mesma página. Títulos e descrições traduzidos **podem aparecer nos resultados de pesquisa do YouTube para espectadores que falam esses idiomas**, e um espectador que pesquisa em sua própria língua pode encontrar e assistir a qualquer vídeo que possua legendas que ele consiga ler. Um vídeo com apenas uma faixa em inglês é descoberto em um idioma. Um vídeo com nove faixas é descoberto em nove.

Portanto, traduza também o título e a descrição, não apenas as legendas. Eles são a base do resultado da pesquisa, e são apenas três linhas de texto comparadas a uma hora de fala.

### Acessibilidade, que é o motivo para legendar

Legendas não são um "luxo" para um grande grupo de pessoas. A Organização Mundial da Saúde relata que **mais de 1,5 bilhão de pessoas vivem com algum grau de perda auditiva**, das quais 430 milhões têm perda auditiva significativa o suficiente para precisar de reabilitação, e projeta [2,5 bilhões até 2050](https://www.who.int/news/item/02-03-2021-who-1-in-4-people-projected-to-have-hearing-problems-by-2050), ou seja, uma em cada quatro pessoas.

Além disso, há todos aqueles que ouvem perfeitamente bem, mas ainda assim preferem ler. Em uma [pesquisa YouGov](https://yougov.com/en-us/articles/45987-american-adults-under-30-watching-tv-subtitles) com 1.000 adultos nos EUA em julho de 2023, **63% dos menores de 30 anos disseram preferir legendas ativadas** ao assistir em um idioma que já conhecem. A preferência aumentava conforme a idade diminuía, sendo o grupo mais jovem o que mais as desejava.

E as pessoas assistem no mudo. Em um estudo realizado pela Verizon Media e Publicis Media em abril de 2019 com 5.616 adultos nos EUA, **80% disseram ter mais probabilidade de assistir a um vídeo inteiro quando as legendas estão disponíveis**, e metade afirmou que as legendas são importantes porque costumam assistir com o som desligado.

**Seja preciso sobre o que esses dois últimos números provam**, pois é fácil distorcê-los. Eles medem legendas em um idioma que o espectador já fala, portanto, são o argumento para ter uma faixa de legendas, e não a prova de que uma faixa em japonês atrai espectadores japoneses. O dado do YouTube acima é o que se refere à tradução. Juntos, o argumento é simples: uma faixa de texto atrai atenção, e uma faixa de texto no idioma nativo de alguém atrai atenção em um mercado onde você atualmente não aparece.

Mais dois números que valem a pena ter em mente, de pesquisas sobre compra em vez de visualização: a [CSA Research](https://csa-research.com/Blogs-Events/CSA-in-the-Media/Press-Releases/Consumers-Prefer-their-Own-Language) descobriu que 76% dos compradores online preferem comprar produtos com informações em seu próprio idioma, e 40% não compram de sites em outros idiomas. Se seus vídeos vendem algo, esse é o mesmo argumento aplicado ao checkout.

## E quanto à tradução automática do próprio YouTube

O YouTube pode traduzir automaticamente uma faixa de legendas para o espectador, diretamente no player. Não custa nada e é uma alternativa razoável para a longa cauda de idiomas que você nunca publicará adequadamente.

Mas essa tradução não pertence a você. Você não escolhe as palavras, não pode corrigir um termo que ficou errado, a experiência não é a mesma para todos os espectadores e o arquivo não existe em lugar nenhum para que você possa reutilizá-lo. Já uma faixa enviada por upload funciona de forma oposta: ela aparece no menu de legendas do seu próprio vídeo, diz exatamente o que você decidiu e o mesmo arquivo funciona em qualquer outra plataforma onde você publicar esse vídeo.

Use a tradução automática para os idiomas nos quais você não está investindo. Faça o upload de faixas reais para aqueles em que você investe.

## A real abrangência disso

Para um único vídeo curto em um idioma, alguém que o fale fará um trabalho melhor do que qualquer uma dessas opções, e é isso que você deve solicitar.

Para oito idiomas em todo um catálogo antigo, a gestão de arquivos é o maior custo, e isso não é trabalho linguístico. Processe o volume bruto via AI Glot e, então, aplique a revisão onde ela realmente agrega valor: nos idiomas mais importantes para o seu público e nos vídeos que realmente vendem algo. Muitas equipes a utilizam para a primeira versão e depois pedem para um falante nativo ler o resultado, o que é um ótimo uso de um especialista e evita que uma tarde inteira seja desperdiçada renomeando arquivos.

Se quiser testar em um episódio antes de se comprometer com uma série, o [tradutor de legendas](/pt/file-formats/srt-translation) aceita um arquivo sem a necessidade de conta. Depois, [crie uma conta gratuita](https://app.ai-glot.com/signup) quando estiver pronto para processar todo o conjunto.

---

*Os limites citados aqui são os vigentes no momento da redação: 4 MB por arquivo SRT e, para um arquivo de legendas, 200 arquivos e 20 MB. Contagens de palavras, contagens de marcações e custos sempre derivam do plano para o seu próprio arquivo, que é gratuito para produzir e gratuito para corrigir.*