O YouTube exige um arquivo de legenda por idioma, então um vídeo em oito idiomas significa oito arquivos. A tradução é a parte fácil. O trabalho repetido oito vezes é o que faz as pessoas desistirem por volta do terceiro idioma.
Este guia cobre as duas formas de fazer isso: clicando manualmente, o que funciona para um ou dois idiomas, e entregando todo o conjunto a um agente de IA que executa nossa ferramenta de linha de comando para você. A segunda opção exige o mesmo esforço para oito idiomas ou para dois.
O que o YouTube fornece e o que ele espera de volta
Abra o YouTube Studio, acesse as legendas do vídeo e você poderá baixar a faixa que já possui. Você terá a escolha de formatos: escolha .srt, pois esse é o formato de legenda que o AI Glot lê.
O que o YouTube espera de volta é a mesma coisa, uma vez por idioma: um arquivo .srt enviado para um idioma que você adicionou ao vídeo. Não existe nenhum campo que aceite oito idiomas de uma só vez.
Se a sua única faixa for a legenda automática do YouTube, corrija-a antes de traduzir. A transcrição automática costuma errar nomes de produtos, nomes de pessoas e qualquer fala rápida. Traduzir isso transforma uma palavra errada em inglês na mesma palavra errada em oito idiomas, e você terá que corrigi-la oito vezes em vez de uma.
O detalhe do arquivo de legenda que define todo o trabalho
Um SRT é uma lista numerada de marcações. Cada marcação possui um número, um código de tempo de início e fim e o texto que aparece na tela.
1400:01:12,480 --> 00:01:15,920Upload the file you already haveImporta el archivo que ya tienes O número e o código de tempo são a estrutura. Eles são copiados intactos: uma marcação de entrada gera uma marcação de saída, sem fusões ou divisões. Assim, o arquivo traduzido se encaixa perfeitamente no mesmo vídeo e permanece sincronizado.
E aqui está a restrição que molda todo o resto: o arquivo contém exatamente uma faixa de texto. Não há uma segunda coluna para espanhol nem lugar para adicionar uma. Traduzir um SRT substitui o texto de cada marcação no próprio local, e é precisamente por isso que os players e o YouTube usam um arquivo por idioma.
Portanto, oito idiomas não são um único trabalho com oito saídas. São oito trabalhos.
Dois eixos, e os idiomas são apenas um deles
A maioria das pessoas lida com ambos simultaneamente: vários vídeos e vários idiomas. Eles se comportam de forma diferente, e saber a distinção economiza muitos cliques.
| O que você tem | A estrutura do trabalho | Como executar |
|---|---|---|
| Um vídeo, oito idiomas | Oito arquivos, oito trabalhos | Um trabalho por idioma, em loop |
| Doze episódios, um idioma | Doze arquivos, um trabalho | Coloque tudo em um ZIP |
| Doze episódios, oito idiomas | Oito ZIPs, oito trabalhos | Um ZIP por idioma, em loop |
O ZIP é a parte que as pessoas esquecem. Uma série inteira em um único idioma pode ser enviada como um único arquivo compactado: até 200 arquivos, 20 MB para o arquivo ZIP e 4 MB por arquivo, traduzidos em uma única etapa com uma instrução e um glossário aplicados a cada episódio. Arquivos de legenda não possuem um esquema compartilhado para ser violado, então episódios de durações diferentes convivem tranquilamente no mesmo arquivo.
Os idiomas nunca se consolidam assim. Independentemente da rota escolhida, o número de trabalhos é igual ao número de idiomas.
A rota via navegador e quando ela é a ideal
Faça o upload do arquivo na página do tradutor de SRT ou no app, escreva uma frase sobre o que deseja, leia o plano, aprove-o e baixe o resultado. Depois, repita o processo para o próximo idioma.
Para um ou dois idiomas, esta é genuinamente a opção mais rápida disponível, e não há razão para abrir um terminal para isso. Com oito, tornam-se oito uploads, oito instruções, oito planos, oito aprovações e oito downloads, e os erros passam a ser burocráticos: o arquivo em alemão salvo por cima do francês, um idioma que desaparece silenciosamente.
A rota do agente: um prompt, o conjunto completo
Se você já trabalha com Claude, ChatGPT, Cursor ou qualquer outro agente de IA que possa executar comandos na sua máquina, você não precisa sequer tocar no navegador. Nossa ferramenta de linha de comando faz login uma única vez e recebe um arquivo diretamente, permitindo que um agente execute todo o conjunto e deixe para você uma pasta com um arquivo de legenda por idioma.
- Upload the file
- Type the instruction
- Read the plan, approve
- Download, rename carefully
- Repeat seven more times
- Tell your agent where the file is
- It creates one batch per language
- It shows you every plan and the total
- You say go
- A folder appears with eight files
Instale-o e faça login uma vez:
npm install --global @ai-glot/cli
aiglot auth login
Isso abre um navegador para autorizar a máquina. Em um servidor sem navegador, aiglot auth login --device fornece o fluxo de código de dispositivo, e aiglot auth login --key <key> funciona em CI.
O prompt para entregar ao seu agente
Cole isto, alterando o caminho e a lista de idiomas. Foi escrito para ser entregue a um agente, não para ser executado por você.
My English subtitles are at ~/Videos/episode-04.srt, exported from YouTube.
Translate them into Spanish, Portuguese, French, German, Italian, Japanese,
Hindi and Indonesian using the aiglot CLI. Read `aiglot batches create --help`
and `aiglot batches approve --help` first so you use the real flags, and run
`aiglot languages` to confirm each language tag before you start.
An SRT holds one language, so create ONE batch per target language, eight in
total. The source language is English: say so explicitly in every instruction
rather than letting it be inferred.
Use the lite quality tier. Add "keep every subtitle line under 42 characters
and never merge or split cues" as the string-level instruction at approval.
Show me all eight plans and the total word count and cost BEFORE you approve
anything. Then wait for me to confirm.
After I confirm, approve them, poll until each one reaches a terminal status,
and download the results into ~/Videos/subtitles/ as episode-04.<lang>.srt
using the two-letter code for each language. Tell me if any batch failed.
Quatro coisas nesse prompt realizam o trabalho real, e são as partes que valem a pena copiar para o seu próprio.
Ele instrui o agente a ler a ajuda primeiro. Um agente que tenta adivinhar nomes de flags falha na primeira chamada e depois inventa um motivo plausível para isso. Ler a ajuda real, ou aiglot help --json para toda a árvore de comandos de uma vez, elimina isso completamente.
Ele especifica um lote por idioma, explicitamente. Um agente que assume um único trabalho com oito destinos escreverá uma instrução que o formato não pode honrar, e um arquivo de legenda que deveria ser em japonês retorna como outra coisa.
Ele nomeia o idioma de origem. Sem isso, o motor infere a origem a partir do conteúdo, e essa inferência é menos confiável justamente onde mais custa caro: linhas curtas, arquivos que já contêm uma frase traduzida perdida e textos cheios de nomes.
Ele coloca uma trava antes do gasto. aiglot batches approve é o único comando que consome créditos. Tudo antes disso é gratuito e repetível, portanto, pedir para ver oito planos primeiro não custa nada e evita o tipo mais caro de mal-entendido.
O que o agente realmente executa, por idioma
- 1CreateSend the file, name the languageFree
- 2Read the planCues, words, costFree
- 3ApproveThe only step that spendsSpends credits
- 4DownloadOne SRT, same timingsFree
Quatro comandos, repetidos por idioma. Como um loop de shell, fica assim, que é basicamente o que seu agente acabará fazendo:
# "code:Language" pairs, so the filename gets the code and the instruction
# gets the language name.
for pair in es:Spanish pt:Portuguese fr:French de:German \
it:Italian ja:Japanese hi:Hindi id:Indonesian; do
code=${pair%%:*}
lang=${pair#*:}
id=$(aiglot batches create ~/Videos/episode-04.srt \
--instruction "The source language is English. Translate the text of every cue into ${lang}. Leave cue numbers and timecodes exactly as they are." \
--json | jq -r '.data.id')
# Read the plan for free, and only then commit.
aiglot batches get "$id" --json | jq '.data.plan'
aiglot batches approve "$id" --quality lite \
--instructions "Keep every subtitle line under 42 characters. Never merge or split cues."
# Wait for a TERMINAL status, not for a specific one.
until status=$(aiglot batches get "$id" --json | jq -r '.data.status'); \
[ "$status" = "completed" ] || [ "$status" = "failed" ] || [ "$status" = "cancelled" ]; do
sleep 5
done
[ "$status" = "completed" ] && \
aiglot batches download "$id" --output ~/Videos/subtitles/episode-04.${code}.srt
done
Um detalhe ali vale a pena ser roubado mesmo que você nunca traduza uma legenda. O loop aguarda qualquer status do terminal em vez de monitorar apenas o completed. Um script que espera apenas pelo status que deseja esperará para sempre em caso de falha, porque uma comparação contra um valor que nunca chega não é um erro. É apenas sempre falso.
Também existe um servidor MCP, aiglot mcp, se o seu agente preferir ferramentas a um shell. A CLI é o melhor ponto de partida: funciona em um script, funciona em CI e você pode ler exatamente o que foi executado.
As duas instruções que as pessoas confundem
Esta distinção é a única coisa em todo este fluxo de trabalho que falha silenciosamente, então vale a pena dedicar trinta segundos a ela.
A instrução do plano decide o que será traduzido. Ela é lida uma vez, com base na estrutura do arquivo, e é onde o idioma de destino deve ser colocado. “Traduza o texto de cada legenda para o alemão.”
As instruções ao nível de string são aplicadas enquanto cada linha é escrita. O motor vê uma linha de legenda por vez, portanto, estas só podem descrever algo visível dentro de uma linha. Comprimento da linha, tom, um nome que não deve ser alterado.
Uma regra de comprimento de linha colocada no plano não serve para nada, e uma frase como “traduza apenas a segunda metade do arquivo” colocada nas instruções ao nível da string não tem efeito algum, porque não há arquivo visível naquele momento. Nenhum erro ocorre. Você apenas recebe um resultado que ignorou suas instruções.
Mantendo nomes idênticos em toda uma série
Oito idiomas multiplicados por doze episódios resultam em noventa e seis arquivos, e o problema não é a gramática. É que seu produto é chamado de uma coisa no episódio dois e de outra no episódio nove.
Coloque os termos que não podem variar em um workspace glossary apenas uma vez: nomes de produtos, nomes de personagens, a tradução padrão de uma frase que você repete em todas as intros. Isso será aplicado a cada arquivo em cada idioma, incluindo o episódio que você publicar no mês que vem.
É aqui que um tradutor automático geral falha, e o motivo é mecânico. O glossário dele substitui um termo sempre que encontra uma correspondência, então a frase ao redor da substituição não é reconsiderada. Aqui, o glossário é incorporado como significado enquanto a linha é escrita, portanto, o termo se ajusta gramaticalmente à frase em vez de ser apenas jogado no meio dela.
Fazendo o upload do conjunto de volta para o YouTube
No Studio, adicione um idioma ao vídeo e, em seguida, faça o upload do arquivo correspondente. Faça isso com o primeiro, assista a trinta segundos do vídeo com essa faixa ativada e verifique duas coisas: se uma linha longa não se tornou um bloco de texto e se o tempo ainda parece correto mesmo com o texto mais longo. O texto traduzido geralmente é de 15% a 30% mais longo que o inglês, que é exatamente aquilo de que a instrução de comprimento de linha está protegendo você.
Depois, faça o upload do restante.
O que isso realmente traz para você
Duas coisas distintas, e vale a pena mantê-las separadas, pois as evidências para cada uma são diferentes.
Descoberta, que é o motivo para traduzir
Esta informação vem diretamente do YouTube. “Em média, mais de dois terços do tempo de exibição da audiência de um criador vêm de fora de sua região local.” Esse é o dado do próprio YouTube, em sua própria página de ferramentas de tradução, e é o número mais útil deste artigo: a maior parte da sua audiência já está em outro lugar.
O mecanismo é detalhado na mesma página. Títulos e descrições traduzidos podem aparecer nos resultados de pesquisa do YouTube para espectadores que falam esses idiomas, e um espectador que pesquisa em sua própria língua pode encontrar e assistir a qualquer vídeo que possua legendas que ele consiga ler. Um vídeo com apenas uma faixa em inglês é descoberto em um idioma. Um vídeo com nove faixas é descoberto em nove.
Portanto, traduza também o título e a descrição, não apenas as legendas. Eles são a base do resultado da pesquisa, e são apenas três linhas de texto comparadas a uma hora de fala.
Acessibilidade, que é o motivo para legendar
Legendas não são um “luxo” para um grande grupo de pessoas. A Organização Mundial da Saúde relata que mais de 1,5 bilhão de pessoas vivem com algum grau de perda auditiva, das quais 430 milhões têm perda auditiva significativa o suficiente para precisar de reabilitação, e projeta 2,5 bilhões até 2050, ou seja, uma em cada quatro pessoas.
Além disso, há todos aqueles que ouvem perfeitamente bem, mas ainda assim preferem ler. Em uma pesquisa YouGov com 1.000 adultos nos EUA em julho de 2023, 63% dos menores de 30 anos disseram preferir legendas ativadas ao assistir em um idioma que já conhecem. A preferência aumentava conforme a idade diminuía, sendo o grupo mais jovem o que mais as desejava.
E as pessoas assistem no mudo. Em um estudo realizado pela Verizon Media e Publicis Media em abril de 2019 com 5.616 adultos nos EUA, 80% disseram ter mais probabilidade de assistir a um vídeo inteiro quando as legendas estão disponíveis, e metade afirmou que as legendas são importantes porque costumam assistir com o som desligado.
Seja preciso sobre o que esses dois últimos números provam, pois é fácil distorcê-los. Eles medem legendas em um idioma que o espectador já fala, portanto, são o argumento para ter uma faixa de legendas, e não a prova de que uma faixa em japonês atrai espectadores japoneses. O dado do YouTube acima é o que se refere à tradução. Juntos, o argumento é simples: uma faixa de texto atrai atenção, e uma faixa de texto no idioma nativo de alguém atrai atenção em um mercado onde você atualmente não aparece.
Mais dois números que valem a pena ter em mente, de pesquisas sobre compra em vez de visualização: a CSA Research descobriu que 76% dos compradores online preferem comprar produtos com informações em seu próprio idioma, e 40% não compram de sites em outros idiomas. Se seus vídeos vendem algo, esse é o mesmo argumento aplicado ao checkout.
E quanto à tradução automática do próprio YouTube
O YouTube pode traduzir automaticamente uma faixa de legendas para o espectador, diretamente no player. Não custa nada e é uma alternativa razoável para a longa cauda de idiomas que você nunca publicará adequadamente.
Mas essa tradução não pertence a você. Você não escolhe as palavras, não pode corrigir um termo que ficou errado, a experiência não é a mesma para todos os espectadores e o arquivo não existe em lugar nenhum para que você possa reutilizá-lo. Já uma faixa enviada por upload funciona de forma oposta: ela aparece no menu de legendas do seu próprio vídeo, diz exatamente o que você decidiu e o mesmo arquivo funciona em qualquer outra plataforma onde você publicar esse vídeo.
Use a tradução automática para os idiomas nos quais você não está investindo. Faça o upload de faixas reais para aqueles em que você investe.
A real abrangência disso
Para um único vídeo curto em um idioma, alguém que o fale fará um trabalho melhor do que qualquer uma dessas opções, e é isso que você deve solicitar.
Para oito idiomas em todo um catálogo antigo, a gestão de arquivos é o maior custo, e isso não é trabalho linguístico. Processe o volume bruto via AI Glot e, então, aplique a revisão onde ela realmente agrega valor: nos idiomas mais importantes para o seu público e nos vídeos que realmente vendem algo. Muitas equipes a utilizam para a primeira versão e depois pedem para um falante nativo ler o resultado, o que é um ótimo uso de um especialista e evita que uma tarde inteira seja desperdiçada renomeando arquivos.
Se quiser testar em um episódio antes de se comprometer com uma série, o tradutor de legendas aceita um arquivo sem a necessidade de conta. Depois, crie uma conta gratuita quando estiver pronto para processar todo o conjunto.
Os limites citados aqui são os vigentes no momento da redação: 4 MB por arquivo SRT e, para um arquivo de legendas, 200 arquivos e 20 MB. Contagens de palavras, contagens de marcações e custos sempre derivam do plano para o seu próprio arquivo, que é gratuito para produzir e gratuito para corrigir.