---
title: "YouTube-Untertitel in mehrere Sprachen übersetzen"
description: "YouTube benötigt pro Sprache eine eigene Untertiteldatei. So verwandeln Sie eine SRT-Datei in acht: entweder direkt im Browser oder indem Sie Ihren AI-Agent den gesamten Satz bearbeiten lassen."
date: 2026-09-07
language: de
canonical: https://ai-glot.com/de/blog/translate-youtube-subtitles-multiple-languages
source: AI Glot blog
---
**YouTube verlangt pro Sprache eine einzelne Untertiteldatei, was bedeutet: ein Video in acht Sprachen erfordert acht Dateien.** Die Übersetzung ist der einfache Teil. Die achtcomandigen Wiederholungen sind das, was viele bei der dritten Sprache aufgeben lässt.

Diese Anleitung beschreibt beide Wege: das manuelle Durchklicken, was für ein oder zwei Sprachen völlig ausreichend ist, und die Übergabe des gesamten Sets an einen AI-Agent, der unser Command-Line-Tool für Sie ausführt. Bei der zweiten Variante ist der Aufwand für acht Sprachen derselbe wie für zwei.

## Was YouTube Ihnen gibt und was es zurückerwartet

Öffnen Sie das YouTube Studio, gehen Sie zu den Untertiteln des Videos und **laden Sie die vorhandene Spur herunter**. Sie haben die Wahl zwischen verschiedenen Formaten. Wählen Sie `.srt`, da dies das Untertitelformat ist, das AI Glot liest.

Was YouTube zurückerwartet, ist genau dasselbe, jedoch einmal pro Sprache: eine `.srt`-Datei, die Sie für eine zum Video hinzugefügte Sprache hochladen. Es gibt kein Feld, in das man acht Sprachen gleichzeitig eingeben kann.

**Wenn Ihre einzige Spur die automatischen Untertitel von YouTube sind, korrigieren Sie diese, bevor Sie übersetzen.** Automatische Transkriptionen verstehen Produktnamen, Personennamen oder schnell gesprochene Wörter oft falsch. Wenn Sie dies übersetzen, wird ein falsches Wort im Englischen zu demselben falschen Wort in acht verschiedenen Sprachen, und Sie müssen es achtmal statt nur einmal korrigieren.

## Der entscheidende Punkt an einer Untertiteldatei

Eine SRT-Datei ist eine nummerierte Liste von Cues. Jeder Cue enthält eine Nummer, einen Start- und Endzeitcode sowie den auf dem Bildschirm angezeigten Text.

*Illustration: Ein Cue vor und nach der Übersetzung. Nur die Textzeile ändert sich, sodass die Datei synchron zum selben Video bleibt.*

Die Nummer und der Zeitcode bilden die Struktur. Diese werden unverändert übernommen: Ein Cue hinein bedeutet ein Cue heraus. Es wird nichts zusammengeführt oder getrennt, sodass die übersetzte Datei wieder exakt auf dasselbe Video passt und synchron bleibt.

**Und hier ist die Einschränkung, die alles andere bestimmt: Die Datei enthält genau eine Textspur.** Es gibt keine zweite Spalte für Spanisch und keine Möglichkeit, eine hinzuzufügen. Die Übersetzung einer SRT-Datei ersetzt den Text jedes Cues an Ort und Stelle. Genau deshalb verwenden Player und YouTube eine Datei pro Sprache.

Acht Sprachen bedeuten also nicht einen Job mit acht Ausgaben, sondern acht separate Jobs.

*Illustration: Eine Untertiteldatei enthält eine Sprache. Acht Sprachen bedeuten acht separate Übersetzungen derselben Cues.*

## Zwei Dimensionen, wobei die Sprache nur eine davon ist

Die meisten Nutzer haben beides gleichzeitig: mehrere Videos und mehrere Sprachen. Diese verhalten sich unterschiedlich. Wenn man weiß, was was ist, erspart man sich viel Klickarbeit.

| Vorhandenes Material | Art des Aufwands | Ausführung |
| --- | --- | --- |
| Ein Video, acht Sprachen | Acht Dateien, acht Jobs | Ein Job pro Sprache, in einer Schleife |
| Zwölf Episoden, eine Sprache | Zwölf Dateien, ein Job | In einer ZIP-Datei zusammenfassen |
| Zwölf Episoden, acht Sprachen | Acht ZIPs, acht Jobs | Eine ZIP-Datei pro Sprache, in einer Schleife |

**Die ZIP-Datei ist der Teil, den viele übersehen.** Eine ganze Serie in einer Sprache wird als ein einziges Archiv hochgeladen: bis zu 200 Dateien, 20 MB für das Archiv und 4 MB pro Datei. Alles wird in einem Durchgang mit einer einzigen Anweisung und einem Glossary übersetzt, das auf jede Episode angewendet wird. Untertiteldateien haben kein gemeinsames Schema, das verletzt werden könnte, sodass Episoden unterschiedlicher Länge problemlos im selben Archiv liegen können.

Bei den Sprachen funktioniert das nicht. Welchen Weg Sie auch wählen: Die Anzahl der Jobs entspricht der Anzahl der Sprachen.

## Der Weg über den Browser und wann er die richtige Wahl ist

Laden Sie die Datei auf der [SRT-Übersetzer-Seite](/de/file-formats/srt-translation) oder in der App hoch, geben Sie in einem Satz an, was Sie möchten, lesen Sie den Plan, genehmigen Sie ihn und laden Sie das Ergebnis herunter. Wiederholen Sie diesen Vorgang dann für die nächste Sprache.

Für ein oder zwei Sprachen ist dies wirklich der schnellste Weg, und es gibt keinen Grund, dafür ein Terminal zu öffnen. Bei acht Sprachen werden es jedoch acht Uploads, acht Anweisungen, acht Pläne, acht Genehmigungen und acht Downloads, und die Fehler werden rein administrativer Natur: die deutsche Datei überschreibt die französische, oder eine Sprache fehlt still und heimlich.

## Der Weg über den Agenten: ein Prompt, das gesamte Set

Wenn Sie bereits mit Claude, ChatGPT, Cursor oder einem anderen KI-Agenten arbeiten, der Befehle auf Ihrem Rechner ausführen kann, müssen Sie den Browser überhaupt nicht mehr öffnen. Unser Command-Line-Tool meldet sich einmal an und nimmt eine Datei direkt entgegen, sodass ein Agent den gesamten Prozess abwickeln und Ihnen einen Ordner mit einer Untertiteldatei pro Sprache hinterlassen kann.

*Illustration: Dieselben acht Sprachen, entweder einzeln durchgeklickt oder als ein einziger Prompt an einen Agenten übergeben.*

Installieren Sie es und melden Sie sich einmal an:

```bash
npm install --global @ai-glot/cli
aiglot auth login
```

Dadurch wird ein Browser geöffnet, um das Gerät zu autorisieren. Auf einem Server ohne Browser bietet `aiglot auth login --device` den Device-Code-Flow an, und `aiglot auth login --key <key>` funktioniert in der CI.

### Der Prompt für Ihren Agenten

Fügen Sie dies ein und passen Sie den Pfad sowie die Sprachenliste an. Der Text ist so geschrieben, dass er einem Agenten übergeben und nicht selbst ausgeführt wird.

```
My English subtitles are at ~/Videos/episode-04.srt, exported from YouTube.

Translate them into Spanish, Portuguese, French, German, Italian, Japanese,
Hindi and Indonesian using the aiglot CLI. Read `aiglot batches create --help`
and `aiglot batches approve --help` first so you use the real flags, and run
`aiglot languages` to confirm each language tag before you start.

An SRT holds one language, so create ONE batch per target language, eight in
total. The source language is English: say so explicitly in every instruction
rather than letting it be inferred.

Use the lite quality tier. Add "keep every subtitle line under 42 characters
and never merge or split cues" as the string-level instruction at approval.

Show me all eight plans and the total word count and cost BEFORE you approve
anything. Then wait for me to confirm.

After I confirm, approve them, poll until each one reaches a terminal status,
and download the results into ~/Videos/subtitles/ as episode-04.<lang>.srt
using the two-letter code for each language. Tell me if any batch failed.
```

Vier Aspekte in diesem Prompt leisten die eigentliche Arbeit, und genau diese Teile lohnt es sich, in Ihre eigenen Prompts zu übernehmen.

**Er weist den Agenten an, zuerst die Hilfe zu lesen.** Ein Agent, der Flag-Namen rät, scheitert beim ersten Aufruf und erfindet dann einen plausiblen Grund dafür. Das Lesen der echten Hilfe oder von `aiglot help --json` für den gesamten Befehlsbaum auf einmal eliminiert dieses Problem vollständig.

**Er legt explizit fest: ein Batch pro Sprache.** Ein Agent, der fälschlicherweise davon ausgeht, dass ein einziger Job acht Ziele abdeckt, wird eine Anweisung schreiben, die das Format nicht unterstützen kann, und eine Untertiteldatei, die eigentlich Japanisch sein sollte, kommt als etwas anderes zurück.

**Er benennt die Quellsprache.** Ohne diese Angabe leitet die Engine die Quelle aus dem Inhalt ab. Diese Ableitung ist genau dort am unzuverlässigsten, wo es am meisten kostet: bei kurzen Zeilen, Dateien, die bereits eine einzelne übersetzte Phrase enthalten, oder Texten voller Namen.

**Er setzt einen Stopp vor die Kosten.** `aiglot batches approve` ist der einzige Befehl, der Credits kostet. Alles davor ist kostenlos und wiederholbar. Die Aufforderung, zuerst acht Pläne zu sehen, kostet also nichts und verhindert teure Missverständnisse.

### Was der Agent tatsächlich pro Sprache ausführt

*Illustration: Die vier Schritte, einmal pro Sprache wiederholt. Nur die Genehmigung verbraucht Credits, daher ist die Ansicht in jedem Plan kostenlos.*

Vier Befehle, die pro Sprache wiederholt werden. Als Shell-Loop sieht das so aus, was in etwa das ist, was Ihr Agent letztendlich tun wird:

```bash
# "code:Language" pairs, so the filename gets the code and the instruction
# gets the language name.
for pair in es:Spanish pt:Portuguese fr:French de:German \
            it:Italian ja:Japanese hi:Hindi id:Indonesian; do
  code=${pair%%:*}
  lang=${pair#*:}

  id=$(aiglot batches create ~/Videos/episode-04.srt \
        --instruction "The source language is English. Translate the text of every cue into ${lang}. Leave cue numbers and timecodes exactly as they are." \
        --json | jq -r '.data.id')

  # Read the plan for free, and only then commit.
  aiglot batches get "$id" --json | jq '.data.plan'

  aiglot batches approve "$id" --quality lite \
    --instructions "Keep every subtitle line under 42 characters. Never merge or split cues."

  # Wait for a TERMINAL status, not for a specific one.
  until status=$(aiglot batches get "$id" --json | jq -r '.data.status'); \
    [ "$status" = "completed" ] || [ "$status" = "failed" ] || [ "$status" = "cancelled" ]; do
    sleep 5
  done

  [ "$status" = "completed" ] && \
    aiglot batches download "$id" --output ~/Videos/subtitles/episode-04.${code}.srt
done
```

Ein Detail darin lohnt sich zu übernehmen, selbst wenn Sie nie Untertitel übersetzen: **Der Loop wartet auf jeden Terminal-Status, anstatt nur auf `completed` zu achten.** Ein Skript, das nur auf den erhofften Status wartet, wird bei einem Fehler ewig warten, da ein Vergleich mit einem Wert, der nie eintrifft, kein Fehler ist. Er ist einfach immer falsch.

Es gibt auch einen MCP-Server, `aiglot mcp`, falls Ihr Agent Tools gegenüber einer Shell bevorzugt. Die CLI ist jedoch der bessere Startpunkt: Sie funktioniert in einem Skript, sie funktioniert in der CI, und Sie können genau nachvollziehen, was ausgeführt wurde.

## Die zwei Anweisungen, die oft verwechselt werden

Diese Unterscheidung ist der einzige Punkt im gesamten Workflow, der stillschweigend fehlschlagen kann, daher lohnt es sich, hier dreißig Sekunden zu verweilen.

**Die Plan-Anweisung entscheidet, was übersetzt wird.** Sie wird einmalig basierend auf der Struktur der Datei gelesen, und hier gehört die Zielsprache hin. „Übersetze den Text jedes Cues ins Deutsche.“

**Die Anweisungen auf String-Ebene werden angewendet, während jede Zeile geschrieben wird.** Die Engine sieht immer nur eine Untertitelzeile gleichzeitig, sodass diese Anweisungen nur Dinge beschreiben können, die innerhalb einer Zeile sichtbar sind: Zeilenlänge, Tonfall oder ein Name, der nicht verändert werden darf.

Eine Regel zur Zeilenlänge im Plan bewirkt nichts Nützliches, und eine Anweisung wie "übersetze nur die zweite Hälfte der Datei" in den String-Ebene-Anweisungen bewirkt gar nichts, da zu diesem Zeitpunkt keine Datei sichtbar ist. Es gibt keine Fehlermeldung. Sie erhalten einfach ein Ergebnis, das Ihre Anweisung ignoriert hat.

## Namen über eine ganze Serie hinweg konsistent halten

Acht Sprachen mal zwölf Episoden ergeben sechsundneunzig Dateien, und das Problem ist hier nicht die Grammatik. Es ist die Tatsache, dass Ihr Produkt in Episode zwei anders heißt als in Episode neun.

*Illustration: Ein Glossar legt feste Begriffe fest und wendet diese konsistent auf jede Datei an.*

Tragen Sie Begriffe, die konsistent bleiben müssen, einmal in einen Workspace [glossary](/de/blog/build-translation-glossary-brand) ein: Produktnamen, Charakternamen oder die Standardübersetzung einer Phrase, die Sie in jedem Intro wiederholen. Dies gilt dann für jede Datei in jeder Sprache, einschließlich der Episode, die Sie nächsten Monat veröffentlichen.

Hier stoßen allgemeine maschinelle Übersetzungsprogramme an ihre Grenzen, und der Grund ist mechanischer Natur. Ihr Glossar ersetzt einen Begriff einfach überall dort, wo er übereinstimmt, sodass der Satz um die Ersetzung herum nicht neu bewertet wird. Ein Glossar wird hier als Bedeutung einbezogen, während die Zeile geschrieben wird, sodass der Begriff grammatikalisch in den Satz eingefügt wird, anstatt einfach in die Mitte gesetzt zu werden.

## Den Satz zurück zu YouTube hochladen

Fügen Sie im Studio eine Sprache zum Video hinzu und laden Sie dann die entsprechende Datei hoch. Machen Sie dies zuerst für eine Sprache, schauen Sie sich dreißig Sekunden des Videos mit dieser Spur an und prüfen Sie zwei Dinge: dass eine lange Zeile nicht zu einer Textwand geworden ist und dass das Timing immer noch stimmt, auch wenn die Formulierung länger geworden ist. Übersetzter Text ist in der Regel 15 bis 30 % länger als Englisch, und genau davor schützt Sie die Anweisung zur Zeilenlänge.

Laden Sie dann den Rest hoch.

## Was Ihnen das tatsächlich bringt

Zwei separate Punkte, und es ist wichtig, diese getrennt zu betrachten, da die Belege für jeden unterschiedlich sind.

### Auffindbarkeit, also der Grund für die Übersetzung

Dieser Punkt kommt direkt von YouTube. **"Im Durchschnitt stammt mehr als zwei Drittel der Wiedergabezeit eines Creators aus dem Ausland."** Das ist die offizielle Zahl von YouTube auf der eigenen [Seite für Übersetzungstools](https://support.google.com/youtube/answer/4792576) und die nützlichste Zahl in diesem Artikel: Der Großteil Ihres Publikums befindet sich bereits an einem anderen Ort.

Der Mechanismus wird auf derselben Seite erläutert. Übersetzte Titel und Beschreibungen **können in den YouTube-Suchergebnissen für Zuschauer erscheinen, die diese Sprachen sprechen**, und ein Zuschauer, der in seiner eigenen Sprache sucht, kann jedes Video finden und ansehen, das Untertitel in seiner Sprache bietet. Ein Video mit einer englischen Spur ist in einer Sprache auffindbar. Ein Video mit neun Spuren ist in neun Sprachen auffindbar.

Übersetzen Sie also auch den Titel und die Beschreibung, nicht nur die Untertitel. Sie machen das Suchergebnis aus und bestehen aus nur drei Textzeilen gegenüber einer Stunde gesprochenem Wort.

### Barrierefreiheit, also der Grund für Untertitel an sich

Untertitel sind für eine große Gruppe von Menschen kein nettes Extra. Die Weltgesundheitsorganisation berichtet, dass **mehr als 1,5 Milliarden Menschen mit einem gewissen Grad an Hörverlust leben**, wovon 430 Millionen einen so starken Hörverlust haben, dass sie eine Rehabilitation benötigen. Bis [2050 werden 2,5 Milliarden](https://www.who.int/news/item/02-03-2021-who-1-in-4-people-projected-to-have-hearing-problems-by-2050) prognostiziert, also jeder vierte Mensch.

Dann gibt es all jene, die perfekt hören können und trotzdem lesen. In einer [YouGov-Umfrage](https://yougov.com/en-us/articles/45987-american-adults-under-30-watching-tv-subtitles) unter 1.000 US-Erwachsenen im Juli 2023 gaben **63 % der unter 30-Jährigen an, dass sie Untertitel bevorzugen**, selbst wenn sie in einer Sprache schauen, die sie bereits beherrschen. Diese Präferenz stieg, je jünger die Befragten waren: Die jüngste Gruppe wünschte sie sich am meisten.

Und viele Menschen schauen Videos ohne Ton. In einer Studie von Verizon Media und Publicis Media vom April 2019 unter 5.616 US-Erwachsenen gaben **80 % an, dass sie eher ein gesamtes Video ansehen, wenn Untertitel verfügbar sind**, und die Hälfte gab an, dass Untertitel wichtig für sie seien, da sie meist ohne Ton schauen.

**Seien Sie präzise bei dem, was die letzten beiden Zahlen belegen**, da man sie leicht überinterpretieren kann. Sie messen Untertitel in einer Sprache, die der Zuschauer bereits spricht. Sie sind also das Argument dafür, überhaupt eine Untertitelspur zu haben, aber kein Beweis dafür, dass eine japanische Spur Ihnen japanische Zuschauer bringt. Die oben genannte YouTube-Zahl ist diejenige, die für die Übersetzung spricht. Zusammengefasst ergibt sich: Eine Textspur erregt Aufmerksamkeit, und eine Textspur in der eigenen Sprache des Nutzers erregt Aufmerksamkeit in einem Markt, in dem Sie derzeit nicht präsent sind.

Zwei weitere Zahlen, die man im Hinterkopf behalten sollte, aus einer Studie zum Kaufverhalten statt zum Zuschauerverhalten: [CSA Research](https://csa-research.com/Blogs-Events/CSA-in-the-Media/Press-Releases/Consumers-Prefer-their-Own-Language) fand heraus, dass 76 % der Online-Shopper es bevorzugen, Produkte mit Informationen in ihrer eigenen Sprache zu kaufen, und 40 % kaufen überhaupt nicht auf Websites in anderen Sprachen. Wenn Ihre Videos etwas verkaufen, gilt dasselbe Argument auch für den Checkout.

## Und was ist mit der automatischen Übersetzung von YouTube?

YouTube kann eine Untertitelspur direkt im Player für den Zuschauer maschinell übersetzen. Das kostet nichts und ist eine akzeptable Notlösung für eine Vielzahl von Sprachen, die Sie niemals offiziell veröffentlichen werden.

Aber diese Übersetzung gehört nicht Ihnen. Sie bestimmen nicht die Wortwahl, Sie können keine falsch übersetzten Begriffe korrigieren, die Übersetzung ist für jeden Zuschauer nicht unbedingt identisch und die Datei existiert nirgendwo, sodass Sie sie wiederverwenden könnten. Eine hochgeladene Spur funktioniert genau andersherum: Sie erscheint im eigenen Untertitel-Menü Ihres Videos, sie enthält genau den Text, den Sie festgelegt haben, und dieselbe Datei funktioniert auf jeder anderen Plattform, auf der Sie das Video posten.

Nutzen Sie die automatische Übersetzung für die Sprachen, in die Sie nicht investieren. Laden Sie echte Dateien für die hoch, in die Sie investieren.

## Der realistische Anwendungsbereich

Für ein einzelnes kurzes Video in einer Sprache wird eine Person, die diese Sprache spricht, einen besseren Job machen als all das, und Sie sollten diese Person einfach fragen.

Bei acht Sprachen über einen gesamten Back-Katalog ist der Umgang mit den Dateien der eigentliche Aufwand, und das ist keine sprachliche Arbeit. Lassen Sie die Masse durch AI Glot laufen und setzen Sie die Prüfung dort an, wo sie wirklich sinnvoll ist: bei den Sprachen, die für Ihr Publikum am wichtigsten sind, und bei den Videos, die tatsächlich etwas verkaufen. Viele Teams nutzen das Tool für den ersten Entwurf und lassen das Ergebnis von einem Muttersprachler prüfen. Das ist eine effiziente Nutzung eines Experten und eine bessere Alternative dazu, einen ganzen Nachmittag mit dem Umbenennen von Dateien zu verschwenden.

Wenn Sie es an einer einzelnen Episode ausprobieren möchten, bevor Sie sich für eine ganze Serie entscheiden, können Sie den [Untertitel-Übersetzer](/de/file-formats/srt-translation) ohne Konto nutzen. [Erstellen Sie dann ein kostenloses Konto](https://app.ai-glot.com/signup), wenn Sie bereit sind, den gesamten Satz zu verarbeiten.

---

*Die hier genannten Limits gelten zum Zeitpunkt der Erstellung dieses Textes: 4 MB pro SRT-Datei und für ein Archiv von Untertiteldateien 200 Dateien sowie 20 MB. Wortzahlen, Cue-Zahlen und Kosten basieren immer auf dem Plan für Ihre eigene Datei, die kostenlos erstellt und korrigiert werden kann.*