Online-TTS im Vergleich: 5 kostenlose Text-to-Speech-Tools
Wir vergleichen TTSMaker, TTSFree, Luvvoice, TTS.ai und ElevenLabs nach Anmeldung, kostenlosem Kontingent, Zeichenlimit, Modellen, Speicherung und kommerzieller Nutzung – plus die lokale Browser-Alternative von DORODORA.
Momente, in denen du eine Stimme brauchst – Video-Vertonung, Vorlesen, Ansagen oder Spenden-Alerts im Stream – kommen häufiger vor als gedacht. Ohne Tonstudio oder Sprecher ist Online-Text-to-Speech (TTS) der schnellste Weg, Text in Audio zu verwandeln.
Doch jeder Dienst hat andere Regeln für Anmeldung, kostenloses Kontingent, verfügbare Modelle und kommerzielle Nutzung, sodass man allein am Namen schwer entscheiden kann. Dieser Artikel betrachtet fünf repräsentative Online-TTS-Dienste anhand der Faktoren, die in der Praxis wirklich zählen.
Vergleicht man sie, fällt auf, dass Cloud-Dienste ähnliche Einschränkungen teilen, wie Anmeldung oder Zeichenlimits. Deshalb stellen wir am Ende auch ein Tool vor, das aus diesem Muster ausbricht: das TTS von DORODORA. Es konvertiert nicht auf einem Cloud-Server. Stattdessen lädt es Modelldateien in deinen Browser und läuft direkt auf deinem Gerät – und löst damit einige typische TTS-Frustrationen ganz natürlich.
TTS Playground jetzt ausprobieren
Woran erkenne ich ein gutes TTS?
Worauf du achten solltest, ist überraschend einfach.
- Lässt es sich ohne Anmeldung nutzen?
- Wie viel ist kostenlos drin?
- Welche Modelle und Stimmen bietet es?
- Darf das erzeugte Audio kommerziell genutzt werden?
- Lässt sich das Ergebnis als Datei speichern?
- Wie viele Zeichen sind pro Anfrage maximal möglich?
Im Folgenden stellen wir jeden Dienst mit diesen sechs Checkpunkten vor.
TTSMaker
TTSMaker sticht durch ein großzügiges kostenloses Kontingent hervor.
- Anmeldung: Nicht erforderlich
- Kostenloses Kontingent: 20.000 Zeichen pro Woche (einige Stimmen unbegrenzt)
- Max. Zeichen: 1.000 pro Anfrage (20.000+ mit Pro)
- Modelle & Stimmen: Mehrere KI-Stimmen pro Sprache
- Speicherung: Download als MP3 · WAV · OGG · AAC · OPUS
- Kommerzielle Nutzung: Erlaubt (keine Attribution nötig)
Der größte Vorteil sind die kommerziellen Rechte. Du erhältst 100% kommerzielle Nutzungsrechte für das erzeugte Audio und musst keine Quelle nennen – ideal für YouTube, TikTok oder Podcasts. Auch Regler für Geschwindigkeit, Tonhöhe, Lautstärke, Pausen zwischen Sätzen und Hintergrundmusik (BGM) sind gut abgedeckt.
Hinweise
- Erzeugtes Audio wird nach 30 Minuten automatisch gelöscht, also direkt herunterladen.
- Einige erweiterte Einstellungen sind nur mit Pro verfügbar.
Eine solide erste Wahl für Creator, die regelmäßig lange Skripte vertonen.
TTSFree
TTSFree lässt dich ohne Login mit der Konvertierung starten.
- Anmeldung: Für kostenlose Konvertierung nicht erforderlich
- Kostenloses Kontingent: 50 Konvertierungen pro Tag als Gast (500.000 Zeichen pro Monat mit Anmeldung)
- Max. Zeichen: 500 pro Anfrage (2.000 mit Anmeldung)
- Modelle & Stimmen: Google/Microsoft-Neural-Stimmen, 700+ Stimmen in 140+ Sprachen
- Speicherung: Download als MP3
- Kommerzielle Nutzung: Erlaubt
Es nutzt die neuesten neuronalen Stimmen von Google und Microsoft, daher ist die Aussprache klar und stabil. Auch hochwertigere Stimmen wie Wavenet oder Neural2 sind teilweise kostenlos verfügbar. Geschwindigkeit, Tonhöhe, Lautstärke, SSML und Hintergrundmusik werden unterstützt.
Hinweise
- Premium-Stimmen erfordern einen kostenpflichtigen Plan.
- Erzeugte Dateien werden innerhalb von 24 Stunden gelöscht.
Eine leichte, schnelle Option, wenn du einen kurzen Satz ohne Anmeldung in Audio verwandeln willst.
Luvvoice
Luvvoice bietet die breiteste Stimm-Auswahl.
- Anmeldung: Kostenlose Nutzung möglich (mehr Funktionen mit Login)
- Kostenloses Kontingent: 20.000 Zeichen pro Monat
- Max. Zeichen: 3.000 pro Anfrage (20.000 für eingeloggte Premium-Nutzer)
- Modelle & Stimmen: 200+ Stimmen in 70+ Sprachen + Custom Voices
- Speicherung: Download als MP3
- Kommerzielle Nutzung: In Premium-Plänen enthalten
Ein Highlight ist die Datei-Konvertierung. Du kannst PDF- und TXT-Dokumente hochladen und am Stück in Sprache umwandeln – praktisch für lange Artikel oder Manuskripte. Geschwindigkeits- und Tonhöhen-Regler sind Standard, eingeloggte Nutzer können zusätzlich Pausen zwischen Sätzen einfügen. Außerdem gibt es einen Marktplatz für markante Custom Voices.
Hinweise
- Kommerzielle Rechte sind an Premium-Pläne gebunden – je nach Einsatzzweck Plan prüfen.
- Erzeugtes Audio wird nur 72 Stunden aufbewahrt.
Besonders gut für umfangreiche Aufgaben wie das Vorlesen von Dokumenten.
TTS.ai
TTS.ai ist etwas anders. Statt ein einzelnes Modell zu verkaufen, bündelt es Open-Source-Modelle an einem Ort.
- Anmeldung: Für kostenlose Modelle nicht erforderlich
- Kostenloses Kontingent: 5.000 Zeichen pro Tag (10.000 pro Monat + 15.000 Bonus mit Anmeldung)
- Max. Zeichen: 500 pro Anfrage (5.000 mit Anmeldung)
- Modelle & Stimmen: 36+ Open-Source-Modelle, 314+ Stimmen, 55+ Sprachen
- Speicherung: Download als WAV (mit integriertem Konverter zu MP3 etc.)
- Kommerzielle Nutzung: Erlaubt
Von leichten Modellen wie Kokoro, Piper und MeloTTS bis zu Voice-Cloning-Modellen wie Chatterbox und GPT-SoVITS kannst du denselben Satz mit mehreren Modellen rendern und vergleichen. Auch eine OpenAI-kompatible API ist ab dem kostenlosen Plan verfügbar – praktisch für Entwickler.
Hinweise
- Unterstützte Sprachen und Zeichenverbrauch variieren je nach Modell.
- Für ernsthaften Einsatz ist ab $9/Monat ein Bezahlplan realistisch.
Ideal, wenn du viele TTS-Modelle direkt nebeneinander vergleichen willst.
ElevenLabs
ElevenLabs ist in puncto Stimmqualität überragend.
- Anmeldung: Erforderlich (kostenloser Plan verfügbar)
- Kostenloses Kontingent: 10.000 Credits pro Monat (ca. 10 Minuten)
- Max. Zeichen: Je nach Modell unterschiedlich (Eleven v3: 5.000, Multilingual v2: 10.000)
- Modelle & Stimmen: Eleven v3, Multilingual v2, Flash v2.5, Turbo v2.5 / 11.000+ Stimmen
- Speicherung: Download als MP3 · WAV
- Kommerzielle Nutzung: Nur mit Bezahlplänen (kostenlos mit Attribution)
Die Stimmen werden als kontext- und emotionsbewusst beschrieben und klingen sehr natürlich. Auch Instant Voice Cloning mit etwa einer Minute Sample ist verfügbar. Mehr als 32 Sprachen werden unterstützt (70+ mit Eleven v3).
Hinweise
- Kommerzielle Nutzung und Voice Cloning starten mit Bezahlplänen ($5–$6/Monat aufwärts).
- Credits sind schnell verbraucht, daher Kosten für lange Skripte einplanen.
Erste Wahl für kommerzielle Projekte, bei denen die finale Stimmqualität den Ausschlag gibt.
Typische Frustrationen bei Online-TTS
Betrachtet man die fünf Dienste nebeneinander, hat jeder klare Stärken, teilt aber auch ähnliche strukturelle Merkmale.
- Dein Text wird zur Konvertierung an einen Server gesendet.
- Wöchentliche/monatliche Zeichenkontingente können wiederholtes Testen teuer machen.
- Ergebnisdateien werden nur kurz aufbewahrt (30 Minuten bis 72 Stunden) – also sofort speichern.
In den meisten Fällen kein großes Problem. Willst du aber sensible Texte vertonen oder denselben Satz dutzendfach über Modelle testen, stört diese Struktur.
Dann lohnt es sich, ein TTS auszuprobieren, das direkt in deinem Browser läuft.
Das TTS von DORODORA
Das von DORODORA bereitgestellte TTS nutzt ebenfalls Open-Source-Modelle, ähnlich wie TTS.ai. Statt jedoch auf einem Cloud-Server zu verarbeiten, lädt es Modelldateien in deinen Browser und läuft direkt auf deinem Gerät.
Zusammengefasst mit denselben Checkpunkten wie oben:
- Anmeldung: Nicht erforderlich
- Kostenloses Kontingent: Unbegrenzt
- Max. Zeichen: 1.000 pro Anfrage
- Modelle & Stimmen: 4 lokale Modelle siehe unten
- Speicherung: Download als WAV
- Kommerzielle Nutzung: Erlaubt
Dadurch werden dein Text und das erzeugte Audio nie an DORODORA-Server gesendet, und du musst dir keine Gedanken um Kontingente machen. Einfach Seite öffnen, nutzen und das Ergebnis als WAV auch kommerziell verwenden.
Modellübersicht
- SuperTonic — 399MB · 10 Stimmen · 31+ Sprachen
- Pocket — 199MB · 8 Stimmen · Englisch, Deutsch, Italienisch, Portugiesisch, Spanisch
- Kokoro — 92MB · 28 Stimmen · Englisch
- Kitten — 28MB · 8 Stimmen · Englisch
Dank SuperTonic mit 31+ Sprachen kannst du mehrsprachige Sendungen und Inhalte mit nur einem Tool testen.
Pocket-Modelle bieten zudem Voice Cloning. Lade einen sauberen 1–3-Sekunden-Clip hoch und erzeuge TTS mit genau dieser Stimme. Custom Voices werden im Browser gespeichert und beim nächsten Besuch wiederverwendet.
Außerdem gibt es den verspielten Animalese-Effekt – ein Schalter, der erzeugtes Audio in eine schnelle, niedliche Charakterstimme verwandelt.
Für wen geeignet?
- Streamer, die eine KI-Stimme für Spenden-Alerts vor dem Livegang testen wollen
- Nutzer, die ihren Text ungern an einen externen Server senden
- Nutzer, die Modelle und Stimmen ohne Kontingent-Sorgen vergleichen wollen
- Creator, die Ergebnisse als WAV speichern und direkt im Schnitt nutzen wollen
Auf der anderen Seite musst du Modelldateien vorab herunterladen (28MB–399MB), und einige Modelle sind nur auf Englisch verfügbar.
Empfohlene Kombinationen nach Einsatzzweck
In der Praxis ist es besser, Tools je nach Zweck zu mixen, statt bei einem zu bleiben.
Lange Skripte & Dokumenten-Vertonung
Die Datei-Konvertierung von Luvvoice oder das großzügige Wochenkontingent von TTSMaker ist nützlich, wenn du ein ganzes Manuskript vertonen musst.
Kommerzielle Vertonungen
Wenn die finale Qualität entscheidet, ist der Bezahlplan von ElevenLabs die Standardwahl. Willst du kostenlos bleiben, deckt eine Kombination aus TTSMaker, TTS.ai und DORODORA – alle mit klar erlaubter kommerzieller Nutzung – die meisten Fälle ab.
Modellvergleich & Experimente
Vergleiche Cloud-Open-Source-Modelle mit TTS.ai und lokale Modelle mit dem TTS von DORODORA – so grenzt du Kandidaten schnell ein.
Spenden-Alert-Setup
Wenn Spenden-Nachrichten von einer KI-Stimme vorgelesen werden sollen, musst du hören, wie sie wirklich klingt. Teste Modell- und Stimm-Kombinationen im TTS von DORODORA und verbinde deinen Favoriten über die TTS-Einstellungen in der DORODORA-Konsole. Auch Voice Cloning TTS wird unterstützt, sodass Nachrichten mit deiner eigenen Stimme vorgelesen werden können.
FAQ
Wo kann ich Audio kostenlos und kommerziell nutzen?
Bei TTSMaker, TTS.ai und DORODORA. ElevenLabs und Luvvoice binden kommerzielle Rechte an Bezahlpläne – je nach Einsatzzweck Plan prüfen.
Wo geht es ohne Anmeldung?
TTSFree und TTS.ai (kostenlose Modelle) sowie DORODORA lassen sich ohne Anmeldung nutzen.
Gibt es einen Dienst, der meinen Text nicht an einen Server sendet?
Nur DORODORA. Es lädt Modelle in deinen Browser und verarbeitet alles auf dem Gerät, sodass Text und Audio nie an einen Server gesendet werden. Andere Cloud-Dienste senden deinen Text zur Konvertierung an einen Server.
Wie richte ich TTS für Spenden-Alerts ein?
Finde zuerst ein Modell und eine Stimme, die dir gefällt, im TTS von DORODORA. Aktiviere dann TTS in der DORODORA-Konsole – Spenden-Nachrichten werden von einer KI-Stimme vorgelesen und per OBS-Browserquelle im Stream angezeigt.
Referenz zum Zeitpunkt des Schreibens
Dieser Artikel wurde auf Basis der öffentlichen Seiten jedes Dienstes zum 26. August 2026 geschrieben. Kostenlose Kontingente, Stimmenanzahl und kommerzielle Bedingungen können sich jederzeit ändern – vor dem tatsächlichen Einsatz daher bitte die neuesten Infos prüfen.
- TTSMaker: https://ttsmaker.com/de
- TTSFree: https://ttsfree.com/de
- Luvvoice: https://luvvoice.com/de
- TTS.ai: https://tts.ai/
- ElevenLabs Text to Speech: https://elevenlabs.io/de/text-to-speech
- DORODORA TTS: https://dorodora.com/playground
Kommerzielle Nutzung der von DORODORA bereitgestellten Modelle
Die vier im TTS von DORODORA laufenden Modelle basieren alle auf öffentlichen Open-Source-Projekten. Ihre kommerzielle Nutzbarkeit auf Ebene des Ursprungsprojekts ist wie folgt.
- SuperTonic (Supertone): Code ist MIT, Modellgewichte sind OpenRAIL-M. Kommerzielle Nutzung ist mit Attribution und nutzungsbasierten Einschränkungen erlaubt.
- Pocket (Kyutai): Lizenzen variieren je nach Stimme. Stimmen, die kommerziell genutzt werden können (CC0, CC BY 4.0), existieren neben Expresso-Dataset-Stimmen mit CC BY-NC 4.0 (nur nicht-kommerziell).
DORODORAstellt nur Stimmen bereit, die kommerziell genutzt werden können, sodass du sie ohne zusätzliche Prüfung in monetarisierten Inhalten verwenden kannst. - Kokoro (hexgrad): Gewichte sind Apache 2.0, daher keine Einschränkungen für kommerzielle Nutzung.
- KittenTTS (KittenML): Apache 2.0, daher keine Einschränkungen für kommerzielle Nutzung.
Alle vier Modelle können ohne kommerzielle Einschränkungen verwendet werden. Wenn du dagegen deine eigene Stimme mit einer Custom-Stimme klonst, gibt es kein Datenlizenz-Problem Dritter.
In jedem Fall ist das unbefugte Klonen fremder Stimmen oder täuschender Einsatz bei allen Modellen verboten – vor Veröffentlichung oder Monetarisierung daher bitte die neuesten Lizenzen jedes Modells und jeder Stimme erneut prüfen.
Fazit
Die Auswahl an Online-TTS ist bereits groß genug. TTSMaker punktet bei Kontingent und Flexibilität, TTSFree bei schneller Nutzung ohne Anmeldung, Luvvoice bei Dokumenten-Vertonung, TTS.ai bei Modell-Experimenten und ElevenLabs bei Spitzenqualität.
Wenn du zusätzlich „kein Server-Transfer, kein Kontingent, keine Anmeldung" brauchst, ist DORODORA, das lokal im Browser läuft, eine schöne Ergänzung. Es ist kostenlos und kommerziell nutzbar – probiere es aus, wenn du eine Stimme für Spenden-Alerts oder Inhalte brauchst.
Du kannst TTS sofort unter dorodora.com/playground ausprobieren.