Transkription
Das Audio wird zur Erkennung in die Cloud hochgeladen (dieser Schritt lädt hoch), mit Sprecherkennzeichnung und Zeitstempeln; lange Aufnahmen werden in Abschnitten von 10 Minuten erkannt, die Ergebnisse erscheinen nach und nach. Danach kannst du Wörter im Transkript löschen, um das passende Audio herauszuschneiden, und als TXT, SRT, VTT, Markdown, JSON, CSV oder LRC exportieren.
Schnitt mit dem KI-Assistenten
Öffne den KI-Assistenten im Editor und sag „kürze alle Pausen auf 0,5 Sekunden“, „lösche jedes Äh und Ähm“ oder „halbiere die Lautstärke des zweiten Clips“. Er liest und schreibt deine Zeitleiste (Spuren, Clips, Lautstärke, Blenden, Tempo, EQ, Marker) und dein Transkript; Änderungen am Audio werden zuerst als Vorschau gezeigt und erst nach deiner Bestätigung angewendet, und jeder Schritt lässt sich rückgängig machen. Er führt keine Rauschunterdrückung, Enthallung oder Lautheitsnormalisierung aus und erzeugt keine neuen Stimmen.
Was keine KI ist
Rauschunterdrückung (Spectral Gate), Stimmverbesserung (Entrauschen + Enthallen + Kompression + Limiter), Brummentfernung, Lautheitsnormalisierung (ITU-R BS.1770), Stilleerkennung, BPM-Erkennung, Stimmentfernung (Mittenkanal-Auslöschung) und alle Effekte sind klassische Algorithmen, die in deinem Browser laufen, ohne Upload.
Welche Modelle
TutuAudio entwickelt keine eigenen Modelle; TutuAgent bindet führende Spracherkennungs- und Sprachmodelle an und aktualisiert sie laufend.
- Kann die KI mein Audio verpfuschen?
- Änderungen am Audio werden zuerst als Vorschau gezeigt und erst nach deiner Bestätigung angewendet, und jeder Schritt lässt sich rückgängig machen.
- Muss ich mich anmelden oder bezahlen?
- Nein. Beide KI-Funktionen enthalten ein tägliches Gratiskontingent, das TutuAgent bemisst.
- Wird mein Audio zum Trainieren von Modellen verwendet?
- TutuAudio trainiert keine Modelle. Für die Transkription wird das Audio an den Erkennungsdienst gesendet, den TutuAgent anbindet.