文字起こし
音声をクラウドにアップロードして認識し(この手順ではアップロードが発生します)、話者を自動で区別し、タイムスタンプを付けます。長い音声は 10 分ずつ順に認識され、できた部分から表示されます。完了後は文字起こしの文字を消すだけで対応する音声をカットでき、TXT、SRT、VTT、Markdown、JSON、CSV、LRC で書き出せます。
AI アシスタントで編集
エディタで AI アシスタントを開き、「すべての間を 0.5 秒に縮めて」「『えー』『あのー』を全部消して」「2 番目のクリップの音量を半分に」のように話しかけるだけです。アシスタントはタイムライン(トラック、クリップ、音量、フェード、速度、EQ、マーカー)と文字起こしを読み書きします。音声を変更する操作はまずプレビューを表示し、確認後に実行され、どの手順も元に戻せます。ノイズ除去、残響除去、ラウドネスの統一といったエフェクトは実行せず、新しい声も生成しません。
AI ではないもの
ノイズ除去(スペクトルゲート)、ボイス強調(ノイズ除去 + 残響除去 + コンプレッサー + リミッター)、ハム除去、ラウドネスの統一(ITU-R BS.1770)、無音検出、BPM 検出、ボーカル除去(センターチャンネル除去)、そしてすべてのエフェクトは、ブラウザ内で動く従来型のアルゴリズムで、音声はアップロードされません。
使っているモデル
TutuAudio は自社でモデルを開発していません。TutuAgent がトップクラスの音声認識モデルと大規模言語モデルに接続し、継続的に入れ替えています。
- AI が勝手に音声を消してしまうことは?
- 音声を変更する操作はまずプレビューを表示し、確認後に実行されます。どの手順も元に戻せます。
- ログインや支払いは必要?
- どちらも不要です。2 つの AI 機能には毎日の無料枠があり、TutuAgent が計量します。
- 音声がモデルの学習に使われることは?
- TutuAudio はモデルの学習を行いません。文字起こしの際、音声は TutuAgent が接続する認識サービスに送られて認識されます。