음성 텍스트 변환
오디오를 클라우드에 업로드해 인식하며(이 단계에서는 업로드가 필요합니다), 화자를 자동으로 구분하고 타임스탬프를 표시합니다. 긴 오디오는 10분 단위로 차례대로 인식되며 변환되는 대로 결과가 나옵니다. 변환이 끝나면 스크립트에서 글자를 지워 해당 오디오를 잘라낼 수 있고, TXT, SRT, VTT, Markdown, JSON, CSV, LRC로 내보낼 수 있습니다.
AI 어시스턴트 편집
편집기에서 AI 어시스턴트를 열고 “모든 멈춤을 0.5초로 줄여 줘”, “음, 어를 모두 지워 줘”, “두 번째 클립 음량을 절반으로” 처럼 말하면 됩니다. 어시스턴트는 타임라인(트랙, 클립, 음량, 페이드, 속도, EQ, 마커)과 스크립트를 읽고 씁니다. 오디오를 변경하는 작업은 먼저 미리 보기를 보여 주고 확인한 뒤에 실행하며, 모든 단계는 실행 취소할 수 있습니다. 노이즈 제거, 잔향 제거, 라우드니스 통일 같은 효과는 실행하지 않으며 새로운 목소리도 생성하지 않습니다.
AI가 아닌 것
노이즈 제거(스펙트럼 게이트), 음성 향상(노이즈 제거 + 잔향 제거 + 압축 + 리미터), 험 노이즈 제거, 라우드니스 통일(ITU-R BS.1770), 무음 감지, BPM 감지, 보컬 제거(센터 채널 제거) 및 모든 효과는 브라우저에서 실행되는 전통적인 알고리즘이며 오디오를 업로드하지 않습니다.
어떤 모델을 쓰나요
TutuAudio는 자체 모델을 개발하지 않습니다. TutuAgent가 최상위 수준의 음성 인식 모델과 대규모 언어 모델을 연결하며 계속 교체하고 있습니다.
- AI가 오디오를 마음대로 지우지는 않나요?
- 오디오를 변경하는 작업은 먼저 미리 보기를 보여 주고 확인한 뒤에 실행하며, 모든 단계는 실행 취소할 수 있습니다.
- 로그인이나 결제가 필요한가요?
- 둘 다 필요 없습니다. 두 AI 기능 모두 매일 무료 사용량이 있으며 TutuAgent가 사용량을 계산합니다.
- 내 오디오가 모델 학습에 쓰이나요?
- TutuAudio는 모델을 학습시키지 않습니다. 음성 텍스트 변환 시 오디오는 TutuAgent가 연결한 인식 서비스로 전송되어 인식됩니다.