Chuyển thành văn bản
Âm thanh được tải lên để nhận dạng trên đám mây (bước này có tải lên), tự phân biệt người nói và đánh dấu thời gian; âm thanh dài được nhận dạng lần lượt từng đoạn 10 phút, có kết quả dần dần. Sau đó bạn có thể xóa chữ trong bản chép lời để cắt phần âm thanh tương ứng, và xuất ra TXT, SRT, VTT, Markdown, JSON, CSV hoặc LRC.
Chỉnh sửa bằng trợ lý AI
Mở trợ lý AI trong trình chỉnh sửa và nói “rút tất cả khoảng lặng xuống 0,5 giây”, “xóa hết các tiếng à, ừm” hoặc “giảm một nửa âm lượng clip thứ hai”. Trợ lý đọc và ghi dòng thời gian (track, clip, âm lượng, fade, tốc độ, EQ, điểm đánh dấu) và bản chép lời của bạn; các thao tác làm thay đổi âm thanh sẽ được xem trước và chỉ thực hiện sau khi bạn xác nhận, mọi bước đều hoàn tác được. Trợ lý không thực hiện giảm tiếng ồn, khử vang hay chuẩn hóa độ lớn, và không tạo giọng nói mới.
Những gì không phải AI
Giảm tiếng ồn (cổng phổ), tăng cường giọng nói (giảm tiếng ồn + khử vang + nén + giới hạn), khử tiếng ù, chuẩn hóa độ lớn (ITU-R BS.1770), phát hiện khoảng lặng, phát hiện BPM, loại bỏ giọng hát (triệt tiêu kênh giữa) và mọi hiệu ứng đều là thuật toán truyền thống chạy trong trình duyệt của bạn, không tải âm thanh lên.
Dùng mô hình nào
TutuAudio không tự phát triển mô hình; TutuAgent kết nối các mô hình nhận dạng giọng nói và mô hình ngôn ngữ hàng đầu, và liên tục cập nhật.
- AI có làm hỏng âm thanh của tôi không?
- Các thao tác làm thay đổi âm thanh sẽ được xem trước và chỉ thực hiện sau khi bạn xác nhận, mọi bước đều hoàn tác được.
- Có cần đăng nhập hay trả tiền không?
- Không. Cả hai tính năng AI đều có hạn mức miễn phí hằng ngày do TutuAgent tính.
- Âm thanh của tôi có bị dùng để huấn luyện mô hình không?
- TutuAudio không huấn luyện mô hình. Khi chuyển thành văn bản, âm thanh được gửi đến dịch vụ nhận dạng mà TutuAgent kết nối.