Ghi lại đúng phần âm thanh cần dùng
Đôi khi bạn không cần toàn bộ tệp âm thanh đang làm việc. Hai tham số duration và offset của phương thức record() có thể giúp bạn xử lý việc này.
Sau khi khám phá tập dữ liệu, bạn nhận thấy có một tệp (đã nhập là nothing_at_end) có 30 giây im lặng ở cuối và một tệp ghi âm cuộc gọi hỗ trợ (đã nhập là out_of_warranty) có 3 giây nhiễu ở đầu.
Thiết lập duration và offset nghĩa là phương thức record() sẽ ghi tối đa duration âm thanh bắt đầu từ offset. Cả hai đều được tính bằng giây.
Bài tập này là một phần của khóa học
Xử lý Ngôn ngữ Nói bằng Python
Bài tập tương tác thực hành trực tiếp
Hãy thử làm bài tập này bằng cách hoàn thành đoạn mã mẫu này.
# Convert AudioFile to AudioData
with nothing_at_end as source:
nothing_at_end_audio = recognizer.record(source,
duration=____,
offset=None)
# Transcribe AudioData to text
text = recognizer.recognize_google(nothing_at_end_audio,
language="en-US")
print(text)