Truyền đối số từ khóa
Trong bài tập này, bạn sẽ học cách truyền các đối số từ khóa cho hàm của mô hình khi dùng bên trong một pipeline.
Bạn sẽ dùng mô hình MusicGen bản nhỏ của Meta, có thể tạo mẫu nhạc dựa trên mô tả văn bản hoặc prompt âm thanh.
Mô-đun pipeline đã được nạp và thư viện soundfile có sẵn dưới tên sf.
Bài tập này là một phần của khóa học
Mô hình đa phương thức với Hugging Face
Hướng dẫn bài tập
- Tải một pipeline
text-to-audiodùng mô hìnhfacebook/musicgen-smallvới framework PyTorch. - Tạo một từ điển tên
generate_kwargsđể đặt temperature cho quá trình sinh là0.8vàmax_new_tokenslà1. - Tạo một mảng âm thanh bằng prompt
"Classic rock riff", đồng thời điều chỉnh tham số sinh bằng từ điểngenerate_kwargscủa bạn.
Bài tập tương tác thực hành trực tiếp
Hãy thử làm bài tập này bằng cách hoàn thành đoạn mã mẫu này.
# Load a text-to-audio pipeline
musicgen = pipeline(task="____", model="____", framework="pt")
# Make a dictionary to set the generation temperature to 0.8 and max_new_tokens to 1
generate_kwargs = {"____": ____, "____": ____}
# Generate an audio array passing the arguments
outputs = ____("____", ____=____)
sf.write("output.wav", outputs["audio"][0][0], outputs["sampling_rate"])