OpenAI のテキスト読み上げ(TTS)
OpenAI には、テキスト入力から人間らしい音声を生成する、いわゆるテキスト読み上げ(TTS)モデルがあります。OpenAI では複数の音声が用意されており、レスポンスをローカルファイルや下流のアプリケーションへストリーミングすることもできます。
この演習はコースの一部です
OpenAI APIで学ぶマルチモーダルシステム
演習の手順
"Hi! How's your day going?"に対するテキスト読み上げリクエストを、"ballad"の音声で作成します。- レスポンスを
.mp3ファイルにストリーミングします。
実践的なインタラクティブ演習
このサンプルコードを完成させて、この演習に挑戦してみましょう。
client = OpenAI(api_key="")
# Create the text-to-speech request
response = client.audio.speech.create(
model="gpt-4o-mini-tts",
____,
input="Hi! How's your day going?"
)
# Stream the response to an MP3 file
response.____("output.mp3")