Multimodal

Text-to-speech

Same shape as OpenAI's audio.speechPOST /v1/audio/speech. Returns raw audio bytes in one response (no streaming playback yet), billed per input character.

resp = client.audio.speech.create(
    model="tts-1",
    voice="alloy",
    input="Your order has shipped.",
    response_format="mp3",
)
resp.stream_to_file("out.mp3")

Which models and voices

ModelProviderVoice id
tts-1OpenAIe.g. alloy (default)
tts-1-hdOpenAIOpenAI voice ids
gpt-4o-mini-ttsOpenAIOpenAI voice ids
speech-02-hdMiniMaxMiniMax voice ids — required, no default
speech-02-turboMiniMaxMiniMax voice ids — required, no default
eleven_multilingual_v2ElevenLabsElevenLabs voice ids — required, no default
eleven_v3ElevenLabsElevenLabs voice ids — required, no default

voice only defaults to "alloy" for OpenAI models — MiniMax and ElevenLabs use their own voice-id vocabulary and a request against those models must set voice explicitly. response_format accepts mp3 (default), opus, aac, flac, wav, and pcm.

Not yet supported

No real-time/streamed audio output — the full file is generated and returned in one response. For transcription (audio → text) see Speech-to-text.