Skip to main content
POST
Generate voice audio

Authorizations

Authorization
string
header
required

Bearer authentication header of the form Bearer <token>, where <token> is your auth token.

Headers

Idempotency-Key
string
required

Unique key for safe retries of job creation requests.

Required string length: 8 - 128

Body

application/json

Voice generation request.

Pricing: 2 credits per 10 seconds, rounded up to the next 10s. Minimum 2 credits per request. Duration estimate for TTS = len(text) / 12 seconds.

voice_id
string
required

Library voice ID (e.g. "ahmed") or custom voice ID.

mode
enum<string>
required

• tts — Text-to-Speech (requires text). • sts — Speech-to-Speech, re-voice an existing recording (requires audio_url).

Available options:
tts,
sts
text
string

Script for TTS mode. Up to 8192 characters.

Maximum string length: 8192
audio_url
string<uri>

Hosted audio URL for STS mode. Accepted formats: mp3 / wav / m4a / ogg / webm. Maximum 50 MB.

Response

Voice generation completed or accepted.

id
string
required
object
string
required
Allowed value: "voice_generation"
status
enum<string>
required
Available options:
queued,
processing,
completed,
failed,
canceled
credits_reserved
integer
credits_used
integer | null
credits_refunded
integer
duration_seconds
number
created_at
string<date-time>
updated_at
string<date-time> | null
completed_at
string<date-time> | null
failed_at
string<date-time> | null
failure_code
string | null
failure_message
string | null
assets
object[]