GPT Audio
GPT Audio is an audio model — speech-to-text, text-to-speech, or a unified audio-in/audio-out variant depending on the provider. Available via OpenAI. 128,000-token context. Mid-tier pricing.
GPT Audio is a multimodal AI model from OpenAI. It costs $2.500 per million input tokens and $10.000 per million output tokens (blended $4.750/M), with a 128,000-token context window.
- Speech transcription
- Multilingual coverage
- Realtime or batch ingest depending on provider
- Multimodal: handles images alongside text
- Meeting transcription
- Voice interfaces
- Subtitle pipelines
Benchmarks
More from OpenAI
See all 28 →Frequently asked questions
How much does GPT Audio cost?
GPT Audio costs $2.500 per million input tokens and $10.000 per million output tokens, for a blended reference rate of $4.750 per million tokens.
What is GPT Audio's context window?
GPT Audio supports up to 128,000 tokens of context in a single request.
What is GPT Audio best for?
GPT Audio is well suited to Speech transcription, Multilingual coverage and Realtime or batch ingest depending on provider.
Who makes GPT Audio?
GPT Audio is developed and served by OpenAI.