Audio Intelligence API — 9+ Endpoints
GPU-accelerated audio processing API
9 GPU-accelerated audio endpoints — speech-to-text, text-to-speech, enhancement, and source separation.
curl -H "X-API-Key: YOUR_KEY" \
"https://audio.toolkitapi.io/v1/audio/transcribe?audio_url=https://example.com/audio.mp3&language=en"
import httpx
resp = httpx.get(
"https://audio.toolkitapi.io/v1/audio/transcribe",
params={"audio_url": "https://example.com/audio.mp3", "language": "en"},
headers={"X-API-Key": "YOUR_KEY"},
)
print(resp.json())
const resp = await fetch(
"https://audio.toolkitapi.io/v1/audio/transcribe?audio_url=https://example.com/audio.mp3&language=en",
{ headers: { "X-API-Key": "YOUR_KEY" } }
);
const data = await resp.json();
console.log(data);
GPU Accelerated
|
Whisper + Kokoro TTS
|
Free Tier Available
|
99+ Languages
Popular Tools
GET
GET
GET
GET
Enhance Audio
Reduce background noise and normalize audio levels using GPU acceleration.
Source Separation
Separate audio into individual stems (vocals, drums, bass, other) using Demucs on GPU.
Text-to-Speech
Convert text to natural-sounding speech using Kokoro TTS on GPU — multiple voices, adjustable speed.
Transcribe Audio
Transcribe speech to text using Whisper on GPU — 99+ languages, word timestamps, subtitle output.
Browse by Category
AI-powered audio processing, speech, and editing tools.
Built for Audio Developers
GPU-accelerated speech, enhancement, and editing — all via API.
🎤
Speech-to-Text (Whisper)
Transcribe audio in 99+ languages with GPU-accelerated Whisper models.
🔊
Text-to-Speech (Kokoro)
Generate natural-sounding speech with adjustable voice and speed.
🎛️
Audio Enhancement
Noise reduction, normalization, and quality improvement on GPU.
🎵
Source Separation (Demucs)
Isolate vocals, drums, bass, and other stems from any track.
9+
API Endpoints
2
Categories
99+
Languages (Whisper)
6
GPU Endpoints
Start processing audio today
Start with a free plan. No credit card. GPU-accelerated speech-to-text, TTS, and more.
Get an API Key →