Separador de voces
Divide cualquier canción en pistas de voz e instrumental con un modelo neuronal — karaoke al instante
🎙️ Un modelo neuronal divide el audio en voces + instrumental (MP3). Se admiten videos de hasta 10 minutos.
FFmpeg en el servidor procesa cualquier formato — incluidos archivos HEVC/H.265 que tu navegador no reproduce. Los archivos se borran del servidor en 30 minutos.
⚠️ No cierres ni recargues esta página hasta que termine, o podrías perder el resultado.
💡 Los archivos grandes viajan al ritmo de tu conexión: la subida continúa sola y se reanuda con seguridad, así que una red lenta solo afecta al tiempo, nunca a tus créditos.
Stems para practicar, hacer remixes y karaoke
Separe cualquier pista en voz e instrumental — o en cuatro stems que incluyen batería y bajo — entregados como un ZIP de archivos independientes.
Separación vocal con IA
Un modelo de aprendizaje profundo (Demucs) separa la pista en voz y música analizando la mezcla, no filtrando frecuencias.
Voz + instrumental
Con una sola subida se obtienen un instrumental de karaoke y una acapella limpia: para remezclar, versionar o estudiar cualquiera de las dos pistas.
ZIP con ambas pistas
Ambas pistas separadas llegan en una única descarga ZIP, listas para su DAW o editor de video.
Preguntas frecuentes
¿Qué tan buena es la separación?⌄
Demucs es actualmente el modelo de separación de stems open-source más fuerte. En mezclas de estudio limpias, la voz sale prácticamente sin instrumentación. Casos extremos — reverb pesado, voz distorsionada, mezclas densas de metal — muestran algo de sangrado entre pistas, algo normal en cualquier modelo de separación de fuentes.
¿Por qué recibo un ZIP en lugar de dos descargas separadas?⌄
Las dos pistas se generan juntas en nuestro servidor, y un ZIP las mantiene emparejadas y conserva los nombres de archivo. El ZIP contiene exactamente vocals.mp3 e instrumental.mp3.
¿Cuál es el límite de duración?⌄
10 minutos por trabajo — la separación neuronal de stems consume mucha CPU, y entradas más largas agotarían la capacidad de nuestro servidor. Las canciones más largas pueden cortarse antes con el recortador de video y separarse en partes.
¿Por qué el instrumental aún contiene restos tenues de voz?⌄
La separación es estadística, no perfecta — las frecuencias que se solapan entre voz e instrumentos dejan residuo. El modelo de 4 stems lo reduce más que el de 2 stems; para instrumentales totalmente limpios, elija pistas con voz poco densa y centrada en el paneo.
Modelos de separación de fuentes y salidas
La separación usa una red neuronal optimizada para SDR ejecutada en la CPU del worker:
- Modo 2 stems — voz contra acompañamiento; el más rápido, ideal para pistas de karaoke y práctica de covers.
- Modo 4 stems — además aísla batería y bajo para trabajo de remix y búsqueda de samples; aproximadamente duplica el tiempo de procesamiento.
Cada stem se codifica a la frecuencia de muestreo de la fuente en MP3 320 kbps (o WAV si la entrada era sin pérdida) y todo se empaqueta en un único ZIP. Se aceptan canciones de hasta 15 minutos. El sangrado entre stems es mínimo en pop/rock bien masterizado y mayor en mezclas electrónicas densas — la página lo advierte de antemano porque unas expectativas honestas valen más que reembolsos sorpresa.
Cómo funciona
- 1
Sube la canción o el video — hasta 10 minutos, cualquier formato de audio o la mayoría de videos.
- 2
Inicia el trabajo. El modelo neuronal analiza la mezcla y separa la voz de la instrumentación.
- 3
Descarga el ZIP con vocals.mp3 e instrumental.mp3. El procesamiento en CPU tarda aproximadamente lo mismo que dura la canción.
Herramientas relacionadas
¿Qué es la separación de voz?
Un separador de voz divide una canción en dos pistas limpias: la voz por un lado y la música por el otro. En lugar de un filtrado bruto que deja pasar restos de la otra mitad, un modelo neuronal de separación de fuentes escucha toda la mezcla y reconstruye la voz y los instrumentos como flujos de audio independientes. Sube un archivo de audio —o un vídeo con sonido— de hasta 10 minutos y nuestro servidor te devuelve un ZIP con vocals.mp3 e instrumental.mp3. Los cantantes lo usan para ensayar sin melodía, los remixers aíslan un estribillo o una base, los editores de pódcast eliminan voces no deseadas de un clip y los aficionados al karaoke consiguen una pista de acompañamiento en segundos. La separación se ejecuta en nuestro servidor con el modelo de código abierto Demucs.
Qué puede hacer esta herramienta
- 🎤 Aislar la voz de cualquier canción como pista acapella limpia
- 🎹 Extraer el instrumental para una versión karaoke al instante
- 📦 Descargar ambas pistas como MP3 en un solo ZIP
- 🧠 Separar pistas con un modelo neuronal que entiende la mezcla, no con un filtro simple
- ⏱️ Aceptar archivos de audio y vídeo de hasta 10 minutos
- 🗑️ Eliminar subidas y resultados automáticamente en 30 minutos
Cuándo usarla
- 🎤 Practicar una canción: canta con el instrumental o estudia la voz aislada
- 🎶 Montar una noche de karaoke sin buscar versiones sin voz
- 🎧 Crear remezclas y mashups con pistas limpias
- 🎙️ Quitar la voz de la banda sonora de un pódcast o vídeo
- 🎓 Enseñar música escuchando voz y acompañamiento por separado
Tu archivo se envía a nuestro VPS, donde la red neuronal Demucs realiza la separación; tanto la subida como los resultados se eliminan automáticamente en 30 minutos. Cada tarea cuesta créditos y el modelo tarda en la CPU del servidor aproximadamente lo que dura la reproducción de la canción. Cada tarea admite hasta 10 minutos de audio: las pistas más largas pueden cortarse antes con una herramienta de recorte. En mezclas de estudio limpias las pistas salen prácticamente sin contaminación; las grabaciones muy procesadas, como el metal denso, la reverberación intensa o las voces distorsionadas, pueden mostrar algo de diafonía: una propiedad normal de cualquier modelo de separación de fuentes.
Última actualización · 2026-09-01
Herramientas relacionadas
Estudio de audio en la nube
Convierte, comprime, recorta, ajusta el volumen, elimina silencios, cambia la velocidad, aplica fundidos, invierte, crea bucles y visualiza archivos de audio.
Combinar audio
Combina de 2 a 6 clips de audio en un solo archivo, en el orden que elijas
Audio a texto
Transcribe el habla de cualquier vídeo o audio a texto plano — con la potencia de Qwen3-ASR