Audio a texto
Transcribe el habla de cualquier vídeo o audio a texto plano — con la potencia de Qwen3-ASR
El habla se transcribe con Qwen3-ASR en nuestros servidores y se convierte directamente en texto plano — sin marcas de tiempo, sin formato de subtítulos, solo las palabras. ¿Necesitas subtítulos SRT/VTT? Usa el Generador de subtítulos con IA.
⚠️ No cierres ni recargues esta página hasta que termine, o podrías perder el resultado.
💡 La velocidad de subida depende de tu propia conexión, no de nuestros servidores — con una conexión lenta, la barra simplemente avanza más despacio. Seguirá funcionando; no hace falta reintentar ni te cobraremos dos veces.
Motor ASR, idiomas y notas de precisión
La transcripción ejecuta Qwen3-ASR en el worker con estas características:
- Idiomas — chino e inglés son los más sólidos; los principales idiomas europeos (de/es/fr/pt/ru), el japonés, el coreano y el hindi funcionan bien con habla clara.
- Puntuación automática — comas, signos de interrogación y cortes de oración provienen del modelo, dejando transcripciones legibles sin posedición.
- Números y fechas — normalizados a su forma escrita en el idioma detectado.
- Sin diarización de hablantes — las reuniones con varios hablantes se transcriben como texto continuo; etiquete a los hablantes manualmente si hace falta.
Audio de hasta 500 MB o 2 horas por tarea; el tiempo típico ronda una décima parte de la duración. La salida aparece en la página con un botón de copiar y se descarga como TXT UTF-8.
Cómo funciona
- 1
Sube cualquier vídeo o archivo de audio — el formato no importa, el servidor lo decodifica.
- 2
Elige el idioma hablado o déjalo en detección automática.
- 3
Copia la transcripción o descárgala como archivo .txt. Los archivos se borran automáticamente en 30 minutos.
- 4
Copie la transcripción desde la página o descargue el archivo .txt; el audio original se elimina tras el procesamiento.
Transcripciones con puntuación consciente de los hablantes
Suba una grabación y reciba texto puntuado y dividido en párrafos — no un muro de palabras en minúsculas — en cualquiera de los 11 idiomas de interfaz.
Motor Qwen3-ASR
El mismo reconocimiento de voz que impulsa nuestros subtítulos AI corre en el servidor — entrevistas, clases y reuniones vuelven como texto plano legible.
Acepta cualquier formato
Archivos de audio y vídeo por igual, incluidos contenedores que tu navegador no puede decodificar — sube y el transcodificador del servidor se encarga del resto.
Pista de idioma o automático
Dale al reconocedor una pista de idioma para más precisión o deja que lo detecte solo — la transcripción es texto limpio, listo para copiar o buscar.
Preguntas frecuentes
¿En qué se diferencia de la herramienta de subtítulos con IA?⌄
Usa la misma transcripción Qwen3-ASR por debajo — esta herramienta simplemente va directa al texto plano, sin marcas de tiempo, números de línea ni editor de archivos de subtítulos. Usa el Generador de subtítulos con IA si necesitas archivos SRT/VTT/ASS o subtítulos incrustados.
¿Qué precisión tiene la transcripción?⌄
La precisión depende de la calidad del audio, el acento y el ruido de fondo, pero Qwen3-ASR maneja bien el habla habitual (reuniones, entrevistas, pódcasts, clases). El audio muy ruidoso o con mucha gente hablando a la vez seguirá necesitando revisión manual.
¿Qué pasa con mi archivo?⌄
La subida y la transcripción se borran automáticamente en 30 minutos. Los trabajos solo son accesibles con el token firmado de tu sesión.
¿Identifica quién dijo qué?⌄
Todavía no — la diarización está en la hoja de ruta. En entrevistas, la puntuación igualmente deja ver los turnos en la mayoría de los casos, pero los nombres no se adjuntan a los segmentos.
Herramientas relacionadas
✦ ¿Qué es audio a texto?
Audio a texto convierte la voz de una grabación en una transcripción limpia en texto plano. Impulsada por el mismo reconocimiento de voz Qwen3-ASR que hace funcionar nuestro servicio de subtítulos con IA, entrega texto legible sin marcas de tiempo ni formato. Acepta archivos de audio y de vídeo por igual, en cualquier formato, incluidos los que tu navegador no puede decodificar. Los periodistas convierten entrevistas en notas, los estudiantes transforman clases en material de estudio y los profesionales hacen buscables las reuniones. Una indicación de idioma ayuda al reconocedor, y el resultado se copia con un botón o se descarga como texto.
Qué puede hacer esta herramienta
- 📝 Transcribir la voz a texto plano, sin formato
- 🎬 Aceptar archivos de audio y de vídeo en cualquier formato
- 🌐 Elegir una indicación de idioma: automático, chino, inglés, japonés, coreano, español, francés, alemán, portugués, ruso o hindi
- 📋 Copiar la transcripción con un clic o descargar un archivo de texto
- 🔍 Producir texto limpio, fácil de buscar y reutilizar
Cuándo usarla
- Convertir una grabación de entrevista en notas escritas
- Transformar una clase en material de estudio que puedes ojear
- Hacer que una grabación de reunión se pueda buscar después
- Obtener texto de una voz en off de vídeo para subtítulos o un artículo
Tu audio viaja por una conexión cifrada hasta nuestros servidores y se elimina automáticamente en 30 minutos. La precisión depende de la grabación: el habla clara de una sola persona con poco ruido de fondo se transcribe bien, mientras que el ruido fuerte, los acentos marcados y las voces superpuestas bajan la calidad —y la salida es solo texto plano, sin etiquetas de hablante ni marcas de tiempo. Para mejores resultados, graba en una sala silenciosa y deja que hable una persona a la vez.
Última actualización · 2026-09-01
Herramientas relacionadas
Estudio de audio en la nube
Convierte, comprime, recorta, ajusta el volumen, elimina silencios, cambia la velocidad, aplica fundidos, invierte, crea bucles y visualiza archivos de audio.
Combinar audio
Combina de 2 a 6 clips de audio en un solo archivo, en el orden que elijas
Editor de metadatos MP3
Edita título, artista, álbum, año, pista, género, comentario y carátula — en el servidor