Áudio para texto
Transcreva a fala de qualquer vídeo ou áudio em texto simples — com tecnologia Qwen3-ASR
A fala é transcrita pelo Qwen3-ASR rodando em nossos servidores e depois convertida direto para texto simples — sem timestamps, sem formatação de legenda, só as palavras. Precisa de legendas SRT/VTT? Use o Gerador de legendas com IA.
⚠️ Não feche nem recarregue esta página até terminar, ou você pode perder o resultado.
💡 A velocidade de envio depende da sua própria conexão, não dos nossos servidores — com uma conexão lenta, a barra só avança mais devagar. Ela continuará; não é preciso tentar novamente nem será cobrado duas vezes.
Motor ASR, idiomas e notas de precisão
A transcrição roda Qwen3-ASR no servidor com estas características:
- Idiomas — chinês e inglês são os mais fortes; os principais idiomas europeus (de/es/fr/pt/ru), japonês, coreano e híndi funcionam bem com fala clara.
- Pontuação automática — vírgulas, pontos de interrogação e divisão de frases vêm do modelo, deixando as transcrições legíveis sem pós-edição.
- Números e datas — normalizados para a forma escrita no idioma detectado.
- Sem diarização de falantes — reuniões com vários participantes são transcritas como texto contínuo; rotule os falantes manualmente se necessário.
Áudio de até 500 MB ou 2 horas por trabalho; o tempo típico é de cerca de um décimo da duração. A saída aparece na própria página com um botão de copiar e é baixada como TXT UTF-8.
Como funciona
- 1
Envie qualquer vídeo ou arquivo de áudio — o formato não importa, o servidor faz a decodificação.
- 2
Escolha o idioma falado ou deixe na detecção automática.
- 3
Copie a transcrição ou baixe como arquivo .txt. Arquivos somem automaticamente em 30 minutos.
- 4
Copie a transcrição da página ou baixe o arquivo .txt; o áudio original é excluído após o processamento.
Transcrições com pontuação consciente dos falantes
Envie uma gravação e receba texto pontuado e paragrafado — não um muro de palavras minúsculas — em qualquer um dos 11 idiomas de interface.
Motor Qwen3-ASR
O mesmo reconhecimento de fala que alimenta nossas legendas de IA roda no servidor — entrevistas, aulas e reuniões voltam como texto puro e legível.
Qualquer formato é aceito
Arquivos de áudio e vídeo, incluindo contêineres que seu navegador não consegue decodificar — envie e o transcodificador do servidor cuida do resto.
Dica de idioma ou automático
Dê ao reconhecedor uma dica de idioma para mais precisão ou deixe que ele detecte automaticamente — a transcrição é um texto limpo, pronto para copiar ou pesquisar.
Perguntas frequentes
Qual a diferença para a ferramenta de legendas com IA?⌄
A mesma transcrição Qwen3-ASR por baixo dos panos — esta ferramenta só vai direto ao texto simples, sem timestamps, números de legenda ou editor de arquivo de legendas. Use o Gerador de legendas com IA se precisar de arquivos SRT/VTT/ASS ou legendas gravadas no vídeo.
Qual a precisão da transcrição?⌄
A precisão depende da qualidade do áudio, do sotaque e do ruído de fundo, mas o Qwen3-ASR lida bem com fala comum (reuniões, entrevistas, podcasts, aulas). Áudio muito ruidoso ou com muita gente falando ao mesmo tempo ainda vai exigir revisão manual.
O que acontece com meu arquivo?⌄
O upload e a transcrição são apagados automaticamente em 30 minutos. Os trabalhos só ficam acessíveis com o token assinado da sua sessão.
Ele identifica quem disse o quê?⌄
Ainda não — a diarização está no roteiro. Em entrevistas, a pontuação já torna as trocas de turno visíveis na maioria dos casos, mas os nomes não são vinculados aos trechos.
Ferramentas relacionadas
✦ O que é áudio para texto?
Áudio para texto transforma a fala de uma gravação em uma transcrição limpa em texto puro. Movido pelo mesmo reconhecimento de voz Qwen3-ASR que alimenta nosso serviço de legendas com IA, ele entrega texto legível sem carimbos de tempo nem formatação. Aceita arquivos de áudio e de vídeo igualmente, em qualquer formato, inclusive os que seu navegador não consegue decodificar. Jornalistas transformam entrevistas em notas, estudantes convertem aulas em material de estudo e profissionais tornam reuniões pesquisáveis. Uma dica de idioma ajuda o reconhecedor, e o resultado se copia com um botão ou se baixa como arquivo de texto.
O que esta ferramenta faz
- 📝 Transcrever a fala em texto puro, sem formatação
- 🎬 Aceitar arquivos de áudio e de vídeo em qualquer formato
- 🌐 Escolher uma dica de idioma: automático, chinês, inglês, japonês, coreano, espanhol, francês, alemão, português, russo ou hindi
- 📋 Copiar a transcrição com um clique ou baixar um arquivo de texto
- 🔍 Produzir texto limpo, fácil de buscar e reutilizar
Quando usar
- Transformar uma gravação de entrevista em anotações escritas
- Converter uma aula em material de estudo que você pode folhear
- Tornar uma gravação de reunião pesquisável depois
- Obter texto de uma narração de vídeo para legendas ou um artigo
Seu áudio viaja por uma conexão criptografada até nossos servidores e é excluído automaticamente em até 30 minutos. A precisão depende da gravação: fala clara de uma única pessoa com pouco ruído de fundo transcreve bem, enquanto ruído forte, sotaques carregados e vozes sobrepostas reduzem a qualidade — e a saída é apenas texto puro, sem rótulos de falante nem carimbos de tempo. Para melhores resultados, grave em uma sala silenciosa e deixe uma pessoa falar por vez.
Última atualização · 2026-09-01
Ferramentas relacionadas
Estúdio de Áudio na Nuvem
Converta, comprima, corte, ajuste o volume, remova silêncios, altere a velocidade, aplique fade, inverta, crie loops e visualize arquivos de áudio.
Mesclar áudio
Combine de 2 a 6 clipes de áudio em um único arquivo, na ordem que você escolher
Editor de metadados MP3
Edite título, artista, álbum, ano, faixa, gênero, comentário e capa — no servidor