100% local — seu arquivo nunca sai do navegador
Transcrever Áudio em Texto
Conversor de áudio em texto grátis que roda inteiramente no seu navegador — o arquivo nunca sai do seu dispositivo.
- Grátis
- Sem cadastro
- Sem marca d’água
Como funciona
- 01
Escolha a gravação
Selecione um arquivo de áudio — MP3, WAV, M4A, AAC, OGG ou FLAC — ou um arquivo de vídeo, e a faixa de áudio é extraída para você. Nada é enviado em momento algum.
- 02
Selecione o idioma falado
Escolha o idioma em vez de deixar que ele seja adivinhado. Um palpite errado não falha de forma visível: ele produz um texto fluente e inventado, difícil de perceber como errado.
- 03
Copie ou exporte
A transcrição aparece abaixo, pronta para copiar. Exporte TXT para texto puro, ou SRT e VTT se precisar das marcações de tempo para legendas.
Por que escolher o TranscriptSnap
Feito para gravações que não dá para enviar
Notas de paciente, depoimentos, entrevistas com fontes, áudio de campanha não lançada. Processar localmente não reduz o risco de divulgação — elimina a divulgação, porque nenhum terceiro participa em momento algum.
Sem limite de duração nem de quantidade
Não há servidor para impor limite. Gravações longas são divididas em janelas sobrepostas e recompostas automaticamente; o único teto real é a memória do seu aparelho.
Continua funcionando sem conexão
Depois da primeira execução o modelo fica em cache, então dá para transcrever em um avião ou num escritório com rede restrita. Também é a prova mais simples de que a ferramenta é local — desconecte e tente.
Todo formato de áudio comum, e vídeo também
MP3, WAV, M4A, AAC, OGG e FLAC funcionam, assim como MP4, MOV e WebM, dos quais a faixa de áudio é extraída para você. Sem precisar converter nada antes.
Vale saber
Um conversor de áudio em texto com privacidade de verdade
A maioria das ferramentas envia sua gravação para um servidor. Esta não: o modelo de fala roda dentro do navegador via WebAssembly, então o áudio permanece na sua máquina. Isso torna a ferramenta segura para entrevistas, notas médicas, gravações jurídicas e qualquer coisa que você prefira não entregar a terceiros.
Funciona offline depois de carregado
O modelo fica em cache após a primeira execução, então você pode transcrever áudio em texto depois sem conexão nenhuma. Não há custo por minuto nem limite de upload.
Formatos aceitos e o que vale a pena enviar
MP3, WAV, M4A, AAC, OGG e FLAC funcionam, assim como os contêineres de vídeo mais comuns como MP4, MOV e WebM — a faixa de áudio é extraída para você. A qualidade do que foi gravado importa muito mais que o formato: uma gravação a 128 kbps de alguém falando com clareza perto do microfone ganha de um arquivo sem perdas capturado do outro lado da sala. Se você puder escolher, grave em mono a 16 kHz ou mais e mantenha quem fala perto do microfone.
Como os arquivos longos são tratados
Modelos de voz trabalham em janelas curtas, então gravações longas são divididas em blocos sobrepostos e depois costuradas de volta. É essa sobreposição que impede as frases de serem cortadas ao meio nas emendas — se você já viu uma transcrição em que somem palavras em intervalos suspeitosamente regulares, era uma ferramenta que pulou esta etapa. Arquivos muito longos dependem da memória do seu aparelho, e não de qualquer limite de upload, então uma hora de áudio roda tranquila num notebook e pode pesar num celular.
Para quem isto foi feito
O argumento de privacidade não é abstrato. Subir áudio identificável de um paciente para um serviço sem contrato assinado é um problema de conformidade na saúde. Gravações de clientes são protegidas por sigilo profissional na área jurídica. No jornalismo, a gravação da fonte é o trabalho inteiro, e um processador terceirizado é uma via de ataque real. Material de campanha ainda não divulgado e sob acordo de confidencialidade em geral nem pode ser enviado a fornecedores não aprovados. Em todos esses casos, processar localmente não apenas reduz o risco: elimina a divulgação por completo, porque não existe terceiro envolvido.
Como revisar o resultado sem perder tempo
Leia a transcrição acompanhando o áudio de uma vez só e em ritmo acelerado, em vez de corrigir palavra por palavra. Os erros se concentram em nomes de pessoas, nomes de produto e termos técnicos, então um localizar e substituir sobre o punhado de nomes próprios da gravação costuma resolver a maior parte. A pontuação é inferida, não ouvida, então os fins de frase na fala rápida merecem uma segunda olhada. O resto normalmente está bom o bastante para deixar como está.
Perguntas frequentes
O conversor de áudio em texto é mesmo grátis?
Sim, e ilimitado. Como a transcrição acontece no seu próprio dispositivo, não há custo de servidor para repassar.
Meu áudio é enviado para algum lugar?
Não. O arquivo é lido localmente e processado no navegador. Nada é enviado a um servidor.
Quais formatos são suportados?
MP3, WAV, M4A, AAC, OGG, FLAC e vídeos comuns como MP4 e MOV.
Qual é a precisão?
Usa o OpenAI Whisper, a mesma família de modelos da maioria dos serviços pagos. Com fala limpa, o resultado costuma ficar bem próximo do literal.
Por que a primeira execução é mais lenta?
O modelo é baixado uma vez e depois fica em cache. As transcrições seguintes começam imediatamente.
Dá para verificar que nada é enviado?
Dá, e você deveria verificar. Abra o painel de rede do navegador antes de transcrever: você vai ver os arquivos do modelo baixando na primeira execução e mais nada. Ou desconecte da rede depois que o modelo estiver em cache e transcreva mesmo assim — isso é algo que nenhuma ferramenta consegue fingir.
Funciona no celular?
Sim, embora um celular seja bem mais lento que um notebook e gravações longas possam esgotar a memória dele. Para trechos curtos funciona bem.
O que ele não faz bem?
Os pontos fracos são vozes sobrepostas, nomes próprios e fala com sotaque carregado sobre ruído de fundo. Ele também não identifica quem está falando.
Transcreva áudio em texto de graça, sem entregar o arquivo a ninguém
A maioria das ferramentas que transcrevem áudio em texto é de servidor: você envia, a máquina deles escuta, você recebe o texto e os minutos são contados. Esse modelo serve para um podcast que vai ser público de qualquer jeito, e não serve para boa parte do que as pessoas realmente gravam. Este conversor de áudio em texto compila o modelo de fala dentro do navegador com WebAssembly, então a gravação é lida do seu disco e processada onde já estava. O resultado é a mesma saída do Whisper que os serviços pagos usam, sem cadastro, sem cobrança por minuto e sem upload a justificar.