Skip to content

Use o OpenAI Whisper Online — Sem Instalar Nada

Atualizado

O OpenAI Whisper é um modelo de reconhecimento de fala. Você entrega áudio, ele devolve texto. É o modelo que a maioria dos serviços de transcrição roda silenciosamente por baixo — inclusive vários que cobram por minuto para isso.

A reclamação de sempre é que usá-lo por conta própria significa instalar Python, depois ffmpeg, depois PyTorch, e então descobrir que seu notebook não tem CUDA. Este guia pula tudo isso: o Whisper roda direto numa aba do navegador.

O que o Whisper é de fato

O Whisper foi treinado com cerca de 680.000 horas de áudio multilíngue. É essa escala que explica por que ele lida melhor com sotaques, ruído de fundo e alternância de idiomas do que os motores de fala anteriores. Ele existe em vários tamanhos, e o tamanho escolhido é o principal trade-off entre qualidade e velocidade que está na sua mão.

ModeloParâmetrosTamanho aprox. (quantizado)Onde faz sentido
tiny39M~15 MBRascunhos rápidos, áudio limpo, aparelhos fracos
base74M~73 MBInglês, espanhol, francês, alemão, holandês
small244M~237 MBTodo o resto — e não é opcional
medium / large769M–1,5B1–3 GBNa prática, só do lado do servidor

O conselho corrente é que “base é o ponto ideal para navegadores”. Isso vale para o inglês e está redondamente errado para a maioria dos outros idiomas. Taxas de erro de palavra medidas sobre o mesmo conteúdo gravado:

Idiomabasesmall
Espanhol0,0%0,0%
Francês0,0%0,0%
Holandês3,7%3,7%
Alemão4,2%0,0%
Português6,7%4,4%
Coreano8,5%4,3%
Chinês11,2%0,0%
Japonês11,5%1,6%
Vietnamita16,0%2,0%
Russo24,1%3,4%
Polonês30,0%0,0%
Sueco45,0%5,0%
Turco60,0%26,7%

O polonês é o caso para guardar. É um idioma europeu em alfabeto latino, então a intuição o arquiva ao lado do espanhol e do francês — e ele marca 30%, na mesma faixa do russo. O sueco é pior ainda: 45% no base, 5% no small. Isso não dá para prever pela família linguística nem pelo sistema de escrita. Ou você mede, ou usa small por padrão para tudo que não for inglês.

A consequência prática: uma ferramenta de navegador que usa base para tudo está servindo transcrições quebradas para a maior parte do mundo em silêncio — e as transcrições parecem corretas.

Rodando sem instalar nada

O Whisper foi compilado para WebAssembly, o que significa que o modelo pode executar dentro do próprio sandbox do navegador. Nada é enviado para lugar nenhum — o áudio é decodificado localmente, entregue ao modelo localmente, e o texto volta localmente.

As consequências práticas:

  • A primeira execução é lenta. O modelo precisa ser baixado uma vez (cerca de 74 MB para o base). Depois disso ele fica em cache e começa na hora.
  • As execuções seguintes funcionam offline. Uma vez em cache, dá para transcrever dentro de um avião.
  • Não existe custo por minuto, porque não há servidor de ninguém fazendo o trabalho.
  • Arquivos longos dependem da sua RAM, não do limite de upload de alguém.

Se quiser testar agora, a página de áudio para texto faz exatamente isso — escolha um arquivo e o modelo carrega no primeiro uso.

Você precisa informar o idioma — e eis por que isso importa

O Whisper enquanto modelo consegue detectar o idioma. Várias implementações do Whisper não fazem isso, e a diferença não é acadêmica.

O runtime de navegador mais usado para o Whisper (transformers.js) tem isto no código-fonte, na função que monta os tokens iniciais do decodificador:

if (!language) {
    // TODO: Implement language detection
    language = 'en';
}

Se nenhum idioma for informado, ele não tenta adivinhar — ele fixa inglês. Dê a ele mandarim e o modelo recebe a instrução de produzir inglês a partir de áudio em chinês. Ele não dá erro. Não devolve vazio. Ele inventa um inglês fluente:

Falado (mandarim): 快速快放。今天的会议记录需要整理成文字。 Saída: “The fast-food delivery of the product is now available for the customer.”

Essa saída não é uma tradução — uma tradução ao menos preservaria o sentido. É confabulação, e é o pior modo de falha que uma ferramenta de transcrição tem, porque nada no resultado parece errado. Sem aviso, sem caracteres embaralhados, sem escore de confiança. Só uma frase limpa em inglês que ninguém disse.

Então: se uma ferramenta de transcrição não pergunta em que idioma está o áudio, descubra o que ela faz quando recebe algo que não é inglês antes de confiar a ela qualquer coisa que importe.

Duas situações que vale conhecer mesmo quando você define o idioma:

  • Alternância intensa de idiomas. Um único token de idioma governa o arquivo inteiro. Uma gravação que alterna entre dois idiomas a cada poucas frases será forçada para um deles.
  • A saída em chinês vem em caracteres tradicionais por padrão. Se você precisa de simplificado, a conversão tem de acontecer depois da transcrição. Tentar direcionar isso com um prompt inicial custa conteúdo — em teste, um prompt que de fato empurrou a saída para simplificado também derrubou 32% das palavras.

Qual é a precisão real

Em fala limpa, com um único locutor em ritmo normal, o base costuma chegar perto do literal — bom o bastante para que editar seja mais rápido do que digitar do zero. A precisão cai de maneiras bastante previsíveis:

  • Locutores sobrepostos. O Whisper produz um único fluxo de texto, então duas pessoas falando ao mesmo tempo se misturam. Ele não tem diarização de locutores embutida.
  • Nomes próprios e jargão. Nomes, nomes de produtos e termos técnicos são os erros mais comuns. O Whisper chuta uma palavra plausível em vez de deixar uma lacuna, então esses erros vêm com cara de certeza.
  • Áudio muito ruidoso ou distante. Gravações de celular do outro lado da sala degradam rápido.
  • Silêncios longos. Versões mais antigas do Whisper às vezes alucinam texto sobre o silêncio; fatiar o áudio (veja abaixo) evita isso na maior parte dos casos.

Esse último ponto importa se você está transcrevendo algo em que a precisão sustenta uma decisão. A saída do Whisper é um bom primeiro rascunho, não um registro oficial.

Por que o fatiamento importa em áudios longos

O Whisper processa janelas de 30 segundos. Cortar ingenuamente uma gravação longa em fatias de 30 segundos parte frases nas bordas e perde palavras. A correção são janelas sobrepostas — processa 30 segundos, avança 25, e reconcilia a sobreposição.

Qualquer ferramenta que preste faz isso por você. Se algum dia você vir uma transcrição em que palavras somem em intervalos suspeitosamente regulares, foi isso que deu errado.

Whisper no navegador vs. na API

Os dois rodam a mesma família de modelos. A diferença é onde o trabalho acontece e o que isso custa a você.

Navegador (WebAssembly)API hospedada
Seu áudioNunca sai do aparelhoEnviado a um terceiro
CustoGrátis, ilimitadoPor minuto de áudio
Espera na primeira vez~74 MB de download, uma vezNenhuma
Velocidade em arquivos longosLimitada pela sua CPUMuito mais rápida
Funciona offlineSim, após o primeiro carregamentoNão

A regra honesta: navegador para qualquer coisa sensível ou rotineira, API quando você tem horas de áudio e precisa disso pronto em minutos.

Quando não usar o Whisper

  • Você precisa de rótulos de locutor (“Locutor 1 / Locutor 2”). O Whisper sozinho não faz isso; é preciso uma etapa separada de diarização.
  • Você precisa de transcrições certificadas ou com validade jurídica. Essas exigem um transcritor humano, independentemente da qualidade do modelo.
  • Você precisa de legendas em tempo real durante uma chamada ao vivo. O Whisper foi feito para áudio gravado; legendagem ao vivo usa modelos de streaming construídos para isso.

Perguntas frequentes

Preciso de GPU? Não. WebAssembly roda na CPU. Existe um caminho por GPU via WebGPU, mas ele nem sempre é mais rápido ou mais confiável para modelos quantizados — algumas combinações produzem saída embaralhada, então muitas ferramentas ficam deliberadamente na CPU.

MacWhisper é a mesma coisa? O MacWhisper é um app nativo de macOS que embrulha o mesmo modelo. Se você vive num Mac e transcreve todo dia, é uma boa compra. Se você quer transcrever um arquivo sem instalar nada, uma ferramenta de navegador chega lá mais rápido.

Posso transcrever um vídeo do YouTube ou do Instagram? Não diretamente a partir de um link com uma ferramenta que só roda local — o modelo precisa de um arquivo de áudio. Salve o arquivo que você tem direito de usar e transcreva.

A versão grátis no navegador é pior que a API paga? Não em qualidade de modelo, no mesmo tamanho. Os serviços pagos estão vendendo velocidade e conveniência, não uma saída mais inteligente.

Mais guias