Skip to content

Usa OpenAI Whisper Online — Sin Instalar Nada

Actualizado

OpenAI Whisper es un modelo de reconocimiento de voz. Le das audio y te devuelve texto. Es el modelo que la mayoría de los servicios de transcripción ejecuta silenciosamente por debajo, incluidos varios que cobran por minuto por ello.

La queja habitual es que usarlo por tu cuenta implica instalar Python, luego ffmpeg, luego PyTorch, y descubrir después que tu portátil no tiene CUDA. Esta guía se salta todo eso: Whisper puede ejecutarse directamente en una pestaña del navegador.

Qué es Whisper en realidad

Whisper se entrenó con unas 680.000 horas de audio multilingüe. Esa escala explica por qué maneja acentos, ruido de fondo y cambios de idioma mejor que los motores de voz anteriores. Viene en varios tamaños, y el tamaño que elijas es el principal equilibrio entre calidad y velocidad que está en tus manos.

ModeloParámetrosTamaño aprox. (cuantizado)Dónde tiene sentido
tiny39M~15 MBBorradores rápidos, audio limpio, equipos flojos
base74M~73 MBInglés, español, francés, alemán, neerlandés
small244M~237 MBTodo lo demás — y no es opcional
medium / large769M–1,5B1–3 GBEn la práctica, solo del lado del servidor

El consejo corriente es que “base es el punto dulce para navegadores”. Eso vale para el inglés y es rotundamente falso para la mayoría de los demás idiomas. Tasas de error de palabra medidas sobre el mismo contenido grabado:

Idiomabasesmall
Español0,0%0,0%
Francés0,0%0,0%
Neerlandés3,7%3,7%
Alemán4,2%0,0%
Portugués6,7%4,4%
Coreano8,5%4,3%
Chino11,2%0,0%
Japonés11,5%1,6%
Vietnamita16,0%2,0%
Ruso24,1%3,4%
Polaco30,0%0,0%
Sueco45,0%5,0%
Turco60,0%26,7%

El polaco es el caso que hay que recordar. Es un idioma europeo en alfabeto latino, así que la intuición lo archiva junto al español y el francés — y marca 30%, en la misma liga que el ruso. El sueco es aún peor: 45% en base, 5% en small. Esto no se puede predecir por la familia lingüística ni por el sistema de escritura. O lo mides, o usas small por defecto para todo lo que no sea inglés.

La consecuencia práctica: una herramienta de navegador que usa base para todo está sirviendo transcripciones rotas a la mayor parte del mundo en silencio — y esas transcripciones se leen bien.

Ejecutarlo sin instalar nada

Whisper se ha compilado a WebAssembly, lo que significa que el modelo puede ejecutarse dentro del propio sandbox del navegador. No se sube nada: el audio se decodifica localmente, se le pasa al modelo localmente, y el texto vuelve localmente.

Las consecuencias prácticas:

  • La primera ejecución es lenta. El modelo tiene que descargarse una vez (unos 74 MB para base). Después queda en caché y arranca de inmediato.
  • Las ejecuciones posteriores funcionan sin conexión. Una vez en caché, puedes transcribir en un avión.
  • No hay coste por minuto, porque nadie está pagando un servidor para hacer el trabajo.
  • Los archivos largos dependen de tu RAM, no del límite de subida de nadie.

Si quieres probarlo ahora mismo, la página de audio a texto hace exactamente esto: elige un archivo y el modelo se carga en el primer uso.

Tienes que indicarle el idioma — y por qué eso importa

Whisper como modelo puede detectar el idioma. Varias implementaciones de Whisper no lo hacen, y la diferencia no es académica.

El runtime de navegador más usado para Whisper (transformers.js) tiene esto en su código fuente, en la función que arma los tokens iniciales del decodificador:

if (!language) {
    // TODO: Implement language detection
    language = 'en';
}

Si no se le pasa idioma, no adivina: fija inglés. Dale mandarín y el modelo recibe la instrucción de producir inglés a partir de audio en chino. No da error. No devuelve vacío. Inventa un inglés fluido:

Hablado (mandarín): 快速快放。今天的会议记录需要整理成文字。 Salida: “The fast-food delivery of the product is now available for the customer.”

Esa salida no es una traducción — una traducción al menos conservaría el sentido. Es confabulación, y es el peor modo de fallo que tiene una herramienta de transcripción, porque nada en el resultado parece incorrecto. Sin aviso, sin caracteres corrompidos, sin puntuación de confianza. Solo una frase limpia en inglés que nadie dijo.

Así que: si una herramienta de transcripción no te pregunta en qué idioma está el audio, averigua qué hace cuando le das algo que no es inglés antes de confiarle nada que importe.

Dos situaciones que conviene conocer incluso cuando sí fijas el idioma:

  • Cambio intenso de idioma. Un solo token de idioma gobierna todo el archivo. Una grabación que alterna entre dos idiomas cada pocas frases será forzada hacia uno de ellos.
  • La salida en chino usa caracteres tradicionales por defecto. Si necesitas simplificado, la conversión tiene que ocurrir después de transcribir. Intentar dirigirlo con un prompt inicial te cuesta contenido: en pruebas, un prompt que sí empujó la salida a simplificado también perdió el 32% de las palabras.

Qué precisión tiene realmente

Con voz limpia, un solo hablante y ritmo normal, base suele quedar cerca de lo literal — lo bastante bueno para que editar sea más rápido que escribir desde cero. La precisión cae de formas bastante predecibles:

  • Hablantes superpuestos. Whisper produce un único flujo de texto, así que dos personas hablando a la vez se mezclan. No trae diarización de hablantes.
  • Nombres propios y jerga. Nombres, nombres de producto y términos técnicos son los errores más comunes. Whisper adivina una palabra plausible en vez de dejar un hueco, así que esos errores se leen con aplomo.
  • Audio muy ruidoso o lejano. Las grabaciones de móvil desde el otro lado de la sala se degradan rápido.
  • Silencios largos. Las versiones antiguas de Whisper a veces alucinan texto sobre el silencio; trocear el audio (más abajo) lo evita casi siempre.

Ese último punto importa si transcribes algo donde la precisión sostiene una decisión. La salida de Whisper es un buen primer borrador, no un acta oficial.

Por qué el troceado importa en audios largos

Whisper procesa ventanas de 30 segundos. Cortar ingenuamente una grabación larga en trozos de 30 segundos parte frases en los bordes y pierde palabras. La solución son ventanas solapadas: procesa 30 segundos, avanza 25 y reconcilia el solape.

Cualquier herramienta que valga la pena hace esto por ti. Si alguna vez ves una transcripción donde las palabras desaparecen a intervalos sospechosamente regulares, eso es lo que falló.

Whisper en el navegador frente a la API

Ambos ejecutan la misma familia de modelos. La diferencia es dónde ocurre el trabajo y qué te cuesta.

Navegador (WebAssembly)API alojada
Tu audioNunca sale del dispositivoSe sube a un tercero
CosteGratis, ilimitadoPor minuto de audio
Espera la primera vez~74 MB de descarga, una vezNinguna
Velocidad en archivos largosLimitada por tu CPUMucho más rápida
Funciona sin conexiónSí, tras la primera cargaNo

La regla honesta: navegador para cualquier cosa sensible o rutinaria, API cuando tienes horas de audio y lo necesitas en minutos.

Cuándo no deberías usar Whisper

  • Necesitas etiquetas de hablante (“Hablante 1 / Hablante 2”). Whisper por sí solo no lo hace; hace falta un paso aparte de diarización.
  • Necesitas transcripciones certificadas o con validez legal. Esas requieren un transcriptor humano, sin importar la calidad del modelo.
  • Necesitas subtítulos en tiempo real durante una llamada en directo. Whisper está pensado para audio grabado; los subtítulos en vivo usan modelos de streaming hechos para eso.

Preguntas frecuentes

¿Necesito GPU? No. WebAssembly se ejecuta en la CPU. Existe una vía por GPU con WebGPU, pero no siempre es más rápida ni más fiable con modelos cuantizados — algunas combinaciones producen salida corrompida, así que muchas herramientas se quedan deliberadamente en CPU.

¿MacWhisper es lo mismo? MacWhisper es una app nativa de macOS que envuelve el mismo modelo. Si vives en un Mac y transcribes a diario, es una buena compra. Si quieres transcribir un archivo sin instalar nada, una herramienta de navegador te lleva allí antes.

¿Puedo transcribir un vídeo de YouTube o Instagram? No directamente desde un enlace con una herramienta que solo funciona en local: el modelo necesita un archivo de audio. Guarda el archivo que tengas derecho a usar y transcríbelo.

¿La versión gratuita del navegador es peor que la API de pago? No en calidad de modelo, al mismo tamaño. Los servicios de pago te venden velocidad y comodidad, no una salida más inteligente.

Más guías