Whisper es el motor de reconocimiento de voz de OpenAI, de código abierto y gratuito, que convierte audio en texto. Su gran baza es que puedes ejecutarlo en tu propio ordenador sin pagar nada y sin enviar tus grabaciones a la nube, algo que valoramos mucho cuando se trabaja con material sensible como entrevistas, reuniones o notas de voz personales.
¿Para qué sirve?
Resuelve el problema de transcribir audio de forma rápida y fiable, especialmente en español. En nuestras pruebas el nivel de precisión es de los mejores que hemos visto: aguanta bien el ruido de fondo, los acentos, las muletillas e incluso audios de baja calidad. Además entiende el contexto, lo que le ayuda a deducir palabras ambiguas, y puntúa de forma sorprendentemente natural en lugar de soltar un bloque de texto sin pausas.
Los casos de uso reales son muchos: transcribir entrevistas de periodistas o investigadores, sacar texto de podcasts y vídeos para subtítulos, pasar a limpio reuniones, o simplemente dictar notas. Como es un modelo abierto, también es la base sobre la que funcionan montones de aplicaciones de terceros, así que aunque no lo instales tú directamente, es muy probable que lo estés usando dentro de otra herramienta.
Precio y para quién merece la pena
Whisper es gratis y de código abierto: en local no tiene coste alguno más allá de la potencia de tu equipo. La contrapartida es que no existe una interfaz web oficial cómoda en la nube; para usarlo hay que instalar programas o scripts (en Mac, por ejemplo, aplicaciones como MacWhisper lo hacen muy sencillo) o recurrir a servicios externos que sí cobran por darte ese envoltorio amigable.
Por eso lo recomendamos sobre todo a quien transcribe en español con cierta frecuencia y no quiere pagar suscripciones, y a perfiles algo técnicos cómodos instalando software. Si buscas abrir una pestaña y subir un audio sin más, quizá te encaje mejor una solución comercial que use Whisper por debajo. Pero en relación calidad-precio, es difícil de batir.