- Whistle es un modelo que convierte la voz en texto y, según su desarrollador Cactus, un archivo ocupa 16.9MB. El texto original explica que funciona en CPU sin dependencias adicionales.
- Admite 7 idiomas, entre ellos inglés, alemán, francés, español, italiano, neerlandés y polaco, y puede procesar hasta 30 segundos a la vez. Si no se especifica un idioma, lo detecta automáticamente.
- Ofrece tiempos de inicio y fin y una probabilidad para cada palabra. Según el texto, pasar expresiones como nombres mediante keywords aumenta la probabilidad de que esas expresiones se elijan durante la búsqueda.
- Las cifras de rendimiento son resultados medidos por el desarrollador. En una CPU Apple M4 Pro, con 10 segundos de audio y un tamaño de haz de 5, el tiempo del primer token fue de 11.1 ms, y en las mismas condiciones Whisper base se midió en 73.2 ms.
- La precisión varía según el conjunto de pruebas. El texto original indica que Whistle supera en promedio a LibriSpeech, SPGISpeech, Earnings-22 y FLEURS, mientras que Whisper base supera en promedio a TED-LIUM, AMI y MLS.
Lo primero que llama la atención es la afirmación de que Whisper base superó en el promedio de TED-LIUM, AMI y MLS. La diferencia de velocidad medida con el mismo audio de 10 segundos también son cifras publicadas por el desarrollador, así que habría que comprobar por separado cómo se nota en dispositivos reales. Me pregunto si, al guardar una grabación de reunión como WAV de 16kHz y ejecutar la versión instalada con pip, el resultado se sostiene incluso cuando hay coreano mezclado.