- Whistle نموذج يحوّل الكلام إلى نص، وبحسب الشركة المطورة Cactus يبلغ حجم الملف الواحد 16.9MB. يوضح النص الأصلي أنه يعمل على وحدة المعالجة المركزية CPU دون اعتماديات منفصلة.
- يدعم 7 لغة، منها الإنجليزية والألمانية والفرنسية والإسبانية والإيطالية والهولندية والبولندية، ويمكنه معالجة ما يصل إلى 30 ثانية في المرة الواحدة. وإذا لم تُحدد لغة، فإنه يكتشفها تلقائيا.
- يوفر وقت البداية والنهاية واحتمالية لكل كلمة. ويُقال إن تمرير تعبيرات مثل الأسماء عبر keywords يرفع احتمال اختيار هذه التعبيرات أثناء البحث.
- أرقام الأداء نتائج قاسها المطور. على وحدة المعالجة المركزية Apple M4 Pro، ومع 10 ثانية من الصوت وحجم شعاع بحث 5، بلغ زمن الرمز الأول 11.1 ملي ثانية، وقورن Whisper base تحت الشروط نفسها بزمن 73.2 ملي ثانية.
- تختلف الدقة حسب المعيار. يذكر النص الأصلي أن Whistle يتفوق في متوسط LibriSpeech وSPGISpeech وEarnings-22 وFLEURS، بينما يتفوق Whisper base في متوسط TED-LIUM وAMI وMLS.
أول ما يلفت الانتباه هو الادعاء بأن Whisper base تفوق في متوسط TED-LIUM وAMI وMLS. كما أن فارق السرعة المقاس على نفس الصوت البالغ 10 ثانية أرقام نشرها المطور، لذلك يلزم التحقق بشكل منفصل من مدى ملاحظته على الأجهزة الفعلية. أتساءل عما إذا كانت الصورة ستتضح عند حفظ تسجيل اجتماع واحد بصيغة WAV بتردد 16kHz وتشغيله بالنسخة المثبتة عبر pip، حتى عندما يختلط فيه الكوري.