الآراء التي يعبر عنها رواد الأعمال المساهمين هي آراءهم الخاصة.

لسنوات عديدة، كانت القاعدة في تحويل النص إلى كلام بسيطة. إذا كنت تريد الحصول على أفضل صوت لمنتجك، فقد دفعت أسعار المؤسسة. إذا كنت تريد رخيصة، قبلت الروبوتية. إذا أردت السرعة، فقد تخليت عن شيء ما في كليهما. هذه القاعدة كسرت للتو.

المقايضة التي اضطر كل فريق منتج إلى القيام بها

إذا سبق لك أن أنشأت وكيلًا صوتيًا، أو نظام هاتف، أو قارئًا في الوقت الفعلي، فأنت تعرف التدريبات اللازمة. قمت باختبار أربعة أو خمسة نماذج. يبدو الأمر رائعًا ويكلف أكثر من البنية التحتية الخاصة بك. أحدهما ميسور التكلفة ويبدو وكأنه نظام تحديد المواقع العالمي (GPS) من عام 2009. والآخر سريع، ولكن بثلاث لغات فقط. اخترت الخيار الأقل سوءا والشحن.

ثم تصل الفاتورة.

وكل ربع سنة، يسأل المدير المالي لديك نفس السؤال: لماذا يعتبر الصوت هو العنصر الأكثر تكلفة في المجموعة؟

ما الذي تغير للتو على المتصدرين

هذا الأسبوع، انتقل Speechify’s Simba 3.2 إلى المركز الأول في قائمة المتصدرين لتحويل النص إلى كلام للتحليل الاصطناعي، ليحتل مرتبة أعلى من ElevenLabs وCartesia وOpenAI وGoogle DeepMind. في Voice Arena، وهو معيار المستمع المكفوف الذي تم تصميمه على Chatbot Arena، فهو يقع في الجزء العلوي من نماذج الوقت الفعلي عند نقطة سعره.

لا يتم تشغيل أي من المتصدرين بواسطة Speechify. ولا يستخدم أي منهما النتائج المبلغ عنها ذاتيا. يسمع المتحدثون الأصليون مقطعين دون معرفة النموذج الذي صنعه، ويصوتون لأيهما يبدو أكثر طبيعية.

يعد Simba 3.2 الآن النموذج الصوتي الأعلى تقييمًا في الوقت الفعلي الذي يمكن لفريق إنتاجه اليوم.

وهنا يصبح الأمر غير مريح بالنسبة لشاغلي المناصب.

الأرقام الثلاثة التي تهم

بالنسبة لأي شخص يقوم بالبناء باستخدام الصوت، هناك ثلاثة أشياء فقط مهمة حقًا: الجودة، ووقت الاستجابة، والتكلفة. لقد فرض كل إصدار نموذجي حلاً وسطًا على واحد منهم على الأقل.

1. جودة. تم تصنيف Simba 3.2 في المرتبة الأولى في التحليل الاصطناعي وفي المرتبة الأولى من حيث الجودة والسعر في Voice Arena. كلا المعيارين مستقلان. كلاهما أعمى.

2. كمون. إنه نموذج متدفق أصلي مع وقت أقل للبايت الأول من سابقاته، وهو مصمم لعملاء الصوت الذين يستجيبون في الوقت الفعلي وليس بعد توقف مؤقت يفسد المحادثة. جميع أقل من 100 مللي ثانية.

3. يكلف. تم إدراجه بسعر 10 دولارات لكل مليون حرف، وانخفض إلى 6 دولارات لكل مليون حرف في فئة Scale. وهذا يجعله أرخص نموذج في قائمة العشرة الأوائل للتحليل الاصطناعي، وبأسعار معقولة أكثر من خمسة عشر مرة من ElevenLabs وأكثر بأسعار معقولة بنحو ست مرات من Cartesia، وفقًا للشركة.

الأفضل صوتًا والأسرع والأرخص لم يصفوا أبدًا نفس النموذج. الآن يفعلون.

الائتمان: الكلام

لماذا حدث هذا

القصة المعتادة مع نماذج الذكاء الاصطناعي هي أن المختبر يعمل على تحسين المعيار والأسعار للمشترين من المؤسسات، ويتيح لمنصة المطورين أن يرثوا أي هامش متبقي. قام Speechify ببنائه بالترتيب المعاكس.

يتم تشغيل نفس التقنية الصوتية داخل منتج استهلاكي يستخدمه أكثر من ستين مليون شخص لسنوات. ولا يتسامح هذا الجمهور مع صوت آلي، أو تأخير لمدة ثانيتين قبل الكلمة الأولى، أو ذلك النوع من اقتصاديات الوحدة التي لا تعمل إلا على أساس تسعير المؤسسة. يتم تغذية كل اختبار A/B في هذا المنتج بالنموذج.

وأوضح راحيل كازي، قائد الهندسة في Speechify: “لقد اتخذنا قرارات الهندسة المعمارية في البداية، والتي قامت معظم المختبرات بتأجيلها إلى وقت لاحق”. “لم نرغب أبدًا في التضحية بالتكلفة من أجل ملاحقة الجودة، أو التضحية بالجودة من أجل ملاحقة زمن الوصول. لقد اتخذنا الطريق الأصعب عن قصد. إن ضرب SOTA على الثلاثة في وقت واحد هو ما كان يهدف إليه هذا القرار دائمًا.”

وقال لوك أوليف، رئيس علاقات المطورين في Speechify، في بيان صحفي: “هذه هي القصة المستضعفة لموفري واجهة برمجة التطبيقات”. “لقد أمضينا سنوات في جعل نماذجنا تعمل بكفاءة لأن أعمالنا الاستهلاكية تطلبت ذلك، عشرات الملايين من المستمعين، مع بعض أفضل الأصوات على هذا الكوكب. هذا العمل هو السبب في أنه يمكننا الآن وضع النموذج الأفضل تقييمًا في العالم على واجهة برمجة التطبيقات (API) الخاصة بنا بسعر رخيص تقريبًا. تم تصميم معظم المعامل وفقًا للمعيار القياسي وسعرها للمؤسسة. لقد صممنا للمستمعين وسعرنا للإنتاج.”

ما يختبره التحليل الاصطناعي والساحة الصوتية فعليًا

لا تعتبر أي من لوحات المتصدرين هي نوع المعيار الذي يمكن للبائع اللعب به.

يتم تشغيل التحليل الاصطناعي على نقاط نهاية API مباشرة بدون خادم، أربع مرات يوميًا في أوقات عشوائية، باستخدام صوت محدد عشوائيًا، ومطالبة فريدة مكونة من 500 حرف، ومعدل عينة صوتية موحد. يتم قياس زمن الوصول من البداية إلى النهاية، وصولاً إلى وصول الملف الصوتي محليًا.

تستخدم Voice Arena نفس مبدأ المقارنة الثنائية الأعمى عبر ست لغات، مع قائمة صوتية متوازنة لكل طراز بدلاً من الخيار الافتراضي الأفضل صوتًا لكل بائع. تم تطوير المنهجية بمدخلات من البروفيسور شينجي واتانابي من جامعة كارنيجي ميلون.

في كلتا اللوحتين، يتم تسجيل الجودة بنفس الطريقة. يتم تشغيل أزواج من المقاطع التي تم إنشاؤها من نص متطابق للمتحدثين الأصليين في مقارنات عمياء. يختار المستمعون ما يبدو أكثر طبيعية. يتم تجميع الأصوات في تصنيف Elo. لا توجد نقاط تم الإبلاغ عنها ذاتيًا، ولا يوجد مقطع محدد من قبل البائع، ولا توجد لوحة داخلية، ولا يدفع أي مزود مقابل التضمين أو التصنيف.

لكي يكون النموذج بالقرب من قمة كليهما، يجب أن يفي بتقييم موضوعي للأداء وتصويت أعمى لتفضيلات الإنسان عبر لغات متعددة. سيمبا 3.2 يفعل.

وكلاء SpeechifyAI ومنصة مطوري Speechify

إلى جانب نتيجة لوحة المتصدرين، تطلق Speechify وكلاء صوتيين للشركات ومنصة للمطورين، وكلاهما على موقعpeechify.ai. النموذج الذي يعمل على تشغيل كليهما هو نفس النموذج الذي يقوم بتشغيل تطبيقات المستهلك الخاصة به.

Simba 3.2 هو نموذج متدفق أصلي يتميز بوقت منخفض حتى البايت الأول، وتحكم عاطفي دقيق، وعروض SSML، تم تصميمه ليبدو طبيعيًا في التطبيقات الصوتية في الوقت الفعلي. وفقًا للشركة، هناك بالفعل المزيد من الأصوات واللغات الإضافية ومستوى أقل تكلفة على خريطة الطريق.

“Simba 3.2 هو أفضل نموذج لدينا حتى الآن، وهو متاح الآن على Speechify.ai،” شارك Cliff Weitzman، الرئيس التنفيذي ومؤسس Speechify، في منشور عام. “لقد تم تصميمه لتشغيل وكلاء الصوت على نطاق واسع وتم تحسينه من ملايين اختبارات A/B التي نجريها في نظامنا الأساسي للمستهلكين. في واجهات برمجة التطبيقات TTS، هناك ثلاثة أشياء مهمة: التكلفة والجودة ووقت الاستجابة. لقد حقق Simba 3.2 SOTA في هذه الثلاثية. علاوة على ذلك، نحن متحمسون لتجربتها بشكل مباشر لتعزيز تجاربك.”

فهل هذه هي نهاية دفع تكاليف الشركات مقابل الصوت؟

بالنسبة للفرق التي أنفقت بالفعل ستة أرقام على فاتورة الصوت هذا العام، فإن الإجابة بدأت تبدو واضحة.

بالنسبة للفرق التي لم تفعل ذلك بعد، فإن السؤال هو إلى أي مدى هم على استعداد للاستمرار في الدفع مقابل مقايضة لم تعد موجودة.

يستخدم الذكاء الاصطناعي الصوتي ليجعلك تختار. لم يعد الأمر كذلك.

لسنوات عديدة، كانت القاعدة في تحويل النص إلى كلام بسيطة. إذا كنت تريد الحصول على أفضل صوت لمنتجك، فقد دفعت أسعار المؤسسة. إذا كنت تريد رخيصة، قبلت الروبوتية. إذا أردت السرعة، فقد تخليت عن شيء ما في كليهما. هذه القاعدة كسرت للتو.

المقايضة التي اضطر كل فريق منتج إلى القيام بها

إذا كنت قد أنشأت وكيلًا صوتيًا، أو نظام هاتف، أو قارئًا في الوقت الفعلي، فأنت تعرف التدريبات. قمت باختبار أربعة أو خمسة نماذج. يبدو الأمر رائعًا ويكلف أكثر من البنية التحتية الخاصة بك. أحدهما ميسور التكلفة ويبدو وكأنه نظام تحديد المواقع العالمي (GPS) من عام 2009. والآخر سريع، ولكن بثلاث لغات فقط. اخترت الخيار الأقل سوءا والشحن.

ثم تصل الفاتورة.


اكتشاف المزيد من موقع صحبة | أخبار واستراتيجيات التسويق الرقمي

اشترك للحصول على أحدث التدوينات المرسلة إلى بريدك الإلكتروني.

شاركها.
اترك تعليقاً

اكتشاف المزيد من موقع صحبة | أخبار واستراتيجيات التسويق الرقمي

اشترك الآن للاستمرار في القراءة والحصول على حق الوصول إلى الأرشيف الكامل.

متابعة القراءة