» هوش مصنوعی و رباتیک » ElevenLabs از مدل‌های صوتی جدید v4 با پشتیبانی از ۹۰ زبان رونمایی کرد [تماشا کنید]

ElevenLabs از مدل‌های صوتی جدید v4 با پشتیبانی از ۹۰ زبان رونمایی کرد [تماشا کنید]

مهر ۷, ۱۴۰۵ 008

استارتاپ ElevenLabs دو مدل گفتاری جدید با نام‌های ElevenLabs v4 و v4 Turbo معرفی کرده است. در این مدل‌های صوتی جدید، قابلیت‌های کنترل بیان و احساسات گسترش پیدا کرده‌اند، تأخیر زمانی مربوط به ایجنت‌های صوتی (Voice Agents) به‌طرز چشمگیری کاهش پیدا کرده و امکان پشتیبانی از بیش از ۹۰ زبان مختلف را فراهم می‌کنند.

ElevenLabs برای توسعه نسل مدل‌های v4 از معماری جدیدی بهره گرفته است که امکان کنترل بهتر و شبیه‌سازی سریع‌تر صدا را فراهم می‌کند. براساس اعلام این شرکت، کاربران در مدل صوتی v4 می‌توانند تنها با استفاده از ۱۰ ثانیه فایل صوتی، یک صدا را به‌طور کامل شبیه‌سازی یا کلون کنند.

ارتقای مدل صوتی ElevenLabs v4 برای کاربردهای خلاقانه و سازمانی

از دیدگاه خلاقانه، مدل جدید هویت صدا را در قطعات متنی طولانی‌تر بسیار بهتر حفظ می‌کند. این سیستم همچنین هنگام خواندن متن با صدای بلند، زمینه و مفهوم متن را در نظر می‌گیرد تا حالت‌ها و احساسات بیانی خود را متناسب با آن تغییر دهد. شرکت ElevenLabs همراه با مدل v3 برچسب‌های درون‌متنی را برای تعیین لحن و بیان معرفی کرده بود و اکنون در نسخه v4 این تگ‌ها را گسترش داده است؛ به‌طوری‌که کاربران می‌توانند چندین تگ بیانی را پشت سر هم قرار دهند تا مدل دقیقاً توالی آنها را دنبال کند.

بر اساس آزمون مقایسه‌ای انجام‌شده میان کاربران، مدل جدید ElevenLabs v4 از نظر میزان بیان احساسات و لحن طبیعی برتری محسوسی نسبت به رقبای سرشناس بازار کسب کرده است. در این ارزیابی، مدل v4 توانسته در برابر Cartesia Sonic 3.6 و Inworld TTS-2 با کسب ۸۱ درصد ترجیح کاربران در هر کدام به پیروزی دست یابد؛ همچنین در رقابت با مدل‌های تبدیل متن به گفتار گوگل، ۶۵ درصد ترجیح کاربران را در برابر Google Gemini 3.8 Flash TTS و ۷۲ درصد ترجیح را در مقایسه با نسخه Google Gemini 3.8 Flash-Lite TTS از آن خود کرده است.

ElevenLabs از مدل‌های صوتی جدید v4 با پشتیبانی از ۹۰ زبان رونمایی کرد [تماشا کنید]
ElevenLabs از مدل‌های صوتی جدید v4 با پشتیبانی از ۹۰ زبان رونمایی کرد [تماشا کنید]

نسخه قبلی از ۷۰ زبان پشتیبانی می‌کرد، اما در مدل جدید این عدد به بیش از ۹۰ زبان رسیده است. این شرکت اعلام کرده که بیشترین رشد کیفی در زبان‌های ژاپنی، پرتغالی برزیلی، ماندارین و کانتونی مشاهده شده است. بخش تماس‌های سازمانی ElevenLabs در طول سال گذشته رشد سریعی را تجربه کرده و بیش از ۵۵ درصد از تجارت آن به شرکت‌های بزرگ اختصاص یافته است. این استارتاپ تأکید دارد که نسخه v4 گزینه‌ای بسیار مناسب برای ایجنت‌های صوتی است، زیرا تأخیر کمتری دارد و گفت‌وگوهای روان‌تری را شکل می‌دهد.

علاوه‌براین، مدل v4 می‌تواند به‌محض شروع تولید پاسخ توسط مدل زبانی بزرگ متصل به آن، فرایند تبدیل پاسخ به صوت را آغاز کند. همچنین، این سیستم توانایی مدیریت برخوردهای کلامی، تنش‌ها و زمان‌های انتظار را برای حل بهتر مشکلات در تماس‌ها دارد.

رقابت در حوزه مدل‌های گفتاری با حضور استارتاپ‌هایی نظیر Cartesia ،Deepgram ،Fish Audio ،Boson و WellSaid Labs که همگی مدل‌های صوتی با قابلیت انتقال احساسات توسعه داده‌اند، شدت پیدا کرده است. از سوی دیگر، غول‌های فناوری نظیر گوگل و OpenAI نیز مدل‌های صوتی خود را ارتقا داده‌اند. استارتاپ ElevenLabs اوایل امسال موفق به جذب سرمایه ۵۰۰ میلیون دلاری از شرکت Sequoia با ارزش‌گذاری ۱۱ میلیارد دلار شد. همچنین شایعاتی درباره دور بعدی جذب سرمایه با ارزش‌گذاری ۲۲ میلیارد دلاری مطرح شده است. درآمد سالانه شرکت نیز از حدود ۳۳۰ میلیون دلار در ابتدای سال به بیش از ۶۰۰ میلیون دلار افزایش پیدا کرده است.

به این نوشته امتیاز بدهید!

دیدگاهتان را بنویسید

نشانی ایمیل شما منتشر نخواهد شد. بخش‌های موردنیاز علامت‌گذاری شده‌اند *

  • ×