مدل متن‌باز Magpie TTS انویدیا با ۳۶۴ میلیون پارامتر و پشتیبانی از دوازده زبان، امکان ساخت عامل‌های صوتی چندزبانه با کنترل کامل بر استقرار و تأخیر را روی زیرساخت خودتان فراهم می‌کند. در هر تعامل صوتی، یک بودجهٔ تأخیر محدود وجود دارد؛ تبدیل متن به گفتار (TTS) آخرین مرحلهٔ این خط لوله است و همان مرحله‌ای که کاربر بیش از همه متوجه آن می‌شود. هرچه بخش بیشتری از این خط لوله را خودتان اجرا و تنظیم کنید، بودجهٔ تأخیر بیشتری پس می‌گیرید.

هوش مصنوعی صوتی به‌سرعت در حال پیشرفت است. مدل‌های گفتاری یکپارچه سادگی ارائه می‌دهند — یک فراخوانی API، ورودی صدا، خروجی صدا — اما توانایی تنظیم دقیق هر جزء، تعویض مدل‌های بهتر هنگام انتشار و درک دقیق منشأ تأخیر را از دست می‌دهند. برای کنترل بیشتر، یک معماری آبشاری متشکل از اجزای ASR، TTS و LLM هدفمند، هر لایه را به‌طور مستقل قابل تنظیم و قابل استقرار روی زیرساخت شما نگه می‌دارد.

یک مدل باز برای دوازده زبان

Magpie TTS Multilingual مدلی با وزن‌های باز و ۳۶۴ میلیون پارامتر است که دوازده زبان را پشتیبانی می‌کند: انگلیسی، اسپانیایی، فرانسوی، آلمانی، ایتالیایی، ویتنامی، ماندارین، هندی، ژاپنی و سه زبان تازه‌افزوده یعنی عربی استاندارد مدرن، کره‌ای و پرتغالی برزیلی. هر زبان شامل صدای گویندهٔ مرد و زن از طریق یک بازنمایی چندزبانهٔ مشترک است.

این نسخه همچنین پشتیبانی از تعویض کد (code-switching) را برای هندی و ژاپنی بهبود داده است؛ قابلیتی که از طریق پردازش گرافم-به-فونم IPA و واژه‌نامه‌های تلفظ سفارشی فراهم شده و تلفظ دقیق نام‌ها، اصطلاحات فنی و محتوای چندزبانه را آسان‌تر می‌کند. به‌جای نگه‌داشتن مدل‌های جداگانه برای هر منطقه، توسعه‌دهندگان می‌توانند اپلیکیشن چندزبانه را روی یک پایهٔ باز واحد بسازند.

تأخیری که کاربر واقعاً متوجه آن می‌شود

در هوش مصنوعی مکالمه‌ای، تبدیل متن به گفتار آخرین مرحله پیش از شنیدن پاسخ است؛ به همین دلیل «زمان تا نخستین صدا» (TTFA) یکی از مهم‌ترین معیارهای تأخیر در خط لولهٔ صوتی است. چون Magpie TTS داخل محیط خود شما مستقر می‌شود، تأخیری که اندازه می‌گیرید همان تأخیر سمت سروری است که خودتان کنترل می‌کنید و هیچ رفت‌وبرگشت سرویس مدیریت‌شده‌ای در عدد وجود ندارد.

طبق مستندات عملکرد NVIDIA TTS NIM، این مدل روی پردازندهٔ گرافیکی B200 به نخستین صدا در ۳۲ میلی‌ثانیه می‌رسد و روی A100 این عدد ۷۹ میلی‌ثانیه است. این یعنی بقیهٔ بودجهٔ تأخیر برای پردازش ASR و LLM باقی می‌ماند و کل تأخیر انتها-به-انتها را در پنجرهٔ زیر ۲۰۰ میلی‌ثانیه‌ای نگه می‌دارد که مکالمهٔ طبیعی به آن نیاز دارد. در بار هم‌زمان ۶۴ استریم، B200 همچنان با توان عملیاتی حدود ۳۲۰ برابر زمان واقعی تولید می‌کند. نکتهٔ مهم آن است که این اعداد روی NVIDIA NIM اندازه‌گیری شده‌اند — کانتینر بهینه‌شده‌ای که روی GPU خودتان اجرا می‌شود — و چک‌پوینت باز روی Hugging Face همان مدل است، برای پژوهش و تنظیم دقیق.

معماری‌ای که برای زمان واقعی بهینه شده است

تأخیر کم تصادفی نیست. Magpie دو بهبود معماری مکمل را معرفی می‌کند که زمان استنتاج را کاهش می‌دهند و کیفیت گفتار را حفظ می‌کنند. نخست «انباشت قاب» (frame stacking) است که در هر گام رمزگشایی به‌جای یک قاب صوتی، دو قاب پیش‌بینی می‌کند و تعداد تکرارهای رمزگشا را نصف می‌کند. دوم «ترنسفورمر محلی» است که وابستگی‌های میان توکن‌های کدبوکِ هم‌زمان تولیدشده را مدل می‌کند و کیفیتی را که انباشت قاب به‌تنهایی از دست می‌دهد، بازمی‌گرداند. این معماری در مقالهٔ «Frame-Stacked Local Transformers for Efficient Multi-Codebook Speech Generation» (ICASSP 2026) توصیف شده است.

سرعت تنها در صورتی معنا دارد که گفتار طبیعی باشد. این نسخه علاوه بر افزودن زبان‌ها، کیفیت سنتز را هم بهبود داده است؛ برای مثال نرخ خطای کاراکتر (CER) فرانسوی از ۲.۷۰ به ۱.۵۴ درصد و شباهت گوینده (SSIM) اسپانیایی از ۰.۷۱۵ به ۰.۷۹۳ رسیده است. هرچند معیارهای عینی به سنجش پیشرفت کمک می‌کنند، کیفیت گفتار در نهایت ادراکی است و انویدیا پیشنهاد می‌کند نتیجه را در دموی Hugging Face یا NVIDIA Build شخصاً بشنوید.

چرا وزن‌های باز اهمیت دارند

تأخیری که بتوانید اندازه بگیرید مفید است، اما تأخیری که بتوانید کنترل کنید بهتر است. وزن‌های باز، قابلیت‌هایی به توسعه‌دهنده می‌دهند که از مالکیت استقرار ناشی می‌شود: اجرا کاملاً درون زیرساخت خودتان (از جمله محیط‌های خصوصی یا ایزوله)، مالکیت کامل بودجهٔ تأخیر بدون رفت‌وبرگشت سرویس مدیریت‌شده، سفارشی‌سازی تلفظ و صداها با NeMo، مقیاس‌پذیری بر اساس زیرساخت خودتان، و حفظ کنترل سازمانی بر مکالمات حساس. برای کسب‌وکارهایی که عامل صوتی تولیدی می‌سازند، این کنترل بر استقرار، عملکرد و سفارشی‌سازی اغلب مهم‌ترین عامل است.

هوش مصنوعی صوتی در عمل یک سیستم از مدل‌هاست، نه یک مدل واحد. Magpie TTS بخشی از مثال توسعه‌دهندهٔ «عامل صوتی Nemotron» انویدیاست که نشان می‌دهد مدل‌های گفتار، زبان و استدلال هدفمند چگونه به‌عنوان یک سیستم هماهنگ کار می‌کنند. توسعه‌دهندگان می‌توانند Nemotron Speech برای تشخیص گفتار جریانی، Magpie TTS برای سنتز چندزبانه و مدل‌های زبانی و چندوجهی برای استدلال و فراخوانی ابزار را با هم ترکیب کنند.

نکات کلیدی Magpie TTS

  • دوازده زبان با وزن‌های باز: ۳۶۴ میلیون پارامتر، شامل سه زبان تازهٔ عربی، کره‌ای و پرتغالی برزیلی.
  • تأخیر کنترل‌شده: نخستین صدا در ۳۲ میلی‌ثانیه روی B200، بدون رفت‌وبرگشت سرویس مدیریت‌شده.
  • دو بهبود معماری: انباشت قاب و ترنسفورمر محلی، سرعت و کیفیت را هم‌زمان حفظ می‌کنند.
  • کیفیت ادراکی در کنار معیار عینی: CER و SSIM بهبود یافته‌اند، اما شنیدن خروجی همچنان توصیه می‌شود.
  • کنترل سازمانی: استقرار در محیط ایزوله و نگه‌داشتن داده‌های مشتری داخل زیرساخت خودتان.

در نهایت، Magpie TTS یک راه میان دو سر طیف است: سادگی مدل‌های گفتاری یکپارچه و کنترل کامل یک معماری آبشاری. اگر تیم شما روی سخت‌افزار خودش عامل صوتی چندزبانه می‌سازد و بودجهٔ تأخیر برایش حیاتی است، وزن‌های باز این مدل مسیر مستقیمی به بهینه‌سازی و سفارشی‌سازی می‌دهد؛ کافی است پیش از هر تصمیم، عملکرد را روی سخت‌افزار واقعی خودتان بنچمارک کنید، نه اعداد اعلام‌شدهٔ عمومی.

سوالی دربارهٔ این موضوع داری؟از چت‌بات همر بپرس تا بر اساس بازار ایران راهنماییت کند.
پرسیدن از همر
منبع اصلی: NVIDIA