با ما همراه باشید

تکنولوژی

متا از مدل تبدیل صوت به متن Muse رونمایی کرد؛ تشخیص همزمان چند گوینده و زبان

مدل جدید Muse Voice Transcribe می‌تواند گفتار بیش از ۲۰ نفر و بیش از ۲۰ زبان را به‌صورت هم‌زمان رونویسی کند.

منتشر شده

در

متا مدل جدیدی برای رونویسی لحظه‌ای صدا با نام Muse Voice Transcribe معرفی کرد که به گفته این شرکت می‌تواند گفتار بیش از ۲۰ گوینده را تشخیص دهد و هم‌زمان با چند زبان کار کند. این مدل همچنین می‌تواند هنگام تغییر زبان در میانه جمله، زبان‌های مختلف را تشخیص دهد و متن را بر همان اساس رونویسی کند.

Muse Voice Transcribe اولین مدل پردازش صوتی بلادرنگ متا است و برای تبدیل گفتار به متن در حالت استریم طراحی شده است. این مدل قابلیت‌هایی مانند تفکیک گویندگان و تشخیص زمان پایان گفتار را در یک مدل واحد ارائه می‌کند.

مدل تبدیل گفتار به متن متا: Muse Voice Transcribe

«مارک زاکربرگ»، مدیرعامل متا، نمونه‌ای از عملکرد این مدل را در شبکه اجتماعی ایکس منتشر کرده است. در این ویدیو، سیستم می‌تواند چند گوینده را از یکدیگر تشخیص دهد و هنگام صحبت‌کردن افراد به زبان‌های مختلف، زبان گفتار را به‌صورت خودکار تغییر دهد.

این مدل همچنین از قابلیتی موسوم به تغییر زبانی پشتیبانی می‌کند؛ به این معنا که اگر فردی در یک جمله از واژه‌های چند زبان استفاده کند، سیستم می‌تواند این تغییر را تشخیص دهد و جمله را رونویسی کند.

زاکربرگ درباره نحوه عملکرد مدل توضیح داده است: «مدل تصمیم می‌گیرد چه زمانی گوش بدهد. برای واژه‌های دشوار کمی بیشتر صبر می‌کند و برای واژه‌های ساده سریع‌تر نتیجه را ثبت می‌کند.» به گفته او، این فرایند با استفاده از تأخیر تطبیقی انجام می‌شود تا مدل بتواند توکن بعدی را پیش‌بینی و دقت رونویسی را افزایش دهد.

زاکربرگ همچنین گفته است مدل برای کار با صدای واقعی و نامنظم آموزش دیده و با بیش از ۷۰ زبان آموزش داده شده است. به گفته او، Muse Voice Transcribe می‌تواند جلسات صوتی تا یک ساعت را با بیش از ۲۰ گوینده مدیریت کند.

متا از مدل تبدیل صوت به متن Muse رونمایی کرد؛ تشخیص همزمان چند گوینده و زبان
متا از مدل تبدیل صوت به متن Muse رونمایی کرد؛ تشخیص همزمان چند گوینده و زبان

متا معرفی Muse Voice Transcribe را کمتر از یک هفته پس از معرفی مدل صوتی Gemini 3.5 Transcribe گوگل انجام داده است. گوگل قصد دارد مدل صوتی خود را در اندروید و در آینده در مرورگر کروم ادغام کند، اما هنوز مشخص نیست متا چه برنامه‌ای برای استفاده از Muse Voice Transcribe در سرویس‌های اصلی خود دارد.

درحال‌حاضر، کاربران می‌توانند قابلیت‌های این مدل را در اپلیکیشن دسکتاپ Meta AI برای مک تجربه کنند. این مدل برای توسعه‌دهندگان نیز از طریق Muse Code و Model API متا در دسترس است. هزینه استفاده از API برابر با ۳ دلار به ازای هر هزار دقیقه صوت اعلام شده است.

ادامه مطلب
برای افزودن دیدگاه کلیک کنید

یک پاسخ بگذارید

نشانی ایمیل شما منتشر نخواهد شد. بخش‌های موردنیاز علامت‌گذاری شده‌اند *

اقتصاد پولی مالی24 ثانیه پیش

درهم امارات علیه میانجیگران

اقتصاد پولی مالی1 دقیقه پیش

اکسیر نفت، مس را سبز کرد

تکنولوژی58 دقیقه پیش

دادستان بریتیش کلمبیا از OpenAI به دلیل نقش ChatGPT در تیراندازی تامبلر ریج شکایت کرد

تکنولوژی58 دقیقه پیش

عرضه Muse متا نشان داد: ایجنت‌ها می‌توانند تقاضا برای CPU را به‌شدت افزایش دهند

تکنولوژی58 دقیقه پیش

سیستم هوش مصنوعی FAA برای کمک به کنترل ترافیک هوایی آمریکا راه‌اندازی شد

عراقچی: مصمم بر دفاع از حاکمیت و منافع ملی خود هستیم
سیاسی و اجتماعی2 ساعت پیش

عراقچی: مصمم بر دفاع از حاکمیت و منافع ملی خود هستیم

پایان فرصت طلایی واشنگتن در تهران؛ هرمز در گرو عمل به شروط ایران
سیاسی و اجتماعی2 ساعت پیش

پایان فرصت طلایی واشنگتن در تهران؛ هرمز در گرو عمل به شروط ایران

سینمای ایران و جهان3 ساعت پیش

مهیار علیزاده با «ریشه‌بُر» متفاوت‌ترین تجربه تئاتری‌اش را به کاخ هنر می‌آورد

سینمای ایران و جهان3 ساعت پیش

«اتاق دود» درباره نسبت هنرمند با جامعه است / نگران پر کردن سالن نیستیم

دیپلماسی ترانزیت و معامله گاز؛سناریوهای دستیابی به تجارت ۳ میلیارد دلاری ایران و ترکمنستان
صنعت و خدمات4 ساعت پیش

دیپلماسی ترانزیت و معامله گاز؛سناریوهای دستیابی به تجارت ۳ میلیارد دلاری ایران و ترکمنستان

جدیدترین اخبار پربحث

خبر مهم اخیر

«مجله فان فارسی» از سال ۱۳۹۰ مجله‌ای در حوزه سرگرمی، سبک زندگی، سفر و فرهنگ روزمره است که با انتشار محتوای جذاب و الهام‌بخش، تجربه‌های زندگی شهری، تفریح، هنر و لحظه‌های خوش را برای مخاطبان روایت می‌کند. کپی بخش یا کل هر کدام از مطالب "فان فارسی" تنها با کسب مجوز مکتوب امکان پذیر است.