**متا از مدل جدید رونویسی صوتی خود با نام Muse Voice Transcribe رونمایی کرد**
براساس گزارشهای منتشرشده، شرکت متا در جدیدترین اعلام خود از مدل رونویسی صوتی Muse Voice Transcribe پردهبرداری کرد. این مدل قادر است گفتار بیش از ۲۰ گوینده را به طور همزمان شناسایی کرده و به چند زبان مختلف پاسخ دهد. یکی از ویژگیهای خاص این مدل توانایی تشخیص زبان در حین تغییر آن در میانهی جملات است.
مدل Muse Voice Transcribe بهعنوان اولین مدل پردازش صوتی بلادرنگ متا طراحی شده و وظیفه تبدیل گفتار به متن در حالت استریم را بر عهده دارد. این مدل همچنین قابلیت تفکیک گویندگان و شناسایی پایان جملات را در یک ساختار واحد ارائه میدهد.
مدیرعامل متا، مارک زاکربرگ، نمونهای از کارایی این مدل را در شبکه اجتماعی ایکس منتشر کرده است که در آن سیستم توانسته چند گوینده را از یکدیگر متمایز کند و بهطور خودکار زبان گفتار را تغییر دهد.
این مدل از قابلیت تغییر زبانی نیز بهرهمند است، بدین معنا که اگر فردی در یک جمله از واژههای چند زبان بهرهبرداری کند، Muse Voice Transcribe میتواند بهطور دقیق این تغییر را شناسایی و آن را رونویسی نماید.
زاکربرگ در توضیح عملکرد مدل گفت: «این مدل تعیین میکند چه زمانی به صدا گوش دهد. برای واژههای دشوار کمی بیشتر صبر کرده و برای واژههای ساده سریعتر نتیجه را ثبت میکند.» به گفتهی او، این فرآیند از تأخیر تطبیقی استفاده میکند که دقت رونویسی را افزایش میدهد.
این مدل برای شناسایی گفتار واقعی و متغیر آموزش دیده و با بیش از ۷۰ زبان تطبیق یافته است. زاکربرگ اعلام کرد که Muse Voice Transcribe میتواند بهطور همزمان جلسات صوتی تا یک ساعت را با بیش از ۲۰ گوینده مدیریت کند.
گفتنی است معرفی Muse Voice Transcribe کمتر از یک هفته پس از رونمایی مدل صوتی Gemini 3.5 Transcribe از سوی گوگل صورت گرفته است. گوگل قصد دارد مدل خود را در سیستمعامل اندروید و مرورگر کروم ادغام کند، ولی برنامههای متا برای استفاده از این مدل در سرویسهای خود هنوز شفاف نیست.
در حال حاضر، کاربران میتوانند قابلیتهای Muse Voice Transcribe را در اپلیکیشن دسکتاپ Meta AI برای سیستمعامل مک آزمایش کنند. این مدل همچنین برای توسعهدهندگان از طریق Muse Code و Model API در دسترس است و هزینه استفاده از API آن به ازای هر هزار دقیقه صوت ۳ دلار تعیین شده است.












