ترازبندی صوت و متن
پردازش تصویر و صوتضرورت و کاربرد
گاهی متن صحبت یا سخنرانی صوتی یا فیلم خاصی وجود دارد ولی مشخص نیست که کدام بخش متن مربوط به کدام بخش صوت است. این اطلاعات برای موارد زیر ضروری است:
- نمایش همزمان متن و صوت یا فیلم به کاربر
- نمایش متن به صورت زیرنویس بر روی فیلم و صوت
برنامه ترازبندی صوت و متن برای این کار طراحی شده است.
چالش اصلی
این برنامه از یک سرویس تشخیص صحبت خارجی استفاده میکند. در حال حاضر سرویسهای تشخیص صحبت به متن در سخنرانیها و جلسات از دقت خوبی برخوردار نیستند. از اینرو رویه کار پیچیدهتر شده است.
مراحل انجام کار
مرحله اول: تبدیل فرمت
ابتدا فیلم و یا صوت را به فرمت قابل استفاده برای ماژول تشخیص صحبت به متن تبدیل میکنیم. برای این کار لازم است صوت سخنرانی از کیفیت خوبی برخوردار باشد.
مرحله دوم: تقسیم به قطعات کوچک
پس از آن با کمک تشخیص سکوتها در میان سخنرانی، صوت مذکور را به قطعات کوچکتر تقسیم میکنیم و آنها را به ماژول تشخیص صوت میفرستیم.
مرحله سوم: قطعهبندی چندگانه (در صورت نیاز)
برای دقت بالاتر، در قسمتهایی که به طور طولانی در سخنرانی سکوتی وجود ندارد، میتوان از چند قطعهبندی مختلف استفاده کرد.
مرحله چهارم: تشخیص صحبت
خروجی ماژول تشخیص صوت، یک یا چند جمله تشخیص داده شده است که تا حدودی با قطعه صوت اصلی تطبیق دارد.
مرحله پنجم: تطبیق پویا
پس از نرمال کردن متن اصلی سخنرانی و متن قطعات صوتی تشخیص داده شده، از یک الگوریتم پویا برای تطبیق دادن نقاط صوت با نقاط احتمالی بین کلمات در متن اصلی استفاده میکنیم. این الگوریتم از بررسی فاصله لووناشتاین (Levenshtein Distance) بین جملات تشخیص داده شده کنار هم قرار گرفته با متن اصلی به دست میآید.
خروجی
خروجی کار، قطعات تقسیم شده متن اصلی است که زمانبندی هر کدام از قطعات متن در کنار آن ثبت شده است. از این خروجی برای تولید فایل استاندارد زیرنویس استفاده شده است که در پلیرها قابل پخش میباشد.
نتایج و کاربردهای موفق
خروجی کار برای موارد زیر استفاده شده و جواب مطلوب و دقیق دریافت شده است:
- متن و صوت سخنرانیهای موجود در سایت رهبری
- انطباق ترتیل و متن قرآن

کاربردها
- زیرنویسگذاری خودکار: تولید فایل زیرنویس برای فیلمها و سخنرانیها
- پخش همزمان متن و صوت: نمایش متن هماهنگ با پخش صوت
- متنکاوی سخنرانیها: امکان جستجو در محتوای صوتی بر اساس متن
- منابع آموزشی: ایجاد هماهنگی بین متن درس و فایل صوتی
- ترتیل قرآن: انطباق دقیق آیات با تلاوت
مزایا
- دقت مناسب علیرغم چالشها: با وجود دقت محدود سرویسهای تشخیص صحبت، الگوریتم تطبیق پویا دقت را افزایش میدهد
- خروجی استاندارد: تولید فایل زیرنویس قابل پخش در پلیرهای معمول
- کاربرد موفق در پروژههای واقعی: تأیید شده در سخنرانیهای سایت رهبری و ترتیل قرآن
- مدیریت سکوتها: استفاده هوشمندانه از تشخیص سکوت برای قطعهبندی بهینه
- الگوریتم پویا: استفاده از فاصله لووناشتاین برای یافتن بهترین تطابق