Gemini 3.5 Transcribe

گوگل Gemini 3.5 Transcribe را معرفی کرد؛ هوش مصنوعی جدید برای تبدیل صدا به متن

گوگل Gemini 3.5 Transcribe را معرفی کرد که با بهره‌گیری از هوش مصنوعی پیشرفته، انقلابی در زمینه تبدیل گفتار به متن ایجاد خواهد کرد.

گوگل از مدل جدید هوش مصنوعی خود با نام Gemini 3.5 Transcribe رونمایی کرده است که برای بهبود چشمگیر ورودی صوتی و تبدیل آن به متنی روان و بی‌نقص طراحی شده است. این مدل جدید، قابلیت‌های ویژه‌ای برای حذف کلمات اضافه و تصحیحات لحظه‌ای ارائه می‌دهد و تجربه کاربری تبدیل گفتار به متن را متحول خواهد کرد.

قابلیت‌های برجسته Gemini 3.5 Transcribe

Gemini 3.5 Transcribe

مدل جدید Gemini 3.5 Transcribe در مقایسه با نسل قبلی موتور تبدیل گفتار به متن گوگل، یعنی Chirp 3، سرعت و دقت بسیار بالاتری دارد. این هوش مصنوعی جدید حدود ۷۰ درصد سریع‌تر از صدا به متن نهایی تبدیل می‌کند و نرخ خطای آن در گفتار زنده به ۵.۵ درصد کاهش یافته است که در مقایسه با نرخ خطای ۷.۳۲ درصدی Chirp 3، پیشرفت قابل توجهی به شمار می‌رود. هرچند این بهبود جزئی به نظر می‌رسد، اما کاهش نیاز به تصحیح اشتباهات تایپی در ورودی صوتی، تجربه کاربری را به‌طور محسوسی بهبود می‌بخشد.

بیشتر بخوانید

حذف کلمات اضافه و شخصی‌سازی واژگان

Gemini 3.5 Transcribe تنها در شنیدن کلمات شما بهتر عمل نمی‌کند؛ بلکه در درک منظور واقعی شما نیز هوشمندتر است. این مدل می‌تواند کلمات اضافه مانند «اِم» و «آه» را که معمولاً در هنگام صحبت کردن بیان می‌شوند، حذف کند. همچنین، این قابلیت را دارد که در صورت نیاز به تصحیح خود، متن را به‌صورت لحظه‌ای ویرایش کند و از واژگان سفارشی ارائه‌شده توسط کاربر برای مدیریت «اصطلاحات تخصصی» استفاده کند. این ویژگی‌ها در ۸۵ زبان مختلف و برای حداکثر سه سخنران در فایل‌های صوتی از پیش ضبط‌شده قابل استفاده است. البته، نکته مهم این است که کاربر به دقت هوش مصنوعی در درک صحیح گفتارش وابسته خواهد بود و ممکن است در برخی شرایط خاص، تغییر در شیوه بیان دقیق جملات مناسب نباشد.

0 دیدگاه
جدیدترین
قدیمی ترین بیشترین رای
بازخورد درون خطی
مشاهده همه نظرات