گوگل Gemini 3.5 Transcribe را معرفی کرد که با بهرهگیری از هوش مصنوعی پیشرفته، انقلابی در زمینه تبدیل گفتار به متن ایجاد خواهد کرد.
گوگل از مدل جدید هوش مصنوعی خود با نام Gemini 3.5 Transcribe رونمایی کرده است که برای بهبود چشمگیر ورودی صوتی و تبدیل آن به متنی روان و بینقص طراحی شده است. این مدل جدید، قابلیتهای ویژهای برای حذف کلمات اضافه و تصحیحات لحظهای ارائه میدهد و تجربه کاربری تبدیل گفتار به متن را متحول خواهد کرد.
قابلیتهای برجسته Gemini 3.5 Transcribe
مدل جدید Gemini 3.5 Transcribe در مقایسه با نسل قبلی موتور تبدیل گفتار به متن گوگل، یعنی Chirp 3، سرعت و دقت بسیار بالاتری دارد. این هوش مصنوعی جدید حدود ۷۰ درصد سریعتر از صدا به متن نهایی تبدیل میکند و نرخ خطای آن در گفتار زنده به ۵.۵ درصد کاهش یافته است که در مقایسه با نرخ خطای ۷.۳۲ درصدی Chirp 3، پیشرفت قابل توجهی به شمار میرود. هرچند این بهبود جزئی به نظر میرسد، اما کاهش نیاز به تصحیح اشتباهات تایپی در ورودی صوتی، تجربه کاربری را بهطور محسوسی بهبود میبخشد.
- بمب خبری؛ هوش مصنوعی برای اولین بار در دنیا رسما آدم کشت!
- هوش مصنوعی Accrete پنتاگون؛ سیستمی که دشمنان آمریکا را در شبکههای اجتماعی رصد میکند
- مرورگر کروم اندروید دیگر یک مرورگر ساده نیست؛ هوشمصنوعی جمینای همهچیز را عوض کرد
- گوگل حذف واترمارک در تصاویر هوش مصنوعی Gemini را ممکن کرد
حذف کلمات اضافه و شخصیسازی واژگان
Gemini 3.5 Transcribe تنها در شنیدن کلمات شما بهتر عمل نمیکند؛ بلکه در درک منظور واقعی شما نیز هوشمندتر است. این مدل میتواند کلمات اضافه مانند «اِم» و «آه» را که معمولاً در هنگام صحبت کردن بیان میشوند، حذف کند. همچنین، این قابلیت را دارد که در صورت نیاز به تصحیح خود، متن را بهصورت لحظهای ویرایش کند و از واژگان سفارشی ارائهشده توسط کاربر برای مدیریت «اصطلاحات تخصصی» استفاده کند. این ویژگیها در ۸۵ زبان مختلف و برای حداکثر سه سخنران در فایلهای صوتی از پیش ضبطشده قابل استفاده است. البته، نکته مهم این است که کاربر به دقت هوش مصنوعی در درک صحیح گفتارش وابسته خواهد بود و ممکن است در برخی شرایط خاص، تغییر در شیوه بیان دقیق جملات مناسب نباشد.
گجت نیوز آخرین اخبار تکنولوژی، علم و خودرو 


