
Google представила Gemini 3.5 Transcribe — нову модель для розпізнавання мовлення, яка не просто переводить аудіо в текст, а й може структурувати хаотичну усну мову. Модель підтримує понад 85 мов, розпізнає специфічні терміни та може прибирати слова-паразити.
Одним із наступних застосувань Gemini 3.5 Transcribe стане голосовий ввід у браузері Chrome. Google планує дозволити користувачам диктувати текст безпосередньо в будь-яке текстове поле на сайті — наприклад, писати повідомлення, публікації або давати ШІ голосові команди.
Gemini 3.5 Transcribe розрахована на роботу з неідеальним усним мовленням. Модель може розпізнавати специфічну термінологію та незвичні написання, а також коректно працювати з номерами й комбінаціями літер і цифр.
Під час обробки вже записаного аудіо модель здатна розрізняти до трьох спікерів і визначати часову позначку для кожного сказаного слова.
Окремо Google наголошує на здатності моделі структурувати мовлення. Тобто користувачеві не обов’язково формулювати думки ідеально під час диктування — Gemini може прибрати слова-паразити та перетворити усний потік на більш впорядкований текст.
За даними Google, технологія вже використовується у функції Rambler на смартфонах Pixel 11 та в Gemini для macOS. Компанія також планує інтегрувати її в Search Live, Gemini Live, Google Docs, Google Keep та Gmail. Для розробників Gemini 3.5 Transcribe буде доступна через API.
