
Зображення до статті
Олександр Остапенко
Автор новин
Компанія Google анонсувала появу Gemini 3.5 Transcribe — нової системи розпізнавання мовлення, яку розробники називають своєю найточнішою наразі системою «мовлення в текст». На відміну від стандартних моделей розпізнавання, які погано справляються з фоновими шумами, специфічною лексикою та недомовленими фразами, Gemini 3.5 Transcribe миттєво перетворює сире аудіо на чіткий, структурований та добре оформлений текст.

Дві версії моделі для різних завдань
Розробники матимуть доступ до моделі через два окремі API, залежно від сфери застосування:
- Потокове мовлення в реальному часі — версія gemini-3.5-transcribe-live забезпечує неперервний двосторонній потік даних із затримкою менше ніж секунда, що ідеально підходить для інтерактивних голосових сервісів. Доступ надається через Live API.
- Опрацювання попередньо записаного аудіо — версія gemini-3.5-transcribe розшифровує аудіозаписи зустрічей, телефонних розмов та інших звукових файлів, розділяючи репліки між учасниками та додаючи точні часові відмітки. Доступ надається через Interactions API.
Що вміє модель
Основна перевага Gemini 3.5 Transcribe полягає в її здатності обробляти мовлення у його природній формі, а не лише в ідеальному «дикторському» виконанні:
- Інтелектуальна транскрипція. Модель коректно інтерпретує виправлення мовця, наприклад, «зустрінемось у вівторок — ні, в середу», усуває слова-паразити («ну», «як би») та автоматично форматує отриманий текст.
- Виклик функцій. Gemini 3.5 Transcribe може передавати складні завдання, такі як створення зображень або аналіз документів, іншим моделям Gemini через спеціальні виклики функцій. На даний момент ця можливість доступна в програмі Gemini для macOS.
- Точність розпізнавання. За даними незалежної платформи Artificial Analysis, модель показує середній відсоток помилок (WER) 4,0% у потоковому режимі та 2,6% для вже записаного аудіо. Вона впевнено працює навіть в умовах підвищеного шуму та точно розпізнає буквено-цифрові комбінації, як-от поштові індекси чи номери замовлень.
- Кастомний словник. Модель здатна розпізнавати специфічну термінологію та нестандартні написання слів, адаптуючись до наданого користувачем словника.
- Багатомовність. Автоматичне визначення та розпізнавання понад 85 мов, включаючи різні регіональні акценти та діалекти.
- Розділення мовців. У записаному аудіо модель може точно ідентифікувати мовлення до трьох учасників розмови, додаючи часові мітки для кожного слова. Підтримка більшої кількості мовців наразі перебуває в експериментальній фазі.
За інформацією Google, порівняно з попередньою моделлю транскрипції Chirp 3, Gemini 3.5 Transcribe є значним досягненням. Згідно з даними Artificial Analysis, час, необхідний для отримання фінальної транскрипції, скоротився на 70%. На тестовому наборі FLEURS, який охоплює основні мови та локалі, модель показала 5,50% помилок у потоковому режимі та 5,04% для попередньо записаного аудіо.
Де вже працює і що буде далі
Ця технологія вже впроваджена в кілька сервісів Google. На платформі Android вона лежить в основі функції Rambler у Gboard, яка перетворює усне мовлення на акуратний, форматований текст, дозволяючи вносити правки, виправляти помилки та змінювати стиль написання голосом.
У додатку Gemini для macOS модель не тільки транскрибує вільне мовлення, але й підтримує голосові команди, які інтегруються з контекстом екрана. Це дає змогу користувачеві стисло викладати зміст локальних файлів, переносити текст між програмами чи створювати зображення безпосередньо під курсором, використовуючи лише голос. У
Google Antigravity модель узгоджує контекст екрана та історію діалогів (за згоди користувача) для точного розпізнавання імен файлів, міркувань агента та активних документів. У Google AI Studio її можна використовувати в режимі Build для «вайб-кодингу» голосом.
Найближчим часом підтримка моделі з’явиться і в браузері Chrome. Google обіцяє можливість диктувати текст безпосередньо в будь-яке поле для введення на веб-сторінці, що полегшить надиктовування відповідей, повідомлень або запитів до Gemini в Chrome.
Розробники вже можуть тестувати модель у публічному попередньому доступі через Gemini API в Google AI Studio та Google Antigravity. Для корпоративних клієнтів вона доступна через Gemini Enterprise Agent Platform і незабаром буде представлена в Gemini Enterprise for Customer Experience. Серед платформ, які вже інтегрували модель через Gemini Live API, — Agora, Fishjam, LangChain, LiveKit, Pipecat, Vercel та Vision Agents.
Нагадаємо, нещодавно агент Gemini видалив майже 30 000 рядків програмного коду та надав розробнику неправдиву інформацію про його відновлення.
Головна > Новини > Google представила Gemini 3.5 Transcribe — модель, яка розуміє наміри користувача
Джерело
