Google випустила Gemini 3.5 Transcribe — модель, що розуміє задуми користувача

Фото до статті

Олександр Остапенко

Автор новин

Google анонсувала випуск Gemini 3.5 Transcribe — нової системи розпізнавання мови, яку компанія характеризує як найточнішу свою систему «мова в текст» наразі. На відміну від стандартних систем розпізнавання, які часто втрачають точність через фоновий шум, складну термінологію чи незавершені фрази, Gemini 3.5 Transcribe миттєво трансформує необроблене аудіо у зрозумілий, структурований та відформатований текст.

Дві версії для різних потреб

Розробникам надається доступ до моделі через два окремі API, залежно від специфіки завдань:

  • Для потокової передачі в реальному часі — версія gemini-3.5-transcribe-live забезпечує безперервний двосторонній стрім із затримкою менше секунди, що ідеально підходить для інтерактивних голосових систем. Доступ надається через Live API.
  • Для аналізу записаного аудіо — версія gemini-3.5-transcribe розшифровує аудіозаписи зустрічей, розмов та інших файлів, точно розділяючи репліки між учасниками та вказуючи точні часові позначки. Ця версія доступна через Interactions API.

Можливості моделі

Ключова перевага Gemini 3.5 Transcribe полягає в здатності обробляти реальне мовлення, а не лише ідеально вимовлені фрази:

  • Розумна транскрипція. Модель коректно інтерпретує виправлення в реальному часі, наприклад, «зустрінемось у вівторок — ні, краще в середу», усуває слова-заповнювачі («ну», «як би») та автоматично форматує отриманий текст.
  • Виклик функцій. Gemini 3.5 Transcribe може делегувати складні завдання, такі як створення зображень або аналіз даних, іншим моделям Gemini за допомогою функціональних викликів. Наразі ця функція доступна у додатку Gemini для macOS.
  • Висока точність розпізнавання. Згідно з оцінками незалежної платформи Artificial Analysis, показник середньої частоти помилок (WER) становить 4,0% для потокового режиму та 2,6% для записаного аудіо. Модель демонструє надійну роботу навіть у шумному оточенні та точно розпізнає буквено-цифрові комбінації, такі як поштові індекси чи номери замовлень.
  • Індивідуальний словник. Система здатна розпізнавати специфічну термінологію та нестандартні написання слів, адаптуючись до наданого користувачем словника.
  • Багатомовна підтримка. Автоматичне визначення та розпізнавання понад 85 мов, включаючи різні регіональні акценти та діалекти.
  • Розділення мовлення за спікерами. У записаному аудіо модель може точно ідентифікувати мовлення до трьох учасників розмови, надаючи часові мітки для кожного слова. Підтримка більшої кількості спікерів наразі перебуває в експериментальному стані.

За даними Google, порівняно з попередньою моделлю транскрипції Chirp 3, Gemini 3.5 Transcribe являє собою значний прогрес: згідно з даними Artificial Analysis, час до отримання остаточної транскрипції скоротився на 70%. На тесті FLEURS, який охоплює ключові мови та регіони, модель показала 5,50% помилок у потоковому режимі та 5,04% для попередньо записаного аудіо.

Поточне використання та майбутні плани

Ця технологія вже впроваджена в декілька продуктів Google. На платформі Android вона забезпечує роботу функції Rambler у Gboard, перетворюючи усне мовлення на чіткий, відформатований текст, дозволяючи вносити редагування, виправляти помилки та змінювати стиль написання голосом. У програмі Gemini для macOS модель не тільки транскрибує розмовне мовлення, але й обробляє голосові команди, які враховують контекст екрана. Це дозволяє користувачам, наприклад, узагальнювати локальні файли, переносити вміст між програмами або генерувати зображення безпосередньо під курсором, керуючи всим лише голосом. У Google Antigravity модель синхронізує контекст екрана та історію чату (за згоди користувача) для точного розпізнавання назв файлів, робочих процесів агента та активних документів. У Google AI Studio її можна використовувати в режимі Build для голового «вайб-кодингу».

Найближчим часом підтримка моделі буде додана до браузера Chrome. Google планує надати можливість диктувати текст безпосередньо в будь-яке текстове поле на веб-сторінці, що спростить створення відповідей, публікацій чи запитів до Gemini через Chrome.

Розробники вже мають можливість використовувати модель у публічному попередньому доступі через Gemini API в Google AI Studio та Google Antigravity. Корпоративним клієнтам вона доступна через Gemini Enterprise Agent Platform, а незабаром з’явиться у Gemini Enterprise for Customer Experience. Серед платформ, які вже інтегрували модель через Gemini Live API, — Agora, Fishjam, LangChain, LiveKit, Pipecat, Vercel та Vision Agents.

Нагадаємо, нещодавно агент Gemini видалив близько 30 000 рядків коду і повідомив розробнику, що все відновлено, хоча це було неправдою.

Головна > Новини > Google представила Gemini 3.5 Transcribe — модель, яка розуміє наміри користувача

No votes yet.
Please wait...

Залишити відповідь

Ваша e-mail адреса не оприлюднюватиметься. Обов’язкові поля позначені *