Gemini 3.5 Transcribe: как расшифровать час аудио на русском бесплатно из России в 2026
Google выпустила Gemini 3.5 Transcribe 26 августа 2026: 85+ языков, час аудио за один запрос, разделение по спикерам и тайм-коды. Разбираем, как расшифровать запись бесплатно в AI Studio, что нужно для доступа из России, сколько стоит API в рублях и где модель проседает.
14 мин чтения
Gemini 3.5 Transcribe - это отдельная модель Google для перевода речи в текст, вышла 26 августа 2026 года. Она понимает больше 85 языков вместе с русским, сама ставит пунктуацию, вычищает «эээ» и «ну как бы», размечает, кто говорит, и проставляет тайм-коды. Час записи она глотает за один запрос.
Попробовать её можно бесплатно в Google AI Studio, без карты. Одна проблема: из России штатного доступа нет, нужен аккаунт Google на другой стране плюс VPN. Ниже разберём по шагам, как включить расшифровку, какие настройки реально меняют результат, сколько стоит API в рублях и где модель спотыкается на русской речи.
Gemini 3.5 Transcribe вышла 26 августа 2026 и заменила Chirp 3: время до готовой расшифровки упало на 70%, ошибок 2,6% на английском и 5,04% в многоязычном тесте FLEURS. Час аудио за запрос, до 8 спикеров, тайм-коды по словам, словарь своих терминов на 1000 слов. Бесплатно в AI Studio, по API около $0,005 за минуту. Из России нужен аккаунт Google на поддерживаемой стране и VPN той же страны.
Коротко: пять слов, которые дальше встретятся
- Транскрипция - перевод речи из аудио или видео в текст.
- WER (Word Error Rate) - доля слов с ошибкой распознавания. Меньше значит лучше: 2,6% это примерно 3 ошибки на сотню слов.
- Диаризация - разметка «кто говорит»: реплики подписаны спикером 1, спикером 2 и так далее.
- Streaming (потоковый режим) - распознавание на лету, пока человек ещё говорит.
- FLEURS - открытый многоязычный бенчмарк распознавания речи, куда входит и русский.
Что умеет Gemini 3.5 Transcribe
Google разделила задачи: раньше речь в текст переводила общая модель Chirp 3, теперь для этого есть отдельная специализированная. Точнее, две.
- gemini-3.5-transcribe - для готовых записей. Загружаешь файл, получаешь текст.
- gemini-3.5-transcribe-live - для потока с микрофона в реальном времени.
Что модель делает поверх обычного распознавания:
- Ставит пунктуацию и форматирует текст. На выходе получается читаемый абзац, а не сплошная строка без запятых.
- Убирает слова-паразиты. «Эээ», «ну», «как бы» вычищаются на лету в режиме smart.
- Понимает самопоправки. Фразу «встретимся во вторник, нет, в среду» она записывает как «встретимся в среду», потому что человек имел в виду именно это.
- Определяет язык сама и не ломается, когда внутри одного предложения человек прыгает с русского на английский.
- Размечает спикеров - до 8 человек, хотя сама Google помечает разметку от трёх участников как экспериментальную.
- Даёт тайм-код на каждое слово. Это то, из чего собираются субтитры.
- Держит свой словарь до 1000 терминов: фамилии, названия компаний, профессиональный жаргон.
Модель закрытая: открытых весов нет, локально её не поднять. В этом принципиальная разница с Whisper, который ставится на свой компьютер и работает без интернета. Если тебе важно, чтобы запись вообще не улетала на чужой сервер, смотри в сторону локального решения из гайда про [расшифровку аудио в текст](/guides/rasshifrovka-audio-v-tekst/).
Насколько точно она распознаёт речь
По данным независимого замера Artificial Analysis на август 2026, у Gemini 3.5 Transcribe 2,6% ошибок в обычном режиме и 4,0% в потоковом. Вот как это выглядит рядом с моделями, которые мы разбирали раньше.
Гораздо интереснее второй набор цифр. На бенчмарке FLEURS, который считает ошибки по многим языкам сразу, а не только по английскому, модель показывает 5,04% в обычном режиме и 5,50% в потоковом. Это честнее отражает, что тебя ждёт на русской речи: примерно пять ошибок на сотню слов, и вычитывать расшифровку всё равно придётся.
Второй важный показатель - скорость. Google заявляет, что время до готовой расшифровки сократилось на 70% относительно Chirp 3. На практике это значит, что часовой созвон превращается в текст за считанные минуты, а не за время самого созвона.
Цифра 2,6% снята в основном на английской речи. Для русского ориентируйся на 5% из FLEURS и закладывай вычитку. Особенно на именах, названиях компаний и цифрах: именно там модель ошибается чаще всего, и именно это чаще всего ломает смысл.
Работает ли Gemini 3.5 Transcribe из России
Штатно нет. Россия не входит в список регионов Google AI Studio, и это ровно та же стена, о которую разбивается получение Gemini API key. Барьеров два, и обойти нужно оба.
Не пустит
- российский IP - страница отдаёт ошибку региона
- аккаунт Google, заведённый на Россию
- только VPN, без смены страны аккаунта
- бесплатный массовый VPN с прыгающей страной выхода
Пустит
- аккаунт Google на поддерживаемой стране
- стабильный VPN той же самой страны
- совпадение страны аккаунта и страны IP
- проверка своего IP до захода в AI Studio
Главная деталь, на которой спотыкаются: включить VPN мало. Google смотрит на страну самого аккаунта, а она у большинства определилась по SIM-карте в момент регистрации и осталась российской. Проверить можно в настройках Google-аккаунта, раздел с платёжной информацией и регионом.
Из VPN бери стабильный: массовые бесплатные Google распознаёт и режет, а страна выхода у них скачет от подключения к подключению. Если своего нет, подойдёт рабочий VPN.
Расшифровка это только половина дела: дальше с текстом надо что-то сделать. Пройди мини-курс «Claude за вечер»: от установки до первых результатов на твоих задачах.
Пройти мини-курс →Как расшифровать запись бесплатно: пошагово
Самый быстрый путь идёт через браузер, без кода и без карты.
Открыть AI Studio ≈ 1 мин
- aistudio.google.com
- войти в аккаунт на поддерживаемой стране
- VPN той же страны уже включён
Выбрать модель ≈ 1 мин
- раздел Audio в Playground
- модель gemini-3.5-transcribe
- для потока с микрофона - версия live
Настроить справа ≈ 2 мин
- Primary language: авто или Russian
- Speaker labels для диалогов
- Word timestamps для субтитров
Загрузить аудио ≈ 2 мин
- файл с компьютера или из Google Drive
- либо записать голос кнопкой Record Audio
- до часа записи за один заход
Забрать текст ≈ 3 мин
- кнопка Transcribe
- текст приходит с пунктуацией
- скопировать и вычитать имена и цифры
Настройки, которые реально меняют результат
Четыре переключателя справа делают из сырого распознавания рабочий инструмент.
Speaker labels (разделение по спикерам). Включай для интервью, подкастов и созвонов: реплики придут подписанными. Модель тянет до 8 голосов, но у Google от трёх участников это помечено как экспериментальное, так что на планёрке из шести человек ожидай путаницу.
Word timestamps (тайм-коды по словам). Это сырьё для субтитров и для монтажа: по тайм-коду находишь нужное место в записи за секунду. Google предупреждает, что включённые тайм-коды могут слегка снизить точность самих слов.
Smart transcription. Режим, где модель чистит устную речь: выкидывает паразитов, склеивает самопоправки, форматирует абзацы. Для лекции и созвона это то, что нужно. Для юридической или медицинской записи ставь дословный режим, иначе модель на своё усмотрение перепишет то, что человек сказал.
Custom vocabulary (свой словарь). До 1000 терминов, Google рекомендует держаться в пределах сотни. Сюда идут фамилии участников, названия ваших продуктов, аббревиатуры отрасли. Один раз заполнил - и модель перестала превращать «Топвизор» в «топ визор».
Smart-режим несовместим с тайм-кодами и разделением по спикерам: выбирать придётся. Логика простая - для читаемого конспекта включай smart, для субтитров и разбора «кто что сказал» включай тайм-коды и спикеров, а чистку текста делай потом отдельным промптом.
Лимиты: сколько аудио влезает в один запрос
| Режим | Максимум за раз | Спикеры | Тайм-коды |
|---|---|---|---|
| gemini-3.5-transcribe, обычный | 1 час | да | да |
| gemini-3.5-transcribe с диаризацией или тайм-кодами | 30 минут | да | да |
| gemini-3.5-transcribe-live (поток) | 10 минут сессии | нет | нет |
Отсюда практический вывод. Часовая лекция без разметки спикеров проходит одним файлом. Часовое интервью с разделением голосов придётся резать пополам, потому что лимит падает вдвое. Живой созвон потоком нужно разбивать на десятиминутные куски.
Для файлов длиннее нескольких секунд Google советует заливать аудио через Files API, а не пихать его прямо в тело запроса. Потоковая версия ждёт конкретный формат: 16-битный PCM, 16 кГц, моно, кусками по 100 миллисекунд.
Сколько стоит по API и как за это заплатить из России
Официальный прайс Google на август 2026:
| Модель | Вход (аудио) | Выход (текст) | Примерно за минуту |
|---|---|---|---|
| gemini-3.5-transcribe | $2 за 1 млн токенов | $12 за 1 млн токенов | $0,005 |
| gemini-3.5-transcribe-live | $3,50 за 1 млн токенов | $21 за 1 млн токенов | $0,009 |
Час записи в обычном режиме выходит примерно в $0,30. При курсе 80-100 ₽ за доллар это 25-30 рублей за час аудио. Двадцать часов лекций за семестр обойдутся дешевле одной чашки кофе в центре, так что экономить тут особо не на чем.
Формула: час русского аудио = около 30 рублей по API и 0 рублей вручную в AI Studio. Платить есть смысл только тогда, когда файлов десятки и их обрабатывает скрипт, а не ты.
У обеих моделей есть бесплатный тариф: он и покрывает ручные прогоны в AI Studio. Пока ты расшифровываешь свои созвоны руками, карта не нужна вообще.
Если файлов реально много и упираешься в бесплатные лимиты, оплата Google Cloud с российской карты не пройдёт. Обходной путь тот же, что и для остальных зарубежных подписок: сервис оплаты подписок (реферальная ссылка: тебе тот же прайс, мне небольшой процент). Ставить его есть смысл только под реальный объём файлов.
Биллинг Google Cloud списывает постфактум по факту использования, а не фиксированной подпиской. Если запустишь скрипт в цикле и он зациклится на большом файле, счёт вырастет молча. Ставь лимит расходов в консоли Google Cloud сразу, до первого запуска, и проверяй счётчик после первой пачки файлов.
Как подключить по API
Ключ берётся там же, в AI Studio, кнопкой Get API key. Дальше минимальный запрос выглядит так:
curl -X POST "https://generativelanguage.googleapis.com/v1beta/interactions" \
-H "x-goog-api-key: $GEMINI_API_KEY" \
-H "Content-Type: application/json" \
-d '{"model":"gemini-3.5-transcribe","input":[{"type":"audio","uri":"URI_ТВОЕГО_ФАЙЛА","mime_type":"audio/mp3"}]}'
Настройки из интерфейса в API называются так:
language_codes- язык в формате BCP-47, например["ru-RU"]. Оставишь пустым, модель определит сама.modeсо значением"smart"- та самая чистка устной речи.timestamp_granularitiesсо значением["word"]- тайм-коды по словам.diarization_modeсо значением"speaker"- разделение по голосам.custom_vocabulary- массив своих терминов.
Ключ это пароль: держи его в переменной окружения и не вставляй в код, который выкладываешь в открытый доступ.
Gemini 3.5 Transcribe против остальных
| Что важно | Gemini 3.5 Transcribe | Whisper локально | Яндекс, Telegram Premium |
|---|---|---|---|
| Точность на русском | около 5% ошибок (FLEURS) | хорошая, зависит от размера модели | средняя, для голосовых хватает |
| Из России напрямую | нет, нужен VPN и аккаунт | да, работает офлайн | да |
| Цена | бесплатно вручную, $0,005/мин по API | бесплатно полностью | по подписке сервиса |
| Спикеры и тайм-коды | да, из коробки | отдельными инструментами | нет |
| Час аудио за раз | да | да, упирается в железо | нет, короткие фрагменты |
| Данные уходят на чужой сервер | да | нет | да |
Расклад получается такой. Нужны спикеры, тайм-коды и чистый готовый текст без возни - бери Gemini, он закрывает это одним переключателем. Важна приватность или доступ без VPN - остаётся локальный Whisper. Нужно быстро разобрать голосовое от коллеги - Telegram и Яндекс справятся, не поднимая ничего.
Что делать с расшифровкой дальше
Сырая расшифровка часового созвона это 8-10 тысяч слов, которые никто читать не будет. Прогони её через любую языковую модель вот таким промптом:
Ты редактор. Ниже расшифровка встречи, полученная нейросетью. Сделай три вещи: 1. Вычисти повторы и обрывки фраз, сохранив смысл и авторские формулировки. Ничего не додумывай. 2. Собери саммари на 10-12 пунктов: решения, цифры, факты. 3. Отдельным списком вынеси задачи в формате «кто - что - к какому сроку». Если срок не назвали, напиши «срок не озвучен». Имена и цифры в расшифровке могли распознаться неверно. Места, где ты не уверен, помечай знаком вопроса в скобках. Расшифровка: [ВСТАВЬ ТЕКСТ]
Пункт про пометку неуверенных мест тут ключевой: он превращает ошибки распознавания из скрытой проблемы в видимый список того, что нужно перепроверить. Как собрать из этого нормальный учебный конспект, разобрано в гайде про конспект нейросетью.
Где модель споткнётся
Честно про слабые места, чтобы не было сюрпризов.
- Имена, бренды, термины. Главный источник ошибок на русском. Лечится словарём на 1000 терминов, но заполнять его нужно заранее.
- Плохая запись. Диктофон в кармане, эхо переговорки, три человека говорят одновременно - точность падает у любой модели, включая эту.
- Больше трёх спикеров. Google сама помечает такую разметку как экспериментальную. На планёрке из шести человек реплики будут перепутаны.
- Потоковый режим. По независимому замеру у live-версии 4,0% ошибок против 2,6% у обычной, плюс задержки в распознавании. Если запись можно обработать файлом, обрабатывай файлом.
- Приватность. Аудио уходит на серверы Google. Записи с чувствительными данными - врачебные, юридические, коммерческая тайна - туда не отправляй.
- Доступ. Всё держится на VPN и аккаунте на другой стране. Правила Google меняются, и однажды этот путь может закрыться.
Что у тебя есть после этого гайда
- Понимание, что Gemini 3.5 Transcribe - это специализированная модель распознавания речи, вышла 26 августа 2026 и заменила Chirp 3.
- Реальные цифры точности: 2,6% ошибок на английском, около 5% на многоязычном FLEURS, 4,0% в потоковом режиме.
- Условия доступа из России: аккаунт Google на поддерживаемой стране плюс стабильный VPN той же страны, одного VPN мало.
- Пошаговый путь в AI Studio: выбрать модель, настроить язык и спикеров, загрузить файл до часа, забрать текст с пунктуацией.
- Понимание лимитов: час без диаризации, 30 минут с ней, 10 минут на потоковую сессию.
- Цена вопроса: бесплатно вручную, около 30 рублей за час аудио по API.
- Промпт, который превращает сырую расшифровку в саммари и список задач с пометкой неуверенных мест.
По материалам: Postium о Gemini 3.5 Transcribe, официальный анонс Google и документация Gemini API.
Частые вопросы
Что такое Gemini 3.5 Transcribe?
Отдельная модель Google для перевода речи в текст, вышла 26 августа 2026 года. Понимает более 85 языков, включая русский, сама расставляет пунктуацию, вычищает слова-паразиты, размечает спикеров и тайм-коды. Заменила предыдущую модель Chirp 3 и работает примерно на 70% быстрее неё по времени до готовой расшифровки.
Можно ли пользоваться Gemini 3.5 Transcribe бесплатно?
Да. У модели есть бесплатный тариф в Google AI Studio: загружаешь файл в браузере, жмёшь кнопку расшифровки и получаешь текст, карту привязывать не нужно. Ограничение бесплатного режима одно и то же для всех моделей Gemini API: суточные лимиты запросов на проект.
Работает ли Gemini 3.5 Transcribe из России?
Напрямую нет: Россия не входит в список регионов Google AI Studio. Нужны две вещи сразу - аккаунт Google, заведённый на поддерживаемую страну, и стабильный VPN этой же страны. Одного VPN мало, Google смотрит и на страну аккаунта тоже.
Сколько стоит расшифровать час аудио через Gemini 3.5 Transcribe?
По официальному прайсу Google на август 2026 модель gemini-3.5-transcribe стоит $2 за 1 млн входных аудиотокенов и $12 за 1 млн выходных текстовых, в пересчёте примерно $0,005 за минуту. Час записи выходит около $0,30, то есть 25-30 рублей при курсе 80-100 ₽ за доллар.
Сколько аудио влезает в один запрос?
До одного часа в обычном режиме. Если включить разделение по спикерам или тайм-коды на уровне слов, лимит падает до 30 минут. Потоковая версия gemini-3.5-transcribe-live держит сессию максимум 10 минут и не умеет ни спикеров, ни тайм-кодов.