• Новости
  • Генерация видео
  • Генерация изображений
  • Генерация звука
  • Генерация текста
  • Обзор сервисов
AITopGuide
Новости нейросетей и полезная информация об ИИ
Категория:

Новости

    Новости

    Google выпустила Gemini 3.5 Transcribe: диктовка сама убирает «эм» и правит оговорки

    admin 02.09.2026


    Диктовка в Gboard теперь сама вычищает «эм» и «ага» и переписывает фразу, если человек передумал на полуслове. Google выпустила Gemini 3.5 Transcribe 26 августа — модель распознавания речи на 85+ языков, которая уже работает в Android, приложении Gemini на macOS и в API.

    Содержание

    1. «Встретимся во вторник — нет, в среду»
    2. Два режима — дословно и начисто
    3. 2,6% ошибок и пятая строчка в общем зачёте
    4. Чистый текст или разметка по спикерам, вместе не выйдет
    5. Три двери в 3.5 Transcribe
    6. Расшифровка интервью и черновики голосом
    7. Chrome покажет, чего стоит заявка

    Gemini 3.5 Transcribe пришла на смену Chirp 3 , прежней модели распознавания речи Google. Команда Gemini Audio подаёт релиз как переход от расшифровки к диктовке начисто — сырой звук превращается сразу в отформатированный текст с абзацами и списками. Разработчикам модель открыли в предварительном доступе, обычные пользователи получили её внутри готовых продуктов.

    «Встретимся во вторник — нет, в среду»

    Эту фразу Google вынесла в анонс как образец работы умного режима. Gemini 3.5 Transcribe понимает, что человек передумал на полуслове, и оставляет в тексте только среду. Заодно вычищает «эм», «ага» и повторы, расставляет абзацы и списки.

    На Android это работает через Rambler — новую функцию клавиатуры Gboard. Наговорил мысль как получилось, в поле осталась причёсанная версия. Голосом можно и править уже написанное: исправить опечатку, поменять имя, сменить тон формулировки.

    В приложении Gemini на macOS модель работает уже голосовым командным интерфейсом. Она видит контекст экрана и передаёт тяжёлые задачи другим моделям Gemini — пересказать локальный файл, сгенерировать картинку прямо под курсором. Отдельно Google хвалится точностью на буквенно-цифровых кусках, где спотыкается любая диктовка. Номера заказов, почтовые индексы, артикулы.

    Два режима — дословно и начисто

    По умолчанию Gemini 3.5 Transcribe расшифровывает дословно, со всеми «эм» и оговорками. Чистка включается отдельным режимом, и развилка здесь разумная. Для интервью, протокола или юридической записи важно ровно то, что человек сказал. Причёсанная версия там становится проблемой.

    Модель живёт в двух разных эндпоинтах. gemini-3.5-transcribe-live работает через Live API и держит непрерывный поток с задержкой меньше секунды, под голосовых ассистентов и субтитры в реальном времени. gemini-3.5-transcribe обрабатывает готовые записи через Interactions API, размечает реплики по говорящим и ставит тайминги на каждое слово.

    Есть и собственный словарь — до тысячи терминов, которые модель будет писать так, как нужно вам. Для созвонов с фамилиями, названиями продуктов и внутренним жаргоном это самая полезная строчка в спецификации.

    2,6% ошибок и пятая строчка в общем зачёте

    Точность Google измеряет по данным Artificial Analysis. Средняя доля ошибочных слов у Gemini 3.5 Transcribe — 4,0% в потоковом режиме и 2,6% на готовых записях. На многоязычном наборе FLEURS цифры хуже, 5,50% и 5,04%. Время до финальной расшифровки против Chirp 3 сократилось на 70%.

    Прирост относительно прошлого поколения выглядит убедительно, но формулировку «самая точная модель распознавания речи» Google применяет к своей линейке. В общем зачёте Artificial Analysis результат 2,6% даёт лишь пятое место. Рекорда рынка тут нет, есть аккуратный вход в первую пятёрку с сильной обвязкой вокруг ядра.

    Чистый текст или разметка по спикерам, вместе не выйдет

    Умный режим Gemini 3.5 Transcribe не сочетается с таймингами и диаризацией — разметкой записи по говорящим. Либо причёсанный текст, либо информация о том, кто и на какой секунде что сказал. Для интервью с последующей нарезкой цитат это неприятная развилка.

    Дальше идут лимиты по длине. Обычный файл модель берёт до часа, с диаризацией или пословными таймингами потолок падает до получаса. Уверенно она разбирает трёх собеседников, всё что сверху Google помечает экспериментальным. Часовая планёрка на пять голосов пока вне зоны комфорта.

    Цены в анонсе нет вообще. Ни прайса за минуту, ни примера расчёта — тарификация уходит в общую токенную сетку Gemini API, и посчитать по анонсу стоимость часа записи не получится.

    Три двери в 3.5 Transcribe

    Разработчикам Gemini 3.5 Transcribe открыли в публичном предварительном доступе через Gemini API в Google AI Studio и в среде Antigravity. Вход по обычному аккаунту Google, ни очереди, ни заявки. В AI Studio модель работает ещё и в режиме Build, где приложение собирается голосом.

    Корпоративным клиентам её выдают через Gemini Enterprise Agent Platform, тоже в предварительном доступе. Несколько сторонних платформ для голосовых интерфейсов уже подключили модель через Live API, так что идти к Google напрямую не обязательно.

    Обычному пользователю дверей меньше. Приложение Gemini на macOS понимает только английский, Rambler в Gboard раскатывают на часть стран и языков, диктовку в любое поле браузера Chrome обещают позже. Русского в подтверждённом списке нет, и это главная оговорка для читателя из России. Практический доступ сегодня идёт через API.

    Расшифровка интервью и черновики голосом

    У релиза два прикладных сценария для тех, кто каждый день пишет тексты. Надиктовка черновика стала быстрее, потому что Gemini 3.5 Transcribe отдаёт сразу структурированный текст и править его проще, чем расшифровку из старых движков. Второй сценарий — текстовые версии подкастов и вебинаров, где пословные тайминги дают готовую основу для таймкодов и субтитров.

    Режимы под эти задачи разные. Цитаты собирают из дословной расшифровки, черновик берут из умного, а фамилии спикеров и названия продуктов заранее загоняют в словарь.

    Chrome покажет, чего стоит заявка

    Судить о модели по бенчмаркам смысла мало. Настоящая проверка начнётся в Chrome, когда диктовка появится в любом поле браузера и с ней разом столкнутся десятки миллионов человек. Пока же Gemini 3.5 Transcribe остаётся предварительным доступом для разработчиков и одной функцией клавиатуры на части Android-устройств.

    И ещё одно. Умная расшифровка устроена так, что модель сама решает, что вы имели в виду. Дословный режим Google оставила по умолчанию именно поэтому, и переключать его стоит осознанно.



    Источник

    02.09.2026 0 комментариев
    0 VKOdnoklassnikiEmail
  • Новости

    Агенты Anthropic и OpenAI создали фальшивые личности во время киберучений AISI

    admin 31.08.2026
    31.08.2026

    Британский AI Security Institute опубликовал отчёт об инциденте: во время киберучений ИИ-агенты 19 раз вышли за рамки задания и начали …

    0 VKOdnoklassnikiEmail
  • Новости

    Мeта выпустила Muse Code — терминального ИИ-программиста с фоновыми субагентами

    admin 30.08.2026
    30.08.2026

    *Мeta 5 августа открыла бета-доступ к Muse Code — терминальному агенту, который сам разбирает задачу, пишет код и проверяет результат …

    0 VKOdnoklassnikiEmail
  • Новости

    Samsung показала память, которая садится прямо на ИИ-ускоритель

    admin 29.08.2026
    29.08.2026

    Samsung на конференции FMS 2026 показала zHBM — концепт памяти, которая ставится вертикально над ИИ-ускорителем. Там же компания представила V10 …

    0 VKOdnoklassnikiEmail
  • Новости

    Сбер выложил Kandinsky WM 1.0 — видеомодели для обучения роботов и беспилотников

    admin 28.08.2026
    28.08.2026

    Сбер выложил в открытый доступ Kandinsky WM 1.0 — три модели, которые достраивают видео по первому кадру и удерживают физику …

    0 VKOdnoklassnikiEmail
  • Новости

    OpenAI открыла бесплатным пользователям ChatGPT безлимитные чаты на GPT-5.6 Luna

    admin 27.08.2026
    27.08.2026

    OpenAI переводит бесплатных и Go-пользователей ChatGPT на GPT-5.6 Luna. С этой недели модель становится дефолтной, а со следующей — снимает …

    0 VKOdnoklassnikiEmail
  • Новости

    Anthropic смягчила биологические фильтры Claude Fable 5

    admin 26.08.2026
    26.08.2026

    Anthropic переписала биологический классификатор Claude Fable 5: доля ошибочных переключений на слабую модель упала примерно на 85%. Fable 5 чаще …

    0 VKOdnoklassnikiEmail
  • Новости

    Google DeepMind научила ИИ предсказывать ураганы на сутки раньше

    admin 25.08.2026
    25.08.2026

    Google DeepMind опубликовала в Nature исследование WeatherNext Cyclones: модель предсказывает путь, силу и структуру ветра циклона на трое суток вперёд …

    0 VKOdnoklassnikiEmail
  • Новости

    OpenAI заперла свою следующую модель Astra в изоляции

    admin 24.08.2026
    24.08.2026

    Будущая модель OpenAI под именем Astra на внутренних испытаниях так выросла в кибербезопасности, что компания больше не может исключить у …

    0 VKOdnoklassnikiEmail
  • Новости

    ByteDance открыла публичный API Seedance 2.5

    admin 23.08.2026
    23.08.2026

    7 августа Volcano Engine открыла публичный API Seedance 2.5 — видеомодели ByteDance, которая одним проходом собирает 30-секундный ролик в 4K …

    0 VKOdnoklassnikiEmail
Новые
Старые

Свежие записи

  • 20 промтов для осенней ИИ-фотосессии в нейросетях
  • ElevenLabs добавила генерацию речи, музыки, изображений и видео в MCP
  • OpenAI покажет человекоподобного робота в 2027 году
  • ElevenLabs выпустила Music v2.5 с улучшенным звуком и точным следованием запросу
  • Думейт: от отчета к инструментам доработки

Свежие комментарии

Нет комментариев для просмотра.

Новые статьи

  • 20 промтов для осенней ИИ-фотосессии в нейросетях

    17.09.2026
  • ElevenLabs добавила генерацию речи, музыки, изображений и видео в MCP

    15.09.2026
  • OpenAI покажет человекоподобного робота в 2027 году

    14.09.2026
  • ElevenLabs выпустила Music v2.5 с улучшенным звуком и точным следованием запросу

    13.09.2026
  • Думейт: от отчета к инструментам доработки

    12.09.2026
  • Universal Music и ElevenLabs запустят музыкальную ИИ-платформу

    11.09.2026

Рубрики

  • Генерация видео (113)
  • Генерация звука (23)
  • Генерация изображений (89)
  • Генерация текста (68)
  • Новости (79)
  • Обзор сервисов (36)

20 промтов для осенней ИИ-фотосессии в нейросетях

17.09.2026

ElevenLabs добавила генерацию речи, музыки, изображений и видео...

15.09.2026

OpenAI покажет человекоподобного робота в 2027 году

14.09.2026

ElevenLabs выпустила Music v2.5 с улучшенным звуком и...

13.09.2026

Думейт: от отчета к инструментам доработки

12.09.2026

Обзоры

  • Higgsfield AI: Революция в создании видео с искусственным интеллектом

    30.07.2026
  • Как создать видео с эффектом Soul в Higgsfield AI: пошаговое руководство

    29.07.2026
  • Как оплатить Higgsfield AI и какие есть тарифы: подробный гайд

    28.07.2026

Выбор редакции

  • ElevenLabs представила Dubbing v2 — нейросеть сохраняя голос и подачу оригинала при переводе на другой язык

    02.07.2026
  • Gen-3 Alpha от Runway теперь доступна для платных тарифных планов

    02.08.2026
  • LTX Studio добавила Brand Kit для корпоративных команд

    28.06.2026

Популярное

  • 1

    Промты для открытки на 23 февраля: +нейросети для создания открытки

    21.06.2026
  • 2

    Wan2.2 научилась рисовать: видеомодель от Krea теперь создаёт впечатляющие изображения по запросу

    24.06.2026
  • 3

    Google встроил в Gemini генератор музыки Lyria 3

    21.06.2026
  • Pinterest
  • Youtube
  • Email
  • Vk
  • Rss
  • Yandex

@2026- All Right Reserved.


Наверх
AITopGuide
  • Новости
  • Генерация видео
  • Генерация изображений
  • Генерация звука
  • Генерация текста
  • Обзор сервисов