• Новости
  • Генерация видео
  • Генерация изображений
  • Генерация звука
  • Генерация текста
  • Обзор сервисов
AITopGuide
Новости нейросетей и полезная информация об ИИ
Автор

admin

    Новости

    Google выпустила DiffusionGemma: текст блоками и до 4x ускорение генерации

    admin 18.07.2026


    Google представила DiffusionGemma — экспериментальную открытую модель, которая собирает текст крупными блоками вместо привычной генерации по одному токену. За счёт этого она работает до 4 раз быстрее на видеокартах. Модель вышла под свободной лицензией Apache 2.0, веса уже выложены на Hugging Face.

    Содержание

    1. Печатная машинка уступает место печатному станку
    2. 26 миллиардов параметров, в работе — 3,8
    3. Где двунаправленное внимание решает
    4. Скорость есть, за неё заплатили качеством
    5. Веса уже на Hugging Face
    6. Ниша для экспериментов, не замена флагмана

    Печатная машинка уступает место печатному станку

    Обычная языковая модель работает как машинистка: выдаёт по одному токену слева направо и каждый следующий рассчитывает только после предыдущего. На сервере это незаметно — облако склеивает тысячи запросов в пакеты и загружает железо равномерно. На домашнем GPU при одном пользователе картина иная: видеокарта простаивает, пока ждёт очередное «нажатие клавиши».

    DiffusionGemma переносит на текст приём из генераторов изображений. Те стартуют с цветового шума и постепенно проявляют картинку; модель Google так же начинает с холста из случайных токенов-заглушек и за несколько проходов уплотняет его до связного текста. За один проход она обрабатывает блок в 256 токенов целиком. Отсюда метафора самой Google: 

    Вместо машинистки — печатный станок, отпечатывающий абзац одним движением.

    26 миллиардов параметров, в работе — 3,8

    Под капотом DiffusionGemma — Mixture of Experts на 26 млрд параметров, из которых при выводе активны лишь 3,8 млрд (схема, где под каждый запрос включается только часть «экспертов»). В квантованном виде модель помещается в 18 ГБ видеопамяти, то есть в потолок топовых потребительских карт.

    Скорость Google измеряет конкретно: больше 1000 токенов в секунду на одной NVIDIA H100 и больше 700 — на игровой RTX 5090. Прирост до 4 раз достигается за счёт смены узкого места: декодирование смещается с пропускной способности памяти на вычисления, которыми ускоритель загружается полнее.

    Основа — семейство Gemma 4 и исследования Gemini Diffusion, поверх которых добавлена отдельная «диффузионная голова», заточенная под скорость.

    Где двунаправленное внимание решает

    Главное отличие от обычных моделей в том, что каждый токен в блоке видит все остальные, и предыдущие, и последующие. Для линейного текста это просто ускорение. На «нелинейных» задачах эффект качественный: вставка кода в середину функции, правка внутри готового абзаца, аминокислотные последовательности, математические графы.

    Показательный пример привела команда Unsloth, дообучившая DiffusionGemma играть в судоку. Авторегрессионные модели спотыкаются на этой задаче: каждая цифра зависит от ещё не написанных. Двунаправленное внимание снимает проблему, потому что модель оценивает всё поле сразу.

    Сюда же относится самокоррекция. За несколько проходов модель перечитывает собственный блок и правит ошибки на ходу, вместо того чтобы тащить их дальше по тексту, как при пословной генерации.

    Скорость есть, за неё заплатили качеством

    Google не прячет компромисс. По качеству вывода DiffusionGemma уступает обычной Gemma 4, и за максимальное качество компания прямо советует брать стандартную версию. Это инструмент для исследователей и разработчиков под скоростные интерактивные локальные сценарии: редактирование на лету, быстрые итерации, генерация в реальном времени.

    Второе ограничение — экономика. Ускорение работает на локальном и низконагруженном выводе. В облаке с высоким потоком запросов авторегрессионные модели и так загружают железо плотно, поэтому параллельное декодирование там приносит всё меньше выгоды и может выйти дороже в обслуживании. Отдельная оговорка для владельцев Mac: на Apple Silicon с общей памятью, упирающейся в её пропускную способность, того же ускорения может не быть.

    Веса уже на Hugging Face

    Запуск поддержан широким набором инструментов: MLX, vLLM, Hugging Face Transformers. Дообучение идёт через NVIDIA NeMo, Unsloth и собственный JAX-тулбокс Google под названием Hackable Diffusion. Поддержку llama.cpp обещают вскоре.

    С железом Google работала вместе с NVIDIA: квантование под RTX 5090 и 4090, ускоренные ядра NVFP4 (4-битные вычисления с плавающей точкой) для серверных Hopper и Blackwell, готовность к настольным DGX Spark и DGX Station. Попробовать модель можно и в облаке — через Model Garden на Gemini Enterprise Agent Platform или NVIDIA NIM.

    Ниша для экспериментов, не замена флагмана

    DiffusionGemma — не замена Gemma 4, и Google это не скрывает. Текстовая диффузия годами жила в исследованиях и плохо масштабировалась на большие модели; здесь её довели до открытой версии, которую можно скачать и запустить на домашней карте. Реальную ценность покажут не цифры скорости, а то, приживётся ли подход в живых сценариях: редактуре кода, инструментах с мгновенным откликом, задачах, где текст устроен нелинейно. Пока это сильная техническая заявка, проверять которую будут разработчики на своих RTX.



    Источник

    18.07.2026 0 комментариев
    0 VKOdnoklassnikiEmail
  • Генерация изображений

    Промт для Nano Banana: Новогодний 3D-персонаж в стиле Pixar

    admin 18.07.2026
    18.07.2026

    Этот промт для Nano Banana позволяет создавать очаровательных новогодних персонажей в мультяшном 3D-стиле. Он идеален для генерации праздничных иллюстраций с …

    0 VKOdnoklassnikiEmail
  • Обзор сервисов

    Интеграция Higgsfield AI с другими сервисами: CapCut, TikTok, Instagram и другие

    admin 18.07.2026
    18.07.2026

    ???? Higgsfield AI — мощный инструмент для видео-контента Нейросеть Higgsfield AI позволяет создавать впечатляющие видеоролики с помощью одного фото. Но …

    0 VKOdnoklassnikiEmail
  • Генерация изображений

    В Gemini появились цифровые аватары для Nano Banana

    admin 17.07.2026
    17.07.2026

    Google добавила в Gemini персональные аватары. Теперь можно один раз записать лицо и голос, после чего создавать изображения с собой …

    0 VKOdnoklassnikiEmail
  • Генерация изображений

    ByteDance выпустила Seedream 5.0 Pro для инфографики и точного редактирования изображений

    admin 17.07.2026
    17.07.2026

    ByteDance Seed 8 июля 2026 года представила Seedream 5.0 Pro — мультимодальную модель для генерации и редактирования изображений. Релиз делает …

    0 VKOdnoklassnikiEmail
  • Генерация видео

    Microsoft запускает бесплатный Bing Video Creator на базе Sora от OpenAI

    admin 17.07.2026
    17.07.2026

    Microsoft представила Bing Video Creator — бесплатный инструмент для создания коротких видеороликов по текстовым описаниям, использующий технологию Sora от OpenAI. …

    0 VKOdnoklassnikiEmail
  • Новости

    Агенты Claude заработали по расписанию и с ключами, скрытыми от модели

    admin 17.07.2026
    17.07.2026

    10 июня 2026 года на конференции Code with Claude Tokyo компания Anthropic объявила сразу о трёх обновлениях для работы с …

    0 VKOdnoklassnikiEmail
  • Генерация изображений

    Промт для нейросети: Кинематографичный экшн-портрет в динамике

    admin 17.07.2026
    17.07.2026

    Этот промт для [название нейросети] создаёт сочетание фотореалистичного портрета с абстрактной графикой, идеально подходящее для визуального сторителлинга в спортивном маркетинге …

    0 VKOdnoklassnikiEmail
  • Обзор сервисов

    Higgsfield AI Effects: интеграция в рабочие процессы маркетологов

    admin 17.07.2026
    17.07.2026

    ???? Что такое Higgsfield AI в контексте продакшена? Higgsfield AI — это генеративная нейросеть, которая на основе одной фотографии создает …

    0 VKOdnoklassnikiEmail
  • Генерация текста

    OpenAI выпустила Codex Micro — контроллер для управления ИИ-агентами за $230

    admin 16.07.2026
    16.07.2026

    OpenAI представила Codex Micro — компактный программируемый контроллер для работы с агентами Codex. Компания разработала устройство вместе с производителем клавиатур …

    0 VKOdnoklassnikiEmail
Новые
Старые

Свежие записи

  • 20 промтов для осенней ИИ-фотосессии в нейросетях
  • ElevenLabs добавила генерацию речи, музыки, изображений и видео в MCP
  • OpenAI покажет человекоподобного робота в 2027 году
  • ElevenLabs выпустила Music v2.5 с улучшенным звуком и точным следованием запросу
  • Думейт: от отчета к инструментам доработки

Свежие комментарии

Нет комментариев для просмотра.

Новые статьи

  • 20 промтов для осенней ИИ-фотосессии в нейросетях

    17.09.2026
  • ElevenLabs добавила генерацию речи, музыки, изображений и видео в MCP

    15.09.2026
  • OpenAI покажет человекоподобного робота в 2027 году

    14.09.2026
  • ElevenLabs выпустила Music v2.5 с улучшенным звуком и точным следованием запросу

    13.09.2026
  • Думейт: от отчета к инструментам доработки

    12.09.2026
  • Universal Music и ElevenLabs запустят музыкальную ИИ-платформу

    11.09.2026

Рубрики

  • Генерация видео (113)
  • Генерация звука (23)
  • Генерация изображений (89)
  • Генерация текста (68)
  • Новости (79)
  • Обзор сервисов (36)

20 промтов для осенней ИИ-фотосессии в нейросетях

17.09.2026

ElevenLabs добавила генерацию речи, музыки, изображений и видео...

15.09.2026

OpenAI покажет человекоподобного робота в 2027 году

14.09.2026

ElevenLabs выпустила Music v2.5 с улучшенным звуком и...

13.09.2026

Думейт: от отчета к инструментам доработки

12.09.2026

Обзоры

  • Higgsfield AI: Революция в создании видео с искусственным интеллектом

    30.07.2026
  • Как создать видео с эффектом Soul в Higgsfield AI: пошаговое руководство

    29.07.2026
  • Как оплатить Higgsfield AI и какие есть тарифы: подробный гайд

    28.07.2026

Выбор редакции

  • Промт для нейросети: Кинематографичный экшн-портрет в динамике

    17.07.2026
  • Krea выпустила Wan 2.5: генерация видео ИИ теперь со звуком

    29.06.2026
  • Открытый проект LangStream: революция в потоковой обработке данных для ИИ

    15.08.2026

Популярное

  • 1

    Промты для открытки на 23 февраля: +нейросети для создания открытки

    21.06.2026
  • 2

    Wan2.2 научилась рисовать: видеомодель от Krea теперь создаёт впечатляющие изображения по запросу

    24.06.2026
  • 3

    Higgsfield AI create video: создание видео с нуля

    21.06.2026
  • Pinterest
  • Youtube
  • Email
  • Vk
  • Rss
  • Yandex

@2026- All Right Reserved.


Наверх
AITopGuide
  • Новости
  • Генерация видео
  • Генерация изображений
  • Генерация звука
  • Генерация текста
  • Обзор сервисов