Секрет в архитектуре. В отличие от классических LLM, которые генерируют текст слово за словом, DiffusionGemma использует принцип диффузии. Модель создает весь ответ целиком как зашумленную картинку, а затем последовательно очищает его, восстанавливая идеальный текст. Это дает радикальный прирост скорости.
Звучит фантастически? Да, но есть нюанс. Для запуска DiffusionGemma требуется специализированное оборудование, недоступное большинству пользователей. Пока что технология работает только на мощностях Google Cloud, но сам факт появления такой производительности в открытом доступе меняет правила игры.
1000 токенов в секунду — это не эволюция, а смена парадигмы.