SmoothCache: Uma técnica universal de aceleração de inferência para transformadores de difusão
Author
Venue
Workshop CVPR eLVM 2025
Abstract
Os Transformadores de Difusão (DiT) surgiram como modelos generativos poderosos para várias tarefas, incluindo síntese de imagem, vídeo e fala. No entanto, seu processo de inferência continua sendo computacionalmente oneroso devido à avaliação repetida de módulos de atenção e feed-forward que consomem muitos recursos. Para resolver isso, apresentamos o SmoothCache, uma técnica de aceleração de inferência independente de modelo para arquiteturas DiT. O SmoothCache aproveita a alta similaridade observada entre as saídas das camadas em intervalos de tempo de difusão adjacentes. Ao analisar erros de representação por camada a partir de um pequeno conjunto de calibração, o SmoothCache armazena em cache e reutiliza de forma adaptativa características-chave durante a inferência. Nossos experimentos demonstram que o SmoothCache alcança um aumento de velocidade de 8% a 71%, mantendo ou até mesmo melhorando a qualidade da geração em diversas modalidades. Demonstramos sua eficácia no DiT-XL para geração de imagens, no Open-Sora para conversão de texto em vídeo e no Stable Audio Open para conversão de texto em áudio, destacando seu potencial para viabilizar aplicações em tempo real e ampliar a acessibilidade de poderosos modelos DiT.
