Otimização de modelos de reconhecimento de fala atinge aceleração de até 10 vezes com novas técnicas de inferência
A plataforma NVIDIA NeMo anunciou otimizações que permitem acelerar em até dez vezes o desempenho de modelos de reconhecimento automático de fala que lideram o ranking Open ASR Leaderboard, mantido pela Hugging Face. Os ganhos foram obtidos por meio de três inovações principais aplicadas durante o processo de inferência, que é a etapa em que o modelo já treinado é utilizado para transcrever áudios em texto.
A primeira técnica consiste na conversão automática de tensores — estruturas de dados usadas pelos modelos de inteligência artificial — para o formato bfloat16, um padrão numérico que reduz o consumo de memória e acelera cálculos em GPUs modernas. A segunda inovação é o algoritmo conhecido como label-looping, que reorganiza a forma como o modelo gera as transcrições, evitando etapas redundantes no processamento. Por fim, foram aplicadas otimizações com CUDA Graphs, recurso que permite ao sistema executar sequências inteiras de operações de forma pré-configurada na GPU, diminuindo o tempo gasto com inicializações repetidas.
Os resultados aparecem em testes com modelos de reconhecimento de fala que ocupam as primeiras posições no leaderboard da Hugging Face, plataforma de código aberto dedicada a modelos de aprendizado de máquina. Segundo a divulgação, essas arquiteturas foram originalmente projetadas para equilibrar precisão e velocidade, e os ajustes apresentados ampliam esse equilíbrio sem alterar a acurácia das transcrições.
Além do ganho bruto de velocidade, a nova abordagem também traz vantagens econômicas relevantes. De acordo com os dados apresentados, a inferência em GPU oferece economia de até quatro vezes e meia em relação a alternativas baseadas apenas em CPU. O cálculo considerou a transcrição de um milhão de horas de fala e levou em conta o custo por hora das instâncias de processamento envolvidas.
Os benchmarks foram executados em GPUs NVIDIA A100 de 80 gigabytes, com referência à instância p4de.24xlarge da AWS, que reúne oito unidades desse mesmo processador. O RTFx — métrica que indica quantos segundos de áudio o modelo consegue processar por segundo — foi o principal indicador utilizado para comparar o desempenho antes e depois das otimizações.
A divulgação destaca ainda que essas melhorias impactam diretamente aplicações práticas do reconhecimento de fala, como legendagem automática, assistentes de voz e sistemas de reunião, nas quais o tempo de resposta e o custo de operação são fatores decisivos. A combinação de arquiteturas já reconhecidas no leaderboard da Hugging Face com as novas técnicas de inferência aponta para um cenário em que modelos grandes de transcrição se tornam viáveis em escala produtiva, com tempos menores de resposta e despesas operacionais reduzidas.