PUBLICIDADE

Hugging Face une Transformers e llama.cpp: modelos quantizados GGUF agora rodam nativamente na biblioteca

22/09/2026
60 visualizações
4 min de leitura
Imagem principal do post

Transformers agora executa modelos quantizados do llama.cpp diretamente

A biblioteca Transformers, da plataforma Hugging Face, passou a oferecer suporte nativo para modelos quantizados no formato GGUF, o mesmo utilizado pelo motor de inferência llama.cpp. O avanço foi apresentado em publicação no blog oficial da empresa e marca mais um passo na união entre as duas ferramentas, após a chegada da equipe responsável pelo llama.cpp e pelo GGML ao time da Hugging Face.

A novidade é resultado direto da aquisição da GGML pela Hugging Face, anunciada em fevereiro. Na época, a empresa descreveu as funções complementares das duas tecnologias: enquanto o llama.cpp oferece uma base sólida para a execução local de modelos de inteligência artificial, o Transformers é a base para a definição desses modelos. Com o suporte ao formato GGUF, as duas ferramentas ficaram mais próximas do que nunca, permitindo que desenvolvedores utilizem modelos quantizados diretamente dentro do ecossistema Transformers.

Imagem complementar

Para entender o impacto, é importante conhecer alguns conceitos. O llama.cpp é um motor de inferência escrito em C e C++, projetado para rodar grandes modelos de linguagem localmente, sem depender de Python, CUDA ou de infraestruturas pesadas de servidor. O formato GGUF, também desenvolvido pela mesma equipe, é um arquivo binário otimizado para carregar e salvar modelos rapidamente, além de oferecer suporte a técnicas de quantização e mapeamento de memória que reduzem o consumo de banda no dispositivo do usuário. A quantização, por sua vez, é um processo que comprime os pesos do modelo, permitindo que modelos muito grandes sejam executados em hardware mais acessível, incluindo placas gráficas de consumo.

O artigo assinado por Marc Sun, Arthur Zucker e Lysandre detalha comparações de desempenho entre o llama.cpp e o Transformers rodando os mesmos modelos quantizados. Para medir o desempenho do llama.cpp, os autores utilizaram a ferramenta llama-bench, na versão build 5f55650a7, release b10200, com backend Metal do ggml 0.18.0. O comando executado foi llama-bench -m -p 0 -n 128 -r 3, que gera a métrica tg128, representando a taxa de geração de tokens ao decodificar 128 tokens, calculada como média de três repetições e sem contabilizar o processamento do prompt inicial.

PUBLICIDADE

Já no caso do Transformers, a avaliação foi feita com o método generate, produzindo os mesmos 128 tokens a partir de um prompt de 12 palavras, considerando o melhor resultado entre três execuções aquecidas e incluindo a etapa de prefill, que corresponde ao processamento inicial do prompt antes da geração dos tokens.

Os resultados apresentados indicam que a integração aproxima o desempenho do Transformers ao do llama.cpp, o que representa um ganho expressivo para quem utiliza a biblioteca em fluxos que dependem exclusivamente dela. Em um dos exemplos compartilhados na publicação, o modelo Qwen3.6 27B foi executado dentro do agente de programação Pi, via llama.cpp, em um MacBook Pro. Segundo relato compartilhado na publicação, para tarefas não triviais nos códigos da própria Hugging Face, o resultado ficou muito próximo do obtido com o modelo Opus, da Anthropic, no Claude.

A integração também foi destaque no anúncio anterior da chegada da GGML à Hugging Face. Naquela ocasião, a empresa afirmou que o llama.cpp é o bloco fundamental para a inferência local, enquanto o Transformers é o bloco fundamental para a definição de modelos, descrevendo a união como uma combinação perfeita. O objetivo compartilhado, segundo a empresa, é fornecer à comunidade os blocos de construção necessários para tornar a superinteligência aberta acessível ao mundo nos próximos anos.

Para os desenvolvedores e entusiastas de inteligência artificial, o suporte nativo ao formato GGUF no Transformers significa menos etapas para colocar modelos quantizados em produção. Em vez de converter pesos ou recorrer exclusivamente ao llama.cpp para executar modelos compactados, agora é possível carregá-los diretamente pela interface familiar da biblioteca, mantendo compatibilidade com o restante do ecossistema da Hugging Face.

A movimentação também é vista como um reforço ao crescimento da comunidade de inteligência artificial local. Ao unificar descoberta de modelos, quantização e implantação em um único pipeline, a Hugging Face reduz barreiras de entrada para quem deseja rodar modelos de linguagem em hardware próprio, sem depender de servidores em nuvem. O resultado é um ecossistema mais integrado, no qual as ferramentas de definição e de execução de modelos caminham juntas dentro de uma mesma plataforma.

PUBLICIDADE
Este post foi útil para você?
🛒
Vai rodar IA no seu computador?

Modelos locais dependem da placa de vídeo: quanto mais VRAM, maiores os modelos e mais rápidas as respostas. Compare os preços de placas RTX na Amazon.

Ver preços na Amazon →
Como associado da Amazon, o blog ganha com compras qualificadas, sem custo extra para você.

Leitura recomendada

💬 Comentários

Nenhum comentário ainda. Conte o que achou, tire uma dúvida ou discorde. Seja o primeiro!

Deixe seu comentário
O e-mail não aparece. Serve só para avisar quando responderem você.
Os comentários passam por aprovação antes de aparecer. Crie uma conta de leitor e, depois do primeiro aprovado, os próximos saem na hora.
Apoie o ConexãoTC

O ConexãoTC é independente e gratuito. Se as notícias fazem parte do seu dia, contribua com qualquer valor pelo PIX e ajude a manter o blog no ar.

QR code PIX para apoiar o ConexãoTC
Aponte a câmera do app do banco
Favorecido: Jean Dgardany C. Lima, editor do ConexãoTC
🗳️ O que você quer ler aqui?

Marque os assuntos que te interessam. Os mais pedidos viram os próximos artigos.

Leitores cadastrados têm as sugestões atendidas primeiro e recebem um aviso quando o artigo sai.
Fique por dentro

Os destaques do dia no seu e-mail, todo dia às 8h.

PUBLICIDADE