llama.cpp: guia para rodar modelos GGUF com máximo controle
llama.cpp é o motor leve por trás de grande parte do ecossistema de IA local. Ele roda modelos no formato GGUF, funciona em CPU e pode aproveitar diferentes tipos de GPU. É menos amigável que LM Studio, mas oferece controle fino e uma ótima base para quem quer entender o que acontece por baixo da interface.

Quando usar llama.cpp
Ele é indicado para quem quer rodar modelos diretamente pelo terminal, criar um servidor próprio, testar quantizações diferentes ou aproveitar hardware sem depender de uma interface gráfica.
1. Baixe ou compile
O caminho mais técnico é clonar o repositório oficial e compilar usando CMake. Em um terminal com Git e CMake instalados:
git clone https://github.com/ggml-org/llama.cpp
cd llama.cpp
cmake -B build
cmake --build build --config Release
O projeto suporta diferentes backends, como CPU, CUDA, Metal e Vulkan. A escolha depende do seu sistema e da sua placa de vídeo. Consulte o guia oficial para os parâmetros específicos de cada backend.
2. Entenda o formato GGUF
llama.cpp trabalha principalmente com arquivos GGUF. Eles armazenam o modelo e seus metadados em um formato pensado para inferência local. Você pode baixar um arquivo GGUF manualmente de um repositório confiável ou usar a opção -hf para buscar modelos compatíveis.
3. Rode um prompt
Depois de ter um arquivo GGUF, use o executável gerado na pasta de build. O nome do binário pode variar conforme o sistema, mas a ideia é:
llama-cli -m caminho/para/modelo.gguf -p "Explique quantização em linguagem simples."
Se o binário estiver dentro de build/bin, informe esse caminho. Execute --help para ver os parâmetros disponíveis na versão que você compilou.
4. Crie um servidor local
Para expor o modelo a outras aplicações, use o servidor:
llama-server --model caminho/para/modelo.gguf
Isso cria uma interface HTTP local. É útil para testes, interfaces web e integrações. Evite expor essa porta diretamente à internet sem autenticação e sem saber o que está fazendo.
5. GPU e camadas
Em máquinas com GPU compatível, você pode descarregar parte das camadas do modelo para a placa de vídeo. O parâmetro exato e o suporte variam conforme o backend. Comece com a documentação do seu sistema, faça testes curtos e monitore VRAM, temperatura e velocidade.
Problemas comuns
- Erro ao compilar: atualize CMake e confira o guia do backend escolhido.
- Modelo não abre: confirme se o arquivo é GGUF e se o caminho está correto.
- Lento demais: use uma quantização menor, reduza contexto e avalie acelerar por GPU.
Quando usar llama.cpp
Escolha o llama.cpp quando quiser controle fino sobre arquivos GGUF, quantização, contexto e aceleração por hardware. Para começar de forma mais visual, use LM Studio; para terminal e API local, use Ollama.
Antes de baixar um arquivo, consulte o guia de modelos por VRAM e, se estiver começando, veja como rodar IA local no PC.
Fonte oficial: guia de compilação do llama.cpp e repositório do projeto.
