Ollama: como rodar modelos locais pelo terminal e criar uma API no PC
Ollama é uma forma direta de rodar modelos de IA no próprio computador. Ele baixa e executa modelos locais pelo terminal, mantém uma API em localhost e pode ser conectado a interfaces como o Open WebUI. Este guia mostra um caminho único para começar no Windows.

1. Instale o Ollama
Baixe a versão para Windows, macOS ou Linux em ollama.com/download. No Windows, o instalador torna o comando ollama disponível no PowerShell e deixa o serviço local pronto para uso.
Depois da instalação, feche e abra um terminal novo. Então execute:
ollama
Se o comando responder, a instalação está funcionando. Se aparecer que ollama não é reconhecido, abra outro terminal; se persistir, confira a instalação antes de continuar.

2. Rode seu primeiro modelo local
O comando ollama run baixa um modelo na primeira execução e abre uma conversa no terminal. Para começar, use um modelo pequeno ou médio:
ollama run gemma3
Quando o download terminar, escreva uma pergunta e pressione Enter. Para encerrar, use /bye ou Ctrl+C.
Não escolha o maior modelo só porque ele existe. O melhor ponto de partida depende da memória do seu PC. Consulte o guia de modelos locais por VRAM para decidir entre opções de 4B, 8B, 14B ou maiores.
3. Veja os modelos instalados e libere espaço
Para ver tudo o que já foi baixado, rode:
ollama list

ollama list, com os modelos locais disponíveis no computador.Outros comandos úteis são:
ollama ps
ollama stop nome-do-modelo
ollama rm nome-do-modelo
ollama psmostra os modelos carregados na memória.ollama stopdescarrega um modelo e libera memória RAM ou VRAM.ollama rmremove um modelo do disco.
4. Use o Ollama como API local
Além do terminal, o Ollama disponibiliza uma API local em http://localhost:11434. É assim que aplicativos, scripts e interfaces web conversam com os modelos que estão no seu PC.
Um teste simples para uma conversa pela API é:
curl http://localhost:11434/api/chat -d '{ "model": "gemma3", "messages": [{ "role": "user", "content": "Explique IA local em três frases." }], "stream": false }'
O parâmetro stream: false retorna a resposta inteira de uma vez e facilita o primeiro teste. Em aplicações, o streaming pode mostrar a geração aos poucos.
Segurança: a API local não exige autenticação. Mantenha-a em localhost enquanto estiver aprendendo e não exponha a porta 11434 para a internet sem entender as implicações.
5. Conecte o Ollama a uma interface visual
O terminal é excelente para testar, automatizar e integrar. Mas você não precisa ficar nele para conversar com os modelos. O Open WebUI conecta-se ao Ollama e cria uma interface local no navegador, com conversas, seleção de modelos e histórico.
Se a sua prioridade é descobrir modelos, baixar arquivos GGUF e ajustar parâmetros visualmente, o LM Studio costuma ser mais confortável. Use Ollama quando quiser uma API simples, scripts, automações ou integração com outros programas.
6. Desempenho, memória e contexto
Modelo local não significa que qualquer modelo cabe em qualquer máquina. A memória usada depende do tamanho do modelo, da quantização, do tamanho do contexto e da aceleração disponível. Se a geração estiver lenta, comece por um modelo menor e feche programas que consomem GPU.
Por padrão, o Ollama pode manter o último modelo carregado por alguns minutos para acelerar novas mensagens. Se precisar liberar recursos imediatamente, use ollama stop nome-do-modelo. Em integrações pela API, a opção keep_alive permite controlar esse comportamento.
7. Erros comuns
- “ollama não é reconhecido”: abra outro terminal; se não resolver, confira a instalação e o PATH.
- Não consigo conectar na API: confirme que o Ollama está aberto e teste
http://localhost:11434no próprio computador. - Download interrompido: confira espaço em disco e conexão antes de repetir.
- PC lento ou travando: reduza o tamanho do modelo e o contexto.
- O modelo inventou uma resposta: IA local também pode alucinar. Valide informações importantes em fontes confiáveis.
Próximos passos
- Aprenda a usar Open WebUI com Ollama para conversar pelo navegador.
- Veja o guia do LM Studio se prefere uma experiência visual.
- Use o llama.cpp quando precisar de mais controle sobre arquivos GGUF e parâmetros.
- Se está começando do zero, siga o guia para rodar IA local no PC.
Fontes oficiais
Para informações atualizadas, consulte o quickstart do Ollama, a documentação da API de chat e a página de instalação no Windows.
