Fluxo visual do Ollama: comando local, modelo de IA e servidor local
|

Ollama: como rodar modelos locais pelo terminal e criar uma API no PC

Ollama é uma forma direta de rodar modelos de IA no próprio computador. Ele baixa e executa modelos locais pelo terminal, mantém uma API em localhost e pode ser conectado a interfaces como o Open WebUI. Este guia mostra um caminho único para começar no Windows.

Fluxo visual do Ollama: comando local, modelo de IA e servidor local
Ollama transforma um comando no terminal em um modelo local disponível para outras aplicações.

1. Instale o Ollama

Baixe a versão para Windows, macOS ou Linux em ollama.com/download. No Windows, o instalador torna o comando ollama disponível no PowerShell e deixa o serviço local pronto para uso.

Depois da instalação, feche e abra um terminal novo. Então execute:

ollama

Se o comando responder, a instalação está funcionando. Se aparecer que ollama não é reconhecido, abra outro terminal; se persistir, confira a instalação antes de continuar.

Interface do aplicativo Ollama com seleção de modelo local
Interface do Ollama para iniciar uma conversa e selecionar um modelo local.

2. Rode seu primeiro modelo local

O comando ollama run baixa um modelo na primeira execução e abre uma conversa no terminal. Para começar, use um modelo pequeno ou médio:

ollama run gemma3

Quando o download terminar, escreva uma pergunta e pressione Enter. Para encerrar, use /bye ou Ctrl+C.

Não escolha o maior modelo só porque ele existe. O melhor ponto de partida depende da memória do seu PC. Consulte o guia de modelos locais por VRAM para decidir entre opções de 4B, 8B, 14B ou maiores.

3. Veja os modelos instalados e libere espaço

Para ver tudo o que já foi baixado, rode:

ollama list
Resultado do comando ollama list mostrando os modelos locais instalados
Resultado do comando ollama list, com os modelos locais disponíveis no computador.

Outros comandos úteis são:

ollama ps
ollama stop nome-do-modelo
ollama rm nome-do-modelo
  • ollama ps mostra os modelos carregados na memória.
  • ollama stop descarrega um modelo e libera memória RAM ou VRAM.
  • ollama rm remove um modelo do disco.

4. Use o Ollama como API local

Além do terminal, o Ollama disponibiliza uma API local em http://localhost:11434. É assim que aplicativos, scripts e interfaces web conversam com os modelos que estão no seu PC.

Um teste simples para uma conversa pela API é:

curl http://localhost:11434/api/chat -d '{ "model": "gemma3", "messages": [{ "role": "user", "content": "Explique IA local em três frases." }], "stream": false }'

O parâmetro stream: false retorna a resposta inteira de uma vez e facilita o primeiro teste. Em aplicações, o streaming pode mostrar a geração aos poucos.

Segurança: a API local não exige autenticação. Mantenha-a em localhost enquanto estiver aprendendo e não exponha a porta 11434 para a internet sem entender as implicações.

5. Conecte o Ollama a uma interface visual

O terminal é excelente para testar, automatizar e integrar. Mas você não precisa ficar nele para conversar com os modelos. O Open WebUI conecta-se ao Ollama e cria uma interface local no navegador, com conversas, seleção de modelos e histórico.

Se a sua prioridade é descobrir modelos, baixar arquivos GGUF e ajustar parâmetros visualmente, o LM Studio costuma ser mais confortável. Use Ollama quando quiser uma API simples, scripts, automações ou integração com outros programas.

6. Desempenho, memória e contexto

Modelo local não significa que qualquer modelo cabe em qualquer máquina. A memória usada depende do tamanho do modelo, da quantização, do tamanho do contexto e da aceleração disponível. Se a geração estiver lenta, comece por um modelo menor e feche programas que consomem GPU.

Por padrão, o Ollama pode manter o último modelo carregado por alguns minutos para acelerar novas mensagens. Se precisar liberar recursos imediatamente, use ollama stop nome-do-modelo. Em integrações pela API, a opção keep_alive permite controlar esse comportamento.

7. Erros comuns

  • “ollama não é reconhecido”: abra outro terminal; se não resolver, confira a instalação e o PATH.
  • Não consigo conectar na API: confirme que o Ollama está aberto e teste http://localhost:11434 no próprio computador.
  • Download interrompido: confira espaço em disco e conexão antes de repetir.
  • PC lento ou travando: reduza o tamanho do modelo e o contexto.
  • O modelo inventou uma resposta: IA local também pode alucinar. Valide informações importantes em fontes confiáveis.

Próximos passos

Fontes oficiais

Para informações atualizadas, consulte o quickstart do Ollama, a documentação da API de chat e a página de instalação no Windows.

Posts Similares

Deixe um comentário

O seu endereço de e-mail não será publicado. Campos obrigatórios são marcados com *