A demanda por executar modelos de linguagem locais para garantir soberania de dados e velocidade de resposta explodiu em 2026. Entre todas as ferramentas disponíveis no ecossistema open-source, o Ollama consolidou-se como o padrão de fato pela sua simplicidade, performance otimizada em C++ (via llama.cpp) e compatibilidade nativa com o formato GGUF.
No entanto, instalar o binário diretamente no sistema operacional do servidor pode gerar conflitos de versões de drivers CUDA e dificuldades para gerenciar o ciclo de vida da aplicação em produção.
Neste tutorial prático, você aprenderá a configurar um ambiente profissional do Ollama conteinerizado com Docker, habilitando aceleração nativa por GPU, armazenamento persistente de volumes e proteção de rede para ambientes de produção.
Pré-requisitos do Sistema
- Servidor ou máquina com Ubuntu 24.04 LTS (ou distribuição Linux equivalente);
- Placa de vídeo NVIDIA com drivers proprietários atualizados (versão 550+ recomendada) ou CPU moderna com suporte a AVX2;
- Docker Engine e Docker Compose instalados.
Passo 1: Instalando o NVIDIA Container Toolkit
Para que os containers do Docker consigam se comunicar diretamente com as placas gráficas NVIDIA, é necessário instalar a camada de compatibilidade do NVIDIA Container Toolkit:
# 1. Configurar o repositório oficial da NVIDIA
curl -fsSL https://nvidia.github.io/libnvidia-container/gpgkey | sudo gpg --dearmor -o /usr/share/keyrings/nvidia-container-toolkit-keyring.gpg
curl -s -L https://nvidia.github.io/libnvidia-container/stable/deb/nvidia-container-toolkit.list | \
sed 's#deb https://#deb [signed-by=/usr/share/keyrings/nvidia-container-toolkit-keyring.gpg] https://#g' | \
sudo tee /etc/apt/sources.list.d/nvidia-container-toolkit.list
# 2. Atualizar pacotes e instalar o toolkit
sudo apt-get update
sudo apt-get install -y nvidia-container-toolkit
# 3. Configurar o runtime do Docker e reiniciar o serviço
sudo nvidia-ctk runtime configure --runtime=docker
sudo systemctl restart docker
Para validar se o Docker já enxerga sua GPU com sucesso, execute o teste de sanidade:
docker run --rm --gpus all nvidia/cuda:12.4.1-base-ubuntu22.04 nvidia-smi
Se a tabela de monitoramento da placa de vídeo for exibida no terminal, seu ambiente está pronto para acelerar modelos de IA com performance máxima!
Passo 2: Estrutura do Docker Compose para Produção
Crie uma pasta dedicada para o serviço e elabore o arquivo docker-compose.yml:
mkdir -p ~/ollama-production && cd ~/ollama-production
nano docker-compose.yml
Insira o conteúdo a seguir:
version: '3.8'
services:
ollama-service:
image: ollama/ollama:latest
container_name: ollama_core
restart: unless-stopped
ports:
# Expõe a API apenas localmente por segurança
- "127.0.0.1:11434:11434"
volumes:
# Armazenamento persistente de modelos baixados
- ./ollama_storage:/root/.ollama
environment:
- OLLAMA_KEEP_ALIVE=24h
- OLLAMA_NUM_PARALLEL=4
deploy:
resources:
reservations:
devices:
- driver: nvidia
count: all
capabilities: [gpu]
# Interface web opcional de administração (Open WebUI)
open-webui:
image: ghcr.io/open-webui/open-webui:main
container_name: ollama_webui
restart: unless-stopped
ports:
- "127.0.0.1:8080:8080"
volumes:
- ./webui_storage:/app/backend/data
environment:
- OLLAMA_BASE_URL=http://ollama-service:11434
depends_on:
- ollama-service
Passo 3: Inicialização e Download de Modelos
Suba os serviços em segundo plano com um único comando:
docker compose up -d
Agora, vamos baixar um modelo moderno e eficiente (como o Llama 3.2 ou Phi-4) diretamente para o container:
# Executa o comando pull dentro do container
docker exec -it ollama_core ollama pull llama3.2:3b
Para testar a inferência diretamente pelo terminal:
docker exec -it ollama_core ollama run llama3.2:3b "Explique o conceito de Zero Trust em cibersegurança em 2 parágrafos."
Passo 4: Chamando a API via REST e Integração em Aplicações
Seu servidor agora disponibiliza uma API compatível com os padrões da indústria. Você pode consultá-la via cURL ou integrá-la ao backend de suas aplicações em Node.js, Python ou Go:
curl http://127.0.0.1:11434/api/generate -d '{
"model": "llama3.2:3b",
"prompt": "Quais as 3 melhores práticas de segurança para servidores Linux?",
"stream": false
}'
Boas Práticas de Segurança em Produção
- Nunca exponha a porta 11434 para a internet pública (
0.0.0.0): O Ollama nativamente não possui autenticação por senha. Mantenha-o restrito aolocalhoste use um proxy reverso com Nginx e autenticação via cabeçalho HTTP Bearer. - Defina variáveis de retenção de memória (
OLLAMA_KEEP_ALIVE): Em ambientes corporativos com alto fluxo, manter os pesos do modelo carregados na VRAM da GPU evita o atraso de carregamento do disco a cada requisição. - Backup regular dos volumes: Ao armazenar os modelos em
./ollama_storage, seus downloads e arquivos de configuração ficam protegidos mesmo se o container for atualizado ou recriado.
Conclusão
Com esse setup, você possui uma infraestrutura de IA privada, resiliente e de alto desempenho rodando dentro da sua própria infraestrutura corporativa, garantindo 100% de conformidade com a LGPD e custo zero de chamadas de API externas.
Se você quer integrar soluções avançadas de IA e sistemas web ultra-seguros ao seu negócio, conte com a expertise da Landingfymax. Conheça nossos projetos e eleve sua empresa ao próximo nível.




