Servidor VPS para IA: o que roda e como dimensionar imprimir

  • vps, inteligência artificial, ollama, n8n, chatbot
  • 0

Um servidor VPS para IA roda bem chatbots, automações e APIs que chamam serviços de inteligência artificial, além de modelos pequenos locais em CPU. Treinar modelos ou rodar modelos grandes com rapidez exige GPU, e aí o VPS comum não é a ferramenta certa.

Este guia explica, sem exagero, o que dá para colocar de pé em um VPS, onde estão os limites, como pensar em CPU, memória e disco, quais cuidados de segurança não podem faltar e um passo a passo de um projeto simples.

O que dá para rodar de IA em um VPS

A maior parte dos projetos de IA de pequenas empresas não precisa de uma máquina poderosa. O motivo é simples: o trabalho pesado costuma acontecer no provedor do modelo, e o seu servidor só organiza a conversa, guarda dados e responde ao usuário.

Chatbots e automações que chamam APIs de IA

É o uso mais comum. Seu código recebe uma mensagem (do site, do WhatsApp, do Telegram, de um formulário), envia o texto para a API de um modelo de linguagem, recebe a resposta e devolve ao usuário. O VPS faz tarefas leves:

  • receber e responder requisições HTTP ou webhooks;
  • montar o prompt com instruções e dados do seu negócio;
  • guardar histórico de conversas em um banco de dados;
  • registrar logs, limitar abusos e controlar custos de uso da API.

Nesse cenário, um VPS modesto atende bem, porque a espera maior é pela resposta da API, não pelo processador do seu servidor. Se o seu projeto é um bot de Discord, robô de tarefas ou automação sem IA, o guia VPS para bots e automações cobre esse assunto em detalhes.

n8n com nós de IA

O n8n é uma ferramenta de automação visual que tem nós prontos para modelos de linguagem, agentes e bases vetoriais. Com ele você monta fluxos como "ler e-mail, resumir com IA, classificar e criar tarefa" sem escrever muito código. O processamento de IA continua na API externa; o n8n só orquestra. A Eleven Host tem uma linha própria de planos n8n (n8n Start, n8n Pro, n8n Business, n8n Essencial e n8n Turbo) para quem prefere não instalar tudo do zero em um VPS.

Sua própria API ou aplicação com IA

Se você desenvolve, pode publicar uma API em Python (FastAPI, Flask) ou Node.js que usa IA por trás: geração de descrições de produtos, resumo de documentos, busca inteligente em manuais internos. Um padrão popular é o RAG (geração aumentada por recuperação): você transforma seus documentos em vetores, guarda em um banco como PostgreSQL com a extensão pgvector ou Qdrant e, a cada pergunta, busca os trechos relevantes antes de chamar o modelo. Tudo isso roda bem em CPU, desde que a geração de embeddings também seja feita por API ou por um modelo pequeno.

Modelos pequenos locais com Ollama ou llama.cpp

Dá, sim, para rodar um modelo de linguagem dentro do VPS, sem GPU, usando ferramentas como Ollama ou llama.cpp. Elas usam modelos quantizados (formato GGUF, por exemplo), que ocupam bem menos memória que a versão original. Na prática:

  • modelos de 1 a 3 bilhões de parâmetros rodam com folga em CPU e servem para classificação, extração de dados e respostas curtas;
  • modelos de 7 a 8 bilhões, quantizados em 4 bits, precisam de alguns gigabytes de RAM livre só para o modelo e respondem de forma lenta, com poucos tokens por segundo;
  • a velocidade depende muito da quantidade de núcleos, da geração do processador e de quantas pessoas usam ao mesmo tempo.

Vale para testes, uso interno, tarefas em lote durante a madrugada ou quando os dados não podem sair do seu servidor. Para atendimento ao público com muitas conversas simultâneas, uma API externa costuma ser mais rápida e mais barata no total.

O que não roda bem sem GPU

Ser honesto aqui evita dinheiro jogado fora. Em um VPS apenas com CPU, estes usos tendem a ser lentos demais ou inviáveis:

  • Treinar modelos do zero: exige GPUs potentes por dias ou semanas.
  • Ajuste fino (fine-tuning) de modelos de linguagem: mesmo técnicas econômicas como LoRA dependem de GPU para terminar em tempo razoável.
  • Modelos grandes: modelos com dezenas de bilhões de parâmetros pedem muita memória e ficam lentíssimos em CPU.
  • Geração de imagens e vídeo (Stable Diffusion e similares): funciona em CPU só como experimento, com minutos por imagem.
  • Muitos usuários ao mesmo tempo em um modelo local: cada conversa disputa os mesmos núcleos.

Se o seu projeto cai nessa lista, a saída geralmente é usar a API de um provedor de modelos ou contratar infraestrutura com GPU. Antes de planejar algo que dependa de GPU, confirme com a equipe comercial da Eleven Host o que está disponível.

Como dimensionar CPU, RAM e disco

Não existe número mágico, porque tudo depende do tipo de projeto e do volume de uso. Use estas orientações gerais como ponto de partida e ajuste olhando o consumo real.

Projetos que só chamam APIs

  • CPU: poucos núcleos bastam no início; o gargalo é a rede e a API.
  • RAM: considere o sistema, sua aplicação, o banco de dados e ferramentas como n8n e Redis. Cada serviço extra em Docker soma memória.
  • Disco: SSD é importante para o banco de dados e os logs. Reserve espaço para crescimento do histórico e para backups locais temporários.

Projetos com modelo local

  • RAM: é o fator decisivo. O modelo inteiro precisa caber na memória, com sobra para o sistema e a aplicação. Uma regra prática é somar o tamanho do arquivo do modelo quantizado, mais uma margem para o contexto da conversa, mais o que os outros serviços usam.
  • CPU: mais núcleos e processadores mais novos geram texto mais rápido. Em VPS com poucos núcleos, espere respostas lentas.
  • Disco: cada modelo ocupa de centenas de megabytes a vários gigabytes. Se for testar vários, reserve espaço para isso.

Como escolher o plano sem chutar

  1. Liste tudo o que vai rodar no servidor (aplicação, banco, n8n, Ollama, proxy).
  2. Comece por um plano intermediário e meça com htop, free -h e df -h durante o uso real.
  3. Se a memória vive no limite ou o servidor usa swap o tempo todo, suba de plano.
  4. Se a CPU fica em 100% só quando o modelo local responde, considere um modelo menor ou trocar para API.

A linha de VPS da Eleven Host vai do [BR] PLANO BRONZE ao [BR] PLANO TITANIUM, com a opção [BR] PLANO CUSTOM, e há servidores bare metal para quem precisa de uma máquina física inteira. O artigo como escolher entre os planos VPS da 11Host ajuda a comparar as opções.

Coloque seu chatbot, automação ou API de IA no ar em um servidor com datacenter no Brasil. Ver planos de VPS

Segurança básica para projetos de IA

Projetos de IA costumam guardar chaves de API que geram cobrança por uso. Uma chave vazada pode virar uma fatura alta em poucas horas. Estes cuidados são o mínimo:

Proteja as chaves de API

  • Guarde chaves em variáveis de ambiente ou em arquivo .env com permissão restrita, nunca dentro do código.
  • Coloque o .env no .gitignore para não publicar a chave no GitHub por engano.
  • Defina limites de gasto e alertas no painel do provedor de IA.
  • Se suspeitar de vazamento, revogue a chave e gere outra imediatamente.

Feche portas com firewall

  • Libere só o necessário, em geral SSH, 80 e 443. No Ubuntu: ufw allow OpenSSH, ufw allow 80,443/tcp e ufw enable.
  • Não exponha na internet a porta do Ollama (11434) nem a do banco de dados. Deixe esses serviços ouvindo só em 127.0.0.1 ou na rede interna do Docker.
  • Atenção: portas publicadas pelo Docker podem passar por fora do ufw. Publique como 127.0.0.1:porta:porta quando o serviço for só interno.
  • Coloque a aplicação atrás de um proxy reverso (Nginx, Caddy) com HTTPS. Veja o guia de como instalar certificado SSL.

Mantenha tudo atualizado

  • Atualize o sistema com frequência (apt update && apt upgrade) e ative atualizações automáticas de segurança.
  • Atualize imagens Docker, n8n e bibliotecas de IA, que mudam rápido.
  • Use login por chave SSH e desative o acesso por senha do root.
  • Tenha backup do banco e das configurações fora do servidor.

Passo a passo: um assistente de perguntas simples

Exemplo de projeto enxuto: uma pequena API que responde dúvidas sobre seus serviços, usando um modelo pequeno local. Se preferir usar uma API externa, troque apenas o passo 4.

  1. Contrate e acesse o VPS. Escolha Linux (Ubuntu ou Debian) e conecte por SSH. Se for a primeira vez, siga o guia como acessar um VPS pela primeira vez.
  2. Prepare o servidor. Atualize os pacotes, crie um usuário comum com sudo, configure login por chave e ative o firewall liberando só SSH, 80 e 443.
  3. Instale o Ollama. Use o script de instalação oficial publicado no site do projeto e confirme com ollama --version.
  4. Baixe um modelo pequeno. Por exemplo, ollama pull llama3.2:3b, e teste com ollama run llama3.2:3b. Observe o uso de memória com free -h.
  5. Crie a API. Um script em Python com FastAPI recebe a pergunta, adiciona instruções sobre o seu negócio e envia para http://127.0.0.1:11434/api/generate. A resposta volta em JSON.
  6. Coloque um proxy reverso com HTTPS. Nginx ou Caddy recebe as requisições do seu domínio e repassa para a API, que fica ouvindo só localmente.
  7. Proteja o acesso. Exija um token no cabeçalho das requisições e limite a quantidade de chamadas por IP para evitar abuso.
  8. Rode como serviço. Use systemd ou Docker Compose para a API reiniciar sozinha após quedas ou reinicializações.
  9. Monitore e ajuste. Acompanhe tempo de resposta e uso de RAM. Se ficar lento, teste um modelo menor, reduza o tamanho do contexto ou mude para uma API externa.

Com esse caminho você valida a ideia gastando pouco e descobre, com dados reais, se precisa de mais recursos.

Tem dúvida sobre qual plano atende o seu projeto de IA? Fale com quem entende de servidor. Falar com a equipe

Perguntas frequentes

Preciso de GPU para ter um chatbot com IA?

Não. Se o chatbot usa a API de um provedor de modelos, o processamento acontece lá, e um VPS comum com CPU dá conta de receber e responder as mensagens.

Dá para rodar o ChatGPT dentro do meu VPS?

Não. Os modelos desses serviços ficam na infraestrutura do provedor e são acessados por API. No seu VPS você pode rodar modelos abertos menores com Ollama ou llama.cpp.

Quanto de RAM preciso para rodar um modelo local?

O modelo quantizado precisa caber inteiro na memória, com folga para o sistema e a aplicação. Modelos de 1 a 3 bilhões de parâmetros pedem pouco; modelos de 7 a 8 bilhões já exigem alguns gigabytes livres.

A Eleven Host oferece servidores com GPU?

Para projetos que dependem de GPU, consulte a equipe comercial antes de contratar: ela informa o que está disponível no momento.

Posso usar o n8n com IA em vez de programar?

Sim. O n8n tem nós prontos para modelos de linguagem e agentes, e você pode instalá-lo em um VPS ou usar um dos planos n8n da Eleven Host.


Esta resposta lhe foi útil?