Apps / Ollama
Hosting Ollama administrado.
Un servidor, sin límite de apps.
Run open LLMs on your own server. Honest requirement: real models want real RAM, and the meter will route you to the right plan.
Qué es
Ollama corre modelos de lenguaje grandes en tu propio servidor: Llama, Mistral, Qwen y el mundo de modelos abiertos tras una API local limpia, con tus prompts sin salir jamás de la máquina.
RAM mínima
16 GB
Cabe en SC-16GB; SC-48GB es la opción cómoda con espacio para apilar.
Qué instalamos
El playbook despliega el Ollama actual con la API ligada en privado por defecto, tus modelos iniciales descargados, memoria dimensionada al plan y el servicio supervisado. Open WebUI al lado es un checkbox más.
Qué cubre administrado
Actualizaciones de plataforma y servidor, snapshots diarios más respaldos duales, monitoreo de memoria y del servicio, y el firewall administrado manteniendo la API fuera del internet público salvo que decidas otra cosa.
La app es $0. El servidor administrado es la única factura, y todo lo de arriba es parte de ella.
¿Qué incluye el hosting Ollama administrado?
Un servidor de modelos locales funcionando, dimensionado con honestidad, actualizado y asegurado por defecto, a precio plano sin nada por token. La API es tuya; el medidor no existe.
¿Qué puede correr realmente un servidor de CPU?
La respuesta honesta: modelos pequeños y medianos. Los de clase 7B corren aceptablemente para chat y borradores en 16 GB; un 13B cuantizado cabe con paciencia; los modelos grandes quieren GPUs que no vendemos, y lo diremos antes que venderte decepción. Para resúmenes, extracción y chat privado, un 7B servido por CPU es genuinamente útil.
¿Por qué correr modelos localmente?
Privacidad y forma del costo. Documentos de clientes, contratos y datos internos se procesan sin salir de tu servidor, lo que convierte conversaciones enteras de cumplimiento en un encogimiento de hombros. Y un precio plano de servidor le gana al cobro por token en cuanto el uso se vuelve rutina.
¿Qué se empareja con Ollama?
Open WebUI para una interfaz estilo ChatGPT encima, y n8n para automatización que llama a los modelos: resumir correo entrante, borrar respuestas, clasificar tickets, todo por localhost, todo privado. El kit IA Privada empaqueta exactamente esto.
Apílalo
Ollama funciona bien con.
Mismo servidor, sin factura extra. Estos son los compañeros que más se despliegan junto a Ollama.
Open WebUI
+2 GBLa interfaz de chat para tus modelos locales: multiusuario, con documentos, y la transcripción sin salir de casa.
n8n
+2 GBAutomatización con más de 400 integraciones y ejecuciones ilimitadas: tus flujos, tus credenciales, tu servidor.
Preguntas frecuentes
¿Cuánta RAM necesita Ollama?
16 GB es el mínimo honesto para uso cómodo de clase 7B, y el medidor lo exige. Más RAM significa modelos más grandes o menos cuantizados.
¿Qué modelos puedo descargar?
Lo que esté en la biblioteca de Ollama o sea importable como GGUF: Llama, Mistral, Qwen, Gemma, Phi y el resto del mundo abierto.
¿La API está expuesta?
No por defecto: se liga en privado, las apps del mismo servidor la alcanzan por localhost, y el acceso remoto pasa por WireGuard o un permiso deliberado de firewall.
¿Dimensionando una pila de apps? La calculadora de dimensionamiento VPS recomienda un plan según tus apps y tráfico, con el cálculo a la vista.
Servidores Shared CPU
El hogar correcto para Ollama y la mayoría de pilas: vCPU 3.0+ GHz, desde $10/mes.
Ver Shared CPU →Servidores Dedicated CPU
Para pilas hambrientas de CPU y bases ocupadas: núcleos físicamente tuyos.
Ver Dedicated CPU →Todos los planes y precios
Cada plan, ambas familias, un precio honesto con todo incluido.
Ver precios →Your server runs. You sleep.
Fully managed hosting from people who have been doing this since 2001.