RemarkableCloud

Apps / Ollama

Hosting Ollama administrado.
Un servidor, sin límite de apps.

Run open LLMs on your own server. Honest requirement: real models want real RAM, and the meter will route you to the right plan.

Qué es

Ollama corre modelos de lenguaje grandes en tu propio servidor: Llama, Mistral, Qwen y el mundo de modelos abiertos tras una API local limpia, con tus prompts sin salir jamás de la máquina.

RAM mínima

16 GB

Cabe en SC-16GB; SC-48GB es la opción cómoda con espacio para apilar.

Qué instalamos

El playbook despliega el Ollama actual con la API ligada en privado por defecto, tus modelos iniciales descargados, memoria dimensionada al plan y el servicio supervisado. Open WebUI al lado es un checkbox más.

Qué cubre administrado

Actualizaciones de plataforma y servidor, snapshots diarios más respaldos duales, monitoreo de memoria y del servicio, y el firewall administrado manteniendo la API fuera del internet público salvo que decidas otra cosa.

La app es $0. El servidor administrado es la única factura, y todo lo de arriba es parte de ella.

¿Qué incluye el hosting Ollama administrado?

Un servidor de modelos locales funcionando, dimensionado con honestidad, actualizado y asegurado por defecto, a precio plano sin nada por token. La API es tuya; el medidor no existe.

¿Qué puede correr realmente un servidor de CPU?

La respuesta honesta: modelos pequeños y medianos. Los de clase 7B corren aceptablemente para chat y borradores en 16 GB; un 13B cuantizado cabe con paciencia; los modelos grandes quieren GPUs que no vendemos, y lo diremos antes que venderte decepción. Para resúmenes, extracción y chat privado, un 7B servido por CPU es genuinamente útil.

¿Por qué correr modelos localmente?

Privacidad y forma del costo. Documentos de clientes, contratos y datos internos se procesan sin salir de tu servidor, lo que convierte conversaciones enteras de cumplimiento en un encogimiento de hombros. Y un precio plano de servidor le gana al cobro por token en cuanto el uso se vuelve rutina.

¿Qué se empareja con Ollama?

Open WebUI para una interfaz estilo ChatGPT encima, y n8n para automatización que llama a los modelos: resumir correo entrante, borrar respuestas, clasificar tickets, todo por localhost, todo privado. El kit IA Privada empaqueta exactamente esto.

Apílalo

Ollama funciona bien con.

Mismo servidor, sin factura extra. Estos son los compañeros que más se despliegan junto a Ollama.

Open WebUI

+2 GB

La interfaz de chat para tus modelos locales: multiusuario, con documentos, y la transcripción sin salir de casa.

n8n

+2 GB

Automatización con más de 400 integraciones y ejecuciones ilimitadas: tus flujos, tus credenciales, tu servidor.

Preguntas frecuentes

¿Cuánta RAM necesita Ollama?

16 GB es el mínimo honesto para uso cómodo de clase 7B, y el medidor lo exige. Más RAM significa modelos más grandes o menos cuantizados.

¿Qué modelos puedo descargar?

Lo que esté en la biblioteca de Ollama o sea importable como GGUF: Llama, Mistral, Qwen, Gemma, Phi y el resto del mundo abierto.

¿La API está expuesta?

No por defecto: se liga en privado, las apps del mismo servidor la alcanzan por localhost, y el acceso remoto pasa por WireGuard o un permiso deliberado de firewall.

¿Dimensionando una pila de apps? La calculadora de dimensionamiento VPS recomienda un plan según tus apps y tráfico, con el cálculo a la vista.

Your server runs. You sleep.

Fully managed hosting from people who have been doing this since 2001.