Elegir modelo LLM, Ollama Cloud

imagen-ollama-cloud

Con la cantidad de modelos LLM que aparecen cada semana, elegir uno que sea a la vez razonablemente bueno y económico se ha convertido en un trabajo en sí mismo. Al principio te guías por lo que oyes: tus amigos, los canales de YouTube donde descubres herramientas nuevas. Pero con la experiencia, la frecuencia de uso y el tipo de tareas que vas haciendo, cada decisión pesa más. Y por si fuera poco, el modelo que elegiste ayer se queda antiguo y a las pocas semanas vuelves a empezar.

La tarea puede resultar frustrante. La mayoría tira por los conocidos aunque tenga que pagar más, solo para no perder tiempo decidiendo; a otras personas, en cambio, les gusta buscar el mejor o el más económico en cada momento. Las dos posturas son legítimas: lo importante es saber qué estás comprando con cada una.

Tres formas de trabajar con modelos (y qué te cuesta cada una)

Antes de elegir modelo, conviene decidir por dónde vas a llegar a él. Básicamente hay tres caminos:

  • El agregador. Una sola clave API y acceso a cientos de modelos: OpenRouter, Groq o ZenMux son los más conocidos. Es la vía más cómoda para probar y comparar, y algunos ofrecen modelos gratuitos con ciertos límites. El inconveniente es que hay un intermediario por medio y no todos los modelos rinden o cuestan igual que en su origen.
  • El proveedor directo. Contratas con quien entrena el modelo —por ejemplo DeepSeek— y te ahorras el intermediario. Suele ser la opción más barata por modelo, pero gestionas una clave por proveedor y renuncias a tener todo el catálogo en un mismo sitio.
  • La suscripción con consumo incluido. Pagas una cuota mensual fija y dentro tienes una cantidad de uso. El gasto es predecible y el catálogo, seleccionado. A cambio, dependes de un único proveedor y de su lista de modelos.

Nuestra ruta: del agregador al consumo incluido

Cuando empezamos, elegimos un proveedor que nos ofreciera todas las posibilidades: así, con una única clave API, podíamos cambiar de modelo sin complicaciones. Nos decidimos por OpenRouter. Pero al ser un intermediario y estar consumiendo, en la mayoría de los casos, modelos de DeepSeek, acabamos contratando al proveedor directo: menos coste y menos capas por medio. Nos fue bien.

El problema llegó cuando nos dimos cuenta de que echábamos de menos algún que otro modelo que sí teníamos antes. La solución la encontramos en Ollama Cloud, que combina las dos ventajas: un catálogo amplio y una suscripción mensual con consumo incluido.

Ollama Cloud: qué nos da por 20 $ al mes

El plan que usamos es el Pro: 20 $ al mes (16,67 $/mes si se paga al año) e incluye 60 $ de consumo mensual. Sobre el papel es la mitad de lo que costarían esos créditos comprándolos sueltos, así que para el uso profesional que hacemos nos resulta suficiente.

Plan Precio Consumo incluido Peticiones simultáneas
Free 0 $ Créditos de inicio (modelos básicos) 1
Pro 20 $/mes 60 $/mes 3
Max 100 $/mes 300 $/mes 10
Team 500 $/mes 1.000 $/mes compartidos 10

Dos detalles que conviene saber antes de contratar: el consumo no se acumula de un mes a otro (se renueva en la fecha de alta, no se suma lo que no gastaste) y el catálogo cloud es hoy de 17 modelos, entre ellos deepseek-v4.1-flash, glm-5.3, kimi-k3, minimax-m3 o nemotron-3-ultra. Además, si tienes modelos en local, ejecutarlos en tu propio equipo no consume nada de la cuota.

El detalle que casi nadie mira: la tarifa valle

Aquí está el ahorro silencioso. Ollama aplica precios valle a la mitad fuera del tramo de 12:00 a 18:00 UTC en días laborables, y durante todo el fin de semana. Traducido a horario español: de 14:00 a 20:00 de lunes a viernes, tarifa normal; el resto del tiempo, la mitad.

Modelo Entrada (1M) Entrada en caché (1M) Salida (1M)
deepseek-v4.1-flash 0,30 $ 0,006 $ 1,20 $
glm-5.3 1,40 $ 0,26 $ 4,40 $
kimi-k3 3,00 $ 0,30 $ 15,00 $
minimax-m3 0,60 $ 0,12 $ 2,40 $
gpt-oss:120b 0,15 $ 0,014 $ 0,60 $

Fíjate en la columna de la caché: el precio de entrada en caché puede ser hasta cincuenta veces inferior al de entrada normal. En agentes que trabajan con contextos largos y repetitivos, esa columna es la que decide la factura.

Lo que hemos aprendido

  • Empieza por el modelo que ya conoces. Si tu tarea principal funciona bien con un modelo de una familia, quédate en ella y sube de gama solo cuando una tarea concreta lo pida.
  • Mira el precio de salida, no solo el de entrada. Un modelo barato de entrada puede ser carísimo generando texto.
  • La caché es tu aliada. Un contexto estable y reutilizado se paga a precio de saldo.
  • Aprovecha la tarifa valle para los procesos por lotes: cron nocturnos, informes, generación de contenido.
  • No cambies por moda. Cambia cuando una tarea real te lo pida, no cuando aparezca un titular nuevo.

En resumen

No existe el mejor modelo, sino el mejor equilibrio para tu uso. Si estás empezando y quieres probar sin comprometerte, un agregador te da el catálogo más amplio por una sola clave. Si ya sabes qué modelo quieres y lo usas a diario, ir al proveedor directo suele ser lo más económico. Y si buscas previsibilidad con un catálogo amplio, una suscripción con consumo incluido —como la que nosotros usamos— es difícil de superar.

Si quieres ver la comparativa de agregadores que hicimos antes de dar este paso, la tienes en Agregadores de modelos. Y si prefieres aprender a montarlo paso a paso, echa un vistazo a nuestros cursos de IA y automatización.

Tarifas y catálogo oficiales consultados el 25 de septiembre de 2026 en ollama.com/pricing.