Pregunta a diez desarrolladores qué API LLM es la más barata para programar y obtendrás diez respuestas distintas, porque cada uno mide algo diferente. Una persona lee la cifra de la página de precios. Otra mira la factura del mes pasado. Solo importa una tercera cifra: lo que cuesta obtener del modelo un cambio funcional que pase los tests. Este artículo se escribe en octubre de 2026, así que ningún proveedor ha publicado todavía una lista de precios de 2027. Lo que sigue es el método que elige al ganador sean cuales sean las nuevas cifras, además de un mapa claro de dónde han estado las opciones más baratas.
La respuesta corta: en precio de catálogo, los proveedores más baratos son casi siempre modelos de pesos abiertos servidos por hosts que compiten, o laboratorios que ponen precios muy agresivos a sus propios modelos. En costo por tarea resuelta, el ganador rara vez es el modelo más barato de la lista. Es el modelo que pasa tus tests con la frecuencia suficiente para que los reintentos y el tiempo de revisión se mantengan bajos, con la caché de prompts activada. Las secciones siguientes explican por qué, con un ejemplo práctico que puedes repetir con tus propias cifras.
Por qué el precio de catálogo engaña
Una página de precios muestra dos cifras por modelo: dólares por millón de tokens de entrada y dólares por millón de tokens de salida. Ambas son exactas. Las dos son casi inútiles para una carga de programación si se leen por separado.

El precio por token no es el precio por tarea
Un modelo que cuesta una décima parte por token, pero necesita tres intentos para producir un cambio que pase los tests, no es barato. Es una forma lenta de gastar el mismo dinero, además de tu propio tiempo. Programar es el caso más claro para medir esto, porque el resultado se puede comprobar: los tests pasan o no pasan. Eso convierte el costo por tarea que pasa los tests en la única métrica honesta, y es fácil de calcular en cuanto registras tokens y resultados.
Adónde van realmente los tokens
Las herramientas de programación con agentes vuelven a enviar toda la conversación en cada turno: el prompt del sistema, los archivos del repositorio, los resultados de las herramientas y las ediciones anteriores. Una sesión de doce turnos puede consumir varios cientos de miles de tokens de entrada para producir unos pocos miles de tokens de código. Dos detalles cambian el cálculo:
- La salida cuesta más. Los tokens de salida suelen tener un precio de cuatro a ocho veces el de los de entrada, así que las respuestas charlatanas y las reescrituras de archivos completos perjudican.
- El pensamiento cuenta como salida. Los modelos de razonamiento cobran sus tokens de pensamiento oculto a la tarifa de salida, así que un modelo que parece barato puede costar más que uno sin razonamiento en ediciones sencillas.
💡 Pide diffs en lugar de archivos completos. Un parche de cuarenta líneas cuesta una fracción de una reescritura de cuatrocientas líneas, y es más fácil de revisar.
Tres tipos de proveedores
Los proveedores se dividen en tres grupos, y cada grupo tiene un precio mínimo distinto.

Laboratorios de frontera, venta directa
OpenAI, Anthropic y Google venden directamente sus modelos más potentes. Pagas el precio de catálogo más alto a cambio de las versiones más recientes, los mejores resultados en problemas difíciles con varios archivos y las funciones de caché y lotes más maduras. Modelos como Claude Sonnet 5, GPT 5.6 Terra y Gemini 3.5 Flash están en este grupo. Los niveles más pequeños de cada laboratorio, las variantes Flash y mini, cuestan mucho menos que los modelos insignia y cubren una parte sorprendente del trabajo diario de programación.
Modelos de pesos abiertos en hosts de inferencia
Cuando los pesos de un modelo son públicos, muchas empresas lo sirven y compiten en precio y velocidad. GPT OSS 120B, Llama 4 Maverick Instruct y Qwen3 235B A22B Instruct 2507 son ejemplos de familias que encontrarás en varios hosts. La competencia empuja los precios hacia el costo bruto de las GPU. El problema es la variabilidad: los hosts difieren en cuantización, límites de contexto y disponibilidad, así que un mismo nombre de modelo puede comportarse de forma distinta de un host a otro.
Laboratorios de precios bajos y servicios de enrutamiento
Algunos laboratorios venden sus propios modelos por una fracción de lo que cuestan los modelos insignia occidentales. DeepSeek V3.1, Kimi K2.6 y Qwen3.7 Plus son los nombres habituales de este grupo, y a lo largo de 2025 y 2026 modelos como ellos se mantuvieron competitivos en benchmarks de programación cobrando mucho menos por token. Los servicios de enrutamiento se sitúan por encima de los proveedores, ofreciendo una sola interfaz y conmutación por error automática entre proveedores. Normalmente repercuten los precios de lista y añaden una comisión por la comodidad. Revisa el tratamiento de los datos y dónde están sus servidores antes de enviar código propietario a cualquiera de ellos.
| Tipo de proveedor | Precio de catálogo | Mejor para | Ojo con |
|---|
| Laboratorio de frontera, directo | El más alto | Trabajo difícil con varios archivos, modelos más recientes, caché madura | Precio de salida, niveles de límite de tasa |
| Host de pesos abiertos | Bajo, varios hosts compiten | Cambio fácil, precios predecibles | Cuantización, límites de contexto, disponibilidad |
| Laboratorio de precios bajos, directo | Normalmente el más bajo por token | Buenos resultados en programación por lo que cuesta | Ubicación de los datos, limitación en horas punta |
| Servicio de enrutamiento | Precio de lista más una comisión | Una sola interfaz, conmutación por error, comparación de precios | Latencia extra, la propia comisión |
Cuatro palancas que reducen tu factura
Antes de cambiar de proveedor, comprueba si ya estás aprovechando los descuentos disponibles. En cargas de programación valen más que la mayoría de las diferencias de precio entre proveedores.

| Palanca | Efecto típico | Ideal para | Contrapartida |
|---|
| Caché de prompts | La entrada en caché se cobra a una fracción de la tarifa normal | Bucles de agentes, mucho contexto de repositorio | La caché caduca en minutos, el prefijo debe coincidir exactamente |
| Endpoints por lotes | Suele costar alrededor de la mitad | Generación de tests, migraciones, evaluaciones | Los resultados llegan en horas, no en segundos |
| Modelo más barato para turnos sencillos | Suele ser de 5 a 20 veces más barato por token | Sugerencias en línea, mensajes de commit | Menor tasa de resolución en problemas difíciles |
| Disciplina en la salida | Recorta los tokens más caros | Diffs, explicaciones breves | El modelo debe seguir el formato |
Así funciona cada una en la práctica:
- Caché de prompts. Las condiciones varían según el proveedor, pero la entrada en caché suele cobrarse a entre el diez y el cincuenta por ciento de la tarifa normal. Los agentes de programación son el cliente ideal, porque reenvían el mismo prompt del sistema y el mismo contexto del repositorio en cada turno. Algunos proveedores guardan la caché de forma automática, mientras que otros cobran un extra por escribirla.
- Endpoints por lotes. Si un trabajo no necesita respuesta inmediata, como generar tests para cien archivos durante la noche, un endpoint por lotes suele reducir el precio a la mitad.
- Un modelo más barato para turnos sencillos. Renombrar una variable no necesita un modelo insignia. Un modelo pequeño como Claude 4.5 Haiku está pensado para trabajos rápidos y de bajo riesgo de este tipo.
- Disciplina en la salida. Limita la longitud de la salida, pide diffs y dile al modelo que omita la explicación larga salvo que la pidas.
💡 La caché solo compensa cuando el inicio del prompt es idéntico entre llamadas. Pon primero el material estable (prompt del sistema, mapa del repositorio, reglas de estilo) y al final la tarea que cambia.
Un ejemplo de costo paso a paso
Los precios siguientes son cifras redondas ilustrativas, no una cotización de ningún proveedor. Lo importante es la forma del cálculo, que sigue siendo válida cuando lleguen los precios reales de 2027.

La configuración
- Un intento de una tarea usa 300.000 tokens de entrada (una sesión de agente de doce turnos) y 8.000 tokens de salida.
- Modelo económico: $0,30 por millón de entrada, $1,20 por millón de salida, resuelve el 50% de las tareas en el primer intento.
- Modelo de frontera: $3 por millón de entrada, $15 por millón de salida, resuelve el 85% de las tareas en el primer intento.
- Con la caché activada, el 80% de los tokens de entrada se cobra al 10% de la tarifa normal.
- Un intento fallido le cuesta al desarrollador 4 minutos de revisión a $60 por hora, es decir, $4.
Costo por tarea resuelta
Divide el costo de un intento entre la tasa de resolución, ya que un modelo que acierta la mitad de las veces necesita, de media, dos intentos.
| Escenario | Costo por intento | Tasa de resolución | Costo de API por tarea resuelta |
|---|
| Económico, sin caché | $0,10 | 50% | $0,20 |
| Frontera, sin caché | $1,02 | 85% | $1,20 |
| Económico, con caché | $0,035 | 50% | $0,07 |
| Frontera, con caché | $0,37 | 85% | $0,44 |
Solo con el gasto en API, el modelo económico gana por un margen amplio, y la caché recorta cada fila. Si la historia terminara aquí, la respuesta sería sencilla.
Añade el tiempo de revisión
Los intentos fallidos no solo cuestan tokens. Alguien lee la salida incorrecta, decide que está mal y lo intenta de nuevo. Usando los $4 por fallo de la configuración:
| Escenario | Costo de API | Costo de revisión de los fallos | Total por tarea resuelta |
|---|
| Económico, sin caché | $0,20 | $4,00 | $4,20 |
| Frontera, sin caché | $1,20 | $0,71 | $1,91 |
| Económico, con caché | $0,07 | $4,00 | $4,07 |
| Frontera, con caché | $0,44 | $0,71 | $1,15 |
El ranking se invierte. El modelo de frontera cuesta diez veces más por intento y aun así sigue saliendo más barato por tarea resuelta, porque sus fallos son raros. En este ejemplo, el modelo económico necesitaría una tasa de resolución de alrededor del 70% para igualarlo. Por eso "el proveedor más barato" no puede responderse solo con una lista de precios. Para obtener tu propia respuesta:
- Elige 30 tareas reales de tu repositorio que tengan tests.
- Ejecuta cada modelo candidato tres veces con la misma configuración de agente.
- Registra los tokens de entrada, los de caché y los de salida, además de si pasó o falló.
- Construye las mismas dos tablas con tus propios precios y tiempo de revisión.
- Repítelo cada trimestre, porque los precios y los modelos cambian muy rápido.
Enrutar modelos según la tarea
Usar un solo modelo para todo es la opción predeterminada, y es cara. Ajusta el nivel a la dificultad del trabajo y el costo medio por tarea baja sin perjudicar la calidad donde más importa.

Trabajo fácil: sugerencias y tests
El código repetitivo, la estructura base de los tests unitarios, los docstrings y los mensajes de commit tienen tasas de resolución altas incluso en modelos pequeños, así que un fallo es barato y raro. Granite 4.1 8B, Claude 4.5 Haiku y GPT 5.6 Luna son el tipo de opciones rápidas y de bajo costo para probar primero.
Trabajo medio: refactorizaciones y bucles de agentes
Las refactorizaciones con varios archivos y las sesiones largas con herramientas son el terreno en el que brillan la caché y los modelos de precio medio. Gemini 3.5 Flash, DeepSeek V3.1, Kimi K2.6 y Qwen3.7 Plus merecen todos un lugar en tu conjunto de pruebas. Este nivel suele concentrar la mayor parte de tu volumen de tokens, así que una pequeña diferencia de precio se acumula aquí.
Trabajo difícil: depuración y diseño
Las condiciones de carrera, el código heredado que no conoces y las decisiones de arquitectura castigan a los modelos débiles: la tasa de resolución cae y el costo de revisión pasa a dominar, exactamente como en la tabla de arriba. Aquí sí conviene gastar. Claude Sonnet 5, GPT 5.6 Sol y Claude Fable 5 son el tipo de modelos que conviene reservar para estas tareas.

| Tipo de tarea | Proporción habitual del volumen | Nivel de modelo | Por qué |
|---|
| Sugerencias en línea, tests, documentación | Alta | Pequeño y barato | Tasa de resolución alta, fallos baratos |
| Refactorizaciones, bucles de agentes | Media | Nivel medio con caché | La mayoría de los tokens, calidad constante |
| Depuración difícil, diseño | Baja | El más potente disponible | Fallos caros |
Para empezar basta con un enrutador sencillo basado en reglas. Elige el nivel según las etiquetas de la tarea o el número de archivos, y escala a un modelo más potente solo después de que los tests fallen dos veces. Registra qué nivel respondió a cada tarea. Al cabo de un mes verás cuánto volumen absorbió realmente el nivel barato, y podrás subir o bajar los umbrales según los fallos observados y no según suposiciones.
Elegir según el tamaño del equipo
Las restricciones de presupuesto se ven distintas para una persona que para un equipo de veinte.
Desarrolladores en solitario

Tu tiempo es el recurso escaso, y tu volumen es bajo. Quédate con un modelo de nivel medio para la mayoría del trabajo, reserva un modelo más potente para los problemas difíciles y aprovecha las cuotas incluidas con tus herramientas antes de pagar por token. Configura un límite de gasto mensual en el panel del proveedor desde el primer día.
Equipos pequeños

El ahorro está en el volumen. Define un modelo por defecto para cada tipo de tarea, activa la caché en todas partes y pasa los trabajos nocturnos a endpoints por lotes. Un servicio de enrutamiento puede simplificar la facturación y la conmutación por error, pero compara su comisión con el ahorro. Revisa un informe mensual que muestre el costo por pull request fusionado, no solo el gasto total. Los equipos con código propietario deben fijar primero la retención de datos y la ubicación de los servidores, porque esas restricciones descartan algunas de las opciones más baratas antes de que siquiera se hable del precio. Vuelve a revisar ese informe mensual cada trimestre, ya que un solo lanzamiento de un modelo nuevo puede reorganizar toda la tabla de la noche a la mañana.
Errores que inflan los costos
- Sin límite de gasto. Un agente en bucle puede generar una factura enorme durante la noche. Establece límites estrictos y alertas.
- Enviar todo el repositorio en cada turno. Dale al modelo un mapa del repositorio y deja que pida los archivos que necesite.
- Sin límite de pasos en los bucles de agentes. Tras un número determinado de intentos fallidos, detente y escala el caso a una persona o a un modelo más potente.
- Modo de razonamiento en ediciones triviales. Los tokens de pensamiento se cobran como salida. Desactívalo para dar formato y renombrar.
- Cambiar de proveedor por un diez por ciento. El tiempo de migración, la reescritura de prompts y las diferencias de calidad suelen borrar un ahorro tan pequeño.
Pruébalo en PicassoIA
Antes de comprometerte con un contrato de API, ejecuta el mismo prompt de programación en varios modelos y compara tú mismo las respuestas. PicassoIA reúne decenas de modelos de lenguaje (LLM) en un solo lugar, desde los pequeños y rápidos hasta las versiones más potentes, y puedes explorar el catálogo completo en picassoia.com/en/all-models. Pega una función real de tu proyecto, pide a cada modelo la misma refactorización y anota cuál necesita menos prompts de seguimiento. Esa prueba pequeña te dice más que cualquier lista de precios.

El mismo hábito de comparar resultados funciona con lo visual. Las imágenes de cabecera del blog, las maquetas de producto y los diagramas de documentación se pueden generar en minutos: describe la escena, crea varias versiones con PicassoIA Image y elige la que encaje. Prueba hoy mismo a crear tus propias imágenes con PicassoIA, cambia un detalle del prompt y comprueba cuánto mueve el resultado una sola frase.