
Qué automatizar primero en una pequeña empresa
Elija la primera automatización según el trabajo, los datos, el riesgo, la responsabilidad y la reversibilidad. Valide un piloto antes de ampliarlo.
El 30 de julio de 2026 OpenAI bajó un 80 por ciento el precio de GPT-5.6 Luna. La entrada cayó a 20 centavos por millón de tokens y la salida a 1,20 dólares. Terra bajó una quinta parte. Seis días antes Anthropic había publicado Opus 5 al precio de la generación anterior, con más del doble de rendimiento por tarea según sus propias mediciones. Y Gemini 3.6 Flash, de Google, gasta un 17 por ciento menos de tokens de salida en trabajo comparable.
Si uno mira solo las listas de precios, julio parece el mejor mes de la historia para una empresa que paga por IA.
La contabilidad dice otra cosa. La encuesta State of FinOps 2026, con 1.192 profesionales que gestionan más de 83.000 millones de dólares de gasto anual en la nube, encontró que el 73 por ciento de las organizaciones se pasó de su presupuesto de IA. En el mismo periodo el presupuesto medio de IA subió de 1,2 millones de dólares al año en 2024 a 7 millones en 2026.
Los precios bajan. Las facturas suben. Las dos cosas son ciertas a la vez y conviene entender el motivo antes de aprobar el próximo proyecto de IA.
Cuatro laboratorios grandes sacaron modelos insignia o casi insignia en treinta días, y junto a ellos aparecieron los pesos abiertos más grandes publicados hasta la fecha.
En una pantalla pequeña, desplace la tabla horizontalmente.
| Modelo | Publicación | Entrada / salida por 1 M | Contexto |
|---|---|---|---|
| GPT-5.6 Sol | 9 de julio | 5 / 30 USD | 1 M |
| GPT-5.6 Terra | 9 de julio, rebaja 30 de julio | 2 / 12 USD | 1 M |
| GPT-5.6 Luna | 9 de julio, rebaja 30 de julio | 0,20 / 1,20 USD | 1 M |
| Grok 4.5 | 8 de julio | 2 / 6 USD | 500 K |
| Kimi K3 | 16 de julio, pesos 27 de julio | 3 / 15 USD | 1 M |
| Gemini 3.6 Flash | 21 de julio | 1,50 / 7,50 USD | 1 M |
| Claude Opus 5 | 24 de julio | 5 / 25 USD | 1 M |
Kimi K3, de Moonshot, es el modelo abierto más grande disponible con 2,8 billones de parámetros. La descarga completa de pesos ronda 1,56 TB, así que casi nadie lo aloja en su propio rack. Lo relevante está en otro sitio. Modelos que hace un año ocupaban la parte alta de la escala de precios hoy están en mitad de tabla.
Cuando GPT-4 salió en marzo de 2023, un millón de tokens de entrada costaba 30 dólares. A finales de julio de 2026 una calidad comparable cuesta 14 centavos. Eso son 214 veces menos en cuarenta meses, una curva de deflación sin precedente en el software empresarial.
Aun así los presupuestos revientan. La explicación no está en la tarifa, sino en cómo se usan hoy los modelos.
Un chatbot recibe una pregunta y devuelve una respuesta. Una llamada, una tanda de tokens facturada. Un flujo agéntico que procesa una factura entrante recupera el documento, lo clasifica, extrae las líneas, las compara con el pedido, marca la discrepancia y redacta una respuesta. Eso son veinte llamadas para un solo documento sin despeinarse. Mismo precio por token, veinte veces el consumo.
A eso se suman los modelos de razonamiento. Generan pensamiento interno antes de responder, que usted nunca ve y siempre paga a tarifa de salida. Detrás de quinientas palabras visibles puede haber decenas de miles de tokens facturados.
El analista Jacob Bourne lo resumió a VentureBeat sin rodeos. «The era of tokenmaxxing is over. Enterprises have figured out how easy it is to burn tokens without getting value back.»
Deje de comparar el precio por millón de tokens. Compare el coste por tarea terminada.
La distancia entre esas dos cifras es mayor de lo que parece, y las mediciones publicadas de SWE-Bench Pro lo enseñan con claridad. Grok 4.5 resuelve una tarea media con 15.954 tokens de salida. Opus 4.8 en modo de esfuerzo máximo necesita 67.020.
En una pantalla pequeña, desplace la tabla horizontalmente.
| Modelo | Precio de salida por 1 M | Tokens de salida por tarea | Salida por tarea |
|---|---|---|---|
| Grok 4.5 | 6 USD | 15.954 | 0,10 USD |
| Opus 4.8 (máx.) | 25 USD | 67.020 | 1,68 USD |
La tarifa difiere en un factor de 4,2. El consumo también, en torno a 4,2. Solo que esos dos factores no se suman, se multiplican, con lo que la diferencia real por tarea ronda las diecisiete veces.
Tómelo como ilustración del mecanismo y no como veredicto sobre los modelos. Son cifras de benchmark publicadas, no mediciones nuestras, y con otra carga de trabajo el orden cambia. El principio es lo que se traslada. El consumo de tokens es la otra mitad del precio y la mayoría de las empresas ni lo mide.
En los laboratorios ya lo saben. Google encabezó el anuncio de Gemini 3.6 Flash con un 17 por ciento menos de tokens de salida, no con más inteligencia. Hablar menos, no pensar más.
El segundo cambio de julio es más discreto y pesa más en la práctica. Un modelo ya no es una sola cosa a un solo precio.
Opus 5 llega con nivel de esfuerzo seleccionable entre bajo, medio y alto. Misma pregunta, mismo modelo, distinto consumo y distinta respuesta. GPT-5.6 Sol estrenó un modo rápido que corre unas 2,5 veces más ligero por el doble de precio. Grok 4.5 factura de una manera por debajo de 200.000 tokens de contexto y de otra por encima, y al cruzar ese umbral se reprecia la petición entera.
En la práctica, «usamos este modelo» ya no es una decisión. Son modelo, nivel de esfuerzo, tamaño de contexto y estrategia de caché. Quien lo configura una vez y lo deja ahí paga la clasificación de correos a tarifa de análisis de contratos.
La factura del proveedor dice cuánto gastó. No dice qué flujo lo gastó. Etiquete las llamadas según el proceso que las dispara y siga el coste por documento procesado, por ticket resuelto, por oferta preparada. Solo esa cifra se puede poner al lado del precio de una hora de trabajo.
Solo en julio el orden cambió tres veces. Si el modelo es una constante repartida por veinte ficheros, cada cambio es un proyecto. Si es un valor de configuración detrás de una interfaz, son diez minutos. Es el seguro más barato del mercado y le cuesta una tarde.
Sin treinta o cincuenta casos reales con resultado esperado, pasarse a un modelo más barato es una apuesta. Con ellos es una sola medición. Ese mismo conjunto es además la única defensa contra la pérdida silenciosa de calidad cuando el proveedor actualiza el modelo por debajo.
Una alerta sobre el gasto mensual total avisa cuando ya es tarde. Un límite de llamadas y tokens dentro de una ejecución del agente corta un bucle descontrolado ese mismo día. La mayoría de las sorpresas caras no son crecimiento lento, son un fallo que estuvo corriendo el fin de semana.
La entrada cacheada cuesta una fracción de la tarifa normal en casi todos los proveedores. Grok 4.5 la factura a 0,50 dólares en lugar de 2. En un agente que reenvía el mismo contexto de sistema en cada paso, eso no es un redondeo. Y para clasificar, enrutar o extraer campos basta con la clase más barata, que hoy es casi gratis.
Para una empresa de veinte personas, la diferencia entre 5 dólares y 20 centavos por millón de tokens no decide la rentabilidad de un proyecto. Con volúmenes normales hablamos de decenas de euros al mes.
El peso está en otra parte. Si cambiar de modelo obliga a reescribir veinte ficheros, cualquier rebaja del mercado le sirve de poco, porque no llega a alcanzarla. La otra pata es la visibilidad. Una empresa que sabe decir al momento cuánto le cuesta procesar una factura también consigue bajar esa cifra. La que no lo sabe se entera del consumo por la factura.
El mercado seguirá moviéndose. En un mes la gama media bajó una quinta parte, la gama baja cuatro quintas partes y los modelos insignia subieron. Quien montó la IA como pieza intercambiable se lleva esa ventaja. Quien eligió un proveedor y lo coló dentro del código seguirá pagando por la decisión de la temporada pasada.
En Rise.sk construimos automatización y flujos de IA para que el modelo se pueda cambiar sin tocar la arquitectura. Medimos el coste por unidad procesada desde el primer día. Si quiere saber cuánto le cuesta hoy un proceso y si se puede abaratar, escríbanos.

Elija la primera automatización según el trabajo, los datos, el riesgo, la responsabilidad y la reversibilidad. Valide un piloto antes de ampliarlo.
GrantAI monitoriza convocatorias, las empareja con perfiles de empresa, prepara un análisis de elegibilidad y redacta los materiales de solicitud. Demo y piloto para equipos de subvenciones.
Los equipos de asesoría pierden margen cuando cada nueva convocatoria empieza con lectura manual, debate interno y comprobaciones repetidas de perfiles. Este artículo muestra cómo GrantAI ayuda a los consultores a acortar el cribado de subvenciones sin eliminar la revisión experta.