El token más barato es el que no gastas rehaciendo.
La misma tarea puede consumir entre 30% y 70% menos con disciplina de formato, de contexto y de
modelo. En asientos de tarifa plana eso recupera horas bloqueadas por los topes de uso; en API baja
la cuenta en dólares.
El hallazgo de mediados de 2026: el precio por token dejó de predecir el costo.
Los tres grandes laboratorios lanzaron modelos que resuelven la misma tarea con drásticamente menos
tokens de razonamiento, así que un modelo con precio de lista más alto termina más barato por tarea
completada. El número que manda es el costo por tarea.
¿Qué te conviene comprar?
Cinco preguntas y una hipótesis de mix. El respaldo de cada respuesta está en las
secciones que siguen.
1. La primera decisión: qué pasa cuando se acaba la cuota
Los cuatro proveedores grandes venden un asiento y los cuatro miden algo encima.
Lo que los separa no es el precio: es qué miden, en qué unidad, y qué pasa cuando se agota.
Unos fallan abiertos y te mandan la factura. Otros fallan cerrados y detienen a tu
gente. Elegir es decidir cuál de los dos riesgos prefieres.
Esa es la pregunta que hay que hacer antes de comparar tarifas, y casi nunca aparece en la
conversación comercial. Verificamos los cuatro contra su documentación oficial:
Lo que revela el cuadro. El costo fijo puro está en retirada. En OpenAI
ningún plan corporativo es de costo fijo: tanto Business como Enterprise miden créditos desde el
primer día, y lo único ilimitado es el modelo rápido. En Microsoft el asiento cubre lo básico pero
todo lo agéntico se mide siempre. Solo Anthropic mantiene un plan corporativo verdaderamente plano
—Team— y Google lo mantiene dentro de Workspace a cambio de topes duros.
Dos asimetrías que conviene poner sobre la mesa antes de firmar.
La dirección del riesgo se invierte. Anthropic falla abierto: el consumo sigue y se
factura, así que el riesgo es presupuestario. OpenAI y Microsoft fallan cerrados y con prepago: el
riesgo es operativo, gente detenida. Google se queda en medio, bloquea pero le ofrece al
administrador abrir la llave. Para un cliente que teme la factura sorpresa, la respuesta no es el
proveedor más barato: es el que falla del lado que puede tolerar.
OpenAI no publica el precio de su unidad. Microsoft dice que su crédito vale
US$0,01 y Google publica US$0,10 por consulta y US$4 por Deep Research. El crédito de OpenAI solo
aparece dentro del producto, al momento de comprar. Eso hace que su modelo no se pueda modelar en
un caso de negocio antes de firmar, que es justo cuando se necesita.
Y una diferencia de fondo en la unidad de medida. Google es el único que
cobra el excedente en la moneda del trabajo —una consulta, una investigación— y no en la del
modelo. Eso lo hace mucho más fácil de presupuestar para un gerente, porque nadie sabe cuántos
tokens tiene un contrato pero todos saben cuántos contratos revisan al mes. La contrapartida es que
una vez habilitado el excedente no hay tope duro, solo alertas.
En detalle: las cuatro puertas de Anthropic
Lo desglosamos con el stack que conocemos mejor. La estructura se traduce a los otros
proveedores: un asiento con tope, un asiento con más tope, un asiento con medidor, y la API sin
asiento.
El punto de equilibrio entre fijo y variable
La comparación que importa es entre un asiento Premium y un asiento Enterprise, porque ambos
resuelven el mismo problema —que a la persona no le falte capacidad— por caminos opuestos.
Cómo se decide en la práctica. Casi ninguna organización elige un solo
camino. El patrón que funciona es mezclar: Standard para el grueso del equipo,
Premium para el puñado de usuarios intensivos que se bloquean seguido, y API directa
para las automatizaciones y productos, que no necesitan asiento porque no hay una persona detrás.
Team permite combinar Standard y Premium en la misma organización, así que no hay que elegir un
nivel para todos.
Y a veces la decisión no es económica. Los registros de auditoría, los
permisos por rol, SCIM y la retención de datos configurable solo existen en Enterprise. Para un
banco, una aseguradora o cualquier organización con obligaciones de trazabilidad bajo Ley 21.719,
eso puede convertir a Enterprise en la única opción defendible, sin importar la comparación de
costo. Enterprise también sube el contexto de 200K a 500K, que es una diferencia funcional y no
solo de gobierno.
Dónde aparece el desperdicio en cada caso
| | Costo fijo (Team) | Costo variable (Enterprise o API) |
| La unidad que se gasta |
Un balde compartido entre Chat, Cowork y Claude Code, con ventana de 5 horas y tope semanal. |
Dólares por millón de tokens, de forma lineal. |
| Cómo se ve el desperdicio |
La sesión que se agota a media tarde y deja a alguien esperando. |
La cuenta a fin de mes, que nadie proyectó. |
| Qué recupera la disciplina |
Horas de trabajo y capacidad del equipo. |
Dinero, de forma directa y medible. |
| El error más caro |
Mandar a Cowork una tarea que el Chat resolvía: drena el balde de todos. |
Dejar crecer el contexto sin gestión, que multiplica la factura sin avisar. |
Dato operativo: en los asientos de tarifa plana el cupo es un solo balde
compartido entre Chat, Cowork y Claude Code. Quemar tokens en un motor resta capacidad en los
otros. Cuando alguien topa, puede esperar el reinicio o activar usage credits, que permiten
seguir trabajando a tarifa API — un escape variable dentro de un plan fijo.
¿Cuál de los dos riesgos tolera tu organización? MAindset modela el caso de
negocio antes de firmar: consumo esperado, punto de equilibrio y mix de asientos por equipo.
Conversemos →
2. Los heavy users dan vuelta la conclusión
Para la mayoría de la gente, un plan fijo es un gasto. Para un desarrollador o un
analista de control de gestión, es un descuento — y de una magnitud que cambia la decisión.
Un asiento de tarifa plana puede costar veinte o cuarenta veces menos que el mismo
trabajo pagado a tarifa API.
Es la cara opuesta de la sección anterior. El punto de equilibrio de US$80 al mes se cruza
rápido: un desarrollador con Claude Code abierto todo el día, o un equipo de control de gestión
cerrando mes, no consume US$80 — consume múltiplos de eso. Ahí la suscripción deja de ser un costo
y pasa a ser la opción barata.
Tres advertencias antes de usar este número
1. Es un techo, no un valor. Alcanzarlo exige saturar los límites del plan
de forma continua, veinticuatro por siete, y enrutar todo por el modelo más caro. Eso no lo hace
una persona: lo hace una automatización (agentes, integración continua, tareas programadas).
2. El uso interactivo real rinde entre 1x y 3x. Un humano frente a la pantalla no
extrae más, por intensa que sea su jornada. Si vas a construir un caso de negocio, constrúyelo
sobre ese rango, no sobre el techo.
3. El techo estuvo a punto de cerrarse, y puede cerrarse. Anthropic anunció que
desde el 15 de junio de 2026 el uso automatizado —Agent SDK, claude -p, apps de
terceros— dejaría de consumir los límites de la suscripción y pasaría a facturarse aparte. El 15
de junio pausó el cambio y hoy nada de eso ocurrió: el uso automatizado sigue descontando
del plan. Pero declaró que va a volver en alguna forma y que avisará antes. Un caso de negocio
apoyado en este arbitraje tiene fecha de vencimiento desconocida.
Cuánto vale la automatización, según el propio proveedor. En el esquema
que Anthropic alcanzó a publicar, el crédito mensual para uso automatizado era exactamente igual
al precio del asiento: US$20 para Pro y Team Standard, US$100 para Max 5x y Team Premium, US$200
para Max 20x. Esa simetría es la señal más clara de cómo el proveedor valoriza la automatización
frente al uso humano: uno a uno. Y su recomendación explícita fue que los equipos con
automatización de producción compartida usen la API con clave propia, no la suscripción.
El arbitraje compra un problema de gobierno. Pro y Max son planes
individuales: no tienen facturación central, ni SSO, ni controles de administrador, ni registros
de auditoría. Poner a los desarrolladores en Max 20x para capturar el descuento significa
sacarlos del perímetro administrado de la organización. Para un regulado, ese ahorro puede ser
inaceptable por razones que no tienen nada que ver con el costo.
Lo que queda en pie. El valor de una suscripción no es el arbitraje de
tokens: es la predicibilidad del costo y la superficie de producto que la API pelada
no entrega — Claude Code interactivo, Cowork, Projects, Skills, conectores, la aplicación de
escritorio. El arbitraje es un beneficio secundario, sujeto a que el proveedor lo tolere. La
predicibilidad y el producto son estructurales.
Esta es exactamente la clase de decisión donde MAindset trabaja: medir el consumo real por
persona y por equipo, distinguir el uso interactivo del automatizado, y armar el mix de planes que
entrega la capacidad que hace falta sin pagar de más ni quedar fuera del perímetro de gobierno.
Conversemos →
3. El mapa de modelos
Elegir el modelo es hoy una decisión de costo, no solo de calidad. Haz clic en cualquier encabezado para reordenar.
| Modelo |
Familia |
Input |
Output |
Contexto |
Caché |
Puntaje |
US$/tarea |
min/tarea |
tok/tarea |
Cómo leer cada columna
- Input · Output · Caché
- USD por millón de tokens. Input es lo que le mandas, output lo que responde
—siempre entre 3 y 6 veces más caro— y caché lo que cuesta releer contexto ya enviado.
- Contexto
- Cuánto texto entra de una vez en una sola conversación o request.
- Puntaje · US$/tarea · min/tarea · tok/tarea
- Las cuatro vienen de la misma fuente y de la misma medición: el
Artificial Analysis Intelligence Index v4.1, una batería independiente de
nueve evaluaciones distintas. No son cifras nuestras ni de los proveedores.
El puntaje es el resultado combinado de las nueve; más es mejor. Las otras tres
son el costo, el tiempo y los tokens de salida promedio para completar una tarea de esa
misma batería, ponderados por el peso de cada evaluación e incluyendo los tokens de
razonamiento. Ordena por cualquiera de ellas y el ranking cambia por completo: es el punto de
toda esta página.
«s/p» = el modelo salió después de la medición del 20 de julio y no está puntuado.
«s/m» = sin medir.
Qué son esas nueve evaluaciones: GDPval-AA v2 (trabajo real por
ocupación), 𝜏³-Banking (uso de herramientas), Terminal-Bench v2.1 (código y terminal), SciCode,
Humanity's Last Exam, GPQA Diamond (razonamiento científico), CritPt (física), AA-Omniscience
(conocimiento y alucinación) y AA-LCR (razonamiento en contexto largo).
Por eso «tarea» aquí no significa tu tarea. Es una tarea de ese conjunto. Sirve
para comparar modelos entre sí en igualdad de condiciones, no para estimar lo que te va a costar
tu propio flujo — para eso está la calculadora más abajo, y sobre todo medir tu caso real.
Metodología y datos en
artificialanalysis.ai.
Casi todos los modelos ofrecen además Batch API, que cuesta la mitad si el resultado puede
esperar horas; la excepción del mapa es Kimi K3, y está dicho en su nota.
Tres trampas que el precio de lista no muestra.
1. El acantilado de contexto largo. OpenAI cobra el doble de input y 1,5x el output
sobre 272K tokens, y lo aplica a la request completa, no al excedente. Gemini Pro duplica sobre 200K.
Claude no tiene recargo: una request de 900K se factura a la misma tarifa por token que una de 9K.
2. El tokenizador cambió. Claude 4.7 y posteriores, incluido Opus 5, usan un
tokenizador que produce cerca de 30% más tokens para el mismo texto. Rinde mejor, pero comparar
precio por token contra generaciones anteriores dejó de ser válido.
3. Mantener el caché cuesta. En Gemini hay precio de almacenamiento por hora
(US$1 por millón en Flash, US$4,50 en Pro) además del costo de lectura.
Cómo leer el puntaje. Es el promedio ponderado de nueve evaluaciones, lo
que lo hace más robusto que un test suelto, pero sigue siendo un benchmark: mide lo que mide.
El evaluador METR reportó además en GPT-5.6 la tasa de «benchmark-gaming» más alta que ha medido.
Úsalo para descartar opciones obviamente flojas, no para elegir entre dos que están a dos puntos
de distancia.
4. Lo que realmente cuesta una tarea
Artificial Analysis corre una batería independiente de nueve evaluaciones y mide,
para cada modelo, cuánto cuesta, cuánto demora y cuántos tokens gasta en completar una de esas
tareas. Son tres preguntas distintas y ninguna se responde con el precio de lista.
Claude Sonnet 5 cuesta la mitad por token que Opus 5. Pero gasta el doble de tokens
por tarea, demora 40% más y puntúa ocho puntos menos.
Ahí está toda la tesis en un caso. Sonnet 5 tiene precio de lista más bajo, así que en cualquier
planilla de comparación gana. En el trabajo real quema 68.700 tokens de salida por tarea contra los
37.000 de Opus 5 —el 81% en razonamiento— y termina costando casi lo mismo por tarea completada,
más lento y con peor resultado.
Fuente: Artificial Analysis, Intelligence Index v4.1 — un promedio ponderado sobre
nueve evaluaciones independientes. Cambia de pestaña para ver los tres ejes. El número gris de la
derecha es el puntaje de inteligencia del modelo y su razón de eficiencia. Ni las cifras ni el
índice son nuestros: son verificables en artificialanalysis.ai.
Por qué el precio por token engaña. Un modelo de razonamiento decide
cuántos tokens gasta pensando antes de responder, y esa cantidad no aparece en ninguna lista de
precios. En estos modelos el razonamiento se lleva entre el 54% y el 81% de la salida: estás
comprando cantidad de pensamiento, no cantidad de texto. Por eso dos modelos con precios de lista
parecidos difieren al doble por tarea completada.
El tiempo también es plata, y no aparece en la factura. Kimi K3 puntúa 57,
más que casi todo el mapa, y cuesta US$0,72 por tarea. Pero demora 13 minutos por tarea, contra los
2,4 de GPT-5.6 Terra, que puntúa 55. Para un proceso por lotes de noche eso da igual. Para alguien
esperando frente a la pantalla, o para un agente con veinte pasos en cadena, es la diferencia entre
una herramienta que se usa y una que se abandona.
Las tres lecturas que sirven para decidir
| Si tu problema es… | El dato que manda | Qué hacer |
Volumen alto de tareas simples clasificar, extraer, rutear |
Costo por tarea, sin más |
Los modelos livianos resuelven a una fracción del costo. La diferencia entre el más barato
y el más caro del mercado es de más de cien veces, y la mayoría de las tareas de volumen
no necesita frontera. |
Producción rutinaria documentos, respuestas, generación estándar |
Puntos por dólar |
Aquí está el mayor desperdicio silencioso: es donde la gente usa el modelo de frontera por
costumbre. Un modelo intermedio suele puntuar a dos o tres puntos del tope por menos de la
mitad del costo por tarea. |
Razonamiento difícil o agéntico donde un error gatilla reintentos |
Costo del reintento, no de la tarea |
El único caso donde el modelo caro se defiende. Si fallar de primera obliga a repetir el
trabajo, o peor, si el error llega al cliente, la tarea barata que hay que hacer tres veces
sale más cara que la correcta a la primera. |
Cómo no usar este gráfico. Dos advertencias.
Mide tareas de benchmark, no las tuyas. Un despacho legal revisando contratos en
español y una startup generando código tienen perfiles de consumo distintos, y el orden puede
cambiar. Sirve para descartar lo obviamente caro y para formular la hipótesis; la decisión se
cierra midiendo tu propio flujo con dos modelos en paralelo durante una semana.
La razón de eficiencia premia a los modelos baratos y flojos. El que más puntos por
dólar rinde es también el que menos puntúa del mapa, y un modelo de 36 puntos no reemplaza a uno de
61 en trabajo difícil. La métrica sirve para comparar entre modelos que ya te sirven para la tarea,
no para elegir el más eficiente en abstracto.
MAindset mide tu costo por tarea real: tu flujo, tus documentos, dos modelos en
paralelo durante una semana. Con eso la decisión se toma con datos propios y verificables.
Pide la medición →
5. Licencias de asiento
Aquí vive la economía de cupo, y aquí vive Copilot, que no se cobra por token.
| Proveedor | Plan | Por usuario/mes | Nota |
Copilot dejó de ser «una licencia y listo». Hoy es suscripción más medidor.
El asiento de US$30 cubre chat, apps y agentes internos; todo lo agéntico nuevo se paga con Copilot
Credits a US$0,01 cada uno, no se acumulan de un mes al siguiente y los agentes se desactivan al
125% de la capacidad contratada. Para un cliente que ya tiene E3 o E5, el riesgo de presupuesto no
es el complemento: es el consumo variable que nadie proyectó.
Dato de gobernanza: Anthropic es hoy subprocesador de Microsoft y está
activo por defecto en la nube comercial. Si el inventario de proveedores de tu cliente dice «solo
Microsoft», está incompleto — y eso importa para el registro de tratamiento bajo Ley 21.719.
6. Las cinco palancas
Cada palanca tiene una regla y un régimen donde pega más fuerte.
Las cinco palancas se instalan entrenando a los equipos con casos del propio
negocio — es parte del trabajo de adopción de MAindset.
Entrena a tu equipo →
7. ¿Cuánto cuesta hoy tu forma de trabajar?
Ajusta los controles a tu operación real. La columna de la izquierda es el escenario
sin disciplina; la del centro, el mismo trabajo con las cinco palancas aplicadas.
Con las cinco palancas
—
—
De dónde sale la diferencia
Cifras ilustrativas con supuestos declarados. Los resultados reales varían según el
contenido. Conversión a CLP a $950/USD referencial. La calculadora
reproduce los Ejemplos A a E del informe.
8. Biblioteca de tips
Filtra por palanca, régimen, área o nivel. Se agregan tips cada dos semanas.
Palanca
Régimen
Área
Nivel
9. Recursos
Lo que se usa, no lo que se lee.