Surfear la Ola: hacemos que la iA sea navegable

Tokenomics:
la economía del token

Cinco palancas para rendir más con iA, el mapa de modelos vigente y una calculadora para ver cuánto cuesta hoy tu forma de trabajar.


Actualizado ·

El token más barato es el que no gastas rehaciendo.

La misma tarea puede consumir entre 30% y 70% menos con disciplina de formato, de contexto y de modelo. En asientos de tarifa plana eso recupera horas bloqueadas por los topes de uso; en API baja la cuenta en dólares.

El hallazgo de mediados de 2026: el precio por token dejó de predecir el costo. Los tres grandes laboratorios lanzaron modelos que resuelven la misma tarea con drásticamente menos tokens de razonamiento, así que un modelo con precio de lista más alto termina más barato por tarea completada. El número que manda es el costo por tarea.

¿Qué te conviene comprar?

Cinco preguntas y una hipótesis de mix. El respaldo de cada respuesta está en las secciones que siguen.

1 · ¿Necesitas trazabilidad formal? (auditoría, roles, Ley 21.719)
2 · Cuando se agote la cuota, ¿qué prefieres?
3 · ¿Cuántos usuarios intensivos tienes?
4 · ¿Tienes o planeas automatización con iA? (agentes, pipelines)
5 · ¿Qué suite de productividad paga tu organización?

1. La primera decisión: qué pasa cuando se acaba la cuota

Los cuatro proveedores grandes venden un asiento y los cuatro miden algo encima. Lo que los separa no es el precio: es qué miden, en qué unidad, y qué pasa cuando se agota.

Unos fallan abiertos y te mandan la factura. Otros fallan cerrados y detienen a tu gente. Elegir es decidir cuál de los dos riesgos prefieres.

Esa es la pregunta que hay que hacer antes de comparar tarifas, y casi nunca aparece en la conversación comercial. Verificamos los cuatro contra su documentación oficial:

Lo que revela el cuadro. El costo fijo puro está en retirada. En OpenAI ningún plan corporativo es de costo fijo: tanto Business como Enterprise miden créditos desde el primer día, y lo único ilimitado es el modelo rápido. En Microsoft el asiento cubre lo básico pero todo lo agéntico se mide siempre. Solo Anthropic mantiene un plan corporativo verdaderamente plano —Team— y Google lo mantiene dentro de Workspace a cambio de topes duros.
Dos asimetrías que conviene poner sobre la mesa antes de firmar.

La dirección del riesgo se invierte. Anthropic falla abierto: el consumo sigue y se factura, así que el riesgo es presupuestario. OpenAI y Microsoft fallan cerrados y con prepago: el riesgo es operativo, gente detenida. Google se queda en medio, bloquea pero le ofrece al administrador abrir la llave. Para un cliente que teme la factura sorpresa, la respuesta no es el proveedor más barato: es el que falla del lado que puede tolerar.

OpenAI no publica el precio de su unidad. Microsoft dice que su crédito vale US$0,01 y Google publica US$0,10 por consulta y US$4 por Deep Research. El crédito de OpenAI solo aparece dentro del producto, al momento de comprar. Eso hace que su modelo no se pueda modelar en un caso de negocio antes de firmar, que es justo cuando se necesita.
Y una diferencia de fondo en la unidad de medida. Google es el único que cobra el excedente en la moneda del trabajo —una consulta, una investigación— y no en la del modelo. Eso lo hace mucho más fácil de presupuestar para un gerente, porque nadie sabe cuántos tokens tiene un contrato pero todos saben cuántos contratos revisan al mes. La contrapartida es que una vez habilitado el excedente no hay tope duro, solo alertas.

En detalle: las cuatro puertas de Anthropic

Lo desglosamos con el stack que conocemos mejor. La estructura se traduce a los otros proveedores: un asiento con tope, un asiento con más tope, un asiento con medidor, y la API sin asiento.

El punto de equilibrio entre fijo y variable

La comparación que importa es entre un asiento Premium y un asiento Enterprise, porque ambos resuelven el mismo problema —que a la persona no le falte capacidad— por caminos opuestos.

Cómo se decide en la práctica. Casi ninguna organización elige un solo camino. El patrón que funciona es mezclar: Standard para el grueso del equipo, Premium para el puñado de usuarios intensivos que se bloquean seguido, y API directa para las automatizaciones y productos, que no necesitan asiento porque no hay una persona detrás. Team permite combinar Standard y Premium en la misma organización, así que no hay que elegir un nivel para todos.
Y a veces la decisión no es económica. Los registros de auditoría, los permisos por rol, SCIM y la retención de datos configurable solo existen en Enterprise. Para un banco, una aseguradora o cualquier organización con obligaciones de trazabilidad bajo Ley 21.719, eso puede convertir a Enterprise en la única opción defendible, sin importar la comparación de costo. Enterprise también sube el contexto de 200K a 500K, que es una diferencia funcional y no solo de gobierno.

Dónde aparece el desperdicio en cada caso

 Costo fijo (Team)Costo variable (Enterprise o API)
La unidad que se gasta Un balde compartido entre Chat, Cowork y Claude Code, con ventana de 5 horas y tope semanal. Dólares por millón de tokens, de forma lineal.
Cómo se ve el desperdicio La sesión que se agota a media tarde y deja a alguien esperando. La cuenta a fin de mes, que nadie proyectó.
Qué recupera la disciplina Horas de trabajo y capacidad del equipo. Dinero, de forma directa y medible.
El error más caro Mandar a Cowork una tarea que el Chat resolvía: drena el balde de todos. Dejar crecer el contexto sin gestión, que multiplica la factura sin avisar.
Dato operativo: en los asientos de tarifa plana el cupo es un solo balde compartido entre Chat, Cowork y Claude Code. Quemar tokens en un motor resta capacidad en los otros. Cuando alguien topa, puede esperar el reinicio o activar usage credits, que permiten seguir trabajando a tarifa API — un escape variable dentro de un plan fijo.

¿Cuál de los dos riesgos tolera tu organización? MAindset modela el caso de negocio antes de firmar: consumo esperado, punto de equilibrio y mix de asientos por equipo. Conversemos →

2. Los heavy users dan vuelta la conclusión

Para la mayoría de la gente, un plan fijo es un gasto. Para un desarrollador o un analista de control de gestión, es un descuento — y de una magnitud que cambia la decisión.

Un asiento de tarifa plana puede costar veinte o cuarenta veces menos que el mismo trabajo pagado a tarifa API.

Es la cara opuesta de la sección anterior. El punto de equilibrio de US$80 al mes se cruza rápido: un desarrollador con Claude Code abierto todo el día, o un equipo de control de gestión cerrando mes, no consume US$80 — consume múltiplos de eso. Ahí la suscripción deja de ser un costo y pasa a ser la opción barata.

Tres advertencias antes de usar este número

1. Es un techo, no un valor. Alcanzarlo exige saturar los límites del plan de forma continua, veinticuatro por siete, y enrutar todo por el modelo más caro. Eso no lo hace una persona: lo hace una automatización (agentes, integración continua, tareas programadas).

2. El uso interactivo real rinde entre 1x y 3x. Un humano frente a la pantalla no extrae más, por intensa que sea su jornada. Si vas a construir un caso de negocio, constrúyelo sobre ese rango, no sobre el techo.

3. El techo estuvo a punto de cerrarse, y puede cerrarse. Anthropic anunció que desde el 15 de junio de 2026 el uso automatizado —Agent SDK, claude -p, apps de terceros— dejaría de consumir los límites de la suscripción y pasaría a facturarse aparte. El 15 de junio pausó el cambio y hoy nada de eso ocurrió: el uso automatizado sigue descontando del plan. Pero declaró que va a volver en alguna forma y que avisará antes. Un caso de negocio apoyado en este arbitraje tiene fecha de vencimiento desconocida.
Cuánto vale la automatización, según el propio proveedor. En el esquema que Anthropic alcanzó a publicar, el crédito mensual para uso automatizado era exactamente igual al precio del asiento: US$20 para Pro y Team Standard, US$100 para Max 5x y Team Premium, US$200 para Max 20x. Esa simetría es la señal más clara de cómo el proveedor valoriza la automatización frente al uso humano: uno a uno. Y su recomendación explícita fue que los equipos con automatización de producción compartida usen la API con clave propia, no la suscripción.
El arbitraje compra un problema de gobierno. Pro y Max son planes individuales: no tienen facturación central, ni SSO, ni controles de administrador, ni registros de auditoría. Poner a los desarrolladores en Max 20x para capturar el descuento significa sacarlos del perímetro administrado de la organización. Para un regulado, ese ahorro puede ser inaceptable por razones que no tienen nada que ver con el costo.
Lo que queda en pie. El valor de una suscripción no es el arbitraje de tokens: es la predicibilidad del costo y la superficie de producto que la API pelada no entrega — Claude Code interactivo, Cowork, Projects, Skills, conectores, la aplicación de escritorio. El arbitraje es un beneficio secundario, sujeto a que el proveedor lo tolere. La predicibilidad y el producto son estructurales.

Esta es exactamente la clase de decisión donde MAindset trabaja: medir el consumo real por persona y por equipo, distinguir el uso interactivo del automatizado, y armar el mix de planes que entrega la capacidad que hace falta sin pagar de más ni quedar fuera del perímetro de gobierno. Conversemos →

3. El mapa de modelos

Elegir el modelo es hoy una decisión de costo, no solo de calidad. Haz clic en cualquier encabezado para reordenar.

Modelo Familia Input Output Contexto Caché Puntaje US$/tarea min/tarea tok/tarea

Cómo leer cada columna

Input · Output · Caché
USD por millón de tokens. Input es lo que le mandas, output lo que responde —siempre entre 3 y 6 veces más caro— y caché lo que cuesta releer contexto ya enviado.
Contexto
Cuánto texto entra de una vez en una sola conversación o request.
Puntaje · US$/tarea · min/tarea · tok/tarea
Las cuatro vienen de la misma fuente y de la misma medición: el Artificial Analysis Intelligence Index v4.1, una batería independiente de nueve evaluaciones distintas. No son cifras nuestras ni de los proveedores.

El puntaje es el resultado combinado de las nueve; más es mejor. Las otras tres son el costo, el tiempo y los tokens de salida promedio para completar una tarea de esa misma batería, ponderados por el peso de cada evaluación e incluyendo los tokens de razonamiento. Ordena por cualquiera de ellas y el ranking cambia por completo: es el punto de toda esta página.

«s/p» = el modelo salió después de la medición del 20 de julio y no está puntuado. «s/m» = sin medir.

Qué son esas nueve evaluaciones: GDPval-AA v2 (trabajo real por ocupación), 𝜏³-Banking (uso de herramientas), Terminal-Bench v2.1 (código y terminal), SciCode, Humanity's Last Exam, GPQA Diamond (razonamiento científico), CritPt (física), AA-Omniscience (conocimiento y alucinación) y AA-LCR (razonamiento en contexto largo).

Por eso «tarea» aquí no significa tu tarea. Es una tarea de ese conjunto. Sirve para comparar modelos entre sí en igualdad de condiciones, no para estimar lo que te va a costar tu propio flujo — para eso está la calculadora más abajo, y sobre todo medir tu caso real.

Metodología y datos en artificialanalysis.ai. Casi todos los modelos ofrecen además Batch API, que cuesta la mitad si el resultado puede esperar horas; la excepción del mapa es Kimi K3, y está dicho en su nota.

Tres trampas que el precio de lista no muestra.

1. El acantilado de contexto largo. OpenAI cobra el doble de input y 1,5x el output sobre 272K tokens, y lo aplica a la request completa, no al excedente. Gemini Pro duplica sobre 200K. Claude no tiene recargo: una request de 900K se factura a la misma tarifa por token que una de 9K.

2. El tokenizador cambió. Claude 4.7 y posteriores, incluido Opus 5, usan un tokenizador que produce cerca de 30% más tokens para el mismo texto. Rinde mejor, pero comparar precio por token contra generaciones anteriores dejó de ser válido.

3. Mantener el caché cuesta. En Gemini hay precio de almacenamiento por hora (US$1 por millón en Flash, US$4,50 en Pro) además del costo de lectura.
Cómo leer el puntaje. Es el promedio ponderado de nueve evaluaciones, lo que lo hace más robusto que un test suelto, pero sigue siendo un benchmark: mide lo que mide. El evaluador METR reportó además en GPT-5.6 la tasa de «benchmark-gaming» más alta que ha medido. Úsalo para descartar opciones obviamente flojas, no para elegir entre dos que están a dos puntos de distancia.

4. Lo que realmente cuesta una tarea

Artificial Analysis corre una batería independiente de nueve evaluaciones y mide, para cada modelo, cuánto cuesta, cuánto demora y cuántos tokens gasta en completar una de esas tareas. Son tres preguntas distintas y ninguna se responde con el precio de lista.

Claude Sonnet 5 cuesta la mitad por token que Opus 5. Pero gasta el doble de tokens por tarea, demora 40% más y puntúa ocho puntos menos.

Ahí está toda la tesis en un caso. Sonnet 5 tiene precio de lista más bajo, así que en cualquier planilla de comparación gana. En el trabajo real quema 68.700 tokens de salida por tarea contra los 37.000 de Opus 5 —el 81% en razonamiento— y termina costando casi lo mismo por tarea completada, más lento y con peor resultado.

Fuente: Artificial Analysis, Intelligence Index v4.1 — un promedio ponderado sobre nueve evaluaciones independientes. Cambia de pestaña para ver los tres ejes. El número gris de la derecha es el puntaje de inteligencia del modelo y su razón de eficiencia. Ni las cifras ni el índice son nuestros: son verificables en artificialanalysis.ai.

Por qué el precio por token engaña. Un modelo de razonamiento decide cuántos tokens gasta pensando antes de responder, y esa cantidad no aparece en ninguna lista de precios. En estos modelos el razonamiento se lleva entre el 54% y el 81% de la salida: estás comprando cantidad de pensamiento, no cantidad de texto. Por eso dos modelos con precios de lista parecidos difieren al doble por tarea completada.
El tiempo también es plata, y no aparece en la factura. Kimi K3 puntúa 57, más que casi todo el mapa, y cuesta US$0,72 por tarea. Pero demora 13 minutos por tarea, contra los 2,4 de GPT-5.6 Terra, que puntúa 55. Para un proceso por lotes de noche eso da igual. Para alguien esperando frente a la pantalla, o para un agente con veinte pasos en cadena, es la diferencia entre una herramienta que se usa y una que se abandona.

Las tres lecturas que sirven para decidir

Si tu problema es…El dato que mandaQué hacer
Volumen alto de tareas simples
clasificar, extraer, rutear
Costo por tarea, sin más Los modelos livianos resuelven a una fracción del costo. La diferencia entre el más barato y el más caro del mercado es de más de cien veces, y la mayoría de las tareas de volumen no necesita frontera.
Producción rutinaria
documentos, respuestas, generación estándar
Puntos por dólar Aquí está el mayor desperdicio silencioso: es donde la gente usa el modelo de frontera por costumbre. Un modelo intermedio suele puntuar a dos o tres puntos del tope por menos de la mitad del costo por tarea.
Razonamiento difícil o agéntico
donde un error gatilla reintentos
Costo del reintento, no de la tarea El único caso donde el modelo caro se defiende. Si fallar de primera obliga a repetir el trabajo, o peor, si el error llega al cliente, la tarea barata que hay que hacer tres veces sale más cara que la correcta a la primera.
Cómo no usar este gráfico. Dos advertencias.

Mide tareas de benchmark, no las tuyas. Un despacho legal revisando contratos en español y una startup generando código tienen perfiles de consumo distintos, y el orden puede cambiar. Sirve para descartar lo obviamente caro y para formular la hipótesis; la decisión se cierra midiendo tu propio flujo con dos modelos en paralelo durante una semana.

La razón de eficiencia premia a los modelos baratos y flojos. El que más puntos por dólar rinde es también el que menos puntúa del mapa, y un modelo de 36 puntos no reemplaza a uno de 61 en trabajo difícil. La métrica sirve para comparar entre modelos que ya te sirven para la tarea, no para elegir el más eficiente en abstracto.

MAindset mide tu costo por tarea real: tu flujo, tus documentos, dos modelos en paralelo durante una semana. Con eso la decisión se toma con datos propios y verificables. Pide la medición →

5. Licencias de asiento

Aquí vive la economía de cupo, y aquí vive Copilot, que no se cobra por token.

ProveedorPlanPor usuario/mesNota
Copilot dejó de ser «una licencia y listo». Hoy es suscripción más medidor. El asiento de US$30 cubre chat, apps y agentes internos; todo lo agéntico nuevo se paga con Copilot Credits a US$0,01 cada uno, no se acumulan de un mes al siguiente y los agentes se desactivan al 125% de la capacidad contratada. Para un cliente que ya tiene E3 o E5, el riesgo de presupuesto no es el complemento: es el consumo variable que nadie proyectó.
Dato de gobernanza: Anthropic es hoy subprocesador de Microsoft y está activo por defecto en la nube comercial. Si el inventario de proveedores de tu cliente dice «solo Microsoft», está incompleto — y eso importa para el registro de tratamiento bajo Ley 21.719.

6. Las cinco palancas

Cada palanca tiene una regla y un régimen donde pega más fuerte.

Las cinco palancas se instalan entrenando a los equipos con casos del propio negocio — es parte del trabajo de adopción de MAindset. Entrena a tu equipo →

7. ¿Cuánto cuesta hoy tu forma de trabajar?

Ajusta los controles a tu operación real. La columna de la izquierda es el escenario sin disciplina; la del centro, el mismo trabajo con las cinco palancas aplicadas.

Sin disciplina
Con las cinco palancas
Ahorro
De dónde sale la diferencia

    Cifras ilustrativas con supuestos declarados. Los resultados reales varían según el contenido. Conversión a CLP a $950/USD referencial. La calculadora reproduce los Ejemplos A a E del informe.

    8. Biblioteca de tips

    Filtra por palanca, régimen, área o nivel. Se agregan tips cada dos semanas.

    Palanca
    Régimen
    Área
    Nivel

    9. Recursos

    Lo que se usa, no lo que se lee.

    La disciplina individual rinde hasta cierto tamaño.

    Con cientos de usuarios y varios proveedores en juego, se necesita observabilidad y atribución de costo por equipo, por modelo y por proveedor. Eso ya no es disciplina: es gobierno. Y es el trabajo de GobiernA.

    Medir el consumo de tu organización →

    Primera conversación sin compromiso: 30 minutos para ver dónde se está yendo el gasto.

    MAindset · Surfear la Ola: hacemos que la iA sea navegable

    Esta página se actualiza cada dos semanas porque los precios cambian a esa velocidad. Verifica siempre contra las páginas oficiales de cada proveedor antes de una decisión vinculante.

    © 2026 MAindset · Santiago, Chile