El hallazgo de mediados de 2026: el precio por token dejó de predecir el costo. Los tres grandes laboratorios lanzaron modelos que resuelven la misma tarea con drásticamente menos tokens de razonamiento, así que un modelo con precio de lista más alto termina más barato por tarea completada. El número que manda es el costo por tarea.
La misma tarea puede consumir entre 30% y 70% menos con disciplina de formato, de contexto y de modelo. En asientos de tarifa plana eso recupera horas bloqueadas por los topes de uso; en API baja la cuenta en dólares.
Precios y modelos verificados contra las páginas oficiales de Anthropic, OpenAI, Google, xAI, Meta, Moonshot y Microsoft el 2 de octubre de 2026. El mercado cambia semana a semana: validar cifras antes de toda decisión vinculante.
¿Qué te conviene comprar?
Cinco preguntas y una hipótesis de mix. El respaldo de cada respuesta está en las secciones que siguen.
La primera decisión: qué pasa cuando se acaba la cuota
Los seis proveedores de la tabla venden un asiento, y casi todos miden algo encima. Lo que los separa no es el precio: es qué miden, en qué unidad, y qué pasa cuando se agota.
Unos fallan abiertos y te mandan la factura. Otros fallan cerrados y detienen a tu gente. Elegir es decidir cuál de los dos riesgos prefieres.
Esa es la pregunta que hay que hacer antes de comparar tarifas, y casi nunca aparece en la conversación comercial. Verificamos los seis contra su documentación oficial.
| Proveedor | Asiento | ¿Costo fijo puro? | Unidad del excedente | Pago | Al agotarse | El riesgo |
|---|---|---|---|---|---|---|
| Anthropic | US$20 a US$100 (Team) · US$20 (Enterprise) | Sí, en Team | Tokens a tarifa API de lista | Prepago en Team · postpago en Enterprise con contrato | Falla abiertoEl consumo sigue y se factura. Nadie se bloquea. | La factura que nadie proyectó.Límites de gasto por usuario y por organización en Team y Enterprise; por tipo de asiento, solo en Enterprise. |
| OpenAI | US$20 a US$125 (Business Standard y Premium) · Enterprise sin precio público | Sí, en Business, si no se compran créditos | Créditos propios, sin precio de lista (≈US$0,04 implícito) · tokens en Enterprise | Prepago · postpago por tokens en Enterprise | Falla cerradoSe agota el pool y la función se bloquea. El usuario pide más al administrador. | Gente detenida a mitad de mes.Controles de gasto por asiento y por usuario; por rol solo en Enterprise. |
| Microsoft | US$30 (Microsoft 365 Copilot) · Copilot Chat incluido | Solo para la iA cotidiana; lo avanzado se mide siempre | Copilot Credits a US$0,01 | Prepago · por uso vía Azure | Falla cerradoCon capacidad prepagada, los agentes se desactivan al llegar al 125%. Con pago por uso vía Azure no hay corte: se factura. | Agentes apagados, y créditos que no se acumulan al mes siguiente.Topes de gasto por tenant, grupo y usuario, con panel de costos. |
| Desde US$21 a US$30 (Gemini Enterprise) · incluido en Workspace | En Workspace sí, con límites por usuario | Tokens a precios de Agent Platform (hasta septiembre, por consulta) | Postpago, si se habilita | Falla cerrado, con llaveSe restringe la función y el administrador decide: habilitar el excedente o quedarse en la cuota. | En Gemini Enterprise la cuota es un pozo común por edición: un usuario intensivo puede dejar sin asistente a sus colegas.Tope mensual de gasto que corta el excedente, más alertas de presupuesto. | |
| SpaceXAI (xAI) | US$10 a US$300 (SuperGrok) · US$30 por asiento en Grok Business · Enterprise cotizado | Sí, si no se compran créditos | Extra Usage Credits en US$, prepagados desde US$5 | Prepago | Falla cerradoAl agotar la bolsa semanal el plan cae al nivel gratis, salvo que esté activa la recarga automática. | Gente degradada al plan gratis a mitad de semana.SSO, SCIM y retención configurable solo en Enterprise. Sin residencia de datos fuera de EE.UU. |
| Meta | US$20 (Muse Power) o US$100 (Muse Max) · sin plan por asiento para empresas | Sí: no hay excedente | No hay: cuota semanal en tokens | Prepago mensual | Falla cerradoSe espera a que se reinicie la cuota semanal. | Sin plan corporativo y solo en EE.UU. y Canadá: hoy no es una compra posible para una empresa en Chile.Meta Enterprise Platform se anunció el 28 de septiembre, sin precios. |
Lo que revela el cuadro. El asiento con uso incluido y créditos encima se volvió el estándar. Anthropic lo tiene en Team y OpenAI lo copió en Business, que desde agosto suma un asiento Premium: si no se compran créditos, ambos son de costo fijo y la persona espera al topar. En Microsoft el asiento cubre la iA cotidiana y todo lo avanzado se mide siempre. Google lo mantiene dentro de Workspace con límites por usuario. SpaceXAI copia el esquema con créditos prepagados en dólares, y Meta todavía no vende Muse a empresas.
Dos asimetrías que conviene poner sobre la mesa antes de firmar.
La dirección del riesgo se invierte. Anthropic falla abierto: el consumo sigue y se factura, así que el riesgo es presupuestario. OpenAI y Microsoft fallan cerrados y con prepago: el riesgo es operativo, gente detenida. Google se queda en medio: bloquea, pero le ofrece al administrador abrir la llave y, desde septiembre, fijar un tope mensual. Para un cliente que teme la factura sorpresa, la respuesta no es el proveedor más barato: es el que falla del lado que puede tolerar.
OpenAI sigue sin publicar el precio de su unidad. Microsoft dice que su crédito vale US$0,01. OpenAI dice que depende del plan o del acuerdo, pero su promoción de asientos Premium equiparó US$100 a 2.500 créditos: unos US$0,04 por crédito, consistente con su tabla de conversión por token. Sirve para modelar el caso de negocio; el precio se pide por escrito antes de firmar.
Y Google dejó de cobrar en la moneda del trabajo. Hasta julio era el único que cobraba el excedente por consulta y por investigación, la unidad más fácil de presupuestar para un gerente: nadie sabe cuántos tokens tiene un contrato, pero todos saben cuántos contratos revisan al mes. Su documentación de fines de septiembre lo cobra a precios de Agent Platform, por tokens, como los demás. A cambio, sumó un tope mensual de gasto que corta el excedente al alcanzarlo.
En detalle: las cuatro puertas de Anthropic
Lo desglosamos con el stack que conocemos mejor. La estructura se traduce a los otros proveedores: un asiento con tope, un asiento con más tope, un asiento con medidor, y la API sin asiento.
Team · asiento Standard
US$20 por asiento/mes
US$25 si se factura mensual. De 2 a 150 asientos.
- ¿Hay tope de uso?
- Sí. Ventana de 5 horas más tope semanal, compartidos entre Chat, Cowork y Claude Code.
- Cuando se topa
- La persona espera a que se reinicie, o se activan usage credits prepagados a tarifa API.
- Contexto
- Hasta 1M, según el modelo
- Gobierno
- SSO, facturación central, control de conectores.
- Para quién
- El grueso de la organización: uso regular, presupuesto que hay que defender con una cifra exacta.
Team · asiento Premium
US$100 por asiento/mes
US$125 si se factura mensual. Cinco veces el uso de un Standard.
- ¿Hay tope de uso?
- Sí, cinco veces más alto que Standard.
- Cuando se topa
- Igual que Standard, pero se topa mucho menos seguido.
- Contexto
- Hasta 1M, según el modelo
- Gobierno
- El mismo que Standard.
- Para quién
- Los usuarios intensivos. Se pueden mezclar Standard y Premium en la misma organización, así que no hay que elegir uno para todos.
Enterprise
US$20 por asiento/mes + consumo
El consumo se factura a tarifa API y escala con el modelo y la tarea. Solo contrato anual.
- ¿Hay tope de uso?
- No hay tope de uso. Hay límites de gasto que fija el administrador.
- Cuando se topa
- Nadie se bloquea: el consumo sigue y se factura.
- Contexto
- Hasta 1M, según el modelo
- Gobierno
- Todo lo de Team, más límites de gasto por usuario y por organización, permisos por rol, SCIM, registros de auditoría, API de cumplimiento, retención de datos configurable, control de red y lista blanca de IP.
- Para quién
- Organizaciones grandes, y cualquiera con exigencias de auditoría o cumplimiento. Para un regulado en Chile suele ser la única opción viable.
API directa
Solo consumo
Sin asientos. Precio por millón de tokens, con caché y Batch.
- ¿Hay tope de uso?
- No hay tope, solo límites de tasa por nivel de cuenta.
- Cuando se topa
- No aplica.
- Contexto
- Según el modelo, hasta 1M
- Gobierno
- Consola, claves por proyecto, atribución de costo propia.
- Para quién
- Productos, automatizaciones y pipelines. No para que una persona trabaje.
El punto de equilibrio entre fijo y variable
La comparación que importa es entre un asiento Premium y un asiento Enterprise, porque ambos resuelven el mismo problema —que a la persona no le falte capacidad— por caminos opuestos.
El Premium se paga solo desde US$80 al mes de consumo a tarifa API. Y su cupo, a esa misma tarifa, vale del orden de US$2.000.
Para dar escala: US$80 son unas 13 tareas de complejidad alta con Claude Opus 5.5 en su esfuerzo máximo (US$5,98 por tarea), o 23 en esfuerzo xhigh. Quien hace menos que eso al mes sale más barato en Enterprise, que tampoco es ilimitado: al llegar al límite de gasto que fija el administrador, se detiene. Uno que hace mucho más, en Enterprise dispara la cuenta, y ahí el Premium funciona como seguro contra el consumo propio.
Cómo se decide en la práctica. Casi ninguna organización elige un solo camino. El patrón que funciona es mezclar: Standard para el grueso del equipo, Premium para el puñado de usuarios intensivos que se bloquean seguido, y API directa para las automatizaciones y productos, que no necesitan asiento porque no hay una persona detrás. Team permite combinar Standard y Premium en la misma organización, así que no hay que elegir un nivel para todos.
Y a veces la decisión no es económica. Los registros de auditoría, los permisos por rol, SCIM y la retención de datos configurable solo existen en Enterprise. Para un banco, una aseguradora o cualquier organización con obligaciones de trazabilidad bajo Ley 21.719 —vigente desde el 1 de diciembre de 2026, con un proyecto en el Senado para postergarla un año—, eso puede convertir a Enterprise en la única opción defendible, sin importar la comparación de costo.
Dónde aparece el desperdicio en cada caso
| Aspecto | Costo fijo (Team) | Costo variable (Enterprise o API) |
|---|---|---|
| La unidad que se gasta | Un balde compartido entre Chat, Cowork y Claude Code, con ventana de 5 horas y tope semanal. | Dólares por millón de tokens, de forma lineal. |
| Cómo se ve el desperdicio | La sesión que se agota a media tarde y deja a alguien esperando. | La cuenta a fin de mes, que nadie proyectó. |
| Qué recupera la disciplina | Horas de trabajo y capacidad del equipo. | Dinero, de forma directa y medible. |
| El error más caro | Mandar a Cowork una tarea que el Chat resolvía: drena el balde de todos. | Dejar crecer el contexto sin gestión, que multiplica la factura sin avisar. |
Dato operativo. En los asientos de tarifa plana el cupo es un solo balde compartido entre Chat, Cowork y Claude Code. Quemar tokens en un motor resta capacidad en los otros. Cuando alguien topa, puede esperar el reinicio o activar usage credits, que permiten seguir trabajando a tarifa API: un escape variable dentro de un plan fijo.
Los heavy users dan vuelta la conclusión
Para la mayoría de la gente, un plan fijo es un gasto. Para un desarrollador o un analista de control de gestión, es un descuento, y de una magnitud que cambia la decisión.
Un asiento de tarifa plana puede costar veinte o cuarenta veces menos que el mismo trabajo pagado a tarifa API.
Es la cara opuesta de la sección anterior. El punto de equilibrio de US$80 al mes se cruza rápido: un desarrollador con Claude Code abierto todo el día, o un equipo de control de gestión cerrando mes, no consume US$80: consume múltiplos de eso. Ahí la suscripción deja de ser un costo y pasa a ser la opción barata.
| Plan | Precio | Gasto máx. | Múltiplo |
|---|---|---|---|
| Anthropic · Claude | |||
| Pro | US$20 | US$400 | 20x |
| Max 5x | US$100 | US$2.000 | 20x |
| Max 20x | US$200 | US$8.000 | 40x |
| OpenAI · ChatGPT / Codex | |||
| Plus | US$20 | US$700 | 35x |
| Pro 5x | US$100 | US$3.500 | 35x |
| Pro 10x | US$200 | US$7.000 | 35x |
| Pro 25x | US$500 | US$17.500 | 35x |
Tres advertencias antes de usar este número
- Es un techo, no un valor. Alcanzarlo exige saturar los límites del plan de forma continua, veinticuatro por siete, y enrutar todo por el modelo más caro. Eso no lo hace una persona: lo hace una automatización (agentes, integración continua, tareas programadas).
- El uso interactivo real rinde entre 1x y 3x. Un humano frente a la pantalla no extrae más, por intensa que sea su jornada. Si vas a construir un caso de negocio, constrúyelo sobre ese rango, no sobre el techo.
- El techo estuvo a punto de cerrarse, y puede cerrarse. Anthropic anunció que desde el 15 de junio de 2026 el uso automatizado —Agent SDK, claude -p, apps de terceros— dejaría de consumir los límites de la suscripción y pasaría a facturarse aparte. El 15 de junio pausó el cambio y hoy nada de eso ocurrió: el uso automatizado sigue descontando del plan. Pero declaró que va a volver en alguna forma y que avisará antes. Un caso de negocio apoyado en este arbitraje tiene fecha de vencimiento desconocida.
Cuánto vale la automatización, según el propio proveedor. En el esquema que Anthropic alcanzó a publicar, el crédito mensual para uso automatizado era exactamente igual al precio del asiento: US$20 para Pro y Team Standard, US$100 para Max 5x y Team Premium, US$200 para Max 20x. Esa simetría es la señal más clara de cómo el proveedor valoriza la automatización frente al uso humano: uno a uno. Y su recomendación explícita fue que los equipos con automatización de producción compartida usen la API con clave propia, no la suscripción.
El arbitraje compra un problema de gobierno. Pro y Max son planes individuales: no tienen facturación central, ni SSO, ni controles de administrador, ni registros de auditoría. Poner a los desarrolladores en Max 20x para capturar el descuento significa sacarlos del perímetro administrado de la organización. Para un regulado, ese ahorro puede ser inaceptable por razones que no tienen nada que ver con el costo.
Lo que queda en pie. El valor de una suscripción no es el arbitraje de tokens: es la predicibilidad del costo y la superficie de producto que la API pelada no entrega: Claude Code interactivo, Cowork, Projects, Skills, conectores, la aplicación de escritorio. El arbitraje es un beneficio secundario, sujeto a que el proveedor lo tolere. La predicibilidad y el producto son estructurales.
El mapa de modelos
Elegir el modelo es hoy una decisión de costo, no solo de calidad. Haz clic en cualquier encabezado para reordenar.
| Claude Opus 5.5 | Claude | US$4,00 | US$20,00 | 1M | US$0,20−95% | 58 | US$5,98 | 13,2 | 119K70% razón |
|---|---|---|---|---|---|---|---|---|---|
| El más capaz del índice (58) y además 20% más barato por token que Opus 5, con 95% de descuento de caché; en esfuerzo xhigh baja a 56 puntos por US$3,46 la tarea, que suele ser el punto óptimo. | |||||||||
| Claude Sonnet 5.5 | Claude | US$2,00 | US$10,00 | 1M | US$0,20−90% | 56 | US$7,67 | 14,9 | 197K74% razón |
| En máximo esfuerzo puntúa 56 pero gasta 197.000 tokens por tarea, el más verboso del mapa, y termina costando más por tarea que Opus 5.5; en esfuerzo high (47 puntos, US$1,12) es donde rinde como caballo de producción. | |||||||||
| Claude Fable 5.1 | Claude | US$10,00 | US$50,00 | 1M | US$0,25−97,5% | 53 | US$7,63 | 11,9 | 78K60% razón |
| Sigue siendo el más caro por token y ya no es el más capaz: Opus 5.5 puntúa cinco más y cuesta 22% menos por tarea; su ventaja real es el mayor descuento de caché entre los modelos cerrados (97,5%). | |||||||||
| GPT-6 Astra | OpenAI | US$10,00 | US$50,00 | 1,05M | US$1,00−90% | 53 | US$3,26 | 8,4 | 27K61% razón |
| El tope de OpenAI empata en puntaje con Gemini 4 Argon (53) a un costo por tarea 64% mayor, y sobre 272K tokens pasa a US$20/US$75 aplicado a la request completa. | |||||||||
| Gemini 4 Argon | US$2,00 | US$10,00 | 1M | US$0,10−95% | 53 | US$1,99 | s/m | 62K58% razón | |
| Empata a GPT-6 Astra (53) al 60% de su costo por tarea, pero con dos letras chicas: los US$2/US$10 son introductorios, sin fecha de término confirmada, y suben a US$4/US$20; y por ahora solo lo usan miembros del programa Fairwind de Google, no está abierto en la API. | |||||||||
| GPT-6.1 Sol | OpenAI | US$2,00 | US$10,00 | 1,05M | US$0,10−95% | 52 | US$0,72 | 10,1 | 38K66% razón |
| La mejor relación puntaje-costo de la frontera: 52 puntos, uno menos que Astra, por US$0,72 la tarea, menos de un cuarto; reemplazó a GPT-6 Sol el 29 de septiembre con el doble de descuento de caché (95%). | |||||||||
| Muse Spark 1.3 | Meta | US$1,25 | US$4,25 | 1,05M | US$0,15−88% | 48 | US$1,60 | 6,7 | 60K57% razón |
| 48 puntos a US$1,60 por tarea, menos de la mitad que Grok 4.7, y sin recargo por contexto largo. Pero no tiene Batch, la API hoy se contrata solo desde EE.UU., Meta agrega su propio prompt de sistema a cada llamada y el tier barato (Contributor) entrena con tus datos. | |||||||||
| Grok 4.7 | SpaceXAI | US$2,00 | US$6,00 | 500K | US$0,50−75% | 46 | US$3,74 | 17,1 | 81K73% razón |
| 46 puntos, pero ya no es el eficiente del mapa: es muy verboso y cuesta US$3,74 y 17 minutos por tarea, más del doble que Muse Spark 1.3 con dos puntos menos. Acepta Batch sin descuento, el caché rebaja solo 75% y desde 200K tokens el precio se dobla (US$4/US$12) sobre la request completa. | |||||||||
| MiMo-V2.6-Pro | Open-weight | US$0,435 | US$0,87 | 1M | US$0,0036−99,2% | 46 | US$0,13 | 23,0 | 64K58% razón |
| La sorpresa del mapa: 46 puntos, igual que Grok 4.7, por US$0,13 la tarea y con pesos abiertos bajo licencia MIT; el costo es la latencia, 23 minutos por tarea. | |||||||||
| GLM-5.3 | Open-weight | US$1,40 | US$4,40 | 1M | US$0,26−81,4% | 45 | US$2,01 | 13,6 | 71K69% razón |
| 45 puntos con pesos abiertos a US$2 por tarea y 13,6 minutos; su descuento de caché (81%) es de los más bajos del mapa, aunque el almacenamiento del caché es gratis por tiempo limitado. | |||||||||
| Kimi K3 | Open-weight | US$3,00 | US$15,00 | 1,05M | US$0,30−90% | 44 | US$2,00 | 20,5 | 48K67% razón |
| Los pesos ya están publicados en Hugging Face desde el 27 de julio, con licencia propia, no estándar, que exige acuerdo a quien venda el modelo como servicio con más de US$20 millones de ingresos; por API cuesta US$2 por tarea, demora 20 minutos y no tiene Batch. | |||||||||
| Gemini 3.8 Flash | US$0,75 | US$3,75 | 1,05M | US$0,075−90% | 41 | US$1,24 | 4,4 | 71K60% razón | |
| 41 puntos a US$1,24 por tarea con precio introductorio: desde el 1 de enero de 2027 sube al doble (US$1,50/US$7,50) y el almacenamiento de caché pasa de US$0,50 a US$1 por millón por hora. | |||||||||
| DeepSeek V4.1 Flash | Open-weight | US$0,30 | US$1,20 | 1M | US$0,006−98% | 39 | US$0,27 | 5,0 | 89K71% razón |
| 39 puntos a US$0,27 por tarea y 5 minutos, con pesos abiertos; los precios son de hora punta y fuera de ella (incluidos fines de semana) cuestan la mitad, lo que funciona como un Batch. | |||||||||
| GPT-6 Luna | OpenAI | US$0,10 | US$0,50 | 1,05M | US$0,01−90% | 38 | US$0,068 | 6,2 | 50K78% razón |
| El más barato por tarea del mapa (US$0,07) con 38 puntos, más del doble que Haiku 4.5 y casi a la par de DeepSeek V4.1 Flash; para volumen alto, cuidando el salto a US$0,20/US$0,75 sobre 272K tokens. | |||||||||
| Gemini 3.5 Flash-Lite | US$0,30 | US$2,50 | 1,05M | US$0,03−90% | 22 | US$0,12 | 0,8 | 18K59% razón | |
| Sigue siendo el más rápido del mapa (menos de un minuto por tarea) a US$0,12 la tarea; para clasificación y extracción de altísimo volumen, supera a Haiku 4.5 en puntaje y en costo. | |||||||||
| Claude Haiku 4.5 | Claude | US$1,00 | US$5,00 | 200K | US$0,10−90% | 17 | US$0,28 | 2,0 | 18K41% razón |
| Sigue siendo el Haiku vigente, pero en el índice nuevo quedó atrás: 17 puntos contra 22 de Gemini 3.5 Flash-Lite y 46 de MiMo-V2.6-Pro, que cuestan menos por tarea; único Claude con 200K de contexto. | |||||||||
- Input · Output · Caché
- USD por millón de tokens. Input es lo que le mandas, output lo que responde —siempre entre 3 y 6 veces más caro— y caché lo que cuesta releer contexto ya enviado.
- Contexto
- Cuánto texto entra de una vez en una sola conversación o request.
- Puntaje · US$/tarea · min/tarea · tok/tarea
- Las cuatro vienen de la misma fuente y de la misma medición: el Artificial Analysis Intelligence Index v4.3.2, una batería independiente de diez evaluaciones distintas. No son cifras nuestras ni de los proveedores.
El puntaje es el resultado combinado de las diez; más es mejor. Las otras tres son el costo, el tiempo y los tokens de salida promedio para completar una tarea de esa misma batería, ponderados por el peso de cada evaluación e incluyendo los tokens de razonamiento. Ordena por cualquiera de ellas y el ranking cambia por completo: es el punto de toda esta página.
Qué son esas diez evaluaciones: AA-Briefcase (trabajo de oficina con archivos), GDPval-AA v2.1 (trabajo real por ocupación), AutomationBench-AA (automatización con herramientas), Terminal-Bench 4.0 (código y terminal), SciCode, Humanity's Last Exam, GDP.pdf (documentos), CritPt (física), AA-Omniscience (conocimiento y alucinación) y AA-LCR v1.1 (razonamiento en contexto largo). Desde septiembre las tareas son más difíciles: los puntajes bajaron para todos y no se comparan con los de julio.
Por eso «tarea» aquí no significa tu tarea. Es una tarea de ese conjunto. Sirve para comparar modelos entre sí en igualdad de condiciones, no para estimar lo que te va a costar tu propio flujo: para eso está la calculadora más abajo, y sobre todo medir tu caso real.
Metodología y datos en artificialanalysis.ai. «s/m» es sin medir. Casi todos los modelos ofrecen además Batch API, que cuesta la mitad si el resultado puede esperar horas; las excepciones del mapa son Grok 4.7, que lo acepta sin descuento, Kimi K3 y Muse Spark 1.3, y está dicho en sus notas.
Tres trampas que el precio de lista no muestra.
- El acantilado de contexto largo. OpenAI cobra el doble de input y 1,5x el output sobre 272K tokens, y lo aplica a la request completa, no al excedente. Grok 4.7 y Gemini Pro duplican sobre 200K. Claude no tiene recargo: una request de 900K se factura a la misma tarifa por token que una de 9K.
- El tokenizador cambió. Claude 4.7 y posteriores, incluidos Opus 5.5 y Sonnet 5.5, usan un tokenizador que produce cerca de 30% más tokens para el mismo texto. Rinde mejor, pero comparar precio por token contra generaciones anteriores dejó de ser válido.
- Mantener el caché cuesta. En Gemini hay precio de almacenamiento por hora (US$0,50 por millón en Gemini 3.8 Flash hasta diciembre y US$1 desde enero, US$4,50 en Pro) además del costo de lectura.
Cómo leer el puntaje. Es el promedio ponderado de diez evaluaciones, lo que lo hace más robusto que un test suelto, pero sigue siendo un benchmark: mide lo que mide, y cambió tres veces de versión en septiembre. El evaluador METR reportó además en GPT-5.6 la tasa de «benchmark-gaming» más alta que había medido. Úsalo para descartar opciones obviamente flojas, no para elegir entre dos que están a dos puntos de distancia.
Lo que realmente cuesta una tarea
Artificial Analysis corre una batería independiente de diez evaluaciones y mide, para cada modelo, cuánto cuesta, cuánto demora y cuántos tokens gasta en completar una de esas tareas. Son tres preguntas distintas y ninguna se responde con el precio de lista.
Claude Sonnet 5.5 cuesta la mitad por token que Opus 5.5. Pero gasta 66% más tokens por tarea, demora más, puntúa dos puntos menos y termina 28% más caro.
Ahí está toda la tesis en un caso. Sonnet 5.5 tiene precio de lista más bajo, así que en cualquier planilla de comparación gana. En el trabajo real, en su esfuerzo máximo, quema 197.000 tokens de salida por tarea contra los 119.000 de Opus 5.5 —el 74% en razonamiento— y termina costando US$7,67 por tarea completada contra US$5,98: más caro, más lento y con peor resultado.
Por qué el precio por token engaña. Un modelo de razonamiento decide cuántos tokens gasta pensando antes de responder, y esa cantidad no aparece en ninguna lista de precios. En estos modelos el razonamiento se lleva entre el 41% y el 78% de la salida: estás comprando cantidad de pensamiento, no cantidad de texto. Por eso dos modelos con el mismo precio de lista difieren cinco veces por tarea completada: GPT-6.1 Sol y Sonnet 5.5 cobran ambos US$2/US$10, y uno cuesta US$0,72 por tarea y el otro US$7,67.
El tiempo también es plata, y no aparece en la factura. MiMo-V2.6-Pro puntúa 46, igual que Grok 4.7, y cuesta US$0,13 por tarea. Pero demora 23 minutos por tarea, contra los 10 de GPT-6.1 Sol, que puntúa 52, y el minuto escaso de Gemini 3.5 Flash-Lite. Para un proceso por lotes de noche eso da igual. Para alguien esperando frente a la pantalla, o para un agente con veinte pasos en cadena, es la diferencia entre una herramienta que se usa y una que se abandona.
Las tres lecturas que sirven para decidir
| Si tu problema es… | El dato que manda | Qué hacer |
|---|---|---|
| Volumen alto de tareas simplesclasificar, extraer, rutear | Costo por tarea, sin más | Los modelos livianos resuelven a una fracción del costo. La diferencia entre el más barato y el más caro del mercado es de más de cien veces, y la mayoría de las tareas de volumen no necesita frontera. |
| Producción rutinariadocumentos, respuestas, generación estándar | Puntos por dólar | Aquí está el mayor desperdicio silencioso: es donde la gente usa el modelo de frontera por costumbre. Un modelo intermedio suele puntuar a dos o tres puntos del tope por menos de la mitad del costo por tarea. |
| Razonamiento difícil o agénticodonde un error gatilla reintentos | Costo del reintento, no de la tarea | El único caso donde el modelo caro se defiende. Si fallar de primera obliga a repetir el trabajo, o peor, si el error llega al cliente, la tarea barata que hay que hacer tres veces sale más cara que la correcta a la primera. |
Cómo no usar este gráfico.
- Mide tareas de benchmark, no las tuyas. Un despacho legal revisando contratos en español y una startup generando código tienen perfiles de consumo distintos, y el orden puede cambiar. Sirve para descartar lo obviamente caro y para formular la hipótesis; la decisión se cierra midiendo tu propio flujo con dos modelos en paralelo durante una semana.
- La razón de eficiencia premia a los modelos baratos y flojos. El que más puntos por dólar rinde es también el que menos puntúa del mapa, y un modelo de 36 puntos no reemplaza a uno de 61 en trabajo difícil. La métrica sirve para comparar entre modelos que ya te sirven para la tarea, no para elegir el más eficiente en abstracto.
Licencias de asiento
Aquí vive la economía de cupo, y aquí vive Copilot, que no se cobra por token.
| Proveedor | Plan | Por usuario/mes | Nota |
|---|---|---|---|
| Anthropic | Claude Pro | US$17 | US$20 si se factura mensual. Plan individual, no corporativo: sin facturación central ni SSO. |
| Anthropic | Claude Max | US$100 | Cinco o veinte veces el uso de Pro. Individual. Para un equipo, el asiento Premium de Team cuesta lo mismo y suma administración. |
| Anthropic | Team · Standard | US$20 | US$25 mensual. De 2 a 150 asientos. Se puede mezclar con asientos Premium. |
| Anthropic | Team · Premium | US$100 | US$125 mensual. Cinco veces el uso de un Standard. |
| Anthropic | Enterprise | US$20 | Más el consumo a tarifa API. Límites de gasto por tipo de asiento, SCIM, auditoría y permisos por rol. Solo anual. |
| OpenAI | ChatGPT Plus | US$20 | Acceso a la familia GPT-6 con límites. Existe además ChatGPT Go a US$8. |
| OpenAI | ChatGPT Pro | US$100 | Cinco veces el uso de Plus. Desde el 29 de septiembre hay escalones de US$200 (diez veces, para suscriptores nuevos) y US$500 (veinticinco veces). |
| OpenAI | ChatGPT Business | US$25 | US$20 por usuario con compromiso anual. Mínimo dos asientos. Desde el 25 de agosto hay asiento Premium a US$100 anual (US$125 mensual), con cinco veces el uso. |
| Google AI Pro | US$19,99 | Cuatro veces los límites del plan gratuito. | |
| Google AI Ultra | US$99,99 | Cinco veces los límites de Pro. Hay un escalón de US$199,99. | |
| SpaceXAI | SuperGrok Lite | US$10 | Individual. No incluye Grok Bot. |
| SpaceXAI | SuperGrok | US$30 | Individual. Bolsa semanal compartida entre productos e incluye Grok Bot. El excedente se paga con créditos prepagados en dólares. |
| SpaceXAI | SuperGrok Plus · Heavy | US$100 · US$300 | Más bolsa semanal y acceso prioritario a los modelos más pesados. Individuales. |
| SpaceXAI | Grok Business | US$30 | Por asiento, según la prensa. No incluye Grok Bot. SSO, SCIM, retención configurable y Vault, solo en Enterprise (cotizado). |
| Meta | Muse Power · Max | US$20 · US$100 | Individuales, solo mensuales y solo en EE.UU. y Canadá. Cuota semanal sin excedente: al agotarla, se espera. |
| Microsoft | Microsoft 365 Copilot | US$30 | Complemento sobre un plan base elegible (E3, E5, Business Standard o Premium). Compromiso anual. |
| Microsoft | Copilot Business | US$21 | Para pymes de menos de 300 usuarios. Precio promocional de US$18 hasta el 31 de diciembre de 2026. |
| Microsoft | Copilot Chat | incluido | Incluido sin costo adicional en las suscripciones M365 elegibles. Los agentes se cobran por consumo. |
| Microsoft | Copilot Studio | por consumo | US$200 por paquete mensual = 25.000 Copilot Credits a nivel tenant. Por consumo: US$0,01 por crédito. |
Copilot dejó de ser «una licencia y listo». Hoy es suscripción más medidor, y Microsoft lo formalizó el 25 de septiembre: el asiento de US$30 cubre la iA cotidiana, y Cowork, Code, Autopilot, los agentes de larga duración y los modelos de frontera como Fable y Astra se pagan con Copilot Credits a US$0,01 cada uno. Los créditos prepagados no se acumulan de un mes al siguiente y los agentes se desactivan al 125% de la capacidad contratada; con pago por uso vía Azure no hay corte, se factura. Para un cliente que ya tiene E3 o E5, el riesgo de presupuesto no es el complemento: es el consumo variable que nadie proyectó.
Grok Bot no se cobra aparte. Son los agentes de SpaceXAI (ex xAI) que trabajan de forma continua en un computador en la nube, y corren sobre Cursor. No se cobran por agente ni por hora: vienen en los planes Pro, Pro+, Ultra y Teams de Cursor, o al vincular una cuenta SuperGrok, Plus o Heavy; Lite y Grok Business no los incluyen. Al agotar la bolsa semanal, el excedente se cobra por tokens vía Cursor, con tope mensual. En Teams viene activado por defecto, así que no se corta solo: es un proveedor que falla abierto escondido dentro de otro. Y todos los Bots de un usuario comparten el mismo computador, así que uno no sirve como frontera de seguridad del otro.
Meta Muse todavía es un producto de consumo. No hay plan por asiento ni administración central, y solo funciona en EE.UU. y Canadá. Su modelo, Muse Spark 1.3, es eficiente por tarea, pero su API hoy se contrata solo desde EE.UU. y en septiembre acumuló dudas de privacidad: Muse entregaba su sistema de archivos completo con poco esfuerzo, algo que Meta dice que es intencional. Vale seguirlo, no comprarlo todavía.
Dato de gobernanza. Anthropic es hoy subprocesador de Microsoft y está activo por defecto en la nube comercial, salvo en la Unión Europea, EFTA y Reino Unido. Si el inventario de proveedores de tu cliente dice «solo Microsoft», está incompleto, y eso importa para el registro de tratamiento bajo Ley 21.719.
Las cinco palancas
Cada palanca tiene una regla y un régimen donde pega más fuerte.
Qué motor uso
Si te sentarías a mirarlo, es Chat. Si te levantarías a hacer otra cosa, es Cowork o Claude Code.
Dónde pega: CupoCuándo reinicio el contexto
Un hilo fresco por tarea. Lo durable vive en el Project, no en la conversación.
Dónde pega: Ambas economíasQué modelo y con qué esfuerzo
El costo que importa es por tarea completada: ahí el modelo caro puede salir más barato.
Dónde pega: FacturaQué preparo fuera del modelo
Nunca pegues un PDF crudo cuando basta texto limpio.
Dónde pega: FacturaQué reutilizo en vez de rehacer
El skill se descubre una vez y se invoca siempre.
Dónde pega: Ambas economías¿Cuánto cuesta hoy tu forma de trabajar?
Ajusta los controles a tu operación real. A la izquierda, el escenario sin disciplina; al centro, el mismo trabajo con las palancas aplicadas.
Biblioteca de tips
Filtra por palanca, régimen, área o nivel. En la fuente se agregan tips cada dos semanas.
77 de 77 tips
Cowork consume mucho más que un chat
Una tarea de Cowork lee archivos, ejecuta código y revisa su propio trabajo, y cada paso gasta tokens: consume mucho más cupo que una pregunta rápida. Anthropic no publica un múltiplo, pero las mediciones independientes hablan de un orden de magnitud o más. Mandar a Cowork lo que el Chat resolvía drena tu cupo antes de tiempo.
El cupo es un solo balde
En las suscripciones, Chat, Cowork y Claude Code comparten la misma ventana de 5 horas y el mismo tope semanal. Quemar tokens en uno resta capacidad en los otros.
Projects no es un motor, es un contenedor
Si te sorprendes re-pegando el mismo brief, ese brief va a un Project: se cachea una vez y se relee barato en muchas consultas.
Pregunta qué pasa cuando se acaba la cuota
Es la pregunta que no aparece en la conversación comercial y la que más importa. Anthropic Enterprise sigue y factura hasta el límite de gasto que fijes. OpenAI y Microsoft, con créditos prepagados, se bloquean al agotarlos. Google bloquea y deja al administrador abrir el excedente, ahora con tope mensual. No eliges un precio: eliges qué riesgo toleras.
El costo fijo puro está en retirada
En Microsoft el asiento cubre la iA cotidiana y todo lo agéntico (Cowork, agentes, modelos de frontera) se cobra con Copilot Credits. En OpenAI el asiento Business trae uso incluido y los créditos corren después; Enterprise ya ofrece facturación por tokens. Si tu presupuesto asume una cifra plana, verifica qué queda fuera del asiento.
En Google la cuota es un pozo común
En Gemini Enterprise las cuotas se agrupan por edición, no por persona. Un usuario intensivo puede consumir buena parte del pozo y dejar sin asistente a sus colegas antes del mediodía, y la app no avisa cuando el pozo se agota. Ojo: en Google Workspace con Gemini es al revés, los límites son por usuario y no se comparten.
Fijo o variable es la primera decisión, no la última
Con costo fijo sabes cuánto vas a pagar y arriesgas que tu gente se bloquee. Con costo variable nadie se bloquea y arriesgas la cuenta. Elegir mal no se arregla con disciplina de tokens: se arregla cambiando de plan.
El punto de equilibrio del asiento Premium
Premium cuesta US$100 fijos; Enterprise cuesta US$20 más consumo. Premium sale más barato apenas esa persona consumiría más de US$80 al mes a tarifa API, unas 13 tareas complejas con Opus 5.5, y su cupo vale mucho más que eso. Enterprise conviene solo a quien usa poco, y también se detiene al llegar al límite de gasto.
No elijas un plan para todos
Team permite mezclar asientos Standard y Premium en la misma organización. El patrón que funciona es Standard para el grueso del equipo, Premium para el puñado que se bloquea seguido, y API directa para las automatizaciones, que no necesitan asiento.
A veces la decisión no es económica
Registros de auditoría, permisos por rol, SCIM y retención configurable solo existen en Enterprise. Para un regulado con obligaciones de trazabilidad bajo Ley 21.719, eso puede volverlo la única opción defendible, sin importar la comparación de costo.
Los usage credits son la válvula de escape
En un plan de tarifa plana, cuando alguien topa el límite puede esperar el reinicio o activar usage credits y seguir a tarifa API. Es costo variable dentro de un plan fijo: útil para picos, peligroso si nadie lo mira.
Curar el Project, no acumularlo
Un Project inflado encarece la línea base de cada conversación que lo usa. Saca lo que ya no se consulta.
Agrupa el trabajo agéntico en una sesión
Anthropic recomienda juntar el trabajo multi-paso en una sola sesión de Cowork en vez de abrir varias: la planificación y los sub-agentes se pagan una vez.
Heavy users a Team Premium
Si alguien agota el cupo de forma sistemática, moverlo a un asiento Premium de Team (US$100 anual, US$125 mensual) sale más barato que el tiempo que pierde bloqueado. ChatGPT Business ofrece desde agosto un asiento Premium equivalente al mismo precio.
Claude Code para código, no por costumbre
Es el mismo motor, pero con el control más fino del contexto: /compact, /clear, hooks y subagentes. Ese control solo rinde en trabajo de repositorio.
Copilot dejó de ser «una licencia y listo»
Hoy es suscripción más medidor. El asiento cubre chat, apps y agentes internos; todo lo agéntico nuevo se paga con Copilot Credits a US$0,01 cada uno. Si tu cliente ya tiene E3 o E5, el riesgo de presupuesto no es el complemento: es el consumo variable que nadie proyectó.
Los Copilot Credits no se acumulan y cortan al 125%
Lo que no gastaste en el mes se pierde, y los agentes se desactivan al llegar al 125% de la capacidad contratada. Dimensionar de menos no ahorra: apaga el servicio a mitad de mes.
En julio subió el piso, no el complemento
Microsoft subió el precio de las suites base (E3 de US$36 a US$39, E5 de US$57 a US$60) y excluyó los SKU de Copilot del ajuste. Resultado: tener Copilot cuesta más sin que Copilot haya cambiado de precio.
El contexto lo define el modelo, no el plan
En Pro, Max, Team y Enterprise, Fable 5.1, Opus 5.5, Opus 5, Sonnet 5.5 y Sonnet 5 trabajan con 1M de tokens; los modelos anteriores, con 500K o 200K. Si el trabajo son expedientes largos, elige el modelo correcto: no hace falta subir de plan para eso.
Un hilo de 40 turnos paga el contexto 40 veces
Cada turno reenvía todo el historial, así que el gasto acumulado crece aproximadamente con el cuadrado del número de turnos. Es el multiplicador más silencioso de la cuenta.
La señal de corte es que olvide instrucciones
Cuando el modelo olvida lo que le pediste al principio o se pone lento, no insistas: abre una conversación nueva. Eso es «context rot», y no se arregla repitiendo la instrucción.
/compact al 60%, no al 90%
En Claude Code, compacta cuando vas en ~60% del contexto. La compactación automática se gatilla entre el 83% y el 95%, y a esa altura ya pagaste el contexto inflado muchas veces.
/clear entre tareas
Terminar una tarea y empezar otra en el mismo hilo arrastra todo el contexto de la anterior. /clear cuesta cero y ahorra el resto de la sesión.
El impuesto agéntico
Una tarea que reenvía un prompt de sistema de 20K tokens a lo largo de 40 pasos lo paga 40 veces. Antes de optimizar el modelo, mide el largo de tu prompt de sistema.
Empezar de cero sin perder contexto
Projects y skills permiten reiniciar el hilo sin perder nada, porque lo durable vive en el contenedor. Reiniciar solo duele si guardas el conocimiento en la conversación.
El caching se amortiza con una lectura
Escribir el caché de 5 minutos cuesta 1,25x el input estándar y cada lectura posterior paga 0,10x: se amortiza con una sola lectura. El de 1 hora cuesta 2x y necesita dos. En Opus 5.5 la lectura baja a 0,05x y en Fable 5.1 a 0,025x, así que el ahorro es todavía mayor.
El descuento de caché no es igual en todos
Va de 75% en Grok 4.7 a 95% en Opus 5.5, GPT-6.1 Sol y Gemini 4 Argon, y 97,5% en Fable 5.1. Entre los abiertos, de 81% en GLM-5.3 a más de 99% en MiMo. Si el caching es tu palanca principal, esa diferencia sobre el contexto repetido pesa más que la ventaja de precio de lista.
En Gemini, mantener el caché cuesta por hora
Además del cache read hay precio de almacenamiento: US$0,50 por millón de tokens por hora en Gemini 3.8 Flash hasta el 31 de diciembre (US$1 desde enero), US$1 en Flash-Lite y US$4,50 en 3.1 Pro. Un modelo de costos que solo cuenta lecturas subestima el gasto real.
Elige la duración del caché a conciencia
En Claude, escribir caché de 5 minutos cuesta 1,25x el input y se amortiza con una sola lectura. El de 1 hora cuesta 2x y necesita dos. Si el flujo relee en segundos, el caché corto es el correcto.
Qué cachear primero
Prompts de sistema, definiciones de herramientas y bases de conocimiento: todo lo estable que se reenvía en cada llamada. Es la primera optimización que se activa en API.
El caching también baja la latencia
Hasta 85% en prompts largos. En un producto de cara al usuario, eso suele valer más que el ahorro en dólares.
OpenAI no publica el precio de su crédito, pero se puede inferir
Microsoft dice que su crédito vale US$0,01. OpenAI sigue sin precio de lista («depende del plan o acuerdo»), pero su promoción de asientos Premium equiparó US$100 a 2.500 créditos: US$0,04 por crédito, consistente con su tabla de conversión por token. Úsalo para modelar el caso de negocio y pide el precio por escrito en la negociación.
Google dejó de cobrar en la moneda del trabajo
Gemini Enterprise dejó de publicar tarifas por consulta o por Deep Research: el excedente del asistente y de las investigaciones se cobra a precios de Agent Platform, es decir, por tokens. A cambio, ahora permite fijar un tope mensual de gasto que corta el excedente al alcanzarlo.
El precio por token ya no predice el costo
Un modelo de razonamiento decide cuántos tokens gasta pensando, y eso no aparece en ninguna lista de precios. La comparación válida es el costo por tarea completada, no los US$ por millón.
Cuatro veces y media el costo por un punto de índice
GPT-6.1 Sol puntúa 52 y cuesta US$0,72 por tarea. GPT-6 Astra, del mismo laboratorio, puntúa 53 y cuesta US$3,26. Si la tarea no depende de ese punto, la diferencia es puro desperdicio.
El modelo más caro por token ya no es el más capaz
Fable 5.1 es el más caro del mapa por token (US$10/US$50) y puntúa 53. Opus 5.5 cuesta 60% menos por token, puntúa 58 y sale 22% más barato por tarea. Cuando eso pasa, el precio de lista dejó de ser una señal de calidad.
El tiempo por tarea no aparece en la factura
MiMo-V2.6-Pro puntúa 46 y cuesta US$0,13 por tarea, pero demora 23 minutos. GPT-6.1 Sol puntúa 52, cuesta US$0,72 y demora 10. Para un lote nocturno da igual; para alguien esperando frente a la pantalla es la diferencia entre una herramienta que se usa y una que se abandona.
La verbosidad se paga dos veces
Sonnet 5.5 en esfuerzo máximo gasta 197.000 tokens de salida por tarea contra los 119.000 de Opus 5.5, con 74% en razonamiento. Cuesta la mitad por token y termina 28% más caro por tarea, y más lento. Antes de elegir por tarifa, mira los tokens por tarea.
El nivel de esfuerzo mueve el costo siete veces
Sonnet 5.5 en esfuerzo high puntúa 47 por US$1,12 la tarea; en max, 56 por US$7,67: casi siete veces el costo por nueve puntos. Opus 5.5 baja de max a xhigh perdiendo dos puntos y 42% del costo. Calibrar el esfuerzo rinde más que cambiar de proveedor.
El razonamiento es el componente más grande de la cuenta
En los modelos de frontera, pensar cuesta más que el input y más que la respuesta. Por eso calibrar el nivel de esfuerzo rinde más que negociar el precio por token: estás comprando cantidad de pensamiento, no cantidad de texto.
Mide puntos por dólar, no precio
Divide el puntaje del modelo por su costo por tarea. GPT-6 Luna rinde 559 puntos por dólar y Fable 5.1 rinde 7: ochenta veces menos. Es la métrica que revela el desperdicio en producción rutinaria.
El benchmark no es tu flujo
El costo por tarea se mide sobre tareas de índice, no sobre las tuyas. Un despacho revisando contratos en español y un equipo generando código tienen perfiles distintos. Úsalo para formular la hipótesis y ciérrala corriendo dos modelos en paralelo una semana sobre tu trabajo real.
Enruta por dificultad, no por precio
Volumen simple: GPT-6 Luna, Gemini 3.5 Flash-Lite o DeepSeek V4.1 Flash. Producción de una pasada: GPT-6.1 Sol, Sonnet 5.5 en esfuerzo high o Gemini 3.8 Flash. Razonamiento difícil y agéntico: Opus 5.5, GPT-6 Astra o Gemini 4 Argon cuando abra a todos.
Sonnet no siempre es más barato que Opus
Sonnet 5.5 cuesta la mitad por token que Opus 5.5, pero en esfuerzo máximo gasta 66% más tokens y termina más caro por tarea: US$7,67 contra US$5,98. En cadenas multi-paso donde un error de primera pasada gatilla reintentos, Opus cierra la tarea más barato. Mide el costo por tarea antes de asumir.
Sonnet se quedó en US$2/US$10
El alza de Sonnet 5 a US$3/US$15 anunciada para el 1 de septiembre no ocurrió: el 10 de agosto Anthropic dejó el precio introductorio como permanente, y Sonnet 5.5 salió el 28 de septiembre con la misma tarifa. Los anuncios de precio también cambian: presupuesta con la página oficial del día.
El tokenizador nuevo produce 30% más tokens
Claude 4.7 y posteriores, incluidos Opus 5.5 y Sonnet 5.5, usan un tokenizador distinto que genera cerca de 30% más tokens para el mismo texto. Rinde mejor, pero invalida cualquier comparación de precio por token contra modelos de generaciones anteriores: el mismo documento cuesta más tokens.
El acantilado de los 272K tokens en OpenAI
Sobre 272K tokens de input, GPT-6 Astra, GPT-6.1 Sol y GPT-6 Luna cobran 2x el input y 1,5x el output, y lo aplican a la request completa, no solo al excedente. Un documento que cruza el umbral por poco duplica el costo de todo. En Grok 4.7 y Gemini Pro el acantilado está en 200K.
Claude no cobra recargo por contexto largo
Una request de 900K tokens se factura a la misma tarifa por token que una de 9K. Para revisión de expedientes largos o due diligence documental, eso vale más que la diferencia de precio de lista.
Calibra el nivel de esfuerzo
Los modelos de razonamiento exponen niveles (low, medium, high, xhigh). Dejarlo en alto por defecto es pagar razonamiento que la tarea no necesita.
Batch API: la mitad de precio en lo que no es urgente
Si el resultado puede esperar horas, se paga la mitad: −50% en Claude, OpenAI y Gemini. Grok 4.7 acepta Batch pero sin descuento, y Kimi K3 y Muse Spark 1.3 no lo tienen. DeepSeek cobra la mitad fuera de hora punta, que en la práctica funciona como uno.
Lee los benchmarks con cautela
El evaluador METR reportó en GPT-5.6 la tasa de «benchmark-gaming» más alta que había medido, y Artificial Analysis cambió su índice tres veces en septiembre: los puntajes de hoy no se comparan con los de julio. Los índices de inteligencia son un benchmark entre muchos, no una verdad.
La clasificación de riesgo también es un criterio de selección
OpenAI clasificó a GPT-6 Astra como su primer modelo sobre el umbral crítico de ciberseguridad, y Anthropic y Google entregan su capacidad más alta (Mythos 5.1, Gemini 4 Argon) primero a organizaciones verificadas. Eso agrega obligaciones y plazos en flujos sensibles: no es solo precio y calidad.
En cupo, el modelo define qué tan rápido te bloqueas
No hay factura, pero el modelo más caro agota el balde más rápido. La misma disciplina de enrutamiento aplica: no uses el motor de frontera para clasificar correos.
Verifica la jurisdicción real, no la nacionalidad del laboratorio
La API de Kimi la opera una entidad de Singapur con servidores en Singapur y ley singapurense, no China como se suele asumir. Bajo Ley 21.719 sigue siendo transferencia internacional, pero el marco legal aplicable es otro. El dato se verifica en los términos, no por el origen del modelo.
Lee la cláusula de entrenamiento antes de subir nada
Los términos de Moonshot permiten usar el contenido del cliente para desarrollar y mejorar sus modelos salvo acuerdo enterprise por escrito. Ese es el hallazgo que decide si el modelo entra o no, muy antes que el precio.
Los pesos de Kimi K3 ya existen, con condiciones
Moonshot los publicó en Hugging Face el 27 de julio con una licencia propia, no estándar: exige un acuerdo a quien lo venda como servicio con más de US$20 millones de ingresos al año. Son 2,8 billones de parámetros: que los pesos sean abiertos no significa que se pueda correr en casa. Desde el 18 de septiembre está además en Amazon Bedrock.
La residencia de datos tiene precio de lista
En Claude, forzar inferencia solo en Estados Unidos aplica un multiplicador de 1,1x sobre todas las categorías de token. En xAI, el modelo más nuevo no está disponible en la región europea. La soberanía se paga en dinero o en capacidad, y conviene presupuestarla.
Tu stack tiene más proveedores de los que crees
Anthropic es hoy subprocesador de Microsoft y está activo por defecto en la nube comercial, salvo en la Unión Europea, EFTA y Reino Unido. Si el inventario de proveedores de tu cliente dice «solo Microsoft», está incompleto, y eso importa para el registro de tratamiento bajo Ley 21.719.
Control de egress vence al miedo al backdoor
Un modelo de pesos abiertos desplegado sin salida a internet no puede exfiltrar datos. Eso neutraliza el temor mejor que cualquier API, de origen occidental u oriental.
Pesos abiertos no significa uso comercial permitido
La licencia puede restringirlo. Se lee la del release específico y pasa por revisión legal antes de cualquier plan de infraestructura.
Un PDF se cobra dos veces
Cada página de un PDF se cobra dos veces: el texto extraído, que suma entre 1.500 y 3.000 tokens según la densidad, más la página convertida en imagen. El mismo contenido en Markdown solo paga el texto.
Convierte con código, no con el modelo
Un script o un skill convierte PDF, PPTX o XLSX a Markdown o CSV por casi cero tokens. Pedirle al modelo que lea y reformatee paga tokens de imagen más razonamiento.
CSV gana a JSON por ~3x en datos planos
Un benchmark midió 1.303 tokens en CSV contra 4.166 en JSON para los mismos datos. El CSV pierde tipos, así que declara el esquema aparte.
Nunca pegues un volcado completo de planilla
Pre-agrega y envía esquema más filas de muestra. El modelo no necesita las 40.000 filas para entender la estructura ni para responder la pregunta.
OCR antes de enviar escaneos
Una página escaneada como imagen cuesta 700 a 1.500 tokens. Correr OCR y enviar el texto es mucho más barato en páginas densas, y habilita modelos posteriores más económicos.
Separa el OCR del estructurado
Un caso de producción documentado separó las dos etapas y bajó el costo cerca de 60 veces. Extraer texto y estructurarlo son trabajos distintos con modelos distintos.
El español cuesta entre 30% y 55% más
El mismo texto en español gasta más tokens que en inglés: el estudio de Oxford (Petrov et al., NeurIPS 2023) midió 1,55 veces con el tokenizador de GPT-4. Los tokenizadores nuevos acortan la brecha, pero no la cierran. Cada ineficiencia de formato o de contexto se amplifica en una operación en español.
El «hasta 95%» de los conversores es marketing
Comparando texto extraído contra Markdown la brecha es ~30%; comparando PDF nativo contra Markdown es enorme. El rango defendible para flujos documentales es 30% a 70%.
Haz la conversión el default de la herramienta
Mientras convertir sea un paso manual, la gente lo va a saltar. Si el formulario interno convierte solo, el ahorro deja de depender de la disciplina de cada persona.
Limita la salida explícitamente
Pedir «en 200 palabras» o «máximo 5 bullets» corta el output, que es el token más caro en todos los modelos: entre 3 y 6 veces el precio del input.
Ocho personas descubriendo lo mismo se paga ocho veces
Y salen ocho resultados distintos. El problema es de operaciones, no de mecánica de tokens: un dueño por flujo recurrente y el contexto construido una vez.
Tener muchas skills cuesta casi nada
La revelación progresiva carga solo el nombre y la descripción de cada skill, cerca de 100 tokens. Un agente con 100 skills gasta unos 10.000 tokens al inicio de sesión: poco frente a un contexto de 1M. «Cuántas tener» es la pregunta menor.
El costo real de las skills es la colisión de triggers
Dos skills con descripciones parecidas se disparan sin que corresponda. La disciplina es curar descripciones precisas, no limitar la cantidad.
Mantén cada SKILL.md bajo ~5.000 tokens
El cuerpo se carga entero cuando la skill se dispara. Lo pesado va a archivos y scripts referenciados, que solo cargan al usarse.
Una librería de prompts compartida
El prompt que funcionó es un activo. Si vive en el historial de una persona, se pierde. Si vive en un Project de equipo, lo usan todos.
Un dueño por flujo recurrente
La minuta semanal, el informe mensual, la revisión de contratos: cada flujo repetido necesita alguien que lo codifique una vez, en vez de que cada persona lo reinvente.
Sin atribución de costo no hay gobierno
Con cientos de usuarios y varios proveedores, la disciplina individual deja de rendir. Se necesita observabilidad por equipo, por modelo y por proveedor.
Recursos
Lo que se usa, no lo que se lee.
Script de conversión a Markdown
Convierte PDF, DOCX, PPTX y XLSX a texto limpio antes de que entren a un contexto caro. La palanca D automatizada.
PróximamenteChecklist de las tres etapas
Qué activar en 0–30, 30–90 y 90+ días, con la meta de ahorro de cada punto.
PróximamentePlantilla de Project de equipo
Estructura base para que el contexto se construya una vez y no ocho.
PróximamenteLibrería de prompts base
Los prompts que ya funcionaron, listos para pegar en un Project compartido.
PróximamenteQué se movió.
- 30 sepGoogle presenta Gemini 4 Argon, su nuevo modelo de frontera, a precio introductorio de US$2/US$10 por millón de tokens. Lo abre por fases, partiendo por socios de ciberseguridad: todavía no es una opción de compra general.
- 29 sepOpenAI lanza GPT-6.1 Sol en DevDay a US$2/US$10, un quinto del precio de Astra, y dice que casi lo iguala en código y trabajo profesional. El mismo día suma ChatGPT Pro a US$500 (25 veces Plus) y reabre el de US$200 con la mitad del cupo: 10 veces Plus para suscriptores nuevos; los actuales lo conservan hasta el 29 de octubre.
- 28 sepClaude Sonnet 5.5 llega a US$2/US$10. Y Sonnet 5 no subió: Anthropic dejó sus US$2/US$10 introductorios como precio estándar y canceló el alza a US$3/US$15 prevista para el 1 de septiembre.
- 28 sepMeta crea Meta Enterprise Platform para vender Muse, la API y Muse Code a empresas. Todavía no publica precios.
- 25 sepMicrosoft parte Copilot en dos: la iA cotidiana sigue en la licencia por usuario, y la iA avanzada (Cowork, agentes de larga duración y modelos de frontera como Fable y Astra) se cobra con Copilot Credits. Lo más caro de operar queda fuera del asiento de US$30.
- 25 sepOpenAI pausa el entrenamiento de sus modelos más avanzados después de que un agente evadió las restricciones del entorno de entrenamiento, la segunda pausa en tres meses. ChatGPT y la API siguen operando, pero el calendario de su próxima generación queda en duda.
- 24 sepThe Verge muestra que Muse entrega su sistema de archivos completo con poco esfuerzo. Meta responde que es el computador del propio usuario y que es intencional. Para un comprador corporativo, esa duda es parte del riesgo.
- 22 sepClaude Opus 5.5 rinde como Fable 5.1 y, según Anthropic, cuesta 40% menos de operar que Opus 5: US$4/US$20 y caché a 5% del input. Noventa minutos después, OpenAI reemplaza GPT-5.6 Sol y Luna por GPT-6 Sol (US$2/US$10) y GPT-6 Luna (US$0,10/US$0,50), la mitad del precio.
- 21 sepSale Grok 4.7 a US$2/US$6, con el doble de precio sobre 200K tokens. En el índice de Artificial Analysis queda bajo Muse Spark 1.3 y cuesta más del doble por tarea.
- 18 sepKimi K3 entra a Amazon Bedrock, su primer proveedor occidental. Sus pesos sí se publicaron el 27 de julio en Hugging Face, bajo licencia propia: corregimos lo que dijimos ese día.
- 16 sepCowork pasa a estar dentro de cualquier conversación en los planes Pro y Max de Claude: ya no se elige el modo antes de pedir. El riesgo de gastar cupo de agente en una pregunta de chat pasa a depender de cómo se formula el encargo.
- 8 sepMeta lanza Muse, su agente personal con computador propio en la nube, en EE.UU.: plan gratis, Power de US$20 y Max de US$100. No hay plan para empresas.
- 3 sepOpenAI lanza GPT-6 Astra, su modelo más capaz, a US$10/US$50 por millón de tokens. La demanda obligó a pausar las altas a ChatGPT Pro de US$200 del 10 al 29 de septiembre. Un día antes, Google lanzó Gemini 3.8 Flash a US$0,75/US$3,75, precio introductorio hasta el 31 de diciembre.
- 2 sepMeta lanza Muse Spark 1.3: 48 puntos en el índice de Artificial Analysis a US$1,60 por tarea, sin recargo por contexto largo.
- 1 sepAnthropic lanza Claude Fable 5.1, al mismo US$10/US$50 de Fable 5 pero con la lectura de caché a 2,5% del input, y Mythos 5.1 en acceso restringido. Para cargas con mucho contexto repetido, el modelo más caro se abarata bastante.
- 1 sepEl Gobierno ingresa al Senado un proyecto para postergar la Ley 21.719 al 1 de diciembre de 2027. Mientras no se apruebe, la fecha legal sigue siendo el 1 de diciembre de 2026.
- 26 agoGrok Bot llega a SuperGrok (US$30), Plus, Cursor Pro y Cursor Teams. Ya no es exclusivo de los planes de US$200 o más.
- 25 agoChatGPT Business suma asientos Premium a US$100 anual (US$125 mensual), con cinco veces el uso de Standard y sin límite de 5 horas. OpenAI adopta la misma estructura que Team de Anthropic: asiento base, asiento intensivo y créditos encima.
- 21 agoMeta abre el tier Contributor de Muse Spark: es 12 veces más barato, pero entrena con tus prompts y respuestas.
- 11 agoSpaceXAI y Cursor lanzan en beta Grok Bot: agentes que trabajan con un computador propio en la nube y siguen operando con el notebook cerrado.
- 27 julLos cuatro proveedores grandes convergen al asiento con medidor, pero fallan distinto: Anthropic factura el excedente sin cortar, OpenAI y Microsoft bloquean con prepago, y Google bloquea dejando al administrador la decisión de abrir.
- 27 julCuatro caminos de compra con lógicas de costo distintas: Team Standard y Premium a precio fijo, Enterprise a US$20 por asiento más consumo a tarifa API, y API directa.
- 27 julMoonshot publica los pesos de Kimi K3 en Hugging Face, bajo una licencia propia que exige acuerdo a quien lo venda como servicio con más de US$20 millones de ingresos.
- 24 julClaude Opus 5 se convierte en el modelo más capaz del índice independiente con 61 puntos, un punto sobre Fable 5 y con 26% menos costo por tarea. También lidera en trabajo agéntico de conocimiento.
- 21 julGemini 3.6 Flash reemplaza a 3.5 Flash con el mismo input (US$1,50) y output más barato: US$7,50 contra US$9.
- 21 julGemini 3.6 Flash y 3.5 Flash-Lite cortan a la mitad el tiempo por tarea de sus antecesores. Flash-Lite gana 11 puntos de índice; 3.6 Flash no gana inteligencia pero baja el costo.
- 17 julCuatro lanzamientos de frontera en ocho días: Grok 4.5, GPT-5.6, Muse Spark 1.1 y Kimi K3. Seis laboratorios superan los 50 puntos del índice, contra dos a comienzos de junio. El precio de la inteligencia cercana a la frontera se derrumbó.
- 16 julKimi K3 disponible por API: 2,8 billones de parámetros, 1M de contexto, tercer puntaje del índice independiente.
- 9 julOpenAI lanza la familia GPT-5.6 (Sol, Terra, Luna). Las tres quedan clasificadas en riesgo «Alto» para ciber y bio-químico, la primera vez que modelos pequeños de una familia reciben esa designación.
- 1 julMicrosoft sube el precio de las suites base: E3 de US$36 a US$39, E5 de US$57 a US$60, Business Standard de US$12,50 a US$14. Los SKU de Copilot quedan excluidos del ajuste, así que tener Copilot cuesta más sin que Copilot cambie de precio.
- 16 junCopilot Cowork entra en disponibilidad general como el primer componente de Copilot 100% pay-per-use. Corre sobre modelos Anthropic.
Precios y modelos verificados por MAindset contra las páginas oficiales de Anthropic, OpenAI, Google, xAI, Meta, Moonshot y Microsoft el 2 de octubre de 2026. Puntaje, costo, tiempo y tokens por tarea: Artificial Analysis, Intelligence Index v4.3.2. La fuente se actualiza cada dos semanas porque los precios cambian a esa velocidad. Verifica siempre contra las páginas oficiales de cada proveedor antes de una decisión vinculante. Fuente: tokenomics.cl.