Llevo unos días con problemas raros en mis distintos "chats" sí, para mí todos son "Oye chat". Cuando digo mis chats me refiero a las conversaciones que tengo con ChatGPT (cuenta Plus) y Claude (también de pago), esas suscripciones mensuales de 20 dólares cada una. Sí, todo vale 20, pero si sumas... es un dineral al final de mes.
Lo que pasa es que van raros: da igual el modelo que use, da igual el prompt inicial, las respuestas enseguida pierden calidad y además mezclan contextos entre el historial de chats. En Claude debo decir que era peor, enfatizo era, porque borré todo el historial y ahora va como la seda. En otro post lo explicaré con detalle.
Total, al grano: a raíz de estos conflictos con mis "chats" me ha obsesionado una pregunta que, aunque parece sencilla, la respuesta no es para nada simple:
¿Cuánto contexto (tokens) estoy consumiendo realmente en mi conversación?
Si no sabes qué es una ventana de contexto, te lo explico rápido y entenderás por qué quiero contar los tokens: la ventana de contexto determina la cantidad total de tokens que un modelo puede procesar en un chat, incluyendo tanto tu prompt de entrada como la respuesta que genera.
El problema: cuando el contexto se descontrola
Cuando estás chateando verás que a medida que vas hablando el chat se "descontrola" y da respuestas raras:
- Respuestas que ignoran detalles importantes que mencionaste al principio
- Mezcla información de diferentes partes de la conversación
- Genera respuestas más genéricas o menos precisas
- Directamente "olvida" el hilo de lo que estabais discutiendo
¿Por qué pasa esto? La ventana de contexto, entre otras cosas, que veremos algún día.
Qué es la ventana de contexto (y por qué importa)
La ventana de contexto determina cuánta información puede procesar un modelo en una sola interacción. Es como la "memoria de trabajo" del chat:
- GPT-4o: 128,000 tokens de ventana total
- GPT-4: 8,192 tokens
- GPT-3.5: 4,096 tokens
Pues teniendo en cuenta todo lo anterior vuelvo a mi pregunta de inicio: ¿Qué parte del contexto real podemos medir, en el chat?.
Ante esta necesidad de tener más control, he desarrollado mi propio script que puedes ejecutar en la consola del navegador para obtener una estimación de los tokens que estás consumiendo:
// Extraer todos los textos únicos de la conversación
let textos = Array.from(document.querySelectorAll('.markdown')).map(e => e.innerText.trim());
let textosUnicos = Array.from(new Set(textos));
// Función para estimar tokens
function estimarTokens(texto) {
if (!texto) return 0;
let palabras = texto.trim().split(/\s+/).length;
return Math.round(palabras * 1.3); // 1,3 tokens por palabra (estimación conservadora)
}
// Calcular tokens totales
let textoTotal = textosUnicos.join('\n');
let tokensUsados = estimarTokens(textoTotal);
console.log(Tokens estimados: ${tokensUsados});
Cómo funciona:
- Extrae el texto: Busca todos los elementos con clase .markdown (donde ChatGPT renderiza los mensajes)
- Elimina duplicados: Usa Set para evitar contar el mismo contenido varias veces
- Estima tokens: Cuenta palabras y multiplica por 1.3 como aproximación (para castellano debería ser x2, pero es solo una estimación)
Lo que realmente estoy haciendo:
No es tanto una herramienta perfecta de conteo como un instrumento de investigación empírica. Mi objetivo es correlacionar el número de tokens estimados con la calidad de las respuestas para probar si realmente: más tokens = más alucinaciones.
Con este script convertido a bookmarklet, puedo documentar y medir si mi hipótesis es correcta o si la degradación que percibo tiene otras causas.

Limitaciones reconocidas:
- Solo cuenta palabras (no tokens reales)
- Factor 1.3 inexacto para castellano (debería ser x2)
- No incluye tokens de sistema o metadatos
- Es una aproximación burda, no un conteo exacto
- Depende de la estructura DOM de ChatGPT
Pero eso no es el punto. El objetivo no es precisión absoluta, sino poder investigar empíricamente la relación entre volumen de contexto y calidad de respuestas.
Este script te da una aproximación útil para monitorizar tu consumo de contexto, pero no resuelve la pregunta fundamental: ¿cuánto del contexto real estamos capturando?
La única forma de saber el conteo exacto sería usando la API de OpenAI, donde sí tienes acceso a los tokens reales consumidos. Pero para usuarios de la interfaz web, seguimos navegando a ciegas.
¿Tú cómo gestionas el contexto en tus chats largos?
UPDATE: Extensión Chrome para medir tokens automáticamente
Después de publicar este post y pensar un ratito en poder hacer un experimento recolectando datos he desarrollado una extensión de Chrome que automatiza todo el proceso de medición.
Qué hace la extensión
La extensión añade un botón flotante verde en ChatGPT que dice "Guardar Tokens". Cuando lo pulsas:
- Mide automáticamente los tokens de toda la conversación
- Te pide valorar la calidad de las respuestas en escala 1-5
- Guarda todo en Firebase para análisis posterior
- Muestra el resultado con tokens estimados y porcentaje de contexto usado

Conexión con Firebase y qué datos almacena
Todos los datos se guardan en una base de datos Firebase en tiempo real. Cada medición registra:
- fecha: Timestamp completo de cuándo hiciste la medición
- url: La URL exacta del chat de ChatGPT
- tokens: Número estimado de tokens calculados
- porcentaje: Qué porcentaje representa del límite de 128k tokens
- calidad: Tu valoración subjetiva de 1-5 sobre la calidad de las respuestas
- idioma: El idioma detectado en el navegador
- numMensajes: Cantidad total de intercambios en la conversación
Esto me permite acumular datos de múltiples sesiones, analizar patrones a largo plazo, y correlacionar tokens vs. calidad de respuestas.
Puedes ver todos los datos en tiempo real aquí: seoutopico.github.io/tokens-dashboard

Importante: qué mide y qué NO mide
La extensión SOLO mide texto plano de los mensajes visibles en la conversación. NO cuenta:
- Archivos que subas (PDFs, documentos, etc.)
- Imágenes que adjuntes
- Tokens de sistema o metadatos internos
- El contexto real que ChatGPT procesa internamente
Por qué es relevante esto: Si subes un documento largo o varias imágenes, el contexto real que consume ChatGPT será mucho mayor que lo que mide mi extensión. Esto puede explicar por qué a veces percibes degradación en conversaciones que según mi contador "van bien de tokens".
El objetivo sigue siendo investigación empírica casera
No busco precisión absoluta, sino generar datos suficientes para investigar la correlación entre volumen de contexto visible y calidad percibida.
La extensión me está ayudando a documentar sistemáticamente cuándo y por qué se produce esa degradación que experimentamos en chats largos. Con suficientes mediciones podré confirmar o refutar mi hipótesis inicial sobre la relación tokens-calidad.
¿Tú también has notado que las respuestas empeoran en conversaciones largas? Los datos están empezando a mostrar patrones interesantes...