Abres tu Klaviyo, tu Mailchimp o tu Brevo. Miras el segmento "clientes VIP" y ves 5.000 personas. Miras el segmento "en riesgo de perderlos" y ves 6.500. Programas una campaña con un cupón del 20% para reactivar el segundo grupo y un email exclusivo con producto premium para el primero. Le das a enviar y esperas resultados. Dos semanas después, los datos son raros: la campaña VIP la abren muy pocos y los que compran ya lo hacían de todas formas; la de reactivación la usa gente que compró ayer. Sospechas del asunto, del creativo, de la hora de envío. Pruebas variantes, cambias la copy, mueves el horario. Los resultados siguen sin cuadrar.
En una parte más grande de la que se suele reconocer, el problema no está en la campaña. Está en la segmentación. Los segmentos RFM son tan buenos como la calidad de la base de datos sobre la que se calculan, y cuando hay duplicados, emails inválidos y direcciones incompletas, el algoritmo de segmentación reparte a las personas equivocadas en los grupos equivocados. Este artículo va dirigido a responsables de email marketing y dueños de tienda online que usan segmentación RFM (Recency, Frequency, Monetary) en Klaviyo, Mailchimp, Brevo o cualquier otra plataforma y sienten que sus segmentos ya no describen a los clientes que creen tener.
Qué es exactamente RFM y por qué lo usa todo el mundo
RFM es un modelo de segmentación de clientes basado en tres variables que se calculan sobre el histórico de pedidos:
- Recency (R): cuánto tiempo ha pasado desde la última compra de ese cliente.
- Frequency (F): cuántas compras ha hecho ese cliente en un periodo definido (habitualmente 12 o 24 meses).
- Monetary (M): cuánto ha gastado ese cliente en total en ese periodo.
Cada cliente recibe una puntuación (típicamente del 1 al 5) en cada una de las tres variables, y la combinación produce segmentos como "campeones" (5-5-5), "leales" (X-5-5), "en riesgo" (1-4-4) o "hibernando" (1-1-1). Casi todas las plataformas de email marketing lo tienen integrado con nombres ligeramente distintos, y casi todas las tiendas online que hacen algo mínimamente serio de retención lo usan en algún nivel.
La razón por la que se ha impuesto es simple: no necesita datos demográficos ni encuestas, se calcula automáticamente sobre lo que ya tienes en la base, y es sorprendentemente bueno prediciendo qué cliente va a volver a comprar y qué cliente se te está yendo. Cuando funciona.
Cuatro formas concretas en que los datos sucios rompen tu RFM
1. Los duplicados fracturan la Frequency y la Monetary
Este es el más silencioso y el más caro. Imagina que Marta compró en tu tienda hace un año con marta.lopez@gmail.com, hace nueve meses con marta.lopez@hotmail.es (había cambiado de correo), hace seis meses volvió al de Gmail y hace tres meses compró como invitada escribiendo marta_lopez@gmail.com con un guion bajo. Para tu tienda son cuatro clientes distintos, cada uno con una única compra. Para el cálculo de RFM son cuatro perfiles con Frequency=1 y Monetary bajo, cada uno colocado en un segmento diferente según cuándo fue su "única" compra.
La consecuencia práctica es doble. Primero, Marta (que es una clienta recurrente con 4 pedidos en 12 meses y debería estar en el segmento VIP con Frequency alta) queda repartida entre segmentos como "nuevo cliente", "primera compra", "hibernando" y "reciente pero de un solo pedido". Segundo, tu segmento VIP real (el que has definido como Frequency ≥ 4) tiene menos gente de la que debería porque los clientes verdaderamente recurrentes están artificialmente fragmentados.
2. Los emails inválidos rompen la Recency
La Recency se suele calcular sobre la última interacción registrada, que en Klaviyo y Mailchimp incluye compras pero también aperturas de email. Un cliente con un email inválido nunca abre nada (los mensajes rebotan o se marcan como spam automáticamente), así que su Recency se queda congelada en la fecha de su última compra aunque en realidad ese cliente ya no existe como contacto alcanzable.
El resultado es que tu segmento "activos" incluye clientes que no reciben tus emails desde hace meses (porque tu proveedor los ha marcado como suprimidos por rebote pero siguen contando como "última compra hace tres semanas"), y tu segmento "en riesgo por caída de engagement" está pequeño de forma engañosa porque muchos clientes que ya no interactúan siguen apareciendo como recientes por su última compra técnicamente registrada.
3. Los teléfonos mal formateados rompen los segmentos multicanal
Muchas plataformas modernas (Klaviyo, Brevo, Omnisend) construyen segmentos híbridos email+SMS+WhatsApp. Cuando el teléfono está en formato "612 34 56 78" en unos registros, "+34612345678" en otros y "34-612-345-678" en otros, el motor de segmentación cuenta como "contactable por SMS" solo a los que cumplen exactamente el formato esperado (E.164 en la mayoría de casos). El resto queda como "no contactable" aunque el teléfono sea perfectamente válido, y no aparece en las campañas SMS ni en los flows automáticos que dependen de ese canal.
El daño colateral es que tu decisión de invertir más o menos en SMS se toma sobre una audiencia contactable inflada o desinflada respecto a la real.
4. Las direcciones incompletas rompen los segmentos geográficos
Si segmentas por comunidad autónoma o por provincia para lanzar campañas locales, promos por temporada o notificaciones de envío gratuito por zona, cualquier registro con provincia vacía, código postal en blanco o país mal escrito (España, Espana, ES, Spain, ESPAÑA todo mezclado) queda fuera del segmento geográfico correcto. En bases medianas con un porcentaje típico de campos vacíos, el segmento "clientes Cataluña" puede estar perdiendo entre un 10% y un 20% de los clientes que realmente están ahí.
Un escenario ilustrativo con los números detrás
Imagina una tienda española de moda con 30.000 contactos en su base y un 18% de duplicados (formatos distintos del mismo email, guiones bajos, mayúsculas, dominios equivalentes). La base real es de aproximadamente 24.600 clientes únicos.
Antes de limpiar:
- Segmento "VIP" (Frequency ≥ 4, Recency ≤ 90 días): 5.000 registros.
- Segmento "en riesgo" (Frequency ≥ 3, Recency 90-180 días): 6.500 registros.
Se lanza una campaña de reactivación con cupón del 20% al segmento "en riesgo".
Después de deduplicar y limpiar la base:
- Segmento "VIP" real: 4.100 registros (bajan 900 porque muchos clientes VIP estaban divididos en varios registros con Frequency baja cada uno).
- Segmento "en riesgo" real: 4.800 registros (bajan 1.700 porque muchos "en riesgo" eran duplicados de clientes VIP activos que ya compraron recientemente en otra dirección de email).
La diferencia es que estabas mandando 1.700 cupones de descuento a personas que iban a comprar de todas formas. Con una tasa de redención típica del 30% en campañas de reactivación bien pensadas, esos 1.700 cupones adicionales se traducen en unos 510 pedidos con descuento aplicado que no lo necesitaban. Si tu ticket medio es de 65 euros y el descuento es del 20%, cada uno de esos pedidos innecesariamente descontados te cuesta 13 euros de margen. En total: 6.630 euros de margen perdido en una única campaña.
Multiplícalo por las cuatro campañas de reactivación trimestrales que suele lanzar una tienda mediana al año: aproximadamente 26.500 euros anuales de margen quemado en descuentos a personas que no los necesitaban, causados directamente por duplicados en la base.
Y no es lo peor. Lo peor es que la campaña VIP de la que hablábamos al principio nunca llegó a los 900 clientes VIP reales que estaban escondidos como fragmentos duplicados en otros segmentos. Esa parte no se puede calcular fácilmente en euros, pero es peor: son los clientes con más lifetime value ignorados por tu plataforma porque tu base los tenía rotos.
Cómo detectar si tu segmentación RFM está sesgada por datos sucios
Tres comprobaciones rápidas que puedes hacer esta semana:
- Contar duplicados fuzzy en tu export CSV. No solo emails idénticos, también variantes con puntos, guiones bajos, mayúsculas y dominios equivalentes (gmail.com vs googlemail.com). Si el porcentaje de duplicados fuzzy pasa del 10%, tu RFM está sesgada.
- Cruzar clientes activos con emails inválidos. Filtra por clientes con última compra en los últimos 6 meses y comprueba cuántos tienen email con formato incorrecto o dominio inexistente. Ese subgrupo está inflando tus segmentos "activos" con contactos que no lo son.
- Comparar el tamaño de tus segmentos con el número de clientes únicos. Si sumas los registros de todos los segmentos RFM y te da más del 100% de tus clientes, tienes duplicados clasificados en varios sitios.
Preguntas frecuentes
¿Klaviyo o Mailchimp no deduplican solos por email?
Deduplican por email idéntico exacto, pero no por variantes (mayúsculas, puntos, guiones bajos, dominios equivalentes). Ana.Lopez@Gmail.com y ana.lopez@gmail.com son la misma persona pero en la mayoría de plataformas figuran como dos registros distintos si se importaron por vías diferentes.
¿Cada cuánto debería revisar la calidad de mi base para que la segmentación RFM sea fiable?
Un análisis trimestral es un buen punto de partida para tiendas medianas. Tiendas con captura muy activa (varias campañas de leads al mes, popups en varias landings, importaciones frecuentes desde ferias o eventos) probablemente necesiten mensual.
¿Los datos sucios afectan también a modelos más sofisticados que RFM, como el predictive de Klaviyo?
Sí, y potencialmente más. Los modelos predictivos (Predicted Lifetime Value, Churn Probability) usan las mismas variables base pero les aplican machine learning encima. Si los inputs están fragmentados por duplicados, las predicciones amplifican el error en vez de corregirlo.
¿Merece la pena limpiar antes de definir los segmentos o después?
Antes. Definir segmentos sobre una base sucia y luego limpiarla obliga a redefinir todo (los umbrales de Frequency y Monetary cambian cuando la Frequency real de los clientes recurrentes deja de estar fragmentada).
Empieza por ver el tamaño real del problema
Antes de rediseñar tu estrategia de segmentación, mira los números concretos de tu base. En ClearRows puedes subir el export de clientes de tu tienda en CSV o XLSX y en un par de minutos ver el porcentaje de duplicados exactos y fuzzy, emails inválidos, teléfonos mal formateados y direcciones incompletas, con desglose por columna y una estimación en euros mensuales de lo que esa calidad de datos te está costando. El análisis es gratuito, sin tarjeta y sin límite de filas. Con esos números puedes decidir si tu problema de conversión está en el email, en el creativo o en que tu segmentación RFM lleva meses tomando decisiones sobre una foto de tus clientes que no se corresponde con la realidad.