Negocios: Producto · Lección N.prod.7

La auditoría: cuando la IA inventa la métrica de producto

La IA escribe bien y calcula mal, con cara de certeza total. Esta lección te da un checklist de auditoría de cinco ítems para toda métrica de producto (retención, activación, adopción) y el principio de que quien firma el número siempre es una persona.

Ejemplos para

Un PM le pidió a la IA que armara el resumen de retención del trimestre. Volvió un texto impecable, con una tasa de retención en D30 y una frase de conclusión que parecía escrita por un head de producto con experiencia. Casi lo pegó en el board deck. Antes de enviarlo, rehizo el cálculo directo en Amplitude por costumbre: la retención que calculó la IA era 42%. En el panel real, era 29%. La IA había contado como retenido a un usuario que solo abrió la app una vez en el período. Trece puntos de retención inventados, listos para volverse decisión de roadmap.

Ok, para un segundo en ese "casi". En todos estos casos el número equivocado casi pasó, no porque la persona fuera descuidada, sino porque la IA entrega mal con la misma confianza con la que entrega bien. Ese es el punto incómodo de esta lección: la salida numérica de una IA no es confiable por defecto. Y en producto, donde una métrica de retención o de adopción se vuelve decisión de roadmap, contratación de equipo y presentación al directorio, eso no es un detalle. Es la diferencia entre profesionalismo y ruleta.

La idea central de esta lección. La IA es excelente con texto y pésima como fuente de verdad numérica: cuenta mal, aplica un criterio distinto al que le pediste, redondea hacia arriba, y entrega todo con confianza total. Por eso la métrica que calcula la IA es una propuesta, no una verdad. Auditar no es desconfiar de la herramienta, es higiene profesional que protege tu firma. El cierre de la lección es un checklist de cinco ítems y un principio innegociable: quien firma la métrica siempre es una persona.

01Excelente con texto, pésima con la verdad

Vale la pena entender por qué pasa esto, porque entenderlo cambia cómo usas la herramienta. La IA que usas es, en esencia, una máquina de predecir la próxima palabra que suena bien. Está entrenada para que el texto sea fluido, plausible y seguro. Nadie la entrenó para que la cuenta cierre. Son dos objetivos distintos, y ella solo persigue el primero.

El efecto colateral es cruel para producto. La misma habilidad que hace que la IA escriba un párrafo de análisis impecable hace que escriba una métrica impecable que está equivocada. No tiene un sentido interno de "esto no puede estar bien". Cuando falta claridad sobre el criterio (qué cuenta como "usuario retenido", qué cuenta como "activado"), no se traba: elige un criterio plausible por su cuenta, y a veces ese criterio no es el tuyo.

Fíjate en los modos clásicos de falla. Cuenta como éxito lo que en realidad fue abandono. Aplica un criterio de "activación" distinto al que definió el equipo. Redondea hacia arriba porque el texto "suena mejor" con el número redondo. Suma cohortes que no deberían sumarse. Todos salen con la misma confianza absoluta.

02La paradoja de la sensación: crees que vas más rápido

Aquí entra el estudio que más me hizo detenerme a pensar. En 2025, el METR midió a profesionales con experiencia trabajando con y sin IA en tareas reales. El resultado esperado era ganancia de velocidad. Lo que apareció fue lo contrario: con la IA, fueron cerca de 19% más lentos, y la parte traicionera es que CREÍAN que estaban siendo más rápidos.

¿Por qué importa esto en una lección de auditoría de métrica? Porque la sensación de acierto funciona igual que la sensación de velocidad. Cuando la IA te entrega una métrica linda, bien formateada, con una explicación convincente de por qué la feature funcionó, tu cerebro registra "esto está resuelto" y baja la guardia. En producto, esa falsa confianza cuesta caro: el número equivocado que "parece correcto" es justamente el que atraviesa tu revisión y llega al all-hands, a la reunión de directorio, a la decisión de duplicar la inversión en una feature que en realidad no estaba funcionando.

más rápido más lento la sensación yo gané tiempo lo medido menos 19 por ciento METR 2025: la sensación subió, el resultado cayó

03El checklist de auditoría de la métrica de producto

Aquí está el corazón de la lección. Auditar una métrica no es un talento, es un procedimiento. Cinco preguntas, en orden, antes de que cualquier métrica calculada por IA salga con tu nombre.

La primera: ¿la cuenta cierra cuando se rehace por separado, directo en la fuente? Abres Amplitude, el panel o la planilla de origen y recalculas sin mirar la respuesta de la IA. Si los dos coinciden, seguimos. Si solo confirmaste leyendo la explicación de la IA, no auditaste nada, te convenciste.

La segunda: ¿el criterio usado es el mismo que definió el equipo? "Usuario retenido", "activado", "adoptante" son definiciones que tu equipo fijó en algún lugar. Si la IA usó un criterio distinto (contó una sesión como retención, por ejemplo), el número está bien para la definición equivocada.

La tercera: ¿las premisas están explícitas? Qué período, qué segmento, qué entra y qué no entra en la base. La premisa escondida en la prosa es donde se esconde el error.

La cuarta: ¿alguna señal u orden de magnitud parece raro? Da un paso atrás: ¿esa retención del 42% tiene sentido para tu producto, en tu historial? Un salto demasiado grande rara vez sobrevive a una mirada de sentido común.

La quinta, y la más importante: ¿quien firma sabe defender ese número en el all-hands, línea por línea? Si la respuesta es "no, fue la IA la que calculó", la métrica no está lista.

métrica propuesta por la IA 1 · ¿la cuenta cierra rehecha directo en la fuente? 2 · ¿el criterio usado es el del equipo? 3 · ¿las premisas están explícitas? 4 · ¿señal o magnitud rara? 5 · ¿quien firma defiende? métrica defendible
Sabe más: por qué el criterio de la métrica cambia todo, incluso con el cálculo correcto

Dos equipos pueden calcular "retención en D30" con fórmulas matemáticamente correctas y llegar a números bien distintos, solo porque la definición de "retenido" cambia: abrió la app una vez, o completó una acción de valor. La IA no sabe qué definición usa TU equipo, a menos que se lo digas explícitamente. El error más común no es cuenta equivocada, es cuenta correcta aplicada al criterio equivocado. Por eso el ítem dos del checklist (el criterio es el mismo que definió el equipo) es tan importante como el ítem uno (la cuenta cierra).

04La regla RESPONDER: la IA propone, el humano confirma, la persona firma

El checklist tiene un principio detrás. La IA propone. Es rápida y excelente para generar el borrador de la métrica, la primera versión del cálculo. Úsala con confianza aquí. Pero propuesta es propuesta: nada de lo que produce es verdad solo porque lo produjo.

El humano confirma. Es el checklist de las cinco preguntas corriendo. No es opcional, no es "si hay tiempo". Es el paso que transforma una propuesta de la máquina en un número auditado.

Y la persona firma. Cuando la métrica sale con tu nombre, en un all-hands, en un board deck, la responsabilidad es tuya, entera. "Fue la IA la que calculó" no existe como excusa. La máquina no va a la reunión a defender el número. Tú vas.

05Auditar no es desconfiar: es proteger tu firma

Auditar no es desconfianza de la herramienta, es higiene. El costo de auditar son minutos. El costo de no auditar es una métrica equivocada en el all-hands, una decisión de roadmap tomada sobre ficción, una credibilidad dañada que tomó años construir. La IA te devuelve tiempo en la propuesta; tú reinviertes una fracción de ese tiempo en la confirmación y te quedas con la ganancia neta Y con tu firma protegida.

Hazlo ahora

Hazlo tú

Toma una métrica de producto real que producirías o produjiste con ayuda de IA (tu tarea real sirve bien). Arma TU checklist de auditoría de cinco ítems, adaptado a tu contexto:

  1. ¿LA CUENTA CIERRA REHECHA DIRECTO EN LA FUENTE? ¿Cómo, exactamente, recalcularías esta métrica de forma independiente, sin mirar la respuesta de la IA?
  2. ¿EL CRITERIO ES EL MISMO QUE DEFINIÓ EL EQUIPO? Escribe la definición oficial de "retenido", "activado" o "adoptante" que usa tu equipo, y confirma si la IA usó esa misma definición.
  3. ¿LAS PREMISAS ESTÁN EXPLÍCITAS? Lista período, segmento y qué entra o no en la base.
  4. ¿SEÑAL O MAGNITUD RARA? ¿Qué valor, si apareciera, haría que pares en seco y digas "esto no puede estar bien"?
  5. ¿QUIEN FIRMA DEFIENDE? Escribe el nombre de la persona que firma esa métrica y la defensa de una línea que daría en el all-hands.

Guarda este checklist. Vale para toda métrica que vayas a producir con IA de aquí en adelante.

Practica

1. La IA entregó un resumen de retención del trimestre con un texto ejecutivo muy convincente. ¿Cuál es la lectura correcta antes de usar el número?

2. Dos equipos calculan 'retención en D30' con fórmulas matemáticamente correctas y llegan a números bien distintos. ¿Cuál es la explicación más probable, según el checklist de esta lección?

3. Un número de activación calculado por IA salió con tu nombre en una presentación y estaba equivocado. ¿Quién responde por ese número?

Para la pizarra

Sobre su naturalezaexcelente con el texto, pésima como fuente de verdad numérica. Una propuesta no es la verdad.
Sobre la definicióndos fórmulas correctas con números distintos es problema de criterio, no de cuenta. Verifica la definición que el equipo acordó.
Sobre la firmala responsabilidad no migra a la herramienta. Quien firma responde.
¿Qué te pareció esta página?
¿Recomendarías esta página a alguien de tu equipo?