Conectar la IA al contexto de gente (con LGPD redoblada)
Cómo hacer que la IA trabaje con los datos reales de gente, eligiendo el camino correcto según el formato del dato, y por qué la revisión de seguridad en RRHH es redoblada: aquí no es solo dato sensible de la empresa, es dato personal de gente de verdad.
Le preguntas a la IA cuál es la tasa de turnover real del último trimestre. Ella responde con un análisis lleno de términos bonitos de gestión de personas, e inventado. La IA nunca abrió tu sistema de nómina ni tu base de despidos, así que adivina un número plausible para tu sector, que no es el tuyo.
Le pides a la IA que cruce el costo de nómina, que es dato estructurado en el ERP, con la política de ajuste salarial, que es texto corrido, para saber si el presupuesto del próximo año cierra. Ella devuelve una respuesta segura, pero trató el ERP como texto para buscar por significado y la política como planilla, perdiendo la regla de ajuste por rango. El sobregiro de presupuesto real quedó escondido en una cláusula que ella nunca leyó bien.
Le pides a la IA que evalúe el riesgo de un proceso laboral cruzando el historial de amonestaciones del colaborador, estructurado en el sistema de RRHH, con el contrato de trabajo, que es texto corrido en PDF. Ella devuelve un dictamen confiado, pero trató el historial como texto para buscar por significado y el contrato como planilla, perdiendo la cláusula que cambiaba todo. El punto que decidía el caso desapareció porque ninguna fuente se leyó de la forma correcta.
Le pides a la IA que cruce el employer branding, medido en métrica estructurada de postulaciones por canal, con el informe de percepción de marca empleadora en PDF lleno de gráficos. Ella devuelve un resumen bonito, pero leyó el PDF como texto corrido y perdió el gráfico, y trató la métrica de canal como si necesitara búsqueda por significado. El canal que realmente traía buenos candidatos desapareció en medio de la confusión.
Le pides a la IA que cruce el índice de turnover, que vive estructurado en el sistema de nómina, con la política de despido, que es texto corrido en PDF, para entender por qué un área específica está perdiendo gente. Ella devuelve una respuesta con jerga de gestión de personas, pero trató la política como si fuera planilla y la nómina como si necesitara búsqueda por significado. El equipo que más perdía gente desapareció en medio de la confusión, porque ninguna de las dos fuentes se leyó de la forma correcta. Y antes de siquiera conectar la base de despidos nominal, con nombre, CPF, motivo, todavía falta la pregunta que vale más: ¿ese dato puede salir de la empresa sin anonimizar, y es dato personal sensible, por ejemplo si el motivo involucra salud o licencia?
Le pides a la IA que diga qué squad tiene la mayor retención de talento, cruzando el panel de headcount, que es dato estructurado, con el informe trimestral de clima en PDF lleno de gráficos que envía RRHH. Ella devuelve un número bonito, pero leyó el PDF como texto corrido y perdió la tabla, y trató el panel como si necesitara buscar por significado en vez de calcular. El squad que realmente retenía talento estaba en una columna del panel que ella nunca sumó bien.
Le pides a la IA que explique dónde el embudo de contratación más se traba, cruzando el export del ATS, que es fila y columna, con el informe de feedback de candidatos en PDF que arma RRHH cada trimestre. Ella devuelve una respuesta de consultor, pero trató el ATS como texto para buscar por significado y el PDF lleno de gráficos como planilla simple, perdiendo la tabla de conversión por etapa. El cuello de botella real estaba en la entrevista técnica, escondido en una tabla que ella nunca leyó como imagen.
Le pides a la IA que encuentre dónde el tiempo de contratación más se dispara, cruzando el sistema de tiempo por etapa del ATS, que es dato estructurado, con el informe de calidad de contratación en PDF lleno de gráficos que te manda RRHH cada semana. Ella devuelve una respuesta con jerga de eficiencia, pero trató el PDF como texto corrido, perdiendo la tabla de tiempos, y trató el sistema estructurado como si necesitara búsqueda por significado. El cuello de botella que más atrasaba estaba en una tabla que ella nunca leyó como imagen de verdad.
Le pides a la IA que liste qué procesos de RRHH están más expuestos bajo la LGPD, cruzando la matriz de accesos a dato personal, que es fila y columna, con la política de retención de datos de candidatos, que es texto corrido, y el informe de auditoría en PDF lleno de gráficos. Ella devuelve una lista genérica, pero mezcló las tres fuentes: trató la matriz como texto, la política como planilla, y el PDF perdió la tabla de severidad. El acceso realmente indebido estaba en una política que ella nunca leyó por significado.
Le pides a la IA que encuentre qué etapa del onboarding técnico más genera tickets de soporte, cruzando el log estructurado del sistema de acceso con el informe de satisfacción de onboarding en PDF lleno de gráficos. Ella devuelve una suposición con aire de quien entiende, pero trató el log como texto para buscar por significado y el PDF como planilla simple, perdiendo el gráfico. La etapa que más trababa al nuevo colaborador estaba en una tabla del informe que ella nunca leyó como imagen.
Le pides a la IA que encuentre dónde el candidato más abandona el proceso de selección, cruzando los datos de embudo del ATS, que son estructurados, con el informe de investigación de experiencia del candidato en PDF lleno de mapas de calor. Ella devuelve un cliché de reclutamiento, pero trató el embudo como texto corrido y el PDF como planilla, perdiendo el mapa de calor que mostraba el punto real de abandono. El paso de la mitad del proceso, donde el candidato realmente se trababa, desapareció porque ninguna fuente se leyó de la forma correcta.
Le preguntas a la IA qué competidor te está robando el mejor talento, juntando el informe de entrevistas de salida, en PDF lleno de gráficos, con la planilla de headcount por área de una sola vez. Ella devuelve una respuesta bonita, pero mezcló los dos: trató el PDF con gráficos como texto corrido y perdió la tabla, y trató la planilla como si necesitara búsqueda por significado. El área que más perdía gente ante el competidor estaba escondida en una fila de la planilla que ella nunca leyó como tabla de verdad.
Ok, fíjate en algo: el problema casi nunca es que la IA sea mala con las cuentas. El problema es que está respondiendo de memoria, sin haber abierto nunca los datos reales de tu gente. Es como contratar al mejor consultor de RRHH del mercado, sentarlo en tu oficina y nunca darle acceso a tu ATS, a tu nómina, a tu historial de despidos. Va a hablar bonito y va a fallar feo, porque está adivinando. Conectar la IA al contexto de gente es exactamente lo que la saca de lo genérico. Solo que aquí conectar mal es peor que en cualquier otra área, porque no es filtrar un número, es filtrar la vida de una persona.
La idea central de esta lección. La IA solo sirve de verdad cuando trabaja con los datos reales de gente, y el FORMATO del dato decide el camino. El dato estructurado (nómina, ATS, sistema de fichaje) muchas veces ni pide búsqueda vectorial: la IA razona sobre el schema, las estadísticas y una muestra. El documento de texto (política, contrato, manual del colaborador) pide RAG, búsqueda por significado. El informe con gráfico y tabla (encuesta de clima en PDF, dashboard de headcount) rompe el RAG tradicional, y ahí entra leer la página como imagen. Pero en RRHH hay una diferencia que lo cambia todo: antes que nada, la revisión de seguridad es REDOBLADA. No es "dato sensible de la empresa", es dato personal de una persona identificable, y a veces dato personal sensible de verdad, bajo la LGPD.
01El formato del dato de gente decide el camino
Lo primero que cambia todo es dejar de tratar "los datos de RRHH" como una sola cosa. No existe un camino único para conectar la IA con tu gente. Lo que existe es el formato del dato, y el formato dicta la ruta.
Piensa conmigo en tres tipos de información que viven en todo RRHH. Está el dato estructurado, que vive en fila y columna: el export del ATS o de Gupy, la nómina, el sistema de fichaje. Está el documento de texto corrido: la política de despido, el manual del colaborador, la CLT y las normas internas, el contrato de trabajo. Y está el informe visual: la encuesta de clima en PDF con mapa de calor por área, el dashboard de headcount con tabla a color.
Son tres naturalezas distintas, y cada una pide una herramienta distinta. Intentar meter las tres en el mismo camino es el error número uno. El estudio de @datasciencebrain apunta exactamente a esto: el formato del dato decide la arquitectura de memoria, no al revés.
02Dato estructurado: la IA razona sobre el schema, no necesita vectorial
Aquí vive el error más común de quien acaba de aprender RAG: pensar que TODO dato necesita volverse búsqueda vectorial. No es así. Y en RRHH buena parte de tu información vive estructurada, en fila y columna, directo del sistema de nómina o del ATS.
Cuando el dato es un export de headcount o una tabla de turnover por área, la IA gana casi nada transformando cada celda en coordenada de significado. Lo que necesita es entender la ESTRUCTURA: cuáles son las columnas, qué significa cada una, cuál es el total de filas, la suma de cada columna, el rango de los valores. En vez de "buscar fragmentos parecidos", ella razona sobre el schema, sobre las estadísticas (promedio, suma, máximo, mínimo) y sobre una muestra de algunas filas representativas.
Piensa en la diferencia práctica. Para responder "qué área tiene el mayor turnover", la IA no necesita una búsqueda semántica difusa. Necesita mirar la tabla de la nómina, ordenar la columna de despidos y leer la primera fila. Eso es razonamiento sobre dato estructurado, no búsqueda vectorial. Es más barato en tokens, más exacto y no tiene el riesgo de que la búsqueda traiga el historial de la persona equivocada.
El mensaje es directo: antes de armar un RAG completo para tus datos de gente, pregúntate si el dato ya no está estructurado. Si lo está, el camino es darle a la IA el schema, las estadísticas y una muestra, y dejar que ella calcule. ¿Listo?
03Documento e informe visual: dos caminos que no se mezclan
Ahora los otros dos formatos, que mucha gente trata igual y no lo son.
El documento de texto es el territorio natural del RAG, exactamente como viste en la lección de RAG y memoria (la 2.4). La política de despido, el manual del colaborador, el contrato de trabajo: todo eso es texto corrido, y la IA encuentra la respuesta correcta buscando por significado. Le preguntas "cuál es el preaviso de esa política" y la búsqueda por significado trae el fragmento correcto, aunque la política diga "período de transición" en vez de "preaviso". Para texto, RAG resuelve.
El informe visual es donde vive la trampa. Toma el PDF de tu encuesta de clima: tiene mapa de calor por área, tiene tabla de eNPS por antigüedad, tiene números alineados en columna, tiene leyenda que cambia el sentido del gráfico al lado. Si metes ese PDF en un RAG tradicional, él extrae el texto y MEZCLA todo: el mapa de calor se vuelve una sopa de números sueltos, la tabla desaparece, la relación entre el área y el índice se pierde. El RAG tradicional se rompe con el informe visual, y lo peor es que se rompe en silencio: devuelve un número que parece correcto y está mal, señalando el problema en el área equivocada.
La salida es leer la página como IMAGEN. Los modelos con visión (multimodales) miran el PDF como una foto de la página, ven la tabla como tabla, el gráfico de calor como gráfico, y preservan la relación entre el área y el índice. Es la diferencia entre transcribir una encuesta de clima a ciegas y mirarla de verdad.
04Seguridad redoblada: aquí es dato personal de verdad
Todo lo que vimos hasta aquí es sobre hacer que la IA acierte. Ahora el punto que, en RRHH, es lo que puede derribarte de una forma distinta a finanzas: lo que sale de la empresa no es solo un número, es gente.
En el instante en que conectas la IA a los datos de tu equipo, la revisión de seguridad es REDOBLADA respecto a cualquier otra área. No es "dato sensible de la empresa", como un precio o un margen. Es dato que identifica a una persona específica: nombre, CPF, evaluación de desempeño, motivo de despido. Y a veces es dato personal SENSIBLE de verdad, en la definición del artículo 11 de la LGPD: salud, licencia de maternidad, orientación, entre otros. Ese tipo de dato pide un cuidado que ni todo dato financiero pide.
Existen tres capas de protección que andan juntas, y aquí son todavía más estrictas. La primera es la anonimización: cambiar el nombre de la persona por un código antes de mandarlo a la IA, enmascarar el CPF, agregar por área en vez de exponer al individuo, siempre que la pregunta permita responder de forma agregada. La segunda es la elección de dónde corre: el dato personal sensible pide un modelo corriendo local o en un entorno cerrado, nunca la nube pública sin anonimizar antes. La tercera es el gateway, el portón que queda entre tú y el modelo y BLOQUEA lo que no puede pasar, registrando todo lo que pasó, porque en una auditoría de LGPD es ese registro el que prueba que trataste el dato con cuidado.
Ese gateway es el mismo concepto de la Pila más AI Gateway que viste en la Sala de Máquinas, y conecta directo con la lección de gobernanza de la ejecución (la 4.4). Aquí la diferencia tiene nombre de proceso laboral, de multa de la ANPD y de confianza rota con tu propio equipo. Filtrar el dato sensible de un colaborador no es como filtrar un número de margen: es la vida de una persona expuesta.
05Uniendo todo: del dato genérico al dato de tu gente
Ahora se puede ver el cuadro completo. Conectar la IA al contexto de gente es lo que la saca de lo genérico, es lo que hace que deje de adivinar y empiece a responder con tu ATS, tu nómina, tu encuesta de clima delante. Pero conectar es un arma de doble filo que corta más hondo en RRHH: conectar mal o filtra información que identifica a una persona, o inventa un hallazgo con cara de verdad sobre gente de verdad.
La secuencia mental que te protege es siempre la misma, con un paso más al final. Primero, mira el FORMATO del dato y elige el camino: estructurado se vuelve razonamiento sobre schema, texto se vuelve RAG, informe visual se vuelve lectura como imagen. Segundo, antes de conectar cualquier cosa, pasa por la revisión de seguridad redoblada: ¿este dato identifica a una persona?, ¿es dato sensible bajo el artículo 11?, ¿necesita anonimizar?, ¿corre local o en la nube?, ¿el gateway está en el medio? Formato primero, seguridad siempre, y en RRHH esa seguridad nunca es opcional ni "depende del caso".
Quien entiende este orden deja de tratar la IA como una caja mágica que adivina hallazgos sobre tu equipo y pasa a tratarla como una analista a la que le das acceso, con reglas, a lo que puede ver de gente de verdad. ¿Listo?
Hazlo ahora
Toma un caso real de tu RRHH donde la IA respondió de memoria y falló, o donde todavía no intentaste usar IA: tu tarea real.
- Lista 3 fuentes de dato que contendrían la respuesta correcta (ATS, nómina, encuesta de clima, política de despido, contrato de trabajo).
- Para cada fuente, clasifica el FORMATO: estructurado (fila y columna), documento de texto, o informe visual (tabla y gráfico en una página).
- Marca el camino de cada una: estructurado lleva a razonamiento sobre schema, texto lleva a RAG, informe visual lleva a lectura como imagen.
- Haz la revisión de seguridad REDOBLADA de cada fuente en una línea: ¿este dato identifica a una persona? ¿Es dato personal sensible (salud, licencia, entre otros del art. 11)? ¿Necesita anonimizar? ¿Corre en la nube o pide entorno cerrado?
- Señala cuál fuente es la más sensible de las tres y escribe, en una frase, qué debería bloquear el gateway en ella.
Acabas de diseñar la conexión de tu IA con tu gente por el camino correcto y con el portón de seguridad redoblado en su lugar. Estás por delante de quien solo tira la encuesta de clima en un chat y reza.
Practica
1. Necesitas que la IA responda 'qué área tiene el mayor turnover' a partir del export de tu nómina. ¿Cuál es el camino más indicado?
2. ¿Por qué meter el PDF de la encuesta de clima (con mapa de calor y tablas) en un RAG tradicional suele señalar el área equivocada?
3. Antes de conectar la IA a un dato de RRHH que involucra salud o licencia de un colaborador, ¿cuál es la postura correcta?
Para la pizarra
Sobre el diagnósticoestá adivinando porque nunca abrió tu ATS, tu nómina, tu historial.
Sobre el formatola nómina es estructurada y pide razonamiento sobre columnas. Un informe visual rompe el RAG tradicional en silencio.
Sobre la seguridadaquí es dato personal de verdad. La verificación viene antes de cualquier conexión, no después del susto.
Gracias por el feedback. Esto ayuda a afinar la próxima lección.