Basado en Programming Differential Privacy, de Joseph P. Near y Chiké Abuah
Universidad de los Andes & Quantil
24 septiembre 2026
¿Cómo publicamos estadísticas útiles sobre un conjunto de personas sin revelar nada sobre ninguna de ellas en particular?
Todo el código de estas slides se ejecuta en el navegador: los números y las figuras se calculan en el momento, y cada bloque se puede editar y volver a correr.
Trabajamos con un censo sintético de 5.000 personas, con la estructura del dataset Adult del US Census que usa el libro.
Publicamos solo un conteo. Sin nombres, sin identificadores. Parece seguro. Consideremos el caso de Karen.
Ataque diferencial. Dos agregados, restados, reconstruyen un dato individual.
Si el resultado publicado hubiera sido casi el mismo con o sin Karen en la base, entonces observarlo no dice nada sobre ella.
Karen puede sostener: ese resultado se habría producido igual si yo no estuviera en los datos. Y sería creíble.
Formalizamos “casi el mismo” con dos piezas:
-privacidad diferencial. Un mecanismo aleatorio satisface -privacidad diferencial si para todo par de bases vecinas , y todo conjunto de salidas :
Tres lecturas de la misma desigualdad:
acota cuánto puede cambiar la creencia de un atacante sobre Karen.
se considera protección fuerte; , poca privacidad. No hay umbral universal: es una decisión del investigador.
La receta más simple que satisface la definición: sumar ruido de Laplace calibrado al presupuesto.
La sensibilidad de un conteo es : una persona cambia el resultado en, como máximo, uno. Volveremos sobre esto en el capítulo 3.
Menos significa más dispersión: más privacidad y menos utilidad. El mismo parámetro gobierna ambas cosas.
Repetimos el ataque, pero ahora las dos consultas pasan por el mecanismo.
La señal que busca el atacante vale 1; el ruido tiene desviación estándar de varias unidades. La señal queda enterrada.
¿Por qué la definición exige que la garantía valga para todo par de bases vecinas, y no en promedio sobre las bases plausibles?
Porque una garantía promedio se rompe justo para quien más la necesita: el individuo atípico. El millonario en un censo de ingresos, el paciente con la enfermedad rara.
Una garantía en el peor caso es además la única que sobrevive a un atacante con conocimiento auxiliar arbitrario: no necesitamos suponer qué sabe.
Es la diferencia con la anonimización clásica: -anonimato protege contra los ataques que imaginaste; la privacidad diferencial, contra todos.
Nadie publica una sola consulta. Un instituto de estadística publica docenas de tablas; un modelo se entrena con miles de iteraciones.
Necesitamos saber qué pasa cuando los resultados privados se combinan, se transforman o se repiten. Tres propiedades responden eso:
Si es -DP y es cualquier función que no vuelve a mirar los datos, entonces también es -DP.
Podemos limpiar, reescalar y graficar los resultados. La información privada ya fue protegida; ninguna función puede recuperarla.
Si es -DP y es -DP, publicar ambas es -DP.
El presupuesto se gasta: repetir una consulta permite promediar el ruido hasta hacerlo desaparecer.
Con publicaciones el error cae como : con suficientes consultas el atacante recupera el valor exacto. Por eso el presupuesto debe sumar.
Si los son -DP y se aplican sobre subconjuntos disjuntos de los datos, el total es -DP — no .
Un histograma es el caso canónico: cada persona cae en exactamente un nivel educativo, así que solo afecta a una barra.
La diferencia es visualmente imperceptible porque el ruido es de orden personas sobre barras de cientos. Los histogramas son el caso exitoso de la privacidad diferencial.
Hasta ahora usamos sensibilidad sin justificarlo. Esa es la pieza que conecta la consulta con el ruido.
Sensibilidad global. Para una consulta , es decir: cuánto puede mover el resultado una sola persona, en el peor caso.
El mecanismo de Laplace con escala satisface -DP. Todo el trabajo está en calcular correctamente.
Agregar o quitar una persona cambia un conteo en o en . Nunca más. , independientemente del tamaño de la base.
Por eso los conteos son baratos: el ruido necesario no crece con , así que el error relativo se desvanece en bases grandes.
Nadie impide que exista una persona con una ganancia de capital de mil millones. La sensibilidad de una suma sin restricciones es infinita, y un ruido infinito destruye toda utilidad.
Forzamos una cota. Si ningún valor puede exceder , entonces por construcción.
El dilema del recorte: pequeño sesga la suma hacia abajo; grande exige más ruido. Hay un óptimo intermedio.
A la izquierda, el sesgo desaparece al crecer . A la derecha, el ruido lo compensa: el error total tiene un mínimo interior.
Problema circular: el óptimo depende de los datos, y mirarlos cuesta presupuesto. La salida del libro: buscar el codo con consultas privadas.
Honestidad contable: el presupuesto gastado en elegir cuenta. Es composición secuencial, no un preprocesamiento gratuito.
Un promedio no es una consulta lineal, así que no tiene sensibilidad simple. La descomponemos y usamos composición secuencial.
El presupuesto se parte: para la suma (sensibilidad , la edad máxima) y para el conteo (sensibilidad ).
Tentación: usar la sensibilidad en la base que tenemos, no en el peor caso. Sería mucho más chica.
Y rompe la garantía. La sensibilidad local depende de los datos; si la escala del ruido depende de los datos, la escala misma filtra información. Un atacante que observa un ruido pequeño aprende que la base no tiene valores extremos.
Las alternativas legítimas son más elaboradas:
Todas comparten el principio: nada que dependa de los datos puede escapar al presupuesto.
La -DP pura es exigente: prohíbe cualquier salida que sea más de veces más probable bajo que bajo , incluso las de probabilidad ínfima.
Relajar la definición con un término aditivo compra tres cosas:
-privacidad diferencial. Para todo par de bases vecinas , y todo conjunto de salidas :
El término es una probabilidad de falla del mecanismo: con probabilidad la garantía de -DP simplemente no aplica.
Elegir . Con el mecanismo “publicar los datos de una persona al azar” satisface técnicamente la definición — y es evidentemente inaceptable.
La convención habitual es o, directamente, para bases del orden de decenas de miles.
Diferencia conceptual clave:
Son dos ejes distintos, no dos formas del mismo parámetro.
Cuando la consulta devuelve un vector, hay dos formas de medir cuánto lo mueve una persona.
Para una persona que afecta componentes en cada una: pero . Laplace necesita ; Gauss se conforma con . Ahí está la ganancia.
Misma receta que Laplace — sumar ruido calibrado a la sensibilidad — pero con ruido normal y calibrado a .
Mecanismo Gaussiano. Sea una consulta con valores en y sensibilidad . Para y , el mecanismo
satisface -privacidad diferencial.
Frente a Laplace, en cada componente:
Nótese el precio: para una consulta escalar, incorpora el factor cuando .
En una consulta escalar Laplace gana: con el mismo concentra mucha más masa cerca de cero, mientras Gauss paga el precio de sin recibir nada a cambio.
A partir de componentes, Gauss domina — y sigue mejorando. Por eso el aprendizaje automático privado usa Gauss: un gradiente tiene tantas componentes como parámetros el modelo.
La relajación también mejora la contabilidad del presupuesto.
mecanismos -DP componen a -DP, para cualquier que elijamos, con
Crece como en vez de , pero con un factor constante alto: solo conviene cuando es grande. Para pocas consultas, la composición simple gana.
La composición avanzada sigue siendo mediocre para el aprendizaje automático, donde son miles de iteraciones. De ahí nacieron definiciones diseñadas para componer bien.
El problema de fondo: -DP acota la cola de la pérdida de privacidad. Componer cotas de cola es intrínsecamente costoso — cada composición vuelve a aplicar un argumento de peor caso sobre otro.
-privacidad diferencial de Rényi. la satisface si para todo par de bases vecinas , :
donde es la divergencia de Rényi de orden .
En vez de acotar una cola, acota una divergencia. Y las divergencias se suman:
Mismo mecanismo Gaussiano repetido veces (, , ). Solo cambia cómo llevamos la cuenta.
La conversión final es : se compone en RDP y se optimiza sobre al final, convirtiendo una sola vez.
Con el presupuesto cae de a sin tocar el ruido. Esto es lo que hace viable el DP-SGD del capítulo siguiente.
Queremos entrenar un clasificador que prediga ingreso alto a partir de edad y educación — sin que el modelo memorice a nadie.
Regresión logística por descenso de gradiente. El gradiente es una suma sobre personas — y cada término depende de una sola.
Publicar el gradiente agregado en cada iteración es publicar una consulta de suma. Ya sabemos protegerla: recortar y sumar ruido.
La sensibilidad de la suma de gradientes no está acotada — igual que la suma de ganancias de capital. Misma solución: recortar, ahora en norma .
Juntamos todo: recorte por persona, ruido Gaussiano sobre la suma, y composición secuencial a lo largo de las iteraciones.
La curva es la respuesta honesta a “¿cuánto cuesta la privacidad?”: depende del régimen. Arriba de el costo es casi nulo; abajo de el modelo colapsa hacia la clase mayoritaria.
Más iteraciones convergen mejor, pero cada una gasta : el ruido por paso crece con . Hay un óptimo interior.
Con presupuesto fijo, el número de iteraciones pasa de ser un detalle de implementación a ser un hiperparámetro de privacidad. Y ajustarlo mirando los datos también cuesta presupuesto.
Lo que implementamos es noisy gradient descent de lote completo. El algoritmo estándar, DP-SGD, agrega dos piezas:
Ambas piezas atacan lo mismo: el presupuesto por iteración. Con ellas, entrenar redes profundas con deja de ser imposible.
| Capítulo | Idea central | Qué se lleva a la práctica |
|---|---|---|
| 1. Privacidad diferencial | Indistinguibilidad entre bases vecinas, en el peor caso | es la perilla única entre privacidad y utilidad |
| 2. Propiedades | Post-procesamiento gratis; composición secuencial y paralela | El presupuesto es un recurso que se asigna y se agota |
| 3. Sensibilidad | Cuánto mueve el resultado una persona | Sin cota no hay privacidad: recortar es obligatorio |
| 4. DP aproximada | compra Gauss, y mejor composición | Indispensable en alta dimensión |
| 5. Aprendizaje | El gradiente es una consulta de suma | Recortar por persona, ruido, contabilidad |
Near, J. P. y Abuah, C. (2021). Programming Differential Privacy. Capítulos 3 (Differential Privacy), 4 (Properties of Differential Privacy), 5 (Sensitivity), 6 (Approximate Differential Privacy) y 11 (Machine Learning). https://programming-dp.com/
Dwork, C. y Roth, A. (2014). The Algorithmic Foundations of Differential Privacy. Foundations and Trends in Theoretical Computer Science, 9(3-4).
Abadi, M. et al. (2016). Deep Learning with Differential Privacy. CCS 2016.
Esta presentación se hizo con la ayuda del Claude Code Academic Workflow de Sant’Anna, P. H. C. (2026). GitHub. https://github.com/pedrohcgs/claude-code-my-workflow