Un algoritmo no es justo ni injusto

El caso es viejo y sigue siendo el más claro que conozco.

Una empresa quiere automatizar parte de su proceso de contratación. Entrena un sistema con su propio histórico: quiénes se postularon, a quiénes contrataron, cómo les fue. Y resulta que en ese histórico la mayoría de los contratados son hombres.

El sistema aprende lo que le enseñaron. Empieza a preferir hombres. La base de datos le está diciendo, con toda claridad, que en esta empresa se contrata a hombres.

La solución obvia

La solución más inmediata es balancear la base de datos: conseguir que el histórico con el que se entrena tenga una proporción distinta a la que tuvo la realidad.

Funciona, y se usa. Pero a mí siempre me pareció que atacaba el síntoma. Estás corrigiendo la distribución de una variable que, para empezar, no debería estar ahí.

La que a mí me parece más justa

No usar el sexo como parámetro de entrada.

No porque sea incómodo, sino porque no determina las capacidades profesionales de nadie. Si no determina el resultado que quieres predecir, no es un dato del problema. Es ruido con historia.

Reconozco que en la práctica esto es más difícil de lo que suena: hay variables que actúan como sustituto, y quitar una columna no borra la información que otras columnas cargan. Pero la pregunta de fondo sigue en pie, y es la que casi nunca se hace en voz alta: ¿por qué está ese dato en la entrada?

Y aquí está el punto

Fíjate en todo lo que hubo que decidir para llegar hasta aquí:

Ninguna de esas decisiones la tomó una máquina. Las máquinas no eligen su algoritmo, no eligen sus datos, no eligen su aplicación, y no eligen las implicaciones.

Por eso me parece que "justicia" es la palabra equivocada. Un proceso determinado por estadística o por ecuaciones hace lo que se le indicó. La palabra que sí aplica es responsabilidad, y la responsabilidad tiene siempre a alguien detrás.

Decir que "el algoritmo es injusto" suena a denuncia y funciona como coartada: convierte una cadena de decisiones humanas en una propiedad del software. Es mucho más incómodo —y mucho más útil— preguntar quién eligió los datos.


Este texto sale del episodio 002 del Podcast Algoritmos, sobre ordenar y los criterios. Relacionado: qué es realmente una caja negra.

No se pudo guardar tu suscripción. Por favor, inténtalo de nuevo.
Tu suscripción ha sido exitosa.

Boletín

Recibe nuevos artículos por correo.