Passport Photo AI Passport Photo AI
31 de agosto de 2026 · Passport Photo AI · 9 min

Cómo la IA revisa tu foto de pasaporte (y por qué los revisores humanos se pierden cosas)

Lo que el editor en el navegador hace realmente con tu foto: mapeo facial de 478 puntos, segmentación de personas, 22 controles agrupados, y por qué la IA detecta lo que los humanos no ven.

Un estudio de 2019 del NIST sobre algoritmos de reconocimiento facial encontró que la varianza entre dos revisores humanos que evalúan la misma foto de pasaporte es de alrededor del 11 %: es decir, si enviaras una foto idéntica a dos funcionarios consulares distintos el mismo día, hay aproximadamente una probabilidad de uno entre diez de que uno la acepte y el otro la rechace. El mismo estudio encontró que los controles algorítmicos reducen la varianza entre evaluadores por debajo del 1 %.

Esa diferencia es la razón por la que existe un control de cumplimiento automatizado antes de enviar. Un revisor humano es rápido pero inconsistente. Un algoritmo es consistente pero limitado a reglas objetivas. El truco es usar ambos: dejar que el algoritmo resuelva cada regla medible y reservar el juicio humano para el pequeño grupo de decisiones genuinamente subjetivas.

Este artículo explica qué hace el editor en el navegador con tu foto cuando la subes: los modelos, las mediciones, los 22 controles, y dónde la IA es realmente mejor que un revisor humano, dónde es peor y qué significa eso para si debes fiarte del veredicto “pasa” antes de enviarla.

Qué pasa cuando subes una foto

El editor se ejecuta íntegramente en tu navegador. Nada se sube a un servidor, lo que importa tanto por privacidad (tu cara no sale de tu dispositivo) como por velocidad (sin latencia de ida y vuelta). El pipeline tiene cuatro fases:

  1. Detección facial y puntos de referencia: localizar la cara, identificar 478 puntos anatómicos en ella.
  2. Segmentación de personas: separar a la persona del fondo a nivel de píxel.
  3. Estadísticas por región: medir iluminación, nitidez, color y geometría en las regiones de cara, pelo y fondo.
  4. Validación de reglas: ejecutar 22 controles agrupados contra la especificación del documento y devolver pasa/falla con motivos.

Cada fase usa un modelo o técnica específica. Repasémoslas.

Fase 1: Mapeo facial de 478 puntos

El editor usa MediaPipe Face Landmarker de Google, un modelo que identifica 478 puntos específicos en un rostro humano: comisuras de los ojos, borde de los labios, punta de la nariz, línea de la mandíbula, arco de la ceja, posición de la oreja, línea del pelo en la frente. El mapa de 478 puntos es lo bastante denso como para medir:

  • Inclinación de la línea de ojos: el ángulo de la línea entre los centros de las dos pupilas respecto a la horizontal. La especificación pide menos de 5°; el modelo lo mide con una precisión de 0,1°.
  • Yaw de la cabeza: rotación izquierda-derecha de la cabeza, medida por la asimetría entre la visibilidad de la oreja izquierda y derecha y la posición de la punta de la nariz respecto al eje medio de la cara.
  • Pitch de la cabeza: inclinación arriba-abajo, medida por la posición vertical de los ojos dentro del óvalo facial.
  • Apertura de la boca: separación entre los puntos de referencia del labio superior e inferior. Bocas cerradas registran 0-3 px; sonrisa con dientes registra 8 px o más.
  • Apertura de ojos: distancia entre los puntos del párpado superior e inferior. Por debajo de un umbral, los ojos se clasifican como semicerrados.
  • Centrado del iris: posición del iris dentro de la apertura del ojo. Una desviación de más del 15 % respecto al centro activa una marca de “mirada lateral”.

Un revisor humano calcula a ojo todo esto. El algoritmo lo mide en píxeles. Esa es la ventaja de consistencia: el algoritmo no tiene un “buen día” ni un “mal día”.

Qué significan 478 puntos en la práctica

El mapeo denso es lo que permite al editor detectar los detalles sutiles que se le escapan a los revisores humanos. Una cabeza girada 6° a la derecha parece recta al ojo humano pero produce un desplazamiento medible de la nariz respecto al eje medio y una asimetría en la visibilidad de las orejas. El algoritmo lo marca; el humano lo deja pasar; el sistema biométrico en la frontera más tarde no consigue emparejar. Mejor detectarlo antes de enviar.

Fase 2: Segmentación de personas

El cumplimiento del fondo es el motivo de rechazo más común (ver el artículo de las 22 razones), así que el editor usa un modelo dedicado de segmentación de personas: concretamente una variante ligera de U-Net entrenada en el dataset COCO de segmentación de personas y adaptada para encuadres de retrato.

La salida es una máscara por píxel: 1 si el píxel pertenece a la persona, 0 si pertenece al fondo. La máscara se usa para tres cosas:

  • Análisis del fondo: recoger cada píxel marcado como fondo y hacer estadísticas de color sobre él. RGB medio, desviación típica, distribución de tonos. Un fondo verdaderamente liso y blanco tiene una desviación típica muy baja (por debajo de 5 en cada canal) y un tono casi gris. Una pared con textura, el borde de una ventana o una sombra aparecen como desviación típica elevada.
  • Reemplazo de fondo: si la foto falla el control de fondo, la máscara se usa para componer a la persona sobre un fondo limpio blanco o blanco roto.
  • Detección de sombras: una sombra proyectada sobre el fondo aparece como una región oscura localizada en la máscara del fondo. El editor la detecta comparando el brillo de los píxeles de fondo alrededor de la cabeza con el resto del fondo.

El modelo de segmentación es bueno pero no perfecto: las hebras finas de pelo y los contornos suaves de mandíbula son los casos difíciles. El editor usa una máscara con bordes suavizados (alpha-feathered) para evitar el aspecto de “recortable de papel” que producen las herramientas amateur de eliminación de fondo.

Fase 3: Estadísticas por región

Una vez localizados los puntos faciales y segmentada la persona, el editor calcula estadísticas sobre regiones específicas:

  • Brillo facial: luminancia media de los píxeles de piel. Se compara con el brillo del fondo para detectar caras subexpuestas (cara mucho más oscura que el fondo) o sobreexpuestas (cara quemada).
  • Simetría de iluminación: ratio de brillo entre la mitad izquierda y derecha de la cara. Un ratio simétrico (cerca de 1,0) significa iluminación uniforme; un ratio por encima de 1,2 significa que una luz lateral fuerte está sombreando una mitad de la cara.
  • Suavidad de la piel: contenido de textura de alta frecuencia en las regiones de mejillas y frente. Una cara natural sin editar tiene textura medible (poros, microsombras). Una foto pasada por un filtro de belleza tiene un contenido de alta frecuencia anormalmente bajo: esa es la señal que usa el detector de filtros.
  • Nitidez: varianza laplaciana en la región facial. Una cara nítida y enfocada produce un valor alto; una borrosa (movimiento, desenfoque, borde difuminado por modo retrato) produce un valor bajo.
  • Nitidez específica de los ojos: medida por separado porque los ojos deben estar nítidos incluso cuando otras regiones toleren cierta suavidad.

Cada estadística es un número. Cada número se mapea a una regla. Cada regla se mapea a un control. De ahí salen los 22 controles.

Fase 4: Los 22 controles agrupados

La fase final del editor toma las mediciones de las fases 1-3 y las ejecuta contra la especificación del documento de destino (pasaporte estadounidense, pasaporte británico, visado Schengen, DV Lottery, etc., cada uno con sus propios umbrales). Los controles se agrupan así:

  • Fondo: liso, color correcto, sin sombras, sin objetos.
  • Geometría facial: tamaño de la cabeza en el encuadre, posición de la cabeza, altura de los ojos, inclinación, rotación.
  • Expresión: boca cerrada, ojos abiertos, mirada a la cámara, expresión neutra.
  • Iluminación: exposición facial, simetría de iluminación, sin sombras duras.
  • Calidad: nitidez, sin filtros, sin ojos rojos, sin artefactos de compresión.
  • Accesorios: sin gafas (salvo cuando se permitan), sin sombrero, pelo despejado de la cara.
  • Técnico: relación de aspecto correcta, dimensiones en píxeles correctas, tamaño de archivo correcto, formato correcto.

Cada control devuelve pasa, advertencia o falla. El veredicto compuesto es: todos pasan = verde. Cualquier control falla = rojo con el motivo específico. Las advertencias (cercanas a un umbral) no hacen fallar la foto, pero se marcan para que decidas.

Dónde la IA supera a los revisores humanos

Hay cinco categorías en las que el algoritmo es realmente más fiable que un humano:

  1. Mediciones geométricas. Altura de la cabeza en mm, línea de ojos en grados, margen entre la coronilla y el borde en porcentaje. Un humano lo calcula a ojo; el algoritmo lo mide.
  2. Consistencia entre fotos. Un revisor humano que lleva seis horas de turno es más permisivo que en su primera hora. El algoritmo no tiene turnos.
  3. Detección sutil de filtros. Los filtros de belleza que suavizan la piel o afinan la mandíbula son casi invisibles a simple vista, pero el contenido de alta frecuencia cae a niveles detectables.
  4. Análisis del tono de fondo. Una pared que parece blanca pero tiene un tinte cálido por luz incandescente se lee como fuera de especificación para el algoritmo. Un revisor humano probablemente no lo verá bajo la luz fluorescente de su propia oficina.
  5. Cumplimiento de las reglas de formato. Dimensiones en píxeles, tamaño de archivo, profundidad de color, JPEG vs PNG: son controles mecánicos y un algoritmo los ejecuta en milisegundos.

Dónde los humanos superan a la IA

También hay categorías en las que los humanos son mejores, y ser honesto al respecto es importante:

  1. Matices de expresión. “¿Es esto una expresión neutra o una leve sonrisa?” Los puntos de la apertura de la boca miden la separación en píxeles, pero la pregunta de fondo —qué cuenta como “natural y neutra”— es subjetiva. Un revisor humano a menudo tiene la respuesta correcta aquí incluso cuando el algoritmo marca un caso límite.
  2. Caras atípicas. Personas con diferencias faciales, cicatrices, condiciones congénitas o asimetría significativa pueden hacer saltar controles algorítmicos que un humano aceptaría correctamente. El algoritmo, entrenado sobre rostros típicos, a veces malinterpreta los atípicos.
  3. Tocados culturales y religiosos. Si un velo religioso concreto cumple la política del país es una decisión interpretativa. El algoritmo puede medir la visibilidad de frente a barbilla, pero no si el tocado se considera religioso.
  4. Contexto. Un revisor puede ver si una foto ligeramente imperfecta es “lo mejor que se va a poder conseguir” —por ejemplo, para un familiar anciano al que es difícil volver a fotografiar—. El algoritmo solo ve pasa o falla.

Qué significa esto para ti

El resumen honesto: si tu foto pasa el control por IA, tienes una confianza muy alta de que se cumplen las reglas objetivas. Geometría, iluminación, fondo, formato, accesorios: todo medido, todo en verde.

Lo que queda es la pequeña superficie de juicio subjetivo: la línea exacta entre expresión neutra y leve sonrisa, la interpretación de un caso de tocado religioso, si tu cara es “suficientemente reciente” dado un envejecimiento sutil. Esas son las preguntas en las que un revisor humano es realmente mejor.

Así que el flujo de trabajo es:

  1. Hacer la foto.
  2. Pasarla por el editor para superar cada regla objetiva.
  3. Si el editor marca algo subjetivo (expresión límite, recorte límite), tomar una decisión y repetir si puedes.
  4. Enviar.

No dependes de la IA para sustituir la revisión humana. La usas para resolver los fallos consistentes, medibles y automatizables —la mayoría— para que el revisor humano solo tenga que pensar en los casos realmente difíciles.

Prueba el control antes de enviar

Si tienes una foto y quieres ver cómo se ven 22 controles ejecutándose sobre ella, súbela al editor en el navegador. Funciona en tu navegador, tarda unos dos segundos y te dice exactamente qué reglas pasan, cuáles fallan y cuáles están en el límite. Para una lista de cada motivo de rechazo y la solución para cada uno, consulta la guía de las 22 razones. Para las especificaciones específicas de cada país con las que el editor compara, revisa las páginas por país.