Passport Photo AI Passport Photo AI
31 अगस्त 2026 · Passport Photo AI · 9 min

AI आपकी पासपोर्ट फ़ोटो की कैसे जाँच करता है (और मानव समीक्षक चीज़ें क्यों चूकते हैं)

in-browser editor आपकी फ़ोटो के साथ वास्तव में क्या करता है — 478-point face mapping, person segmentation, 22 grouped checks — और AI ऐसी चीज़ें क्यों पकड़ता है जो मानव समीक्षक नहीं पकड़ते।

face-recognition algorithms पर 2019 के NIST अध्ययन ने पाया कि एक ही पासपोर्ट फ़ोटो को grade करने वाले दो मानव समीक्षकों के बीच variance लगभग 11% है — मतलब यदि आप एक ही दिन दो अलग-अलग consulate clerks को एक समान फ़ोटो सबमिट करते, तो लगभग एक-इन-दस chance है कि एक स्वीकार करेगा और दूसरा अस्वीकार। उसी अध्ययन ने पाया कि algorithmic जाँचों ने inter-rater variance को 1% से कम कर दिया।

वह अंतर पूरा कारण है कि सबमिट करने से पहले एक स्वचालित अनुपालन जाँच मौजूद है। एक मानव समीक्षक तेज़ है लेकिन inconsistent है। एक algorithm consistent है लेकिन objective नियमों तक सीमित है। चाल दोनों का उपयोग करना है: algorithm को हर मापन योग्य नियम साफ़ करने दें, और मानव निर्णय को genuinely subjective कॉल के छोटे सेट के लिए reserve करें।

यह पोस्ट समझाती है कि in-browser editor आपकी फ़ोटो के साथ वास्तव में क्या करता है जब आप इसे अपलोड करते हैं — models, measurements, 22 जाँचें — और जहाँ AI genuinely एक मानव समीक्षक से बेहतर है, जहाँ यह बदतर है, और इसका मतलब है कि क्या आप सबमिट करने से पहले “passes” verdict पर भरोसा करना चाहिए।

जब आप एक फ़ोटो अपलोड करते हैं तो क्या होता है

Editor पूरी तरह से आपके browser में चलता है। कुछ भी server पर अपलोड नहीं किया जाता है, जो privacy (आपका चेहरा कभी आपके device को नहीं छोड़ता) और speed (कोई round-trip latency नहीं) दोनों के लिए मायने रखता है। Pipeline में चार stages हैं:

  1. Face detection और landmarking — चेहरे को ढूँढें, उस पर 478 anatomical landmarks पहचानें।
  2. Person segmentation — person को background से pixel level पर अलग करें।
  3. Region statistics — चेहरे, बाल, और background क्षेत्रों में प्रकाश, sharpness, रंग, और geometry मापें।
  4. Rule validation — document के स्पेक के विरुद्ध 22 grouped checks चलाएँ और कारणों के साथ pass/fail लौटाएँ।

प्रत्येक stage एक विशिष्ट model या तकनीक का उपयोग करता है। चलिए उनसे गुज़रते हैं।

Stage 1: 478-point face mapping

Editor Google के MediaPipe Face Landmarker का उपयोग करता है, एक model जो एक मानव चेहरे पर 478 विशिष्ट points पहचानता है — आँखों के corners, होंठों का किनारा, नाक की नोक, jaw line, eyebrow arc, कान की स्थिति, माथे की hairline। 478-point map मापने के लिए पर्याप्त घना है:

  • Eye-line tilt — दो pupil centres के बीच रेखा का horizontal के सापेक्ष कोण। स्पेक 5° के नीचे कहता है; model इसे 0.1° के भीतर मापता है।
  • Head yaw — सिर का left-right rotation, बाएँ और दाएँ कान की दृश्यता के बीच asymmetry और face midline के सापेक्ष नाक की नोक की स्थिति से मापा जाता है।
  • Head pitch — up-down tilt, face oval के भीतर आँखों की vertical स्थिति से मापा जाता है।
  • Mouth openness — ऊपरी और निचले होंठ landmarks के बीच गैप। बंद मुँह 0–3px register करते हैं; दाँतों के साथ मुस्कुराहट 8px+ register करती है।
  • Eye openness — ऊपरी और निचली पलक landmarks के बीच की दूरी। एक threshold के नीचे और आँखें half-closed के रूप में वर्गीकृत होती हैं।
  • Iris centring — आँख खुलने के भीतर iris की स्थिति। केंद्र से 15% से अधिक drift करना एक “looking aside” फ़्लैग ट्रिगर करता है।

एक मानव समीक्षक इन सभी को आँख से देखता है। Algorithm इन्हें pixels में मापता है। यह consistency का लाभ है — algorithm का “अच्छा दिन” या “बुरा दिन” नहीं होता।

478 points का व्यवहार में क्या मतलब है

घना landmarking वह है जो editor को सूक्ष्म चीज़ें पकड़ने देता है जो मानव समीक्षक चूक जाते हैं। दाएँ 6° मुड़ा हुआ सिर मानव आँख को सीधा दिखता है लेकिन एक मापन योग्य nose-to-midline offset और ear-visibility asymmetry पैदा करता है। Algorithm इसे फ़्लैग करता है; मानव इसे पास करता है; बाद में border पर biometric system match करने में विफल होता है। सबमिट करने से पहले इसे पकड़ना बेहतर है।

Stage 2: Person segmentation

Background अनुपालन सबसे आम अस्वीकृति कारण है (22-कारण पोस्ट देखें), इसलिए editor एक समर्पित person-segmentation model का उपयोग करता है — विशेष रूप से एक lightweight U-Net variant जो COCO-person-segmentation dataset पर trained है और portrait framing के लिए adapted है।

Output एक per-pixel mask है: 1 यदि pixel व्यक्ति का है, 0 यदि यह background का है। Mask का उपयोग तीन चीज़ों के लिए किया जाता है:

  • Background analysis — background के रूप में चिह्नित प्रत्येक pixel एकत्र करें और उस पर रंग statistics चलाएँ। Mean RGB, standard deviation, hue distribution। एक वास्तव में सादे सफ़ेद background का बहुत कम standard deviation होता है (प्रत्येक channel पर 5 के नीचे) और लगभग ग्रे hue। एक बनावट वाली दीवार, एक खिड़की का किनारा, या एक छाया उच्च standard deviation के रूप में दिखाई देती है।
  • Background replacement — यदि फ़ोटो background जाँच में विफल होती है, तो mask का उपयोग व्यक्ति को एक साफ़ सफ़ेद या ऑफ़-व्हाइट background पर composite करने के लिए किया जाता है।
  • Shadow detection — background पर डाली गई एक छाया background mask में एक स्थानीयकृत dark क्षेत्र के रूप में दिखाई देती है। Editor सिर के चारों ओर background pixels में brightness की तुलना बाक़ी background से करके इसका पता लगाता है।

Segmentation model अच्छा है लेकिन perfect नहीं — बारीक बालों की strands और soft jaw lines कठिन मामले हैं। Editor “cut-out paper doll” look से बचने के लिए सीमा पर एक alpha-feathered mask का उपयोग करता है जो amateur background-removal उत्पन्न करता है।

Stage 3: Region statistics

एक बार चेहरा landmarked हो जाता है और व्यक्ति segmented हो जाता है, editor विशिष्ट क्षेत्रों में statistics compute करता है:

  • Face brightness: त्वचा pixels का mean luminance। बहुत dark चेहरों (background से बहुत dark चेहरा) या overexposed चेहरों (washed out चेहरा) का पता लगाने के लिए background brightness के विरुद्ध तुलना की जाती है।
  • Lighting symmetry: चेहरे के बाएँ आधे और दाएँ आधे पर brightness का ratio। एक symmetric ratio (1.0 के क़रीब) का मतलब समान lighting है; 1.2 से ऊपर का ratio का मतलब एक मज़बूत side-light चेहरे के एक आधे को shadow कर रहा है।
  • Skin smoothness: गाल और माथे क्षेत्रों में high-frequency texture content। एक प्राकृतिक unedited चेहरे में मापन योग्य texture (pores, micro-shadows) होता है। एक beauty filter से चलाई गई फ़ोटो में अप्राकृतिक रूप से कम high-frequency content होता है — यह वह signal है जिसका filter detector उपयोग करता है।
  • Sharpness: face region में Laplacian variance। एक sharp, in-focus चेहरा एक उच्च मान उत्पन्न करता है; एक blurry वाला (motion blur, out-of-focus, portrait-mode edge blur) एक कम मान उत्पन्न करता है।
  • Eye sharpness विशेष रूप से: अलग से मापी जाती है क्योंकि आँखें sharp होनी चाहिए भले ही अन्य क्षेत्र हल्की softness बर्दाश्त कर सकते हैं।

प्रत्येक statistic एक संख्या है। प्रत्येक संख्या एक नियम पर map होती है। प्रत्येक नियम एक जाँच पर map होता है। यहीं से 22 जाँचें आती हैं।

Stage 4: 22 grouped checks

Editor का अंतिम stage stages 1–3 से measurements लेता है और उन्हें target दस्तावेज़ के स्पेक के विरुद्ध चलाता है (US पासपोर्ट, UK पासपोर्ट, Schengen वीज़ा, DV Lottery, और इसी तरह — प्रत्येक का अपना thresholds है)। जाँचें grouped हैं:

  • Background: सादा, सही रंग, कोई छाया नहीं, कोई वस्तु नहीं।
  • Face geometry: फ़्रेम में सिर का आकार, सिर की स्थिति, आँख की ऊँचाई, सिर का tilt, सिर का turn।
  • Expression: मुँह बंद, आँखें खुली, कैमरे की ओर देखना, तटस्थ अभिव्यक्ति।
  • Lighting: face exposure, lighting symmetry, कोई harsh shadows नहीं।
  • Quality: sharpness, कोई filters नहीं, कोई red-eye नहीं, कोई compression artefacts नहीं।
  • Accessories: कोई चश्मा नहीं (जब तक अनुमति न हो), कोई टोपी नहीं, बाल चेहरे से हटाए हुए।
  • Technical: सही ऐस्पेक्ट रेशियो, सही पिक्सेल आयाम, सही फ़ाइल आकार, सही फ़ॉर्मेट।

प्रत्येक जाँच pass, warning, या fail लौटाती है। Composite verdict है: सभी checks pass = हरा। कोई भी check विफल = विशिष्ट कारण के साथ लाल। चेतावनियाँ (एक threshold के क़रीब) फ़ोटो को विफल नहीं करतीं लेकिन फ़्लैग की जाती हैं ताकि आप decide कर सकें।

जहाँ AI मानव समीक्षकों को मात देता है

पाँच श्रेणियाँ हैं जहाँ algorithm एक मानव से genuinely अधिक विश्वसनीय है:

  1. Geometric measurements. mm में सिर की ऊँचाई, डिग्री में आँख की रेखा, प्रतिशत में crown-to-frame मार्जिन। एक मानव इसे आँख से देखता है; algorithm इसे मापता है।
  2. फ़ोटो में consistency। एक मानव समीक्षक जो छह घंटे से shift पर है, घंटे एक की तुलना में अधिक lenient है। Algorithm में shifts नहीं होती।
  3. सूक्ष्म filter detection। Beauty filters जो त्वचा को smooth करते हैं या jaw lines को पतला करते हैं, casual आँख के लिए लगभग अदृश्य हैं लेकिन high-frequency content detectable स्तर तक गिर जाती है।
  4. Background tone analysis। एक दीवार जो दिखती सफ़ेद है लेकिन वास्तव में incandescent lighting से warm-tinted है, algorithm के लिए off-spec पढ़ी जाती है। एक मानव समीक्षक संभवतः अपनी fluorescent office light के नीचे इसे miss करेगा।
  5. File-format नियमों के साथ अनुपालन। पिक्सेल आयाम, फ़ाइल आकार, रंग गहराई, JPEG बनाम PNG — ये mechanical जाँचें हैं और algorithm उन्हें milliseconds में चलाता है।

जहाँ मानव समीक्षक AI को मात देते हैं

ऐसी श्रेणियाँ भी हैं जहाँ मानव बेहतर हैं, और उनके बारे में ईमानदार होना महत्वपूर्ण है:

  1. Expression nuance. “क्या यह एक तटस्थ अभिव्यक्ति है या एक हल्की मुस्कुराहट?” Mouth-open landmarks pixels में गैप मापते हैं, लेकिन अंतर्निहित प्रश्न — क्या “natural और neutral” के रूप में गिना जाता है — subjective है। एक मानव समीक्षक अक्सर यहाँ सही उत्तर रखता है यहाँ तक कि जब algorithm एक borderline मामला फ़्लैग करता है।
  2. असामान्य चेहरे। चेहरे की भिन्नताओं, scars, congenital conditions, या significant asymmetry वाले लोग algorithmic जाँचों को trip कर सकते हैं जिन्हें एक मानव सही ढंग से स्वीकार करेगा। Algorithm जो विशिष्ट चेहरों पर trained है, कभी-कभी atypical चेहरों को misread करता है।
  3. सांस्कृतिक और धार्मिक headwear। क्या एक विशिष्ट धार्मिक covering देश की नीति को पूरा करता है, यह एक judgment call है। Algorithm forehead-to-chin दृश्यता माप सकता है लेकिन यह नहीं कि क्या covering धार्मिक के रूप में योग्य है।
  4. Context. एक समीक्षक बता सकता है कि क्या एक थोड़ी imperfect फ़ोटो “वह सबसे अच्छी है जो आपको मिलने वाली है” किसी, जैसे, एक बुज़ुर्ग रिश्तेदार के लिए जो आसानी से फिर से नहीं ले सकता। Algorithm बस pass या fail देखता है।

इसका आपके लिए क्या मतलब है

ईमानदार सारांश: यदि आपकी फ़ोटो AI जाँच पास करती है, तो आपके पास बहुत उच्च आत्मविश्वास है कि objective नियम पूरे हुए हैं। Geometry, lighting, background, file format, accessories — सब मापे गए, सब हरे।

जो बचता है वह subjective judgment का छोटा surface area है: एक तटस्थ अभिव्यक्ति और एक हल्की मुस्कुराहट के बीच सटीक रेखा, एक धार्मिक headwear case की व्याख्या, क्या आपका चेहरा सूक्ष्म aging को देखते हुए “recent enough” है। वे प्रश्न हैं जिन पर एक मानव समीक्षक genuinely बेहतर है।

तो workflow है:

  1. फ़ोटो लें।
  2. हर objective नियम साफ़ करने के लिए इसे editor के माध्यम से चलाएँ।
  3. यदि editor कुछ subjective फ़्लैग करता है (borderline expression, borderline crop), एक judgment call करें और यदि आप कर सकते हैं तो फिर से लें।
  4. सबमिट करें।

आप मानव समीक्षा को बदलने के लिए AI पर भरोसा नहीं कर रहे हैं। आप इसका उपयोग consistent, मापन योग्य, automatable failures को साफ़ करने के लिए कर रहे हैं — जो उनमें से अधिकांश हैं — ताकि मानव समीक्षक को केवल genuinely कठिन मामलों के बारे में सोचना पड़े।

सबमिट करने से पहले जाँच आज़माएँ

यदि आपके पास एक फ़ोटो है और आप देखना चाहते हैं कि 22 checks उस पर चलते हुए कैसी दिखती हैं, इसे in-browser editor में डालें। यह आपके browser में चलता है, लगभग दो सेकंड लेता है, और आपको विशेष रूप से बताता है कि कौन से नियम pass होते हैं, कौन से fail होते हैं, और कौन से borderline हैं। प्रत्येक अस्वीकृति कारण और प्रत्येक के लिए fix की सूची के लिए, देखें 22-कारण गाइड। Editor जिनसे match करता है वे देश-विशिष्ट specs के लिए, country pages browse करें।