Vous êtes sur la page 1sur 42

MASTER GBIM : GENIE BIOMEDICAL INSTRUMENTATION

ET MAINTENANCE

Module de traitement et analyse des images


Rapport du mini projet

La reconnaissance faciale

Demandé par :
Mr.ABDELLAOUI Réalisé par :
DIOUANE Imane
NASSIM Sara
OTMAN Meryem

2019/2020
Table des matières
Table des figures
I. Introduction ................................................................................................................................4
II. Historique : .................................................................................................................................5
III. Domaines d’application : .........................................................................................................5
IV. Problématique :.......................................................................................................................6
V. Méthodes de détection et de reconnaissance des visages ...........................................................7
1. Introduction : ..........................................................................................................................7
2. Détection de visages :..............................................................................................................8
A. Méthodes de détections réparties en catégories : ...............................................................8
a. Approche basée sur la reconnaissance .............................................................................9
b. Approche basée sur les caractéristiques invariantes :.......................................................9
i. La couleur de peau : ................................................................................................... 10
c. Approche basée sur l’appariement de gabarits (Template matching) ............................. 10
i. Des Faces prédéfinies de visages : .............................................................................. 10
d. Approche basée sur l’apparence : .................................................................................. 11
i. Réseaux de neurone :................................................................................................. 12
ii. Méthode de Viola-Jones :........................................................................................... 12
3. Prétraitement :...................................................................................................................... 14
A. Normalisation Géométrique : ............................................................................................ 15
B. Normalisation Photométrique : ......................................................................................... 15
a. Égalisation d’histogramme : ........................................................................................... 15
4. Reconnaissance de visages : .................................................................................................. 16
A. Méthodes globales ............................................................................................................ 17
a. Analyse en composantes principales (ACP) :................................................................... 17
b. Analyse Discriminante Linéaire (ADL) : ........................................................................... 17
B. Méthodes locales : ............................................................................................................ 18
a. Méthodes locales basées sur les points d’intérêts : ........................................................ 18
b. Les méthodes locales basées sur l’apparence du visage : ............................................... 19
C. Méthodes hybrides : .......................................................................................................... 21
D. Reconnaissance par Eigenfaces : ........................................................................................ 21
VI. Les bases de données : .......................................................................................................... 27
1. La base XM2VTS : .................................................................................................................. 27

1
2. La base FERET : ...................................................................................................................... 28
3. La base AR : ........................................................................................................................... 29
4. La base CVL : ......................................................................................................................... 30
5. La Base de donnée ORL ......................................................................................................... 30
6. Base Labeled Faces in the Wild (LFW): ................................................................................... 33
VII. Principales difficultés de la reconnaissance de visage : .......................................................... 34
1. Changement d’illumination : ................................................................................................. 35
2. Variation de pose : ................................................................................................................ 35
3. Expressions faciales : ............................................................................................................. 36
4. Présence ou absence des composants structurels :................................................................ 36
5. Occultations partielles : ......................................................................................................... 36
VIII. Performances d’un système de reconnaissances de visage : .................................................. 37
1. Performance d’un système d’identification : ......................................................................... 37
2. Performance d’un système de vérification : ........................................................................... 37
IX. Nouvelle technologie améliorant la reconnaissance faciale :.................................................. 39
1. L’utilisation de la technologie infrarouge : ............................................................................. 39
2. L’utilisation de la technologie 3D : ......................................................................................... 40
3. Avantage de la technologie 3D : ............................................................................................ 40
X. Applications MATLAB : .............................................................................................................. 40

2
Table des figures

Figure 1 :Les biométries couramment utilisées....................................................................................4


Figure 2 : Principe de fonctionnement de base d’un système de reconnaissance faciale......................8
Figure 3 : Exemple de détection de visage. ..........................................................................................9
Figure 4:La détection de la couleur de peau. ..................................................................................... 10
Figure 5: Processus de la mise en correspondance ........................................................................... 11
Figure 6: diagramme de la méthode de Rowley................................................................................. 12
Figure 7: Les descripteurs de Haar..................................................................................................... 13
Figure 8: Cascade de classifieurs ....................................................................................................... 14
Figure 9:Histogramme de l’image avant et après égalisation ............................................................. 16
Figure 10: Quand les visages ne sont pas vus dans leur état naturel, la capacité du système visuel
humain à les distinguer est dégradée. ............................................................................................... 16
Figure 11: EBGM ............................................................................................................................. 19
Figure 12: Comparaison des propriétés des caractéristiques locales et des caractéristiques globales.
......................................................................................................................................................... 20
Figure 13: Visage moyen .................................................................................................................. 23
Figure 14: Quelques faces propres .................................................................................................... 25
Figure 15 : Exemples d’images de la base XM2VTS ............................................................................ 28
Figure 16 : Extrait de la base Color FERET : Les images sont transformées en niveau de gris. ............. 29
Figure 17 : Extrait de la base AR. Ensembles des vues collectées pour un individu de la base. ........... 29
Figure 18 : Images faciales extraites de la base CVL. .......................................................................... 30
Figure 19 : Base de données ORL ...................................................................................................... 31
Figure 20: Exemple de changements d’orientations du visage ........................................................... 31
Figure 21 : Exemple de changements d’éclairage .............................................................................. 31
Figure 22: Exemple de changements d’échelle .................................................................................. 32
Figure 23: Exemple de changements des expressions faciales ........................................................... 32
Figure 24 : Exemple de port de lunettes ............................................................................................ 32
Figure 25 : Exemple de changements de coiffure et de port de barbe ............................................... 33
Figure 26 : Exemple d’individus de différents ages races et sexes ...................................................... 33
Figure 27: Paires de la base LFW aligned ........................................................................................... 34
Figure 28 : Exemple de variation d’éclairage. .................................................................................... 35
Figure 29: Exemples de variation de poses. ....................................................................................... 36
Figure 30 : Exemples de variation d’expressions. ............................................................................... 36
Figure 31 : Exemples de variation d’expressions. ............................................................................... 38
Figure 32 : La courbe ROC. ................................................................................................................ 39

3
Introduction

Identifier une personne à partir de son visage est une tâche aisée pour les humains. En
est-il de même pour une machine ? Ceci définit la problématique de la reconnaissance
automatique de visages, qui a engendré un grand nombre de travaux de recherche au cours des
dernières années. Le visage peut être considéré comme une donnée biométrique. Une donnée
biométrique est une donnée qui permet l’identification d’une personne sur la base de ce qu’il
est (caractéristiques physiologiques ou comportementales). Les indices biométriques
physiologiques sont des traits biologiques/chimiques innés, alors que les indices biométriques
comportementaux sont associés à des comportements appris ou acquis. Le tableau ci-dessous
fournit une liste des indices biométriques couramment utilisés. Les données biométriques sont
devenues des données incontournables pour le problème de l’identification sécurisée et de la
vérification de personnes. Les méthodes d’identification ou de vérification d’identité basées
sur une donnée biométrique offrent certains avantages par rapport aux méthodes basées sur un
mot de passe ou un code PIN. Premièrement, les données biométriques sont des données
individuelles, alors que les mots de passe peuvent être utilisés ou volés par quelqu’un d’autre
que l’utilisateur autorisé. Deuxièmement, une donnée biométrique est très pratique car il n’y a
rien à porter ou à mémoriser. Troisièmement, les technologies biométriques deviennent de
plus en plus précises avec un coût en constante diminution. Parmi les éléments biométriques
figurant dans le tableau ci-dessous, seules les données visage et parole appartiennent à la fois
aux deux catégories physiologique et comportementale. Cela veut dire entre autres que la
biométrie faciale nous permet d’exploiter de nombreuses informations relatives à une
personne. Dans la vie quotidienne, le visage est probablement le trait biométrique le plus
utilisé par les humains afin de reconnaitre les autres, le visage a de grands avantages par
rapport aux autres biométries, parce qu’il est naturel, et facile à acquérir.

Figure 1 :Les biométries couramment utilisées.

4
Historique :

La reconnaissance faciale automatique est un concept relativement nouveau. Le premier


système semi-automatisé de la reconnaissance faciale a été développé dans les années 1960, il
nécessite à l’administrateur de localiser les yeux, les oreilles, le nez et la bouche sur la photo
et de saisir les distances calculées et les ratios à un point de référence commun, qui ont
ensuite été comparés aux données de référence. Dans les années 1970, Goldstein, Harmon et
Lesk ont utilisé 21 marqueurs spécifique tels que la couleur des cheveux et l’épaisseur de la
lèvre pour automatiser la reconnaissance. Le problème avec ces deux premières solutions,
c’est que les mesures et les emplacements ont été calculés manuellement. En 1988, Kirby et
Sirovich ont appliqué l’analyse en composantes principales (ACP), une technique standard de
l’algèbre linéaire. Cela a été considéré en quelque sorte comme une étape importante car elle
a montré qu’au moins une centaine de valeurs ont été nécessaires pour coder convenablement
et avec pécision une image alignée et normalisée. En 1991, Turk et Pentland ont découvert
que lorsque vous utilisez la technique Eigenfaces (ACP), l’erreur résiduelle peut être utilisée
pour détecter un visage dans une image, une découverte qui a permis la reconnaissance faciale
automatique en temps réel. Bien que l’approche fût quelque peu limitée par des facteurs
environnementaux, elle a néanmoins créé un intérêt significatif pour promouvoir le
développement des technologies de la reconnaissance faciale automatique. Cette technologie a
été mise en essai en janvier 2001 lors de la finale du championnat de football américain
SUPER BOWL en capturant des images de surveillance puis comparées à une base de
données numérique. Aujourd’hui la reconnaissance faciale est utilisée dans plusieurs
domaines.

Domaines d’application :

La sécurité reste le domaine d’application principal. Dans ce domaine, la reconnaissance des visages
est nécessaire à l’identification et à l’authentification. Un bon exemple de cet usage est l’aéroport de
Francfort (Allemagne) où on utilise la reconnaissance pour automatiser le contrôle des passagers.
L’analyse des vidéos capturées par les systèmes de caméras externes gérés par les grandes villes est un
autre exemple, un suspect peut être identifié. Les agences de publicité sont en train de développer des

5
panneaux d’affichage intelligents, qui grâce à la reconnaissance du visage des personnes qui passent
adaptent le contenu affiché. Google et Facebook ont implémenté des algorithmes pour identifier les
personnes dans leurs bases de données de photos. En octobre 2013, Facebook a abandonné la
reconnaissance faciale en Europe suite aux critiques visant cette technologie. Il est interdit de détecter
les visages des gens sur les photos, cela met en péril leur vie privée. Aux États-Unis, cette technologie
continue à se développer, elle est même utilisée par les agences gouvernementales (FBI) ou par des
entreprises privées. Au Brésil, la police se prépare à la coupe du monde de football de 2014 à sa façon
: elle utilisera des lunettes équipées d’une caméra capable de filmer 400 images par seconde et les
comparer avec une base de données numérique de 13 millions de photos. La nouveauté dans la
reconnaissance faciale arrive grâce au développement des nouvelles caméras de type 3D. Ces caméras
obtiennent de meilleurs résultats que les caméras classiques, parce qu’elles acquièrent une image
tridimensionnelle de chaque visage.

Problématique :

Le problème de la reconnaissance de visages peut être formulé comme suit : étant données
une ou plusieurs images d’un visage, la tâche est de trouver ou de vérifier l’identité d’une
personne par comparaison de son visage à l’ensemble des images de visage stockées dans une
base de données. En général, un système de biométrie faciale est constitué de deux modules :
un module de segmentation de visages (détection ou localisation de visage), et un module de
reconnaissance qui se déroule en trois étapes : normalisation ou prétraitement, extraction de
caractéristiques faciales, classification

6
Méthodes de détection et de reconnaissance des visages

1. Introduction :

La reconnaissance faciale est une tâche que les humains effectuent naturellement et
sans effort dans leurs vies quotidiennes. La grande disponibilité d’ordinateurs puissants et peu
onéreux ainsi que des systèmes informatiques embarqués ont suscité un énorme intérêt dans le
traitement automatique des images et des vidéos numériques au sein de nombreuses
applications, incluant l’identification biométrique, la surveillance, l’interaction homme
machine et la gestion de données multimédia. La reconnaissance faciale, en tant qu’une des
technologies biométriques de base, a pris une part de plus en plus importante dans le domaine
de la recherche, ceci étant dû aux avances rapides dans des technologies telles que les
appareils photo numériques, Internet et les dispositifs mobiles, le tout associé à des besoins en
sécurité sans cesse en augmentation.
La reconnaissance faciale possède plusieurs avantages sur les autres technologies
biométriques : elle est naturelle, non intrusive et facile à utiliser. Parmi les six attributs
biométriques considérés, les caractéristiques faciales marquent un score de compatibilité le
plus élevé dans un système MRTD (“Machine Readable Travel Documents”), ce score étant
basé sur plusieurs facteurs d’évaluation tels que l’enrôlement, le renouvellement des
données, les requis matériels et la perception des utilisateurs.

Idéalement, un système de reconnaissance faciale doit pouvoir identifier des visages


présents dans une image ou une vidéo de manière automatique. Le système peut opérer dans
les deux modes suivants : authentification ou identification ; on peut également noter qu’il
existe un autre type de scénario de reconnaissance faciale mettant en jeu une vérification sur
une liste de surveillance, où un individu est comparé à une liste restreinte de suspects. Le
principe de fonctionnement de base d’un système de reconnaissance faciale peut être résumé
en trois étapes.

7
Figure 2 : Principe de fonctionnement de base d’un système de reconnaissance faciale.

2. Détection de visages :

La détection de visage dans l’image est un traitement indispensable et crucial avant la phase de
reconnaissance. En effet, le processus de reconnaissance de visages ne pourra jamais devenir
intégralement automatique s’il n’a pas été précédé par une étape de détection efficace. Le
traitement consiste à rechercher dans une image la position des visages et de les extraire sous la
forme d’un ensemble d’imagettes dans le but de faciliter leur traitement ultérieur. Un visage est
considéré correctement détecté si la taille d’imagette extraite ne dépasse pas 20% de la taille réelle
de la région faciale, et qu’elle contient essentiellement les yeux, le nez et la bouche. L’intérêt de la
localisation faciale va au-delà de l’application de ce présent mémoire. Quelques appareils photos
numériques récents emploient la détection de visages pour la mise au point automatique. Elle est
également recherchée dans le domaine des économies d’énergie ; les télévisions et les ordinateurs
peuvent économiser l’énergie en réduisant l’éclat. Le système peut identifier la direction de visage de
l’utilisateur de TV. Quand l’utilisateur ne regarde pas l’écran, l’éclat de TV est abaissé, et quand le
visage revient à l’écran, l’éclat est augmenté. Les premières difficultés rencontrées par les méthodes
de détections de visages sont les variations de pose (vue de profil ou de face), d’expression, de
rotation du visage, d’âge et d’illumination. Ce dernier type de difficulté pouvant être surmonté par
un prétraitement de normalisation et de compensation de l’illumination.

A. Méthodes de détections :

Une classification des méthodes de localisation faciale a été proposée par Yang. Les méthodes
sont divisées en quatre catégories. Ces catégories peuvent se chevaucher si un algorithme peut
appartenir à deux ou plusieurs catégories. Cette classification peut être faîte comme suit :

8
Figure 3 : Exemple de détection de visage.

a. Approche basée sur la reconnaissance

C’est une méthode fondée sur des règles qui représentent les composants principaux et
représentatifs des visages humains. Les règles sont généralement constituées à partir de la
relation entre les caractéristiques du visage. Par exemple, les visages sur les images ont
souvent deux yeux qui sont symétriques, un nez et une bouche. La relation entre ces membres
peut être représentée par la distance entre ces derniers et leur position.
Un problème se pose avec cette approche, en l’occurrence la difficulté de traduire les
connaissances relatives aux visages humains en règles bien définies, ce qui peut provoquer
des erreurs de détection et rendre le système peu fiable.
b. Approche basée sur les caractéristiques invariantes :

Cette famille d’algorithme a pour objectif de trouver les caractéristiques structurelles même si
le visage est dans différentes positions, conditions lumineuses ou angle de vue. Le problème
que rencontre cette approche est que la qualité des images peut être sévèrement diminuée à
cause de l’illumination, le bruit ou l’occlusion.

9
Cependant, Il existe plusieurs propriétés ou caractéristiques invariables du visage dont les
principales sont les suivantes :
i. La couleur de peau :

La couleur de la peau de l’être humain a été utilisée pour la détection des visages et sa
pertinence a été prouvée comme caractéristique spécifique au visage.
Le principe de cette méthode est basé sur l’information couleur pour la discrimination des
pixels de peau ou non-peau. Chaque pixel d’une image couleur est codé dans un espace
couleur (par exemple RGB ou YCrCb, ..).
Cette méthode se résume en trois étapes :
1) Prétraitement de l’image.

2) Choix d’un espace de couleurs.

3) Seuillage et segmentation de la couleur de peau

Figure 4:La détection de la couleur de peau.

Cette méthode est caractérisée par la rapidité de traitement et par la simplicité de la décision.
En effet le principe est simple et limité à la couleur de peau sans aucune considération des effets
d’échelle et de position. Néanmoins, cette méthode affiche des détections des faux positifs et
peut créer des conflits avec l’arrière-plan.

c. Approche basée sur l’appariement de gabarits (Template matching)

La détection de visages entiers ou de parties de visage se fait à travers un apprentissage


d’exemples standards de visages. La corrélation entre les images d’entrées et les exemples
enregistrés est calculée et utilisée pour la décision.
i. Des Faces prédéfinies de visages :

10
Cette technique est utilisée pour classer des objets, elle est très intéressante pour la détection
de visage de par sa facilité d’application.
Le principe de cette méthode basé sur une comparaison effectuée entre une image quelconque
et un modèle prédéfini, dont le but est de calculer la corrélation pour aboutir à une décision
par oui/non. La correspondance est faite pixel par pixel.

Ces méthodes utilisent le même principe que présenté au point précédent mais se basent
sur des modèles appris à partir d’un ensemble d’essai. Ces méthodes présentent l’avantage de
s’exécuter très rapidement mais demandent un long temps d’entraînement. Les méthodes
appartenant à cette catégorie ont montré de bons résultats par rapport aux trois autres types de
méthodes. On peut citer parmi celles-ci, la méthode basée sur les réseaux de neurones de
Rowley, la méthode de Schneiderman et Kanade basée sur un classifieur de Bayes naîf ainsi
que le fameux algorithme de Viola et Jones fonctionnant en temps réel, et ce dernier sera
détaillé ci-dessous.

Figure 5: Processus de la mise en correspondance

Cette méthode a l’avantage d’être simple mais elle est sensiblement influencée par la variation
d’échelle, de pose et de forme.

d. Approche basée sur l’apparence :

Cette approche a pour objectif de déterminer les caractéristiques significatives des


visages et des non visages à partir de techniques d’analyse statistique et d’apprentissage
organisés par le biais de modèles de distribution ou par une fonction discriminante.
La classification visage ou non visage est représentée par une variable aléatoire x (dérivée
d’une image ou d’un vecteur caractéristique).

11
Parmi les méthodes utilisées dans ce contexte nous citons : Les réseaux de neurones, les
machines à vecteur de support SVM, les modèles cachés de Markov HMM, Viola-Jones…

i. Réseaux de neurone :

Les réseaux de neurones sont des outils d’analyse statistique dont l’objectif principal est la
classification. Ils sont utilisés dans plusieurs domaines, et représentent un enjeu très
important. Nous distinguons les réseaux de neurones les plus répandus et les plus simples : les
perceptrons multicouches (PMC). Le réseau de neurone détecte l’existence ou non de visage
au moyen d’une fenêtre bien définie (taille des images d’apprentissage). Celle-ci va balayer
l’image d’entrée traitée d’une manière multi-échelles
Afin de réduire la complexité de calcul, les images d’entrée sont tout d’abord prétraitées.

Figure 6: diagramme de la méthode de Rowley.

Le grand avantage des réseaux de neurones réside dans leur capacité automatique
d’apprentissage ce qui permet d’éviter des règles de calcul complexes. Toutefois, est difficile
d’interpréter le modèle construit, ou de déterminer la cause en cas d’erreur du système.

ii. Méthode de Viola-Jones :

La méthode Viola-Jones consiste à utiliser les descripteurs de Haar qui sont constitués de
deux rectangles adjacents, l’un noir et l’autre blanc. Ces descripteurs sont superposés aux
différentes régions de l’image à la recherche d’une zone de forte corrélation

12
Figure 7: Les descripteurs de Haar.
L’algorithme détermine alors la ressemblance d’une zone de l’image aux descripteurs de Haar
en soustrayant la moyenne des valeurs des pixels contenus dans la région noire à la moyenne
des valeurs des pixels contenus dans la région blanche. La zone est retenue si cette différence
est supérieure à un seuil. Le seuil utilisé est déterminé au cours de l’apprentissage par la
méthode AdaBoost. Il s’agit de la combinaison de plusieurs classificateurs peu performants
(dits faibles), chacun assigné à un poids, pour en créer un beaucoup plus fiable (dit fort). La
réponse de chaque classificateur (la région étudiée appartient au visage ou non) est peu fiable
mais si le procédé est itératif, la réponse se fait de plus en plus précise au fur et à mesure du
processus, d’où le nom de « cascade » de classificateurs.

13
Figure 8: Cascade de classifieurs

Pour bien caractériser le visage, les descripteurs rectangles initiaux choisis par Ada-Boost
sont significatifs et facilement interprétés. Le choix du premier descripteur est basé sur la
propriété que la région des yeux est souvent plus foncée que la région du nez et des joues.
Le deuxième descripteur choisi est basé sur le constat que les yeux sont généralement plus
foncés que le pont du nez.

Les deux premiers descripteurs de Haar sélectionnés dans la méthode Viola-Jones.

En conclusion, nous avons déduit que l’approche de reconnaissance est peu fiable en
raison de la position variable du visage dans une image. Quant à l’approche basée sur les
caractéristiques invariantes, il s’est avéré qu’elle ne répond pas totalement au besoin de
détection de visage en raison de sa dépendance à la qualité d’image. En outre l’approche
d’appariement de gabarit connue par sa qualité de détection rapide, elle a l’inconvénient
d’être limitée par les modèles prédéfinis. Alors que l’approche basée sur l’apparence, quant-à
elle, paraît être la plus fiable car elle utilise des techniques d’analyse statistique et
d’apprentissage automatique en plus de présenter l’avantage de la robustesse par rapport aux
changements de luminosité et d’expression.

3. Prétraitement :

La phase de prétraitement vient après la phase de détection. Elle permet de préparer


l’image du visage de telle sorte qu’elle soit exploitable. On l’appelle aussi phase de
normalisation puisqu’elle ramène à un format prédéfini toutes les images extraites de l’image
brute. Elle consiste généralement en un centrage du visage dans l’image et une élimination
des zones non informatives. Pour garantir la bonne performance du système de
reconnaissance de visages, il est important que toutes les images soient de taille identique, à la
même échelle et au même format concernant les couleurs (par exemple, les images couleur
sont parfois converties en niveaux de gris). Ceci améliore incontestablement le

14
fonctionnement de l’étape d’extraction de signatures et par conséquent la qualité de cette
dernière. La normalisation est constituée de deux processus : géométrique et photométrique.
La normalisation géométrique est nécessaire parce que la taille du visage à l’intérieur de
l’image acquise peut varier en fonction de la distance entre le module d’acquisition et la
personne. L’étape de normalisation photométrique tente d’éliminer ou de réduire les effets de
l’illumination de l’image.

A. Normalisation Géométrique :

En utilisant un algorithme de reconnaissance se basant sur la réduction de l’espace, nous


ne pouvons pas négliger un point très important qui est la normalisation géométrique des
images de visage. Cette normalisation géométrique consiste à extraire la zone du visage de
l’image originale, ensuite une rotation du visage est effectuée afin d’aligner l’axe des yeux
avec l’axe horizontal. Enfin, une réduction proportionnelle à la distance entre les centres des
deux yeux est appliquée. On obtient alors une image de visage dont la distance entre les
centres des yeux est fixe. Les dimensions de l’image du visage sont calculées à partir de la
distance à obtenir entre les centres des deux yeux

B. Normalisation Photométrique :

Dans le domaine de la reconnaissance par le visage, un certain nombre de méthodes de


normalisation de l’illumination ont été présentées. Nous avons opté pour la méthode de
l’égalisation d’histogramme qui a amélioré le taux d’identification de notre système de
reconnaissance.

a. Égalisation d’histogramme :

Le but de l’égalisation est d’harmoniser la répartition des niveaux de gris de l’image.


Elle permet de tendre vers un même nombre de pixels pour chacun des niveaux de
l’histogramme. Cette opération vise à augmenter les nuances dans l’image et donc son
contraste

15
Figure 9:Histogramme de l’image avant et après égalisation

4. Reconnaissance de visages :

La reconnaissance faciale automatique est un challenge tel qu’il a suscité de nombreuses


recherches dans des disciplines différentes : psychologie, neurologie, mathématiques,
physique et informatique (reconnaissance des formes, réseaux de neurones, vision par
ordinateur). C’est la raison pour laquelle la littérature sur la reconnaissance de visages est
vaste et diversifiée. Les neurologistes étudient depuis longtemps le mécanisme par lequel le
cerveau reconnaît les visages, et beaucoup croient que le cerveau perçoit les visages d’une
manière spécifique et très différente des autres objets visuels. Par exemple, les études ont
constaté qu’une rotation d’image faciale de 180◦ dégrade la reconnaissance beaucoup plus
qu’une même rotation pour des objets quelconques. Dans un travail innovant, Moscovitch a
démontré que le cerveau des hommes traite les visages et les objets dans des aires séparées à
savoir que les visages sont traités dans une aire spéciale. Cette approche a fait office de
référence pendant la dernière décennie jusqu’au travail récent de Jiang qui montre que le
traitement des visages et des objets ne repose finalement pas sur des mécanismes différents.

Figure 10: Quand les visages ne sont pas vus dans leur état naturel, la capacité du système
visuel humain à les distinguer est dégradée.

Les systèmes de reconnaissance de visages sont très souvent classés à partir des conclusions
d’études psychologiques sur la façon dont les hommes utilisent les caractéristiques faciales

16
pour reconnaitre les autres. De ce point de vue, on distingue les trois catégories : les méthodes
globales, les méthodes locales et les méthodes hybrides.

A. Méthodes globales

Le principe de ces méthodes est de représenter une image faciale par un seul vecteur de
grande dimension en concaténant les niveaux de gris de tous les pixels du visage. Cette
représentation, appelée description basée sur l’apparence globale, a deux avantages.
Premièrement, elle conserve implicitement toutes les informations de texture et de forme
utiles pour différentier des visages. Deuxièmement, elle peut tenir compte des aspects
d’organisation structurelle globaux du visage. Toutefois, son inconvénient majeur réside dans
la dimension très grande de l’espace image qu’elle nécessite ce qui rend très difficile la
classification. Pour traiter le problème des données de grande dimension, des techniques de
réduction de la dimensionnalité peuvent être utilisées. L’une des techniques les plus courantes
pour la reconnaissance de visages est la description par visages propres, qui est basée sur
l’analyse en composantes principales (ACP).

a. Analyse en composantes principales (ACP) :

Une méthode très populaire, basée sur la technique ACP, est la méthode Eigenface. Son
principe est le suivant : étant donné un ensemble d’images de visages exemples, il s’agit tout
d’abord de trouver les composantes principales de ces visages. Ceci revient à déterminer les
vecteurs propres de la matrice de covariance formée par l’ensemble des images exemples.
Chaque visage exemple peut alors être décrit par une combinaison linéaire de ces vecteurs
propres. Pour construire la matrice de covariance, chaque image de visage est transformée en
vecteur. Chaque élément du vecteur correspond à l’intensité lumineuse d’un pixel. Cette
méthode sera présentée avec davantage de détails dans le chapitre suivant. L’ACP est une
technique rapide, simple et populaire dans l’identification de modèle, c’est l’une des
meilleures techniques. Les projections de l’ACP sont optimales pour la reconstruction d’une
base de dimension réduite. Cependant, l’ACP n’est pas optimisé pour la séparabilité
(discrimination) de classe. Une alternative qui est l’analyse discriminante linéaire LDA tient
compte de ceci.

b. Analyse Discriminante Linéaire (ADL) :

17
Une autre méthode très connue est celle basée sur l’ADL (Analyse discriminante linéaire).
L’objectif de la plupart des algorithmes basés sur l’ADL, est de trouver les directions de
projection les plus discriminantes dans l’espace propre, en maximisant le ratio entre les
variations inter-personnelles et les variations intra-personnelles. Comme les variations intra-
personnelles peuvent être petites (notablement quand il n’y a pas beaucoup d’images par
individu), ce ratio est dificile à maximiser puisqu’il est déjà grand. Ce problème est encore
appelé Small Sample Size. Pour l’éviter, on peut utiliser tout d’abord l’ACP et ensuite l’ADL,
et cette méthode est appelée Fisherfaces. Voilà pourquoi les méthodes basées sur l’ADL ne
fonctionnent bien que lorsque beaucoup d’images par personne sont disponibles dans la base
d’apprentissage. En revanche, quand il n’y a pas beaucoup d’images par personne, les
méthodes basées sur l’ADL marchent moins bien que celles basées sur l’ACP

Bien que les méthodes globales aient eu beaucoup de succès, leur inconvénient majeur réside
dans le fait qu’elles utilisent uniquement des photos 2D d’apparence faciale. Or, on sait
qu’une telle représentation est sensible aux changements d’expression, d’illumination et de
poses. Une manière d’éviter ce problème consiste à utiliser des représentations faciales
locales. En effet, les caractéristiques locales ne sont généralement pas aussi sensibles aux
changements d’apparence que les caractéristiques globales.

B. Méthodes locales :

Les méthodes locales peuvent être classées en deux catégories, les méthodes basées sur les
points d’intérêt et celles basées sur l’apparence du visage.

a. Méthodes locales basées sur les points d’intérêts :

On détecte tout d’abord les points d’intérêts et ensuite on extrait des caractéristiques
localisées sur ces points d’intérêt. Les méthodes les plus anciennes en reconnaissance de
visages appartiennent à cette catégorie. Elles s’appuient toutes sur l’extraction de
caractéristiques géométriques spécifiques telles que la largeur de la tête, les distances entre les
yeux, ... Ces données sont ensuite utilisées par des classificateurs afin de reconnaître des
individus. Ces méthodes présentent les deux inconvénients suivants :

1. les caractéristiques géométriques sont difficiles à extraire dans certains cas puisque la
tâche de la détection précise de points caractéristiques n’est pas facile, en particulier dans les
cas où des occultations ou des variations (pose, expression) de visages sont présentes.

18
2. les caractéristiques géométriques seules ne sont pas suffisantes pour représenter réellement
un visage, alors que d’autres informations utiles telles que les valeurs des niveaux de gris de
l’image sont complètement écartées.

Ces deux limites ont engendré deux directions de recherche. La première se concentre sur les
performances des détecteurs de points caractéristiques du visage. Brunelli et Poggio ont
proposé d’utiliser un ensemble d’apprentissage pour détecter la position de l’oeil dans une
image. Ils ont tout d’abord calculé pour chaque point des coefficients de corrélation entre
l’image de test et les images de l’ensemble d’apprentissage et ensuite ils ont cherché les
valeurs maximales. Rowley a utilisé plusieurs détecteurs de traits spécifiques correspondant à
chaque partie du visage, tels que les yeux, le nez, la bouche,... Malgré toutes ces recherches, il
n’existe pas encore de détecteur de points caractéristiques qui soit suffisamment précis. Dans
la deuxième direction, les méthodes se concentrent sur des représentations plus élaborées des
informations portées par les points caractéristiques du visage, plutôt que simplement sur des
caractéristiques géométriques. Manjunath a proposé des algorithmes pour détecter et
représenter des caractéristiques faciales à partir d’ondelettes de Gabor. Pour chaque point
détecté, deux types d’information sont stockées : sa position et ses caractéristiques.

Pour modéliser la relation entre les points caractéristiques, un graphe topologique est construit
pour chaque visage. Plus tard, Wiskott a proposé une méthode très connue appelée Elastic
Bunch Graph Matching (EBGM), où les nœuds des graphes sont situés sur un certain nombre
de points sélectionnés du visage De manière similaire à la méthode décrite dans l’étude de
Manjunath Wiskott a utilisé les ondelettes de Gabor pour extraire les caractéristiques des
points détectés car les filtres de Gabor sont robustes aux changements d’illumination, aux
distorsions et aux variations d’échelle.

Figure 11: EBGM

b. Les méthodes locales basées sur l’apparence du visage :

19
Dans les méthodes locales basées sur l’apparence du visage, on divise le visage en petites
régions (ou patches) sur lesquelles les caractéristiques locales sont extraites directement.
Martinez a présenté une approche probabiliste locale pour la reconnaissance de visages qui
sont occultés partiellement et avec des variations d’expression dans le cas où une seule image
de référence est disponible. De nombreux échantillons virtuels sont d’abord générés à l’aide
d’une méthode de perturbation de l’image, puis, chaque visage est divisé en six régions
locales en forme d’ellipse. Ensuite, tous les patches locaux à la même position de chaque
visage sont regroupés séparément dans un sous-espace de visages (donc six sous-espaces au
total). Dans la phase d’identification, les images de test sont également divisées en six zones
locales et sont projetées sur les espaces propres calculés ci-dessus, respectivement. Une
approche probabiliste est utilisée pour mesurer la similarité d’une paire d’images. Des
expériences sur un ensemble de 2600 images montrent que l’approche probabiliste locale ne
réduit pas le taux de reconnaissance même lorsque 1 6 du visage est occulté. Cependant, les
complexités de calcul et de stockage ainsi que la procédure de génération des échantillons
virtuels sont très compliquées (6615 échantillons par individu), en particulier si on a une base
de référence avec de nombreux visages. La variation de pose est l’une des questions les plus
importantes et difficiles en reconnaissance automatique de visages, en particulier dans le cas
où une seule image de référence est disponible. Pour traiter ce problème, Kanade et Yamada
ont proposé une méthode probabiliste qui est similaire à celle de Moghaddam et Pentland

Figure 12: Comparaison des propriétés des caractéristiques locales et des caractéristiques
globales.

Les méthodes mentionnées ci-dessus ne considèrent pas explicitement les relations existantes
entre les caractéristiques locales. Il est concevable que l’utilisation de cette information soit
bénéfique pour le système de reconnaissance. Une solution possible est de construire un

20
modèle flexible de géométrie sur les caractéristiques locales comme cela se fait dans la
méthode EBGM.

C. Méthodes hybrides :

Les méthodes hybrides (ou méthodes de fusion) sont des approches utilisant à la fois des
caractéristiques globales et des caractéristiques locales. Les facteurs clés qui influent les
performances des méthodes de fusion comprennent le choix des caractéristiques pour la
combinaison et la manière de les combiner de telle sorte que leurs avantages soient préservés
et que leurs inconvénients soient évités. Les caractéristiques locales et les caractéristiques
globales ont des propriétés très différentes et peuvent offrir des informations complémentaires
utiles à la tâche de classification. Notons aussi que d’un certain point de vue, les méthodes
locales peuvent être considérées comme des méthodes hybrides car des informations globales
sont généralement prises en compte. Dans la méthode probabiliste locale de nouveaux
échantillons d’apprentissage sont d’abord produits pour chaque personne par méthode
globale, puis une méthode locale est utilisée pour la reconnaissance.

D. Reconnaissance par Eigenfaces :

La méthode de reconnaissance faciale Eigenfaces emploie la technique de l’analyse en


composante principale, qui marque une différence notable avec les méthodes plus classiques,
appelées méthodes locales, qui se basent sur les particularités du visage analysé, et dont les
défauts résident dans son manque de précision, ainsi que sa sensibilité aux informations qui ne
sont pas pertinentes. La méthode que nous avons utilisée est qualifiée de globale, puisque
l’ensemble du visage est alors analysé. Notre technique de reconnaissance va donc utiliser la
méthode d’analyse en composantes principales (également dite ACP). De manière simple,
nous visons la diminution de la dimension de l’espace dans lequel nous allons travailler, et
nous pourrons alors simplifier les données à notre disposition et leur interprétation.
L’algorithme ACP, PCA en anglais (Principal Component Analysis) est né des travaux de
M.A. Turk et A.P. Pentland au MIT Media Lab, en 1991 . Il est aussi connu sous le nom de
Eigenfaces car il utilise des vecteurs propres et des valeurs propres. Cet algorithme s’appuie
sur des propriétés statistiques bien connues et utilise l’algèbre linéaire. Il est relativement
rapide à mettre en œuvre mais il reste sensible aux problèmes d’éclairement, de pose et
d’expression faciale. L’idée principale consiste à exprimer les M images d’apprentissage
selon une base de vecteurs orthogonaux particuliers, contenant des informations

21
indépendantes d’un vecteur à l’autre. Ces nouvelles données sont donc exprimées d’une
manière plus appropriée à la reconnaissance du visage. Nous voulons extraire l’information
caractéristique d’une image de visage, pour l’encoder aussi efficacement que possible afin de
la comparer à une base de données de modèles encodés de manière similaire. En termes
mathématiques, cela revient à trouver les vecteurs propres de la matrice de covariance formée
par les différentes images de notre base d’apprentissage . Nous allons chercher à trouver les
visages propres ; tout d’abord, nous devons prendre un nombre M de visages d’apprentissage.
Chacune de ces images, qui sont en pratique des matrices N × N sont alors transformées en un
unique vecteur colonne de longueur N*N

Matrice N × N initiale :

transformée en :

Nous devons par la suite déterminer le visage moyen, déduit des M visages d’apprentissages

22
Figure 13: Visage moyen

Ce visage moyen va servir dans l’analyse d’images, on soustrait en effet ce visage moyen aux
visages d’apprentissages, ce qui nous laisse alors les informations propres à ce visage, nous
récupérons alors dans Φi uniquement les informations qui sont particulières à ce visage
d’apprentissage.

Où Φi représente le i -ème visage auquel on a soustrait le visage moyen. A présent, nous devons
calculer la matrice de covariance D. Elle correspond à

Avec

Nous devrions calculer les vecteurs propres di de la matrice D. Mais cela représente pour nous
N2 vecteurs propres de dimension N2 chacun. C’est à présent que nous allons réduire
l’information en limitant les composantes avec lesquelles nous travaillerons, en accord avec le
principe de l’analyse en composantes principales. Nous allons donc considérer la matrice

23
dont nous trouverons les vecteurs propres ei . Cette matrice est de taille M × M ce qui nous
simplifiera donc les choses étant donné que nous aurons M vecteurs propres de taille M
chacun. Le passage de la matrice D à la matrice E n’est pas anodin, nous utilisons en effet le
fait que les vecteurs propres de ces deux matrices sont liés de manière assez proche. En effet,
nous avons comme relation,

avec λi la valeur propre associée au vecteur propre ei . En multipliant cette équation par la
matrice Q, il vient

Nous voyons alors apparaître la matrice D

Nous en déduisons donc qu’avec ei vecteur propre de la matrice E associé à la valeur propre
λi , nous avons par conséquent Qei est un vecteur propre de la matrice D associé à la même
valeur propre λi . Ainsi, nous avons di vecteur propre de D, avec

Ce sont les valeurs propres qui leur sont associées qui nous permettent ensuite de classer les
vecteurs propres en fonction de leur capacité à caractériser les variations entre les images.
Lorsque l’on les visualise (ces vecteurs sont à l’origine des matrices de taille N×N), les faces
propres sont ce que l’on pourrait appeler des images aux airs fantomatiques. Mais gardons à
l’esprit que ce sont les vecteurs propres de la matrice de covariance des images
d’apprentissage des visages.

24
Figure 14: Quelques faces propres

Les M vecteurs propres que nous avons alors obtenus nous permettrons donc d’approximer au
mieux les visages d’apprentissage en utilisant les visages propres de plus grande importance.
L’avantage de réduire le nombre de visages propres est d’une part de nécessiter de moins
d’espace mémoire, mais aussi de réduire les calculs, leur temps d’exécution ; cependant nous
perdons sans aucun doute de l’information et donc l’information moins précise, mais les
résultats ne s’en verront pas vraiment modifiés, étant donné que nous ne nous donnons qu’une
mission d’identification. Nous ne cherchons pas à reconstruire le visage du sujet à partir de
nos visages propres, mais seulement à le reconnaître. Parmi les M vecteurs propres trouvés,
nous allons seulement conserver un nombre L, qui seront les plus significatifs. Nous allons
trouver maintenant le poids associé à chacun des visages propres. Les images servant à
l’apprentissage, auquel on a enlevé l’image moyenne, sont en fait combinaison linéaire des
visages propres.

Pour trouver le poids associé, nous faisons pour chacune des coordonnées correspondant à un
visage d’apprentissage

25
Ce qui nous permet d’obtenir pour chacun des M visages d’apprentissages un vecteur πi , où i
représente le i eme visage, et qui nous informe sur le coefficient appliqué à chacun des
visages propres.

Passons à présent au travail à effectuer pour la reconnaissance d’un visage d’un sujet. Une
fois l’image prise, l’image (vecteur colonne Γ) obtenue est soustraite à l’image moyenne Ψ :

Puis nous trouvons les coordonnées de cette image dans l’espace réduit des faces propres

Ce qui nous donne au final :

Il nous faut maintenant interpréter la projection de l’image à analyser pour identifier le sujet.
Pour cela nous allons utiliser une mesure de distance particulière, la distance de Mahalanobis.
L’intérêt de cette distance réside dans le fait qu’elle va accorder un poids moins important aux
composantes bruitées, et qu’elle permet de séparer efficacement les axes pour lesquels
l’information peut être mieux classifiée. Elle est définie par :

avec Q covariance des variables. Nous cherchons donc :

26
Puis, nous comparons la valeur de m trouvée à une valeur seuil ∆, qui aurait dû être
déterminée à partir d’essai sur des images choisies aléatoirement, puis en comparant ces
valeurs aux valeurs obtenues avec des visages d’apprentissage, et déterminer si oui ou non
l’image analysée correspond à un visage présent dans la base de données. Le choix de ce seuil
dépend de trop nombreuses conditions (prise de vue des images, niveau de précision souhaité
pour la reconnaissance, etc...

Les bases de données :

Plusieurs bases de données contenant des informations qui permettent l’évaluation des
systèmes de reconnaissance de visages sont disponibles sur le marché. Toutefois, ces bases de
données sont généralement adaptées aux besoins de quelques algorithmes spécifiques de
reconnaissance, chacune d’elle a été construite avec des conditions d’acquisition d’images de
visages diverse (changements d’illumination, de pose, d’expressions faciales) ainsi que le
nombre de sessions pour chaque individu. Les bases les plus anciennes (ORL et YALE) ont
été le plus utilisées et permettent de comparer plus facilement de nouvelles méthodes à celles
de l’état de l’art. Les plus récentes (Color FERET, FRGC, CVL, AR et IV2 ) contiennent plus
de personnes et sont donc utiles pour des évaluations à plus grande échelle. D’autres bases de
visages sont disponibles et destinées à des évaluations adaptées à certaines variabilités du
visage telles que les bases UMIST, BANCA, PF01, Yale et PIE. Ces trois dernières bases par
exemple (PF01, Yale et PIE) disposent d’un nombre important de poses différentes mais
renferment seulement quelques dizaines de personnes acquises lors d’une seule session. Notre
choix s’est arrêté sur les bases XM2VTS, Color FERET, AR, CVL en plus de la base ORL
pour développer notre corpus de travail. Nous détaillons principalement ces bases d’images
ci-dessous.

1. La base XM2VTS :

La base XM2VTS [38] (The Extended M2VTS Database) est une base de données
multimodale qui renferme des images faciales 2D et 3D,ainsi que des séquences vidéo avec
des enregistrements de la voix. La base de données a été acquise dans le cadre du projet
M2VTS (Multi Modal Verification for Teleservices and Security applications) à l’Université
de Surrey (Royaume-Uni). La base de données contient 295 personnes enregistrées en 4
sessions durant une période de 4 mois. La base de données de visage 2D contient des prises de

27
vue faciales et de profil. Deux prises de vue faciales ont été enregistrées, à chaque session, ce
qui fait un total de 8 images pour chaque personne. La figure ci-dessous illustre un exemple
d’images d’une personne. Les images en colonnes représentent les sessions auxquelles elles
appartiennent.

Figure 15 : Exemples d’images de la base XM2VTS

2. La base FERET :

La base de données FERET a été collectée dans le cadre du programme Facial


Recognition Technology mené par le National Institute of Standards and Technology (NIST)
Américain. Il s’agit de la plus grande base disponible pour les chercheurs qui a été acquise
avec des poses différentes et durant 15 sessions entre 1993 et 1996. Les images, initialement
collectées depuis un appareil photographique de 35mm ont ensuite été digitalisées. Une
première version de cette base de données a été réalisée en 2001 et contient 14051 images
faciales en niveaux de gris avec une résolution de 256 x 384 pixels. La version la plus récente,
réalisée en 2003, renferme des images numériques couleurs de plus grande qualité avec une
résolution de 512 x 768 pixels et une compression sans perte de données à la différence des
premières images en niveaux de gris. En plus, de multiples erreurs de noms d’images,
d’identifiants, et dates de capture, qui figurent sur la première base à niveau de gris ont été
corrigées. Cette dernière base contient 11338 images représentant 994 personnes différentes.
Pour chaque individu, on dispose d’une vue faciale régulière fa et une vue faciale alternative
fb prise un peu après fa. D’autres poses ont été acquises pour la majorité de ces individus
allant du profil gauche au profil droit avec des rotations de 15◦ , 22◦ , 45◦ , 67◦ et 90◦ en
profondeur de la tête. Pour quelques personnes de la base, on dispose d’autres vues duplicate
collectées dans des conditions similaires à fa et fb mais dans des sessions ultérieures. Aucune

28
contrainte n’est imposée sur la date de la prise de vue de l’image duplicate I. par contre, la
vue duplicate II a été collectée au moins 540 jours après la première prise de vue.

Figure 16 : Extrait de la base Color FERET : Les images sont transformées en niveau de gris .

3. La base AR :

La base AR a été constituée en 1998 au sein du laboratoire Computer Vision Center


(CVC) à Barcelone, en Espagne. 116 personnes (63 hommes et 53 femmes) sont enregistrées.
Les images sont en couleur de taille 768 x 576 pixels. 13 vues de chaque sujet ont été
collectées. Pour la majorité de ces personnes, 13 autres vues ont été acquises lors d’une
deuxième session à deux semaines d’intervalle. Un extrait des images collectées lors de la
première session est donné en figure ci-dessous. Ces vues renferment des changements
d’expression faciale, d’éclairage, ainsi que des occultations partielles des yeux (lunettes de
soleil) et de la partie basse du visage (cache-col). Lors de la seconde session, les 13 vues sont
collectées dans les mêmes conditions que pour la première.

Figure 17 : Extrait de la base AR. Ensembles des vues collectées pour un individu de la base.

29
4. La base CVL :

Cette base de données de visage a été créée au Computer Vision Laboratory (CVL) à
l’université de Ljubljana (Slovénie). 114 personnes y sont enregistrées. Les images sont en
couleur de taille 640 x 480 pixels. 7 vues de chaque sujet ont été collectées. Ces vues
renferment différentes poses et expressions prises dans des conditions de luminosité
uniformes. Parmi ces images, trois seulement sont de face. La figure ci-dessous illustre un
exemple d’images de face de la base CVL.

Figure 18 : Images faciales extraites de la base CVL.

5. La Base de données ORL

Conçu par AT&T laboratoires de l’université de Cambridge en Angleterre, la base de


données ORL (Olivetti Research Laboratory) est une base de données de référence pour les
systèmes de reconnaissances automatique des visages. En effet tous les systèmes de
reconnaissances de visages trouvés dans la littérature ont été testés par rapport à l’ORL, cette
popularité est dû aux nombres de contraintes imposer par cette base car la plupart des
changement possibles et prévisibles du visage ont été pris en compte, comme par exemple : le
changement de coiffure, la barbe, les lunettes, les changements dans les expressions faciales,
etc. Ainsi que les conditions d’acquisition telles que : le changement d’illumination et le
changement d’échelle dù à la distance entre le dispositif d’acquisition et l’individu. La base de
données ORL est constituée de 40 individus, chaque individu possède 10 poses, donc la base
contient 400 images. Les poses ont été prises sur des intervalles de temps différents pouvant
aller jusqu’à trois mois. L’extraction des visages à partir des images a été faite manuellement.
Nous présenterons dans ce qui suit les figures montrant les spécificités de la base de données
de référence ORL

30
Figure 19 : Base de données ORL
Voici un exemple ou l’acquisition se fait sous différentes orientations du visage et sous
différents éclairages :

Figure 20: Exemple de changements d’orientations du visage

Voici un exemple ou l’acquisition se fait sous différents éclairages :

Figure 21 : Exemple de changements d’éclairage


Cet exemple montre les changements d’échelle dus à la distance entre le dispositif
d’acquisition et l’individu :

31
Figure 22: Exemple de changements d’échelle
La base de données ORL prend aussi en considération les expressions faciales, telles que les
grimaces. En voici un exemple :

Figure 23: Exemple de changements des expressions faciales

La Base ORL prend en compte le fait qu’un individu peut porter ou ne pas porter des lunettes.
Cet exemple en est l’illustration :

Figure 24 : Exemple de port de lunettes


Un individu peut aussi porter une barbe ou changer de coiffure, la base ORL prend en
considérations ces particularités : La base ORL comprend aussi des individus de différents
ages, sexe et couleurs de peaux :

32
Figure 25 : Exemple de changements de coiffure et de port de barbe

Figure 26 : Exemple d’individus de différents ages races et sexes

6. Base Labeled Faces in the Wild (LFW):

Très récemment, une nouvelle base de visages intéressante nommée Labeled Faces in the
Wild 6 a été présentée. Cette base de données qui contient 13233 images de 5749 personnes
est considérée naturelle car les images ont été collectées directement sur le site d’information

33
Yahoo ! News en utilisant un détecteur automatique de visage. Cette base est plus difficile
pour les chercheurs car aucune contrainte sur les paramètres de prise de vue n’a été imposée
(la base contient donc des variations importantes de pose, d’âge, d’expression, des images de
mauvaise qualité, etc.). Dans le protocole d’évaluation associé à cette base, la question de la
reconnaissance de visages devient une tâche de comparaison de l’identité de deux images
dans une paire : étant donnée une paire d’images faciales, il s’agit de déterminer si elles sont
issues de la même personne ou pas. Grâce aux étiquettes associées aux images originales, une
paire d’images de la base LFW est soit classée dans la catégorie Same, si les deux images
proviennent d’une même personne, soit classée dans la catégorie Diff, si les deux images
proviennent de deux personnes différentes. La figure ci-dessous montre quelques exemples de
paires d’images de cette base. Cette base est disponible sous trois versions : original qui
contient les images détectées sans alignement, funneled qui contient les images alignées
automatiquement par l’algorithme de Huang , aligned qui contient les images alignées
automatiquement par l’algorithme de Wolf

Figure 27: Paires de la base LFW aligned

Principales difficultés de la reconnaissance de visage :

Pour le cerveau humain, le processus de la reconnaissance de visages est une tâche visuelle
de haut niveau. Bien que les êtres humains puissent détecter et identifier des visages dans une
scène sans beaucoup de peine, construire un système automatique qui accomplit de telles
tâches représente un sérieux défi. Ce défi est d’autant plus grand lorsque les conditions
d’acquisition des images sont très variables. Il existe deux types de variations associées aux
images de visages : inter et intra sujet. La variation inter sujet est limitée à cause de la

34
ressemblance physique entre les individus. Par contre la variation intra sujet est plus vaste.
Elle peut être attribuée à plusieurs facteurs que nous analysons ci-dessous

1. Changement d’illumination :

L’apparence d’un visage dans une image varie énormément en fonction de l’illumination
de la scène lors de la prise de vue. Les variations d’éclairage rendent la tâche de
reconnaissance de visage très difficile. En effet, le changement d’apparence d’un visage dû à
l'illumination, se révèle parfois plus critique que la différence physique entre les individus, et
peut entraîner une mauvaise classification des images d'entrée. Ceci a été expérimentalement
observé dans Adini où les auteurs ont utilisé une base de données de 25individus.
L'identification de visage dans un environnement non contrôlé reste donc un domaine de
recherche ouvert. Les évaluations ont révélé que le problème de variation d'illumination
constitue un défi majeur pour la reconnaissance faciale

Figure 28 : Exemple de variation d’éclairage.

2. Variation de pose :

Le taux de reconnaissance de visage baisse considérablement quand des variations de pose


sont présentes dans les images. Cette difficulté a été démontrée par des tests d’évaluation
élaborés sur les bases FERET et FRVT. La variation de pose est considérée comme un
problème majeur pour les systèmes de reconnaissance faciale. Quand le visage est de profil
dans le plan image (orientation < 30°), il peut être normalisé en détectant au moins deux traits
faciaux (passant par les yeux). Cependant, lorsque la rotation est supérieure à 30°, la
normalisation géométrique n'est plus possible

35
Figure 29: Exemples de variation de poses.

3. Expressions faciales :

Un autre facteur qui affecte l’apparence du visage est l’expression faciale. La


déformation du visage qui est due aux expressions faciales est localisée principalement sur la
partie inférieure du visage. L'information faciale se situant dans la partie supérieure du visage
reste quasi invariable. Elle est généralement suffisante pour effectuer une identification.
Toutefois, étant donné que l'expression faciale modifie l'aspect du visage, elle entraîne
forcément une diminution du taux de reconnaissance. L'identification de visage avec
expression faciale est un problème difficile qui est toujours d’actualité et qui reste non résolu.
L'information temporelle fournit une connaissance additionnelle significative qui peut être
utilisée pour résoudre ce problème.

Figure 30 : Exemples de variation d’expressions.

4. Présence ou absence des composants structurels :

La présence des composants structurels telle que la barbe, la moustache, ou bien les
lunettes peut modifier énormément les caractéristiques faciales telles que la forme, la couleur,
ou la taille du visage. De plus, ces composants peuvent cacher les caractéristiques faciales de
base causant ainsi une défaillance du système de reconnaissance. Par exemple, des lunettes
opaques ne permettent pas de bien distinguer la forme et la couleur des yeux, et une
moustache ou une barbe modifie la forme du visage

5. Occultations partielles :

Le visage peut être partiellement masqué par des objets dans la scène, ou par le port
d’accessoire tels que lunettes, écharpe... Dans le contexte de la biométrie, les systèmes

36
proposés doivent être non intrusifs c’est-à-dire qu’on ne doit pas compter sur une coopération
active du sujet. Par conséquent, il est important de savoir reconnaître des visages

partiellement occultés. Gross a étudié l’impact du port de lunettes de soleil, et du cache-nez


occultant la partie inférieure du visage sur la reconnaissance faciale. Ils ont utilisé la base de
données AR . Leurs résultats expérimentaux semblent indiquer que, dans ces conditions, les
performances des algorithmes de reconnaissance restent faibles.

Performances d’un système de reconnaissances de


visage :

Les performances d’un système de reconnaissance dépendent de plusieurs facteurs qui


interviennent à plusieurs niveaux et qui peuvent limiter le degré de précision. Cependant, il
serait judicieux de s’intéresser à ces facteurs avant de mesurer la performance d’un système
de reconnaissance. Nous citons ici les principaux facteurs :
L’environnement au moment de l’acquisition.
Les différentes positions des capteurs.
La qualité des capteurs.
La mauvaise interaction entre l’utilisateur et les capteurs.

1. Performance d’un système d’identification :

Pour évaluer les performances d’un système d’identification, on calcule le taux de


reconnaissance du système. L’erreur commise par ce type de système est d’attribuer à
l’individu présenté une identité autre que la sienne. Les performances de ces systèmes sont
mesurées à l’aide du taux d’identification correcte

2. Performance d’un système de vérification :

Un système de vérification ne peut donner, lors d’une comparaison entre deux


échantillons qu’un résultat sous forme de probabilité de coïncidence ou score (S), ce score est
comparé à un seuil de décision (T) que l’on détermine grâce à de nombreux tests ; Si S est

37
supérieur à T le sujet en question est accepté et dans le cas contraire le sujet est considéré
comme imposteur. Dans ce cas, deux types d’erreurs peuvent être commis :
 Faux Rejets FR (False-Rejection) : correspond au cas où le système rejette un client
légitime.
 Fausse Acceptation FA (False-Acceptance) : correspond au cas où le système
accepte un imposteur.

La fiabilité d’un système de reconnaissance biométrique est caractérisée par deux valeurs

Statistiques :

 Le Taux de Faux Rejets (FRR): il exprime le pourcentage d'utilisateurs légitimes


rejetés.

 Le Taux de Fausses Acceptations (FAR) : il exprime le pourcentage d'imposteurs


acceptés.

Figure 31 : Exemples de variation d’expressions.

On peut représenter graphiquement les performances d‟un système de reconnaissance de


visage à l‟aide de la courbe ROC (Receiver Operating Characteristic). Les FRR sont
donnés en fonction des FAR pour les différentes valeurs du seuil Ө

38
Figure 32 : La courbe ROC.

Il existe d’autres critères statistiques pour mesurer les performances d‟un système
biométrique :

 L’EER (Equal Error Rate ou EER): Il correspond à l’intersection de la courbe


ROC avec la première bissectrice : FAR = FRR
 Le HTER (Half Total Error Rate): Il représente la moyenne de FAR et FRR donc :

 Le TER (Total Error Rate) :représente le taux d’erreur total.

Nouvelle technologie améliorant la reconnaissance


faciale :

1. L’utilisation de la technologie infrarouge :

Les systèmes de reconnaissance de visage infrarouges utilisent des ondes infrarouges pour
mesurer les radiations thermiques émises dans la gamme du spectre infrarouge. Ces systèmes
ne sont pas sensibles à la couleur de la peau, bronzage, usage de produits de beauté, les
lentilles de l’oeil coloré, la chirurgie plastique et les photos peuvent être prises dans

39
l’obscurité. Néanmoins, le coût extrêmement élevé de cette technologie rend son utilisation
prohibitive pour les applications

2. L’utilisation de la technologie 3D :

La quasi-totalité des systèmes de reconnaissance de visages travaillent à partir d’images


fixes. Pour améliorer cette technique, les chercheurs s’orientent vers l’utilisation du modèle
3D du visage, à l’aide de plusieurs caméras, scanners ou caméras spécialisées.
L’objectif est de conserver les avantages de la reconnaissance faciale avec des scores de
fiabilité proches de ceux obtenus en empreintes digitales par exemple

3. Avantage de la technologie 3D :

 Insensibilité à la variation lumineuse


Lorsque la personne se présente de biais, un logiciel ferait « tourner » numériquement le
modèle 3D pour le faire correspondre à l’image 2D prise en conditions réelles. De même,
ce logiciel modifierait les conditions lumineuses de l’image 3D pour les rendre plus
proches de l’éclairage existant.

 Invariance de l’angle

La diversité des paramètres 3D fait que le dispositif d’enregistrement en temps réel est en
mesure de reconnaître des personnes se trouvant dans un champ correspondant à une
rotation de 30° de part et d’autre de son axe.

 Unicité des images 3D


La quantité de points de mesure et de données biométriques saisies est telle qu’elle
permet de distinguer des jumeaux monozygotes.

Applications MATLAB :
(Veuillez SVP voir la simulation)

Conclusion :

La reconnaissance d’individus demeure un problème complexe et non parfaitement résolu,


malgré tous les travaux réalisés au cours des dernières années. Plusieurs problèmes incombent
à cette tâche d’identification et chacun d’eux est non trivial. De nombreuses conditions réelles

40
affectent la performance d’un système, cependant la détection automatique des visages
influence énormément la performance du module d’identification.
Ce mini-projet nous a permis de découvrir plus profondément plusieurs aspects de la
reconnaissance faciale. Il nous a fallu d’abord nous renseigner sur le côté algorithmique de la
reconnaissance de visage, et plus généralement de la vision par ordinateur, qui est un domaine
en pleine expansion et puis élargir nos connaissances avec des applications Matlab.
La reconnaissance des visages fait partie de la biométrie qui est sans doute un domaine
d’avenir. Au cours des prochaines décennies, de plus en plus de systèmes verront
probablement le jour afin de réaliser une surveillance accrue.

Références :

http://dspace.univtlemcen.dz/bitstream/112/4799/1/FaceRec.pdf

1) Mémoire de Master de Identification de reconnaissance faciale avec des expressions


Présentée par : OUAMANE Hanane

2) Projet de fin d’études pour obtenir le diplôme national d’ingénieur en informatique


détection et reconnaissances de visage

3) A.J. Goldstein, L. D. Harmon and A. B. Lesk, Identification of Humman Faces,


Proc.IEEE, May 1971, vol.59, No. 5, 748-760.
4) L. Sirovich and M. Kirby, A Low -Dimensional Procedure for the Characterization of
Human Faces, J. Optical Soc. Am. A, 1987, vol.4, No. 3, 559-524
5) M. A. Turk and A. P. Pentland, Face Recognition using Eigenfaces, Proc. IEEE, 1991,
586-591.
6) National Science and Technology Concil (NSTC). Comittee on Technology. Face
Recongnition. 7 Aout 2006, 10p.
7) Martin Willich, 2nd End-User Group Meeting on 3D Face Recognition, February 2008,
Berlin.
8) S. Rogerson, Smart CCTV. IMIS, February 2002, vol.12, No. 1.
9) Shan Li and David Saino, August 21, 2011. Advertises strait using facial recognition to tailor pitches.
Los Angeles Times

41

Vous aimerez peut-être aussi