Des recherches menées à l'Institut des sciences mathématiques et informatiques (ICMC) de l'USP ont appliqué des techniques d'apprentissage automatique pour estimer le risque que les femmes subissent des violences physiques, sexuelles et psychologiques sur la base de données publiques mises à disposition par le système de santé unifié (SUS). L'étude a été récompensée lors de la 9e Conférence internationale sur l'apprentissage automatique et l'intelligence artificielle, qui s'est tenue à Tokyo, au Japon, et sera également présentée au 41e Symposium brésilien sur les bases de données.
Développé par la doctorante Rafaela Miglinski Lucca, le projet a été présenté comme le travail final de la discipline Science des données et apprentissage automatique, enseignée par le professeur Roseli Aparecida Francelin Romero, conseiller et co-auteur de la recherche. L'objectif de la discipline est d'approfondir les connaissances sur les techniques de science des données et d'apprentissage automatique et leur application dans la recherche scientifique.
Calculer le risque
L'étude, qui a donné lieu à un article encore en phase de révision par les pairs, est partie de deux questions : quel est le risque qu'une femme soit victime de violence et quelle est la probabilité que ces prédictions se révèlent fausses. Pour répondre à ces questions, les chercheurs ont appliqué des méthodes d’apprentissage automatique et des données sur la violence contre les femmes, cherchant à identifier des modèles et des variables associés à différents types de violence.
« Nous avons appliqué plusieurs modèles d'apprentissage automatique aux données sur la violence contre les femmes, en réfléchissant à trois résultats (violence psychologique, sexuelle et physique), pour essayer de prédire et de trouver des variables qui aideraient à détecter si une femme pourrait subir ou non de la violence », explique Rafaela.
À l’aide des données sur les cas de violence enregistrés dans DataSUS – le Département d’information et informatique du système de santé unifié –, les modèles ont été formés pour identifier des modèles et faire des estimations. « Une fois entraîné, le modèle reçoit un nouveau cas et renvoie une probabilité, du genre 'il y a 78% de probabilité que ce cas implique des violences sexuelles'. Il ne fournit pas de certitude, mais plutôt une estimation basée sur ce qu'il a déjà vu », explique le doctorant.
DataSUS est une plateforme accessible au public qui rassemble des informations sur la santé de la population brésilienne. Parmi les modèles testés, l'un des points forts était la régression logistique, une méthode statistique qui estime la probabilité d'occurrence d'un certain résultat en fonction de différentes caractéristiques. Le modèle attribue des pondérations aux informations, vous permettant d'identifier les variables qui ont le plus influencé les prédictions.
Malgré les bons résultats, Rafaela Miglinski Lucca met toujours en doute la fiabilité des estimations. Dans un deuxième temps, le chercheur a utilisé la méthode de prédiction conforme pour évaluer le degré de confiance dans les prédictions.
« Il s'agit d'un ensemble de méthodes qui fonctionnent comme un test de l'honnêteté de l'algorithme : avant de l'utiliser, il mesure combien de fois il fait des erreurs dans un groupe de données distinct, précisément dans ce but. Avec cette mesure en main, le modèle cesse de donner une seule réponse et commence à dire à quel point il est fiable », explique-t-il. « Dans l'étude, l'ajustement a été fait pour que la bonne réponse soit présente dans 90 % des cas. »
« Sur la base des résultats de ce premier modèle de régression logistique, nous avons continué à mener le processus en appliquant Locart, un modèle de prédiction d'incertitude pour des sous-groupes, pour observer si ces prédictions faites en régression logistique avaient été fiables », poursuit le chercheur.
Rafaela Miglinski Lucca a cartographié, au Brésil, les zones présentant les taux les plus élevés des trois types de violence analysés. Pour les chercheurs, l'étude peut contribuer à la planification de politiques publiques adaptées aux besoins de chaque région. «Par exemple, si le gouvernement fédéral voulait mettre en œuvre ce (le modèle) au sein des commissariats pour savoir s'il doit déjà prévoir une mesure spécifique pour ce type de femme ou si elle entre dans ce type de variable», explique la doctorante.
Le modèle a permis d'analyser les caractéristiques associées aux cas de violence. Parmi les facteurs identifiés figurent un niveau d'éducation inférieur, le manque de réseau de soutien et le fait de vivre dans des zones ayant peu d'accès aux services de santé.
L'âge apparaît également comme une variable importante dans les cas de violence sexuelle, en particulier chez les jeunes femmes et les enfants. Dans les cas de violence psychologique, l'un des aspects observés était la récidive des victimes vers les hôpitaux et les commissariats de police. Selon Rafaela, « ce qui est remarquable dans ce type de violence, c'est qu'elle n'a pas de bonnes conséquences, car si la femme doit à nouveau porter plainte à la police, il y a une récidive, la violence continue à se produire ».
Innovations et prochaines étapes
C'est la première fois que la méthode Locart est appliquée à une base de données de surveillance sanitaire et à une problématique sociale. Proposée en 2024, la méthode permet d'analyser la fiabilité des prévisions dans différents sous-groupes de la population.
« Les méthodes standards de quantification de l'incertitude garantissaient en moyenne une précision de 90%, et elles y sont parvenues. Mais lorsque nous avons regardé par sous-groupe, nous avons découvert un groupe de 18 326 femmes, suite à des violences sexuelles, dans lequel la garantie réelle n'était que de 44,7%. Avec Locart, elle est passée à 88,3% », explique la doctorante.
En pratique, ce résultat montre qu’un modèle peut présenter des indicateurs de fiabilité généraux tout en produisant des prédictions moins fiables pour certains sous-groupes. « Un modèle peut ne pas être fiable exactement pour le groupe le plus vulnérable et personne ne le remarquerait, car la moyenne le cache. Notre argument est que cette vérification par sous-groupe devrait être une étape obligatoire avant qu'un modèle de ce type ne soit utilisé en politique », souligne Rafaela.
L'analyse nous permet également de construire des informations sur le contexte et les lieux associés aux différents types de violence, une étape qui fait partie du processus de modélisation initial. Outre une éventuelle application à grande échelle, les chercheurs poursuivent leurs études sur la nouvelle méthode en partenariat avec d’autres universités.
Lauréat des prix du meilleur article et de la meilleure présentation lors de la Conférence internationale 2026 sur l'apprentissage automatique et l'intelligence artificielle, l'article complet est en attente de publication dans Springer Nature. Au Brésil, la première étape de la recherche a été soumise au 41e Symposium brésilien sur les bases de données et sera présentée en septembre. (Avec informations du Jornal da USP / Photo : Photo : studio cottonbro/Pexels)