Le codeur probabiliste, réflexions méthodologiques : Sur la validation des données produites par les LLM

Séminaire TETRIS, projet lauréat de l’appel à projet DÉCRIPT 2025.
Plateforme Crystal_Mondes numériques extra-occidentaux
Plateforme Crystal, permettant l'exploration des mondes numériques extra-occidentaux © Geode, Plateforme Crystal‎

Titre : Le codeur probabiliste : Réflexions méthodologiques sur la validation des données produites par les LLM

Invité : Guillaume Sauvé (Université du Québec à Montréal et à l'Université de Montréal)

Présentation de l'invité : Ses recherches se situent à l’intersection de la politique comparée, de la sociologie politique et de l’histoire intellectuelle, avec un intérêt particulier pour la Russie de la fin de l’ère soviétique et de l’après-soviétique. S’appuyant sur des recherches archivistiques et des entretiens, il intègre également des méthodes des sciences sociales computationnelles. 

Discutant : Jérémy Robine (Université Paris 8)

Résumé : Les grands modèles de langage sont de plus en plus utilisés pour coder de grands corpus en sciences sociales. Mais leur caractère probabiliste pose un problème : le même texte et la même requête peuvent produire des réponses différentes. Comment assurer la fiabilité et la validité des résultats ? À partir d’un projet d’analyse semi-automatisée de pétitions dans la presse russe, je propose de considérer le LLM comme un codeur probabiliste accomplissant des tâches interprétatives. Je discuterai des limites d’une validation fondée principalement sur un codage humain de référence et présenterai une approche alternative combinant répétition des codages, mesure de leur stabilité, audits humains ciblés et conservation explicite des cas ambigus. L’enjeu est de traiter l’incertitude du modèle comme une information à analyser, plutôt que comme un simple défaut.

Date, horaires : jeudi 24 septembre, 10h00-12h00

Lieu : Campus Condorcet – Bâtiment recherche Nord (14, cr des Humanités, 93300 Aubervilliers) – Salle 0.009

Lien d'inscription