SCRIPTS
Découvrez des ressources relatives aux scripts, proposées par GARDESO pour soutenir l’analyse et le traitement des données en source ouverte.
Une fois qu’un corpus est prêt pour la modélisation LDA tel que nous l’avons présenté ici, il est important de connaître le nombre optimal de topics à analyser. Pour ce faire, il est possible de calculer le score de cohérence pour différents nombres de topics afin de choisir celui qui convient le mieux. Continue reading
Une fois les données nettoyées (dans le cas de tweets par exemple, retrait de caractères spéciaux, emojis, retours de chariot, tabulations, etc.), la modélisation thématique LDA à l’aide du module Gensim (Python) s’effectue par les 6 étapes suivantes: Continue reading
