Ci-dessous, les différences entre deux révisions de la page.
Les deux révisions précédentes Révision précédente Prochaine révision | Révision précédente Prochaine révision Les deux révisions suivantes | ||
td_histoire_numerique:exercice_4 [2016/01/05 19:32] Francesco Beretta [Exploration du contenu encodé] |
td_histoire_numerique:exercice_4 [2016/01/05 19:46] Francesco Beretta [Exploration avec le logiciel R] |
||
---|---|---|---|
Ligne 52: | Ligne 52: | ||
La méthode d'encodage appliquée est celle présentée dans le [[td_histoire_numerique:exercice_2#principes_d_annotation|deuxième exercice]]. Le document encodé est {{:td_histoire_numerique:liste_notices_bnf_annote_lieux_professions.odt|accessible ici}}. Le codage a été effectué de manière semiautomatique, en partant des formes associées à chaque lemme. De cette manière les variantes ortographiques ont été prises en compte en les associant au même identifiant de la base de données. Afin de compléter le codage, on a également commencé à baliser les enseignements des différentes disciplines, car un peut admettre que "Professeur de mathématiques" est équivalent à "mathématicien". Mais cette demarche demande du temps car les formulations sont très variées et un codage manuel s'avère indispensable. Les mêmes considérations s'appliquent aux lieux de naissance. Ce codage expériemental, présent dans le texte téléchargéable, n'a pas été terminé. | La méthode d'encodage appliquée est celle présentée dans le [[td_histoire_numerique:exercice_2#principes_d_annotation|deuxième exercice]]. Le document encodé est {{:td_histoire_numerique:liste_notices_bnf_annote_lieux_professions.odt|accessible ici}}. Le codage a été effectué de manière semiautomatique, en partant des formes associées à chaque lemme. De cette manière les variantes ortographiques ont été prises en compte en les associant au même identifiant de la base de données. Afin de compléter le codage, on a également commencé à baliser les enseignements des différentes disciplines, car un peut admettre que "Professeur de mathématiques" est équivalent à "mathématicien". Mais cette demarche demande du temps car les formulations sont très variées et un codage manuel s'avère indispensable. Les mêmes considérations s'appliquent aux lieux de naissance. Ce codage expériemental, présent dans le texte téléchargéable, n'a pas été terminé. | ||
===== Exploration du contenu encodé ===== | ===== Exploration du contenu encodé ===== | ||
+ | |||
+ | ==== Transformation vers un texte en format XML ==== | ||
En appliquant la méthode présentée dans le [[td_histoire_numerique:exercice_3#transformation_des_textes_encodes_en_xml|troisième exercice]], nous avons copié le texte encodé qui se trouve dans le document "liste_notices_BNF_annote_lieux_professions.odt" et nous l'avons collé dans l'objet 36 de la base de données, un objet de type "objet digital" intitulé "Notices BNF avec annotation sémantique". Nous avons ensuite exécuté cette transformation: | En appliquant la méthode présentée dans le [[td_histoire_numerique:exercice_3#transformation_des_textes_encodes_en_xml|troisième exercice]], nous avons copié le texte encodé qui se trouve dans le document "liste_notices_BNF_annote_lieux_professions.odt" et nous l'avons collé dans l'objet 36 de la base de données, un objet de type "objet digital" intitulé "Notices BNF avec annotation sémantique". Nous avons ensuite exécuté cette transformation: | ||
Ligne 58: | Ligne 60: | ||
En combinant les requêtes XPath et SQL, on peut désormais explorer les textes encodés. | En combinant les requêtes XPath et SQL, on peut désormais explorer les textes encodés. | ||
- | |||
Avec cette requête, par exemple, on peut chercher tous les concepts encodés, un par personne et année: | Avec cette requête, par exemple, on peut chercher tous les concepts encodés, un par personne et année: | ||
<code sql> | <code sql> | ||
Ligne 87: | Ligne 88: | ||
</code> | </code> | ||
- | Les requêtes SQL peuvent être intégrées directement dans des scripts du logiciel R grâce à la bibliothèque "RPostgreSQL". Dans le projet R ci-joint, on trouvera quelques exemples d'exploration et de visualisation des données. Il faut d'abord ajouter ses propres paramètres de connexion (adresse de la base de données, login et mot de passe) dans le document "connexion_postgresql.R", puis exécuter ce script afin d'ouvrir une connexion avec la base de données qui pourra ensuite être appelée depuis les autres scripts. | + | Les requêtes SQL peuvent être intégrées directement dans les scripts du logiciel R grâce à la librairie "RPostgreSQL". Dans le {{:td_histoire_numerique:r_td2015_distribue.zip|projet R ci-joint}}, on trouvera quelques exemples d'exploration et de visualisation des données. Il faut d'abord ajouter ses propres paramètres de connexion (adresse de la base de données, login et mot de passe) dans le document "connexion_postgresql.R", puis exécuter ce script afin d'ouvrir une connexion avec la base de données qui pourra ensuite être appelée depuis les autres scripts. Il faut aussi installer préalablement toutes les librairies R appelées par les différents scripts du projet. |
+ | |||
+ | |||
+ | ==== Exploration avec le logiciel R ==== | ||
Le script "exploration_notices.R" permet d'afficher un histogramme qui représente les générations de mathématiciens et astronomes avec un pas de 25 ans. | Le script "exploration_notices.R" permet d'afficher un histogramme qui représente les générations de mathématiciens et astronomes avec un pas de 25 ans. | ||
Ligne 97: | Ligne 102: | ||
Enfin, on peut explorer les relations entre professions dans les notices, sous forme de fréquences de cooccurrences, en utilisant une requête SQL/XPath et une visualisation qui utilise des techniques d'analyse de réseaux. | Enfin, on peut explorer les relations entre professions dans les notices, sous forme de fréquences de cooccurrences, en utilisant une requête SQL/XPath et une visualisation qui utilise des techniques d'analyse de réseaux. | ||
{{ :td_histoire_numerique:r_reseau_cooccurrences.jpg?300 |}} | {{ :td_histoire_numerique:r_reseau_cooccurrences.jpg?300 |}} | ||
+ | Ce graphique représente une analyse équivalente à l'analyse des similitudes des notices fondée sur les cooccurrences des lemmes effectuée avec le logiciel Iramuteq. Toutefois, elle est beaucoup plus précise dans la mesure où elle resulte de l'encodage concepts dans les textes, identifiant les entités nommées, et elle dispose donc d'une dimension sémantique résultant de l'analyse du chercheur. | ||