Pour une analyse plus pertinente et sans confusion par les outils de textométrie et le site qui nous a permis de dessiner des "nuages de mots", nous avons modifié quelques formes lexicales, celles qui nous intéressent plus particulièrement pour le projet....
Lire la suite
Avec les codes mises en oeuvres par Kristen, j'ai aussi crée les corpus pour le chinois et le français. Lors du nettoyage, j'ai cependant rencontré un problème: il restait des liens d'images sous la forme [ titredel'image . png ] , [ titredel'image ....
Lire la suite
Nous sommes parvenus à écrire deux scripts bash, l'un servant à nettoyer nos articles de chevrons inutiles (< et >), et l'autre créant un fichier corpus pour chaque langue, les articles annotés par
Nous avons récupéré le contenu textuel de nos URLs, ainsi que le contexte où apparaît le motif que nous cherchons ("Helikopter-Eltern|헬리콥터 부모") et les bigrammes de chaque texte. La prochaine grande partie consiste en l'écriture de fichiers, un par langue,...
Lire la suiteL'écriture de la suite du script Bash sur le traitement de nos URLs consiste au repérage du motif, thème de notre projet. Premièrement, nous cherchons a récupérer deux lignes avant le motif, et deux lignes après, quelque soit la casse de l'occurrence....
Lire la suite
A la séance de cours du 25 novembre, nous avons reprit le programme pour parvenir à la version finale. Nous nous étions arrêtés au traitement des URLs encodées en UTF-8. Cette fois-ci, nous avons ajouté le traitement de données qui ne sont pas en UTF-8....
Lire la suitePour tokeniser le chinois, j'ai regardé sur le blog des années passées les propositions des élèves. Il y avait deux solutions majeurs : l'utilisation de jieba ou de stanford segmenter. Sur un blog consulté, un étudiant à tester les deux propositions :...
Lire la suiteLors de cette séance, nous avons continuer à ajouter des traitements à la suite de ceux existant: On a extrait des contextes réduits au motif (1 ligne avant et 1 ligne après) # 1. construire des morceaux de corpus egrep -C 2 -i "$motif" ./DUMP-TEXT/utf8_"$compteur_tableau-$compteur".txt...
Lire la suiteUne partie de notre projet consiste en la récupération des données sur lesquelles nous allons travailler plus tard. L’objectif de cette étape est d’obtenir un corpus de textes à partir de sites internet que nous avons choisis. Nous avons décidé de nous...
Lire la suiteDurant ce cours, on a mis en place dans notre programme deux choses: 1. un traitement pour tester le bon déroulement de la récupération d'une URL par la commande curl 2. un traitement pour récupérer l'encodage d'une URL Pour cela, on a utilisé des options...
Lire la suite