Eklablog Tous les blogs
Suivre ce blog Administration + Créer mon blog
MENU

Publicité

Corpus coréen et allemand, nuages de mots

Corpus coréen et allemand, nuages de mots

Pour une analyse plus pertinente et sans confusion par les outils de textométrie et le site qui nous a permis de dessiner des "nuages de mots", nous avons modifié quelques formes lexicales, celles qui nous intéressent plus particulièrement pour le projet....

Lire la suite
Publicité

Corpus chinois et français, nuages de mots

Corpus chinois et français, nuages de mots

Avec les codes mises en oeuvres par Kristen, j'ai aussi crée les corpus pour le chinois et le français. Lors du nettoyage, j'ai cependant rencontré un problème: il restait des liens d'images sous la forme [ titredel'image . png ] , [ titredel'image ....

Lire la suite

Création de corpus

Création de corpus

Nous sommes parvenus à écrire deux scripts bash, l'un servant à nettoyer nos articles de chevrons inutiles (< et >), et l'autre créant un fichier corpus pour chaque langue, les articles annotés par . Nous avons donc créé deux dossiers...

Lire la suite

Création de corpus - étape 1

Création de corpus - étape 1

Nous avons récupéré le contenu textuel de nos URLs, ainsi que le contexte où apparaît le motif que nous cherchons ("Helikopter-Eltern|헬리콥터 부모") et les bigrammes de chaque texte. La prochaine grande partie consiste en l'écriture de fichiers, un par langue,...

Lire la suite
Publicité

Suite du script Bash

L'écriture de la suite du script Bash sur le traitement de nos URLs consiste au repérage du motif, thème de notre projet. Premièrement, nous cherchons a récupérer deux lignes avant le motif, et deux lignes après, quelque soit la casse de l'occurrence....

Lire la suite

Finalisation du script Bash

Finalisation du script Bash

A la séance de cours du 25 novembre, nous avons reprit le programme pour parvenir à la version finale. Nous nous étions arrêtés au traitement des URLs encodées en UTF-8. Cette fois-ci, nous avons ajouté le traitement de données qui ne sont pas en UTF-8....

Lire la suite

Tokenization du chinois

Pour tokeniser le chinois, j'ai regardé sur le blog des années passées les propositions des élèves. Il y avait deux solutions majeurs : l'utilisation de jieba ou de stanford segmenter. Sur un blog consulté, un étudiant à tester les deux propositions :...

Lire la suite

Séance 6

Lors de cette séance, nous avons continuer à ajouter des traitements à la suite de ceux existant: On a extrait des contextes réduits au motif (1 ligne avant et 1 ligne après) # 1. construire des morceaux de corpus egrep -C 2 -i "$motif" ./DUMP-TEXT/utf8_"$compteur_tableau-$compteur".txt...

Lire la suite
Publicité

Créer un tableau HTML avec Bash (sites DE et KOR)

Une partie de notre projet consiste en la récupération des données sur lesquelles nous allons travailler plus tard. L’objectif de cette étape est d’obtenir un corpus de textes à partir de sites internet que nous avons choisis. Nous avons décidé de nous...

Lire la suite

Séance 5

Durant ce cours, on a mis en place dans notre programme deux choses: 1. un traitement pour tester le bon déroulement de la récupération d'une URL par la commande curl 2. un traitement pour récupérer l'encodage d'une URL Pour cela, on a utilisé des options...

Lire la suite