Pour une analyse plus pertinente et sans confusion par les outils de textométrie et le site qui nous a permis de dessiner des "nuages de mots", nous avons modifié quelques formes lexicales, celles qui nous intéressent plus particulièrement pour le projet....
Nous sommes parvenus à écrire deux scripts bash, l'un servant à nettoyer nos articles de chevrons inutiles (< et >), et l'autre créant un fichier corpus pour chaque langue, les articles annotés par
A la séance de cours du 25 novembre, nous avons reprit le programme pour parvenir à la version finale. Nous nous étions arrêtés au traitement des URLs encodées en UTF-8. Cette fois-ci, nous avons ajouté le traitement de données qui ne sont pas en UTF-8....
Cet exercice consiste à compléter un script Bash que nous avons écrit en cours. Ce script écrit un code html comportant un tableau. A partir d'un fichier texte renseigné par l'utilisateur, le programme lit chaque ligne et les copie dans le tableau. Vous...
Avec les codes mises en oeuvres par Kristen, j'ai aussi crée les corpus pour le chinois et le français. Lors du nettoyage, j'ai cependant rencontré un problème: il restait des liens d'images sous la forme [ titredel'image . png ] , [ titredel'image ....
Nous avons récupéré le contenu textuel de nos URLs, ainsi que le contexte où apparaît le motif que nous cherchons ("Helikopter-Eltern|헬리콥터 부모") et les bigrammes de chaque texte. La prochaine grande partie consiste en l'écriture de fichiers, un par langue,...
Pour pouvoir mieux intégrer ce que avons appris lors du deuxième cours, nous avons résolut les exercices sur le terminal Unix, que nous pouvons trouver à la page du cours sur iCampus et également en suivant ce lien du site Plurital. Application 1 : Nous...
Exercice: à partir du script fait en cours, y ajouter une colonne supplémentaire au tableau final et y insérer le numéro de la ligne lue. Télécharger le script bash exercice2.sh Le résultat de ce script bash sur amants-utf8.txt: Télécharger « tableau-exo.html...
Pour les manipulations suivantes, on se place dans le répertoire "Projet", dont le chemin absolu est /home/tim/Documents/Projet APPLICATION - Les entrées et les sorties - On crée deux répertoires "TEST1" et "TEST2" avec la commande mkdir et on vérifie...
Une partie de notre projet consiste en la récupération des données sur lesquelles nous allons travailler plus tard. L’objectif de cette étape est d’obtenir un corpus de textes à partir de sites internet que nous avons choisis. Nous avons décidé de nous...
Durant ce cours, on a mis en place dans notre programme deux choses: 1. un traitement pour tester le bon déroulement de la récupération d'une URL par la commande curl 2. un traitement pour récupérer l'encodage d'une URL Pour cela, on a utilisé des options...
Pour tokeniser le chinois, j'ai regardé sur le blog des années passées les propositions des élèves. Il y avait deux solutions majeurs : l'utilisation de jieba ou de stanford segmenter. Sur un blog consulté, un étudiant à tester les deux propositions :...
L'écriture de la suite du script Bash sur le traitement de nos URLs consiste au repérage du motif, thème de notre projet. Premièrement, nous cherchons a récupérer deux lignes avant le motif, et deux lignes après, quelque soit la casse de l'occurrence....
L'objectif de la séance: créer un programme qui avec une liste d'URLS, créer un tableau dans une page html. Ce tableau a trois colonnes: numéro de ligne de l'URL, lien de l'URL, ainsi qu'un lien interne vers la page html aspirée. Pour chaque fichier d'urls,...
Lors de cette séance, nous avons continuer à ajouter des traitements à la suite de ceux existant: On a extrait des contextes réduits au motif (1 ligne avant et 1 ligne après) # 1. construire des morceaux de corpus egrep -C 2 -i "$motif" ./DUMP-TEXT/utf8_"$compteur_tableau-$compteur".txt...
Bonjour et bienvenue sur notre blog, créée pour le cours de M1 TAL "Projet Encadré" ! allcl est le pseudo d'Alexandra LI COMBEAU LONGUET, étudiante à l'INALCO. kristenb est le pseudo de Kristen BERLAND, étudiante à l'INALCO. Le thème de notre projet concerne...