Eklablog Tous les blogs
Suivre ce blog Administration + Créer mon blog
MENU

Publicité

Top articles

  • Corpus coréen et allemand, nuages de mots

    15 janvier 2021

    Pour une analyse plus pertinente et sans confusion par les outils de textométrie et le site qui nous a permis de dessiner des "nuages de mots", nous avons modifié quelques formes lexicales, celles qui nous intéressent plus particulièrement pour le projet....

  • Création de corpus

    21 décembre 2020

    Nous sommes parvenus à écrire deux scripts bash, l'un servant à nettoyer nos articles de chevrons inutiles (< et >), et l'autre créant un fichier corpus pour chaque langue, les articles annotés par . Nous avons donc créé deux dossiers...

  • Finalisation du script Bash

    01 décembre 2020

    A la séance de cours du 25 novembre, nous avons reprit le programme pour parvenir à la version finale. Nous nous étions arrêtés au traitement des URLs encodées en UTF-8. Cette fois-ci, nous avons ajouté le traitement de données qui ne sont pas en UTF-8....

  • Séance 3 - Exercice tableau html

    18 octobre 2020

    Cet exercice consiste à compléter un script Bash que nous avons écrit en cours. Ce script écrit un code html comportant un tableau. A partir d'un fichier texte renseigné par l'utilisateur, le programme lit chaque ligne et les copie dans le tableau. Vous...

  • Corpus chinois et français, nuages de mots

    29 décembre 2020

    Avec les codes mises en oeuvres par Kristen, j'ai aussi crée les corpus pour le chinois et le français. Lors du nettoyage, j'ai cependant rencontré un problème: il restait des liens d'images sous la forme [ titredel'image . png ] , [ titredel'image ....

  • Création de corpus - étape 1

    08 décembre 2020

    Nous avons récupéré le contenu textuel de nos URLs, ainsi que le contexte où apparaît le motif que nous cherchons ("Helikopter-Eltern|헬리콥터 부모") et les bigrammes de chaque texte. La prochaine grande partie consiste en l'écriture de fichiers, un par langue,...

  • Séance 2 - Exercices sur le terminal Unix

    18 octobre 2020

    Pour pouvoir mieux intégrer ce que avons appris lors du deuxième cours, nous avons résolut les exercices sur le terminal Unix, que nous pouvons trouver à la page du cours sur iCampus et également en suivant ce lien du site Plurital. Application 1 : Nous...

  • Exercice de la séance 3

    15 octobre 2020

    Exercice: à partir du script fait en cours, y ajouter une colonne supplémentaire au tableau final et y insérer le numéro de la ligne lue. Télécharger le script bash exercice2.sh Le résultat de ce script bash sur amants-utf8.txt: Télécharger « tableau-exo.html...

  • Exercice de la séance 2

    15 octobre 2020

    Pour les manipulations suivantes, on se place dans le répertoire "Projet", dont le chemin absolu est /home/tim/Documents/Projet APPLICATION - Les entrées et les sorties - On crée deux répertoires "TEST1" et "TEST2" avec la commande mkdir et on vérifie...

  • Créer un tableau HTML avec Bash (sites DE et KOR)

    24 novembre 2020

    Une partie de notre projet consiste en la récupération des données sur lesquelles nous allons travailler plus tard. L’objectif de cette étape est d’obtenir un corpus de textes à partir de sites internet que nous avons choisis. Nous avons décidé de nous...

  • Séance 5

    13 novembre 2020

    Durant ce cours, on a mis en place dans notre programme deux choses: 1. un traitement pour tester le bon déroulement de la récupération d'une URL par la commande curl 2. un traitement pour récupérer l'encodage d'une URL Pour cela, on a utilisé des options...

  • Tokenization du chinois

    29 novembre 2020

    Pour tokeniser le chinois, j'ai regardé sur le blog des années passées les propositions des élèves. Il y avait deux solutions majeurs : l'utilisation de jieba ou de stanford segmenter. Sur un blog consulté, un étudiant à tester les deux propositions :...

  • Suite du script Bash

    01 décembre 2020

    L'écriture de la suite du script Bash sur le traitement de nos URLs consiste au repérage du motif, thème de notre projet. Premièrement, nous cherchons a récupérer deux lignes avant le motif, et deux lignes après, quelque soit la casse de l'occurrence....

  • Séance 4

    03 novembre 2020

    L'objectif de la séance: créer un programme qui avec une liste d'URLS, créer un tableau dans une page html. Ce tableau a trois colonnes: numéro de ligne de l'URL, lien de l'URL, ainsi qu'un lien interne vers la page html aspirée. Pour chaque fichier d'urls,...

  • Séance 6

    24 novembre 2020

    Lors de cette séance, nous avons continuer à ajouter des traitements à la suite de ceux existant: On a extrait des contextes réduits au motif (1 ligne avant et 1 ligne après) # 1. construire des morceaux de corpus egrep -C 2 -i "$motif" ./DUMP-TEXT/utf8_"$compteur_tableau-$compteur".txt...

  • Présentation

    16 octobre 2020

    Bonjour et bienvenue sur notre blog, créée pour le cours de M1 TAL "Projet Encadré" ! allcl est le pseudo d'Alexandra LI COMBEAU LONGUET, étudiante à l'INALCO. kristenb est le pseudo de Kristen BERLAND, étudiante à l'INALCO. Le thème de notre projet concerne...