Overblog Tous les blogs Top blogs Emploi, Enseignement & Etudes Tous les blogs Emploi, Enseignement & Etudes
Suivre ce blog Administration + Créer mon blog
MENU
Publicité

Projet 2012-2013

Nuage

Publié le 23 Janvier 2013

Nuage

La seconde étape de ce projet consiste à réaliser des nuages de mots grâce à des logiciels spécialisés. En effet, on cherche à savoir quel mot est le plus fréquent dans chaque corpus de chaque langue. Le mot qui a le plus d'occurrences est celui qui a...

Lire la suite
Publicité

Résultat

Publié le 20 Janvier 2013

Résultat

Après avoir réalisé toutes les étapes précédentes le résultat final doit ressembler à l'image ci-dessous. Cependant, il ne faut pas oublier qu'il doit y avoir un tableau comme celui-ci de 50 urls pour chaque langue choisie.

Lire la suite

Problème

Publié le 4 Janvier 2013

Nous nous sommes rendues compte d'un problème lorque nous faisions tourner plusieurs fois le programme. En effet, pour un certains nombre d'urls, l'aspiration de la page ne se fait pas. Nous avons donc voulu comprendre la raison de cet échec et il s'avère...

Lire la suite

Contextes et occurrences

Publié le 4 Janvier 2013

Contextes et occurrences

Enfin, pour terminer notre tableau, nous devions créer deux colonnes la première contenant le mot recherché et ses contextes gauche et droit ; la seconde contenant le nombre d'occurrences dans l'ensemble de la page aspirée en tenant compte de la casse...

Lire la suite

Encodage des pages aspirées

Publié le 4 Janvier 2013

Encodage des pages aspirées

Après avoir aspirer les pages, nous avons du faire une varaible dans laquelle le terminal nous affiche l'encodage de la page aspirée avec la commande "file -i". Si le charset est en utf-8 alors le terminal affiche charset=utf-8. Si le charset est différent,...

Lire la suite
Publicité