Dans cette leçon, nous allons présenter. Un nouvel outil appelé Beautiful Soup. Et ce que fait Beautiful Soup, c'est vous permettre d'interroger sites Web et extraire des données de sites Web. Nous allons commencer par Google.com et si vous regardez notre code, nous sommes va importer des requêtes qui vous permettent de faire directement URL et vos appels vers des URL. Et puis nous allons importer Beautiful. Soupe au format très particulier de BS four, import Beautiful De la soupe, nous y allons. Dirigez BeautifulSoup vers Google.com et ensuite nous allons pour imprimer cette URL. Et ce sera évidemment juste cette chaîne ici. Cet argument d'en-têtes est nécessaire et est spécifique à votre combinaison du système d'exploitation du navigateur. J'utilise Mac et Chrome, etc. C'est celui qui me convient. Si vous exécutez Windows et Chrome, vous. Il faudrait un en-tête différent. Très bien, vous pouvez donc le découvrir simplement en le recherchant sur Google et trouver la chaîne dont vous avez besoin. C'est donc la chaîne pour moi. Nous allons ensuite créer une variable appelée Page. Nous allons utiliser cette simple importation de requêtes que nous avons apportée dedans et nous y sommes. Je vais récupérer cette URL en utilisant ces en-têtes, puis l'imprimer ce qu'il trouve. Alors exécutons ça et nous verrons. Qu'il s'agit simplement d'imprimer Google. Cela nous indique ce que nous allons chercher. Cela pourrait être Yahoo, cela pourrait être n'importe quoi. Et puis réponse 200. Pour ceux d'entre vous qui ne savent pas ce que cela signifie, c'est un site Web disant, copiez ça, j'ai une réponse. Que voudriez-vous savoir? Voici donc le site Web qui répond essentiellement que, oui, salut je suis là. Je suis ici. Merci beaucoup. Très bien, maintenant allons-y et. Introduisez Beautiful Soup dans le mélange. Créer simplement une variable appelée Soup, montrer du doigt. Accédez à la bibliothèque Beautiful Soup et au contenu de notre page de notre récente demande. Nous avons donc la Page, le Google. Page dans cette variable ici, et. Ceci est considéré comme du contenu dans Beautiful Soup. Et nous allons utiliser notre analyseur HTML. Et vous pouvez voir ici tout un tas de choses. Un peu de données car elles sont renvoyées en gros. Toute cette page Web. C'est fondamentalement à quoi ressemble Google dans les coulisses. Et comme vous pouvez le constater, c'est tout à fait vrai. Beaucoup de données. Et ce que fait Beautiful Soup, c'est analyser. C'est maintenant d'une manière qui. Nous pouvons jouer avec, rechercher des choses et en extraire des données. Parce que cela revient essentiellement à Google.com, lequel. Cela nous permet ensuite de l'interroger en regardant. Pour des choses telles que le lien. Et je pense que, comme nous le savons tous, si vous êtes dans le domaine de la technologie depuis un certain temps. Bien qu’il soit considéré comme un lien A. Et la raison est qu'il est désigné par un A. Alors maintenant, nous allons créer une variable appelée liens. Nous allons utiliser Soup pour trouver. Tout ça, ayez le A là-dedans. Et exécutons cela. Maintenant nous attribuons les liens. Maintenant, imprimons-les. Et voici tous les liens qu'il a trouvés et vous pouvez voir que c'est beaucoup moins de données. Ce n'est qu'une seule page. Ils ont tous eu ce A ici. Et ce sont tous des liens. C'est très cool. Très bien, nous pouvons aussi simplement dire. Trouver quelle trouvaille ferait-il pour ça. J'ai trouvé tous les liens. Cela trouverait le premier lien. Allons faire ça. Et voilà notre seul lien, le premier qu'il a trouvé. Et alors, que pouvons-nous faire d’autre ? Alors descendons ici très vite. Et maintenant, remarquez que nous sommes fondamentalement juste. J'ai utilisé cette belle bibliothèque de soupes pour tirer. Tout le contenu de cette page Web géante. Et maintenant nous pouvons en quelque sorte le trancher et le couper en dés et nous pouvons commencer avec juste en faisant référence au titre et nous pouvons l'exécuter et. Découvrez qu'il s'agit de Google avec le G majuscule. Et nous pouvons voir cela, nous comprenons cela, nous savons que c'est vrai. C'est vraiment sympathique. On le pointe vers Yahoo ? Nous allons obtenir une réponse différente. Voyons quel est le titre. Et je pense que cela a aussi du sens parce que. C'est le titre et cela fait référence à cette pièce ici. Nous demandons ceci : quel est ce nom ici ? Quel est le conteneur et son titre. Nous pouvons également courir et découvrir. À quoi la chaîne est associée et c'est Google. Ce seraient aussi des liens comme nous. Découvert un peu plus tôt. Et il va trouver le premier. Et puis voici Soup, trouvez tout ce qui. Je trouverais tous les liens qui vraiment. Nous ramène à notre point de départ la soupe et ce que nous pouvons faire avec la soupe. Alors passons à autre chose et extrayons quelques données dans un python liste. Nous allons commencer ici et juste. Rappelez-vous que nous allons utiliser le. Belle soupe que nous avons apprise dans la première partie de cette leçon. Nous allons pointer vers une nouvelle URL, briefing du gouvernement de la Maison Blanche. chambre. Et il s’agit essentiellement de communiqués de presse de la Maison Blanche. Et ce que nous pouvons faire ici, c'est que nous avons les mêmes en-têtes argument. Très bien, nous devons le faire parce que j'utilise Mac avec Chrome. La page devient alors la combinaison d'accéder à cette URL en utilisant les en-têtes. Adapté à mon environnement, puis nous l'imprimions. Vous vous souviendrez également que nous pouvons créer une soupe en utilisant notre belle bibliothèque de soupes. Et le contenu de cette page et puis nous. Peut faire des choses comme trouver tous les liens. Cela nous rattrape donc. Maintenant, ce qui est différent ici, c'est que nous. Créez une nouvelle liste Python. N'oubliez pas que les listes sont mes choses préférées, mais nous allons créer une liste vierge. URL appelées et une autre liste vide appelée liens. Et ce que nous allons faire, c'est. Nous allons passer en revue tout ce que la soupe trouve. Nous allons chercher un mot-clé, le nom de notre président dans ce cas Biden. Et si nous voyons son nom. Ce lien, alors nous allons l'obtenir. Le texte de ce lien et nous allons obtenir la Href de celui-ci lien et nous allons le mettre dans ces listes. Et puis, ce que cela nous permettrait de faire, c'est essentiellement de interroger un site Web. Et cela pourrait être n’importe quel site Web. Utiliser la Maison Blanche. Nous allons donc les rechercher, puis les exécuter et voir ce que nous récupérons. Dans ce cas, vous le remarquerez ici. J'ai dit d'imprimer les liens et voici donc nos liens. Et puis voici l'URL associée. Et ainsi vous pouvez voir ce que nous avons ici est par exemple le. L'URL réelle de celui-ci est à peu près comme ici. Si nous devions copier ceci et allez le taper dans un nouvel onglet du navigateur, nous pourrons y aller à ce lien. Très bien, c'est donc une belle soupe et une introduction rapide à ce que vous pouvez faire avec Beautiful Soup. Et ensuite, nous allons procéder au scraping de données à l'aide d'une API.