In dieser Lektion werden wir es vorstellen. Ein neues Tool namens Beautiful Soup. Und Beautiful Soup ermöglicht es Ihnen, zu verhören Websites und extrahieren Daten von Websites. Wir beginnen mit Google.com und wenn Sie sich unseren Code ansehen, sind wir es Ich werde Anfragen importieren, was es Ihnen ermöglicht, einfach direkt vorzugehen URLs und Ihre Aufrufe von URLs. Und dann werden wir Beautiful importieren. Suppe ganz besonderes Format von BS vier, Import schön Suppe, das machen wir. Richten Sie BeautifulSoup auf Google.com und schon geht es los um diese URL auszudrucken. Und das wird hier offensichtlich genau diese Saite sein. Dieses Header-Argument wird benötigt und ist speziell für Sie bestimmt Browser-Betriebssystemkombination. Ich verwende Mac und Chrome und so. Das ist das Richtige für mich. Wenn Sie Windows ausführen und Chrome, du. Würde einen anderen Header benötigen. Also gut, Sie können das einfach herausfinden, indem Sie es googeln und Finden Sie die Saite, die Sie brauchen. Das ist also die Saite für mich. Anschließend erstellen wir eine Variable namens Page. Wir werden diesen einfachen Anfrageimport verwenden, den wir mitgebracht haben rein und wir sind. Ich werde diese URL mithilfe dieser Header abrufen und dann ausdrucken herauszufinden, was es findet. Lassen Sie uns das also ausführen und wir werden sehen. Dass das nur ein Ausdruck von Google ist. Das sagt uns, wonach wir suchen werden. Das könnte Yahoo sein, das könnte alles sein. Und dann Antwort 200. Für diejenigen unter Ihnen, die nicht wissen, was das bedeutet: Das ist ein Website mit der Aufschrift „Kopieren Sie das“, ich habe eine Antwort erhalten. Was würdest du gerne wissen? Das ist also die Website, die im Grunde darauf antwortet, ja, Hallo ich bin hier. Ich bin dort. Vielen Dank. Also gut, jetzt lasst uns weitermachen. Fügen Sie der Mischung Beautiful Soup hinzu. Erstellen Sie einfach eine Variable namens Soup, zeigend. Es geht um die Beautiful Soup-Bibliothek und unseren Seiteninhalt aus unserer letzten Anfrage. Wir haben also die Seite, das Google. Seite in dieser Variablen hier und. Das wird in Beautiful Soup als Inhalt angesehen. Und wir werden unseren HTML-Parser verwenden. Und hier sieht man einiges. Ein paar Daten, weil sie grundsätzlich zurückgegeben werden. Die ganze Webseite. Das ist grundsätzlich so wie Google hinter den Kulissen aussieht. Und wie Sie sehen, ist es ruhig. Viele Daten. Und was Beautiful Soup macht, ist Parsen. Das ist jetzt in gewisser Weise herausgekommen. Wir können damit spielen und nach Dingen suchen und daraus Daten extrahieren. Da dies im Grunde eine Rückkehr zu Google.com ist, welche. Ermöglicht es uns, das dann zu befragen und zu betrachten. Für Dinge wie Link. Und ich denke, wie wir alle wissen, wenn man sich schon eine Weile mit Technik beschäftigt. Es wird zwar als A-Link betrachtet. Und der Grund dafür ist, dass es mit einem A gekennzeichnet ist. Jetzt erstellen wir eine Variable namens Links. Wir werden Soup verwenden, um es zu finden. All das, habe das A drin. Und lassen Sie uns das ausführen. Jetzt Wir weisen die Links zu. Lassen Sie uns diese nun ausdrucken. Und hier sind alle gefundenen Links und Sie können sie sehen deutlich weniger Daten. Es ist nur diese eine Seite. Sie alle haben hier die Eins. Und es sind alles Links. Das ist sehr cool. Alles klar, wir können es auch einfach sagen. Finden Welcher Fund würde so etwas bewirken? Habe alle Links gefunden. Dies würde den ersten Link finden. Lassen Sie uns das ausführen. Und da ist unser einziger Link, der erste, den es gefunden hat. Und was können wir sonst noch tun? Also lasst uns ganz schnell hierher gehen. Und jetzt bemerken Sie, dass wir im Grunde nur. Ich habe diese schöne Suppenbibliothek zum Ziehen verwendet. Der gesamte Inhalt dieser riesigen Webseite. Und jetzt können wir es in Scheiben schneiden und würfeln, und wir können anfangen weg mit einfach Verweisen auf den Titel und wir können das ausführen und. Finden Sie heraus, dass es sich um Google mit dem großen G handelt. Und wir können das sehen, wir verstehen das, wir wissen, dass es so ist WAHR. Das ist wirklich schön. Wir richten es auf Yahoo? Wir werden eine andere Antwort bekommen. Mal sehen, wie der Titel lautet. Und ich denke auch, dass es Sinn macht, weil. Es ist der Titel und bezieht sich auf dieses Stück hier. Wir fragen: „Wie heißt dieser Name hier?“ Was ist der Container dafür und der Titel? Wir können auch rennen und es herausfinden. Welche Zeichenfolge ist damit verknüpft und es handelt sich um Google. Dies wären auch Links wie wir. Etwas früher entdeckt. Und es wird den ersten finden. Und dann gibt's hier noch Suppe, was alles dabei ist. Würde wirklich alle Links finden, die. Das bringt uns wieder zurück zu dem Punkt, wo wir angefangen haben Suppe und was wir mit Suppe machen können. Machen wir also weiter und extrahieren einige Daten in eine Python Liste. Wir fangen hier einfach an. Denken Sie daran, dass wir das verwenden werden. Wunderschöne Suppe, die wir im ersten Teil dieser Lektion gelernt haben. Wir werden auf eine neue URL verweisen: Briefing der Whitehouse-Regierung Zimmer. Und dabei handelt es sich im Wesentlichen um Pressemitteilungen des Weißen Hauses. Und was wir hier tun können, ist, dass wir die gleichen Header haben Streit. Okay, das müssen wir machen, weil ich einen Mac verwende Chrom. Die Seite wird dann zur Kombination aus „Zu dieser URL gelangen“. mithilfe der Header. Passend zu meiner Umgebung und dann würden wir das ausdrucken. Sie werden sich auch erinnern, dass wir mit unserem eine Suppe zubereiten können wunderschöne Suppenbibliothek. Und dieser Seiteninhalt und dann wir. Kann beispielsweise alle Links finden. Das hält uns also auf dem Laufenden. Was hier nun anders ist, ist, dass wir. Erstellen Sie eine neue Python-Liste. Merklisten sind meine Lieblingsbeschäftigungen, aber wir werden es tun Erstellen Sie eine leere Liste. Aufgerufene URLs und eine weitere leere Liste mit dem Namen Links. Und was wir tun werden, ist. Wir werden alles durchgehen, was Suppe findet. Wir werden nach einem Schlüsselwort suchen, dem Namen unseres Präsident in diesem Fall Biden. Und wenn wir seinen Namen darin sehen. Diesen Link bekommen wir dann. Den Text dieses Links und wir werden die Href davon erhalten Link und wir werden ihn in diese Listen aufnehmen. Und was uns das dann im Grunde ermöglichen würde, ist, Folgendes zu tun: eine Website befragen. Und es könnte jede Website sein, die wir sind. Das Weiße Haus nutzen. Also werden wir danach suchen und sie dann ausführen und sehen was wir zurückbekommen. In diesem Fall werden Sie es hier bemerken. Ich habe die Links gedruckt und hier sind unsere Links. Und hier ist dann die zugehörige URL. Und so können Sie sehen, was wir hier haben ist zum Beispiel die. Die tatsächliche URL dafür ist ungefähr so wie dort. Wenn wir das rauskopieren würden und geben Sie es in einen neuen Browser-Tab ein, dann könnten wir loslegen zu diesem Link. Also gut, das ist eine schöne Suppe und eine kurze Einführung was man mit Beautiful Suppe alles machen kann. Und als nächstes beschäftigen wir uns mit dem Daten-Scraping mithilfe einer API.