Distribution Plots in Python
Ein kostenloses Video-Tutorial von Jose Portilla
Head of Data Science at Pierian Training
86 Kurse
4.654.736 Teilnehmer:innen
Lektionsbeschreibung
Learn about Data Visualization with Seaborn and Python!
Steige mit dem kompletten Kurs tiefer ins Thema ein
Python for Data Science and Machine Learning Bootcamp
Learn how to use NumPy, Pandas, Seaborn , Matplotlib , Plotly , Scikit-Learn , Machine Learning, Tensorflow , and more!
24:46:40 On-Demand-Video • Aktualisiert am Mai 2020
Use Python for Data Science and Machine Learning
Use Spark for Big Data Analysis
Implement Machine Learning Algorithms
Learn to use NumPy for Numerical Data
Learn to use Pandas for Data Analysis
Learn to use Matplotlib for Python Plotting
Learn to use Seaborn for statistical plots
Use Plotly for interactive dynamic visualizations
Use SciKit-Learn for Machine Learning Tasks
K-Means Clustering
Logistic Regression
Linear Regression
Random Forest and Decision Trees
Natural Language Processing and Spam Filters
Neural Networks
Support Vector Machines
Deutsch [autom.]
Hallo allerseits und willkommen zur Vorlesung des Verteilungsplots für Seaborn. In dieser Vorlesung werden wir mit Seaborn verschiedene Plottypen diskutieren, mit denen wir die Verteilung eines Datensatzes visualisieren können. Lassen Sie uns fortfahren und zum Jupiter-Notizbuch springen, um loszulegen. OK hier bin ich am Notebook. Ich möchte mit dem Import auf See beginnen und gemäß der Konvention importieren wir Seaborn als Asinus. Und da ich im Notizbuch bin, werde ich weitermachen und sagen, dass Matt Plot live in der Linie ist, so dass ich Visualisierungen im Notizbuch sehen kann. Gut. Lassen Sie uns nun einige Daten erhalten, die ein Plot auf See tatsächlich mit einigen integrierten Datensätzen enthält, die Sie direkt laden können. Und ich werde mir einen namens Tips schnappen und ihn als Datenrahmen namens Tips speichern. Sie können dies tun, indem Sie einfach sagen, dass Tipps gleich dem Asinus-Ladedatensatz sind, und dann Passagiertipps als Zeichenfolge. Und dies lädt den Tipp-Datensatz und dann kann ich tatsächlich den Kopf des Rahmenzustands überprüfen und es sieht ungefähr so aus. Hier gibt es sieben Spalten, und dies sind im Grunde nur Daten, die sich auf Personen beziehen, die eine Mahlzeit hatten und danach ein Trinkgeld hinterlassen haben. Sie haben also den Gesamtpreis oder die Rechnung der Mahlzeit, wie viel als Trinkgeld das Geschlecht oder Geschlecht der Person übrig hat, die das Trinkgeld verlässt, unabhängig davon, ob sie an dem Tag und zu der Uhrzeit, an dem sie ihre Mahlzeit gegessen haben, Raucher waren oder nicht. Und dann die Größe der Party. Gut. Lassen Sie uns fortfahren und unseren ersten Diagrammtyp diskutieren, bei dem es sich um dieses Diagramm handelt. CISC-Diagramm, mit dem wir die Verteilung eines univariaten Satzes von Beobachtungen zeigen können, und Sie wissen genau, dass es nur eine andere Art ist, nur eine Variable zu sagen. Lassen Sie uns hineingehen und dies erkunden. Ich werde sagen, Asinus hat diesen Plot gedacht und für diesen Plot übergeben Sie einfach eine einzelne Spalte Ihres Datenrahmens. In diesem Fall sehen wir uns an, wie die Gesamtrechnung verteilt wird. Also werde ich Gesamtrechnung sagen und dann die Zelle laufen lassen und du solltest eine Handlung bekommen, die so aussieht. Wenn Sie hier eine Warnung erhalten, machen Sie sich darüber keine Sorgen. Das muss eigentlich tun, wenn ein anderes Paket stat's Modelle heißt. Dies hat keinen Einfluss auf Ihren tatsächlichen Seaborn-Code. Aber hier haben wir keine Warnung, also sind wir in Ordnung. Beachten Sie hier, dass ich im Grunde genommen ein Histogramm bekomme und eine sogenannte Kernel-Dichteschätzung, die hier die Linie ist. Später in diesem Vortrag werden wir diskutieren, was diese Katie ist und wie wir das tatsächlich aufbauen können. Aber jetzt können wir es entfernen, wenn wir wollen, indem wir hier als zusätzliches Argument sagen, dass Katie gleich falsch ist. Und nur durch Eingabe von Katy ist falsch. Jetzt haben Sie im Wesentlichen nur ein Histogramm und ein Histogramm ist im Wesentlichen nur eine Verteilung dessen, wo Ihre Gesamtrechnung liegt. Sie können hier also sehen, dass Sie auf der y-Achse eine Zählung haben und dann diese Balken auf der X-Achse als Bins. Und das bedeutet im Grunde, dass die meisten Ihrer Gesamtrechnungen irgendwo zwischen 10 und 20 US-Dollar liegen. Und wenn Sie ein wenig mehr Informationen dazu erhalten möchten, können Sie die Anzahl der Fächer ändern, damit Sie fortfahren können. Es gibt ein drittes Argument von Sabin und dann hängt die entsprechende Anzahl von Geboten und die Anzahl wirklich von Ihrem Datensatz ab. Aber lassen Sie uns jetzt 30 wählen. Und jetzt können wir eine etwas grundlegendere Definition bekommen und wir können immer noch sehen, dass die meisten Rechnungen zwischen 10 und 20 passieren. Wenn Sie zum Beispiel einen zu hohen Wert wählen, setzen wir 100 ein und Sie erhalten ein seltsames Szenario, in dem Sie im Wesentlichen beginnen, jede einzelne Instanz der Gesamtrechnungen für jeden einzelnen Preispunkt zu zeichnen. Normalerweise möchte ich versuchen, ein Gleichgewicht in der Größe zu finden, aber das hängt wirklich von Ihrer Handlung selbst ab. IN ORDNUNG. Anscheinend haben wir hier eine gute Vorstellung von den Informationen. Und wenn er diese Grafik lesen kann, kann er im Grunde nur sagen, dass die meisten Rechnungen irgendwo zwischen 10 und 20 US-Dollar liegen und allmählich verblassen, wenn Sie höher und höher werden. Rechnungspreis Das ist die Handlung, mit der Sie die Verteilung im Wesentlichen als Histogramm visualisieren und zusätzlich einen Kuchen zum Essen hinzufügen können. Aber wir werden später etwas über die Handlung von Katie erfahren. Lassen Sie uns über das gemeinsame Diagramm und die gemeinsamen Diagramme aus der See sprechen. Ich kann sagen, dass die gemeinsamen Diagramme von Asinus es Ihnen ermöglichen, diese Diagramme grundsätzlich anhand verschiedener Daten abzugleichen, was bedeutet, dass Sie im Wesentlichen zwei verschiedene Verteilungsdiagramme kombinieren können. Und genau genommen sind es nur zwei Variablen. Und wenn Sie eine Art Parameter haben, mit dem wir herumspielen werden, können wir auswählen, wie wir diese beiden Verteilungen tatsächlich vergleichen möchten. Lassen Sie mich hineingehen und Ihnen zeigen, wie wir Essenz als Ausgangspunkt verwenden können. Zuerst haben Sie den Passagier in der x-Variablen und dann müssen Sie eine Y-Variable übergeben und dann müssen Sie Ihren Datensatz übergeben. Beginnen wir am Backend, damit der Passagierdatensatz als Tipps dient. Also diese Art von Datenrahmen und dann für x und y nur pasand Zeichenfolgen, die Spaltennamen sind. Die beiden Dinge, die Sie miteinander vergleichen möchten. Vielleicht möchte ich zum Beispiel die Verteilung der Gesamtrechnung mit der Spitzengröße vergleichen. Lass uns weitermachen und das tun. Ich werde die Gesamtrechnung als meine Ex angeben und auf meinem Weg zu Access werde ich die Trinkgeldspalte eingeben. Im Moment übergebe ich in der Spalte "Gesamtrechnung" nur die Spalte "Trinkgeld" und dann entsprechen die Daten den Trinkgeldern. Ich erhalte ein Diagramm, das so aussieht und im Wesentlichen nur aus zwei Verteilungsdiagrammen besteht. Sie können die Spitze auf der y-Achse und die Gesamtrechnung entlang der x-Achse sehen und dann herauszoomen, damit Sie das gesamte Diagramm sehen können. Und dazwischen habe ich ein Streudiagramm, und dieses Streudiagramm macht im Grunde genommen Sinn, weil es so aussieht, als ob es einen Trend hat, dass Sie mit zunehmender Gesamtrechnung ein höheres Trinkgeld erhalten, und das ist sinnvoll, weil Trinkgelder normalerweise proportional zu Ihrer Gesamtrechnung sind . Jetzt geben Ihnen gemeinsame Diagramme tatsächlich einen zusätzlichen Argumentparameter namens kind's. Mit diesem Parameter können Sie beeinflussen, was tatsächlich in diesem gemeinsamen Diagramm vor sich geht. Im Moment ist es standardmäßig Streuung, aber Sie können auch ein Argument wie hex und hex übergeben, mit dem Sie im Grunde eine hexagonale Verteilungsdarstellung erstellen können. Es ähnelt der Streuung, außer wenn das Sechseck eine bestimmte Anzahl von Punkten enthält, wird es dunkler und wenn es weniger Punkte hat, wird es im Wesentlichen heller. Es ist nur eine Möglichkeit, nicht alle diese Streupunkte anzulegen, sondern stattdessen eine Verteilung mit anzuzeigen diese Sechsecke. Ein weiteres Argument, das wir für die Art vorbringen können, ist z. B. das, was für Regression steht. Und dies wird einem Streudiagramm sehr ähnlich sein, außer dass Seaborn tatsächlich eine Regressionslinie darauf ziehen wird. Jetzt haben wir noch nichts über lineare Regression gelernt, was das Thema maschinelles Lernen betrifft, aber später, wenn wir uns diesem Thema nähern, werden wir darauf zurückkommen und tatsächlich diskutieren, wie diese Linie aufgebaut ist. Aber im Wesentlichen zeigt sich dies fast wie eine lineare Anpassung an die Streupunktdaten, und Sie können tatsächlich sehen, dass sie einen P-Wert in einem Peerson-Koeffizienten haben, den wir später diskutieren werden, wenn wir tatsächlich die lineare Regression diskutieren. Eine andere Art, die Sie hier einfügen können, ist KDE, und das ermöglicht es Ihnen, dies auch zu haben. Ich habe K-T erwähnt, das im Wesentlichen nur die Dichte zeigt, in der diese Punkte am besten übereinstimmen. In Ordnung, lassen Sie uns fortfahren und von der gemeinsamen Handlung fortfahren. In der Regel wird die Handlung mit der Standardstreuung verwendet, da diese im Wesentlichen am einfachsten zu lesen ist und Ihnen auf Anhieb eine Menge Informationen liefert. Wir werden diese Idee erweitern, indem wir Ihnen zeigen, dass Pair Plot und Pair Plot im Wesentlichen paarweise Beziehungen über einen gesamten Datenrahmen darstellen, zumindest für die numerischen Spalten. Außerdem wird ein Farbtonargument für kategoriale Spalten unterstützt, das ich Ihnen später zeigen werde. Aber wir sehen hier oben, dass wir das Diagramm dieses Gelenks haben. Was das Diagramm im Wesentlichen tun wird, ist dieses gemeinsame Diagramm für jede einzelne mögliche Kombination der numerischen Spalten in diesem Datenrahmen. Lass mich dir zeigen, was ich meine. Weil es für alle Kombinationen funktioniert. Grundsätzlich müssen Sie nur S und S Gedanken pro Plot aufrufen und Ihren Datenrahmen übergeben. Und das werden wir während des gesamten Kurses ziemlich viel tun. Denken Sie daran, je größer Ihr Datenrahmen ist, desto länger dauert es pro Plot. Es dauert also oft eine Weile pro Plot, wenn Sie einen sehr großen Datenrahmen anstelle von relativ kleinen Rahmen haben. Also geht es uns gut. Und hier haben wir im Grunde ein Paardiagramm für alle numerischen Spaltenwerte. Wir haben also Größe vs. Gesamtrechnungsgröße versus Trinkgeld. Und wenn Sie dann zu einem Parameter gegen sich selbst kommen, zum Beispiel Größe gegen Größe, anstatt tatsächlich ein Streudiagramm zu erstellen, das, wenn es sinnvoll ist, nur eine gerade Linie hat. Sie sehen stattdessen ein Histogramm. Und das Gleiche gilt für Trinkgeld gegen Trinkgeld. Und für die Gesamtrechnung im Vergleich zur Gesamtrechnung bedeutet dies, dass pro Grundstück eine wirklich gute Möglichkeit ist, Ihre Daten schnell zu visualisieren. Und was noch schöner ist, ist, dass Sie diesem h, das Sie essen, ein Farbtonargument hinzufügen können, und das hewe-Argument ist, wo Sie in der Spalte übergeben würden. Das Ziel einer kategorialen Spalte in kategorialen Kategorien bedeutet nicht numerische oder kontinuierliche, sondern tatsächliche Kategorien. Zum Beispiel ist die Sexspalte kategorisch, weil es zwei Kategorien gibt, nämlich männlich und weiblich. Und wenn Sie dies eingeben, während Sie den Namen der Kolonie gleichgeschlechtlich eingeben, werden die Datenpunkte basierend auf der Spalte, die Sie für den Farbton eingegeben haben, eingefärbt. Hier sind also alle grünen Punkte weiblich, basierend auf dieser Legende und allen männlichen Punkten. Wir werden herauszoomen, damit wir das Ganze sehen können. Alle blauen Punkte sind männlich. Und als drittes Argument können Sie eine Palette angeben, und die Palette ermöglicht es Ihnen, diese tatsächlich mit einer bestimmten Farbpalette einzufärben. Wir werden am Ende der Vorlesungsreihe auf See über Paletten, Farbe und Stil sprechen. Im Moment zeige ich Ihnen nur ein Beispiel. Im Wesentlichen gibt es diese Farbkartenzeichenfolgen, die aus diesem Plot stammen und die Sie in seiner Palette übergeben können, und sie wählen bestimmte Farben für alle Parameter aus. Und hier können wir jetzt sehen, dass die Post blau und die weibliche hellrosa Farbe ist. Gut. Wir werden es auf Paletten in Farben und Stilen viel mehr berühren. Gehen wir weiter zu Roug-Plots, und Rogue-Plots sind eigentlich ein sehr einfaches Konzept, aber wir werden das Konzept eines Rogue-Plots verwenden, um tatsächlich zu bauen. Ich bin. Erklären Sie die K-T-Handlung, die wir zuvor gesehen haben, wo ich weitermachen und S sagen werde. EIN. Roug-Diagramme und genau wie das Verteilungsdiagramm, das Sie hier übergeben möchten, in einer einzelnen Spalte. Wir werden also Tipps geben und die gesamte Rechnungsspalte durchgehen. Die Teppichhandlung ist ein sehr einfaches Konzept. Es zeichnet nur eine Strichmarkierung für jeden Punkt auf dieser einheitlichen oder eindeutigen Variantenverteilung, im Wesentlichen einer einzelnen Variablen. Lassen Sie mich also anstatt wie ein Histogramm fortfahren und diese Darstellung noch einmal vergleichen. Ich werde sagen, sobald diese Handlung die Gesamtrechnung kippt. Führen Sie das aus und lassen Sie uns sagen, dass Katie falsch ist. OK, der Unterschied zwischen einem Histogramm hier unten und diesem Rugge-Diagramm besteht darin, dass das Histogramm im Wesentlichen Bins enthält und zählt, wie viele Striche sich in diesem Bin befanden, und es dann hier oben als Zahl anzeigt. Das bedeutet, dass es zwischen 10 und I don liegt. Ich weiß nicht, ob es einen gibt, wenn wir uns das ansehen. Fünfundvierzig Striche dort. Sie sind alle irgendwie übereinander gestapelt. Und dann, wenn wir den Gesamtrechnungspreis weiter erhöhen, gibt es weniger Roug oder weniger Striche und das bedeutet, dass der Ben weniger hoch sein wird. Das ist die grundlegende Beziehung zwischen dem SR-GR-RAM und diesem wirklich einfachen Konzept. Sie zeichnen einfach eine Strichmarkierung für jeden einzelnen Punkt entlang der Verteilungslinie. Gut. Das ist die Gesamtrechnung. Was wir tun wollen, ist diese Idee von Schurkenplots auszubauen, um zu erklären, was dieser tatsächliche Kaytee-Plot ist, und das wird genau hier diese Linie sein. Wie bauen wir diese Linie tatsächlich auf der Grundlage dieser Schurkenpläne? Und Sie können sehen, dass es eine Art Beziehung zu den Rogue-Plot-Zählungen hat. KDE-Plots stehen für Kernel-Dichteschätzungs-Plots. Sie können dies tatsächlich googeln und in der Wikipedia nach Kernel-Dichteschätzungs-Plots suchen, und die Seite sieht ungefähr so aus wie diese Curl-Dichte Schätzung und dies ist ein wirklich nach unten scrollen. Dies ist eine wirklich schöne Figur hier und im Wesentlichen werden wir versuchen zu konstruieren. Sie werden feststellen, dass jeder dieser schwarzen Striche hier die Schurkenhandlung ist. Also die eigentlichen Punkte. Und dann haben Sie diese kleinen normalen Gaußschen Verteilungen über jedem Punkt. Und dann fassen Sie sie alle zusammen. Sie erhalten also diese endgültige Schätzung der Currence-Kerneldichte. Was meine ich nun mit Normalverteilung oder Gaußscher Verteilung? Nun, wenn Sie auch bei Wikipedia Nessus in der Wahrscheinlichkeitstheorie nachschlagen, wird die Normalverteilung und ich würde sagen, die wahrscheinlich häufigste kontinuierliche Wahrscheinlichkeitsverteilung zentral. Es ist diese Art von Normalverteilung, bei der Sie sagen: Oh, wie haben sich alle bei ihrem Test geschlagen, und Sie bewerten alle Schüler und sehen dann die Verteilung der Punktzahlen. Normalerweise folgt so etwas Normalisiertes oder zum Beispiel das Alter oder die Höhe der Menschen. Normalerweise folgen viele Dinge einer Normalverteilung. IN ORDNUNG. Lassen Sie uns zum Jupiter-Notizbuch zurückkehren und diese Themen etwas ausführlicher behandeln, um dies zu tun. Ich werde Code aus dem Notizbuch kopieren und einfügen, und Sie müssen sich keine Gedanken über das Verständnis dieses Codes machen. Es geht nur darum, ein Diagramm zur Erklärung zu erstellen, um es zu kopieren und einzufügen. Ich habe diesen Code kopiert und eingefügt und lasse mich mit diesen Codes ganz schnell zusammenbrechen. Ich habe nur ein paar Importe. Ich erstelle einen Datensatz mit zufälligen Daten. Dann verwende ich einen Teppichplot für diese zufälligen Daten. Ich habe die x-Achse für das Diagramm eingerichtet. Verwenden Sie einen beliebigen Ohlund-Raum, um 100 Punktpunkte mit gleichem Abstand aus X-Men's X max und dann hier zu erstellen. Dies ist wahrscheinlich am schwierigsten zu verstehen, da die Bibliothek verwendet wird. Wir haben noch nicht darüber gesprochen. Das ist nicht normal Alles, was dies bewirkt, ist eine Normalverteilung für jeden der Teppichplotpunkte. Und das sieht so aus. Wir gehen voran und vergrößern dies. Hier habe ich meinen Datensatz und dies ist ein zufälliger Datensatz. Wenn Sie dieses Jahr laufen, sehen Sie vielleicht etwas anders aus, aber denken Sie daran, dass wir nicht mehr mit Tipps arbeiten. Wir arbeiten nur an zufälligen Daten. Beachten Sie, dass ich hier blaue Striche habe und diese grauen Linien dann Normalverteilungen darstellen. Oben auf jedem dieser blauen Striche. Dies ist also eine Normalverteilung, die um den Bindestrich zentriert ist. Und wir haben ein paar davon übereinander. Nun, wir werden weitermachen und als nächstes einige von ihnen alle tun, um die Kernel-Dichte-Basisfunktion zu erhalten. Und dies ist nur die Summe all dieser kleinen Normalverteilungen. Gut. Durch Kopieren und Einfügen des zweiten Codeblocks aus dem Notizbuch können wir tatsächlich alle diese Basisfunktionen zusammenfassen, die nur diese Normalverteilungen sind, wenn sie alle zusammenfasst. Sie erhalten etwas, das so aussieht, nämlich nur Teekay, der Plot von zuvor, und so wird der Plot aus dem Disk-Plot aufgebaut. Bei der allerersten Darstellung haben wir uns das höchste t unter T angesehen. Gut. Das sind also alle wichtigen Möglichkeiten, wie Sie Datenverteilungen anzeigen können, die wir mehr sehen. Lassen Sie uns fortfahren und schnell alle verschiedenen Plottypen überprüfen, die dieser Computer und die Plottypen verwenden. Wir scrollen zurück nach oben. Sie waren das diese Diagramm und wieder, dass dieses Diagramm Sie mit zwei Methoden verwenden können, haben Kaytee gleich falsch und sehen im Wesentlichen nur ein Histogramm oder lassen Sie dieses Feld leer. Und dann können Sie tatsächlich die Caity sehen, die Kernel-Dichteschätzung, die erklärt, dass das Ende nur die Summe aller Normalverteilungen um den Teppich ist. A-Plot-Fugenplot ist dieser Idee sehr ähnlich sie als x- und y-Argumente. Wenn Ihr drittes Argument den Daten entspricht, war das nächste Diagramm, das wir kennenlernen, das Paardiagramm, und das Diagramm baut nur aus dem Diagramm auf und ist im Wesentlichen ein gemeinsames Diagramm für jede einzelne Spalte oder numerische Spalte in Ihrem Datensatz, und das bedeutet, dass Sie Übergeben Sie einfach den Datensatz selbst, den Datenrahmen, und Sie können den Farbton und die Palette übergeben, wenn Sie tatsächlich nach einer kategorialen Spalte färben möchten. Das nächste Diagramm, von dem wir erfahren haben, war, dass das Roug-Diagramm normalerweise keine Roug-Diagramme verwendet, aber es ist für Sie da und die Hauptidee der Verwendung eines Schurkenplots besteht darin, die Logik des Kernel-Dichteschätzungsplots zu erstellen, die hier durch diesen Code durchgeführt wird. Sie können sich die Zeit nehmen und diesen Code durchlesen, aber ich wollte nur den Punkt verdeutlichen, wenn Sie ein Rogue-Diagramm verwenden, und Sie möchten ein Kernel-Dichteschätzungsdiagramm für das Katie-Diagramm erstellen. Sie können dies einfach tun, indem Sie sagen Rogue Plot hat alle diese Normalverteilungen auf jeden Punkt und nimmt dann die Summe aller dieser Punkte. Und das ist das Diagramm zur Schätzung der Kerneldichte. Und wir haben gesehen, wie wir das mit diesem Plot machen können, und als schnellen Punkt, wenn Sie diesen Plot hier verwenden, wissen wir, dass wir den K-T-Plot loswerden können, indem wir sagen, Kaytee ist gleich falsch. Wenn Sie eigentlich nur den K-T-Plot wollen und nicht den tatsächlichen Beenz hier, können Sie tatsächlich Pasan anstelle der Plots, die Sie Asinus KDE-Plot und dann Passagiertipps machen können. Die Gesamtrechnung und damit wird das K-T-Grundstück ohne Verteilung der Balken erstellt. Gut. Hoffentlich erkennen Sie, dass Seaborn unglaublich leistungsfähig und auch sehr einfach ist, was den Code betrifft, den Sie schreiben müssen. Alles, was wir getan haben, wurde nur in einer Zeile erledigt. Wenn Sie versuchen, dies zu tun, hätten Sie mehrere Zeilen benötigt, aber das Schöne daran ist, dass es mit dem funktioniert, was Sie über Plot live wissen, und wir werden das viel mehr sehen, wenn wir über Styling und Farben sprechen . Ein Großteil dieses gelebten Wissens über Kartenplots wird auf die eigentliche Bearbeitung kleiner Dinge in diesem Plot übertragbar sein. OK, ich hoffe, Sie werden Seaborn wieder genießen, wie ich bereits erwähnt habe, bevor es eine meiner Lieblingsbibliotheken ist, und ich kann es kaum erwarten, Ihnen die nächsten Handlungstypen zu zeigen, die wir mit Seaborn kennenlernen werden. Vielen Dank an alle und wir sehen uns bei der nächsten Vorlesung