Las visualizaciones de datos son una herramienta poderosa para comprender mejor los atributos de un conjunto de datos.
pandas es una biblioteca de Python diseñada para agilizar los procesos relacionados con la captura y manipulación de datos relacionales que tiene métodos integrados para trazar y visualizar los valores capturados en sus estructuras de datos.
Un método popular para visualizar figuras de pandas es el diagrama de caja. En esta publicación, aprenderá los conceptos básicos de un diagrama de caja y verá ejemplos de diagramas de caja en pandas.
Diagrama de caja en Pandas
Un diagrama de caja se crea calculando un cuartil de conjunto de datos que divide un rango de números en cuatro partes según su distribución.
Para comprender mejor los cuartiles, analicemos cada uno de ellos:
- Mediana: valor en el medio de la distribución
- Cuartil inferior: El punto medio entre la mediana y el valor más bajo en el rango
- Cuartil superior: El punto medio entre la mediana y el valor más alto en el rango
- el límite inferior: valor más bajo en la distribución
- limite superior: valor más alto en la distribución
Puede ver cada uno de estos valores marcados en el diagrama de caja a continuación.

Los diagramas de caja lo ayudan a comprender mejor el rango de valores en su conjunto de datos e identificar cualquier valor atípico en un formato que es más fácil de entender que los datos sin procesar.
Ahora que comprende qué es un diagrama de caja, echemos un vistazo a cómo crear uno en pandas.
Ejemplos de pandas de diagramas de caja
Para comenzar, debe importar las bibliotecas panda y matplotlib. Específicamente, importará el submódulo pyplot, porque ahí es donde accederá al método de diagrama de caja en lugar de importar toda la biblioteca matplotlib. Las instrucciones de importación para ambas bibliotecas se encuentran a continuación.
import pandas as pd
import matplotlib.pyplot as plt
Ahora que tiene las herramientas que desea, puede comenzar a crear sus diagramas de caja.
Para estos tutoriales, se crearán visuales a partir del DataFrame de los estudiantes con columnas de calificaciones generadas aleatoriamente. El DataFrame está impreso en el terminal a continuación.

A continuación se muestran ejemplos de diagramas de caja generados a partir de una columna y varias columnas de datos.
Diagrama de caja de pandas de una sola columna
En el primer ejemplo, veamos cómo crear un diagrama de caja para una sola columna de datos, también conocida como serie. En este código, genera un diagrama de caja a partir de la columna denominada «Keely Mays»:
stud_bplt = stud_df.boxplot(column = 'Keely Mays')
stud_bplt.plot()
plt.show()
Primera llamada .diagrama de caja () método de la biblioteca panda en semental_df Marco de datos. Asigne los valores de diagrama de caja recién calculados a semental_bplt cambiable.
Entonces llamas .intriga() graficar los valores del diagrama de caja en semental_bplt a un gráfico en la interfaz pyplot. Entonces llamas .mostrar() en el módulo pyplot para mostrar la interfaz con el diagrama de caja trazado actualmente.
La salida está debajo.

La distribución de la columna etiquetada como «Keely Mays» ahora se captura en el diagrama de caja. Puede ver los límites, los cuartiles superior e inferior y la mediana de sus puntuaciones.
Ahora que está familiarizado con el flujo de trabajo básico, echemos un vistazo a cómo comparar varias columnas una al lado de la otra.
Pandas Boxplot Muchas columnas
Los diagramas de caja no se limitan a mostrar columnas individuales; el principal caso de uso de los diagramas de caja es comparar distribuciones relacionadas. Puede extender fácilmente el alcance de su diagrama de caja a varias columnas de datos al proporcionar una lista de nombres de columnas al método .boxplot:
stud_bplt = stud_df.boxplot(column = [
'Keely Mays',
'Pennie Stinnett',
'Manuela Roden',
'Shawana Shanks',
'Cathi Brownlee'
])
stud_bplt.plot()
plt.show()
Aquí te paso una lista de etiquetas para columna argumento. El resto del flujo de trabajo sigue siendo el mismo.
La salida está debajo.

Ahora puede ver los desgloses de calificaciones de todos los estudiantes en el conjunto de datos y comparar las calificaciones de estudiantes individuales con sus compañeros. También puede notar la presencia de un valor atípico en la distribución «Cathi Brownlee», lo que significa una burbuja en el exterior de la distribución.
El argumento de la columna no es el único parámetro disponible en el método .boxplot. Ahora veamos algunos de los ajustes.
Mods de diagrama de caja de Panda
La biblioteca panda proporciona muchos argumentos para personalizar aún más cómo se muestra el diagrama de caja. Veamos algunas de las opciones más populares.
1. Color del gráfico de caja Panda
Puede decidir que se puede modificar el esquema de color predeterminado del gráfico de caja. Para cambiar esto, puede usar el argumento de color para modificar la apariencia visual:
stud_df.boxplot(column = 'Keely Mays', color="red")
Aquí declaras color argumento y establecerlo en «rojo» al invocar .diagrama de caja () en pandas.
La salida está debajo.

Su diagrama de caja ahora tiene un color rojo distintivo. Puede establecer el color en cualquier otro color primario con nombre. Piensa en ROY G BIV: rojo, naranja, amarillo, verde, azul, índigo, morado.
Otra modificación le permite agregar un título al gráfico.
2. Pandas Boxplot Título
Los títulos ayudan a los usuarios a comprender rápidamente lo que están viendo. Puede agregar un título a su diagrama de caja yendo al módulo pyplot.
En este código, crea un diagrama de caja como de costumbre, pero esta vez agrega un paso adicional:
stud_bplt = stud_df.boxplot(column = 'Keely Mays')
stud_bplt.plot()
plt.title('Keely Mays Grade Distribution')
plt.show()
aquí tu llamas .título() para asignar al diagrama de caja el título «Distribución de calificaciones de Keely Mays». Entonces llamas .mostrar() como siempre para ver el resultado final:

Ahora tiene un título que les permite a todos los recién llegados saber qué representa este diagrama de caja para que puedan entenderlo más rápido.
Esta personalización final se remonta a los argumentos del método .boxplot.
3. Tamaño de fuente de la etiqueta Pandas Boxplot
Puede cambiar el tamaño de fuente predeterminado para las etiquetas de diagrama de caja. Esto puede hacer que el diagrama de caja sea más accesible y más fácil de leer.
Para hacer esto, agregue tamaño de fuente argumento tuyo .diagrama de caja () conexión:
stud_bplt = stud_df.boxplot(column = 'Keely Mays', fontsize = 15)
stud_bplt.plot()
plt.show()
Aquí aumenta el tamaño de fuente de las etiquetas de diagrama de caja para 15. Este valor está estrechamente relacionado con el tamaño del punto, como se ve a continuación:

Ahora tanto la etiqueta de la columna como las etiquetas de la cuadrícula son más fáciles de leer.
Los gráficos de cuadro de Pandas revelan información sobre sus datos.
Los diagramas de caja son una poderosa herramienta de visualización que le permite profundizar en las figuras. Muestran la distribución de valores en rangos y cualquier valor atípico en sus conjuntos de datos. Al aprovechar toda la potencia de las bibliotecas pandas y matplotlib, puede personalizar sus diagramas de caja para adaptarlos a su negocio y mejorar la toma de decisiones.








