본문 바로가기

제로베이스/Python

Python 1. Getting & Knowing Data

파이썬 기초 익히기

 

Q1. data read하기

import pandas as pd
DriveUrl = 'https://drive.google.com/~'

df =pd.read_csv(DriveUrl)
type(df)

 

Q2. 상위 5개의 행을 출력

df.head()

✔ 인덱스가 0부터 시작함

 

Q3. 데이터의 행과 열의 개수를 파악

df.shape

 

Q4. 전체 컬럼 출력 

df.columns

 

Q5. 6번째 컬럼 출력 

df.columns[5]

 

Q6. 6번째 컬럼의 데이터 타입을 확인 

df.iloc[:,5].dtype

✔ iloc[행번호,열번호] -> 행번호와 열번호로 원하는 데이터 범위를 지정하여 데이터 출력

✔ iloc[행번호1:행번호2] -> 행번호1부터 행번호까지 불러오겠다는 의미

" : " 만 쓰면 모든 행(또는 열)을 불러오겠다는 의미

 

Q7. 데이터셋의 인덱스 구성을 확인 

df.index

 

Q8. 6번째 컬럼의 3번째 값 출력 

df.iloc[2,5]

✔ 행도 인덱스 0부터 시작

 

Q9. 컬럼이 한글인 데이터 로드 

import pandas as pd
DriveUrl = 'https://drive.google.com/~'
df = pd.read_csv(DriveUrl, encoding = 'euc-kr')
type(df)

 

Q10. 데이터 마지막 3개행을 출력 

df.tail[3]

 

Q11. 수치형 변수를 가진 컬럼 출력

#1
df.select_dtypes(exclude = object).columns
#2
df.select_dtypes(include = 'number').columns

 

Q12. 범주형 변수를 가진 컬럼 출력 

df.select_dtypes(include = object).columns

 

Q13. 각 컬럼의 결측치 숫자 파악 

df.isnull().sum()

✔ isnull( )함수로 null 여부 구분하고 sum( )으로 카운트 

 

Q14. 각 컬럼의 데이터 수, 데이터 타입 한번에 확인하기 

df.info()

✔ 이런식으로 데이터에 대한 여러 정보를 확인할 수 있음 

 

  Q15. 각 수치형 변수의 분포(사분위, 평균, 표준편차, 최대, 최소) 구하기 

# 기술통계량 확인
df.describe()

 

Q16. 거주인구 컬럼의 값들을 출력(특정 컬럼 값 확인)

df['거주인구']

 

Q17. 평균 속도 컬럼의 4분위 범위(IQR)값을 구하라(IQR = Q3 - Q1)

df['평균 속도'].quantile(0.75) - df['평균 속도'].quatile(0.25)

 

Q18. 읍면동명 컬럼의 유일값 개수를 출력 

df['읍면동명'].nunique()

 

Q19. 읍면동명 컬럼의 유일값을 모두 출력 

df['읍면동명'].unique()

 

'제로베이스 > Python' 카테고리의 다른 글

Python 6. Pivot  (0) 2024.06.29
Python 5. Time_Series  (0) 2024.06.29
Python 4.Apply, Map  (0) 2024.06.28
python3. Grouping  (0) 2024.06.28
Python 2. Filtering & Sorting  (0) 2024.06.27