파이썬 기초 익히기
Q1. data read하기
import pandas as pd
DriveUrl = 'https://drive.google.com/~'
df =pd.read_csv(DriveUrl)
type(df)
Q2. 상위 5개의 행을 출력
df.head()
✔ 인덱스가 0부터 시작함
Q3. 데이터의 행과 열의 개수를 파악
df.shape
Q4. 전체 컬럼 출력
df.columns
Q5. 6번째 컬럼 출력
df.columns[5]
Q6. 6번째 컬럼의 데이터 타입을 확인
df.iloc[:,5].dtype
✔ iloc[행번호,열번호] -> 행번호와 열번호로 원하는 데이터 범위를 지정하여 데이터 출력
✔ iloc[행번호1:행번호2] -> 행번호1부터 행번호까지 불러오겠다는 의미
✔ " : " 만 쓰면 모든 행(또는 열)을 불러오겠다는 의미
Q7. 데이터셋의 인덱스 구성을 확인
df.index
Q8. 6번째 컬럼의 3번째 값 출력
df.iloc[2,5]
✔ 행도 인덱스 0부터 시작
Q9. 컬럼이 한글인 데이터 로드
import pandas as pd
DriveUrl = 'https://drive.google.com/~'
df = pd.read_csv(DriveUrl, encoding = 'euc-kr')
type(df)
Q10. 데이터 마지막 3개행을 출력
df.tail[3]
Q11. 수치형 변수를 가진 컬럼 출력
#1
df.select_dtypes(exclude = object).columns
#2
df.select_dtypes(include = 'number').columns
Q12. 범주형 변수를 가진 컬럼 출력
df.select_dtypes(include = object).columns
Q13. 각 컬럼의 결측치 숫자 파악
df.isnull().sum()
✔ isnull( )함수로 null 여부 구분하고 sum( )으로 카운트
Q14. 각 컬럼의 데이터 수, 데이터 타입 한번에 확인하기
df.info()
✔ 이런식으로 데이터에 대한 여러 정보를 확인할 수 있음

Q15. 각 수치형 변수의 분포(사분위, 평균, 표준편차, 최대, 최소) 구하기
# 기술통계량 확인
df.describe()

Q16. 거주인구 컬럼의 값들을 출력(특정 컬럼 값 확인)
df['거주인구']
Q17. 평균 속도 컬럼의 4분위 범위(IQR)값을 구하라(IQR = Q3 - Q1)
df['평균 속도'].quantile(0.75) - df['평균 속도'].quatile(0.25)
Q18. 읍면동명 컬럼의 유일값 개수를 출력
df['읍면동명'].nunique()
Q19. 읍면동명 컬럼의 유일값을 모두 출력
df['읍면동명'].unique()
'제로베이스 > Python' 카테고리의 다른 글
| Python 6. Pivot (0) | 2024.06.29 |
|---|---|
| Python 5. Time_Series (0) | 2024.06.29 |
| Python 4.Apply, Map (0) | 2024.06.28 |
| python3. Grouping (0) | 2024.06.28 |
| Python 2. Filtering & Sorting (0) | 2024.06.27 |