전체 글 42

20250710_통계학 라이브 (4-2)

회귀모형 평가회귀분석은 모든 점에 대해 정확한 예측이 아니라 전체적으로 어떤 패턴이나 경향이 있는지를 설명해야 한다 RSS(잔차제곱합)의 한계회귀식의 오차 총량으로 회귀선이 얼마나 실제 데이터를 잘 못 맞췄는가를 나타냄데이터 단위에 값이 달라짐 잔차표준오차(RSE)평균적으로 예측이 얼마나 빗나갔는지 나타내는 값오차 평균 크기를 표준화해서 보여줌 결정계수(R2)오차만 줄이는게 아니라 데이터의 전체적인 변화를 얼마나 잘 설명하고 있는지를 숫자로 보여주는 지표-> 회귀 모델이 종속 변수(Y)의 총 변동성 중에서 독립 변수(X)를 통해 얼마나 잘 설명해 내는지를 나타내는 지표 다중회귀다중선형회귀란 ?단순선형회귀는 독립변수 x가 1개지만 다중선형회귀는 여러개 -> 현실에선 결과에 영향을 주는 원인이 1개가 아님y..

카테고리 없음 2025.07.10

20250709_통계학 라이브 강의 (4-1)

산점도-> 양적 변수 2개는 x축과 y축으로 이루어진 산점도로 표현할 수 있다. 피어슨 상관계수 -> 두 변수 사이 선형 관계의 정도- 0.7 - 0.4 - 0.2 - 0.0 * 하지만 상관계수만 보고 관계가 없다고 결론 내리는 것은 위험 ! 스피어만 "순위"상관계수-> 두 변수의 순위 간 상관관계를 측정하는 지표 -> 값보다 커지거나 작아지는 순서 관계에 집중 회귀-> 변수들 사이의 관계를 수학적인 공식으로 만들어 예측하는 통계 기법 -> y = f(x) 회귀모형 (단순 공식)-> 데이터 간의 예측 관계를 표현하는 수학적 틀-> y = a(x)+b -> 결과 = 기울기(원인) + 절편 회귀모형의 종류- 선형 회귀(직선), 비선형 회귀(곡선 등등) 회귀 모델 -> 데이터를 가장 잘 설명하는..

카테고리 없음 2025.07.09

20250708_통계학 라이브 강의(3-2)

이산형변수 분포 이산형 변수- 값이 0,1,2처럼 정수 단위로만 측정되는 수치형 변수 (고객 수, 방문 횟수, 사고 건수 등)- 평균보다는 "횟수/빈도" 자체가 의미 있는 변수 이항 분포- 성공/실패 반복 시행에서 성공 횟수 (n:시행 횟수, p: 성공 확률)- 각 시행은 성공/실패 2가지 결과만 존재, 확률 일정 (10번의 동전던지기, 100명 중 특정 약을 먹고 효과 있는 사람 수)- 성공 횟수 분포 설명 / 이항 검정, 이항 회귀(로지스틱 회귀) 포아송 분포- 단위 시간/공간 내 사건 발생 횟수 (람다:평균 발생 횟수, 평균=분산)- 카운트형 종속변수 예측, 사건 수 예측 모델링 이산형 변수, 이항 분포, 포아송 분포 - 극강 요약이산형 변수: 세는 값 (횟수/빈도).이항 분포: 성공 횟수 (..

카테고리 없음 2025.07.08

20250708_통계학 라이브 강의 (3-1)

통계이론이 중요한 이유통계의 계산은 파이썬, 라이브러리가 해주지만 이론은 이해를 해야한다. 통계와 머신러닝의 차이 복습신뢰구간 -> 신뢰 가능한 값의 범위 가설검정 -> 차이가 의미 있는지 판단하기 위한 통계적 절차 (p-value, 귀무가설) 수치형 변수를 위한 가설 검정방법왜 다양한 검정 방법을 알아둬야 할까 ?- 분석 목적에 따라 적절한 검정 방법이 다르다 t검정- 1개 또는 2개의 집단 간 평균 차이를 비교하는 검정 방법 정규분포를 가정하는 모수 검정 t검정의 전제1. 정규분포를 따른다.2.등분산성 가정3. 자유도 ? t검정의 종류단일표본 t검정-> 특정 기준값과 다른지 -> ex 평균은 ~다 이표본 t검정-> 두 집단의 평균 차이 -> ex 평균은 같다, 다르다전제 조건 : 정규성, 등분..

카테고리 없음 2025.07.08

20250707_통계학 라이브 강의 정리 (2-2)

가설검정 가설검정이란 ?신뢰구간이 모수의 추정 범위를 판단했다면, 가설검정은 '어떤 주장이 통계적으로 의미가 있는가?'를 판단-> 신뢰구간 95%를 구하고 / 귀무가설에서 주장하는 값(0)이 범위 안에 들어가서 / 통계적 의미가 있는가 ? 확증적 자료분석 = 가설을 미리 다 세우고 검증하는 접근법탐색적 자료분석 = 가설 없이 데이터를 탐색하며 해석하는 접근법 가설검정의 구조 귀무가설 -> 차이가 없다. -> 우리가 밝히고자 하는 가설의 부정명제 대립가설 -> 차이가 있다. 검정통계량 -> (A-B)의 차이를 표준오차로 나눈 값 유의수준 -> 0.05 (신뢰구간95%와 유의수준 5%) p-value -> 실제 데이터에서의 차이가 우연히 나올 확률 -> 우연인지 아닌지 **판단 기준** -> p-valu..

카테고리 없음 2025.07.07

20250704_통계학 라이브 강의 정리 (2-1)

추정 학습 목표신뢰구간이 무엇인가 !? 왜 사용하는가 !? 복습 베이즈정리 사전 확률우도사후 확률 추정 추정이 무엇인가 ?-> 표본을 통해 대신 계산하는 것 ! 추정의 2가지 관점 그 추정은 2가지 관점으로 나뉘는데 빈도주의 : 반복했을 때 평균이 어떨지 - 표본이 많을 때- 정규분포 가정 성립- 가설검정 필요- 명확한 검정 결과 필요한 경우 베이지안 : 주어진 정보로 얼마나 확신할 수 있는지- 표본이 적을 때- 사전 지식(도메인) 활용 가능할 때- 실시간 업데이트가 필요한 경우- 확률로 직관적 해석 필요한 경우 베이지안 -> 베이즈정리 기반 -> 후에 다룰 예정 !! 모집단의 특성 -> 모수 모집단과 정규분포 표본오차우리가 측정한 값과 실제 값의 차이 큰수의 법칙 모수는 무엇인가 ? 모수 추정하기 ..

카테고리 없음 2025.07.04

20250703_통계학 라이브 강의 정리(1)

데이터 분석의 통곡의 벽 "통계" 왜 배워야 하는가 ?실제로 어려운 학문이고 이해하기 쉽지 않겠지만, 분석 결과를 더욱 설득력있게 만들어주는 것이 통계다.그럼으로 이번 강의는 이해가 되면 좋은거고 안되면 암기 or 찍먹으로 가면 된다 ..?그래도 최대한 이해하려고 노력해보자 ! 통계란 무엇인가 ?통계는 해석을 위한 논리적 도구 배워서 어디다 써먹을까 ?분석이 끝나고 "사실"을 가져와 "해석"을 한다면 그건 주관의 영역이지만 통계로 그 해석에 수치화 된 논리적인 근거를 붙여서 "설득"한다 ! 1. 추론의 검증을 위해2. 데이터를 이해하기 위해3. 모델링과 머신러닝의 기반 !4. 제일 중요한 "설득"을 위해 통계 기초- 모집단 : 우리가 알고 싶은 전체 (전수 조사 -> 거의 불가능) - 표본 : ..

카테고리 없음 2025.07.03

20250702_크롤링_1

HTTP = 웹 브라우저와 웹 서버 간 Request(요청) & Response(응답) 형태로 이루어짐-> HyperText Transfer protocol HTTPS = HTTP에서 보안이 강화된 버전 -> 로그인, 결제 정보 등 민감 데이터에 필수 클라이언트: 웹 브라우저(크롬, 사파리) + 앱 같이 서버에 요청을 보내는 곳 -> Request서버: 웹 페이지, 이미지, 데이터 등을 저장하다 요청 들어오면 응답을 보내주는 곳 -> Response HTML = 웹페이지 구조와 내용을 담은 "마크업 언어"로 시작해서 로 끝냄그 안에 ,로 제목이나 내용 채움 CSS = 웹 페이지 스타일글꼴, 색상, 레이아웃 등등나중에 크롤링하다 이거 때문에 막힐수도 있음 웹개발자 도구 활용 Elements 탭 F1..

카테고리 없음 2025.07.02

Spotify 0. 음악을 숫자로 본다는 것

왜 이 분석을 시작하는가 ? 데이터 분석을 공부하면서 "도메인에 대한 이해"가 얼마나 중요한지 실감했다.낯선 분야에서는 어떤 데이터가 의미가 있는지조차 판단이 어려웠기에그래서 전공분야로 가장 자신있는 도메인인 "음악"이라는 분야를 첫 개인 프로젝트로 삼았다. 가설 1빌보드 차트 상위권 음악들의 장르, 특성들이 시간이 흐르고 한국에 유행을 한다.이것을 데이터로 분석해보면 어떠한 주기, 패턴을 명확히 수치화가 가능하지 않을까 ? 가설 2상위권 곡들 사이에 수치화 가능한 공통점이 존재한다면,장르나 곡의 특성만으로 히트 가능성을 예측할 수 있는 공식도 만들 수 있지 않을까 ? 음악 활동을 하면서 곡을 음악 분석할 때 수치화까지는 아니더라도트랜드, 장르, 곡의 특성같은 정성적인 기준을 나름대로 정리해온 경험이 있..

카테고리 없음 2025.06.27

TIL_20250612 (목) 파이썬 함수 정리

list comprehension- 기본 구조 = [표현식 for 변수 in 반복가능한 객체]->> 반복 가능한 객체에서 값을 하나씩 꺼내 표현식에 적용한 결과를 리스트로 만든다.- 기본 예시 = [i * 2 for i in range(5)]->> range(5)의 숫자들을 하나씩 i로 꺼내서 i * 2 한 값을 리스트로 만든다.- if 문과 함께 = [i for i in range(10) if i % 2 == 0]->> range(10)의 숫자 중에서, i가 2로 나눴을 때 나머지가 0일 때만 리스트에 담는다.(짝수 구하기)- if else문 = ["짝수" if i % 2 == 0 else "홀수" for i in range(5)]->> else를 사용하면 if else가 for문 앞에 와야함 ==>..

카테고리 없음 2025.06.12