많은 분석이 유의성 검정으로 끝나는데, 그럼 회귀는 왜 쓸까요? 사실 "회귀냐 검정이냐"는 대립하는 두 도구가 아니에요. 회귀 안에 이미 유의성 검정이 들어 있거든요. 그래서 질문을 정확히 다시 잡으면 이렇게 돼요 — 효과의 크기(변화율)까지 알아야 하나, 있느냐 없느냐만 알면 되나?
t검정 같은 순수 검정이 답하는 건 하나예요. "이 차이가 우연이라고 보기 어려운가?" 즉 있냐/없냐(예·아니오)까지죠. 회귀는 여기서 한 발 더 나가 관계를 식 하나로 씁니다. 그리고 그 안의 기울기 β₁이 바로 "x가 1 늘 때 y가 평균 얼마 변하나"라는 변화율이고, 회귀는 이 β₁에 대해 유의성 검정도 같이 돌려줘요.
t검정과 회귀가 같아지는 경우: 두 집단 평균만 비교할 때. 이항변수 하나로 하는 회귀의 β₁은 두 집단 평균의 차이와 정확히 같고, 그 검정은 t검정과 수학적으로 동일해요 (t검정은 회귀의 특수한 경우). 이때는 뭘 써도 상관없어요.
회귀가 진짜 필요해지는 경우는 이런 것들이에요. ① x가 연속변수라 집단으로 못 나눌 때 — 변화율 β₁은 회귀만 줍니다. ② 예측식이 필요할 때. ③ 그리고 실무에서 가장 흔한 이유 — 다른 변수를 통제해 순효과를 볼 때.
예를 들어 어떤 건강 프로그램 참여자와 비참여자의 의료비를 단순 비교(t검정)해서 차이가 났다고 해요. 근데 참여자가 원래 더 젊고 건강했다면? 그 차이가 프로그램 효과인지 나이·기저질환 탓인지 t검정은 구분을 못 해요. 회귀는 처럼 나이·기저질환을 붙잡아둔 채 프로그램의 몫(β₁)만 떼어내요. 이게 검정이 절대 못 하는 일이고, 계량·보건경제 논문이 거의 다 회귀를 쓰는 진짜 이유예요.
정리하면, 검정은 "차이가 있냐"에 답하고, 회귀는 "무엇이 결과를 얼마만큼, 다른 걸 감안했을 때 움직이냐"에 답해요. 그리고 후자 안에 전자가 이미 포함돼 있어요.
단순회귀의 표준형은 이거예요.
β₀(절편)은 x=0일 때 y의 기준값, β₁(기울기)은 변화율, u(오차)는 x로 설명 안 되는 나머지 전부예요. 임금을 교육 연수로 설명한다면 β₁은 "1년 더 배우면 임금이 평균 얼마 오르나"가 되죠.
OLS는 각 점에서 회귀선까지의 세로(y방향) 거리, 즉 잔차 를 제곱해서 다 더한 값(SSR)을 가장 작게 만드는 선을 골라요.
'세로'로 재는 이유는 회귀가 x가 주어졌을 때 y를 예측하는 것이고, 우리가 틀리는 게 y 방향이기 때문이에요. (점까지의 직교 거리를 쓰면 x에도 오차가 있다는 다른 가정이 돼요.) 제곱을 쓰는 이유는 부호 상쇄를 막고, 큰 오차에 큰 벌점을 주고, 미분으로 매끄럽게 풀리기 때문이고요.
직접 해보기 — 슬라이더로 선을 움직여 잔차(코랄 점선)와 SSR을 줄여보세요.
위 SSR을 최소화하는 값은 편미분으로 정확히 풀려요(도출 과정은 다음 페이지). 결과는 단순하지만 근사가 아니라 정확한 답이에요.
기울기는 "x와 y가 같이 움직이는 정도(공분산)를 x가 퍼진 정도(분산)로 나눈 것"이고, 절편 식을 보면 회귀선은 항상 데이터의 무게중심 를 지나가요. 위 예제 데이터에서는 , 최소 SSR은 2.7이에요.
β̂₁이 믿을 만한 값이 되려면 몇 가지 조건이 필요해요. 중요도 순으로:
1~4가 깨지면 추정치 자체가 틀리고(특히 4번), 5~6이 깨지면 추정치는 괜찮은데 표준오차·검정이 틀려요. "OLS를 쓴다"는 건 사실 이 가정들이 여기서 말이 되는지 계속 점검하는 일이에요.