회귀분석 결과에서 봐야 할 값(B·β·p·R²)은 무엇이고 어떻게 해석하나요?

발행 2026-09-16

회귀분석이 무엇인가요?

회귀분석(regression analysis)은 한 변수(종속변수)를 다른 변수(독립변수)로 설명하거나 예측하는 분석이에요. 상관분석이 두 변수가 함께 변하는 정도만 본다면, 회귀분석은 「무엇이 무엇을 설명하는지」 방향을 정하고, 독립변수 여러 개를 한 번에 넣어 각각의 몫을 나눠 봐요.

결과는 식 하나로 나와요. 독립변수가 하나인 단순회귀의 식은 다음과 같아요.

예측한 종속변수 값 = 절편 + B × 독립변수
B(회귀계수)는 독립변수가 1 커질 때 종속변수가 변하는 양이고, 절편은 독립변수가 0일 때의 예측값이에요. 독립변수가 여럿인 다중회귀는 「+ B × 독립변수」가 독립변수 수만큼 늘어나요.

이 글은 샘플 데이터(대학원생 180명 설문)에서 삶의 만족도를 학업스트레스·사회적 지지·성별로 설명하는 회귀로 설명해요. 데이터는 다음과 같이 생겼어요.

응답삶의 만족도 (종속변수)학업스트레스사회적 지지성별 (코딩값)
#14.602.504.75남 (0)
#22.604.502.50여 (1)
#34.803.252.75여 (1)
#44.004.003.25여 (1)
#54.003.504.25남 (0)
#61.402.753.75남 (0)
샘플 데이터 응답 #1~#6. 삶의 만족도·학업스트레스·사회적 지지는 문항 평균으로 만든 척도 점수(1~5점, 삶의 만족도 3번 문항 역채점), 성별은 여 = 1 · 남 = 0으로 코딩

종속변수는 응답자마다 값이 다른 숫자 변수 하나예요. 독립변수는 숫자 변수이거나, 성별처럼 두 집단을 0과 1로 코딩한 변수예요. #1과 #2를 비교하면 학업스트레스가 높은 #2의 삶의 만족도가 낮고, 사회적 지지가 높은 #1의 삶의 만족도가 높아요. #6처럼 이 경향에서 벗어난 응답자도 있어요. 회귀분석은 이런 경향이 180명 전체에서 얼마나 일관되게 나타나는지를 계수 하나로 요약하고, 식으로 설명하지 못한 나머지(잔차)가 얼마나 남는지도 알려줘요.

결과 표에서 무엇을 보나요?

회귀 결과 표는 값이 많아서 읽는 순서가 중요해요. 모형 전체(F·p·R²)를 먼저 보고, 그다음 독립변수 각각(B·β·t·p)을 봐요. 다중회귀면 VIF와 Durbin-Watson 같은 진단값도 확인해요. 아래 표의 예시 값은 샘플 데이터의 다중회귀(삶의 만족도 ~ 학업스트레스 + 사회적 지지 + 성별, N = 180) 결과예요.

어떻게 읽나요샘플 데이터 예시
B비표준화 회귀계수. 독립변수가 1 커질 때 종속변수가 변하는 양이고, 원래 단위 그대로예요. 다중회귀에서는 다른 독립변수를 같게 놓았을 때의 값이에요부호가 방향(+ 정적, − 부적), 크기가 변화량이에요. 0/1 변수의 B는 1로 코딩한 집단이 0 집단보다 종속변수가 얼마나 높은지예요사회적 지지 B = 0.40: 사회적 지지가 1점 높으면 삶의 만족도가 0.40점 높아요. 성별 B = 0.34: 여성이 남성보다 0.34점 높아요
SEB의 표준오차. 표본을 다시 뽑으면 B가 이 정도 달라질 수 있다는 뜻이에요작을수록 B가 정밀해요. t = B ÷ SE라서 t와 p의 재료가 돼요사회적 지지 SE = 0.07
β표준화 회귀계수. 모든 변수를 표준편차 단위로 바꾼 뒤의 계수라 단위가 없어요단위가 다른 독립변수끼리 예측력을 비교할 때 봐요. 독립변수끼리 상관이 낮을 때는 절댓값이 클수록 상대적 예측력이 커요(Cohen et al., 2003). 독립변수가 하나면 β는 상관계수 r과 같아요사회적 지지 β = .37, 학업스트레스 β = −.25, 성별 β = .17. 사회적 지지의 몫이 가장 커요
t · p (독립변수)그 독립변수의 계수가 0과 다른지 검정한 결과예요흔히 p < .05면 통계적으로 유의하다고 봐요. 유의하지 않으면 「이 표본에서는 그 변수의 몫을 확인하지 못했다」는 뜻이에요성별 t = 2.68, p = .008
R² · 수정 R²종속변수의 분산(사람마다 다른 정도) 중 모형이 설명한 비율. 수정 R²는 독립변수 수를 반영해 줄인 값이에요0~1이고, 100을 곱하면 「몇 %를 설명」이에요. 독립변수를 넣기만 해도 R²는 커지므로 다중회귀에서는 수정 R²를 함께 봐요R² = .28, 수정 R² = .27: 세 변수가 삶의 만족도 차이의 약 28%를 설명해요
F · p (모형)모형 전체가 의미 있는지, 즉 모든 계수가 0이라는 가설을 검정한 결과예요가장 먼저 봐요. 모형 p가 .05보다 크면 개별 변수의 별표는 해석하지 않아요F(3, 176) = 22.71, p < .001
VIF분산팽창지수. 독립변수끼리 겹치는 정도(다중공선성)라 다중회귀에서만 뜻이 있어요. 공차(tolerance)는 1 ÷ VIF예요흔히 10 이상(공차 .10 이하)이면 계수가 불안정하다고 봐요(Field, 2018). 특별한 사유가 없으면 10을 기준으로 보고, 표본이 작을 때는 3~5처럼 더 엄격한 값을 함께 살피라고 권하는 교재도 있어요(Hair et al., 2010)최대 VIF = 1.04. 겹침이 거의 없어요
Durbin-Watson잔차(모형이 설명하고 남은 차이)가 행 순서대로 이어지는지(자기상관) 보는 값이에요. 0~4 사이예요2 근처면 자기상관이 없다고 봐요. 1 미만이나 3 초과는 문제 신호로 봐요(Field, 2018). 설문처럼 행 순서에 의미가 없는 자료에서는 보조 진단이에요D-W = 2.09
회귀 결과 표의 값과 읽는 법. 예시 값은 샘플 데이터 다중회귀(삶의 만족도 ~ 학업스트레스 + 사회적 지지 + 성별, N = 180)의 결과

읽는 순서를 정리하면 다음과 같아요.

  1. 모형 p와 R²로 식 전체가 의미 있는지, 얼마나 설명하는지 봐요.
  2. 각 독립변수의 p로 어느 변수가 유의한지 봐요.
  3. 유의한 변수의 B와 β로 방향과 크기를 읽어요. 원 단위 해석은 B, 변수끼리 비교는 β예요.
  4. 다중회귀면 VIF와 Durbin-Watson으로 계수를 믿어도 되는지 확인해요.

샘플 데이터에서는 어떻게 읽나요?

먼저 학업스트레스 하나로 삶의 만족도를 설명하는 단순회귀예요. 세 척도의 기술통계는 삶의 만족도 M = 3.37(SD = 0.98), 학업스트레스 M = 3.31(SD = 0.94), 사회적 지지 M = 3.49(SD = 0.90)이고, 성별은 여성 85명·남성 95명이에요(N = 180).

독립변수BSEβtp
(상수)4.500.2517.67< .001
학업스트레스−0.340.07−.33−4.61< .001
샘플 데이터 단순회귀: 삶의 만족도 ~ 학업스트레스 (N = 180). 두 변수 모두 척도 점수(1~5점). 모형 R² = .11, F(1, 178) = 21.26, p < .001

식으로 쓰면 「예측 삶의 만족도 = 4.50 − 0.34 × 학업스트레스」예요. 학업스트레스가 1점 높은 응답자는 삶의 만족도가 평균 0.34점 낮아요(B = −0.34, p < .001). 모형은 유의하고(F(1, 178) = 21.26, p < .001), 삶의 만족도 차이의 약 11%를 설명해요(R² = .11). 독립변수가 하나라 β = −.33은 두 변수의 상관계수 r = −.33과 같아요.

이제 사회적 지지와 성별을 함께 넣은 다중회귀예요.

독립변수BSEβtpVIF
(상수)2.670.377.26< .001
학업스트레스−0.260.07−.25−3.80< .0011.04
사회적 지지0.400.07.375.70< .0011.03
성별 (기준: 남)0.340.13.172.68.0081.03
샘플 데이터 다중회귀: 삶의 만족도 ~ 학업스트레스 + 사회적 지지 + 성별(여 = 1 · 남 = 0) (N = 180). 모형 R² = .28, 수정 R² = .27, F(3, 176) = 22.71, p < .001, Durbin-Watson = 2.09

모형이 유의하고(F(3, 176) = 22.71, p < .001) 세 변수가 삶의 만족도 차이의 약 28%를 설명해요(R² = .28, 수정 R² = .27). 한 변수씩 읽으면 다음과 같아요.

  • 학업스트레스: 사회적 지지와 성별을 같게 놓았을 때, 학업스트레스가 1점 높은 응답자는 삶의 만족도가 평균 0.26점 낮아요(B = −0.26, β = −.25, p < .001).
  • 사회적 지지: 사회적 지지가 1점 높은 응답자는 삶의 만족도가 평균 0.40점 높아요(B = 0.40, β = .37, p < .001). 독립변수끼리 상관이 낮은 자료라(최대 VIF = 1.04) β를 서로 비교할 수 있어요. 세 변수 중 절댓값이 가장 커서 상대적 예측력이 가장 커요.
  • 성별: 다른 두 변수를 같게 놓았을 때, 여성이 남성보다 삶의 만족도가 평균 0.34점 높아요(B = 0.34, β = .17, p = .008). 0/1 변수의 B는 다른 독립변수를 같게 놓은 두 집단의 평균 차이예요.

학업스트레스의 B가 단순회귀의 −0.34에서 −0.26으로 작아졌어요. 단순회귀의 B에는 학업스트레스와 조금씩 관련된 사회적 지지(r = −.14)와 성별(r = −.15)의 몫이 섞여 있었는데, 다중회귀는 그 몫을 각 변수에 나눠 주기 때문이에요. 그래서 다중회귀의 B는 「다른 독립변수를 같게 놓았을 때」라는 조건을 붙여 읽어요. 어떤 변수를 함께 넣느냐에 따라 B와 p가 달라지므로, 독립변수 구성은 결과를 보기 전에 이론과 선행 연구로 정해요.

R²는 .11에서 .28로 올라갔어요. 사회적 지지와 성별이 학업스트레스가 설명하지 못한 부분을 추가로 설명한 거예요. 수정 R²(.27)가 R²와 거의 같은 이유는 N = 180에 독립변수가 3개뿐이기 때문이에요. 독립변수가 많고 표본이 작으면 둘의 차이가 커져요.

무엇을 조심해야 하나요?

회귀 결과를 읽고 쓸 때 자주 놓치는 점은 다음 일곱 가지예요.

  • 인과관계가 아니에요. 설문처럼 한 시점에 모은 자료(횡단자료)의 회귀는 「함께 넣은 변수 안에서의 통계적 설명」이에요. 학업스트레스가 삶의 만족도를 낮춘다는 증명이 아니라, 학업스트레스가 높은 사람의 삶의 만족도가 낮은 경향이 있다는 뜻이에요. 논문에서는 「영향을 미쳤다」보다 「예측하였다」「설명하였다」가 안전해요. 논문 제목에는 관행적으로 「…이 …에 미치는 영향」이 쓰이지만, 결과를 서술하는 문장에서는 예측·설명으로 쓰는 편이 더 정확해요.
  • 독립변수는 연속 변수이거나 0/1로 코딩한 두 집단 변수여야 해요. 전공처럼 순서가 없는 명목 변수나 학년처럼 순서만 있는 서열 변수를 1·2·3 숫자 그대로 넣으면, 회귀는 그 숫자를 간격이 같은 값으로 계산해요. 명목 변수는 순서도 간격도 없고 서열 변수는 간격이 같다는 보장이 없으니, 어느 쪽도 숫자 열 하나로는 넣을 수 없어요. 집단이 3개 이상인 이런 변수는 「범주 수 − 1」개의 0/1 더미 변수로 바꿔야 하는데, 이 처리는 연구친구에 순차 추가 예정이에요.
  • 다중공선성을 확인해요. 독립변수끼리 상관이 높으면(같은 개념을 재는 척도 두 개, 하위척도와 총점을 함께 넣는 경우) 각 변수의 몫을 나누기 어려워 B와 SE가 불안정해져요. VIF로 확인하고, 흔히 10 이상을 문제로 봐요(Field, 2018). 샘플 데이터는 독립변수 사이 상관이 −.15에서 .09 사이이고 최대 VIF가 1.04라 겹침이 거의 없어요.
  • 표본 크기를 확인해요. 흔히 쓰는 기준은 모형 검정에 N ≥ 50 + 8k, 개별 계수 검정에 N ≥ 104 + k예요(k = 독립변수 수; Green, 1991). 독립변수가 3개면 각각 74명, 107명이고 샘플 데이터(N = 180)는 둘 다 넘어요. 표본이 작으면 유의한 변수를 놓치기 쉽고 R²가 실제보다 크게 나와요(Cohen et al., 2003).
  • 잔차 가정을 확인해요. 회귀는 잔차가 정규분포를 따르고, 예측값에 따라 퍼진 정도가 같고(등분산), 서로 독립이라고 가정해요(Tabachnick & Fidell, 2019). 등분산은 회귀 결과 표에 없는 값이라 잔차 산점도로 따로 확인해요. 연구친구는 잔차 산점도를 그리지 않아 다른 도구가 필요해요. 샘플 데이터 다중회귀의 잔차는 Shapiro-Wilk W = .99, p = .241로 정규분포에서 벗어난다고 볼 근거가 없었고, 단순회귀는 W = .97, p < .001로 벗어났어요. 다만 표본이 크면 이 검정은 작은 이탈에도 유의하게 나오고, 큰 표본에서는 회귀 추정이 잔차 분포에 덜 좌우된다는 문헌도 있어요(Lumley et al., 2002). 정규성 판단 기준은 「정규성은 어떻게 확인하나요? 왜도·첨도 기준은 얼마인가요?」에 정리했어요. 독립성은 Durbin-Watson으로 확인해요.
  • 이상치를 먼저 확인해요. 회귀는 평균과 분산으로 계산하기 때문에 입력 실수로 들어간 극단값 하나가 B와 R²를 크게 바꿔요. 회귀를 돌리기 전에 종속변수와 독립변수의 이상치를 확인해요(「설문 데이터 이상치, 기준은 무엇이고 어떻게 처리하나요?」).
  • 통제변수와 투입 순서를 정해요. 나이·성별 같은 통제변수는 이론과 선행 연구를 근거로 고르고, 관심 변수와 함께 넣어요. 설문 논문에서는 통제변수를 먼저 넣고 관심 변수를 다음 단계에 넣어 모형 간 R²의 변화(ΔR²)를 보고하는 위계적 회귀도 자주 써요. 연구친구는 지금 모든 독립변수를 동시에 투입하는 방식만 지원해요(위계적 회귀는 순차 추가 예정).

논문에는 뭐라고 쓰나요?

결과 부분에는 표 하나와 문장 두 종류를 써요. 표에는 독립변수마다 B·SE·β·t·p를 적고, 다중회귀면 VIF(또는 공차)도 적고, 마지막 줄에 R²·수정 R²·F(df)·p를 적어요(APA, 2020). 0/1로 코딩한 변수는 기준 집단을 표에 밝혀요.

  1. 모형 문장. 모형이 유의한지와 설명력을 먼저 써요. 「회귀모형은 통계적으로 유의하였으며(F(3, 176) = 22.71, p < .001), 설명력은 28%였다(R² = .28, 수정 R² = .27)」처럼 적어요.
  2. 독립변수 문장. 유의한 변수마다 방향과 β, p를 써요. 「사회적 지지(β = .37, p < .001)는 삶의 만족도를 정적으로 예측하였다」처럼요. B와 SE는 표에 있으니 문장에는 β와 p만 적어도 돼요. 유의하지 않은 변수도 「유의하지 않았다(β = …, p = …)」로 적어요.
  3. 진단과 코딩. 다중회귀면 VIF 최댓값과 Durbin-Watson 값을 한 문장으로 적어요. 0/1 변수의 코딩(남 = 0, 여 = 1)과 결측 처리(제외한 응답자 수 또는 N)는 방법 부분에 밝혀요.
  4. 표. 열은 독립변수, B, SE, β, t(별표), p, 다중회귀면 VIF·공차예요. 별표는 t 오른쪽 위첨자로 붙여요. 마지막 행에 R², 수정 R², F(df), p, D-W를 적고, 표 아래 주에 「t 위첨자 * p < .05, p < .01, * p < .001」처럼 별표 기준을 적어요.

아래 「논문에 쓰는 문장」은 샘플 데이터의 숫자로 쓴 예예요. 변수 이름과 숫자만 바꿔 쓰면 돼요.

논문에 쓰는 문장

방법

삶의 만족도를 종속변수로, 학업스트레스·사회적 지지·성별을 독립변수로 하여, 독립변수를 동시에 투입하는 입력(Enter) 방식으로 다중회귀분석을 실시하였다. 성별은 남성을 0, 여성을 1로 코딩하였으며, 종속변수와 독립변수 중 하나라도 결측인 응답자는 분석에서 제외하였다(N = 180).

다중공선성은 분산팽창지수(VIF)로, 잔차의 독립성은 Durbin-Watson 통계량으로 확인하였다.

결과

회귀모형은 통계적으로 유의하였으며(F(3, 176) = 22.71, p < .001), 모형의 설명력은 28%였다(R² = .28, 수정 R² = .27). 사회적 지지(β = .37, p < .001)와 성별(β = .17, p = .008)은 삶의 만족도를 정적으로, 학업스트레스(β = −.25, p < .001)는 부적으로 예측하였다. 모든 독립변수의 VIF는 1.04 이하였고, Durbin-Watson 통계량은 2.09였다.

단순회귀분석 결과, 학업스트레스는 삶의 만족도를 유의하게 예측하였다(B = −0.34, SE = 0.07, β = −.33, t = −4.61, p < .001). 모형의 설명력은 11%였다(R² = .11, F(1, 178) = 21.26, p < .001).

자주 묻는 질문

B와 β 중 무엇을 보고하나요?

둘 다 표에 적어요. B는 원래 단위의 변화량이라 「1점 높으면 0.40점 높다」처럼 해석하고 다른 연구와 비교할 때 쓰고, β는 단위를 없앤 값이라 같은 표본 안에서 독립변수끼리 예측력을 비교할 때 써요. 이 비교는 독립변수끼리 상관이 낮을 때 뜻이 있어요(Cohen et al., 2003). 본문 문장에는 β와 p를 적고, B와 SE는 표에 두는 방식이 흔해요.

R²가 .10이면 낮은 건가요?

분야에 따라 달라요. Cohen(1988)의 f² 기준으로 .02·.15·.35가 작은·중간·큰 효과이고, R²로 바꾸면 약 .02·.13·.26이에요. 샘플 데이터의 단순회귀(R² = .11)는 f² = 0.12로 작은 효과와 중간 효과 사이, 다중회귀(R² = .28)는 f² = 0.39로 큰 효과에 해당해요. 사람의 태도와 행동을 설문으로 재는 사회과학에서는 R²가 크지 않은 경우가 흔하니, 낮다·높다보다 같은 분야 선행 연구의 R²와 비교해 적어요.

p가 .05보다 크면 그 변수는 빼야 하나요?

빼지 않아요. 독립변수는 결과를 보기 전에 이론과 선행 연구로 정하고, 유의하지 않은 변수도 그대로 두고 결과를 보고해요(Cohen et al., 2003). 유의한 변수만 남기려고 여러 번 돌리면 그 결과는 이 표본에만 맞춰진 것이라 다른 표본에서 재현되기 어려워요. 유의하지 않다는 결과 자체가 「이 변수들을 함께 고려해도 관계가 확인되지 않았다」는 정보예요.

성별 같은 범주 변수를 넣어도 되나요?

두 집단이면 0과 1로 코딩해서 넣을 수 있어요. 이때 B는 1로 코딩한 집단이 0 집단(기준)보다 종속변수가 평균 얼마나 높은지예요. 샘플 데이터에서는 여성(1)이 남성(0)보다 삶의 만족도가 0.34점 높았어요(p = .008). 집단이 3개 이상인 변수는 「범주 수 − 1」개의 0/1 더미 변수로 바꿔야 하는데, 이 처리는 연구친구에 순차 추가 예정이에요.

연구친구에서는

종속변수 하나와 독립변수를 고르면 단순·다중회귀가 R로 계산되고, 결과가 논문 형식으로 정리돼요.

  • APA 형식 회귀표를 보여드려요. 독립변수마다 B·SE·β·t(위첨자 별표)·p, 다중회귀면 VIF·공차 열과 R²·수정 R²·F·p·D-W 통계행까지 표에 들어가고, Word·한글에 붙여 넣을 수 있어요.
  • 핵심 결론과 결과 해설이 함께 나와요. 모형(F·R²) → 개별 계수(B·β·p) 순서로 읽는 해설과 다중공선성·잔차 진단(VIF·D-W·잔차 정규성) 판정이에요.
  • 논문에 쓰는 문장을 만들어 드려요. 모형 유의성·설명력·유의한 독립변수의 방향을 논문체 문장으로 정리해요.
  • 독립변수는 숫자형과 2집단 변수만 들어가요. 2집단 변수는 0/1로 코딩해 계산하고 기준 집단을 표에 표시해요. 집단이 3개 이상인 변수는 순차 추가 예정이에요.

참고 자료

  • Cohen, J., Cohen, P., West, S. G., & Aiken, L. S. (2003). Applied multiple regression/correlation analysis for the behavioral sciences (3rd ed.). Erlbaum. · B·β의 뜻과 편회귀계수(다른 독립변수를 같게 놓았을 때) 해석, β 비교는 독립변수끼리 상관이 낮을 때 유효, 독립변수 구성은 이론 기준, 작은 표본에서 R²가 커지는 이유
  • Tabachnick, B. G., & Fidell, L. S. (2019). Using multivariate statistics (7th ed.). Pearson. · 회귀 가정(잔차 정규성·등분산·독립)과 다중공선성·표본 크기 점검 절차
  • Field, A. (2018). Discovering statistics using IBM SPSS Statistics (5th ed.). Sage. · VIF 10·공차 .10 기준, Durbin-Watson 1 미만·3 초과 경고 기준, 큰 표본에서 정규성 검정이 작은 이탈에도 유의한 점
  • Hair, J. F., Black, W. C., Babin, B. J., & Anderson, R. E. (2010). Multivariate data analysis (7th ed.). Pearson. · VIF 10(공차 .10) 관례와 표본이 작을 때 더 엄격한 값(3~5)을 함께 살피라는 권고
  • Green, S. B. (1991). How many subjects does it take to do a regression analysis? Multivariate Behavioral Research, 26(3), 499–510. · 표본 크기 경험칙 N ≥ 50 + 8k(모형 검정)·N ≥ 104 + k(개별 계수)
  • Cohen, J. (1988). Statistical power analysis for the behavioral sciences (2nd ed.). Erlbaum. · 회귀 효과크기 f²의 .02·.15·.35 기준과 f² = R² / (1 − R²) 관계
  • Lumley, T., Diehr, P., Emerson, S., & Chen, L. (2002). The importance of the normality assumption in large public health data sets. Annual Review of Public Health, 23, 151–169. · 큰 표본에서 회귀 추정이 잔차 분포에 덜 좌우된다는 근거
  • American Psychological Association. (2020). Publication manual of the American Psychological Association (7th ed.). · 통계 표기(B, SE, β, t, p, R², F)와 회귀표 형식 관례

함께 보기