One resident survey, end to end: questionnaire to report
Synthetic data, 1,000 respondents, 32 columns, six steps — intake, preprocessing, reliability, factor analysis, group comparison, regression
Research question — What raises overall satisfaction, and what differs by district?
Raw data 원자료_시민인식조사_2026.csv · 12 rows
Synthetic demonstration data — not a real survey and not any municipality’s data (the city is written as a placeholder). The 1,000-row sample comes from a seeded generator in the repository, and every table and sentence was produced by running the repository’s own engines. Those values were then checked cell by cell against an independently computed answer sheet: 22 cells, 0 mismatches.
| id | 성별 | 연령대 | 거주권역 | 거주기간_년 | q1 | q5 | q16 | q19_전반만족 | q21_우선투자 |
|---|---|---|---|---|---|---|---|---|---|
| R0001 | 여성 | 30-39세 | 동부권 | 16 | 3 | 4.0 | 1 | 3 | 교통 |
| R0002 | 남성 | 19-29세 | 서부권 | 10 | 3 | 4.0 | 4 | 5 | 환경·녹지 |
| R0003 | 여성 | 30-39세 | 동부권 | 4 | 4 | 5.0 | 2 | 3 | 문화·체육 |
| R0004 | 여성 | 40-49세 | 서부권 | 27 | 2 | 1.0 | 3 | 3 | 환경·녹지 |
| R0005 | 여성 | 40-49세 | 서부권 | 35 | 2 | 3.0 | 3 | 복지·돌봄 |
The study, step by step — what was actually produced
① Intake — who answered
Count first: how many fall in each gender, district and investment priority, and where cells are missing. Skip this and every later test reports without saying how many people it ran on.
총 1000명을 대상으로 성별, 거주권역, _우선투자의 빈도분석을 실시하였다. 성별은 2개 범주 가운데 '남성'이 가장 많았다(506명, 50.6%; 유효 1000명, 결측 0건). 거주권역은 4개 범주 가운데 '중앙권'이 가장 많았다(273명, 27.3%; 유효 1000명, 결측 0건). _우선투자는 6개 범주 가운데 '교통'이 가장 많았다(210명, 21.0%; 유효 1000명, 결측 0건). 전체 결측치는 0건으로 데이터 품질이 양호하였다.
② Preprocessing — flip the reverse items, build the scales
Two reverse-coded items are flipped back, then each scale becomes the mean of its items. The flip uses the same one-line formula the preprocessing screen uses. Then the shape of overall satisfaction and the four scale means is checked.
_전반만족 등 5개 변수에 대하여 기술통계 분석을 실시하였다(N = 1000). _전반만족의 평균은 3.24이었다(SD = 1.27, Mdn = 3.00, 범위 1.00–5.00). 왜도 = -0.17, 첨도 = -1.01로 정규 범위 내였다. 행정서비스_평균의 평균은 3.37이었다(SD = 0.87, Mdn = 3.40, 범위 1.00–5.00). 왜도 = -0.17, 첨도 = -0.62로 정규 범위 내였다. 생활환경_평균의 평균은 3.22이었다(SD = 0.89, Mdn = 3.20, 범위 1.00–5.00). 왜도 = -0.19, 첨도 = -0.64로 정규 범위 내였다. 주민참여_평균의 평균은 2.87이었다(SD = 0.91, Mdn = 3.00, 범위 1.00–5.00). 왜도 = 0.08, 첨도 = -0.56으로 정규 범위 내였다. 신뢰_평균의 평균은 3.02이었다(SD = 0.97, Mdn = 3.00, 범위 1.00–5.00). 왜도 = -0.00, 첨도 = -0.71로 정규 범위 내였다. 전체 분석 과정에서 16건의 결측치가 확인되었다.
③ Reliability — do these items hang together
Cronbach alpha checks whether the five administrative-service items really measure one thing. Item-total correlations and alpha-if-deleted come back with it.
행정서비스의 내적 일관성 신뢰도를 분석한 결과, Cronbach's α = .81이었다. 총 5개 문항, 910명 응답 데이터를 분석하였다. 수정된 문항-총점 상관은 .52에서 .67 사이였다. 표준화 α = .81, 평균 문항간 상관 = .46.
④ Factor analysis — do they split into four as designed
All eighteen items go in at once to see how many groups they form. KMO and Bartlett say first whether the data support factoring at all; eigenvalues and cumulative explained variance follow.
KMO = .90, Bartlett 구형성 검정 χ²(153, N = 603) = 3685.10, p < .001. Varimax (직교) 회전을 적용하여 4개 요인을 추출하였으며, 전체 분산의 58.8%를 설명하였다. 적재량 0.4 미만 문항: 없음. 교차적재 문항: 없음. 요인 1은 q12, q11, q14와 관련이 깊다. 요인 2는 q7, q8, q6과 관련이 깊다. 요인 3은 q2, q1, q4와 관련이 깊다. 분석 표본은 N = 603명이었다. 요인 적재량은 .61에서 .80 사이였다. 요인 1은 분산의 13.5%를 설명하였다, 요인 2는 분산의 15.3%를 설명하였다, 요인 3은 분산의 15.5%를 설명하였다, 요인 4는 분산의 14.5%를 설명하였다. 공통성은 .39에서 .73 사이였다.
⑤ Group comparison — does living environment differ by district
With four groups you run one ANOVA, not three t-tests. When the effect is significant, the post-hoc test (Tukey HSD) names which district pair separated.
거주권역에 따른 생활환경_평균의 차이를 검정하기 위해 일원배치 분산분석을 실시하였다(N = 1000). 생활환경_평균에 대한 일원배치 분산분석 결과, 집단 간 유의한 차이가 있었다(F(3, 996) = 8.52, p < .001, η² = .03). 집단별 기술통계는 동부권(M = 3.12, SD = 0.88), 서부권(M = 3.04, SD = 0.87), 신도시권(M = 3.36, SD = 0.91), 중앙권(M = 3.35, SD = 0.87)이었다. 등분산 가정은 충족되었다(Levene p = .890). 사후검정(Tukey HSD): 동부권↔신도시권(p = .021), 동부권↔중앙권(p = .024), 서부권↔신도시권(p < .001), 서부권↔중앙권(p < .001).
⑥ Regression — what raises overall satisfaction
The four scale means predict overall satisfaction. Standardized beta gives the priority order across domains, and VIF answers whether the predictors are too much alike.
_전반만족에 대한 다중회귀분석을 실시하였다. 회귀모형은 통계적으로 유의하였다(R² = .59, 수정 R² = .59, F(4, 979) = 355.56, p < .001). 모형의 설명력은 59.2%였다. 이는 투입된 4개 독립변수가 _전반만족 분산의 약 59%를 설명함을 의미한다. 각 독립변수의 영향력을 살펴보면, 행정서비스_평균은 _전반만족에 유의한 정적(+) 영향을 미쳤다(B = 0.54, SE = 0.04, β = .37, t(979) = 14.46, p < .001). 다음으로 생활환경_평균은 _전반만족에 유의한 정적(+) 영향을 미쳤다(B = 0.37, SE = 0.03, β = .26, t(979) = 11.15, p < .001). 다음으로 신뢰_평균은 _전반만족에 유의한 정적(+) 영향을 미쳤다(B = 0.29, SE = 0.03, β = .22, t(979) = 8.72, p < .001). 마지막으로 주민참여_평균은 _전반만족에 유의한 정적(+) 영향을 미쳤다(B = 0.25, SE = 0.03, β = .18, t(979) = 7.49, p < .001). 즉, 행정서비스_평균, 생활환경_평균, 신뢰_평균, 주민참여_평균이 높을수록 _전반만족이 높아지는 것으로 해석할 수 있다. 다중공선성 진단 결과 최대 VIF는 22.22(행정서비스_평균)로, 다중공선성 우려이었다.
Key results
① Intake — 빈도표
누적 퍼센트: 유효 응답 기준 누적 비율
| 변수명 | 항목 | 빈도 | 퍼센트 | 유효 퍼센트 | 누적 퍼센트 |
|---|---|---|---|---|---|
| 성별 | 남성 | 506 | 50.6 | 50.6 | 50.6 |
| 성별 | 여성 | 494 | 49.4 | 49.4 | 100.0 |
| 거주권역 | 동부권 | 224 | 22.4 | 22.4 | 22.4 |
| 거주권역 | 서부권 | 246 | 24.6 | 24.6 | 47.0 |
| 거주권역 | 신도시권 | 257 | 25.7 | 25.7 | 72.7 |
| 거주권역 | 중앙권 | 273 | 27.3 | 27.3 | 100.0 |
| q21_우선투자 | 교통 | 210 | 21.0 | 21.0 | 21.0 |
| q21_우선투자 | 문화·체육 | 131 | 13.1 | 13.1 | 34.1 |
| q21_우선투자 | 복지·돌봄 | 176 | 17.6 | 17.6 | 51.7 |
| q21_우선투자 | 일자리·경제 | 166 | 16.6 | 16.6 | 68.3 |
| q21_우선투자 | 주거·도시정비 | 137 | 13.7 | 13.7 | 82.0 |
| q21_우선투자 | 환경·녹지 | 180 | 18.0 | 18.0 | 100.0 |
| 합계 | 1000 | 100.0 | 100.0 | 100.0 |
② Preprocessing — 기술통계량 요약
| 변수 | N | 평균 | 표준편차 | 분산 | 표준오차 | 중위수 | 1사분위수 | 3사분위수 | 최소값 | 최대값 | 왜도 | 첨도 |
|---|---|---|---|---|---|---|---|---|---|---|---|---|
| q19_전반만족 | 984 | 3.24 | 1.27 | 1.62 | 0.041 | 3.0 | 2.0 | 4.0 | 1.0 | 5.0 | -0.174 | -1.014 |
| 행정서비스_평균 | 1000 | 3.37 | 0.87 | 0.76 | 0.028 | 3.4 | 2.8 | 4.0 | 1.0 | 5.0 | -0.173 | -0.617 |
| 생활환경_평균 | 1000 | 3.22 | 0.89 | 0.80 | 0.028 | 3.2 | 2.6 | 3.8 | 1.0 | 5.0 | -0.189 | -0.642 |
| 주민참여_평균 | 1000 | 2.87 | 0.91 | 0.83 | 0.029 | 3.0 | 2.2 | 3.5 | 1.0 | 5.0 | 0.077 | -0.563 |
| 신뢰_평균 | 1000 | 3.02 | 0.97 | 0.93 | 0.031 | 3.0 | 2.2 | 3.8 | 1.0 | 5.0 | -0.003 | -0.713 |
③ Reliability — 신뢰도 분석 결과 (α = 0.809, 우수)
Cronbach's α = 0.809 (우수) · 표준화 α = 0.809 · 문항 수 = 5, 사례 수 = 910 · 평균 문항간 상관 = 0.459 · 판정 기준: 문항-총점 상관 0.30 미만 = 검토 필요, 0.30~0.40 = 수용 가능, 0.40 이상 = 양호
| 문항 | 평균 | 표준편차 | 문항-총점 상관 | 제거 시 α |
|---|---|---|---|---|
| q1 | 3.410 | 1.153 | 0.672 | 양호 |
| q2 | 3.387 | 1.179 | 0.647 | 양호 |
| q3 | 3.357 | 1.176 | 0.579 | 양호 |
| q4 | 3.388 | 1.164 | 0.562 | 양호 |
| q5 | 3.298 | 1.174 | 0.523 | 양호 |
④ Factor analysis — 요인분석 적합성 검정
| 지표 | 값 | 해석 |
|---|---|---|
| KMO | 0.8989 | 우수 |
| Bartlett χ² | 3685.10 | - |
| Bartlett df | 153 | - |
| Bartlett p | < .001 | 적합 |
④ Factor analysis — 고유값 및 설명 분산
| 요인 | 고유값 | 분산비율 | 누적 | Kaiser |
|---|---|---|---|---|
| 1 | 5.6906 | 31.61% | 31.61% | ● |
| 2 | 2.0844 | 11.58% | 43.19% | ● |
| 3 | 1.5658 | 8.70% | 51.89% | ● |
| 4 | 1.2520 | 6.96% | 58.85% | ● |
| 5 | 0.7705 | 4.28% | 63.13% | |
| 6 | 0.7115 | 3.95% | 67.08% | |
| 7 | 0.6752 | 3.75% | 70.83% | |
| 8 | 0.6390 | 3.55% | 74.38% | |
| 9 | 0.5871 | 3.26% | 77.64% | |
| 10 | 0.5626 | 3.13% | 80.77% |
⑤ Group comparison — 생활환경_평균 — 사후검정 (Tukey HSD)
| 비교 | 평균차 | 표준오차 | p | 95% CI | 판정 |
|---|---|---|---|---|---|
| 동부권 vs 서부권 | 0.090 | 0.058 | .690 | [-0.120, 0.300] | 비유의 |
| 동부권 vs 신도시권 | -0.233 | 0.057 | .021 | [-0.440, -0.025] | 유의 |
| 동부권 vs 중앙권 | -0.226 | 0.056 | .024 | [-0.430, -0.021] | 유의 |
| 서부권 vs 신도시권 | -0.322 | 0.056 | < .001 | [-0.525, -0.120] | 유의 |
| 서부권 vs 중앙권 | -0.315 | 0.055 | < .001 | [-0.515, -0.116] | 유의 |
| 신도시권 vs 중앙권 | 0.007 | 0.054 | > .999 | [-0.190, 0.205] | 비유의 |
⑤ Group comparison — 거주권역에 따른 차이분석
생활환경_평균: η²=0.025, ω²=0.022, 사후검정(Tukey HSD): 동부권↔신도시권(p=.021), 동부권↔중앙권(p=.024), 서부권↔신도시권(p=< .001), 서부권↔중앙권(p=< .001)
| 변수 | 집단 | N | 평균 | 표준편차 | SS | df | MS | F | p | η² | ω² |
|---|---|---|---|---|---|---|---|---|---|---|---|
| 생활환경_평균 | 동부권 | 224 | 3.12 | 0.882 | 19.925 | 3 | 6.642 | 8.520 | < .001 | 0.025 | 0.022 |
| 서부권 | 246 | 3.04 | 0.874 | ||||||||
| 신도시권 | 257 | 3.36 | 0.909 | ||||||||
| 중앙권 | 273 | 3.35 | 0.867 | ||||||||
| 집단 내 | 776.402 | 996 | 0.780 | ||||||||
| 합계 | 796.326 | 999 |
⑥ Regression — _전반만족에 영향을 미치는 요인
종속변수: _전반만족 · N = 984 · 모형 요약 행: R²·수정 R²는 값 열에, 모형 F는 검정통계량·유의확률 열에 싣습니다. · 다중공선성 주의: 행정서비스_평균, 생활환경_평균, 주민참여_평균, 신뢰_평균
| 변수 | B | 표준오차 | 베타 | t | p | VIF |
|---|---|---|---|---|---|---|
| (상수) | -1.331 | 0.125 | -10.673 | < .001 | - | |
| 행정서비스_평균 | 0.537 | 0.037 | 0.369 | 14.461 | < .001 | 22.22 |
| 생활환경_평균 | 0.369 | 0.033 | 0.260 | 11.148 | < .001 | 15.78 |
| 주민참여_평균 | 0.246 | 0.033 | 0.177 | 7.489 | < .001 | 13.67 |
| 신뢰_평균 | 0.286 | 0.033 | 0.217 | 8.721 | < .001 | 15.58 |
| R² | 0.592 | |||||
| 수정 R² | 0.591 | |||||
| 모형 F(4, 979) | 355.563 | < .001 |
Representative quotes
Every quote is a sentence that exists in the raw data (excerpt-existence check passed).
Paper-ready tables
Copying opens an editable duplicate in your workbench — this showcase stays as it is.