고1-고3정보AI·소프트웨어

데이터 분석 보고서 서론 쓰기: EDA·상관분석과 TF-IDF 맞춤 대본

자료와 정보 영역의 서론을 실제 분석 단위와 처리 조건에 맞춰 구체화하기

목차

  1. 서론의 네 가지 연결 고리
  2. 수치형 데이터 서론 대본
  3. 텍스트 데이터 서론 대본
  4. 분석 후 서론 수정
  5. 면접 연습
  6. 제출 전 점검표

핵심 요약

  • 수집·전처리·분석·한계를 연결합니다
  • 상관과 인과, 단어 가중치와 문서 입장을 구분합니다
  • 수식과 라이브러리 설정을 일치시킵니다
데이터 분석, EDA, TF-IDF 키워드와 산점도·문서 분석을 표현한 일러스트

데이터 분석 보고서의 서론은 자료와 그래프의 목록이 아니라, 어떤 질문을 어떤 자료와 처리 절차로 검토할지 안내하는 문단입니다. 이 글은 정보 교과의 자료 수집·표현·가공 영역을 중심으로 수치형 데이터의 EDA·상관분석과 텍스트의 TF-IDF 분석에 맞춘 서론 대본을 제공합니다.

교과서 단원명과 순서는 출판사와 교육과정에 따라 다르므로, 반드시 자신의 교과서와 수행평가 안내를 확인하세요. 대본은 제출용 완성 원고가 아닌 작성 틀입니다. [대괄호]를 실제 자료·조건으로 바꾸고, 아직 수행하지 않은 분석은 계획형으로 표시합니다. 이 방법이 특정 대학의 평가 등급이나 합격을 보장하지 않습니다.

1. 데이터 분석 서론의 네 가지 연결 고리

  1. 배경·필요성: 교과 개념에서 생긴 질문과 조사할 현상을 구체화합니다.
  2. 목적·방법: 자료의 출처, 분석 단위, 전처리 기준, 비교할 지표를 밝힙니다.
  3. 이론·교과 연계: 실제 배운 개념과 추가 학습한 수식을 구분합니다.
  4. 범위·구성: 기간·지역·문서 수 등 범위를 한정하고 본론과 한계 분석의 순서를 안내합니다.

분석 흐름은 수집 → 품질 확인·전처리 → EDA 또는 텍스트 가중치 계산 → 시각화 → 해석·한계 점검입니다. EDA는 특정 수식 하나가 아니라 분포·관계·품질을 살펴보는 탐색 과정입니다. 자료가 작아도 질문과 비교 기준이 명확하면 탐구가 가능하며, 실제 규모를 확인하지 않고 ‘빅데이터’라고 부를 필요는 없습니다.

2. 수치형 데이터: 공공자료·EDA·상관분석 대본

주제 예시: 같은 지역·연도의 환경 지표와 보건 지표를 결합하여 분포와 선형 상관관계를 탐색하기.

① 탐구 배경·필요성

정보 교과의 [자료 수집·표현·가공 관련 단원]에서 자료를 분석 가능한 형태로 정리하는 절차를 배웠다. [수업 자료 또는 실제로 확인한 지역 현안]을 계기로 지역별 환경 지표와 보건 지표가 함께 달라지는 양상을 확인하고 싶었다. 이에 개인 경험 대신 공개 통계의 분석 단위를 맞추어 두 지표의 관계를 탐색하는 질문을 설정했다.

② 탐구 목적·구체적 방법

본 탐구의 목적은 [자료 제공 기관·통계명]에서 [기간·지역·관측치 수]의 자료를 확보하고, 품질 점검과 EDA를 거쳐 [변수 X]와 [변수 Y]의 선형 상관관계를 살펴보는 것이다. [실제로 이용한 API·CSV 다운로드 등]로 수집하고, Pandas와 NumPy를 활용해 중복·자료형·단위·결측치·이상값 후보를 확인한다. 처리 전후 관측치 수와 분포를 비교하고, 산점도와 Pearson 상관계수를 함께 해석한다.

③ 이론적 배경·교과 연계

정보 교과의 [리스트·배열·반복문 등 실제 학습한 개념]을 자료 저장과 계산의 기반으로 삼는다. 수학에서 학습한 평균·분산·표준편차를 활용하고, 공분산과 상관계수는 필요한 경우 추가 학습 내용으로 구분한다. 같은 관측치 쌍에서 평균을 뺀 편차의 곱을 합산하고 두 변수의 편차 제곱합으로 정규화하여 Pearson r을 직접 계산한다. 계산 결과를 동일한 결측치 처리 조건의 라이브러리 결과와 비교한다.

④ 탐구 범위·보고서 구성

분석은 [행정구역 수준·기간·집계 기준]에 한정한다. 제2장에서는 출처와 변수 정의, 자료 결합·전처리 이력, 분포·산점도·상관계수를 제시한다. 제3장에서는 결측치 처리, 이상값 후보, 표본 선택과 교란 요인에 따른 해석의 한계를 정리한다. 이번 분석은 두 지표의 연관성을 탐색하며 인과관계를 입증하는 연구는 아니다.

대본을 정밀하게 만드는 수치·방법 체크

  • 자료 출처: 공공데이터포털, KOSIS, 서울 열린데이터광장은 서로 다른 서비스입니다. 실제 이용한 기관·통계명·접근 경로·확인일·이용 조건을 기록합니다.
  • 결합 단위: 지역명·행정구역 코드·연도·단위·집계 주기를 맞춥니다. 다른 기준의 자료를 단순히 같은 행에 붙이지 않습니다.
  • 인구 규모: 환자 수 같은 절대 건수와 인구 대비 비율은 의미가 다릅니다. 분모를 확인하고 비교 가능한 지표를 선택합니다.
  • 결측치: 0, 미관측, 비공개, 해당 없음은 다릅니다. 삭제·대체 기준을 밝히고 처리 전후 표본 수를 기록합니다. 평균 대체가 분산과 상관관계를 바꿀 수 있음을 점검합니다.
  • 이상값: 크다는 이유만으로 삭제하지 않습니다. 입력 오류인지 실제 극단 관측인지 구분하고, 포함·제외 결과를 비교합니다.
  • 상관계수: r=Σ(xᵢ−x̄)(yᵢ−ȳ)/√[Σ(xᵢ−x̄)²Σ(yᵢ−ȳ)²]입니다. 두 변수 중 하나가 상수이면 분모가 0이므로 정의되지 않습니다. 같은 관측치 쌍과 충분한 자료 수를 확보합니다.
  • 해석: Pearson r은 선형 관계를 요약합니다. 비선형 관계·이상값·시간 추세의 영향을 산점도와 함께 확인합니다. 상관이 인과를 뜻하지 않으며, 지역 집계 관계를 개인에게 그대로 적용하는 생태학적 오류도 피합니다.

이상값 기준 예시: 사분위범위 IQR=Q3−Q1를 사용해 Q1−1.5×IQR 미만 또는 Q3+1.5×IQR 초과 관측을 후보로 표시할 수 있습니다. 이는 조사할 후보를 찾는 관례이지 자동 삭제 명령이나 오류 판정이 아닙니다. 표본과 사분위수 계산 방식도 명시하세요.

3. 텍스트 데이터: 문서 수집·TF-IDF 대본

주제 예시: 환경 정책 관련 문서에서 빈도와 TF-IDF를 비교하여 문서별 특징적인 단어를 찾기.

① 탐구 배경·필요성

[자료 표현·문자열 처리 관련 단원]을 학습하며 문장 자료가 분석을 위해 어떤 구조로 바뀌는지 궁금해졌다. [선정한 주제] 관련 문서에서 자주 등장하는 단어와 특정 문서에 특징적으로 나타나는 단어의 차이를 확인하기 위해, 문서군의 단어 분포를 비교하는 탐구를 계획했다.

② 탐구 목적·구체적 방법

본 탐구는 [출처·수집 기간·문서 수·선정 기준]의 텍스트를 확보하고, 중복 제거와 단어 분리 후 단어 빈도와 TF-IDF 가중치를 비교하는 것을 목적으로 한다. 자료는 [이용이 허용된 API·다운로드·직접 작성한 문서 등]로 확보한다. 실제 사용한 [형태소 분석기 이름·버전 또는 단순 분리 방식]과 불용어 목록을 공개하고, 가중치가 높은 단어를 표와 막대그래프로 제시한다.

③ 이론적 배경·교과 연계

정보 교과의 문자열 처리와 딕셔너리 구조로 문서별 단어 빈도를 저장한다. TF는 해당 문서 내 단어 빈도를 전체 토큰 수로 나누어 계산하고, IDF는 ln((N+1)/(df+1))+1로 정의한다. N은 전체 문서 수, df는 해당 단어가 등장한 문서 수이다. TF-IDF는 두 값의 곱이며, 문서군에 흔한 단어의 상대적 가중치를 낮추는 과정을 비교한다. 로그와 평활화는 실제 학습 범위에 맞춰 추가 학습으로 표시한다.

④ 탐구 범위·보고서 구성

자료 범위는 [언론사·기관·문서 종류·기간·언어]로 제한한다. 제2장에서는 수집·전처리 규칙과 단어 빈도·TF-IDF 비교 결과를 제시하고, 제3장에서는 표본 선택, 중복 기사, 형태소 분리, 다의어·부정 표현에 따른 해석의 한계를 정리한다. 가중치만으로 문서의 입장이나 전체 여론을 판정하지 않는다.

TF-IDF와 텍스트 해석의 기술 점검

  • 수식의 일관성: IDF에는 여러 정의가 있습니다. 원문의 ln(N/(1+df))는 df=N일 때 음수가 될 수 있습니다. 이 글은 양쪽에 평활화를 적용하고 1을 더하는 정의를 채택했습니다. TF 정규화와 벡터 정규화 여부도 공개하고, 다른 라이브러리 기본값과 무조건 같다고 가정하지 않습니다.
  • 로그의 역할: 희귀 단어와 흔한 단어의 차이를 압축하는 설계입니다. 로그를 썼다는 사실만으로 객관성이나 학술적 우수성이 입증되지는 않습니다.
  • 도구의 역할: BeautifulSoup는 HTML 파싱 도구이며 수집 허가를 대신하지 않습니다. KoNLPy를 쓰면 실제 분석기·사전·설치 조건을 밝혀야 합니다. 아직 사용하지 않은 도구를 수행한 방법으로 적지 않습니다.
  • 권리와 접근: 이용약관·저작권·개인정보·접근 규칙을 확인하고 과도한 요청과 차단 우회를 피합니다. 가능하면 이용 조건이 명확한 자료를 선택합니다.
  • 전처리: 불용어 목록과 선정 이유를 공개합니다. 부정어를 지우면 의미가 뒤집힐 수 있으며, 고유명사 분리나 동의어 처리도 결과를 바꿉니다.
  • 해석 범위: 텍스트를 숫자로 분석하는 것은 곧바로 질적 연구를 수행한 것과 같지 않습니다. TF-IDF는 문서군 안에서 단어의 상대적 특징을 보는 도구이며 감정·입장·프레이밍을 직접 증명하지 않습니다. 필요하면 원문 문맥을 별도 기준으로 읽고 근거를 제시합니다.
  • 시각화: 워드클라우드는 보조 그림입니다. 단어 크기의 의미를 명시하고 정확한 값은 표로 제공합니다. 수집·토큰화 오류와 번역의 오역은 다른 문제이므로 실제 수행 과정에 맞는 한계를 기록합니다.

4. 분석 후 서론을 수정하는 방법

서론 초안은 탐구 전에 작성할 수 있습니다. 분석 중 범위·처리 기준이 바뀌었다면 최종 서론을 실제 본론에 맞춰 수정하세요. ‘100% 완료한 뒤에만 써야 한다’는 규칙 대신, 문장마다 자료나 코드·표의 근거를 연결하는 것이 실용적입니다.

  • ‘수집했다’ → 자료 목록·출처·기간·관측치 수가 있는지 확인합니다.
  • ‘정제했다’ → 처리 기준과 처리 전후 수, 삭제·대체 이유를 남깁니다.
  • ‘직접 구현했다’ → 직접 작성한 코드와 외부 도구에 맡긴 부분을 구분합니다.
  • ‘관계를 확인했다’ → 지표와 그래프가 무엇을 뒷받침하고 무엇을 말하지 못하는지 적습니다.
  • ‘한계를 분석했다’ → 실제로 점검한 민감도와 아직 확인하지 못한 조건을 구분합니다.

다중공선성은 여러 설명 변수 사이의 강한 선형 관계 문제이고, 과적합은 학습 자료에 지나치게 맞춘 모형이 새로운 자료에서 잘 일반화하지 못하는 문제입니다. 단순 EDA나 TF-IDF 서론에 두 용어를 의례적으로 넣지 마세요. 실제 예측 모형이나 다변량 분석을 추가한 경우에 해당 조건에서 점검합니다. 한계를 정직하게 쓰는 것은 좋은 연구 습관이지 합격의 보장 수단은 아닙니다.

5. 서론에서 이어지는 면접 연습

다음 단계는 설명 연습용이며 특정 대학의 공식 면접 체계가 아닙니다.

1단계: 정의와 실제 수행

질문: “상관계수의 분모는 어떤 역할을 하나요? TF-IDF에서 로그를 사용하는 이유는 무엇인가요?” 기호·입력·계산 순서를 자신의 말로 설명하고 손계산과 코드의 연결 위치를 보여줍니다.

2단계: 전처리와 한계

질문: “이상값 제거 기준은 무엇이며, 제거가 편향을 만들 수 있나요?” 표시 기준, 실제 삭제 여부와 이유, 포함·제외 결과의 차이를 답합니다. 자료가 부족해 확인하지 못한 비교는 그렇게 밝힙니다.

3단계: 사회적 전이

질문: “이 결과를 정책에 활용한다면 어떤 집단이 자료에서 빠질 수 있나요?” 디지털 접근성, 대표성, 지역 집계와 개인의 차이, 개인정보, 이의제기와 추가 검증을 자신의 자료 범위에 연결합니다.

6. 제출 전 점검표

  • 교과서와 교사의 평가 기준을 확인했는가?
  • 주제·자료·전처리·방법·범위가 같은 질문을 향하는가?
  • 실제 자료 규모와 관측 단위, 기간, 출처를 밝혔는가?
  • 결측치와 이상값 처리를 정당화하고 전후 결과를 비교했는가?
  • 수식의 정의·정규화·라이브러리 설정이 일치하는가?
  • 상관과 인과, 단어 가중치와 문서 입장을 구분했는가?
  • 실제로 한 일과 후속 계획, 자신의 코드와 외부 도구를 구분했는가?
  • 서론의 각 문장에 본론의 근거가 있는가?

학생부 세특은 교사가 작성합니다. 학생은 실제 수업 활동과 분석 과정, 수정 이력, 출처를 사실대로 정리하세요. 이전 정보 교과 영역별 서론 가이드와 함께 활용하면 자료 분석 영역의 방법과 범위를 더 구체화할 수 있습니다.

관련 글

운영자 안내

이 글은 일반 교육 정보이며 특정 대학 합격·학생부 평가·면접 결과를 보장하지 않습니다. 학교와 대학의 공식 안내를 함께 확인해 주세요.

글 작성자

탐구가이드 편집팀

고교학점제, 탐구보고서 작성, 세특 연결, 서류기반면접 준비 흐름을 학생과 학부모 눈높이에 맞춰 정리합니다.