데이터사이언스 K-평균 군집화 — 평면좌표 거리와 중점으로 초기 중심 배치 비교
공통수학2 · 평면좌표 · 데이터사이언스
관련 성취기준
- [10공수2-01-01] 선분의 내분을 이해하고, 내분점의 좌표를 계산할 수 있다.
1거리와 중심이 데이터 묶음에 미치는 영향
평면좌표 단원에서 배운 두 점 사이의 거리와 선분의 중점은 처음에는 도형의 길이나 위치를 구하는 계산으로 보였지만, 여러 점이 흩어져 있는 자료를 ‘어떤 기준으로 묶을 것인가’를 설명하는 도구로도 해석될 수 있다. 예를 들어 좌표평면에 여러 점이 있을 때, 각 점이 어느 중심에 더 가까운지를 거리로 판단하면 비슷한 점끼리 하나의 집단으로 나눌 수 있다. 즉, 교과서의 좌표 개념이 단순한 계산을 넘어 데이터 분류의 기준으로 확장된다는 점에서 탐구의 출발점을 찾았다.
특히 같은 데이터라도 초기 중심을 어디에 두는가에 따라 결과가 달라진다는 점이 흥미로웠다. 어떤 점들을 먼저 중심으로 잡느냐에 따라 각 점이 속하는 군집이 바뀌고, 반복 계산 뒤의 최종 중심도 달라질 수 있다. 이는 수학적 규칙이 같아도 시작 조건이 다르면 결과가 달라질 수 있음을 보여 준다. 따라서 단순히 ‘가장 가까운 곳에 배정한다’는 규칙만 아는 것보다, 처음 중심을 정하는 방식까지 함께 살피는 것이 더 깊은 이해라고 판단하였다.
이번 탐구에서는 초기 중심 배치 방식을 무작위 배치, 먼 점 우선 배치, 중점 기준 배치의 세 가지로 나누어 비교하고자 한다. 무작위 배치는 가장 단순한 기준이고, 먼 점 우선 배치는 중심 사이 간격을 크게 두려는 방식이며, 중점 기준 배치는 두 점 또는 점들의 대표 위치를 활용한다는 점에서 교과 개념과 직접 연결된다. 세 방법을 같은 데이터에 적용해 보면, 거리와 중심이라는 익숙한 개념이 실제로 군집 형성 결과를 얼마나 바꾸는지 확인할 수 있다.
탐구 방향을 분명히 하기 위해 비교 항목도 미리 정리하였다. 독립변인은 초기 중심 배치 방식이며, 결과는 각 점이 어디에 묶이는지, 최종 중심이 어디로 이동하는지, 그리고 군집 내부가 얼마나 조밀하게 모이는지로 판단할 수 있다. 이를 정리하면 다음과 같다.
| 비교 항목 | 내용 |
|---|---|
| 독립변인 | 무작위 배치, 먼 점 우선 배치, 중점 기준 배치 |
| 공통 데이터 형식 | 2차원 좌표 데이터 |
| 관찰 대상 1 | 각 점의 군집 소속 변화 |
| 관찰 대상 2 | 최종 중심의 좌표 변화 |
| 관찰 대상 3 | 군집 내 거리 합의 크기 비교 |
| 탐구 의의 | 거리·중점 개념의 실제 활용 확인 |
이러한 문제의식은 데이터사이언스 진로와도 연결된다. 실제 비지도학습에서는 정답표가 없는 데이터를 비슷한 특성끼리 묶어 구조를 파악하는 일이 중요하며, 이때 가장 기본이 되는 기준이 거리이다. 따라서 본 보고서는 좌표평면의 거리와 중점 개념이 데이터 군집화의 출발점이 될 수 있음을 밝히고, 다음 섹션에서 그 수학적 의미를 교과 개념 중심으로 정리한 뒤 K-평균 알고리즘과 연결해 보고자 한다.
2교과 개념 — 두 점 사이 거리와 중점의 수학적 의미 정리
앞선 섹션 1에서 제기한 문제의식처럼, 데이터 점들을 묶으려면 먼저 ‘어떤 점이 어떤 중심에 더 가까운가’를 판단할 기준이 필요하다. 평면좌표에서 그 기준이 되는 것이 두 점 사이의 거리 공식이다. 좌표평면의 두 점 , 사이의 거리는 다음과 같이 계산된다.
여기서 는 각 점의 좌표값이며, 거리의 단위는 좌표축의 단위와 같다. 이 식은 단순히 선분의 길이를 구하는 공식이 아니라, 두 점이 얼마나 비슷한 위치에 있는지를 수치화하는 기준으로 해석할 수 있다. 데이터 군집화에서는 한 점이 여러 중심 후보 중 어느 중심에 가장 가까운지를 이 거리를 비교하여 결정한다.[1]
또한 중점 공식은 두 점을 대표하는 균형 위치를 보여 준다. 두 점 , 의 중점 의 좌표는 다음과 같다.
이 식은 두 점 사이의 정확한 가운데를 나타내므로, 두 점을 함께 대표하는 위치로 볼 수 있다. 교과서에서는 선분의 가운데 점을 구하는 데 사용하지만, 이를 확장하면 여러 점의 분포를 대표하는 중심 개념으로 이어지는 직관을 얻을 수 있다. 즉, 중점은 ‘중앙에 있는 좌표’라는 감각을 제공하며, 이후 군집 중심을 이해하는 출발점이 된다.
이 두 교과 개념은 K-평균의 핵심 원리와 자연스럽게 연결된다. 첫째, 거리 최소화는 각 점을 가장 가까운 중심에 배정하는 규칙의 근거가 된다. 예를 들어 점 가 중심 , 중 어디에 속할지를 판단할 때는 과 를 각각 계산해 더 작은 쪽을 선택한다. 둘째, 대표 위치 설정은 한 군집의 중심을 새롭게 갱신하는 생각과 연결된다. 고등학교 수준에서는 이를 각 점들의 평균 좌표가 그 집단의 대표 위치가 된다고 이해할 수 있으며, 중점은 이러한 평균 중심 개념을 직관적으로 받아들이게 해 준다.
이를 실제 탐구에 맞게 정리하면 다음과 같다. 섹션 1에서 설정한 ‘초기 중심이 결과를 바꾼다’는 질문은, 결국 어떤 중심이 각 점과의 거리를 더 작게 만드는가의 문제로 바뀐다. 따라서 거리 공식은 점 배정 규칙의 수학적 근거이고, 중점 개념은 초기 중심 후보를 해석하는 출발점이다. 다음 섹션에서는 이 교과 개념이 데이터사이언스의 군집화 알고리즘과 어떻게 연결되는지 진로 관점에서 확장해 보고자 한다.
| 교과 개념 | 수학식 | 군집화에서의 의미 |
|---|---|---|
| 두 점 사이 거리 | 점과 중심의 가까움 비교 기준 | |
| 선분의 중점 | 대표 위치, 초기 중심 해석의 직관 | |
| 거리 최소화 | 가장 작은 거리 선택 | 점의 군집 소속 결정 |
| 중심 갱신 | 군집 점들의 평균 좌표 | 새로운 중심 형성 원리 |
3진로 연계 — 좌표의 중심 개념과 군집화 알고리즘의 연결
섹션 1에서 거리와 중심이 데이터 묶음의 결과를 바꿀 수 있다는 문제의식을 세웠고, 섹션 2에서는 거리 공식과 중점 공식이 각각 점 배정과 대표 위치 해석의 기초가 됨을 정리하였다. 이러한 연결은 데이터사이언스에서 자주 사용되는 군집화(clustering) 와 직접 이어진다. 군집화는 정답이 미리 주어지지 않은 데이터를 비슷한 특성끼리 자동으로 묶는 비지도학습의 대표 방법이다. 예를 들어 소비 패턴, 지역 좌표, 센서 위치처럼 정답표가 없는 자료에서도 데이터 내부의 구조를 찾아낼 수 있다는 점에서 활용 범위가 넓다.[4]
그중 K-평균(K-means) 은 계산 원리가 비교적 단순하여 고1 수준의 수학 탐구 주제로 적합하다. K-평균은 먼저 중심의 개수 를 정하고, 초기 중심을 배치한 뒤, 각 점을 가장 가까운 중심에 배정하고, 다시 각 군집의 평균 좌표로 중심을 갱신하는 과정을 반복한다. 이 과정은 복잡한 미적분보다 좌표, 거리, 평균이라는 익숙한 수학 개념으로 설명할 수 있다. 특히 초기 중심이 달라지면 반복의 출발점이 달라져 최종 결과가 달라질 수 있다는 점이 탐구 가치가 크다.[1]
K-평균의 기본 목표는 군집 안의 점들이 중심에 가깝게 모이도록 하는 것이다. 이를 간단히 쓰면 각 점과 자신이 속한 중심 사이 거리의 제곱합을 줄이는 방향으로 작동한다고 볼 수 있다.
여기서 은 전체 데이터 개수, 는 번째 데이터 점의 좌표, 는 그 점이 배정된 군집 중심이다. 이 식은 ‘전체적으로 얼마나 조밀하게 묶였는가’를 수치로 보는 기준이며, 값이 작을수록 군집 내부가 더 잘 모였다고 해석할 수 있다. 고등학생 수준에서는 벡터 표기 자체보다 ‘각 점에서 중심까지의 거리 제곱을 모두 더한 값’으로 이해하는 것이 적절하다.
기존 응용 연구들은 주로 통신망, 센서 네트워크, 성능 최적화처럼 실제 시스템에서 군집화 효율을 높이는 방향을 다루는 경우가 많다.[2][3][4] 반면 본 탐구는 복잡한 프로그래밍 성능 비교보다, 평면좌표의 거리·중점 개념만으로 초기 중심 배치 차이를 설명한다는 점에서 의미가 있다. 즉, 연구 공백을 ‘고등학교 교과 수학의 언어로 알고리즘의 핵심 원리를 해석하는 사례가 상대적으로 적다’는 데서 찾을 수 있다.
따라서 이 탐구는 데이터사이언스를 단순히 컴퓨터 기술로 보는 것이 아니라, 수학적 기준을 통해 데이터를 해석하는 학문으로 이해하게 한다. 다음 섹션에서는 이러한 진로 관점을 바탕으로, 같은 2차원 데이터와 같은 값을 유지한 채 초기 중심 배치 방식만 바꾸었을 때 군집 결과와 군집 내 거리 합이 어떻게 달라지는지 구체적인 변인 체계와 가설을 세워 비교하고자 한다.
| 요소 | 내용 |
|---|---|
| 진로 분야 | 데이터사이언스 |
| 핵심 방법 | 비지도학습의 군집화 |
| 대표 알고리즘 | K-평균 |
| 수학적 기반 | 거리 공식, 평균, 중점의 직관 |
| 민감한 조건 | 초기 중심 선택, 군집 수 |
| 본 탐구의 의의 | 교과 수학으로 알고리즘 원리 설명 |