전체 글
-
[클러스터링] K-means의 다양한 확장clustering 2023. 3. 8. 22:56
[거리 혹은 비유사도]에서 이어지는 내용입니다. 0. 내용 K-means EM 알고리즘으로 본 K-means 다른 K-centroids 기법들 K-medians K-modes K-protypes Spherical K-means Minibatch K-means K-medoids Fuzzy C-means K-means++ 경사 하강 최적화 중심점의 개수를 정할 수 있을까? (X-means) 나가며 코드 R Python 1. K-means K-means는 가장 유명한 클러스터링 방식이 아닐까 생각이 들 정도로 여러 분야에서 광범위하게 사용되는 클러스터링입니다. 아이디어도 직관적이고 다양한 다른 클러스터링 기법들과 연관도 많아서 그런 것이 아닐까 합니다. 계산도 빠르구요! 가장 먼저 이야기해야 할 것은 아무래도..
-
[클러스터링] 거리 혹은 비유사도 (Distance or Dissimilarity)clustering 2023. 3. 5. 17:28
0. 내용 클러스터링이란? 거리란? 다양한 거리 유클리드 거리 민코프스키 거리 (맨해튼 거리, 캔버라 거리, 체브셰프 거리) 마할라노비스 거리 각도 기반 거리 (코사인 유사도, 피어슨 상관계수) 하버사인 거리 자카드 거리 (가중 자카드 거리, 다이스 거리) 편집 거리 (해밍 거리, 레벤슈타인 거리) 어떤 걸 어떻게 써야 하는지? 참고 문헌 1. 클러스터링이란? 클러스터링(군집화)은 데이터의 내재적 특성을 이용하여 데이터 포인트들을 여러 클러스터로 묶는 방법입니다. 다른 말로는, 데이터를 클러스터에 소속시킨다..., 혹은 데이터의 소속(membership)을 추정한다...고 표현하기도 합니다. 이때 보통 서로 유사한 데이터는 같은 클러스터에, 상이한 데이터는 다른 클러스터에 소속시키는 것이 자연스럽습니다...