AP Statistics
cluster
Còn gọi: cluster
Cụm là một nhóm giá trị trong phân phối dữ liệu tụ lại gần nhau, tách biệt hẳn khỏi các nhóm giá trị khác bởi một khoảng trống ở giữa.
Khi mô tả hình dạng của một phân phối dữ liệu định lượng, người ta không chỉ chú ý đến độ đối xứng hay lệch mà còn phải tìm những đặc điểm bất thường (unusual features) như giá trị ngoại lai, khoảng trống, và cụm. Cụm xuất hiện khi các quan sát không rải đều hay tụ quanh một đỉnh duy nhất, mà chia thành hai hay nhiều đám riêng biệt, mỗi đám cách đám kia bằng một khoảng gần như trống dữ liệu. Trên đồ thị chấm (dotplot) hay biểu đồ tần số (histogram), cụm hiện ra rất rõ dưới dạng những đợt sóng cao thấp xen kẽ những đoạn phẳng lì không có điểm nào.
Về mặt thống kê, sự xuất hiện của cụm thường là dấu hiệu cho thấy tập dữ liệu thực chất gồm hai hay nhiều nhóm nhỏ khác nhau về bản chất, chứ không phải một tổng thể đồng nhất. Ví dụ, nếu đo chiều cao của một nhóm học sinh gồm cả lớp 6 và lớp 12, biểu đồ tần số rất có thể cho thấy hai cụm tách rời nhau vì hai độ tuổi có tầm vóc khác hẳn nhau. Do đó, khi phát hiện cụm, người phân tích nên đặt câu hỏi liệu có một biến ẩn nào đó — như giới tính, độ tuổi, hay điều kiện thí nghiệm — đang chia dữ liệu thành các nhóm con hay không, thay vì vội vàng tính các đại lượng mô tả chung cho toàn bộ tập hợp.
Tuy nhiên, cụm là đặc điểm rất khó — thậm chí không thể — nhận ra chỉ từ biểu đồ hộp (boxplot), vì biểu đồ hộp chỉ tóm tắt dữ liệu qua năm số liệu (five-number summary) mà bỏ qua cách các điểm phân bố chi tiết ở giữa. Hai tập dữ liệu có hình dạng hoàn toàn khác nhau, một tập có cụm rõ rệt và một tập trải đều, vẫn có thể cho ra cùng một biểu đồ hộp. Vì vậy, muốn phát hiện cụm một cách đáng tin cậy, ta cần dùng đồ thị chấm hoặc biểu đồ tần số thay vì chỉ dựa vào biểu đồ hộp.
Trực giác: Giống như nhìn một bãi đậu xe thấy xe không nằm rải đều mà tụ thành hai ba đám riêng, mỗi đám cách nhau một khoảng trống.
1932Harold DriverAlfred KroeberJoseph ZubinRobert TryonRaymond CattellStuart Lloyd
Đầu thế kỷ 20, các nhà nhân học đứng trước một đống số liệu mô tả hàng trăm cộng đồng và không biết xếp chúng vào bao nhiêu loại cho hợp lý. Năm 1932, Driver và Kroeber đề xuất một cách làm cho các bảng phân loại bớt mơ hồ: thay vì chia nhóm theo cảm tính, hãy để chính dữ liệu chỉ ra chỗ nào các quan sát dồn lại gần nhau. Ý tưởng ấy nhanh chóng lan sang tâm lý học, rồi qua thập niên 1960 thì phủ khắp y học, sinh học, xã hội học và địa lý. Vì vậy, khi ta nhìn một biểu đồ phân bố và nói "dữ liệu tách thành hai cụm", ta đang lặp lại đúng trực giác ban đầu đó: chỗ nào đông đúc thì ở đó có một nhóm thật sự.
Vì sao mang đúng cái tên này? Từ "cluster" đi ra từ chữ "clustor" trong tiếng Anh cổ, nghĩa là một nhóm người hoặc vật gắn với nhau, và có họ với từ "kluftr" trong tiếng Bắc Âu cổ dùng để chỉ một toán lính. Cái lõi nghĩa ấy — nhiều đơn vị riêng lẻ nhưng đứng chụm lại thành một khối nhận ra được — chính là thứ được giữ nguyên khi thống kê mượn từ này: một cụm trên biểu đồ là những giá trị dồn về cùng một vùng, tách khỏi phần còn lại bởi các khoảng trống. Thú vị hơn, phân tích cụm từng có một tên gọi khác là "botryology", dựng từ chữ βότρυς trong tiếng Hy Lạp nghĩa là chùm nho, cho thấy người đặt tên nghĩ đến đúng hình ảnh các quả mọc túm tụm quanh một cuống. Ngày nay trong khai phá dữ liệu (data mining), các thuật toán như K trung bình (K-means) do Stuart Lloyd đề xuất năm 1957 hay phân cụm phân cấp (hierarchical clustering) năm 1963 vẫn đi tìm đúng những túm ấy, chỉ khác là bằng máy tính thay vì bằng mắt.
Kéo độ rộng nhóm — nhìn khoảng trống giữa hai cụm hiện ra rồi biến mất
Kéo tham số, thấy khái niệm chuyển động — mở khoá bằng tài khoản 0đ.
Cụm trong phân phối dữ liệu khác hẳn cụm trong chọn mẫu theo cụm.
Khi mô tả một biểu đồ tần số, cụm chỉ là nhóm các giá trị dồn lại gần nhau và tách khỏi nhóm khác bởi một khoảng trống (gap). Còn trong lấy mẫu theo cụm (cluster sampling), cụm là các nhóm đơn vị có sẵn — trường học, khu dân cư — được chọn nguyên khối. Hai khái niệm trùng tên nhưng ở hai chương khác nhau, và đề thường hỏi riêng từng loại nên đừng mang định nghĩa này sang trả lời câu kia.
Không phải cứ hai đỉnh là hai cụm.
Một phân phối hai đỉnh (bimodal) vẫn có thể liền mạch, không có khoảng trống nào giữa hai đỉnh, khi đó dữ liệu chỉ có hai vùng tập trung chứ chưa tách thành cụm rõ rệt. Dấu hiệu chắc chắn của cụm là một dải giá trị hoàn toàn không có quan sát nào chia đôi dữ liệu, chẳng hạn không có giá trị nào rơi vào khoảng từ đến giây. Vì vậy hãy nhìn khoảng trống trước, nhìn đỉnh sau.
Một cụm nhỏ không giống một giá trị ngoại lai.
Giá trị ngoại lai (outlier) thường là một hoặc hai điểm lẻ nằm xa phần còn lại, trong khi cụm là cả một nhóm điểm nằm sát nhau nhưng tách khỏi nhóm lớn. Năm chiếc trực thăng giấy có thời gian bay dưới giây tạo thành một cụm chứ không phải năm giá trị ngoại lai. Gọi sai tên khiến phần mô tả phân phối bị trừ điểm dù nhận xét về hình dạng vẫn đúng.
Chỉ ra cụm mà không nói cụm đó ứng với điều gì là chưa đủ.
Đề thường cho thêm một biểu đồ phân tán để học sinh giải thích nguồn gốc của cụm: nhóm bay dưới giây đều có bề rộng cánh cm. Khi ấy câu trả lời phải nối cụm với biến giải thích, tức nói rõ rằng sự tách nhóm đến từ một đặc điểm chung của các quan sát đó. Mô tả suông kiểu "có hai cụm" chỉ được tính nửa ý.
Viết mô tả phân phối theo đủ bốn ý: hình dạng, tâm, độ phân tán, điểm bất thường.
Cụm và khoảng trống thuộc ý thứ tư, nên nếu thấy dữ liệu tách nhóm thì phải nêu ngay ở đó kèm số liệu cụ thể của ranh giới. Ghi rõ "có một khoảng trống từ … đến …, chia dữ liệu thành hai cụm" sẽ an toàn hơn nhiều so với câu chung chung.
Đọc kỹ chữ cluster trong câu hỏi lấy mẫu để không nhầm với chọn mẫu phân tầng.
Chọn mẫu theo cụm chia tổng thể thành các nhóm không giao nhau rồi chọn ngẫu nhiên vài nhóm và khảo sát toàn bộ nhóm đó; chọn mẫu phân tầng (stratified random sampling) thì lấy một ít từ mọi tầng. Khi các nhóm khác nhau nhiều giữa nhóm này với nhóm kia, chọn vài cụm dễ làm mẫu không đại diện, và đây chính là ý mà bài tự luận muốn bạn viết ra.
Khi đề cho hai biểu đồ, hãy dùng biểu đồ thứ hai để giải thích cụm ở biểu đồ thứ nhất.
Biểu đồ tần số cho thấy có cụm, còn biểu đồ phân tán cho biết cụm đó gắn với giá trị nào của biến kia. Câu trả lời đạt điểm tối đa luôn nối được hai thông tin ấy trong cùng một câu.
Phân phối thời gian di chuyển có hai cụm rõ rệt — khoảng 5–25 phút (17 học sinh) và khoảng 35–50 phút (13 học sinh) — cách nhau bởi khoảng trống 25–35 phút, hình dạng hai đỉnh và không có giá trị ngoại lai. Trung bình xấp xỉ phút nằm ngay trong khoảng trống đó nên không mô tả đúng học sinh nào cả; nhà trường cần lập kế hoạch xe đưa đón theo từng cụm thay vì theo một con số trung bình chung.
Biểu đồ tần số các thời gian rơi gồm hai cụm — 12 chiếc quanh 1,5 giây và 12 chiếc quanh 3,0 giây — tách nhau bởi khoảng trống 1,8–2,6 giây, và nguyên nhân là lớp chỉ thử đúng hai chiều rộng cánh. Đường nối hai điểm trung bình có hệ số góc , tức trung bình thời gian rơi tăng 0,5 giây mỗi xăng-ti-mét cánh rộng thêm. Tuy nhiên, do dữ liệu chỉ tụ thành hai cụm, chỉ cho biết hai cụm lệch nhau theo chiều dương chứ không chứng minh được quan hệ giữa chiều rộng cánh và thời gian rơi là tuyến tính.
Quiz câu thật từ ngân hàng đề
Vài câu thật gắn đúng khái niệm này, chấm ngay kèm giải thích từng đáp án — hệ thống ghi nhớ bạn nắm tới đâu.
Biên soạn bởi DucklingStudy, bản quyền thuộc DucklingStudy. Xuất bản .