AP Statistics

cụm (trong phân phối dữ liệu)

cluster

Còn gọi: cluster

Cụm là một nhóm giá trị trong phân phối dữ liệu tụ lại gần nhau, tách biệt hẳn khỏi các nhóm giá trị khác bởi một khoảng trống ở giữa.

Khi mô tả hình dạng của một phân phối dữ liệu định lượng, người ta không chỉ chú ý đến độ đối xứng hay lệch mà còn phải tìm những đặc điểm bất thường (unusual features) như giá trị ngoại lai, khoảng trống, và cụm. Cụm xuất hiện khi các quan sát không rải đều hay tụ quanh một đỉnh duy nhất, mà chia thành hai hay nhiều đám riêng biệt, mỗi đám cách đám kia bằng một khoảng gần như trống dữ liệu. Trên đồ thị chấm (dotplot) hay biểu đồ tần số (histogram), cụm hiện ra rất rõ dưới dạng những đợt sóng cao thấp xen kẽ những đoạn phẳng lì không có điểm nào.

Về mặt thống kê, sự xuất hiện của cụm thường là dấu hiệu cho thấy tập dữ liệu thực chất gồm hai hay nhiều nhóm nhỏ khác nhau về bản chất, chứ không phải một tổng thể đồng nhất. Ví dụ, nếu đo chiều cao của một nhóm học sinh gồm cả lớp 6 và lớp 12, biểu đồ tần số rất có thể cho thấy hai cụm tách rời nhau vì hai độ tuổi có tầm vóc khác hẳn nhau. Do đó, khi phát hiện cụm, người phân tích nên đặt câu hỏi liệu có một biến ẩn nào đó — như giới tính, độ tuổi, hay điều kiện thí nghiệm — đang chia dữ liệu thành các nhóm con hay không, thay vì vội vàng tính các đại lượng mô tả chung cho toàn bộ tập hợp.

Tuy nhiên, cụm là đặc điểm rất khó — thậm chí không thể — nhận ra chỉ từ biểu đồ hộp (boxplot), vì biểu đồ hộp chỉ tóm tắt dữ liệu qua năm số liệu (five-number summary) mà bỏ qua cách các điểm phân bố chi tiết ở giữa. Hai tập dữ liệu có hình dạng hoàn toàn khác nhau, một tập có cụm rõ rệt và một tập trải đều, vẫn có thể cho ra cùng một biểu đồ hộp. Vì vậy, muốn phát hiện cụm một cách đáng tin cậy, ta cần dùng đồ thị chấm hoặc biểu đồ tần số thay vì chỉ dựa vào biểu đồ hộp.

Trực giác: Giống như nhìn một bãi đậu xe thấy xe không nằm rải đều mà tụ thành hai ba đám riêng, mỗi đám cách nhau một khoảng trống.

Khái niệm này sinh ra từ đâu

1932Harold DriverAlfred KroeberJoseph ZubinRobert TryonRaymond CattellStuart Lloyd

Chữ "cụm" bắt nguồn từ một từ cổ trong tiếng Anh chỉ một nhóm người hay vật nằm sát nhau, còn cách dùng nó như một thuật ngữ thống kê hình thành từ năm 1932, khi Driver và Kroeber đưa phân tích cụm (cluster analysis) vào ngành nhân học để gom các nền văn hóa và cá nhân thành nhóm.

Đầu thế kỷ 20, các nhà nhân học đứng trước một đống số liệu mô tả hàng trăm cộng đồng và không biết xếp chúng vào bao nhiêu loại cho hợp lý. Năm 1932, Driver và Kroeber đề xuất một cách làm cho các bảng phân loại bớt mơ hồ: thay vì chia nhóm theo cảm tính, hãy để chính dữ liệu chỉ ra chỗ nào các quan sát dồn lại gần nhau. Ý tưởng ấy nhanh chóng lan sang tâm lý học, rồi qua thập niên 1960 thì phủ khắp y học, sinh học, xã hội học và địa lý. Vì vậy, khi ta nhìn một biểu đồ phân bố và nói "dữ liệu tách thành hai cụm", ta đang lặp lại đúng trực giác ban đầu đó: chỗ nào đông đúc thì ở đó có một nhóm thật sự.

Vì sao mang đúng cái tên này? Từ "cluster" đi ra từ chữ "clustor" trong tiếng Anh cổ, nghĩa là một nhóm người hoặc vật gắn với nhau, và có họ với từ "kluftr" trong tiếng Bắc Âu cổ dùng để chỉ một toán lính. Cái lõi nghĩa ấy — nhiều đơn vị riêng lẻ nhưng đứng chụm lại thành một khối nhận ra được — chính là thứ được giữ nguyên khi thống kê mượn từ này: một cụm trên biểu đồ là những giá trị dồn về cùng một vùng, tách khỏi phần còn lại bởi các khoảng trống. Thú vị hơn, phân tích cụm từng có một tên gọi khác là "botryology", dựng từ chữ βότρυς trong tiếng Hy Lạp nghĩa là chùm nho, cho thấy người đặt tên nghĩ đến đúng hình ảnh các quả mọc túm tụm quanh một cuống. Ngày nay trong khai phá dữ liệu (data mining), các thuật toán như K trung bình (K-means) do Stuart Lloyd đề xuất năm 1957 hay phân cụm phân cấp (hierarchical clustering) năm 1963 vẫn đi tìm đúng những túm ấy, chỉ khác là bằng máy tính thay vì bằng mắt.

Thử nghiệm tương tác

Kéo độ rộng nhóm — nhìn khoảng trống giữa hai cụm hiện ra rồi biến mất

Kéo độ rộng nhóm — nhìn khoảng trống giữa hai cụm hiện ra rồi biến mất

Kéo tham số, thấy khái niệm chuyển động — mở khoá bằng tài khoản 0đ.

Tạo tài khoản miễn phí

Hay hiểu sai

Cụm trong phân phối dữ liệu khác hẳn cụm trong chọn mẫu theo cụm.

Không phải cứ hai đỉnh là hai cụm.

Một cụm nhỏ không giống một giá trị ngoại lai.

Chỉ ra cụm mà không nói cụm đó ứng với điều gì là chưa đủ.

Mẹo phòng thi

Viết mô tả phân phối theo đủ bốn ý: hình dạng, tâm, độ phân tán, điểm bất thường.

Đọc kỹ chữ cluster trong câu hỏi lấy mẫu để không nhầm với chọn mẫu phân tầng.

Khi đề cho hai biểu đồ, hãy dùng biểu đồ thứ hai để giải thích cụm ở biểu đồ thứ nhất.

Tần suất trong đề AP StatisticsHay gặp

Ví dụ có lời giải

1Ví dụ 1/2
Một trường trung học khảo sát 30 học sinh khối 11 về thời gian di chuyển từ nhà đến trường vào buổi sáng (đơn vị: phút). Kết quả được ghép nhóm với độ rộng mỗi nhóm là 5 phút như sau: [5, 10): 4 học sinh; [10, 15): 7 học sinh; [15, 20): 5 học sinh; [20, 25): 1 học sinh; [25, 30): 0 học sinh; [30, 35): 0 học sinh; [35, 40): 3 học sinh; [40, 45): 6 học sinh; [45, 50): 4 học sinh. Nhà trường muốn dùng số liệu này để lên kế hoạch cho xe đưa đón.
  1. aMô tả phân phối của thời gian di chuyển, có nêu rõ đặc điểm bất thường nếu có.
  2. bHiệu trưởng báo cáo rằng "thời gian di chuyển trung bình của học sinh là khoảng 26 phút". Hãy tính lại con số này từ bảng tần số và giải thích vì sao nó dễ gây hiểu lầm.
1Bước 1: Hình dung dạng biểu đồ tần số trước khi mô tả. Cột cao dần từ nhóm [5, 10) lên đỉnh ở nhóm [10, 15) rồi thấp dần xuống 1 học sinh ở nhóm [20, 25); sau đó hai nhóm [25, 30) và [30, 35) hoàn toàn trống; tiếp theo các cột lại dựng lên với đỉnh thứ hai ở nhóm [40, 45). Như vậy biểu đồ có hai vùng dày số liệu tách rời nhau chứ không phải một khối liền mạch.
2Bước 2: Đặt tên cho các đặc điểm vừa thấy. Hai vùng dày số liệu chính là hai cụm: cụm thứ nhất trải từ 5 đến 25 phút và chứa 4+7+5+1=174+7+5+1=17 học sinh, cụm thứ hai trải từ 35 đến 50 phút và chứa 3+6+4=133+6+4=13 học sinh. Giữa hai cụm là một khoảng trống (gap) rộng 10 phút, từ 25 đến 35 phút, nơi không có học sinh nào. Vì có hai đỉnh nên phân phối được gọi là phân phối hai đỉnh (bimodal), và ở đây không có giá trị ngoại lai (outlier) nào tách hẳn khỏi cả hai cụm.
3Bước 3: Trả lời ý (a) bằng một câu mô tả đầy đủ và gắn với ngữ cảnh: phân phối thời gian di chuyển của 30 học sinh có hai cụm, một cụm khoảng 5–25 phút với 17 học sinh và một cụm khoảng 35–50 phút với 13 học sinh, ngăn cách bởi khoảng trống 25–35 phút; hình dạng tổng thể là hai đỉnh, độ phân tán lớn (trải từ 5 đến 50 phút) và không có giá trị ngoại lai. Một cách giải thích hợp lý là cụm gần gồm học sinh đi bộ hoặc đi xe đạp trong nội thành, còn cụm xa gồm học sinh ở các xã lân cận.
4Bước 4: Tính trung bình xấp xỉ từ bảng tần số bằng điểm giữa mim_i của mỗi nhóm nhân với tần số fif_i: mifi=7,5(4)+12,5(7)+17,5(5)+22,5(1)+37,5(3)+42,5(6)+47,5(4)=785\sum m_i f_i = 7{,}5(4)+12{,}5(7)+17{,}5(5)+22{,}5(1)+37{,}5(3)+42{,}5(6)+47{,}5(4)=785. Do đó xˉmifin=7853026,2.\bar{x}\approx\frac{\sum m_i f_i}{n}=\frac{785}{30}\approx 26{,}2. Con số này nói rằng nếu chia đều tổng thời gian di chuyển cho 30 học sinh thì mỗi em được khoảng 26,2 phút.
5Bước 5: Đối chiếu giá trị vừa tính với hình dạng phân phối để trả lời ý (b). Giá trị 26,2 phút rơi đúng vào khoảng trống giữa hai cụm, nghĩa là trên thực tế không có học sinh nào mất khoảng chừng ấy thời gian. Khi dữ liệu tách thành hai cụm, trung bình bị kéo về vùng ở giữa và không đại diện cho bất kỳ nhóm nào; vì vậy báo cáo nên nêu riêng hai mức tiêu biểu, chẳng hạn khoảng 13 phút cho nhóm gần và khoảng 43 phút cho nhóm xa.

Phân phối thời gian di chuyển có hai cụm rõ rệt — khoảng 5–25 phút (17 học sinh) và khoảng 35–50 phút (13 học sinh) — cách nhau bởi khoảng trống 25–35 phút, hình dạng hai đỉnh và không có giá trị ngoại lai. Trung bình xấp xỉ 26,226{,}2 phút nằm ngay trong khoảng trống đó nên không mô tả đúng học sinh nào cả; nhà trường cần lập kế hoạch xe đưa đón theo từng cụm thay vì theo một con số trung bình chung.

2Ví dụ 2/2
Học sinh một lớp Vật lí làm thí nghiệm về ảnh hưởng của chiều rộng cánh quạt đến thời gian rơi của trực thăng giấy. Các em chỉ gấp hai kiểu cánh, rộng 2 cm và rộng 5 cm, mỗi kiểu 12 chiếc, rồi thả cả 24 chiếc từ cùng một độ cao và ghi lại thời gian rơi (giây). Nhóm cánh 2 cm cho thời gian nằm trong khoảng từ 1,2 đến 1,8 giây với trung bình 1,5 giây; nhóm cánh 5 cm cho thời gian từ 2,6 đến 3,4 giây với trung bình 3,0 giây. Biểu đồ tần số của toàn bộ 24 thời gian rơi và biểu đồ tán xạ của thời gian rơi theo chiều rộng cánh đều được vẽ ra, và hệ số tương quan (correlation coefficient) tính được là r=0,94r = 0{,}94.
  1. aMô tả đặc điểm nổi bật nhất của biểu đồ tần số các thời gian rơi và cho biết nguyên nhân của đặc điểm đó.
  2. bTính hệ số góc của đường thẳng nối hai điểm trung bình của hai nhóm và nêu ý nghĩa của nó trong ngữ cảnh.
  3. cGiải thích vì sao giá trị r=0,94r = 0{,}94 không cho phép kết luận rằng quan hệ giữa chiều rộng cánh và thời gian rơi là tuyến tính.
1Bước 1: Xét xem 24 thời gian rơi phân bố ra sao trên trục số. Mười hai giá trị của nhóm cánh hẹp nằm gọn trong đoạn 1,2–1,8 giây, mười hai giá trị của nhóm cánh rộng nằm gọn trong đoạn 2,6–3,4 giây, còn vùng từ 1,8 đến 2,6 giây không có quan sát nào. Vậy biểu đồ tần số gồm hai cụm tách biệt, mỗi cụm 12 chiếc, ngăn cách bởi một khoảng trống rộng khoảng 0,8 giây; đây chính là câu trả lời cho phần mô tả của ý (a).
2Bước 2: Truy nguyên nhân của hai cụm bằng cách nhìn sang biểu đồ tán xạ. Trên biểu đồ tán xạ, tất cả các điểm chỉ nằm trên hai đường dọc ứng với x=2x = 2x=5x = 5, nên biến giải thích chỉ nhận đúng hai giá trị. Do đó hai cụm trong biểu đồ tần số không phải là hiện tượng ngẫu nhiên mà là hệ quả trực tiếp của thiết kế thí nghiệm: cánh hẹp rơi nhanh, cánh rộng rơi chậm, và giữa hai mức ấy không có chiếc nào được thử.
3Bước 3: Tính hệ số góc cho ý (b) từ hai điểm trung bình (2;1,5)(2; 1{,}5)(5;3,0)(5; 3{,}0): b=3,01,552=1,53=0,5.b=\frac{3{,}0-1{,}5}{5-2}=\frac{1{,}5}{3}=0{,}5. Nghĩa là khi đi từ kiểu cánh 2 cm sang kiểu cánh 5 cm, thời gian rơi trung bình tăng thêm 0,5 giây cho mỗi xăng-ti-mét chiều rộng cánh.
4Bước 4: Đánh giá giá trị r=0,94r=0{,}94 cho ý (c). Khi dữ liệu chỉ tụ về hai cụm ứng với hai giá trị của xx, luôn có thể kẻ một đường thẳng đi qua hai trung bình ấy, và mọi hệ số tương quan lớn ta thu được chỉ phản ánh việc hai cụm nằm chéo nhau chứ không nói gì về dáng đi của dữ liệu ở giữa. Hai cụm có thể được nối bằng đường thẳng, đường cong lồi hay đường cong lõm mà biểu đồ vẫn y hệt; vì vậy không có bằng chứng nào về dạng tuyến tính trong khoảng từ 2 cm đến 5 cm.
5Bước 5: Rút ra hệ quả thực hành. Nếu muốn biết quan hệ có thật sự tuyến tính hay không, lớp cần làm thêm trực thăng với các chiều rộng trung gian như 3 cm và 4 cm để lấp khoảng trống giữa hai cụm. Chừng nào chưa có dữ liệu ở vùng đó thì mọi dự đoán cho chiều rộng nằm giữa hai mức đã thử đều là ngoại suy thiếu căn cứ.

Biểu đồ tần số các thời gian rơi gồm hai cụm — 12 chiếc quanh 1,5 giây và 12 chiếc quanh 3,0 giây — tách nhau bởi khoảng trống 1,8–2,6 giây, và nguyên nhân là lớp chỉ thử đúng hai chiều rộng cánh. Đường nối hai điểm trung bình có hệ số góc 0,50{,}5, tức trung bình thời gian rơi tăng 0,5 giây mỗi xăng-ti-mét cánh rộng thêm. Tuy nhiên, do dữ liệu chỉ tụ thành hai cụm, r=0,94r = 0{,}94 chỉ cho biết hai cụm lệch nhau theo chiều dương chứ không chứng minh được quan hệ giữa chiều rộng cánh và thời gian rơi là tuyến tính.

Bạn nắm chắc chưa?

Quiz câu thật từ ngân hàng đề

Vài câu thật gắn đúng khái niệm này, chấm ngay kèm giải thích từng đáp án — hệ thống ghi nhớ bạn nắm tới đâu.

Tạo tài khoản miễn phí

Học tiếp từ đây

Mục tiêu và lộ trình unit xem miễn phí — làm bài tập và lưu tiến độ cần tài khoản 0đ.

Hay nhầm với

Khác nhau ở đâuCụm là một nhóm giá trị nằm sát nhau trên trục số. Khoảng trống là khoảng không có quan sát nào, chính nó tách các cụm ra.
Hay nhầm khiKhi mô tả histogram có hai vùng cột cách xa nhau, thí sinh gọi tên nhầm giữa phần có dữ liệu và phần trống ở giữa.
Khác nhau ở đâuCụm ở đây là đặc điểm hình dạng đọc được trên biểu đồ. Mẫu cụm là một cách chọn mẫu: chia tổng thể thành nhóm rồi bốc ngẫu nhiên vài nhóm.
Hay nhầm khiGặp chữ cluster trong đề, thí sinh hay trả lời về thiết kế chọn mẫu trong khi câu hỏi chỉ yêu cầu mô tả phân phối.

Cùng chủ đề

Nguồn tham khảo

  1. [1]Barron_AP_Stat_2026. tr. 22–23, 48.

Biên soạn bởi DucklingStudy, bản quyền thuộc DucklingStudy. Xuất bản .