AP Statistics

kiểm định chi bình phương về tính độc lập

chi-square test for independence

Còn gọi: chi-square test for independence

Kiểm định chi bình phương về tính độc lập là phép kiểm định xem hai biến phân loại trên cùng một tổng thể có liên hệ với nhau hay không.

Khi một nhà nghiên cứu thu thập dữ liệu về hai biến phân loại trên cùng một mẫu — chẳng hạn giới tính và sở thích môn học — câu hỏi đặt ra thường là liệu hai biến này có độc lập với nhau hay không. Kiểm định chi bình phương về tính độc lập (chi-square test for independence) trả lời câu hỏi đó bằng cách so sánh bảng chéo các số đếm quan sát được với bảng số đếm kỳ vọng nếu giả thuyết không H0H_0: hai biến độc lập là đúng. Số đếm kỳ vọng của mỗi ô được tính từ tổng hàng và tổng cột theo công thức E=(tổng haˋng)(tổng cột)n.E = \frac{(\text{tổng hàng})(\text{tổng cột})}{n}. Công thức này phản ánh đúng định nghĩa xác suất (probability) của tính độc lập, vì nếu hai biến không liên quan thì tỉ lệ (proportion) phân bố theo cột phải giống nhau ở mọi hàng.

Sau khi có bảng kỳ vọng, đại lượng thống kê kiểm định được tính bằng χ2=(OE)2E,\chi^2 = \sum \frac{(O-E)^2}{E}, trong đó tổng lấy trên tất cả các ô của bảng chéo, và giá trị này càng lớn thì số đếm thực tế càng lệch xa so với số đếm kỳ vọng dưới giả thuyết độc lập, do đó bằng chứng chống lại H0H_0 càng mạnh. Đại lượng χ2\chi^2 tuân theo phân phối chi bình phương với bậc tự do df=(r1)(c1)df = (r-1)(c-1), với rrcc lần lượt là số hàng và số cột của bảng, từ đó ta tính giá trị p và so với mức ý nghĩa (significance level) để kết luận.

Trước khi tiến hành, cần kiểm tra ba điều kiện: dữ liệu đến từ một mẫu ngẫu nhiên (random sample) của một tổng thể duy nhất, các quan sát độc lập với nhau, kiểm tra điều kiện 10% (10% condition) nếu lấy mẫu không hoàn lại, và mọi số đếm kỳ vọng đều ít nhất bằng 5. Điểm khác biệt cốt lõi giữa kiểm định này với kiểm định chi bình phương về tính đồng nhất nằm ở cách lấy mẫu: kiểm định độc lập xét hai biến trên một tổng thể, còn kiểm định đồng nhất so sánh phân phối của một biến giữa nhiều tổng thể hay nhóm khác nhau, dù công thức tính toán hoàn toàn giống nhau.

Ký hiệuχ2=(OE)2E\chi^2 = \sum \frac{(O-E)^2}{E}, df=(r1)(c1)df=(r-1)(c-1), H0H_0: hai biến độc lập

Trực giác: Giống như kiểm tra xem sở thích màu áo có ăn nhập gì với giới tính hay không, bằng cách xem số người thực tế mỗi ô lệch bao xa so với con số ta chờ đợi nếu hai chuyện đó chẳng liên quan gì đến nhau.

Công thức

Eij=RiCjnE_{ij}=\htmlClass{fp-0}{\frac{\htmlClass{fp-1}{R_i C_j}}{\htmlClass{fp-2}{n}}}

Dùng để tính số đếm kỳ vọng EijE_{ij} của từng ô trong bảng hai chiều (bảng tiếp liên) trước khi so sánh với số đếm quan sát OijO_{ij}.

Trong đó

EijE_{ij}số đếm kỳ vọng ở ô hàng ii, cột jjRiR_itổng số quan sát trên hàng iiCjC_jtổng số quan sát trên cột jjnntổng số quan sát trong toàn bảng
χ2=i,j(OijEij)2Eij\chi^2=\htmlClass{fp-3}{\sum_{i,j}\htmlClass{fp-2}{\frac{\htmlClass{fp-1}{\htmlClass{fp-0}{(O_{ij}-E_{ij})}^2}}{E_{ij}}}}

Đây là thống kê kiểm định dùng để so sánh bảng số đếm quan sát với bảng số đếm kỳ vọng dưới giả thuyết không H0H_0 rằng hai biến phân loại độc lập với nhau trong một tổng thể.

Trong đó

OijO_{ij}số đếm quan sát ở ô hàng ii, cột jjEijE_{ij}số đếm kỳ vọng ở ô hàng ii, cột jj khi H0H_0 đúng
df=(r1)(c1)df=\htmlClass{fp-0}{(r-1)}\htmlClass{fp-1}{(c-1)}

Dùng để xác định bậc tự do của phân phối χ2\chi^2 tham chiếu khi tính P-value cho kiểm định tính độc lập trên bảng có rr hàng và cc cột.

Trong đó

rrsố hàng của bảng tiếp liênccsố cột của bảng tiếp liên

Khái niệm này sinh ra từ đâu

1900Karl Pearson

Kiểm định này do nhà thống kê người Anh Karl Pearson giới thiệu trong một bài báo năm 1900, nhằm đánh giá xem dữ liệu đếm theo nhóm có ủng hộ một giả thiết đặt ra hay không. Từ tiêu chí ban đầu ấy, thống kê mang tên ông được mở rộng để xét mối liên hệ giữa hai biến phân loại (categorical variables).

Cuối thế kỷ 19, thống kê đã biết mô tả dữ liệu nhưng chưa có công cụ chuẩn để trả lời câu hỏi "số liệu quan sát được có phù hợp với mô hình ta giả định không". Karl Pearson là người đầu tiên nhận ra vấn đề đó và năm 1900 ông đưa ra một tiêu chí đo độ chênh giữa số đếm quan sát và số đếm lý thuyết, gọi là kiểm định mức độ phù hợp (goodness-of-fit test). Vì tiêu chí này chỉ cần dữ liệu dạng tần số chứ không cần số đo liên tục, nó nhanh chóng được dùng cho bảng hai chiều (two-way table) để hỏi xem giới tính và khối lớp, hay giới tính và ngành học, có liên quan với nhau hay không.

Vì sao mang đúng cái tên này? Tên gọi đến từ chữ cái Hy Lạp chi, viết là χ\chi, mà Pearson dùng để ký hiệu đại lượng của mình; vì đại lượng đó là tổng của các độ chênh bình phương nên nó mang số mũ hai, thành χ2\chi^2 — đọc là "chi bình phương". Phần "về tính độc lập" thì đến từ giả thuyết không của bài toán: biến hàng và biến cột độc lập với nhau, và bác bỏ giả thuyết này nghĩa là hai biến có liên hệ nào đó mà kiểm định không chỉ rõ hình dạng. Chính vì công đầu thuộc về Pearson mà tài liệu tiếng Anh thường gọi kèm tên ông, "Pearson's chi-square", để phân biệt với những biến thể ra đời sau này.

Thử nghiệm tương tác

Gạt sang "số kỳ vọng" — xem ô 191 vượt mức 148,5 bao nhiêu

Gạt sang "số kỳ vọng" — xem ô 191 vượt mức 148,5 bao nhiêu

Kéo tham số, thấy khái niệm chuyển động — mở khoá bằng tài khoản 0đ.

Tạo tài khoản miễn phí

Hay hiểu sai

Điều kiện cỡ mẫu áp cho tần số kỳ vọng (expected cell count), không phải tần số quan sát.

Không bác bỏ giả thuyết không thì chỉ có thể mắc sai lầm loại II.

Không bác bỏ không có nghĩa là đã chứng minh hai biến độc lập.

Bậc tự do là (r1)(c1)(r-1)(c-1), không phải n1n-1 cũng không phải số ô trừ một.

Một mẫu phân loại theo hai biến mới là kiểm định về tính độc lập.

Mẹo phòng thi

Viết đủ ba điều kiện thành ba câu riêng, mỗi câu kèm số liệu của đề.

Trình bày kết luận theo mạch: so sánh pp-value với α\alpha, ra quyết định, rồi diễn giải theo ngữ cảnh.

Khi bác bỏ, hãy chỉ ra ô đóng góp nhiều nhất vào χ2\chi^2 để mô tả mối liên hệ.

Tần suất trong đề AP StatisticsThường xuyên

Ví dụ có lời giải

1Ví dụ 1/2
Một trường liên cấp có khoảng 5 000 học sinh. Ban giám hiệu chọn ngẫu nhiên đơn giản 200 học sinh và ghi lại hai đặc điểm của mỗi em: khối lớp (10, 11, 12) và việc em đó có đi làm thêm ngoài giờ học hay không. Kết quả được tóm tắt trong bảng hai chiều sau (số quan sát được): | Khối lớp | Có làm thêm | Không làm thêm | Tổng | |---|---|---|---|Lớp 10125870Lớp 11204565Lớp 12283765Tổng60140200 Ban giám hiệu muốn biết liệu khối lớp và việc đi làm thêm có liên hệ với nhau trong toàn trường hay không, ở mức ý nghĩa α=0,05\alpha = 0{,}05.
  1. aPhát biểu cặp giả thuyết và kiểm tra các điều kiện cần thiết cho kiểm định.
  2. bTính bảng giá trị kỳ vọng, thống kê kiểm định, bậc tự do và giá trị pp.
  3. cNêu kết luận trong ngữ cảnh và cho biết loại sai lầm nào có thể đã mắc phải.
1Bước 1: Vì chỉ có một mẫu duy nhất gồm 200 học sinh và mỗi em được phân loại theo hai biến định tính, đây đúng là tình huống của kiểm định về tính độc lập chứ không phải kiểm định về tính đồng nhất. Cặp giả thuyết phải nói về mối liên hệ giữa hai biến trong cùng một tổng thể: H0H_0 — khối lớp và việc đi làm thêm là độc lập với nhau đối với học sinh của trường; HaH_a — khối lớp và việc đi làm thêm không độc lập, tức là có mối liên hệ (association) giữa hai biến này.
2Bước 2: Kiểm tra ba điều kiện. Mẫu là mẫu ngẫu nhiên đơn giản nên điều kiện ngẫu nhiên thỏa mãn. Việc lấy mẫu là không hoàn lại, nhưng 200<0,1×5000=500200 < 0{,}1 \times 5\,000 = 500 nên điều kiện 10% cũng thỏa mãn, các quan sát coi như độc lập. Điều kiện cuối cùng về cỡ mẫu lớn sẽ được xác nhận ngay sau khi tính xong bảng giá trị kỳ vọng (expected counts) ở bước dưới.
3Bước 3: Mỗi giá trị kỳ vọng được tính từ tổng dòng, tổng cột và cỡ mẫu theo công thức Eij=RiCjn.E_{ij} = \frac{R_i \cdot C_j}{n}. Ví dụ ô "Lớp 10 – có làm thêm" cho E=70×60200=21E = \dfrac{70 \times 60}{200} = 21. Làm tương tự cho năm ô còn lại, ta được bảng: lớp 10 là 21214949; lớp 11 là 65×60200=19,5\dfrac{65 \times 60}{200} = 19{,}545,545{,}5; lớp 12 cũng là 19,519{,}545,545{,}5. Giá trị kỳ vọng nhỏ nhất là 19,5>519{,}5 > 5, do đó điều kiện cỡ mẫu lớn được thỏa mãn và phân phối chi bình phương dùng được làm xấp xỉ.
4Bước 4: Cộng đóng góp của sáu ô theo công thức χ2=(OE)2E,\chi^2 = \sum \frac{(O-E)^2}{E}, trong đó OO là số quan sát được còn EE là giá trị kỳ vọng tương ứng. Cụ thể: (1221)221=3,857\dfrac{(12-21)^2}{21} = 3{,}857; (5849)249=1,653\dfrac{(58-49)^2}{49} = 1{,}653; (2019,5)219,5=0,013\dfrac{(20-19{,}5)^2}{19{,}5} = 0{,}013; (4545,5)245,5=0,005\dfrac{(45-45{,}5)^2}{45{,}5} = 0{,}005; (2819,5)219,5=3,705\dfrac{(28-19{,}5)^2}{19{,}5} = 3{,}705; (3745,5)245,5=1,588\dfrac{(37-45{,}5)^2}{45{,}5} = 1{,}588. Tổng lại được χ210,82\chi^2 \approx 10{,}82, và có thể thấy ngay hai ô của lớp 10 và lớp 12 đóng góp gần như toàn bộ giá trị này.
5Bước 5: Bảng có 3 dòng và 2 cột nên bậc tự do (degrees of freedom) là df=(31)(21)=2df = (3-1)(2-1) = 2. Tra máy tính, χ2cdf(10,82, 1000, 2)0,0045\chi^2\text{cdf}(10{,}82,\ 1000,\ 2) \approx 0{,}0045. Vậy giá trị p0,0045p \approx 0{,}0045: nếu hai biến thực sự độc lập thì xác suất thu được một thống kê kiểm định lớn cỡ 10,8210{,}82 trở lên chỉ do biến thiên ngẫu nhiên của mẫu 200 học sinh là khoảng 0,45%.
6Bước 6: So sánh với mức ý nghĩa: vì p0,0045<0,05=αp \approx 0{,}0045 < 0{,}05 = \alpha, ta bác bỏ giả thuyết không (null hypothesis). Do đã bác bỏ H0H_0, sai lầm duy nhất còn có thể mắc là sai lầm loại I (Type I error), tức là kết luận có mối liên hệ trong khi thực ra khối lớp và việc đi làm thêm hoàn toàn độc lập. Hậu quả thực tế là nhà trường có thể tốn công xây dựng chương trình hỗ trợ riêng cho học sinh lớp 12 dựa trên một mối liên hệ không có thật.

Với χ210,82\chi^2 \approx 10{,}82, df=2df = 2p0,0045<0,05p \approx 0{,}0045 < 0{,}05, ta bác bỏ H0H_0. Có bằng chứng thuyết phục rằng khối lớp và việc đi làm thêm không độc lập với nhau đối với học sinh của trường; số liệu cho thấy tỉ lệ đi làm thêm tăng dần theo khối lớp (lớp 10 quan sát được ít hơn kỳ vọng, lớp 12 nhiều hơn kỳ vọng). Vì đã bác bỏ H0H_0 nên loại sai lầm có thể mắc là sai lầm loại I.

2Ví dụ 2/2
Một nhà nghiên cứu thực hiện kiểm định chi bình phương về tính độc lập trên một bảng hai chiều gồm 3 nhóm tuổi và 3 loại phương tiện đi làm, với mức ý nghĩa α=0,05\alpha = 0{,}05. Giả sử mọi điều kiện của kiểm định đều đã được thỏa mãn. Thống kê kiểm định thu được là χ27,85\chi^2 \approx 7{,}85 và giá trị pp tương ứng là 0,09720{,}0972.
  1. aXác nhận bậc tự do của kiểm định và nêu quyết định thống kê.
  2. bLoại sai lầm nào có thể đã mắc phải? Diễn giải sai lầm đó trong ngữ cảnh.
1Bước 1: Bảng có r=3r = 3 dòng và c=3c = 3 cột nên df=(r1)(c1)=(31)(31)=4df = (r-1)(c-1) = (3-1)(3-1) = 4, đúng với giá trị p=0,0972p = 0{,}0972 ứng với χ2=7,85\chi^2 = 7{,}85. Lưu ý rằng bậc tự do của kiểm định về tính độc lập chỉ phụ thuộc vào kích thước bảng, không phụ thuộc vào cỡ mẫu, nên đây là chi tiết dễ kiểm tra nhanh trong đề trắc nghiệm.
2Bước 2: So sánh pp với α\alpha: vì 0,0972>0,050{,}0972 > 0{,}05, ta không bác bỏ H0H_0. Kết luận là không đủ bằng chứng để cho rằng nhóm tuổi và phương tiện đi làm có liên hệ với nhau. Cần nhớ rằng "không bác bỏ" không đồng nghĩa với "chứng minh hai biến độc lập" — ta chỉ đơn giản là không tìm được bằng chứng đủ mạnh chống lại giả thuyết độc lập.
3Bước 3: Loại sai lầm có thể mắc luôn được xác định bởi quyết định vừa đưa ra, chứ không bởi độ lớn của χ2\chi^2. Khi đã bác bỏ H0H_0 thì chỉ có thể mắc sai lầm loại I; ngược lại, khi không bác bỏ H0H_0 như ở đây thì chỉ có thể mắc sai lầm loại II (Type II error), tức là không bác bỏ một giả thuyết không vốn dĩ sai.

Bậc tự do là df=4df = 4. Vì p=0,0972>α=0,05p = 0{,}0972 > \alpha = 0{,}05 nên ta không bác bỏ H0H_0, và do đó loại sai lầm có thể mắc là sai lầm loại II: trong thực tế nhóm tuổi và phương tiện đi làm có liên hệ với nhau, nhưng dữ liệu của nghiên cứu này lại không phát hiện được mối liên hệ đó.

Bạn nắm chắc chưa?

Quiz câu thật từ ngân hàng đề

Vài câu thật gắn đúng khái niệm này, chấm ngay kèm giải thích từng đáp án — hệ thống ghi nhớ bạn nắm tới đâu.

Tạo tài khoản miễn phí

Học tiếp từ đây

Mục tiêu và lộ trình unit xem miễn phí — làm bài tập và lưu tiến độ cần tài khoản 0đ.

Hay nhầm với

Khác nhau ở đâuKiểm định tính độc lập lấy một mẫu duy nhất rồi phân loại theo hai biến. Kiểm định tính đồng nhất lấy nhiều mẫu riêng từ các tổng thể khác nhau.
Hay nhầm khiĐề mô tả cách thu thập dữ liệu rồi hỏi tên kiểm định; hai kiểm định có cùng công thức nên chỉ phân biệt được qua thiết kế lấy mẫu.
Khác nhau ở đâuKiểm định độ phù hợp xét một biến phân loại so với bộ tỉ lệ lý thuyết. Kiểm định tính độc lập xét liên hệ giữa hai biến trong bảng hai chiều.
Hay nhầm khiKhi bảng dữ liệu chỉ có một hàng, thí sinh hay chọn nhầm kiểm định tính độc lập và tính sai bậc tự do.

Cùng chủ đề

Nguồn tham khảo

  1. [1]Barron_AP_Stat_2026. tr. 14, 435, 440.

Biên soạn bởi DucklingStudy, bản quyền thuộc DucklingStudy. Xuất bản .