AP Statistics

kiểm định z hai mẫu cho hiệu hai tỉ lệ

two-sample z-test for a difference in proportions

Còn gọi: two-sample z-test for a difference in proportions

Kiểm định z hai mẫu cho hiệu hai tỉ lệ là phép kiểm định giả thuyết dùng thống kê z để xét xem hai tỉ lệ tổng thể có bằng nhau hay không.

Khi muốn biết hai nhóm khác nhau có cùng một tỉ lệ thành công hay không — chẳng hạn tỉ lệ khỏi bệnh giữa nhóm dùng thuốc mới và nhóm dùng thuốc đối chứng — ta cần một công cụ so sánh hai tỉ lệ tổng thể p1p_1p2p_2 dựa trên hai tỉ lệ mẫu p^1\hat{p}_1p^2\hat{p}_2. Kiểm định z hai mẫu cho hiệu hai tỉ lệ (two-sample z-test for a difference in proportions) ra đời để trả lời câu hỏi đó. Giả thuyết không luôn phát biểu H0:p1=p2H_0: p_1 = p_2, tức là hai tổng thể thực chất có cùng một tỉ lệ, còn giả thuyết thay thế nêu p1>p2p_1 > p_2, p1<p2p_1 < p_2 hoặc p1p2p_1 \neq p_2 tùy vào câu hỏi nghiên cứu đặt ra. Do đó, việc chọn đúng dạng giả thuyết thay thế ngay từ đầu sẽ quyết định cách đọc kết quả sau này.

Điểm đặc biệt của kiểm định này nằm ở cách tính độ lệch chuẩn (standard deviation) của hiệu hai tỉ lệ mẫu. Vì giả thuyết không giả định hai tỉ lệ bằng nhau, nên thay vì dùng riêng p^1\hat{p}_1p^2\hat{p}_2, người ta gộp hai mẫu lại thành một tỉ lệ gộp duy nhất:

p^c=x1+x2n1+n2\hat{p}_c = \frac{x_1+x_2}{n_1+n_2}

trong đó x1,x2x_1, x_2 là số thành công và n1,n2n_1, n_2 là cỡ mẫu (sample size) của hai mẫu. Tỉ lệ gộp này đóng vai trò ước lượng tốt nhất cho tỉ lệ chung dưới giả thuyết không.

Từ tỉ lệ gộp, thống kê kiểm định được tính bằng

z=p^1p^2p^c(1p^c)(1n1+1n2)z = \frac{\hat{p}_1 - \hat{p}_2}{\sqrt{\hat{p}_c(1-\hat{p}_c)\left(\dfrac{1}{n_1}+\dfrac{1}{n_2}\right)}}

Giá trị z này cho biết khoảng cách quan sát được giữa hai tỉ lệ mẫu lớn gấp bao nhiêu lần độ lệch chuẩn kỳ vọng nếu H0H_0 đúng. Ngược lại, nếu z càng gần 0 thì hai tỉ lệ mẫu càng gần nhau, và bằng chứng bác bỏ H0H_0 càng yếu.

Để kết quả đáng tin cậy, dữ liệu cần đến từ hai mẫu ngẫu nhiên độc lập, và cỡ mẫu phải đủ lớn theo điều kiện số đếm lớn: cả bốn giá trị n1p^cn_1\hat{p}_c, n1(1p^c)n_1(1-\hat{p}_c), n2p^cn_2\hat{p}_c, n2(1p^c)n_2(1-\hat{p}_c) đều phải từ 10 trở lên để phân phối lấy mẫu của hiệu hai tỉ lệ xấp xỉ chuẩn. Vì vậy, nếu một trong bốn điều kiện này không thỏa, kết quả kiểm định sẽ kém tin cậy và cần cân nhắc phương pháp khác.

Sau khi có z, ta tính giá trị p tương ứng và so với mức ý nghĩa đã chọn để quyết định bác bỏ hay không bác bỏ H0H_0. Kết luận rút ra khi đó thường được đối chiếu thêm với khoảng tin cậy cho hiệu hai tỉ lệ (difference of two proportions) nhằm đánh giá cả độ lớn lẫn ý nghĩa thực tiễn của sự khác biệt.

Ký hiệup^c\hat{p}_c, zz, H0:p1=p2H_0: p_1 = p_2

Trực giác: Giống như trộn phiếu bầu của hai nhóm cử tri lại để tính tỉ lệ ủng hộ chung, rồi xem hai nhóm ban đầu lệch khỏi con số chung đó bao xa.

Công thức

z=(p^1p^2)p^(1p^)(1n1+1n2)z=\htmlClass{fp-4}{\frac{\htmlClass{fp-0}{(\hat{p}_1-\hat{p}_2)}}{\htmlClass{fp-3}{\sqrt{\htmlClass{fp-1}{\hat{p}(1-\hat{p})}\htmlClass{fp-2}{\left(\frac{1}{n_1}+\frac{1}{n_2}\right)}}}}}

Dùng khi kiểm định giả thuyết H0:p1=p2H_0:p_1=p_2 so với đối thuyết một phía hoặc hai phía về hiệu hai tỉ lệ tổng thể, sau khi đã kiểm tra các điều kiện chọn mẫu ngẫu nhiên, độc lập và cỡ mẫu đủ lớn để dùng xấp xỉ chuẩn.

Trong đó

p^1\hat{p}_1tỉ lệ thành công quan sát được trong mẫu thứ nhấtp^2\hat{p}_2tỉ lệ thành công quan sát được trong mẫu thứ hain1n_1cỡ mẫu thứ nhấtn2n_2cỡ mẫu thứ haip^\hat{p}tỉ lệ gộp, ước lượng tỉ lệ chung dưới giả thuyết H0H_0
p^=x1+x2n1+n2\hat{p}=\frac{x_1+x_2}{n_1+n_2}

Dùng để tính tỉ lệ gộp trước khi thay vào công thức thống kê zz, áp dụng khi giả thuyết không cho rằng hai tổng thể có cùng một tỉ lệ thật.

Trong đó

x1x_1số trường hợp thành công trong mẫu thứ nhấtx2x_2số trường hợp thành công trong mẫu thứ hain1n_1cỡ mẫu thứ nhấtn2n_2cỡ mẫu thứ hai

Khái niệm này sinh ra từ đâu

thập niên 1730 (nền móng) — hoàn chỉnh trong thế kỷ 19–20Abraham de Moivre

Kiểm định z hai mẫu cho hiệu hai tỉ lệ lớn lên từ truyền thống dùng phân phối chuẩn để suy luận về tham số tổng thể, với nền móng do Abraham de Moivre đặt ra từ thập niên 1730 khi ông chỉ ra phân phối nhị thức có thể xấp xỉ bằng đường cong chuẩn; dạng kiểm định giả thuyết hoàn chỉnh chỉ định hình trong thống kê hiện đại của thế kỷ 19 và 20.

Câu hỏi "hai nhóm có khác nhau ở một kết quả phân loại hay không" đã theo thống kê từ những ngày đầu: một loại thuốc mới có tỉ lệ khỏi bệnh cao hơn giả dược không, tỉ lệ cử tri đi bầu ở hai quận có lệch nhau không. Để trả lời, người ta cần biết tỉ lệ mẫu dao động thế nào quanh tỉ lệ tổng thể. Nhờ kết quả xấp xỉ chuẩn cho phân phối nhị thức, bài toán rời rạc và khó tính ấy được chuyển sang một đường cong trơn quen thuộc. Từ đó, hiệu hai tỉ lệ mẫu có thể chuẩn hóa thành một thống kê duy nhất và đem so với ngưỡng, mở đường cho mọi kiểm định tỉ lệ mẫu lớn ngày nay.

Vì sao mang đúng cái tên này? Tên gọi của kiểm định này mô tả gần như đầy đủ cấu trúc của nó, nên đọc kỹ từng mảnh là hiểu ngay công thức. "Hai mẫu" (two-sample) nhắc rằng dữ liệu đến từ hai nhóm lấy mẫu độc lập chứ không phải hai lần đo trên cùng một nhóm; "hiệu hai tỉ lệ" chỉ rõ đại lượng được quan tâm là p1p2p_1-p_2, tức khoảng cách giữa hai tỉ lệ tổng thể. Giả thuyết không vì vậy luôn có dạng H0:p1=p2H_0: p_1=p_2, nghĩa là ta khởi đầu bằng niềm tin rằng hai tỉ lệ thật sự bằng nhau và chỉ từ bỏ niềm tin ấy khi dữ liệu đủ mâu thuẫn. Chữ "z" mới là phần có lịch sử đằng sau. Mỗi tỉ lệ mẫu thực chất là trung bình của các quan sát nhận giá trị 0 hoặc 1, nên khi cỡ mẫu đủ lớn, định lý giới hạn trung tâm (central limit theorem) bảo đảm nó xấp xỉ phân phối chuẩn — đúng như ý tưởng xấp xỉ phân phối nhị thức (binomial distribution) bằng đường cong chuẩn đã được phát hiện từ thế kỷ 18. Do đó hiệu hai tỉ lệ mẫu cũng xấp xỉ chuẩn, và khi chia cho sai số chuẩn (standard error) ước lượng, ta thu được một đại lượng so sánh được với phân phối chuẩn tắc. Đại lượng chuẩn hóa ấy theo truyền thống ký hiệu là zz, và kiểm định mang luôn tên của nó. Một chi tiết nữa giải thích vì sao công thức trong đề thi trông cồng kềnh hơn dự đoán. Vì giả thuyết không khẳng định hai tỉ lệ bằng nhau, hai mẫu được gộp lại thành một tỉ lệ gộp (pooled proportion) để ước lượng giá trị chung đó, rồi mới dùng nó tính sai số chuẩn. Đây không phải quy ước tùy tiện mà là hệ quả trực tiếp của việc tin vào H0H_0 khi tính toán; nhờ đó thống kê zz phản ánh đúng mức dao động lẽ ra phải có nếu hai tỉ lệ quả thật không khác nhau.

Hay hiểu sai

Tỉ lệ gộp chỉ dùng cho kiểm định, không dùng cho khoảng tin cậy.

Giả thuyết phải viết bằng tham số tổng thể, không phải bằng tỉ lệ mẫu.

Điều kiện đếm lớn phải kiểm với số đếm thực tế của từng mẫu, không kiểm bằng tỉ lệ.

Dữ liệu cặp không được dùng kiểm định hai mẫu.

Giá trị p lớn không chứng minh hai tỉ lệ bằng nhau.

Mẹo phòng thi

Đọc kỹ đề xem câu hỏi yêu cầu kiểm định hay khoảng tin cậy trước khi viết chữ nào.

Trình bày đủ bốn bước thì mới lấy trọn điểm.

Cẩn thận với giả thuyết một phía và thứ tự trừ hai tỉ lệ.

Tần suất trong đề AP StatisticsThường xuyên

Ví dụ có lời giải

1Ví dụ 1/2
Một trường trung học muốn biết thói quen ăn sáng có khác nhau giữa hai khối lớp hay không. Ban khảo sát chọn ngẫu nhiên 150 học sinh khối 10 và 180 học sinh khối 12 (hai mẫu độc lập, mỗi mẫu chiếm chưa tới 10% số học sinh của khối). Kết quả cho thấy 96 học sinh khối 10 và 99 học sinh khối 12 nói rằng mình ăn sáng đều đặn mỗi ngày. Nhà trường tiến hành kiểm định ở mức ý nghĩa α=0,05\alpha = 0{,}05.
  1. aNêu cặp giả thuyết và kiểm tra các điều kiện cần thiết cho kiểm định.
  2. bTính thống kê kiểm định và giá trị p tương ứng.
  3. cĐưa ra kết luận trong ngữ cảnh bài toán ở mức ý nghĩa 5%.
1Bước 1: Gọi p1p_1 là tỉ lệ học sinh khối 10 ăn sáng đều đặn và p2p_2 là tỉ lệ tương ứng của khối 12, cả hai đều là tỉ lệ của toàn khối chứ không phải của mẫu. Vì đề chỉ hỏi hai khối "có khác nhau hay không" mà không chỉ rõ khối nào cao hơn, ta dùng giả thuyết đối (alternative hypothesis) hai phía: H0:p1=p2H_0: p_1 = p_2Ha:p1p2H_a: p_1 \neq p_2. Cách viết tương đương thường gặp trong đề là H0:p1p2=0H_0: p_1 - p_2 = 0, nhấn mạnh rằng đại lượng đang được kiểm định chính là hiệu hai tỉ lệ.
2Bước 2: Điều kiện ngẫu nhiên được thỏa vì hai mẫu đều được chọn ngẫu nhiên và độc lập với nhau, đồng thời mỗi mẫu chiếm chưa tới 10% khối của mình nên các quan sát trong cùng một mẫu cũng xem như độc lập. Điều kiện số đếm lớn đòi hỏi cả bốn số thành công và thất bại đều từ 10 trở lên: ở khối 10 có 969615096=54150 - 96 = 54, ở khối 12 có 999918099=81180 - 99 = 81. Bốn số này đều vượt xa 10, do đó phân phối mẫu của hiệu p^1p^2\hat p_1 - \hat p_2 xấp xỉ chuẩn và ta được phép dùng mô hình zz.
3Bước 3: Hai tỉ lệ mẫu là p^1=96/150=0,64\hat p_1 = 96/150 = 0{,}64p^2=99/180=0,55\hat p_2 = 99/180 = 0{,}55, nên hiệu quan sát được là p^1p^2=0,09\hat p_1 - \hat p_2 = 0{,}09. Vì H0H_0 giả định hai tỉ lệ bằng nhau, ta gộp toàn bộ dữ liệu lại để ước lượng cái tỉ lệ chung đó, gọi là tỉ lệ gộp (pooled proportion): p^c=96+99150+180=1953300,5909.\hat p_c = \frac{96 + 99}{150 + 180} = \frac{195}{330} \approx 0{,}5909. Con số này nói rằng nếu quả thật hai khối giống nhau thì tỉ lệ chung vào khoảng 59,09%, và chính nó sẽ được dùng để đo độ dao động của hiệu hai tỉ lệ.
4Bước 4: Sai số chuẩn (standard error) của hiệu hai tỉ lệ được tính từ tỉ lệ gộp theo công thức SE=p^c(1p^c)(1n1+1n2).SE = \sqrt{\hat p_c(1-\hat p_c)\left(\frac{1}{n_1}+\frac{1}{n_2}\right)}. Thay số, p^c(1p^c)=0,5909×0,40910,2417\hat p_c(1-\hat p_c) = 0{,}5909 \times 0{,}4091 \approx 0{,}24171150+11800,012222\frac{1}{150}+\frac{1}{180} \approx 0{,}012222, nên SE0,00295450,05436SE \approx \sqrt{0{,}0029545} \approx 0{,}05436. Đây là mức chênh lệch "bình thường" mà ta có thể gặp giữa hai tỉ lệ mẫu ngay cả khi hai khối thật sự giống hệt nhau.
5Bước 5: Thống kê kiểm định đo xem hiệu quan sát được cách 0 bao nhiêu lần sai số chuẩn: z=0,640,550,054361,656.z = \frac{0{,}64 - 0{,}55}{0{,}05436} \approx 1{,}656. Vì giả thuyết đối là hai phía, giá trị p (p-value) gộp cả hai đuôi: p=2P(Z>1,656)2(0,0489)0,098p = 2P(Z > 1{,}656) \approx 2(0{,}0489) \approx 0{,}098. Nói cách khác, nếu hai khối thật sự có cùng tỉ lệ ăn sáng thì vẫn có gần 10% khả năng ta bắt gặp chênh lệch mẫu từ 9 điểm phần trăm trở lên, một mức không hiếm đến mức đáng ngờ.
6Bước 6: So sánh p0,098p \approx 0{,}098 với α=0,05\alpha = 0{,}05, ta thấy 0,098>0,050{,}098 > 0{,}05 nên không bác bỏ H0H_0. Cần cẩn thận với cách diễn đạt: không bác bỏ không có nghĩa là đã chứng minh hai tỉ lệ bằng nhau, mà chỉ là dữ liệu chưa đủ mạnh để khẳng định chúng khác nhau. Nếu cỡ mẫu lớn hơn mà hiệu vẫn giữ ở mức 9 điểm phần trăm, SESE sẽ nhỏ đi, zz sẽ lớn lên và kết luận rất có thể sẽ đảo chiều.

Với z1,656z \approx 1{,}656 và giá trị p xấp xỉ 0,098>0,050{,}098 > 0{,}05, ta không bác bỏ giả thuyết không. Dữ liệu không cung cấp bằng chứng thuyết phục cho thấy tỉ lệ học sinh ăn sáng đều đặn ở khối 10 khác với tỉ lệ đó ở khối 12 của trường này.

2Ví dụ 2/2
Một nhóm nghiên cứu y khoa thử nghiệm loại thuốc xịt mũi mới nhằm giảm nguy cơ mắc cúm mùa. Họ tuyển 400 tình nguyện viên rồi chia ngẫu nhiên thành hai nhóm bằng nhau: 200 người dùng thuốc xịt thật và 200 người dùng giả dược. Sau ba tháng theo dõi, nhóm dùng thuốc có 18 người mắc cúm, còn nhóm giả dược có 34 người mắc. Nhóm nghiên cứu kiểm định ở mức ý nghĩa α=0,05\alpha = 0{,}05 xem thuốc có thực sự làm giảm tỉ lệ mắc cúm hay không.
  1. aThực hiện đầy đủ bốn bước của một kiểm định giả thuyết cho hiệu hai tỉ lệ.
  2. bGiải thích vì sao ở thí nghiệm này ta được phép kết luận về quan hệ nhân quả, còn ở một khảo sát quan sát thì không.
1Bước 1: Gọi p1p_1 là tỉ lệ mắc cúm nếu toàn bộ tình nguyện viên dùng thuốc xịt và p2p_2 là tỉ lệ mắc cúm nếu tất cả dùng giả dược. Vì nhà nghiên cứu kỳ vọng thuốc làm giảm nguy cơ, giả thuyết đối là một phía: H0:p1=p2H_0: p_1 = p_2Ha:p1<p2H_a: p_1 < p_2. Hướng của dấu bất đẳng thức phải được quyết định trước khi nhìn số liệu, nếu không thì giá trị p sẽ bị bóp méo.
2Bước 2: Đây là một thí nghiệm có phân công ngẫu nhiên (random assignment), nên hai nhóm độc lập với nhau và điều kiện ngẫu nhiên được thỏa; lưu ý rằng ở thí nghiệm ta không cần kiểm tra điều kiện 10% vì đối tượng không được rút ra từ một tổng thể hữu hạn nào. Điều kiện số đếm lớn cũng đạt: nhóm thuốc có 18 người mắc và 20018=182200 - 18 = 182 người không mắc, nhóm giả dược có 34 và 20034=166200 - 34 = 166, tất cả đều lớn hơn 10. Vì vậy mô hình chuẩn dùng được cho hiệu hai tỉ lệ.
3Bước 3: Hai tỉ lệ mắc bệnh là p^1=18/200=0,09\hat p_1 = 18/200 = 0{,}09p^2=34/200=0,17\hat p_2 = 34/200 = 0{,}17, cho hiệu p^1p^2=0,08\hat p_1 - \hat p_2 = -0{,}08. Tỉ lệ gộp là p^c=(18+34)/400=52/400=0,13\hat p_c = (18+34)/400 = 52/400 = 0{,}13, từ đó SE=0,13×0,87×(1200+1200)=0,1131×0,010,03363.SE = \sqrt{0{,}13 \times 0{,}87 \times \left(\tfrac{1}{200}+\tfrac{1}{200}\right)} = \sqrt{0{,}1131 \times 0{,}01} \approx 0{,}03363. Con số 0,033630{,}03363 cho biết chênh lệch giữa hai nhóm thường dao động khoảng ba điểm phần trăm chỉ do may rủi khi chia nhóm.
4Bước 4: Thống kê kiểm định là z=0,080,033632,379,z = \frac{-0{,}08}{0{,}03363} \approx -2{,}379, nghĩa là hiệu quan sát được nằm thấp hơn 0 gần hai phẩy bốn sai số chuẩn. Vì giả thuyết đối chỉ hướng về một phía, ta chỉ lấy đuôi trái: p=P(Z<2,379)0,0087p = P(Z < -2{,}379) \approx 0{,}0087. Xác suất chưa tới 1% này cho thấy một chênh lệch lớn như vậy rất khó xảy ra nếu thuốc hoàn toàn vô tác dụng.
5Bước 5: 0,0087<0,050{,}0087 < 0{,}05, ta bác bỏ H0H_0 và kết luận có bằng chứng thuyết phục rằng thuốc xịt làm giảm tỉ lệ mắc cúm. Điểm mấu chốt ở phần (b) nằm ở cách thu thập dữ liệu chứ không nằm ở phép tính: chính việc chia nhóm ngẫu nhiên đã cân bằng mọi yếu tố gây nhiễu như tuổi tác, thể trạng hay thói quen sinh hoạt giữa hai nhóm. Nhờ đó, chênh lệch còn lại chỉ có thể quy cho cách xử lý, nên kết luận nhân quả là hợp lệ. Ngược lại, nếu người tham gia tự chọn dùng thuốc hay không, nhóm chịu khó dùng thuốc có thể cũng là nhóm giữ gìn sức khỏe tốt hơn, và ta chỉ được nói hai biến có liên hệ chứ không được nói thuốc gây ra sự khác biệt.

Với z2,379z \approx -2{,}379 và giá trị p xấp xỉ 0,0087<0,050{,}0087 < 0{,}05, ta bác bỏ giả thuyết không: có bằng chứng thuyết phục rằng thuốc xịt mũi làm giảm tỉ lệ mắc cúm so với giả dược. Hơn nữa, vì các tình nguyện viên được phân công ngẫu nhiên vào hai nhóm, kết luận này được phép phát biểu dưới dạng nhân quả cho nhóm đối tượng tham gia thí nghiệm.

Bạn nắm chắc chưa?

Quiz câu thật từ ngân hàng đề

Vài câu thật gắn đúng khái niệm này, chấm ngay kèm giải thích từng đáp án — hệ thống ghi nhớ bạn nắm tới đâu.

Tạo tài khoản miễn phí

Học tiếp từ đây

Mục tiêu và lộ trình unit xem miễn phí — làm bài tập và lưu tiến độ cần tài khoản 0đ.

Hay nhầm với

Khác nhau ở đâuKiểm định một mẫu so tỉ lệ của một nhóm với một giá trị cho trước. Kiểm định hai mẫu so tỉ lệ của hai nhóm độc lập với nhau.
Hay nhầm khiĐề cho hai nhóm nhưng nêu sẵn một con số mục tiêu, thí sinh dễ chọn nhầm loại kiểm định và dùng sai sai số chuẩn.
Khác nhau ở đâuKiểm định z hai mẫu cho biết chiều của hiệu và dùng được đối thuyết một phía. Kiểm định chi bình phương chỉ xét có liên hệ hay không, luôn hai phía.
Hay nhầm khiVới bảng hai chiều cỡ 2×2, hai kiểm định cho cùng kết luận nên thí sinh hay chọn nhầm khi đề hỏi về chiều của hiệu.

Biên soạn bởi DucklingStudy, bản quyền thuộc DucklingStudy. Xuất bản .