AP Statistics
two-sample z-test for a difference in proportions
Còn gọi: two-sample z-test for a difference in proportions
Kiểm định z hai mẫu cho hiệu hai tỉ lệ là phép kiểm định giả thuyết dùng thống kê z để xét xem hai tỉ lệ tổng thể có bằng nhau hay không.
Khi muốn biết hai nhóm khác nhau có cùng một tỉ lệ thành công hay không — chẳng hạn tỉ lệ khỏi bệnh giữa nhóm dùng thuốc mới và nhóm dùng thuốc đối chứng — ta cần một công cụ so sánh hai tỉ lệ tổng thể và dựa trên hai tỉ lệ mẫu và . Kiểm định z hai mẫu cho hiệu hai tỉ lệ (two-sample z-test for a difference in proportions) ra đời để trả lời câu hỏi đó. Giả thuyết không luôn phát biểu , tức là hai tổng thể thực chất có cùng một tỉ lệ, còn giả thuyết thay thế nêu , hoặc tùy vào câu hỏi nghiên cứu đặt ra. Do đó, việc chọn đúng dạng giả thuyết thay thế ngay từ đầu sẽ quyết định cách đọc kết quả sau này.
Điểm đặc biệt của kiểm định này nằm ở cách tính độ lệch chuẩn (standard deviation) của hiệu hai tỉ lệ mẫu. Vì giả thuyết không giả định hai tỉ lệ bằng nhau, nên thay vì dùng riêng và , người ta gộp hai mẫu lại thành một tỉ lệ gộp duy nhất:
trong đó là số thành công và là cỡ mẫu (sample size) của hai mẫu. Tỉ lệ gộp này đóng vai trò ước lượng tốt nhất cho tỉ lệ chung dưới giả thuyết không.
Từ tỉ lệ gộp, thống kê kiểm định được tính bằng
Giá trị z này cho biết khoảng cách quan sát được giữa hai tỉ lệ mẫu lớn gấp bao nhiêu lần độ lệch chuẩn kỳ vọng nếu đúng. Ngược lại, nếu z càng gần 0 thì hai tỉ lệ mẫu càng gần nhau, và bằng chứng bác bỏ càng yếu.
Để kết quả đáng tin cậy, dữ liệu cần đến từ hai mẫu ngẫu nhiên độc lập, và cỡ mẫu phải đủ lớn theo điều kiện số đếm lớn: cả bốn giá trị , , , đều phải từ 10 trở lên để phân phối lấy mẫu của hiệu hai tỉ lệ xấp xỉ chuẩn. Vì vậy, nếu một trong bốn điều kiện này không thỏa, kết quả kiểm định sẽ kém tin cậy và cần cân nhắc phương pháp khác.
Sau khi có z, ta tính giá trị p tương ứng và so với mức ý nghĩa đã chọn để quyết định bác bỏ hay không bác bỏ . Kết luận rút ra khi đó thường được đối chiếu thêm với khoảng tin cậy cho hiệu hai tỉ lệ (difference of two proportions) nhằm đánh giá cả độ lớn lẫn ý nghĩa thực tiễn của sự khác biệt.
Trực giác: Giống như trộn phiếu bầu của hai nhóm cử tri lại để tính tỉ lệ ủng hộ chung, rồi xem hai nhóm ban đầu lệch khỏi con số chung đó bao xa.
Dùng khi kiểm định giả thuyết so với đối thuyết một phía hoặc hai phía về hiệu hai tỉ lệ tổng thể, sau khi đã kiểm tra các điều kiện chọn mẫu ngẫu nhiên, độc lập và cỡ mẫu đủ lớn để dùng xấp xỉ chuẩn.
Trong đó
Dùng để tính tỉ lệ gộp trước khi thay vào công thức thống kê , áp dụng khi giả thuyết không cho rằng hai tổng thể có cùng một tỉ lệ thật.
Trong đó
thập niên 1730 (nền móng) — hoàn chỉnh trong thế kỷ 19–20Abraham de Moivre
Câu hỏi "hai nhóm có khác nhau ở một kết quả phân loại hay không" đã theo thống kê từ những ngày đầu: một loại thuốc mới có tỉ lệ khỏi bệnh cao hơn giả dược không, tỉ lệ cử tri đi bầu ở hai quận có lệch nhau không. Để trả lời, người ta cần biết tỉ lệ mẫu dao động thế nào quanh tỉ lệ tổng thể. Nhờ kết quả xấp xỉ chuẩn cho phân phối nhị thức, bài toán rời rạc và khó tính ấy được chuyển sang một đường cong trơn quen thuộc. Từ đó, hiệu hai tỉ lệ mẫu có thể chuẩn hóa thành một thống kê duy nhất và đem so với ngưỡng, mở đường cho mọi kiểm định tỉ lệ mẫu lớn ngày nay.
Vì sao mang đúng cái tên này? Tên gọi của kiểm định này mô tả gần như đầy đủ cấu trúc của nó, nên đọc kỹ từng mảnh là hiểu ngay công thức. "Hai mẫu" (two-sample) nhắc rằng dữ liệu đến từ hai nhóm lấy mẫu độc lập chứ không phải hai lần đo trên cùng một nhóm; "hiệu hai tỉ lệ" chỉ rõ đại lượng được quan tâm là , tức khoảng cách giữa hai tỉ lệ tổng thể. Giả thuyết không vì vậy luôn có dạng , nghĩa là ta khởi đầu bằng niềm tin rằng hai tỉ lệ thật sự bằng nhau và chỉ từ bỏ niềm tin ấy khi dữ liệu đủ mâu thuẫn. Chữ "z" mới là phần có lịch sử đằng sau. Mỗi tỉ lệ mẫu thực chất là trung bình của các quan sát nhận giá trị 0 hoặc 1, nên khi cỡ mẫu đủ lớn, định lý giới hạn trung tâm (central limit theorem) bảo đảm nó xấp xỉ phân phối chuẩn — đúng như ý tưởng xấp xỉ phân phối nhị thức (binomial distribution) bằng đường cong chuẩn đã được phát hiện từ thế kỷ 18. Do đó hiệu hai tỉ lệ mẫu cũng xấp xỉ chuẩn, và khi chia cho sai số chuẩn (standard error) ước lượng, ta thu được một đại lượng so sánh được với phân phối chuẩn tắc. Đại lượng chuẩn hóa ấy theo truyền thống ký hiệu là , và kiểm định mang luôn tên của nó. Một chi tiết nữa giải thích vì sao công thức trong đề thi trông cồng kềnh hơn dự đoán. Vì giả thuyết không khẳng định hai tỉ lệ bằng nhau, hai mẫu được gộp lại thành một tỉ lệ gộp (pooled proportion) để ước lượng giá trị chung đó, rồi mới dùng nó tính sai số chuẩn. Đây không phải quy ước tùy tiện mà là hệ quả trực tiếp của việc tin vào khi tính toán; nhờ đó thống kê phản ánh đúng mức dao động lẽ ra phải có nếu hai tỉ lệ quả thật không khác nhau.
Tỉ lệ gộp chỉ dùng cho kiểm định, không dùng cho khoảng tin cậy.
Khi giả thuyết không cho rằng hai tỉ lệ tổng thể bằng nhau, ta coi như chỉ có một tỉ lệ chung, nên gộp toàn bộ số lần thành công lại thành tỉ lệ gộp (pooled proportion) rồi thay vào mẫu số . Ngược lại, khi ước lượng hiệu hai tỉ lệ bằng khoảng tin cậy thì không có giả định nào bắt chúng bằng nhau, nên phải dùng và riêng biệt trong sai số chuẩn. Học sinh hay lấy một công thức dùng cho cả hai tình huống và mất điểm ở bước tính, dù kết luận cuối vẫn đúng.
Giả thuyết phải viết bằng tham số tổng thể, không phải bằng tỉ lệ mẫu.
Viết là sai về bản chất, vì hai tỉ lệ mẫu đã quan sát được và gần như chắc chắn khác nhau — chẳng có gì để kiểm định cả. Cách viết đúng là và (hoặc , tùy đề), kèm một câu nói rõ , là tỉ lệ của tổng thể nào. Người chấm tìm chính ký hiệu tham số này, nên nhầm lẫn ở dòng đầu thường kéo theo mất điểm toàn phần đặt vấn đề.
Điều kiện đếm lớn phải kiểm với số đếm thực tế của từng mẫu, không kiểm bằng tỉ lệ.
Điều kiện đếm lớn (large counts condition) đòi hỏi cả bốn số , , , đều ít nhất bằng 10, và phải viết ra giá trị số cụ thể chứ không chỉ ghi "điều kiện thỏa mãn". Ngoài ra còn hai điều kiện thường bị bỏ quên: hai mẫu phải độc lập và đến từ chọn ngẫu nhiên hoặc phân nhóm ngẫu nhiên, đồng thời mỗi mẫu không vượt quá 10% tổng thể tương ứng. Bỏ trống phần này thường khiến bài chỉ còn được điểm một phần dù tính toán hoàn toàn chính xác.
Dữ liệu cặp không được dùng kiểm định hai mẫu.
Nếu mỗi cá thể được đo hai lần, hoặc các cá thể được ghép đôi theo đặc điểm tương đồng, thì hai nhóm không độc lập và giả định của kiểm định này bị vi phạm ngay từ đầu. Với dữ liệu cặp (paired data) ta phải chuyển sang xét hiệu trong từng cặp rồi làm kiểm định một mẫu trên các hiệu đó. Dấu hiệu nhận biết nhanh là câu hỏi "hai nhóm này có phải hai nhóm cá thể khác nhau không?" — nếu câu trả lời là không, đừng đụng tới công thức hai mẫu.
Giá trị p lớn không chứng minh hai tỉ lệ bằng nhau.
Kiểm định giả thuyết chỉ có thể bác bỏ hoặc không bác bỏ , chứ không bao giờ chấp nhận nó, nên viết "vậy hai tỉ lệ bằng nhau" hay " đúng" là sai hoàn toàn. Câu kết luận đạt chuẩn phải có ba phần: so sánh giá trị p (p-value) với mức ý nghĩa, quyết định bác bỏ hay không, và một câu diễn giải bằng ngữ cảnh của đề. Chẳng hạn: "Vì , ta không bác bỏ ; không đủ bằng chứng cho rằng tỉ lệ khỏi bệnh ở hai nhóm khác nhau."
Đọc kỹ đề xem câu hỏi yêu cầu kiểm định hay khoảng tin cậy trước khi viết chữ nào.
Hai bài toán này dùng hai sai số chuẩn khác nhau, và nhầm lẫn giữa chúng là lỗi bị trừ điểm nhiều nhất ở phần thi tự luận. Nếu đề chứa các từ "is there convincing evidence", "test the claim", "significantly different" thì đó là kiểm định và bạn phải gộp; nếu đề nói "estimate the difference" hay "construct a 95% interval" thì tuyệt đối không gộp. Một mẹo an toàn là viết ra công thức sai số chuẩn trước, rồi mới bấm máy.
Trình bày đủ bốn bước thì mới lấy trọn điểm.
Bài tự luận được chấm theo khung gồm nêu tham số và giả thuyết, gọi tên kiểm định, kiểm tra điều kiện, tính thống kê cùng giá trị p, rồi kết luận trong ngữ cảnh. Chỉ ghi kết quả từ máy tính mà không viết công thức hay không kiểm tra điều kiện sẽ bị hạ xuống điểm một phần, dù con số cuối đúng đến từng chữ số. Vì vậy hãy dành khoảng một phút viết rõ "two-sample z-test for " và liệt kê bốn số đếm trước khi bấm máy.
Cẩn thận với giả thuyết một phía và thứ tự trừ hai tỉ lệ.
Nếu đề hỏi nhóm A có tỉ lệ cao hơn nhóm B hay không thì , và giá trị p chỉ lấy một đuôi — nhân đôi ở đây sẽ làm sai kết luận khi giá trị p nằm gần mức ý nghĩa. Đồng thời phải giữ nhất quán thứ tự trừ từ đầu đến cuối bài, vì đảo chiều sẽ làm thống kê đổi dấu và khiến đuôi được tính nằm sai phía. Khi tính xong, hãy kiểm tra nhanh xem dấu của có cùng chiều với chênh lệch quan sát được hay không.
Với và giá trị p xấp xỉ , ta không bác bỏ giả thuyết không. Dữ liệu không cung cấp bằng chứng thuyết phục cho thấy tỉ lệ học sinh ăn sáng đều đặn ở khối 10 khác với tỉ lệ đó ở khối 12 của trường này.
Với và giá trị p xấp xỉ , ta bác bỏ giả thuyết không: có bằng chứng thuyết phục rằng thuốc xịt mũi làm giảm tỉ lệ mắc cúm so với giả dược. Hơn nữa, vì các tình nguyện viên được phân công ngẫu nhiên vào hai nhóm, kết luận này được phép phát biểu dưới dạng nhân quả cho nhóm đối tượng tham gia thí nghiệm.
Quiz câu thật từ ngân hàng đề
Vài câu thật gắn đúng khái niệm này, chấm ngay kèm giải thích từng đáp án — hệ thống ghi nhớ bạn nắm tới đâu.
Biên soạn bởi DucklingStudy, bản quyền thuộc DucklingStudy. Xuất bản .