AP Statistics

chọn mẫu không hoàn lại

sampling without replacement

Còn gọi: lấy mẫu không hoàn lại · sampling without replacement

Chọn mẫu không hoàn lại là cách lấy mẫu trong đó mỗi cá thể, sau khi được chọn, không được đưa trở lại tổng thể để có cơ hội bị chọn lần nữa.

Khi lấy mẫu ngẫu nhiên từ một tổng thể, người ta có thể chọn từng cá thể rồi bỏ lại vào tổng thể trước khi bốc cá thể tiếp theo, hoặc giữ nguyên cá thể đã chọn ở ngoài. Cách làm thứ hai gọi là chọn mẫu không hoàn lại (sampling without replacement), và đây chính là cách hầu hết các cuộc khảo sát thực tế vận hành: một người đã được phỏng vấn thì không bị chọn lại lần thứ hai trong cùng một mẫu. Hệ quả là xác suất chọn trúng một cá thể cụ thể thay đổi sau mỗi lần rút, vì tổng thể còn lại đã hụt đi một đơn vị.

Sự thay đổi xác suất này khiến các quan sát trong mẫu không còn độc lập tuyệt đối với nhau, điều vốn là giả định nền của phân phối nhị thức và của các công thức tính độ lệch chuẩn (standard deviation) cho tỉ lệ mẫu p^\hat p hay trung bình mẫu xˉ\bar x. Tuy nhiên, nếu kích thước mẫu nn chỉ chiếm một phần rất nhỏ so với kích thước tổng thể NN, sự phụ thuộc giữa các lần rút gần như không đáng kể, và ta vẫn có thể dùng các công thức xây dựng cho trường hợp có hoàn lại mà sai số không đáng lo. Từ đó sinh ra điều kiện 10% quen thuộc trong đề thi:

n0.10Nn \le 0.10N

Điều kiện này phát biểu rằng cỡ mẫu không được vượt quá mười phần trăm tổng thể. Khi điều kiện được thỏa, sách giáo khoa cho phép coi các quan sát là gần như độc lập, nhờ đó công thức tính độ lệch chuẩn của p^\hat p hay của hiệu hai tỉ lệ mẫu vẫn áp dụng được mà không cần hệ số hiệu chỉnh tổng thể hữu hạn. Ngược lại, nếu mẫu chiếm tỉ lệ lớn trong tổng thể, chẳng hạn rút 50 học sinh từ một lớp 60 em, thì sự phụ thuộc giữa các lần chọn trở nên đáng kể và các công thức xấp xỉ nhị thức không còn đáng tin cậy.

Ký hiệun ≤ 0.10N

Trực giác: Giống như rút bài ra khỏi cỗ bài và không đặt lại: mỗi lá đã rút làm thay đổi cơ hội của những lá còn lại trong cỗ.

Công thức

n0.10N\htmlClass{fp-0}{n} \le \htmlClass{fp-1}{0.10} \htmlClass{fp-2}{N}

Dùng để kiểm tra điều kiện độc lập gần đúng khi lấy mẫu không hoàn lại: nếu cỡ mẫu không vượt quá 10% cỡ tổng thể thì có thể xem các lần rút mẫu là gần như độc lập và áp dụng công thức độ lệch chuẩn tính cho lấy mẫu có hoàn lại.

Trong đó

nncỡ mẫu được chọn raNNcỡ của tổng thể ban đầu

Khái niệm này sinh ra từ đâu

cuối thế kỷ 19 đến nửa đầu thế kỷ 20John GrauntAnders KiaerRonald A. FisherJerzy NeymanP. C. Mahalanobis

Cách chọn mẫu mà mỗi đơn vị đã rút ra không được trả lại tổng thể hình thành cùng với lý thuyết điều tra chọn mẫu (survey theory) trong thống kê tổng thể hữu hạn, từ những thử nghiệm chọn mẫu ngẫu nhiên cuối thế kỷ 19 đến các thực nghiệm quy mô lớn của P. C. Mahalanobis trong thập niên 1930–1940.

Trước khi có khái niệm này, các cuộc thống kê về đất đai, dân cư và tài sản đều nhắm tới việc đếm toàn bộ tổng thể. Ghi nhận đầu tiên về việc dùng một phần để suy ra toàn thể là ước lượng dân số London của John Graunt năm 1662. Đến năm 1895, Anders Kiaer, người sáng lập Cơ quan Thống kê Na Uy, công bố một phương pháp chọn mẫu có thể xem là ngẫu nhiên, nhưng giới thống kê đương thời phần lớn không chấp nhận vì kết quả không đến từ toàn bộ dân số. Phải mất khoảng năm mươi năm nữa, với đóng góp của Ronald A. Fisher và Jerzy Neyman, lý thuyết đánh giá ước lượng từ mẫu ngẫu nhiên mới thành hình. Trong giai đoạn đó, Mahalanobis tiến hành các thực nghiệm chọn mẫu ngẫu nhiên có tính đến quan hệ không gian, mở đường cho các kỹ thuật rút mẫu con về sau.

Vì sao mang đúng cái tên này? Cái tên nghe lạ tai chủ yếu vì chữ "replacement" ở đây không mang nghĩa "thay thế" như trong tiếng Anh thông thường, mà mang nghĩa gốc là "đặt trở lại chỗ cũ". Hình ảnh chuẩn mực trong các tài liệu là một lọ đựng những viên bi khác nhau: rút một viên rồi bỏ nó trở lại lọ thì gọi là chọn mẫu có hoàn lại (sampling with replacement), còn giữ viên bi đó bên ngoài thì chính là chọn mẫu không hoàn lại. Vì vậy tên gọi mô tả đúng một thao tác vật lý chứ không phải một ý tưởng trừu tượng, và nó giải thích luôn hệ quả toán học: mỗi lần rút, số đơn vị còn lại giảm đi nên xác suất ở lần sau thay đổi theo. Cách đặt tên này gắn liền với bối cảnh tổng thể hữu hạn (finite population) của lý thuyết điều tra, nơi việc hỏi lại đúng một người hai lần là điều vô nghĩa về mặt thực tiễn.

Thử nghiệm tương tác

Bấm dọc một đường rút — nhìn mẫu số teo dần 20 → 19 → 18

Bấm dọc một đường rút — nhìn mẫu số teo dần 20 → 19 → 18

Kéo tham số, thấy khái niệm chuyển động — mở khoá bằng tài khoản 0đ.

Tạo tài khoản miễn phí

Hay hiểu sai

Chọn mẫu không hoàn lại KHÔNG cho các quan sát độc lập thật sự.

Điều kiện 10% là n0.10Nn \le 0.10N, không phải N0.10nN \le 0.10n.

Điều kiện 10% và điều kiện đếm lớn là hai điều kiện khác nhau, kiểm cả hai.

Bài hai tổng thể phải kiểm điều kiện 10% riêng cho từng mẫu.

Mẹo phòng thi

Viết điều kiện 10% bằng số cụ thể, đừng chỉ chép công thức tổng quát.

Gặp cụm "sampling without replacement" trong đề, phản xạ đầu tiên là nghĩ tới điều kiện 10%.

Đừng dùng hệ số hiệu chỉnh tổng thể hữu hạn trong bài thi AP.

Tần suất trong đề AP StatisticsThường xuyên

Ví dụ có lời giải

1Ví dụ 1/2
Một nhóm nghiên cứu muốn so sánh tỉ lệ học sinh đi học bằng phương tiện công cộng ở hai trường trung học trong cùng thành phố. Trường A có 1200 học sinh, trường B có 800 học sinh. Nhóm lấy một mẫu ngẫu nhiên đơn giản (simple random sample) gồm 90 học sinh của trường A, chọn không hoàn lại, và thấy 54 em đi phương tiện công cộng. Độc lập với đó, nhóm lấy một mẫu ngẫu nhiên đơn giản gồm 70 học sinh của trường B, cũng chọn không hoàn lại, và thấy 28 em đi phương tiện công cộng.
  1. aKhi hai mẫu đều được lấy không hoàn lại, cần kiểm tra những điều kiện nào trước khi lập khoảng tin cậy cho hiệu hai tỉ lệ tổng thể?
  2. bHãy kiểm tra cụ thể các điều kiện đó với số liệu đã cho.
  3. cLập khoảng tin cậy 95% cho p1p2p_1 - p_2 và diễn giải kết quả trong ngữ cảnh.
1Bước 1: Liệt kê ba nhóm điều kiện quen thuộc của bài toán hai tỉ lệ. Thứ nhất là cách lấy mẫu: mỗi mẫu phải là mẫu ngẫu nhiên đơn giản và hai mẫu phải độc lập với nhau. Thứ hai là điều kiện xấp xỉ chuẩn: số lần "thành công" và "thất bại" quan sát được ở mỗi mẫu đều phải ít nhất là 10. Thứ ba, và đây chính là điều kiện sinh ra từ việc chọn không hoàn lại, là điều kiện 10% (10% condition): mỗi cỡ mẫu không được vượt quá 10% tổng thể tương ứng của nó, tức n10,10N1n_1 \le 0{,}10N_1n20,10N2n_2 \le 0{,}10N_2.
2Bước 2: Giải thích vì sao riêng điều kiện 10% lại gắn với việc chọn không hoàn lại. Khi rút một học sinh ra mà không trả lại, thành phần của tổng thể còn lại đã thay đổi, nên các lần rút không còn độc lập và công thức sai số chuẩn p(1p)/n\sqrt{p(1-p)/n} vốn dựng trên giả thiết độc lập sẽ hơi quá lớn. Tuy nhiên, nếu mẫu chỉ chiếm một phần rất nhỏ của tổng thể thì mức phụ thuộc đó không đáng kể, và điều kiện n0,10Nn \le 0{,}10N chính là ngưỡng thực hành để bỏ qua nó.
3Bước 3: Kiểm tra từng điều kiện với số liệu. Về cỡ mẫu so với tổng thể: 0,10×1200=1200{,}10 \times 1200 = 1209012090 \le 120; 0,10×800=800{,}10 \times 800 = 80708070 \le 80. Vậy cả hai mẫu đều thỏa điều kiện 10%. Về số đếm: trường A có 5454 thành công và 9054=3690 - 54 = 36 thất bại; trường B có 2828 thành công và 7028=4270 - 28 = 42 thất bại, cả bốn số đều ít nhất bằng 10. Đề đã nói rõ hai mẫu là ngẫu nhiên đơn giản và độc lập, nên mọi điều kiện đều đạt.
4Bước 4: Tính hai tỉ lệ mẫu và sai số chuẩn. Ta có p^1=54/90=0,60\hat{p}_1 = 54/90 = 0{,}60p^2=28/70=0,40\hat{p}_2 = 28/70 = 0{,}40, nên ước lượng điểm là p^1p^2=0,20\hat{p}_1 - \hat{p}_2 = 0{,}20. Sai số chuẩn của hiệu hai tỉ lệ là SE=p^1(1p^1)n1+p^2(1p^2)n2=0,2490+0,2470.SE = \sqrt{\frac{\hat{p}_1(1-\hat{p}_1)}{n_1} + \frac{\hat{p}_2(1-\hat{p}_2)}{n_2}} = \sqrt{\frac{0{,}24}{90} + \frac{0{,}24}{70}}. Hai số hạng bằng 0,0026670{,}0026670,0034290{,}003429, tổng là 0,0060950{,}006095, lấy căn được SE0,0781SE \approx 0{,}0781. Con số này đo mức dao động điển hình của hiệu hai tỉ lệ mẫu quanh hiệu hai tỉ lệ tổng thể.
5Bước 5: Ghép lại thành khoảng tin cậy (confidence interval) 95% với z=1,96z^* = 1{,}96: biên sai số là 1,96×0,07810,1531{,}96 \times 0{,}0781 \approx 0{,}153, do đó khoảng cần tìm là 0,20±0,1530{,}20 \pm 0{,}153, tức (0,047; 0,353)(0{,}047;\ 0{,}353).

Vì cả hai mẫu đều được chọn không hoàn lại, ngoài yêu cầu ngẫu nhiên, độc lập và bốn số đếm thành công/thất bại ít nhất bằng 10, ta còn phải kiểm tra thêm rằng mỗi cỡ mẫu không vượt quá 10% tổng thể của nó; ở đây 9012090 \le 120708070 \le 80 nên điều kiện đạt. Khoảng tin cậy 95% cho hiệu tỉ lệ học sinh đi phương tiện công cộng giữa trường A và trường B là khoảng 0,0470{,}047 đến 0,3530{,}353. Ta tin 95% rằng tỉ lệ thực ở trường A cao hơn trường B từ khoảng 4,7 đến 35,3 điểm phần trăm; vì toàn bộ khoảng nằm bên phải số 0, số liệu cho bằng chứng rằng trường A có tỉ lệ cao hơn thật sự.

2Ví dụ 2/2
Một lớp học có đúng 20 học sinh, trong đó 8 em đeo kính. Giáo viên rút ngẫu nhiên lần lượt 5 em để lập một nhóm trực nhật, rút xong không trả tên em đó lại vào danh sách.
  1. aTính xác suất em được rút thứ hai đeo kính, biết em thứ nhất đã đeo kính, rồi so sánh với 8/208/20 và cho biết điều đó nói gì về tính độc lập.
  2. bTính xác suất đúng để nhóm 5 em có đúng 2 em đeo kính, so với kết quả nếu dùng mô hình nhị thức, và giải thích vì sao chênh lệch lại đáng kể ở đây.
1Bước 1: Xử lý ý (a) bằng cách đếm trực tiếp phần còn lại của lớp. Sau khi một em đeo kính đã bị rút ra, lớp còn 19 em và trong đó chỉ còn 7 em đeo kính, nên P(laˆˋn 2 đeo kıˊnhlaˆˋn 1 đeo kıˊnh)=7/190,368P(\text{lần 2 đeo kính} \mid \text{lần 1 đeo kính}) = 7/19 \approx 0{,}368. Con số này nhỏ hơn hẳn 8/20=0,4008/20 = 0{,}400, tức là kết quả của lần rút trước đã làm thay đổi xác suất của lần rút sau. Vì vậy các lần rút không hoàn lại là phụ thuộc, không độc lập.
2Bước 2: Sang ý (b), mô hình đúng cho phép đếm này là phân phối siêu bội (hypergeometric distribution): ta chọn 2 em trong 8 em đeo kính và 3 em trong 12 em không đeo kính, rồi chia cho tổng số cách chọn 5 em từ 20. Cụ thể P(X=2)=(82)(123)(205)=28×22015504=6160155040,397.P(X = 2) = \frac{\binom{8}{2}\binom{12}{3}}{\binom{20}{5}} = \frac{28 \times 220}{15504} = \frac{6160}{15504} \approx 0{,}397. Tử số 6160 là số nhóm thỏa yêu cầu, còn 15504 là tổng số nhóm 5 em có thể lập được.
3Bước 3: So sánh với mô hình nhị thức, tức mô hình giả vờ rằng mỗi lần rút đều có xác suất đeo kính cố định p=0,4p = 0{,}4 và các lần rút độc lập: P(X=2)=(52)(0,4)2(0,6)3=10×0,16×0,216=0,3456.P(X = 2) = \binom{5}{2}(0{,}4)^2(0{,}6)^3 = 10 \times 0{,}16 \times 0{,}216 = 0{,}3456. Chênh lệch giữa 0,3970{,}3970,3460{,}346 là hơn 5 điểm phần trăm, một sai số quá lớn để bỏ qua.
4Bước 4: Truy nguyên nguồn gốc của chênh lệch bằng điều kiện 10%. Ở đây n/N=5/20=25%n/N = 5/20 = 25\%, vượt xa ngưỡng 10%, nghĩa là mẫu đã "ăn" một phần lớn tổng thể nên sự phụ thuộc giữa các lần rút trở nên rõ rệt. Ngược lại, nếu lớp có 2000 học sinh với 40% đeo kính thì việc rút 5 em gần như không làm đổi thành phần còn lại, và lúc đó mô hình nhị thức sẽ xấp xỉ rất tốt.

Vì rút không hoàn lại, xác suất em thứ hai đeo kính giảm từ 8/20=0,4008/20 = 0{,}400 xuống 7/190,3687/19 \approx 0{,}368 khi biết em thứ nhất đã đeo kính, chứng tỏ các lần rút phụ thuộc lẫn nhau. Xác suất đúng để nhóm có đúng 2 em đeo kính là 6160/155040,3976160/15504 \approx 0{,}397, trong khi mô hình nhị thức cho 0,3460{,}346; sai lệch này lớn vì mẫu chiếm tới 25% lớp, vi phạm điều kiện 10%. Nói cách khác, chọn mẫu không hoàn lại chỉ được phép coi như độc lập khi mẫu nhỏ so với tổng thể, còn với tổng thể bé như lớp 20 học sinh thì phải dùng đúng phân phối siêu bội.

Bạn nắm chắc chưa?

Quiz câu thật từ ngân hàng đề

Vài câu thật gắn đúng khái niệm này, chấm ngay kèm giải thích từng đáp án — hệ thống ghi nhớ bạn nắm tới đâu.

Tạo tài khoản miễn phí

Học tiếp từ đây

Mục tiêu và lộ trình unit xem miễn phí — làm bài tập và lưu tiến độ cần tài khoản 0đ.

Hay nhầm với

điều kiện 10%10% condition
Khác nhau ở đâuChọn mẫu không hoàn lại là cách lấy mẫu, mỗi cá thể chỉ được chọn một lần. Điều kiện 10% là phép kiểm tra xem có được coi các lần rút đó là độc lập hay không.
Hay nhầm khiKhi đề hỏi vì sao phải kiểm tra n0,10Nn \le 0{,}10N trước lúc tính sai số chuẩn, học sinh hay trả lời là do mẫu ngẫu nhiên mà quên nêu lý do rút không hoàn lại.
biến cố độc lậpindependent events
Khác nhau ở đâuChọn mẫu không hoàn lại làm tổng thể nhỏ dần sau mỗi lần rút, nên các lần rút phụ thuộc nhau. Biến cố độc lập đòi hỏi xác suất lần sau không đổi khi đã biết lần trước.
Hay nhầm khiBài tính xác suất rút liên tiếp nhiều thẻ, học sinh nhân các xác suất giống nhau như thể có hoàn lại thay vì giảm dần mẫu số.

Cùng chủ đề

Nguồn tham khảo

  1. [1]Barron_AP_Stat_2026. tr. 319, 322, 326.

Biên soạn bởi DucklingStudy, bản quyền thuộc DucklingStudy. Xuất bản .