AP Statistics

lấy mẫu ngẫu nhiên lặp lại

repeated random sampling

Còn gọi: repeated random sampling

Lấy mẫu ngẫu nhiên lặp lại là việc tưởng tượng rút nhiều mẫu ngẫu nhiên cùng cỡ từ một tổng thể để xem một thống kê mẫu biến thiên thế nào qua các lần rút.

Khi một đề bài viết rằng "trung bình của L là 17", câu hỏi tự nhiên đặt ra là con số 17 ấy có ý nghĩa gì nếu ta chỉ lấy đúng một mẫu 50 người. Do đó, lấy mẫu ngẫu nhiên (random sample) lặp lại (replication) chính là cách trả lời: ta tưởng tượng việc rút mẫu cỡ 50 được lặp đi lặp lại vô số lần, mỗi lần tính ra một giá trị quan tâm, rồi xem tập hợp các giá trị đó phân bố ra sao. Nhờ khung tưởng tượng này, một con số vốn chỉ tính từ một mẫu duy nhất được gắn với ý nghĩa dài hạn, giống như xác suất được định nghĩa qua tần suất về lâu dài chứ không phải qua một lần tung duy nhất.

Về mặt cơ chế, mỗi lần lấy mẫu tạo ra một giá trị của đại lượng mẫu, chẳng hạn trung bình mẫu xˉ\bar x hoặc tỉ lệ (proportion) mẫu p^\hat p; tập hợp toàn bộ các giá trị này qua vô số lần lặp lại tạo thành một phân phối mẫu. Phân phối đó có giá trị trung tâm (center) và độ lệch chuẩn (standard deviation) riêng, được viết là μxˉ=μ\mu_{\bar x}=\muσxˉ=σ/n\sigma_{\bar x}=\sigma/\sqrt{n} đối với trung bình mẫu, nghĩa là nếu lặp lại việc lấy mẫu cỡ nn vô số lần thì giá trị trung bình của các xˉ\bar x đó sẽ bằng đúng trung bình tổng thể μ\mu, còn độ lệch của chúng quanh μ\mu nhỏ dần khi nn tăng.

Chính vì vậy, câu diễn giải đúng cho một trung bình như 17 trong ví dụ khảo sát 50 người không phải là "mọi mẫu đều có 17 người trả lời có", mà là "trong lấy mẫu ngẫu nhiên lặp lại cỡ 50, số người trả lời có trung bình bằng 17". Ngược lại, nếu hiểu sai theo cách đầu tiên thì sẽ đánh mất bản chất dài hạn của thống kê; cách hiểu đúng này cũng là nền móng để định lý giới hạn trung tâm phát huy tác dụng, vì định lý đó mô tả hình dạng của phân phối mẫu khi số lần lặp lại tiến tới vô hạn và cỡ mẫu đủ lớn.

Ký hiệux̄, p̂, μ, σ

Trực giác: Giống như tưởng tượng rút 1000 mẫu ngẫu nhiên, mỗi mẫu 50 người, rồi tính tỉ lệ ủng hộ trong từng mẫu — bạn sẽ thấy các tỉ lệ này không giống nhau mà dao động lên xuống quanh tỉ lệ thật của tổng thể, tạo thành một phân phối các giá trị.

Khái niệm này sinh ra từ đâu

1895 – giữa thế kỷ 20Anders Nicolai KiærArthur Lyon BowleyRonald A. FisherJerzy NeymanStanisław Ulam

Ý tưởng chọn mẫu ngẫu nhiên rồi lặp lại nhiều lần hình thành dần từ cuối thế kỷ 19, khi Anders Nicolai Kiær công bố phương pháp lấy mẫu có yếu tố ngẫu nhiên (1895) và Arthur Lyon Bowley đưa kỹ thuật này vào điều tra xã hội (1906); về sau nhà toán học Ba Lan Stanisław Ulam hình thành ý niệm phương pháp Monte Carlo, dựa hẳn trên việc lấy mẫu ngẫu nhiên lặp đi lặp lại để tính ra kết quả bằng số.

Bài toán gốc rất thực tế: muốn biết một điều gì đó về cả tổng thể nhưng không đủ tiền để đếm hết từng người. Năm 1895, người sáng lập Cơ quan Thống kê Na Uy công bố một cuộc thu thập dữ liệu trong đó mẫu được chọn theo quy tắc phức tạp, phân tầng ở đầu và ngẫu nhiên ở cuối. Phần lớn giới thống kê đương thời không chấp nhận, vì số liệu không đến từ toàn bộ dân số. Phải mất khoảng năm mươi năm, với đóng góp của Ronald A. Fisher và Jerzy Neyman, mới có một lý thuyết đủ sức đánh giá việc ước lượng từ mẫu ngẫu nhiên. Nhờ đó người ta nhận ra mẫu nhỏ mà chọn đúng cách cho biết nhiều hơn hẳn cách kiểm đếm toàn bộ với cùng ngân sách.

Vì sao mang đúng cái tên này? Tên gọi mô tả đúng hai việc chồng lên nhau. Phần "ngẫu nhiên" đến từ truyền thống chọn mẫu ngẫu nhiên (random sampling) mà Bowley đưa vào điều tra xã hội năm 1906, trong đó mỗi phần tử được chọn một cách ngẫu nhiên và độc lập để kết luận không bị thiên lệch. Phần "lặp lại" được nhấn mạnh vì một mẫu đơn lẻ có thể không đại diện tốt cho tổng thể; lặp việc lấy mẫu rất nhiều lần sẽ làm biến thiên giảm đi và ước lượng tham số tổng thể sát hơn. Chính cơ chế lặp này là nền của kỹ thuật bootstrap và của mô phỏng Monte Carlo (Monte Carlo simulation), lớp thuật toán dùng tính ngẫu nhiên để giải những bài toán vốn tất định. Cũng nên nhớ bản thân chữ "thống kê" (statistics) là do Gottfried Achenwall đặt ra, rất lâu trước khi lý thuyết chọn mẫu thành hình.

Thử nghiệm tương tác

Bấm rút từng mẫu — nhìn các chấm dồn lại thành gò quanh trung bình thật

Bấm rút từng mẫu — nhìn các chấm dồn lại thành gò quanh trung bình thật

Kéo tham số, thấy khái niệm chuyển động — mở khoá bằng tài khoản 0đ.

Tạo tài khoản miễn phí

Hay hiểu sai

Phân phối mẫu không phải là phân phối của dữ liệu trong một mẫu.

Lặp nhiều lần hơn không làm phân phối mẫu hẹp lại.

Lấy mẫu lặp lại không chữa được sai lệch của cách chọn mẫu.

Đếm kết quả mô phỏng phải bao gồm cả giá trị quan sát được.

Mẹo phòng thi

Mô tả mô phỏng phải nêu đủ bốn chi tiết mới được trọn điểm.

Kết luận từ biểu đồ mô phỏng phải kèm tỉ lệ cụ thể.

Đọc kỹ đâu là cỡ mẫu, đâu là số lần lặp.

Tần suất trong đề AP StatisticsThường xuyên

Ví dụ có lời giải

1Ví dụ 1/2
Một khảo sát toàn quốc cho biết 34% người được hỏi trả lời "có" cho câu hỏi: "Nếu có thể, bạn có muốn sống mãi mãi không?". Chọn ngẫu nhiên 50 người và gọi LL là số người trong mẫu trả lời "có". Biến ngẫu nhiên (random variable) LL tuân theo phân phối nhị thức (binomial distribution) với μL=17\mu_L = 17σL=3.35\sigma_L = 3.35.
  1. aKiểm chứng lại hai con số μL=17\mu_L = 17σL=3.35\sigma_L = 3.35.
  2. bDiễn giải ý nghĩa của μL\mu_L theo ngôn ngữ lấy mẫu ngẫu nhiên lặp lại, và giải thích vì sao cách nói "mọi mẫu 50 người đều có 34% trả lời có" là sai.
  3. cDiễn giải ý nghĩa của σL\sigma_L trong cùng bối cảnh.
1Bước 1: Với phân phối nhị thức, kỳ vọng là μ=np\mu = np. Ở đây n=50n = 50p=0.34p = 0.34, nên μL=50×0.34=17\mu_L = 50 \times 0.34 = 17. Con số 17 vì vậy không phải là một quan sát cụ thể nào cả, mà là giá trị trung tâm mà cả họ vô số mẫu 50 người xoay quanh.
2Bước 2: Độ lệch chuẩn (standard deviation) của phân phối nhị thức là σ=np(1p)\sigma = \sqrt{np(1-p)}. Thay số: 50×0.34×0.66=11.223.35\sqrt{50 \times 0.34 \times 0.66} = \sqrt{11.22} \approx 3.35. Như vậy cả hai tham số đề cho đều đúng, và 3.353.35 đo mức dao động điển hình của LL quanh mốc 1717.
3Bước 3: Bây giờ mới đến phần quan trọng nhất là cách nói. Hãy tưởng tượng ta không chỉ lấy một mẫu, mà lấy đi lấy lại rất nhiều mẫu ngẫu nhiên, mỗi mẫu gồm 50 người, rồi ghi lại số người trả lời "có" của từng mẫu. Khi đó cách diễn giải đúng là: trong việc lấy mẫu ngẫu nhiên lặp lại 50 người, số người trả lời "có" trung bình là 17 người. Cụm "in repeated random sampling" chính là tín hiệu mà đề AP muốn thấy, vì nó gắn giá trị kỳ vọng với hành vi dài hạn chứ không với một mẫu lẻ.
4Bước 4: Cách nói "mọi mẫu 50 người đều có 34% trả lời có" sai vì nó xóa sạch biến thiên mẫu (sampling variability). Một mẫu cụ thể hoàn toàn có thể cho 13, 15, 19 hay 22 người trả lời "có"; chính vì các mẫu khác nhau nên LL mới là biến ngẫu nhiên và mới cần đến độ lệch chuẩn. Ngược lại, nếu mẫu nào cũng ra đúng 17 thì σL\sigma_L đã phải bằng 0.
5Bước 5: Với σL=3.35\sigma_L = 3.35, cách diễn giải chuẩn là: trong việc lấy mẫu ngẫu nhiên lặp lại 50 người, số người trả lời "có" lệch khỏi mốc 17 trung bình khoảng 3.35 người. Do đó μL\mu_L trả lời câu hỏi "trung tâm ở đâu", còn σL\sigma_L trả lời câu hỏi "các mẫu tản ra rộng chừng nào".

Hai tham số đề cho là chính xác: μL=50(0.34)=17\mu_L = 50(0.34) = 17σL=50(0.34)(0.66)3.35\sigma_L = \sqrt{50(0.34)(0.66)} \approx 3.35. Khi lấy mẫu ngẫu nhiên lặp lại các mẫu gồm 50 người, số người trả lời "có" trung bình là 17 người, và số đó dao động quanh 17 với độ lệch điển hình khoảng 3.35 người. Không thể khẳng định mẫu nào cũng cho đúng 34% trả lời "có", vì mỗi mẫu là một kết quả ngẫu nhiên khác nhau.

2Ví dụ 2/2
Một máy rót cà phê tự động được cài để rót trung bình μ=12.1\mu = 12.1 ounce mỗi cốc, với độ lệch chuẩn σ=0.4\sigma = 0.4 ounce, và lượng cà phê trong một cốc có phân bố xấp xỉ chuẩn. Quản lý cửa hàng chọn ngẫu nhiên 25 cốc trong một ca và tính lượng cà phê trung bình xˉ\bar{x} của 25 cốc đó.
  1. aMô tả dạng, tâm và độ phân tán của phân bố mẫu (sampling distribution) của xˉ\bar{x}.
  2. bTính xác suất một mẫu 25 cốc cho trung bình lớn hơn 12.2 ounce, rồi diễn giải kết quả theo ngôn ngữ lấy mẫu ngẫu nhiên lặp lại.
1Bước 1: Trước hết phải kiểm tra điều kiện. Vì lượng cà phê trong từng cốc đã có phân bố xấp xỉ chuẩn, trung bình của 25 cốc cũng có phân bố xấp xỉ chuẩn, nên ta không cần viện đến định lý giới hạn trung tâm (central limit theorem) vốn đòi cỡ mẫu lớn. Ngoài ra 25 cốc là phần rất nhỏ so với toàn bộ số cốc máy có thể rót, nên điều kiện 10% được thỏa và các quan sát coi như độc lập.
2Bước 2: Tâm của phân bố mẫu chính là trung bình tổng thể: μxˉ=μ=12.1\mu_{\bar{x}} = \mu = 12.1. Độ phân tán được đo bằng sai số chuẩn (standard error): σxˉ=σn=0.425=0.45=0.08.\sigma_{\bar{x}} = \frac{\sigma}{\sqrt{n}} = \frac{0.4}{\sqrt{25}} = \frac{0.4}{5} = 0.08. Con số 0.080.08 cho biết khi lấy mẫu ngẫu nhiên lặp lại các mẫu 25 cốc, giá trị xˉ\bar{x} lệch khỏi 12.1 ounce trung bình khoảng 0.08 ounce — chặt hơn hẳn mức 0.4 ounce của từng cốc riêng lẻ.
3Bước 3: Chuyển mốc 12.2 ounce sang điểm zz (z-score) theo thang của phân bố mẫu, chứ không theo thang của một cốc: z=12.212.10.08=0.10.08=1.25.z = \frac{12.2 - 12.1}{0.08} = \frac{0.1}{0.08} = 1.25. Nghĩa là trung bình mẫu 12.2 ounce nằm cao hơn tâm đúng 1.25 sai số chuẩn.
4Bước 4: Tra bảng chuẩn hoặc dùng máy tính: P(Z<1.25)=0.8944P(Z < 1.25) = 0.8944, do đó P(xˉ>12.2)=P(Z>1.25)=10.8944=0.1056P(\bar{x} > 12.2) = P(Z > 1.25) = 1 - 0.8944 = 0.1056. Trên máy tính có thể bấm trực tiếp normalcdf(12.2, 1E99, 12.1, 0.08) và cũng nhận được xấp xỉ 0.10560.1056.
5Bước 5: Cuối cùng là câu diễn giải mà giám khảo tìm. Xác suất 0.10560.1056 không nói gì về một cốc cà phê, cũng không nói mẫu này "có vấn đề"; nó mô tả tần suất dài hạn. Nếu quá trình lấy mẫu ngẫu nhiên 25 cốc được lặp lại rất nhiều lần, khoảng 10.6% số mẫu sẽ cho trung bình vượt quá 12.2 ounce. Vì vậy một mẫu ra 12.2 ounce là chuyện khá thường gặp, không đủ để kết luận máy đã bị lệch cài đặt.

Phân bố mẫu của xˉ\bar{x} xấp xỉ chuẩn, có tâm tại μxˉ=12.1\mu_{\bar{x}} = 12.1 ounce và sai số chuẩn σxˉ=0.08\sigma_{\bar{x}} = 0.08 ounce. Xác suất một mẫu 25 cốc cho trung bình lớn hơn 12.2 ounce là P(xˉ>12.2)0.1056P(\bar{x} > 12.2) \approx 0.1056, nghĩa là trong việc lấy mẫu ngẫu nhiên lặp lại các mẫu gồm 25 cốc, khoảng 10.6% số mẫu sẽ có lượng cà phê trung bình vượt 12.2 ounce.

Bạn nắm chắc chưa?

Quiz câu thật từ ngân hàng đề

Vài câu thật gắn đúng khái niệm này, chấm ngay kèm giải thích từng đáp án — hệ thống ghi nhớ bạn nắm tới đâu.

Tạo tài khoản miễn phí

Học tiếp từ đây

Mục tiêu và lộ trình unit xem miễn phí — làm bài tập và lưu tiến độ cần tài khoản 0đ.

Hay nhầm với

Khác nhau ở đâuLấy mẫu ngẫu nhiên lặp lại là rút nhiều mẫu khác nhau từ cùng một tổng thể để xem thống kê dao động ra sao. Lặp lại là dùng nhiều đơn vị thí nghiệm cho mỗi xử lý trong một thí nghiệm duy nhất.
Hay nhầm khiCâu hỏi về thiết kế thí nghiệm yêu cầu giải thích vì sao cần nhiều đối tượng mỗi nhóm, thí sinh lại trả lời bằng ý tưởng phân phối mẫu.
Khác nhau ở đâuLấy mẫu ngẫu nhiên lặp lại nói về việc rút đi rút lại nhiều mẫu để xây dựng phân phối mẫu. Chọn mẫu không hoàn lại nói về cách rút từng cá thể bên trong một mẫu duy nhất.
Hay nhầm khiKhi đề nhắc chữ "lặp lại", thí sinh tưởng là hoàn lại cá thể và đi kiểm tra điều kiện 10% thay vì mô tả phân phối mẫu.

Cùng chủ đề

Nguồn tham khảo

  1. [1]Barron_AP_Stat_2026. tr. 296, 301.

Biên soạn bởi DucklingStudy, bản quyền thuộc DucklingStudy. Xuất bản .