AP Statistics

cỡ mẫu

sample size

Còn gọi: kích thước mẫu · sample size

Cỡ mẫu là số lượng cá thể hoặc quan sát được chọn vào một mẫu, thường ký hiệu n, ảnh hưởng trực tiếp tới độ biến thiên của các thống kê mẫu.

Khi không thể khảo sát toàn bộ tổng thể, các nhà nghiên cứu chọn ra một nhóm nhỏ hơn để quan sát, và số cá thể trong nhóm đó chính là cỡ mẫu, ký hiệu nn. Đại lượng này xuất hiện trong hầu hết công thức suy luận thống kê, từ khoảng tin cậy đến kiểm định giả thuyết, bởi vì nó quyết định mức độ chính xác của kết quả ước lượng. Chẳng hạn, sai số chuẩn (standard error) của trung bình mẫu được tính bằng σ/n\sigma/\sqrt{n}, trong đó σ\sigma là độ lệch chuẩn (standard deviation) của tổng thể; công thức này cho thấy khi nn tăng, mẫu số n\sqrt{n} lớn lên và sai số chuẩn co lại.

Do đó, cỡ mẫu càng lớn thì phân phối mẫu càng tập trung sát quanh tham số thật của tổng thể, và ước lượng thu được càng đáng tin cậy hơn. Tính chất này được hình thức hóa qua định lý giới hạn trung tâm (central limit theorem), vốn khẳng định rằng khi nn đủ lớn, phân phối của trung bình mẫu tiến gần đến phân phối chuẩn bất kể hình dạng của tổng thể ban đầu. Tuy nhiên, cần phân biệt rõ vai trò của cỡ mẫu với vai trò của phương pháp chọn mẫu: tăng nn chỉ giúp thu hẹp độ phân tán của ước lượng chứ không sửa được sai lệch hệ thống nếu cách lấy mẫu vốn đã thiên vị.

Ngược lại, một mẫu quá nhỏ sẽ khiến khoảng tin cậy rộng và kiểm định giả thuyết mất sức mạnh phát hiện khác biệt thật, dù dữ liệu thu được hoàn toàn không chệch. Vì vậy, khi thiết kế nghiên cứu, người ta phải cân nhắc cỡ mẫu sao cho vừa đủ lớn để có độ chính xác cần thiết, vừa khả thi về thời gian và chi phí thu thập dữ liệu.

Ký hiệunn

Trực giác: Giống như nếm một nồi canh: múc càng nhiều muỗng để thử thì đánh giá độ mặn của cả nồi càng chính xác.

Công thức

n=(zσME)2n=\htmlClass{fp-3}{\left(\htmlClass{fp-2}{\dfrac{\htmlClass{fp-0}{z^{*}}\htmlClass{fp-1}{\sigma}}{ME}}\right)^{2}}

dùng khi cần xác định trước cỡ mẫu (sample size) tối thiểu sao cho khoảng tin cậy về trung bình tổng thể có sai số biên không vượt quá một giá trị MEME cho trước, với độ lệch chuẩn tổng thể σ\sigma đã biết hoặc được ước lượng từ nghiên cứu trước.

Trong đó

nncỡ mẫu (sample size) cần thiếtzz^{*}điểm tới hạn (critical value) ứng với độ tin cậy mong muốnσ\sigmađộ lệch chuẩn (standard deviation) của tổng thểMEMEsai số biên (margin of error) tối đa chấp nhận được

Khái niệm này sinh ra từ đâu

nền móng từ thế kỷ 17–18; công thức ước lượng cỡ mẫu năm 1967Christiaan HuygensJacob BernoulliPierre-Simon de LaplaceCarl Friedrich GaussAnders Nicolai KiærArthur Lyon BowleyWilliam Cochran

Ý niệm về cỡ mẫu hình thành dần từ công trình xác suất của Christiaan Huygens và Jacob Bernoulli ở thế kỷ 17–18, khi người ta nhận ra số quan sát thu thập được quyết định độ chính xác của kết luận; đến năm 1967 William Cochran đưa ra công thức ước lượng cỡ mẫu mang tên ông.

Khái niệm này không ra đời trong một buổi chiều mà lớn lên cùng lý thuyết xác suất. Huygens nghiên cứu giá trị kỳ vọng (expected value), rồi Bernoulli phát biểu luật số lớn (law of large numbers) — công trình đầu tiên nối thẳng số quan sát với mức tin cậy của kết luận. Sang thế kỷ 18 và 19, Pierre-Simon de Laplace cùng Carl Friedrich Gauss đẩy lý thuyết xác suất tiến thêm một bước dài. Khi điều tra xã hội bùng nổ, câu hỏi "hỏi bao nhiêu người là đủ" trở nên cấp bách: Anders Nicolai Kiær giới thiệu lấy mẫu phân tầng (stratified sampling) năm 1895, còn Arthur Lyon Bowley đưa kỹ thuật lấy mẫu ngẫu nhiên (random sampling) vào thống kê xã hội năm 1906. Nhờ đó cỡ mẫu chuyển từ chuyện cảm tính sang một đại lượng tính được.

Vì sao mang đúng cái tên này? Tên gọi nghe đơn giản đến mức dễ bị xem nhẹ: nó chỉ là "cỡ" — số phần tử — của cái mẫu ta lấy ra, thường ký hiệu bằng nn. Sức nặng của chữ "cỡ" nằm ở chỗ Bernoulli là người đầu tiên buộc con số này vào độ chính xác của suy luận, nên đếm số quan sát không còn là việc ghi chép hành chính mà thành một tham số của lý thuyết. Bản thân ngành thống kê lại mang cái tên rất khác gốc: chữ statistics đi ra từ tiếng Latin mới statisticum collegium ("hội đồng nhà nước") và tiếng Ý statista ("chính khách"), được Gottfried Achenwall đưa vào tiếng Đức năm 1749 để chỉ việc phân tích dữ liệu về nhà nước. Vì vậy, khi nói cỡ mẫu, ta đang dùng một từ rất mộc trong một ngành khoa học vốn sinh ra từ nhu cầu cai trị và kiểm đếm dân cư.

Hay hiểu sai

Tăng cỡ mẫu không làm giảm độ chệch của ước lượng.

Cỡ mẫu không làm thay đổi trung bình của phân bố mẫu.

Mẫu lớn hơn chưa chắc cho độ lệch chuẩn nhỏ hơn nếu pp cũng khác nhau.

Điều kiện về cỡ mẫu gồm hai điều kiện khác nhau, không được gộp làm một.

Mẹo phòng thi

Khi gộp hai tỉ lệ mẫu, phải lấy trung bình có trọng số theo cỡ mẫu.

Viết ra tên kiểm định kèm đầy đủ cụm "cho hiệu hai trung bình dân số".

Đọc kỹ chiều của bất đẳng thức trước khi kết luận mẫu nào cho xác suất lớn hơn.

Tần suất trong đề AP StatisticsThường xuyên

Ví dụ có lời giải

1Ví dụ 1/2
Một nhà sản xuất màn hình điện thoại ghi nhận rằng 5% toàn bộ màn hình xuất xưởng có lỗi. Gọi pdp_d là tỉ lệ màn hình lỗi của cả tổng thể, như vậy pd=0.05p_d = 0.05. Bộ phận kiểm định lấy ngẫu nhiên 400 màn hình từ dây chuyền và tính tỉ lệ màn hình lỗi trong mẫu, ký hiệu p^d\hat{p}_d. Ban giám đốc đang cân nhắc có nên nâng số màn hình kiểm tra mỗi đợt lên 1600 hay không.
  1. aKiểm tra các điều kiện rồi tính trung bình và độ lệch chuẩn của phân phối mẫu của p^d\hat{p}_d khi cỡ mẫu là 400.
  2. bNếu tăng cỡ mẫu lên 1600 thì độ lệch chuẩn thay đổi ra sao? Việc tăng cỡ mẫu có làm giảm sai lệch hệ thống của phương pháp lấy mẫu không?
1Bước 1: Trước hết phải kiểm tra điều kiện, vì mọi công thức về phân phối mẫu (sampling distribution) chỉ đúng khi mẫu được lấy ngẫu nhiên và đủ lớn. Mẫu gồm 400 màn hình được lấy ngẫu nhiên nên điều kiện độc lập được bảo đảm, miễn là tổng sản lượng của nhà máy ít nhất gấp mười lần cỡ mẫu, tức là từ 4000 màn hình trở lên. Tiếp theo là điều kiện số đếm lớn (Large Counts condition): np=400(0.05)=2010np = 400(0.05) = 20 \ge 10n(1p)=400(0.95)=38010n(1-p) = 400(0.95) = 380 \ge 10. Cả hai số đếm đều vượt ngưỡng 10, do đó phân phối của tỉ lệ mẫu (sample proportion) xấp xỉ chuẩn và ta được phép dùng công thức tính độ lệch chuẩn.
2Bước 2: Trung bình của phân phối mẫu luôn bằng đúng tham số của tổng thể, nghĩa là μp^d=pd=0.05\mu_{\hat{p}_d} = p_d = 0.05. Độ lệch chuẩn (standard deviation) được tính theo công thức σp^d=pd(1pd)n=0.05(0.95)400=0.000118750.0109.\sigma_{\hat{p}_d}=\sqrt{\frac{p_d(1-p_d)}{n}}=\sqrt{\frac{0.05(0.95)}{400}}=\sqrt{0.00011875}\approx 0.0109. Con số này cho biết trong các đợt kiểm định 400 màn hình khác nhau, tỉ lệ lỗi tính được thường lệch khỏi 5% khoảng 1,09 điểm phần trăm. Cỡ mẫu nằm ở mẫu số dưới dấu căn, nên nó chính là đại lượng điều khiển mức dao động này.
3Bước 3: Khi cỡ mẫu tăng lên 1600, ta thay nn vào cùng một công thức: σp^d=0.05(0.95)/1600=0.0000296880.0054\sigma_{\hat{p}_d}=\sqrt{0.05(0.95)/1600}=\sqrt{0.000029688}\approx 0.0054. So với 0.0109 thì độ lệch chuẩn giảm đi đúng một nửa, và điều đó không phải ngẫu nhiên: vì nn nằm dưới dấu căn bậc hai nên muốn giảm dao động một nửa ta phải tăng cỡ mẫu gấp bốn lần, đúng như 1600=4×4001600 = 4 \times 400. Đây là lý do các nghiên cứu đòi hỏi độ chính xác cao thường tốn kém, bởi mỗi lần muốn thu hẹp sai số một nửa thì chi phí lấy mẫu phải nhân lên gấp bốn.
4Bước 4: Câu hỏi về sai lệch hệ thống lại thuộc một loại khác hẳn. Trung bình μp^d\mu_{\hat{p}_d} vẫn bằng 0.05 dù cỡ mẫu là 400 hay 1600, nên p^d\hat{p}_d là ước lượng không chệch (unbiased estimator) trong cả hai trường hợp và việc tăng cỡ mẫu không làm thay đổi điều đó. Ngược lại, nếu phương pháp lấy mẫu có khuyết tật — chẳng hạn chỉ kiểm tra màn hình ở một ca sản xuất duy nhất — thì tăng cỡ mẫu chỉ khiến ta ước lượng ngày càng chính xác một con số sai. Nói gọn, cỡ mẫu chữa được độ dao động chứ không chữa được độ chệch (bias); muốn khử độ chệch thì phải sửa cách chọn mẫu.

Với cỡ mẫu 400, phân phối mẫu của tỉ lệ màn hình lỗi có trung bình μp^d=0.05\mu_{\hat{p}_d} = 0.05 và độ lệch chuẩn σp^d0.0109\sigma_{\hat{p}_d} \approx 0.0109, đồng thời xấp xỉ chuẩn vì np=20np = 20n(1p)=380n(1-p) = 380 đều lớn hơn 10. Khi nâng cỡ mẫu lên 1600, độ lệch chuẩn giảm còn khoảng 0.0054, tức là các kết quả kiểm định sẽ bám sát 5% hơn hẳn. Tuy nhiên trung bình vẫn giữ nguyên ở 0.05, nên việc tăng cỡ mẫu chỉ làm tăng độ chính xác chứ không sửa được sai lệch hệ thống nếu cách lấy mẫu vốn đã thiên vị.

2Ví dụ 2/2
Một nhóm nghiên cứu thị trường muốn ước lượng tỉ lệ người trưởng thành trong một thành phố ủng hộ dự án xe buýt điện. Họ đang so sánh các phương án khảo sát khác nhau, mỗi phương án ứng với một cặp cỡ mẫu nn và tỉ lệ tổng thể pp được dự đoán trước: (A) n=100n = 100, p=0.5p = 0.5; (B) n=100n = 100, p=0.1p = 0.1; (C) n=400n = 400, p=0.5p = 0.5; (D) n=400n = 400, p=0.9p = 0.9; (E) n=1000n = 1000, p=0.5p = 0.5. Cuối cùng nhóm chọn khảo sát ngẫu nhiên 1000 người và sau đó đề xuất nâng lên 1300 người.
  1. aCặp nnpp nào cho độ lệch chuẩn lớn nhất của phân phối mẫu của tỉ lệ mẫu?
  2. bNếu nhóm nghiên cứu tăng cỡ mẫu từ 1000 lên 1300 (giả sử p=0.5p = 0.5) thì độ chệch và độ dao động của ước lượng thay đổi thế nào?
1Bước 1: Công thức cần dùng là σp^=p(1p)/n\sigma_{\hat p}=\sqrt{p(1-p)/n}, trong đó tử số phụ thuộc vào tỉ lệ tổng thể còn mẫu số là cỡ mẫu. Vì nn nằm ở mẫu số, cỡ mẫu càng nhỏ thì độ lệch chuẩn càng lớn; vì tích p(1p)p(1-p) đạt cực đại tại p=0.5p = 0.5, tỉ lệ càng gần một nửa thì tử số càng lớn. Do đó, trước khi bấm máy ta đã đoán được đáp án phải là phương án có nn nhỏ nhất kết hợp với pp gần 0.5 nhất.
2Bước 2: Bây giờ tính cụ thể từng phương án để xác nhận. Với (A), 0.5(0.5)/100=0.0025=0.05\sqrt{0.5(0.5)/100}=\sqrt{0.0025}=0.05; với (B), 0.1(0.9)/100=0.0009=0.03\sqrt{0.1(0.9)/100}=\sqrt{0.0009}=0.03; với (C), 0.25/400=0.025\sqrt{0.25/400}=0.025; với (D), 0.09/400=0.015\sqrt{0.09/400}=0.015; với (E), 0.25/10000.0158\sqrt{0.25/1000}\approx 0.0158. Giá trị lớn nhất là 0.05 thuộc về phương án (A), đúng như dự đoán ban đầu.
3Bước 3: Hai phương án (B) và (E) đáng được so sánh riêng vì chúng cho thấy cỡ mẫu và tỉ lệ tổng thể tác động theo hai chiều khác nhau. Phương án (B) có cỡ mẫu rất nhỏ nhưng tỉ lệ lệch xa 0.5, còn (E) có cỡ mẫu gấp mười lần nhưng tỉ lệ đúng bằng 0.5; kết quả là (B) vẫn dao động mạnh gần gấp đôi (E). Như vậy ảnh hưởng của cỡ mẫu thường áp đảo, bởi tăng nn lên mười lần chia độ lệch chuẩn cho 103.16\sqrt{10}\approx 3.16, trong khi p(1p)p(1-p) dù thay đổi thế nào cũng chỉ nằm giữa 0 và 0.25.
4Bước 4: Sang ý (b), ta tính lại với hai cỡ mẫu được nêu: 0.25/10000.0158\sqrt{0.25/1000}\approx 0.01580.25/13000.0139\sqrt{0.25/1300}\approx 0.0139. Độ dao động giảm nhẹ, chứng tỏ mẫu lớn hơn cho ước lượng ổn định hơn, nhưng mức giảm khá khiêm tốn vì 13001300 chỉ gấp 1.31.3 lần 10001000 nên độ lệch chuẩn chỉ giảm theo hệ số 1/1.30.8771/\sqrt{1.3}\approx 0.877. Trong khi đó trung bình của phân phối mẫu vẫn là μp^=p=0.5\mu_{\hat p}=p=0.5 ở cả hai cỡ mẫu, nên mức độ chệch không hề thay đổi. Đây chính là bẫy quen thuộc của đề thi: đáp án đúng luôn là "độ chệch giữ nguyên, độ dao động giảm", chứ không phải "cả hai cùng giảm".

Phương án (A) với n=100n = 100p=0.5p = 0.5 cho độ lệch chuẩn lớn nhất, bằng 0.050.05, vì nó gộp cả cỡ mẫu nhỏ nhất lẫn tỉ lệ làm tích p(1p)p(1-p) đạt cực đại. Khi nhóm nghiên cứu tăng cỡ mẫu từ 1000 lên 1300, độ lệch chuẩn của tỉ lệ mẫu giảm từ khoảng 0.01580.0158 xuống khoảng 0.01390.0139, nghĩa là các ước lượng về mức ủng hộ dự án xe buýt điện sẽ bám sát giá trị thật hơn. Tuy vậy mức độ chệch vẫn giữ nguyên, bởi cỡ mẫu lớn hơn không sửa được bất kỳ khuyết tật nào trong cách chọn người để khảo sát.

Bạn nắm chắc chưa?

Quiz câu thật từ ngân hàng đề

Vài câu thật gắn đúng khái niệm này, chấm ngay kèm giải thích từng đáp án — hệ thống ghi nhớ bạn nắm tới đâu.

Tạo tài khoản miễn phí

Học tiếp từ đây

Dẫn tớisai số biên
Mục tiêu và lộ trình unit xem miễn phí — làm bài tập và lưu tiến độ cần tài khoản 0đ.

Hay nhầm với

Khác nhau ở đâuCỡ mẫu là số đơn vị thực sự được thu thập dữ liệu, ký hiệu nn. Cỡ quần thể là tổng số đơn vị tồn tại trong toàn bộ nhóm quan tâm, ký hiệu NN.
Hay nhầm khiKhi kiểm tra điều kiện 10%, thí sinh hay thay nhầm nn vào chỗ của NN hoặc ngược lại.
Khác nhau ở đâuCỡ mẫu là một con số đếm số đơn vị trong mẫu. Lặp lại là nguyên tắc thiết kế đòi hỏi mỗi nhóm xử lý phải có đủ nhiều đơn vị thí nghiệm.
Hay nhầm khiCâu hỏi về thí nghiệm yêu cầu nêu nguyên tắc lặp lại, thí sinh chỉ trả lời chung chung là 'lấy cỡ mẫu lớn'.

Cùng chủ đề

Nguồn tham khảo

  1. [1]Barron_AP_Stat_2026. tr. 23, 38, 49.

Biên soạn bởi DucklingStudy, bản quyền thuộc DucklingStudy. Xuất bản .