AP Statistics
sample size
Còn gọi: kích thước mẫu · sample size
Cỡ mẫu là số lượng cá thể hoặc quan sát được chọn vào một mẫu, thường ký hiệu n, ảnh hưởng trực tiếp tới độ biến thiên của các thống kê mẫu.
Khi không thể khảo sát toàn bộ tổng thể, các nhà nghiên cứu chọn ra một nhóm nhỏ hơn để quan sát, và số cá thể trong nhóm đó chính là cỡ mẫu, ký hiệu . Đại lượng này xuất hiện trong hầu hết công thức suy luận thống kê, từ khoảng tin cậy đến kiểm định giả thuyết, bởi vì nó quyết định mức độ chính xác của kết quả ước lượng. Chẳng hạn, sai số chuẩn (standard error) của trung bình mẫu được tính bằng , trong đó là độ lệch chuẩn (standard deviation) của tổng thể; công thức này cho thấy khi tăng, mẫu số lớn lên và sai số chuẩn co lại.
Do đó, cỡ mẫu càng lớn thì phân phối mẫu càng tập trung sát quanh tham số thật của tổng thể, và ước lượng thu được càng đáng tin cậy hơn. Tính chất này được hình thức hóa qua định lý giới hạn trung tâm (central limit theorem), vốn khẳng định rằng khi đủ lớn, phân phối của trung bình mẫu tiến gần đến phân phối chuẩn bất kể hình dạng của tổng thể ban đầu. Tuy nhiên, cần phân biệt rõ vai trò của cỡ mẫu với vai trò của phương pháp chọn mẫu: tăng chỉ giúp thu hẹp độ phân tán của ước lượng chứ không sửa được sai lệch hệ thống nếu cách lấy mẫu vốn đã thiên vị.
Ngược lại, một mẫu quá nhỏ sẽ khiến khoảng tin cậy rộng và kiểm định giả thuyết mất sức mạnh phát hiện khác biệt thật, dù dữ liệu thu được hoàn toàn không chệch. Vì vậy, khi thiết kế nghiên cứu, người ta phải cân nhắc cỡ mẫu sao cho vừa đủ lớn để có độ chính xác cần thiết, vừa khả thi về thời gian và chi phí thu thập dữ liệu.
Trực giác: Giống như nếm một nồi canh: múc càng nhiều muỗng để thử thì đánh giá độ mặn của cả nồi càng chính xác.
dùng khi cần xác định trước cỡ mẫu (sample size) tối thiểu sao cho khoảng tin cậy về trung bình tổng thể có sai số biên không vượt quá một giá trị cho trước, với độ lệch chuẩn tổng thể đã biết hoặc được ước lượng từ nghiên cứu trước.
Trong đó
nền móng từ thế kỷ 17–18; công thức ước lượng cỡ mẫu năm 1967Christiaan HuygensJacob BernoulliPierre-Simon de LaplaceCarl Friedrich GaussAnders Nicolai KiærArthur Lyon BowleyWilliam Cochran
Khái niệm này không ra đời trong một buổi chiều mà lớn lên cùng lý thuyết xác suất. Huygens nghiên cứu giá trị kỳ vọng (expected value), rồi Bernoulli phát biểu luật số lớn (law of large numbers) — công trình đầu tiên nối thẳng số quan sát với mức tin cậy của kết luận. Sang thế kỷ 18 và 19, Pierre-Simon de Laplace cùng Carl Friedrich Gauss đẩy lý thuyết xác suất tiến thêm một bước dài. Khi điều tra xã hội bùng nổ, câu hỏi "hỏi bao nhiêu người là đủ" trở nên cấp bách: Anders Nicolai Kiær giới thiệu lấy mẫu phân tầng (stratified sampling) năm 1895, còn Arthur Lyon Bowley đưa kỹ thuật lấy mẫu ngẫu nhiên (random sampling) vào thống kê xã hội năm 1906. Nhờ đó cỡ mẫu chuyển từ chuyện cảm tính sang một đại lượng tính được.
Vì sao mang đúng cái tên này? Tên gọi nghe đơn giản đến mức dễ bị xem nhẹ: nó chỉ là "cỡ" — số phần tử — của cái mẫu ta lấy ra, thường ký hiệu bằng . Sức nặng của chữ "cỡ" nằm ở chỗ Bernoulli là người đầu tiên buộc con số này vào độ chính xác của suy luận, nên đếm số quan sát không còn là việc ghi chép hành chính mà thành một tham số của lý thuyết. Bản thân ngành thống kê lại mang cái tên rất khác gốc: chữ statistics đi ra từ tiếng Latin mới statisticum collegium ("hội đồng nhà nước") và tiếng Ý statista ("chính khách"), được Gottfried Achenwall đưa vào tiếng Đức năm 1749 để chỉ việc phân tích dữ liệu về nhà nước. Vì vậy, khi nói cỡ mẫu, ta đang dùng một từ rất mộc trong một ngành khoa học vốn sinh ra từ nhu cầu cai trị và kiểm đếm dân cư.
Nguồn đối chiếu
Tăng cỡ mẫu không làm giảm độ chệch của ước lượng.
Đây là chỗ nhiều thí sinh mất điểm ở câu hỏi về ảnh hưởng của việc nâng cỡ mẫu lên 1.300: độ chệch (bias) phản ánh việc cách lấy mẫu có hệ thống làm ước lượng lệch khỏi tham số hay không, nên nó do thiết kế khảo sát quyết định chứ không do . Nếu mẫu vốn đã ngẫu nhiên và không chệch thì tăng cũng chẳng có gì để sửa; ngược lại, nếu khung mẫu bỏ sót một nhóm dân số, lấy thêm hàng nghìn người vẫn chệch y như cũ, chỉ chệch một cách chính xác hơn. Cái mà cỡ mẫu làm giảm là phương sai (variance): nhỏ đi khi lớn lên. Vì vậy đáp án đúng gần như luôn là "độ chệch không đổi, phương sai giảm".
Cỡ mẫu không làm thay đổi trung bình của phân bố mẫu.
Với tỉ lệ màn hình lỗi , ta có dù lấy mẫu cỡ 400, cỡ 40 hay cỡ 4.000, bởi là ước lượng không chệch của . Nhiều học sinh tưởng mẫu lớn thì trung bình phân bố mẫu (sampling distribution) sẽ "xích lại gần hơn", nhưng nó vốn đã bằng đúng ngay từ đầu. Cái xích lại gần là các giá trị riêng lẻ: chúng bu quanh chặt hơn vì độ lệch chuẩn nhỏ hơn. Do đó khi đề hỏi về , hãy trả lời ngay bằng và đừng nhìn vào .
Mẫu lớn hơn chưa chắc cho độ lệch chuẩn nhỏ hơn nếu cũng khác nhau.
Trong dạng đề "cặp và nào cho độ lệch chuẩn lớn nhất", công thức có hai bộ phận cùng tác động: tử số đạt cực đại tại và giảm dần khi tiến về hoặc , còn mẫu số kéo toàn bộ biểu thức xuống. Học sinh vội vàng chỉ nhìn nhỏ nhất rồi khoanh, nhưng nếu phương án đó có trong khi phương án kia có thì kết luận có thể đảo ngược. Cách an toàn là tính thẳng giá trị số cho từng cặp rồi so sánh, vì bốn phép tính này chưa tới một phút.
Điều kiện về cỡ mẫu gồm hai điều kiện khác nhau, không được gộp làm một.
Điều kiện độc lập yêu cầu dân số lớn ít nhất gấp 10 lần cỡ mẫu — như lập luận rằng dây chuyền sản xuất bim bim thừa sức tạo ra số lượng gói gấp hơn 10 lần hai mẫu 150 và 200. Còn điều kiện xấp xỉ chuẩn lại đòi và cho tỉ lệ, hoặc theo định lý giới hạn trung tâm (central limit theorem) cho trung bình. Viết một điều kiện rồi coi như đã kiểm tra xong là mất điểm, vì bài chấm tính hai ý riêng biệt. Đặc biệt với hai mẫu, cả bốn bất đẳng thức đếm phải được ghi ra, mỗi mẫu hai cái.
Khi gộp hai tỉ lệ mẫu, phải lấy trung bình có trọng số theo cỡ mẫu.
Công thức tỉ lệ gộp (pooled proportion) là , tức tổng số thành công chia tổng số quan sát. Với , và , , ta được chứ không phải trung bình cộng . Mẫu lớn hơn kéo giá trị gộp về phía nó, nên cứ lấy trung bình cộng đơn thuần là sai số nhỏ nhưng đủ để lệch khỏi đáp án trắc nghiệm.
Viết ra tên kiểm định kèm đầy đủ cụm "cho hiệu hai trung bình dân số".
Ở phần tự luận, giám khảo cần thấy bạn nhận diện đúng cả ba yếu tố: hai mẫu độc lập, biến định lượng, và đại lượng quan tâm là hiệu. Câu trả lời đạt điểm là "two-sample -test for a difference in population means"; chỉ viết "t-test" thì mơ hồ, còn viết "z-test" khi chưa biết độ lệch chuẩn dân số là sai hẳn. Sau đó mới liệt kê điều kiện ngẫu nhiên, điều kiện và điều kiện chuẩn theo từng mẫu.
Đọc kỹ chiều của bất đẳng thức trước khi kết luận mẫu nào cho xác suất lớn hơn.
Khi đề so sánh giữa và một cỡ mẫu lớn hơn, mẫu nhỏ có độ lệch chuẩn lớn hơn nên phân bố dàn rộng, đẩy nhiều xác suất ra hai đuôi. Nếu nằm phía trên giá trị , mẫu nhỏ cho xác suất vượt ngưỡng cao hơn; nhưng nếu ngưỡng nằm phía dưới thì kết luận đảo chiều. Hãy vẽ nhanh hai đường cong chồng lên nhau, đánh dấu ở giữa và ngưỡng ở đúng phía của nó, rồi mới chọn đáp án.
Với cỡ mẫu 400, phân phối mẫu của tỉ lệ màn hình lỗi có trung bình và độ lệch chuẩn , đồng thời xấp xỉ chuẩn vì và đều lớn hơn 10. Khi nâng cỡ mẫu lên 1600, độ lệch chuẩn giảm còn khoảng 0.0054, tức là các kết quả kiểm định sẽ bám sát 5% hơn hẳn. Tuy nhiên trung bình vẫn giữ nguyên ở 0.05, nên việc tăng cỡ mẫu chỉ làm tăng độ chính xác chứ không sửa được sai lệch hệ thống nếu cách lấy mẫu vốn đã thiên vị.
Phương án (A) với và cho độ lệch chuẩn lớn nhất, bằng , vì nó gộp cả cỡ mẫu nhỏ nhất lẫn tỉ lệ làm tích đạt cực đại. Khi nhóm nghiên cứu tăng cỡ mẫu từ 1000 lên 1300, độ lệch chuẩn của tỉ lệ mẫu giảm từ khoảng xuống khoảng , nghĩa là các ước lượng về mức ủng hộ dự án xe buýt điện sẽ bám sát giá trị thật hơn. Tuy vậy mức độ chệch vẫn giữ nguyên, bởi cỡ mẫu lớn hơn không sửa được bất kỳ khuyết tật nào trong cách chọn người để khảo sát.
Quiz câu thật từ ngân hàng đề
Vài câu thật gắn đúng khái niệm này, chấm ngay kèm giải thích từng đáp án — hệ thống ghi nhớ bạn nắm tới đâu.
Biên soạn bởi DucklingStudy, bản quyền thuộc DucklingStudy. Xuất bản .