AP Statistics
stratum
Còn gọi: stratum · strata
Tầng là một nhóm con của tổng thể gồm các cá thể có chung một đặc điểm quan trọng, dùng làm đơn vị để chọn mẫu ngẫu nhiên riêng trong mỗi nhóm.
Trước khi lấy mẫu, nhà nghiên cứu đôi khi chia tổng thể thành nhiều nhóm con sao cho các cá thể trong cùng một nhóm giống nhau ở một đặc điểm nào đó, chẳng hạn giới tính, độ tuổi, hay khối lớp. Mỗi nhóm con như vậy được gọi là một tầng, trong đó các phần tử tương đối đồng nhất với nhau, còn giữa các tầng thì khác biệt rõ rệt; đây chính là bước chuẩn bị cho phương pháp chọn mẫu phân tầng (stratified sampling), nơi mẫu cuối cùng được ghép từ nhiều mẫu con.
Sau khi xác định các tầng, người ta rút một mẫu ngẫu nhiên đơn từ từng tầng một cách độc lập, rồi gộp lại thành mẫu phân tầng hoàn chỉnh. Nhờ đó, mọi tầng, kể cả những nhóm thiểu số dễ bị bỏ sót nếu chọn mẫu ngẫu nhiên toàn bộ, đều chắc chắn có mặt trong mẫu với tỉ lệ hợp lý. Khi số cá thể được chọn từ mỗi tầng tỉ lệ đúng với kích thước của tầng đó trong tổng thể, người ta gọi đó là chọn mẫu tỉ lệ, với công thức n_h = n · N_h/N, trong đó N_h là số cá thể của tầng thứ h, N là tổng số cá thể của toàn bộ tổng thể, còn n_h là số người được lấy mẫu từ tầng đó khi cỡ mẫu chung là n.
Tuy nhiên, việc phân tầng đòi hỏi phải biết trước tổng thể được chia thành những nhóm nào và mỗi cá thể thuộc tầng nào, thông tin này không phải lúc nào cũng có sẵn hoặc chính xác. Ngược lại, một cụm trong chọn mẫu theo cụm lại được xây dựng để bản thân nó phản ánh sự đa dạng của cả tổng thể, còn giữa các cụm thì tương đối giống nhau; vì vậy người ta chọn toàn bộ một vài cụm nhưng chỉ chọn một phần từ mỗi tầng. Sự phân biệt này thường xuất hiện trong các câu hỏi yêu cầu giải thích vì sao một thiết kế lấy mẫu cụ thể là hợp lý.
Trực giác: Giống như chia học sinh toàn trường theo khối lớp trước khi bốc thăm mỗi khối một số bạn, để chắc chắn khối nào cũng có đại diện trong mẫu.
1895Anders Nicolai KiærArthur Lyon Bowley
Cuối thế kỷ 19, các cuộc điều tra xã hội quy mô lớn đang là chuyện thời sự ở châu Âu, và câu hỏi nhức nhối là làm sao nói được điều gì đó đáng tin về cả một quốc gia khi ngân sách chỉ đủ hỏi một phần nhỏ dân cư. Năm 1895, Anders Nicolai Kiær đề xuất chia dân số thành những nhóm bên trong tương đối đồng nhất rồi lấy mẫu trong từng nhóm, thay vì bốc ngẫu nhiên trên toàn bộ. Nhờ đó mẫu phản ánh được cơ cấu thật của dân số. Ít lâu sau, Arthur Lyon Bowley tiếp nối hướng này và đưa kỹ thuật chọn mẫu ngẫu nhiên (random sampling) vào các khảo sát xã hội ở London.
Vì sao mang đúng cái tên này? Tên gọi nghe lạ tai vì nó vốn không thuộc về thống kê. Trong tiếng Anh, stratum (số nhiều là strata) là từ gốc Latin chỉ một lớp, một tầng nằm chồng lên nhau — đúng nghĩa các lớp đất đá mà nhà địa chất nhìn thấy trên vách núi. Khi thống kê mượn hình ảnh ấy, dân số được hình dung như một khối có nhiều lớp: mỗi lớp gồm những cá thể giống nhau ở đặc điểm ta quan tâm, còn các lớp thì khác nhau rõ rệt. Vì vậy tiếng Việt dịch là "tầng", và phép lấy mẫu chia theo các lớp đó mang tên chọn mẫu phân tầng.
Rút 25 mẫu theo hai cách — xem cách chia theo tầng bó sát giá trị thật hơn
Kéo tham số, thấy khái niệm chuyển động — mở khoá bằng tài khoản 0đ.
Tầng không phải cụm.
Trong chọn mẫu phân tầng, mỗi tầng gồm các cá thể GIỐNG nhau ở đặc điểm liên quan (nam/nữ, khối 10/11/12), và ta lấy mẫu từ TẤT CẢ các tầng. Ngược lại, chọn mẫu phân cụm (cluster sampling) chia quần thể thành các cụm mà mỗi cụm đã là một bản thu nhỏ của quần thể, rồi chỉ chọn ngẫu nhiên vài cụm và khảo sát trọn cụm đó. Vì vậy câu hỏi phân biệt hai cách luôn xoay quanh một điểm: bạn lấy mẫu từ mọi nhóm hay chỉ lấy vài nhóm?
Bỏ sót một tầng là hỏng cả thiết kế.
Nhiều bài làm mô tả rất kỹ cách chia tầng rồi lại chỉ bốc ngẫu nhiên vài tầng để khảo sát — đó đã thành phân cụm chứ không còn phân tầng. Điểm mạnh của phân tầng nằm ở chỗ mọi nhóm đều có tiếng nói trong mẫu, nhờ đó ước lượng phản ánh đủ cơ cấu quần thể. Khi trình bày, phải viết rõ: trong MỖI tầng, chọn một mẫu ngẫu nhiên đơn giản (simple random sample).
Phân tầng không nhằm khử thiên lệch mà nhằm giảm biến thiên.
Nếu cách chọn trong từng tầng vẫn ngẫu nhiên thì ước lượng đã không thiên lệch sẵn rồi; cái phân tầng thêm vào là độ chính xác. Khi các cá thể trong cùng một tầng khá đồng nhất còn giữa các tầng lại khác nhau rõ, độ lệch chuẩn (standard deviation) của ước lượng nhỏ hơn so với lấy mẫu ngẫu nhiên đơn giản cùng cỡ. Do đó câu trả lời đúng thường là "giảm biến thiên của ước lượng", không phải "loại bỏ thiên lệch".
Chia tầng theo biến không liên quan thì chẳng được lợi gì.
Tầng chỉ phát huy tác dụng khi biến dùng để chia có liên hệ với biến đang đo: chia theo khối lớp khi khảo sát thời gian tự học thì hợp lý, còn chia theo thứ tự chữ cái của họ tên thì vô ích. Nếu các tầng giống hệt nhau về biến quan tâm, phân tầng không tốt hơn lấy mẫu ngẫu nhiên đơn giản. Vì vậy khi giải thích lựa chọn, luôn nêu lý do tại sao biến phân tầng liên quan đến câu hỏi nghiên cứu.
Đừng lẫn tầng trong khảo sát với khối trong thí nghiệm.
Tầng thuộc về việc chọn mẫu, còn khối (block) thuộc về việc phân nhóm đối tượng trước khi gán ngẫu nhiên các nghiệm thức. Hai khái niệm chung một tinh thần — gom các cá thể tương tự lại để giảm biến thiên — nhưng dùng ở hai loại nghiên cứu khác nhau. Dùng sai tên trong bài tự luận sẽ bị trừ điểm dù ý tưởng đúng.
Mô tả thiết kế phân tầng phải đủ ba ý mới trọn điểm.
Ý thứ nhất: nêu tiêu chí chia tầng và giải thích vì sao tiêu chí đó liên quan đến biến đang đo. Ý thứ hai: nói rõ chọn ngẫu nhiên trong TỪNG tầng, kèm cách chọn cụ thể (đánh số rồi dùng bảng số ngẫu nhiên hoặc máy tính). Ý thứ ba: nói cỡ mẫu lấy ở mỗi tầng, thường phân bổ theo tỉ lệ , trong đó là số cá thể của tầng thứ và là cỡ quần thể.
Thấy chữ "trong mỗi nhóm" thì nghĩ ngay đến phân tầng.
Đề thường mô tả tình huống bằng lời chứ không gọi tên phương pháp, nên phải bắt từ khóa: lấy mẫu từ mọi nhóm là phân tầng, chọn vài nhóm rồi khảo sát trọn vẹn là phân cụm, chọn thẳng từ toàn bộ danh sách là mẫu ngẫu nhiên đơn giản. Đọc kỹ một câu quyết định này trước khi khoanh đáp án.
Khi so sánh hai thiết kế, hãy viết ra chữ "biến thiên" thay vì nói chung chung "tốt hơn".
Giám khảo tìm lập luận rằng các cá thể trong cùng tầng tương tự nhau nên ước lượng dao động ít hơn qua các mẫu lặp lại. Một câu như "phân tầng theo khối lớp giúp giảm biến thiên của ước lượng vì thời gian tự học khác nhau rõ giữa các khối" đủ ăn điểm, còn "phân tầng cho kết quả chính xác hơn" thì không.
Trường được chia thành ba tầng theo khối lớp; với phân bổ tỉ lệ ta khảo sát 31 em khối 10, 29 em khối 11 và 30 em khối 12, mỗi nhóm rút ngẫu nhiên độc lập trong khối của mình. Từ kết quả ba mẫu, ước lượng số giờ tự học trung bình của học sinh toàn trường là khoảng 1,83 giờ mỗi ngày. Vì khác biệt lớn nằm giữa các khối chứ không nằm trong từng khối, cách làm này cho ước lượng ổn định hơn so với rút ngẫu nhiên 90 em từ cả trường.
Các lớp chủ nhiệm là cụm, vì mỗi lớp đa dạng như một bản thu nhỏ của trường và nhà nghiên cứu chỉ lấy một phần các nhóm rồi khảo sát trọn vẹn. Nếu chuyển sang phân tầng theo khối lớp, ta rút ngẫu nhiên độc lập 60 em khối 10, 50 em khối 11 và 40 em khối 12 để được mẫu 150 em. Cách này đánh đổi sự tiện lợi lấy độ chính xác: tốn công tổ chức hơn, nhưng ước lượng cho toàn trường sẽ ổn định hơn.
Quiz câu thật từ ngân hàng đề
Vài câu thật gắn đúng khái niệm này, chấm ngay kèm giải thích từng đáp án — hệ thống ghi nhớ bạn nắm tới đâu.
Biên soạn bởi DucklingStudy, bản quyền thuộc DucklingStudy. Xuất bản .