AP Statistics
randomized experiment
Còn gọi: randomized experiment
Thí nghiệm ngẫu nhiên hoá là nghiên cứu trong đó nhà thống kê chủ động phân ngẫu nhiên đối tượng vào các nhóm xử lý để so sánh kết quả.
Thí nghiệm ngẫu nhiên hoá là kiểu nghiên cứu mà người làm thí nghiệm chủ động can thiệp bằng cách phân ngẫu nhiên các đối tượng vào hai hay nhiều nhóm xử lý, rồi so sánh kết quả giữa các nhóm với nhau. Điểm khác biệt cốt lõi so với nghiên cứu quan sát (observational study) nằm ở chỗ chính người nghiên cứu quyết định ai nhận xử lý nào, thay vì chỉ ghi nhận những gì xảy ra tự nhiên, nhờ đó thí nghiệm ngẫu nhiên hoá trở thành công cụ hiếm hoi cho phép kết luận về quan hệ nhân quả chứ không dừng lại ở một mối liên hệ mơ hồ.
Cơ chế then chốt nằm ở việc phân ngẫu nhiên làm cho các nhóm xử lý trở nên tương đồng về mọi đặc điểm khác của đối tượng, kể cả những đặc điểm mà nhà nghiên cứu chưa từng nghĩ tới để đo đạc. Vì vậy, nếu sau thí nghiệm các nhóm cho kết quả khác nhau rõ rệt thì khó có thể quy sự khác biệt ấy cho một biến gây nhiễu (confounding variable) nào khác ngoài chính xử lý đang so sánh. Ngược lại, một nghiên cứu quan sát dù cỡ mẫu lớn đến đâu vẫn luôn để ngỏ khả năng tồn tại yếu tố ẩn giấu làm lệch dữ liệu, chẳng hạn học sinh chọn học môn AP Thống kê vốn đã có động lực học tập cao hơn ngay từ đầu chứ không phải môn học tạo ra khác biệt điểm số đại học.
Trong suy luận thống kê, việc phân ngẫu nhiên còn thay thế cho điều kiện độc lập vốn thường được kiểm tra bằng điều kiện 10%, do đó khi dữ liệu đến từ một thí nghiệm ngẫu nhiên hoá thật sự thì không cần so cỡ mẫu với tổng thể mà chỉ cần khẳng định các đối tượng đã được phân ngẫu nhiên vào các nhóm xử lý. Điều kiện này xuất hiện thường xuyên trong các bài kiểm định hai mẫu, đặc biệt khi so sánh trung bình hoặc tỉ lệ giữa nhóm xử lý và nhóm đối chứng.
Trực giác: Giống như bốc thăm chia đội chơi để không ai cố tình xếp cầu thủ giỏi vào một đội, phân ngẫu nhiên giúp các yếu tố gây nhiễu được rải đều một cách cân bằng giữa các nhóm, chứ không đảm bảo hai đội hoàn toàn ngang sức tuyệt đối.
cuối thế kỷ 19Charles Sanders PeirceJoseph JastrowRonald A. Fisher
Ý tưởng so sánh hai nhóm được đối xử khác nhau đã có từ rất lâu: Sách Daniel trong Cựu Ước kể chuyện Daniel đề nghị cho mình ăn rau và uống nước trong mười ngày, rồi so diện mạo với những thanh niên dùng thức ăn của nhà vua. Điều còn thiếu suốt nhiều thế kỷ là cách quyết định ai vào nhóm nào. Cuối thế kỷ 19, Peirce và Jastrow bổ sung đúng mảnh ghép đó bằng cách dùng cơ chế may rủi để phân thứ tự các lần thử, tạo ra thí nghiệm ngẫu nhiên hoá có làm mù (double-blind) đầu tiên. Cách làm này lan nhanh trong tâm lý học và giáo dục học; sau đó Fisher mang nó ra ngoài hai lĩnh vực ấy cùng nhiều nguyên tắc thiết kế thí nghiệm khác.
Vì sao mang đúng cái tên này? Cái tên nghe lạ vì phần "ngẫu nhiên hoá" không mô tả kết quả mà mô tả một thao tác. Thí nghiệm có đối chứng (controlled experiment) đã tồn tại từ thời cổ, nhưng điểm mới mà Peirce đưa vào là việc phân bổ các đơn vị thí nghiệm vào các nhóm xử lý bằng cơ chế may rủi, tức ngẫu nhiên hoá (randomization). Chính thao tác đó trở thành tên gọi: thí nghiệm nào dùng phép gán ngẫu nhiên thì được gọi là thí nghiệm ngẫu nhiên hoá, phân biệt với thí nghiệm chỉ có nhóm đối chứng mà người nghiên cứu tự chọn ai vào nhóm nào.
Tắt ngẫu nhiên hoá rồi bật lại — nhìn cột nhiễu phình lên rồi tụt xuống
Kéo tham số, thấy khái niệm chuyển động — mở khoá bằng tài khoản 0đ.
Điều kiện 10% không áp dụng cho thí nghiệm ngẫu nhiên hoá.
Điều kiện 10% (10% condition) sinh ra để xử lý việc lấy mẫu không hoàn lại: khi ta bốc người ra khỏi một tổng thể hữu hạn, các quan sát không còn độc lập hoàn toàn, nên phải giới hạn cỡ mẫu dưới 10% tổng thể để sai lệch đó bỏ qua được. Trong thí nghiệm, tính ngẫu nhiên đến từ việc gán ngẫu nhiên (random assignment) các đối tượng vào nhóm xử lý, chứ không đến từ việc rút người ra khỏi danh sách. Vì vậy khi đề nói 180 tình nguyện viên vượt quá 10% danh sách, đó là thông tin gây nhiễu chứ không phải một vi phạm điều kiện.
Điều kiện Chi-square xét số đếm kỳ vọng, không xét số đếm quan sát.
Nhiều học sinh thấy mọi ô quan sát đều từ 8 trở lên nên vội kết luận thủ tục hợp lệ, trong khi số đếm kỳ vọng (expected counts) nhỏ nhất chỉ là . Quy tắc yêu cầu mọi giá trị kỳ vọng thoả , vì chính các giá trị kỳ vọng nằm dưới mẫu số của thống kê và quyết định xem phân phối lấy mẫu có xấp xỉ được bằng phân phối khi bình phương hay không. Chỉ cần một ô có là điều kiện hỏng, dù tất cả ô quan sát đều lớn.
Gán ngẫu nhiên không cứu được số đếm kỳ vọng quá nhỏ.
Đây là hai điều kiện khác nhau phục vụ hai mục đích khác nhau: ngẫu nhiên hoá bảo đảm cơ sở xác suất cho suy luận, còn ngưỡng bảo đảm phép xấp xỉ phân phối hoạt động được. Thoả điều kiện này không miễn trừ điều kiện kia. Khi trình bày, học sinh phải kiểm tra riêng từng điều kiện và ghi rõ giá trị nhỏ nhất tìm được, thay vì viết một câu chung chung rằng thí nghiệm đã ngẫu nhiên nên mọi thứ đều ổn.
Cỡ mẫu nhỏ hơn 30 không tự động loại bỏ thủ tục .
Ngưỡng 30 chỉ là một quy ước thô để yên tâm viện dẫn định lý giới hạn trung tâm (central limit theorem), không phải một luật cấm. Với mỗi nhóm, điều cần kiểm tra là hình dạng dữ liệu: nếu hai biểu đồ gần đối xứng và không có giá trị ngoại lai (outlier) mạnh, điều kiện dữ liệu mẫu vẫn đạt và thủ tục dùng được bình thường. Ngược lại, một mẫu lệch nặng kèm vài điểm cực trị vẫn có thể khiến thủ tục kém tin cậy, nên đừng lấy con số 30 làm câu trả lời máy móc.
Khi đề nói "randomized experiment", hãy gạch bỏ ngay điều kiện 10% khỏi danh sách kiểm tra.
Đề AP rất thích cài một câu kiểu "tổng số người vượt quá 10% danh sách tình nguyện viên" để dụ thí sinh chọn phương án nói rằng điều kiện bị vi phạm. Nhận ra ngay từ đầu rằng nguồn ngẫu nhiên ở đây là gán ngẫu nhiên chứ không phải chọn mẫu, bạn sẽ loại được hai đến ba phương án chỉ trong vài giây và dành thời gian cho phần kiểm tra thật sự quan trọng.
Viết ra con số nhỏ nhất khi kiểm tra điều kiện, đừng chỉ viết "điều kiện thoả".
Ở câu tự luận, giám khảo cần thấy bằng chứng cụ thể: ghi "số đếm kỳ vọng nhỏ nhất là nên điều kiện không thoả", hoặc với thủ tục thì ghi rằng hai đồ thị gần đối xứng và không có điểm ngoại lai rõ rệt. Một câu khẳng định trống không thường bị trừ điểm dù kết luận cuối cùng vẫn đúng. Thói quen này cũng giúp chính bạn không nhầm giữa số đếm quan sát và số đếm kỳ vọng.
Phân biệt rõ điều gì cho phép suy luận nhân quả và điều gì cho phép tổng quát hoá.
Gán ngẫu nhiên các đối tượng vào nhóm xử lý là thứ cho phép kết luận nhân quả, còn việc lấy mẫu ngẫu nhiên từ tổng thể mới là thứ cho phép mở rộng kết luận ra ngoài nhóm tham gia. Một thí nghiệm trên tình nguyện viên có thể kết luận rằng phương pháp tạo ra khác biệt, nhưng không đương nhiên nói được điều đó đúng cho mọi học sinh. Khi đề hỏi phạm vi kết luận, hãy trả lời theo đúng hai trục này.
Dữ liệu 200 hồ sơ chỉ cho thấy một mối liên hệ giữa việc học Thống kê AP và GPA đại học cao hơn; vì học sinh tự chọn nhóm nên động lực và nền tảng toán có thể là nguyên nhân thật sự, và lời khuyên của phòng tư vấn là chưa có căn cứ. Nếu thay bằng thí nghiệm gán ngẫu nhiên 100 em vào lớp Thống kê AP và 100 em vào môn toán khác, mọi khác biệt xuất phát sẽ được cân bằng, và khi đó chênh lệch GPA đủ lớn mới cho phép kết luận rằng chính môn Thống kê AP làm GPA tăng.
Mọi số đếm kỳ vọng đều bằng 48 hoặc 12, tức đều vượt 5, và tính độc lập có được nhờ việc gán ngẫu nhiên 180 người vào ba cách nhắc, nên kiểm định chi bình phương dùng được; riêng điều kiện 10% không cần xét vì đây là thí nghiệm ngẫu nhiên hoá chứ không phải khảo sát mẫu. Với , và , ta không có đủ bằng chứng cho rằng tỉ lệ hoàn thành bài tập khác nhau giữa ba cách nhắc, và kết luận này chỉ có giá trị cho nhóm 180 tình nguyện viên tham gia thí nghiệm.
Quiz câu thật từ ngân hàng đề
Vài câu thật gắn đúng khái niệm này, chấm ngay kèm giải thích từng đáp án — hệ thống ghi nhớ bạn nắm tới đâu.
Biên soạn bởi DucklingStudy, bản quyền thuộc DucklingStudy. Xuất bản .