AP Statistics

thí nghiệm ngẫu nhiên hoá

randomized experiment

Còn gọi: randomized experiment

Thí nghiệm ngẫu nhiên hoá là nghiên cứu trong đó nhà thống kê chủ động phân ngẫu nhiên đối tượng vào các nhóm xử lý để so sánh kết quả.

Thí nghiệm ngẫu nhiên hoá là kiểu nghiên cứu mà người làm thí nghiệm chủ động can thiệp bằng cách phân ngẫu nhiên các đối tượng vào hai hay nhiều nhóm xử lý, rồi so sánh kết quả giữa các nhóm với nhau. Điểm khác biệt cốt lõi so với nghiên cứu quan sát (observational study) nằm ở chỗ chính người nghiên cứu quyết định ai nhận xử lý nào, thay vì chỉ ghi nhận những gì xảy ra tự nhiên, nhờ đó thí nghiệm ngẫu nhiên hoá trở thành công cụ hiếm hoi cho phép kết luận về quan hệ nhân quả chứ không dừng lại ở một mối liên hệ mơ hồ.

Cơ chế then chốt nằm ở việc phân ngẫu nhiên làm cho các nhóm xử lý trở nên tương đồng về mọi đặc điểm khác của đối tượng, kể cả những đặc điểm mà nhà nghiên cứu chưa từng nghĩ tới để đo đạc. Vì vậy, nếu sau thí nghiệm các nhóm cho kết quả khác nhau rõ rệt thì khó có thể quy sự khác biệt ấy cho một biến gây nhiễu (confounding variable) nào khác ngoài chính xử lý đang so sánh. Ngược lại, một nghiên cứu quan sát dù cỡ mẫu lớn đến đâu vẫn luôn để ngỏ khả năng tồn tại yếu tố ẩn giấu làm lệch dữ liệu, chẳng hạn học sinh chọn học môn AP Thống kê vốn đã có động lực học tập cao hơn ngay từ đầu chứ không phải môn học tạo ra khác biệt điểm số đại học.

Trong suy luận thống kê, việc phân ngẫu nhiên còn thay thế cho điều kiện độc lập vốn thường được kiểm tra bằng điều kiện 10%, do đó khi dữ liệu đến từ một thí nghiệm ngẫu nhiên hoá thật sự thì không cần so cỡ mẫu với tổng thể mà chỉ cần khẳng định các đối tượng đã được phân ngẫu nhiên vào các nhóm xử lý. Điều kiện này xuất hiện thường xuyên trong các bài kiểm định hai mẫu, đặc biệt khi so sánh trung bình hoặc tỉ lệ giữa nhóm xử lý và nhóm đối chứng.

Trực giác: Giống như bốc thăm chia đội chơi để không ai cố tình xếp cầu thủ giỏi vào một đội, phân ngẫu nhiên giúp các yếu tố gây nhiễu được rải đều một cách cân bằng giữa các nhóm, chứ không đảm bảo hai đội hoàn toàn ngang sức tuyệt đối.

Khái niệm này sinh ra từ đâu

cuối thế kỷ 19Charles Sanders PeirceJoseph JastrowRonald A. Fisher

Thí nghiệm ngẫu nhiên hoá được nhà khoa học Mỹ Charles Sanders Peirce tạo ra vào cuối thế kỷ 19 khi ông cùng học trò Joseph Jastrow đo cảm giác phân biệt trọng lượng, và được R. A. Fisher phổ biến rộng rãi ở đầu thế kỷ 20 qua cuốn Statistical Methods for Research Workers.

Ý tưởng so sánh hai nhóm được đối xử khác nhau đã có từ rất lâu: Sách Daniel trong Cựu Ước kể chuyện Daniel đề nghị cho mình ăn rau và uống nước trong mười ngày, rồi so diện mạo với những thanh niên dùng thức ăn của nhà vua. Điều còn thiếu suốt nhiều thế kỷ là cách quyết định ai vào nhóm nào. Cuối thế kỷ 19, Peirce và Jastrow bổ sung đúng mảnh ghép đó bằng cách dùng cơ chế may rủi để phân thứ tự các lần thử, tạo ra thí nghiệm ngẫu nhiên hoá có làm mù (double-blind) đầu tiên. Cách làm này lan nhanh trong tâm lý học và giáo dục học; sau đó Fisher mang nó ra ngoài hai lĩnh vực ấy cùng nhiều nguyên tắc thiết kế thí nghiệm khác.

Vì sao mang đúng cái tên này? Cái tên nghe lạ vì phần "ngẫu nhiên hoá" không mô tả kết quả mà mô tả một thao tác. Thí nghiệm có đối chứng (controlled experiment) đã tồn tại từ thời cổ, nhưng điểm mới mà Peirce đưa vào là việc phân bổ các đơn vị thí nghiệm vào các nhóm xử lý bằng cơ chế may rủi, tức ngẫu nhiên hoá (randomization). Chính thao tác đó trở thành tên gọi: thí nghiệm nào dùng phép gán ngẫu nhiên thì được gọi là thí nghiệm ngẫu nhiên hoá, phân biệt với thí nghiệm chỉ có nhóm đối chứng mà người nghiên cứu tự chọn ai vào nhóm nào.

Thử nghiệm tương tác

Tắt ngẫu nhiên hoá rồi bật lại — nhìn cột nhiễu phình lên rồi tụt xuống

Tắt ngẫu nhiên hoá rồi bật lại — nhìn cột nhiễu phình lên rồi tụt xuống

Kéo tham số, thấy khái niệm chuyển động — mở khoá bằng tài khoản 0đ.

Tạo tài khoản miễn phí

Hay hiểu sai

Điều kiện 10% không áp dụng cho thí nghiệm ngẫu nhiên hoá.

Điều kiện Chi-square xét số đếm kỳ vọng, không xét số đếm quan sát.

Gán ngẫu nhiên không cứu được số đếm kỳ vọng quá nhỏ.

Cỡ mẫu nhỏ hơn 30 không tự động loại bỏ thủ tục tt.

Mẹo phòng thi

Khi đề nói "randomized experiment", hãy gạch bỏ ngay điều kiện 10% khỏi danh sách kiểm tra.

Viết ra con số nhỏ nhất khi kiểm tra điều kiện, đừng chỉ viết "điều kiện thoả".

Phân biệt rõ điều gì cho phép suy luận nhân quả và điều gì cho phép tổng quát hoá.

Tần suất trong đề AP StatisticsThường xuyên

Ví dụ có lời giải

1Ví dụ 1/2
Một trường đại học so sánh hồ sơ của 200 sinh viên năm nhất: 100 em từng học môn Thống kê AP ở phổ thông và 100 em không học. Điểm trung bình tích luỹ (GPA) năm nhất của nhóm có học là 3,423{,}42, của nhóm không học là 3,183{,}18. Từ chênh lệch 0,240{,}24 này, phòng tư vấn định khuyên mọi học sinh chuẩn bị vào đại học đều nên học Thống kê AP.
  1. aGiải thích vì sao dữ liệu trên không cho phép kết luận rằng việc học Thống kê AP làm GPA đại học tăng lên.
  2. bMô tả một thí nghiệm ngẫu nhiên hoá trả lời được câu hỏi trên, và nêu rõ nhờ đâu thiết kế đó cho phép kết luận nhân quả.
1Bước 1: Trước hết phải xác định dữ liệu sinh ra bằng cách nào. Ở đây nhà trường chỉ đi lục lại hồ sơ có sẵn: không ai quyết định em nào học Thống kê AP, chính học sinh tự chọn lấy môn đó. Vì việc phân nhóm nằm ngoài tay người nghiên cứu nên đây là một nghiên cứu quan sát (observational study), chứ không phải thí nghiệm.
2Bước 2: Khi người tham gia tự chọn nhóm, hai nhóm đã khác nhau từ trước khi bất kỳ xử lí nào diễn ra. Học sinh dám đăng ký một môn AP thường là những em có động lực cao hơn, nền toán vững hơn, và hay đến từ những trường có nhiều nguồn lực hơn. Mỗi đặc điểm đó vừa gắn với việc chọn học Thống kê AP, vừa tự nó kéo GPA đại học lên, nên nó là một biến gây nhiễu (confounding variable). Do đó chênh lệch 3,423,18=0,243{,}42-3{,}18=0{,}24 hoàn toàn có thể là hậu quả của việc hai nhóm vốn không giống nhau, chứ không phải của môn học.
3Bước 3: Muốn chặn đường đó thì phải giành lại quyền phân nhóm. Hãy lấy 200 học sinh lớp 11 đủ điều kiện học Thống kê AP, đánh số từ 001 đến 200, rồi dùng máy tạo số ngẫu nhiên chọn ra 100 số khác nhau: những em mang số được chọn sẽ học Thống kê AP, 100 em còn lại học một môn toán tự chọn khác. Sau năm nhất đại học, ghi lại GPA của từng em và so sánh trung bình hai nhóm. Cách gán ngẫu nhiên (random assignment) này chính là điều biến nghiên cứu thành thí nghiệm ngẫu nhiên hoá theo thiết kế ngẫu nhiên hoàn toàn (completely randomized design).
4Bước 4: Sức mạnh của việc bốc thăm nằm ở chỗ nó không cần biết biến gây nhiễu là gì. Động lực, năng lực nền, hoàn cảnh gia đình và cả những yếu tố chưa ai nghĩ ra đều được rải đều về hai nhóm, nên tính trung bình hai nhóm xuất phát ngang nhau. Vì vậy nếu về sau GPA hai nhóm chênh nhau nhiều hơn mức mà dao động ngẫu nhiên có thể tạo ra, lời giải thích hợp lý duy nhất còn lại là môn học. Đó là lý do chỉ thí nghiệm ngẫu nhiên hoá mới cho phép nói "làm tăng", còn nghiên cứu quan sát chỉ được nói "có liên hệ".

Dữ liệu 200 hồ sơ chỉ cho thấy một mối liên hệ giữa việc học Thống kê AP và GPA đại học cao hơn; vì học sinh tự chọn nhóm nên động lực và nền tảng toán có thể là nguyên nhân thật sự, và lời khuyên của phòng tư vấn là chưa có căn cứ. Nếu thay bằng thí nghiệm gán ngẫu nhiên 100 em vào lớp Thống kê AP và 100 em vào môn toán khác, mọi khác biệt xuất phát sẽ được cân bằng, và khi đó chênh lệch GPA đủ lớn mới cho phép kết luận rằng chính môn Thống kê AP làm GPA tăng.

2Ví dụ 2/2
Một nhóm nghiên cứu muốn biết kiểu nhắc nhở nào giúp học viên hoàn thành bài tập trực tuyến. Từ danh sách 1200 tình nguyện viên, họ chọn 180 người và gán ngẫu nhiên mỗi người vào một trong ba cách nhắc, mỗi cách 60 người: nhắc bằng email (A), nhắc bằng tin nhắn (B), nhắc bằng thông báo trong ứng dụng (C). Sau hai tuần, số người hoàn thành bài tập là 48 ở nhóm A, 52 ở nhóm B và 44 ở nhóm C.
  1. aKiểm tra các điều kiện để dùng kiểm định chi bình phương về tính đồng nhất.
  2. bMột học viên nói: "180 người vượt quá 10% của 1200 tình nguyện viên nên không được làm kiểm định." Đánh giá nhận định này.
  3. cTính giá trị thống kê kiểm định, kết luận ở mức α=0,05\alpha=0{,}05 và nêu phạm vi mà kết luận đó có hiệu lực.
1Bước 1: Lập bảng hai chiều trước đã. Mỗi hàng là một cách nhắc với tổng 60, cột "hoàn thành" có tổng 48+52+44=14448+52+44=144, cột "không hoàn thành" có tổng 180144=36180-144=36. Các số đếm quan sát ở cột thứ hai lần lượt là 6048=1260-48=12, 6052=860-52=86044=1660-44=16.
2Bước 2: Các số đếm kỳ vọng (expected counts) tính theo E=RCnE=\dfrac{R\cdot C}{n}, với RR là tổng hàng, CC là tổng cột và n=180n=180. Cột hoàn thành cho E=60144180=48E=\dfrac{60\cdot 144}{180}=48 ở cả ba hàng, cột không hoàn thành cho E=6036180=12E=\dfrac{60\cdot 36}{180}=12. Ô nhỏ nhất là 1212, vẫn lớn hơn 55, nên điều kiện về cỡ mẫu lớn đã thoả. Điều kiện còn lại là tính độc lập, và nó được bảo đảm bởi chính khâu gán ngẫu nhiên vào ba cách nhắc.
3Bước 3: Nhận định của học viên kia là sai, nhưng sai vì áp nhầm điều kiện chứ không vì tính nhầm. Quy tắc n0,10Nn\le 0{,}10N sinh ra để xử lí việc lấy mẫu không hoàn lại từ một tổng thể hữu hạn: rút quá nhiều thì các cá thể không còn độc lập với nhau. Trong một thí nghiệm ngẫu nhiên hoá, yếu tố ngẫu nhiên nằm ở khâu gán người vào nhóm xử lí chứ không nằm ở khâu rút người ra khỏi tổng thể, nên điều kiện 10% không áp dụng. Thứ phải kiểm tra thay vào đó là các nhóm đã được gán ngẫu nhiên hay chưa, và ở đây thì có.
4Bước 4: Bây giờ tính χ2=(OE)2E\chi^2=\sum\dfrac{(O-E)^2}{E}. Cột hoàn thành đóng góp 0248+4248+4248=0+0,333+0,333\dfrac{0^2}{48}+\dfrac{4^2}{48}+\dfrac{4^2}{48}=0+0{,}333+0{,}333, cột không hoàn thành đóng góp 0212+4212+4212=0+1,333+1,333\dfrac{0^2}{12}+\dfrac{4^2}{12}+\dfrac{4^2}{12}=0+1{,}333+1{,}333. Cộng lại được χ23,33\chi^2\approx 3{,}33 với bậc tự do df=(31)(21)=2df=(3-1)(2-1)=2, tương ứng p0,19p\approx 0{,}19. Vì p>0,05p>0{,}05 nên ta không bác bỏ giả thuyết không.
5Bước 5: Cuối cùng phải nói rõ kết luận có hiệu lực tới đâu, và ở đây hai khâu ngẫu nhiên đóng hai vai khác nhau. Việc gán ngẫu nhiên cho phép quy mọi khác biệt đáng kể (nếu có) cho chính cách nhắc, tức là cho phép nói chuyện nhân quả. Tuy nhiên 180 người này là tình nguyện viên chứ không phải mẫu ngẫu nhiên rút từ danh sách 1200 người, nên dù kết quả có ra sao cũng không được suy rộng cho toàn bộ học viên.

Mọi số đếm kỳ vọng đều bằng 48 hoặc 12, tức đều vượt 5, và tính độc lập có được nhờ việc gán ngẫu nhiên 180 người vào ba cách nhắc, nên kiểm định chi bình phương dùng được; riêng điều kiện 10% không cần xét vì đây là thí nghiệm ngẫu nhiên hoá chứ không phải khảo sát mẫu. Với χ23,33\chi^2\approx 3{,}33, df=2df=2p0,19>0,05p\approx 0{,}19>0{,}05, ta không có đủ bằng chứng cho rằng tỉ lệ hoàn thành bài tập khác nhau giữa ba cách nhắc, và kết luận này chỉ có giá trị cho nhóm 180 tình nguyện viên tham gia thí nghiệm.

Bạn nắm chắc chưa?

Quiz câu thật từ ngân hàng đề

Vài câu thật gắn đúng khái niệm này, chấm ngay kèm giải thích từng đáp án — hệ thống ghi nhớ bạn nắm tới đâu.

Tạo tài khoản miễn phí

Học tiếp từ đây

Bài học chứa thuật ngữ nàyThiết kế thực nghiệmDữ liệu một biến & thu thập dữ liệu · khoá AP Statistics
Mục tiêu và lộ trình unit xem miễn phí — làm bài tập và lưu tiến độ cần tài khoản 0đ.

Hay nhầm với

Khác nhau ở đâuThí nghiệm ngẫu nhiên hoá chủ động gán xử lý nên cho phép kết luận nhân quả. Nghiên cứu quan sát chỉ ghi nhận điều sẵn có nên chỉ kết luận được mối liên hệ.
Hay nhầm khiCâu hỏi mô tả một nghiên cứu rồi hỏi có được nói xử lý gây ra kết quả hay không; nhiều thí sinh kết luận nhân quả cho dữ liệu quan sát.
Khác nhau ở đâuThí nghiệm ngẫu nhiên hoá gán ngẫu nhiên xử lý nên quyết định quyền kết luận nhân quả. Mẫu ngẫu nhiên chọn ngẫu nhiên đối tượng nên quyết định quyền khái quát cho tổng thể.
Hay nhầm khiĐề cho bốn tình huống bật/tắt hai loại ngẫu nhiên và hỏi được suy rộng hay được nói nhân quả; thí sinh hay đảo hai vai trò này.

Cùng chủ đề

Nguồn tham khảo

  1. [1]Barron_AP_Stat_2026. tr. 263, 337, 360.

Biên soạn bởi DucklingStudy, bản quyền thuộc DucklingStudy. Xuất bản .