AP Statistics
trial
Còn gọi: lượt thử · trial
Phép thử (trial) là một lần thực hiện hành động ngẫu nhiên, cho ra đúng một kết quả có thể xảy ra.
Trong thống kê, phép thử là một lần thực hiện của một hành động có kết quả ngẫu nhiên, chẳng hạn tung đồng xu hay quan sát một ngày giao dịch chứng khoán. Mỗi phép thử chỉ cho đúng một kết quả trong số các kết quả có thể, và trước khi thực hiện ta không biết chắc kết quả nào sẽ xảy ra. Do đó, khi phép thử được lặp lại (replication) nhiều lần độc lập, tần suất xuất hiện của một kết quả sẽ tiến gần tới xác suất lý thuyết của nó.
Trong phân phối nhị thức (binomial distribution), phép thử phải thỏa ba điều kiện: chỉ có hai kết quả thành công hoặc thất bại, xác suất thành công không đổi qua các lần thử, và các lần thử độc lập với nhau. Vì vậy, khi cả ba điều kiện được thỏa mãn, số lần thành công trong phép thử tuân theo phân phối nhị thức, với xác suất có đúng thành công tính bằng Công thức này thể hiện số cách sắp xếp lần thành công trong vị trí, nhân với xác suất tương ứng của các lần thành công và thất bại.
Vì phép thử là đơn vị nhỏ nhất được lặp lại, nó cũng là nền tảng của mô phỏng (simulation): khi không có công thức tường minh, người ta mô phỏng hàng nghìn phép thử độc lập để ước lượng (estimator) xác suất của một kết quả hiếm. Do đó, việc xác định đúng số phép thử , xác suất giả định , và số lần lặp lại là bước đầu tiên trước khi đọc kết quả của bài toán thống kê (statistic) thực nghiệm.
Trực giác: Giống như mỗi lần bạn tung một viên xúc xắc: mỗi cú tung là một phép thử, kết quả ra sao chỉ biết sau khi xúc xắc dừng lại.
James LindAvicenna
Gốc rễ xa nhất của ý niệm "đem ra thử để biết kết quả" nằm trong các hệ thống luật pháp cổ đại, chẳng hạn Bộ luật Hammurabi của Babylon, nơi một phiên xử được mở ra để xác định người bị cáo có tội hay vô tội. Về sau, cùng một chữ ấy được y học mượn lại. Năm 1025, Avicenna viết Canon of Medicine và đặt ra những nguyên tắc sớm nhất cho việc làm thí nghiệm nhằm đánh giá hiệu quả của thuốc. Đến thế kỷ 18, bác sĩ người Scotland James Lind tiến hành nghiên cứu về bệnh scurvy năm 1747, đưa nhóm đối chứng (control group) vào thực hành và đặt nền cho phương pháp thử nghiệm lâm sàng (clinical trial) hiện đại.
Vì sao mang đúng cái tên này? Chữ "trial" đi vào tiếng Anh qua tiếng Pháp cổ "triel", và xa hơn nữa được cho là bắt nguồn từ chữ Latin "tribulus" với nghĩa "đập lúa" hay "nỗi gian nan". Hình ảnh đập lúa rất sát với cái lõi ngữ nghĩa của từ: người ta đập để tách hạt ra khỏi vỏ, tức là làm một động tác rồi xem cái gì lộ ra. Nghĩa "phiên tòa" cũng đi theo mạch đó, vì xét xử chính là đem sự việc ra thử để biết sự thật. Vì vậy, khi từ này được dùng trong xác suất, nó vẫn giữ nguyên tinh thần cũ: mỗi lượt thử là một lần thực hiện hành động rồi quan sát kết quả hiện ra, không hơn không kém. Hiểu được gốc ấy, người học sẽ thấy vì sao cùng một chữ lại xuất hiện ở ba nơi tưởng chừng chẳng liên quan — tòa án, bệnh viện và bài toán tung đồng xu.
Chạy một lượt: năm lần tung gộp lại thành đúng một chấm
Kéo tham số, thấy khái niệm chuyển động — mở khoá bằng tài khoản 0đ.
Số lượt thử của mô phỏng không phải cỡ mẫu trong mỗi lượt thử.
Đây là chỗ vấp nặng nhất khi đề cho hai mô phỏng kiểu "1.500 lượt thử với cỡ mẫu (sample size) 100" và "2.000 lượt thử với cỡ mẫu 50". Số lượt thử chỉ cho biết ta lặp lại quy trình bao nhiêu lần để vẽ nên phân bố mẫu (sampling distribution), còn độ lệch chuẩn của phân bố đó lại do cỡ mẫu trong MỖI lượt quyết định, theo với là cỡ mẫu chứ không phải số lượt. Vì vậy mô phỏng có ít lượt thử hơn nhưng cỡ mẫu lớn hơn vẫn cho phân bố hẹp hơn. Thấy con số lớn là vội kết luận "biến thiên ít hơn" thì trúng bẫy.
Tăng số lượt thử không làm phân bố mẫu hẹp lại.
Nhiều bạn nghĩ mô phỏng càng nhiều lượt thì kết quả càng "chụm", nhưng thực ra tăng số lượt chỉ làm biểu đồ mô phỏng bám sát hơn phân bố lý thuyết mà thôi. Khi đề nói 400 lượt thử, mỗi lượt gieo xúc xắc 5 lần rồi lấy trung bình, thì 400 giá trị sẽ có trung bình xấp xỉ và độ lệch chuẩn xấp xỉ . Con số không hề xuất hiện trong mẫu số; nếu bạn viết thì mất trọn điểm.
Hai lượt thử trên cùng một người không phải hai đối tượng độc lập.
Trong thí nghiệm mà mỗi học sinh lần lượt đạp xe có xem video rồi đạp xe không xem video, 14 học sinh và 2 lượt thử KHÔNG tạo ra 28 quan sát độc lập. Mỗi học sinh là một khối (block), và việc ngẫu nhiên hóa chỉ là ngẫu nhiên hóa thứ tự hai lượt thử trong cùng một người, nên đây là thiết kế cặp đôi (matched pairs). Do đó phải phân tích trên hiệu số của từng cặp bằng kiểm định một mẫu, chứ không so sánh hai trung bình độc lập.
Không phải dãy lặp lại nào cũng là các lượt thử độc lập.
Mô hình nhị thức (binomial) đòi hỏi số lượt thử cố định, mỗi lượt chỉ có hai kết quả, xác suất thành công không đổi và các lượt độc lập với nhau. Khi bốc lần lượt từ một tập hữu hạn mà không hoàn lại, xác suất thành công thay đổi sau mỗi lượt nên điều kiện độc lập hỏng, chỉ cứu được gần đúng nếu cỡ mẫu dưới tổng thể. Ngược lại, gieo xúc xắc hay tung đồng xu thì các lượt thử luôn độc lập vì vật gieo "không nhớ" kết quả trước.
Khi mô tả mô phỏng, phải nêu đủ: một lượt thử gồm gì, lặp mấy lần, ghi đại lượng nào.
Đây là barem quen thuộc của câu tự luận về mô phỏng, và học sinh thường chỉ nói "gieo xúc xắc rồi lặp lại nhiều lần" nên mất điểm oan. Hãy viết thành câu trọn vẹn kiểu: gieo 5 lần, tính trung bình của 5 giá trị đó, ghi lại trung bình này, rồi lặp toàn bộ quy trình 400 lần và vẽ phân bố của 400 giá trị thu được. Chấm điểm nhìn vào chỗ bạn nói rõ "lặp lại toàn bộ quy trình", chứ không phải lặp lại một lần gieo.
Gặp đề mô phỏng, gạch chân ngay số lượt thử và cỡ mẫu để khỏi nhầm lẫn.
Đề cố tình đặt hai số gần nhau trong cùng một câu để bạn lẫn, và chỉ cỡ mẫu mới đi vào công thức sai số chuẩn (standard error). Một mẹo kiểm tra nhanh: trung bình của phân bố mẫu luôn bằng trung bình tổng thể bất kể hai con số đó, nên nếu đáp án nào nói trung bình thay đổi theo số lượt thử thì loại ngay.
Cụm "at most" và "at least" phải chuyển thành danh sách số cụ thể trước khi cộng xác suất.
Khi đếm số lần thành công trong một dãy lượt thử, "at most 2" nghĩa là , hoặc , nên xác suất bằng tổng ba cột chứ không phải hai; bỏ sót giá trị là lỗi rất phổ biến. Tương tự, "at most three successes" gồm bốn cột . Viết hẳn dãy số ra lề giấy rồi mới cộng chiều cao các cột, đừng nhẩm trong đầu.
Trong bài này, là số phép thử của một lần nếm thử (mỗi ly là một phép thử với hai kết cục đúng/sai), còn là số lượt thử của mô phỏng. Ước lượng từ mô phỏng cho , rất sát giá trị lý thuyết . Vì , ta kết luận rằng kết quả đoán đúng trên ly chưa cung cấp bằng chứng thuyết phục rằng học sinh đó thực sự phân biệt được Coca và Pepsi.
Đây là thiết kế nhóm đối sánh, trong đó mỗi lượt thử là một lần một học sinh đạp xe phút dưới một điều kiện và được đo số calo; thứ tự hai lượt cần bốc thăm riêng cho từng em để khử hiệu ứng thứ tự, còn yêu cầu lặp lại đã được đáp ứng nhờ có học sinh chứ không phải nhờ mỗi em làm hai lượt. Với , và giá trị p xấp xỉ , có bằng chứng thuyết phục rằng việc xem video cảnh rừng khi đạp xe làm tăng lượng calo tiêu hao trung bình đối với nhóm học sinh lớp này.
Quiz câu thật từ ngân hàng đề
Vài câu thật gắn đúng khái niệm này, chấm ngay kèm giải thích từng đáp án — hệ thống ghi nhớ bạn nắm tới đâu.
Biên soạn bởi DucklingStudy, bản quyền thuộc DucklingStudy. Xuất bản .