AP Statistics

bằng chứng thống kê

statistical evidence

Còn gọi: statistical evidence

Bằng chứng thống kê là mức độ dữ liệu quan sát được mâu thuẫn với giả thuyết không, dùng làm căn cứ để quyết định có bác bỏ giả thuyết đó hay không.

Khi một nghiên cứu đặt câu hỏi liệu có sự khác biệt thật sự giữa hai nhóm hay không, người làm thống kê không thể trả lời chắc chắn tuyệt đối mà chỉ có thể cân nhắc mức độ thuyết phục của số liệu. Bằng chứng thống kê chính là cách diễn đạt mức độ thuyết phục đó: nó cho biết kết quả quan sát được có bất thường đến mức khó xảy ra một cách ngẫu nhiên hay không, nếu giả sử thật ra không hề có khác biệt gì, tức là dưới giả thuyết không (null hypothesis). Công cụ đo lường phổ biến nhất là giá trị p, với quy tắc quyết định thường viết dưới dạng pαp \le \alpha \Rightarrow bác bỏ giả thuyết không, trong đó α\alpha là ngưỡng ý nghĩa chọn trước, thường là 0.05.

Trong nhiều bài toán, giá trị p không tính bằng công thức đóng mà được ước lượng qua mô phỏng (simulation): người ta lặp lại thí nghiệm giả định hàng trăm lần dưới giả thuyết không, rồi đếm tỉ lệ lần kết quả mô phỏng cực đoan bằng hoặc hơn kết quả quan sát thực tế. Tỉ lệ đó chính là ước lượng của giá trị p, nên nếu nó rất nhỏ, kết quả quan sát khó có thể xảy ra chỉ do biến động ngẫu nhiên, và ta nói dữ liệu cung cấp bằng chứng thống kê thuyết phục để bác bỏ giả thuyết không.

Bằng chứng thống kê còn có thể đọc trực tiếp từ khoảng tin cậy: nếu khoảng tin cậy cho một hiệu số, chẳng hạn hiệu hai trung bình (difference of two means) hoặc hiệu hai tỉ lệ, không chứa giá trị 0, đó cũng là bằng chứng cho thấy khác biệt là có thật chứ không chỉ do ngẫu nhiên. Tuy nhiên cần lưu ý rằng bằng chứng thống kê chỉ nói về mức độ thuyết phục dựa trên xác suất, không chứng minh nguyên nhân và không đảm bảo kết luận đúng tuyệt đối, vì luôn tồn tại khả năng mắc sai lầm loại I hoặc loại II trong quá trình suy luận.

Ký hiệup-value, α, H₀

Trực giác: Giống như một bồi thẩm đoàn chỉ tuyên án có tội khi bằng chứng đủ mạnh để loại trừ khả năng vô tội một cách hợp lý.

Khái niệm này sinh ra từ đâu

1962–1969Allan BirnbaumFlorence NightingaleAdolphe Quetelet

Ý niệm dùng số liệu làm bằng chứng để thuyết phục nhà cầm quyền đã có từ thế kỷ 19 với Adolphe Quetelet và Florence Nightingale, nhưng việc dựng thành nguyên lý chặt chẽ thuộc về nhà thống kê toán học người Mỹ Allan Birnbaum trong hai công trình năm 1962 và 1969.

Khi phương pháp thống kê được đem áp dụng cho các hiện tượng xã hội, nhà thiên văn người Bỉ Adolphe Quetelet đã đặt ra cái ông gọi là vật lý xã hội, tìm những quy luật đều đặn trong tính cách và hành vi của cả nhóm người. Ông ảnh hưởng mạnh đến Florence Nightingale, người tiên phong ngành điều dưỡng ở Anh, và chính bà thúc giục các chính phủ phải lưu trữ hồ sơ cho tốt rồi ra quyết định dựa trên bằng chứng thống kê. Một thế kỷ sau, Allan Birnbaum mới đi tìm câu trả lời cho câu hỏi nền tảng: thế nào mới là bằng chứng. Khảo sát nguyên lý hợp lý (likelihood principle), ông kết luận rằng muốn đánh giá bằng chứng thì cần đến một dạng khoảng tin cậy (confidence interval) nào đó.

Vì sao mang đúng cái tên này? Phần "thống kê" trong tên gọi này mang theo cả một lịch sử chính trị. Từ tiếng Latinh mới statisticum collegium nghĩa là "hội đồng nhà nước", còn tiếng Ý statista nghĩa là "chính khách"; nhà khoa học chính trị người Đức Gottfried Achenwall đưa ra chữ Statistik năm 1749 để chỉ việc phân tích dữ liệu về nhà nước, tức "khoa học về quốc gia", mà tiếng Anh thời đó gọi là số học chính trị (political arithmetic). Sir John Sinclair đưa chữ này vào tiếng Anh năm 1791 khi xuất bản tập đầu trong bộ Statistical Account of Scotland. Mãi đến đầu thế kỷ 19 nó mới mang nghĩa rộng là thu thập và phân loại dữ liệu nói chung, và nhờ đó cụm "bằng chứng thống kê" mới có thể chỉ bằng chứng rút ra từ số liệu bất kỳ chứ không riêng sổ sách của triều đình. Chữ "bằng chứng" thì đến từ khung suy luận thống kê (statistical inference) theo trường phái tần suất (frequentist) mà Birnbaum tìm cách đặt nền móng.

Thử nghiệm tương tác

Xáo nhãn nhóm hàng trăm lần — xem may rủi có tạo nổi chênh lệch này không

Xáo nhãn nhóm hàng trăm lần — xem may rủi có tạo nổi chênh lệch này không

Kéo tham số, thấy khái niệm chuyển động — mở khoá bằng tài khoản 0đ.

Tạo tài khoản miễn phí

Hay hiểu sai

Không bác bỏ H0H_0 không có nghĩa là H0H_0 đúng.

Giả thuyết luôn viết bằng tham số tổng thể, không bao giờ bằng thống kê mẫu.

Chiều của đối thuyết phải khớp với câu hỏi nghiên cứu, không khớp với dữ liệu.

Giá trị pp không phải xác suất giả thuyết không đúng.

Mẹo phòng thi

Kết luận phải có đủ ba phần: so sánh, quyết định, và bối cảnh.

Nêu tên kiểm định và kiểm tra điều kiện trước khi bấm máy.

Chỉ được kết luận nhân quả khi có phân nhóm ngẫu nhiên.

Tần suất trong đề AP StatisticsThường xuyên

Ví dụ có lời giải

1Ví dụ 1/2
Một trường cao đẳng muốn biết sinh viên chơi thể thao đại diện trường (athletes) có dành nhiều giờ tự học ngoài lớp hơn sinh viên không chơi thể thao (nonathletes) hay không. Người ta khảo sát ngẫu nhiên 25 sinh viên mỗi nhóm và ghi lại số giờ tự học mỗi tuần. Trung vị của nhóm vận động viên là 15 giờ, trung vị của nhóm còn lại là 12 giờ, nên hiệu số trung vị quan sát được (athletes trừ nonathletes) bằng 3 giờ. Để xem hiệu số này có đáng kể hay không, người ta trộn 50 giá trị thành một khối rồi chia ngẫu nhiên lại thành hai nhóm 25 người, tính hiệu số trung vị, và lặp lại 110 lần. Trong 110 lần mô phỏng đó, có 9 lần hiệu số trung vị đạt từ 3 giờ trở lên.
  1. aƯớc lượng xác suất quan sát được hiệu số trung vị từ 3 giờ trở lên nếu thực tế hai nhóm không khác nhau về giờ tự học.
  2. bDựa trên kết quả câu (a), dữ liệu có cung cấp bằng chứng thống kê thuyết phục rằng vận động viên tự học nhiều giờ hơn hay không?
1Bước 1: Trước hết phải hiểu mô phỏng đang giả định điều gì. Khi trộn 50 giá trị rồi chia ngẫu nhiên lại, ta đã mặc nhiên coi việc một sinh viên thuộc nhóm nào là hoàn toàn không ảnh hưởng đến số giờ tự học của người đó; đây chính là giả thuyết không (null hypothesis) rằng hai nhóm không khác nhau. Phân bố 110 hiệu số thu được từ mô phỏng, gọi là phân bố ngẫu nhiên hóa (randomization distribution), cho ta thấy các hiệu số trung vị dao động ra sao chỉ do may rủi khi chia nhóm. Do đó, so sánh hiệu số thật với phân bố này là cách đo xem con số 3 giờ có gì bất thường không.
2Bước 2: Xác suất ước lượng chính là tỉ lệ các lần mô phỏng cho kết quả xa ít nhất bằng kết quả thật, tính theo hướng mà câu hỏi quan tâm: p^sim=91100,082.\hat{p}_{\text{sim}}=\frac{9}{110}\approx 0{,}082. Con số 0,0820{,}082 nói rằng nếu hai nhóm thật sự học như nhau, thì khoảng 8,2%8{,}2\% số lần chia nhóm ngẫu nhiên vẫn tạo ra chênh lệch trung vị từ 3 giờ trở lên. Nói cách khác, một chênh lệch cỡ 3 giờ không phải là chuyện hiếm gặp khi chỉ có may rủi hoạt động.
3Bước 3: Bây giờ mới đến phần phán quyết. Ta đối chiếu giá trị vừa tính với mức ý nghĩa (significance level) thông thường α=0,05\alpha=0{,}05 và thấy 0,082>0,050{,}082>0{,}05. Vì kết quả quan sát được nằm trong vùng mà ngẫu nhiên thuần túy hoàn toàn có thể sinh ra, ta không có cơ sở để bác bỏ giả định rằng hai nhóm học như nhau. Tuy nhiên, cần nói cho đúng mức: kết luận này không chứng minh hai nhóm giống hệt nhau, nó chỉ nói dữ liệu hiện có chưa đủ mạnh để khẳng định điều ngược lại.

(a) Xác suất ước lượng là 9/1100,0829/110\approx 0{,}082. (b) Vì 0,0820{,}082 lớn hơn 0,050{,}05, một chênh lệch trung vị 3 giờ hoàn toàn có thể xuất hiện do may rủi khi chia nhóm. Vì vậy dữ liệu KHÔNG cung cấp bằng chứng thống kê thuyết phục rằng sinh viên chơi thể thao đại diện trường này dành nhiều giờ tự học ngoài lớp hơn sinh viên không chơi thể thao.

2Ví dụ 2/2
Một tổ chức thăm dò dư luận từng công bố rằng tỉ lệ người trưởng thành Mỹ trả lời họ "đang có một ngày tốt lành" là 0,410{,}41. Một nhà nghiên cứu nghi ngờ tỉ lệ này ở học sinh trung học thì khác. Ông chọn ngẫu nhiên 500 học sinh trung học trên toàn quốc và hỏi cùng câu hỏi đó; có 236 em trả lời rằng mình đang có một ngày tốt lành.
  1. aNêu cặp giả thuyết và kiểm tra các điều kiện cần thiết cho kiểm định.
  2. bTính thống kê kiểm định và giá trị p.
  3. cỞ mức ý nghĩa α=0,05\alpha=0{,}05, dữ liệu có cung cấp bằng chứng thống kê thuyết phục rằng tỉ lệ học sinh trung học trả lời như vậy khác 0,410{,}41 hay không?
1Bước 1: Gọi pp là tỉ lệ toàn bộ học sinh trung học sẽ trả lời rằng mình đang có một ngày tốt lành. Vì đề chỉ nói "khác 0,410{,}41" chứ không chỉ rõ lớn hơn hay nhỏ hơn, ta viết H0:p=0,41H_0: p=0{,}41Ha:p0,41H_a: p\neq 0{,}41, tức một kiểm định hai phía. Ba điều kiện cần kiểm tra là: mẫu được chọn ngẫu nhiên nên có thể suy rộng cho quần thể; số học sinh trung học toàn quốc chắc chắn vượt 10×500=500010\times 500=5000 nên điều kiện độc lập được thỏa; và np0=500(0,41)=205np_0=500(0{,}41)=205 cùng n(1p0)=500(0,59)=295n(1-p_0)=500(0{,}59)=295 đều lớn hơn 10 nên phân bố mẫu của tỉ lệ mẫu xấp xỉ chuẩn.
2Bước 2: Tỉ lệ mẫu là p^=236/500=0,472\hat{p}=236/500=0{,}472, cao hơn 0,410{,}41 khoảng 6,26{,}2 điểm phần trăm. Câu hỏi đặt ra là khoảng cách đó có lớn so với dao động lấy mẫu thông thường hay không, và thống kê kiểm định trả lời đúng câu hỏi ấy: z=p^p0p0(1p0)n=0,4720,41(0,41)(0,59)500=0,0620,02202,82.z=\frac{\hat{p}-p_0}{\sqrt{\dfrac{p_0(1-p_0)}{n}}}=\frac{0{,}472-0{,}41}{\sqrt{\dfrac{(0{,}41)(0{,}59)}{500}}}=\frac{0{,}062}{0{,}0220}\approx 2{,}82. Giá trị z2,82z\approx 2{,}82 nghĩa là tỉ lệ quan sát được nằm cách giá trị giả định khoảng 2,822{,}82 độ lệch chuẩn (standard deviation) của phân bố mẫu.
3Bước 3: Vì kiểm định hai phía nên giá trị p (p-value) phải gộp cả hai đuôi: P=2P(Z>2,82)2(0,0024)=0,0048.P=2\,P(Z>2{,}82)\approx 2(0{,}0024)=0{,}0048. Con số này cho biết nếu tỉ lệ thật đúng bằng 0,410{,}41, thì chỉ khoảng 0,48%0{,}48\% số mẫu cỡ 500 cho kết quả lệch khỏi 0,410{,}41 nhiều như mẫu ta thu được hoặc hơn. Một kết quả hiếm đến vậy khó lòng quy cho may rủi lấy mẫu.
4Bước 4: So sánh 0,0048<0,050{,}0048<0{,}05, ta bác bỏ H0H_0. Điều quan trọng khi viết kết luận là phải nói lại bằng ngôn ngữ của bài toán chứ không dừng ở chữ "bác bỏ": phải nêu rõ bằng chứng nói về tỉ lệ học sinh trung học nào, so với con số nào. Ngoài ra nên tránh nói "đã chứng minh", bởi kiểm định chỉ cho biết dữ liệu khó giải thích được nếu H0H_0 đúng, chứ không loại trừ hoàn toàn khả năng ta vừa gặp một mẫu bất thường.

(a) H0:p=0,41H_0: p=0{,}41 đối với Ha:p0,41H_a: p\neq 0{,}41, với pp là tỉ lệ toàn bộ học sinh trung học trả lời rằng mình đang có một ngày tốt lành; cả ba điều kiện ngẫu nhiên, độc lập và cỡ mẫu đủ lớn đều thỏa. (b) p^=0,472\hat{p}=0{,}472, z2,82z\approx 2{,}82, giá trị p 0,0048\approx 0{,}0048. (c) Vì 0,0048<0,050{,}0048<0{,}05, ta bác bỏ H0H_0: dữ liệu CÓ cung cấp bằng chứng thống kê thuyết phục rằng tỉ lệ học sinh trung học trả lời mình đang có một ngày tốt lành khác 0,410{,}41, và mẫu cho thấy tỉ lệ đó cao hơn.

Bạn nắm chắc chưa?

Quiz câu thật từ ngân hàng đề

Vài câu thật gắn đúng khái niệm này, chấm ngay kèm giải thích từng đáp án — hệ thống ghi nhớ bạn nắm tới đâu.

Tạo tài khoản miễn phí

Học tiếp từ đây

Bài học chứa thuật ngữ nàyGiá trị p (p-value)Suy luận cho tỉ lệ (dữ liệu phân loại) · khoá AP Statistics
Cần trướcgiả thuyết không
Mục tiêu và lộ trình unit xem miễn phí — làm bài tập và lưu tiến độ cần tài khoản 0đ.

Hay nhầm với

Khác nhau ở đâuBằng chứng thống kê là đại lượng liên tục, mạnh dần khi p-value nhỏ dần. Có ý nghĩa thống kê là phán quyết nhị phân sau khi so p-value với mức ý nghĩa.
Hay nhầm khiKhi đề hỏi mô tả mức độ bằng chứng mà thí sinh chỉ trả lời "significant" hoặc "not significant", bỏ mất phần nói bằng chứng mạnh đến đâu.
Khác nhau ở đâuP-value là xác suất cụ thể tính từ phân phối null. Bằng chứng thống kê là cách diễn giải xác suất ấy thành nhận định về giả thuyết không.
Hay nhầm khiThí sinh hay viết "p-value là xác suất giả thuyết không đúng", biến con số xác suất thành phát biểu về bằng chứng một cách sai lệch.

Cùng chủ đề

Nguồn tham khảo

  1. [1]Barron_AP_Stat_2026. tr. 333, 482, 490.

Biên soạn bởi DucklingStudy, bản quyền thuộc DucklingStudy. Xuất bản .