AP Statistics
difference of two means
Còn gọi: hiệu hai trung bình tổng thể · difference in population means · difference of two means
Hiệu hai trung bình là tham số μ1 − μ2 đo mức chênh lệch trung bình giữa hai tổng thể định lượng độc lập, được ước lượng bằng hiệu hai trung bình mẫu.
Khi cần so sánh hai tổng thể định lượng — chẳng hạn tuổi nghỉ hưu dự kiến của giáo sư đại học và của cảnh sát — người ta không hỏi từng trung bình riêng lẻ mà hỏi chúng lệch nhau bao nhiêu. Vì vậy, tham số (parameter) cần suy luận khi đó là hiệu hai trung bình tổng thể , và giá trị ước lượng tự nhiên của nó lấy từ dữ liệu (data) là , hiệu của hai trung bình mẫu thu được từ hai mẫu ngẫu nhiên (random sample) độc lập.
Do và đến từ hai mẫu tách biệt, phân phối mẫu của hiệu có sai số chuẩn cộng gộp từ cả hai phía theo công thức trong đó là độ lệch chuẩn mẫu và là cỡ mẫu của từng nhóm. Do phương sai tổng thể thường không biết, thống kê chuẩn hoá do đó dùng phân phối t với số bậc tự do (degrees of freedom) tính theo công thức Welch, chứ không dùng phân phối chuẩn như khi biết .
Hiệu hai trung bình là nền tảng cho cả hai loại suy luận thống kê: khoảng tin cậy ước lượng nằm trong một khoảng giá trị hợp lý, còn kiểm định giả thuyết (hypothesis testing) kiểm tra xem hiệu này có khác 0 một cách có ý nghĩa hay không. Để áp dụng đúng, hai mẫu phải độc lập với nhau chứ không phải dữ liệu cặp, được chọn ngẫu nhiên, và cỡ mẫu đủ lớn hoặc tổng thể gần chuẩn để định lý giới hạn trung tâm đảm bảo tính hợp lệ của xấp xỉ t. Ngược lại, khi khoảng tin cậy của hoàn toàn nằm về một phía của 0, đó là bằng chứng thuyết phục rằng hai tổng thể thực sự khác trung bình.
Trực giác: Giống như so sánh chiều cao trung bình của hai lớp học bằng cách lấy hiệu số, hiệu hai trung bình cho biết nhóm nào cao hơn và cao hơn bao nhiêu, dựa trên hai mẫu tách biệt.
Dùng khi muốn ước lượng khoảng tin cậy cho hiệu hai trung bình tổng thể từ hai mẫu độc lập, mỗi mẫu có phương sai không nhất thiết bằng nhau.
Trong đó
Dùng làm thống kê kiểm định trong kiểm định giả thuyết về hiệu hai trung bình tổng thể, so sánh với phân phối t.
Trong đó
1925Ronald A. Fisher
Khái niệm này sinh ra từ một nhu cầu rất đời thường: người ta hiếm khi chỉ muốn biết một nhóm, mà muốn biết nhóm này có khác nhóm kia hay không. Một nhà sản xuất muốn ước lượng chênh lệch sản lượng trung bình mỗi ngày giữa hai máy; một nhà nghiên cứu y khoa muốn biết bệnh nhân dùng hai loại thuốc khác nhau đáp ứng khác nhau ra sao. Để trả lời, thống kê suy luận chuyển câu hỏi so sánh thành câu hỏi về một đại lượng duy nhất là hiệu hai trung bình tổng thể, rồi dựng khoảng tin cậy (confidence interval) và kiểm định giả thuyết (hypothesis test) quanh nó. Kiểm định t của Student được dùng cho trường hợp hai tổng thể phân phối chuẩn, và năm 1925 Fisher giới thiệu phân tích phương sai để mở rộng câu hỏi sang ba nhóm trở lên.
Vì sao mang đúng cái tên này? Tên gọi mô tả đúng thứ được đem ra tính: người ta không so sánh hai số trung bình bằng lời mà lấy chúng trừ nhau, tạo ra một đại lượng mới là . Chính vì vậy giả thuyết không được viết thành thay vì — hai cách viết tương đương, nhưng cách sau làm lộ ra rằng đối tượng suy luận thực sự là một hiệu số. Nhờ đó mọi công cụ dành cho một tham số đơn lẻ đều dùng lại được, kể cả sai số chuẩn (standard error) của hiệu, lấy từ lý thuyết xác suất: Công thức này nói rằng độ dao động của hiệu hai trung bình mẫu được gộp từ độ dao động của từng trung bình mẫu, cộng theo bình phương chứ không cộng thẳng. Còn chữ "thống kê" trong tên ngành thì có gốc từ tiếng Latin "status", nghĩa là "nhà nước" — dấu vết của thời mà dữ liệu chủ yếu phục vụ việc cai trị.
Không được cộng thẳng hai độ lệch chuẩn khi tính sai số chuẩn.
Phương sai mới cộng được, còn độ lệch chuẩn thì không, nên sai số chuẩn (standard error) của hiệu hai trung bình là chứ không phải . Công thức này nói rằng độ dao động của được góp từ hai nguồn biến thiên độc lập, và ta gộp chúng theo bình phương rồi mới lấy căn. Cách cộng sai luôn cho kết quả lớn hơn thật, làm khoảng tin cậy rộng ra và thống kê kiểm định nhỏ đi. Do đó bài giải có thể đúng hướng mà vẫn mất điểm phần tính toán.
Dữ liệu ghép cặp phải xử lý như một mẫu hiệu, không phải hai mẫu độc lập.
Khi mỗi đối tượng được đo hai lần, hoặc hai đối tượng được ghép thành cặp theo đặc điểm giống nhau, thì hai cột số liệu không độc lập với nhau. Lúc đó ta lập cột hiệu rồi làm suy luận trên một trung bình duy nhất , tức là dữ liệu ghép cặp (paired data) dùng thủ tục một mẫu. Ngược lại, nếu đem chúng vào kiểm định t hai mẫu (two-sample t-test) thì giả định độc lập bị vi phạm và sai số chuẩn bị thổi phồng. Dấu hiệu nhận biết nhanh là hai nhóm có cùng cỡ mẫu và số liệu được xếp thành từng cặp có ý nghĩa.
Khoảng tin cậy chứa 0 không chứng minh hai trung bình bằng nhau.
Nó chỉ cho thấy dữ liệu chưa đủ bằng chứng để khẳng định có khác biệt, và một khoảng như vẫn tương thích với nhiều mức chênh lệch khác không. Vì vậy câu kết luận đúng phải viết theo kiểu "không có bằng chứng thuyết phục rằng hai trung bình khác nhau", chứ không phải "hai trung bình như nhau". Ngược lại, khi cả khoảng nằm về một phía của 0, bạn được phép nói rõ nhóm nào lớn hơn và lớn hơn khoảng bao nhiêu. Giám khảo chấm rất chặt chỗ này vì nó thể hiện học sinh có hiểu bản chất suy luận hay không.
Bậc tự do của hiệu hai trung bình không mặc định là .
Công thức đó chỉ đúng cho thủ tục gộp phương sai, vốn đòi hỏi giả định hai tổng thể có cùng độ lệch chuẩn — một giả định hiếm khi kiểm tra được trong đề thi. Lựa chọn an toàn là để máy tính dùng xấp xỉ Welch với tùy chọn Pooled: No, và bậc tự do (degrees of freedom) khi đó thường là một số lẻ như . Nếu phải tra bảng bằng tay, bạn dùng và ghi rõ đây là cách xấp xỉ thận trọng. Chọn sai bậc tự do làm giá trị tới hạn lệch đi và kéo theo cả khoảng tin cậy lẫn p-value sai.
Định nghĩa và nêu rõ thứ tự trừ trước khi tính bất cứ thứ gì.
Bài chấm yêu cầu tham số phải gắn với ngữ cảnh, nên hãy viết hẳn ra rằng là trung bình của tổng thể nào, đơn vị gì, rồi mới đặt . Thứ tự trừ quyết định dấu của kết quả: cùng một dữ liệu, và đều đúng nhưng câu kết luận phải khớp với chiều bạn đã chọn. Học sinh hay đổi chiều giữa chừng rồi diễn giải ngược, và đó là lỗi mất điểm phần kết luận.
Kiểm điều kiện riêng cho từng mẫu, đừng gộp chung một câu.
Ba điều kiện cần nêu là lấy mẫu ngẫu nhiên hoặc phân nhóm ngẫu nhiên, mỗi mẫu không quá tổng thể tương ứng, và mỗi mẫu đủ lớn hoặc có dạng phân bố không lệch mạnh. Với cỡ mẫu nhỏ, bạn phải nhắc tới đồ thị hộp hay biểu đồ chấm của cả hai nhóm và nói rằng không thấy dấu hiệu lệch rõ hay giá trị ngoại lai (outlier). Viết "n lớn nên dùng được" mà không tách hai nhóm thường chỉ được tính một phần điểm.
Chép kết quả máy tính thì vẫn phải ghi tên thủ tục, thống kê, bậc tự do và p-value.
Một bài chỉ có dòng "p = 0.032" bị coi là thiếu vì giám khảo không biết bạn chạy thủ tục nào với tùy chọn ra sao. Hãy viết rõ đó là kiểm định t hai mẫu không gộp phương sai, kèm , và , rồi so sánh với đã cho. Câu cuối cùng luôn phải quay về ngữ cảnh bài toán, nêu tên hai nhóm và biến đang đo, chứ không dừng ở "bác bỏ ".
Với độ tin cậy 95%, hiệu thật giữa thời gian vận động trung bình mỗi ngày của học sinh trường A và trường B nằm trong khoảng từ 1,04 đến 5,56 phút. Vì cả khoảng này nằm bên phải số 0, dữ liệu cung cấp bằng chứng thuyết phục cho thấy học sinh trường A vận động nhiều hơn học sinh trường B.
Với , và giá trị p , ta bác bỏ giả thuyết không. Dữ liệu cung cấp bằng chứng thuyết phục rằng phương pháp dạy mới làm tăng điểm trung bình bài kiểm tra cuối kỳ so với phương pháp truyền thống.
Quiz câu thật từ ngân hàng đề
Vài câu thật gắn đúng khái niệm này, chấm ngay kèm giải thích từng đáp án — hệ thống ghi nhớ bạn nắm tới đâu.
Biên soạn bởi DucklingStudy, bản quyền thuộc DucklingStudy. Xuất bản .