AP Statistics

hiệu hai trung bình

difference of two means

Còn gọi: hiệu hai trung bình tổng thể · difference in population means · difference of two means

Hiệu hai trung bình là tham số μ1 − μ2 đo mức chênh lệch trung bình giữa hai tổng thể định lượng độc lập, được ước lượng bằng hiệu hai trung bình mẫu.

Khi cần so sánh hai tổng thể định lượng — chẳng hạn tuổi nghỉ hưu dự kiến của giáo sư đại học và của cảnh sát — người ta không hỏi từng trung bình riêng lẻ mà hỏi chúng lệch nhau bao nhiêu. Vì vậy, tham số (parameter) cần suy luận khi đó là hiệu hai trung bình tổng thể μ1μ2\mu_1-\mu_2, và giá trị ước lượng tự nhiên của nó lấy từ dữ liệu (data) là xˉ1xˉ2\bar{x}_1-\bar{x}_2, hiệu của hai trung bình mẫu thu được từ hai mẫu ngẫu nhiên (random sample) độc lập.

Do xˉ1\bar{x}_1xˉ2\bar{x}_2 đến từ hai mẫu tách biệt, phân phối mẫu của hiệu xˉ1xˉ2\bar{x}_1-\bar{x}_2 có sai số chuẩn cộng gộp từ cả hai phía theo công thức SE=s12n1+s22n2SE=\sqrt{\dfrac{s_1^2}{n_1}+\dfrac{s_2^2}{n_2}} trong đó s1,s2s_1, s_2 là độ lệch chuẩn mẫu và n1,n2n_1, n_2 là cỡ mẫu của từng nhóm. Do phương sai tổng thể thường không biết, thống kê chuẩn hoá do đó dùng phân phối t với số bậc tự do (degrees of freedom) tính theo công thức Welch, chứ không dùng phân phối chuẩn như khi biết σ\sigma.

Hiệu hai trung bình là nền tảng cho cả hai loại suy luận thống kê: khoảng tin cậy ước lượng μ1μ2\mu_1-\mu_2 nằm trong một khoảng giá trị hợp lý, còn kiểm định giả thuyết (hypothesis testing) kiểm tra xem hiệu này có khác 0 một cách có ý nghĩa hay không. Để áp dụng đúng, hai mẫu phải độc lập với nhau chứ không phải dữ liệu cặp, được chọn ngẫu nhiên, và cỡ mẫu đủ lớn hoặc tổng thể gần chuẩn để định lý giới hạn trung tâm đảm bảo tính hợp lệ của xấp xỉ t. Ngược lại, khi khoảng tin cậy của μ1μ2\mu_1-\mu_2 hoàn toàn nằm về một phía của 0, đó là bằng chứng thuyết phục rằng hai tổng thể thực sự khác trung bình.

Ký hiệu
  • μ1μ2\mu_1-\mu_2
  • ước lượng bởi xˉ1xˉ2\bar{x}_1-\bar{x}_2

Trực giác: Giống như so sánh chiều cao trung bình của hai lớp học bằng cách lấy hiệu số, hiệu hai trung bình cho biết nhóm nào cao hơn và cao hơn bao nhiêu, dựa trên hai mẫu tách biệt.

Công thức

(xˉ1xˉ2)±ts12n1+s22n2\htmlClass{fp-0}{(\bar{x}_1-\bar{x}_2)} \pm \htmlClass{fp-1}{t^*} \htmlClass{fp-2}{\sqrt{\frac{s_1^2}{n_1}+\frac{s_2^2}{n_2}}}

Dùng khi muốn ước lượng khoảng tin cậy cho hiệu hai trung bình tổng thể từ hai mẫu độc lập, mỗi mẫu có phương sai không nhất thiết bằng nhau.

Trong đó

xˉ1,xˉ2\bar{x}_1, \bar{x}_2trung bình của mẫu thứ nhất và thứ hais1,s2s_1, s_2độ lệch chuẩn của hai mẫun1,n2n_1, n_2cỡ mẫu của hai nhómtt^*giá trị tới hạn ứng với độ tin cậy đã chọn
t=(xˉ1xˉ2)(μ1μ2)0s12n1+s22n2t=\frac{\htmlClass{fp-0}{(\bar{x}_1-\bar{x}_2)-(\mu_1-\mu_2)_0}}{\htmlClass{fp-1}{\sqrt{\frac{s_1^2}{n_1}+\frac{s_2^2}{n_2}}}}

Dùng làm thống kê kiểm định trong kiểm định giả thuyết về hiệu hai trung bình tổng thể, so sánh với phân phối t.

Trong đó

(μ1μ2)0(\mu_1-\mu_2)_0giá trị hiệu hai trung bình tổng thể theo giả thuyết gốc, thường bằng 0

Khái niệm này sinh ra từ đâu

1925Ronald A. Fisher

Bài toán so sánh hai tổng thể bằng cách xét hiệu hai trung bình được định hình trong thống kê suy luận hiện đại, gắn với kiểm định t của Student cho hai tổng thể phân phối chuẩn và được Sir Ronald A. Fisher mở rộng thành phân tích phương sai (ANOVA) giới thiệu năm 1925.

Khái niệm này sinh ra từ một nhu cầu rất đời thường: người ta hiếm khi chỉ muốn biết một nhóm, mà muốn biết nhóm này có khác nhóm kia hay không. Một nhà sản xuất muốn ước lượng chênh lệch sản lượng trung bình mỗi ngày giữa hai máy; một nhà nghiên cứu y khoa muốn biết bệnh nhân dùng hai loại thuốc khác nhau đáp ứng khác nhau ra sao. Để trả lời, thống kê suy luận chuyển câu hỏi so sánh thành câu hỏi về một đại lượng duy nhất là hiệu hai trung bình tổng thể, rồi dựng khoảng tin cậy (confidence interval) và kiểm định giả thuyết (hypothesis test) quanh nó. Kiểm định t của Student được dùng cho trường hợp hai tổng thể phân phối chuẩn, và năm 1925 Fisher giới thiệu phân tích phương sai để mở rộng câu hỏi sang ba nhóm trở lên.

Vì sao mang đúng cái tên này? Tên gọi mô tả đúng thứ được đem ra tính: người ta không so sánh hai số trung bình bằng lời mà lấy chúng trừ nhau, tạo ra một đại lượng mới là μ1μ2\mu_1-\mu_2. Chính vì vậy giả thuyết không được viết thành H0:μ1μ2=0H_0:\mu_1-\mu_2=0 thay vì H0:μ1=μ2H_0:\mu_1=\mu_2 — hai cách viết tương đương, nhưng cách sau làm lộ ra rằng đối tượng suy luận thực sự là một hiệu số. Nhờ đó mọi công cụ dành cho một tham số đơn lẻ đều dùng lại được, kể cả sai số chuẩn (standard error) của hiệu, lấy từ lý thuyết xác suất: SExˉ1xˉ2=s12n1+s22n2SE_{\bar{x}_1-\bar{x}_2}=\sqrt{\frac{s_1^2}{n_1}+\frac{s_2^2}{n_2}} Công thức này nói rằng độ dao động của hiệu hai trung bình mẫu được gộp từ độ dao động của từng trung bình mẫu, cộng theo bình phương chứ không cộng thẳng. Còn chữ "thống kê" trong tên ngành thì có gốc từ tiếng Latin "status", nghĩa là "nhà nước" — dấu vết của thời mà dữ liệu chủ yếu phục vụ việc cai trị.

Hay hiểu sai

Không được cộng thẳng hai độ lệch chuẩn khi tính sai số chuẩn.

Dữ liệu ghép cặp phải xử lý như một mẫu hiệu, không phải hai mẫu độc lập.

Khoảng tin cậy chứa 0 không chứng minh hai trung bình bằng nhau.

Bậc tự do của hiệu hai trung bình không mặc định là n1+n22n_1+n_2-2.

Mẹo phòng thi

Định nghĩa μ1, μ2\mu_1,\ \mu_2 và nêu rõ thứ tự trừ trước khi tính bất cứ thứ gì.

Kiểm điều kiện riêng cho từng mẫu, đừng gộp chung một câu.

Chép kết quả máy tính thì vẫn phải ghi tên thủ tục, thống kê, bậc tự do và p-value.

Tần suất trong đề AP StatisticsThường xuyên

Ví dụ có lời giải

1Ví dụ 1/2
Một nhà nghiên cứu muốn so sánh thời gian vận động mỗi ngày của học sinh hai trường trung học trong cùng một thành phố. Ông chọn ngẫu nhiên độc lập 40 học sinh trường A và 35 học sinh trường B, rồi ghi lại số phút vận động trung bình mỗi ngày trong một tuần. Mẫu trường A cho trung bình xˉA=27,4\bar{x}_A = 27{,}4 phút với độ lệch chuẩn sA=5,2s_A = 5{,}2 phút; mẫu trường B cho xˉB=24,1\bar{x}_B = 24{,}1 phút với sB=4,6s_B = 4{,}6 phút. Mỗi trường có hơn 1200 học sinh, và đồ thị hộp của hai mẫu đều không cho thấy giá trị ngoại lai (outlier) hay độ lệch mạnh nào.
  1. aHãy kiểm tra các điều kiện và lập khoảng tin cậy 95% cho hiệu hai trung bình μAμB\mu_A - \mu_B.
  2. bDựa trên khoảng tin cậy vừa lập, có bằng chứng thuyết phục cho rằng học sinh trường A vận động nhiều hơn học sinh trường B hay không? Giải thích.
1Bước 1: Xác định tham số và thủ tục. Gọi μA\mu_AμB\mu_B lần lượt là thời gian vận động trung bình mỗi ngày của toàn bộ học sinh trường A và trường B; đại lượng cần ước lượng là hiệu hai trung bình μAμB\mu_A - \mu_B. Vì hai mẫu lấy độc lập và ta chỉ biết độ lệch chuẩn của mẫu chứ không biết của tổng thể, thủ tục phù hợp là khoảng tin cậy hai mẫu t (two-sample t-interval). Cần nói rõ đây là hiệu "A trừ B" để dấu của kết quả có ý nghĩa.
2Bước 2: Kiểm tra ba điều kiện. Thứ nhất, hai mẫu được chọn ngẫu nhiên và độc lập với nhau, nên chênh lệch quan sát được không bị một nhóm học sinh chung nào làm nhiễu. Thứ hai, điều kiện 10% được thỏa vì 40<0,1×120040 < 0{,}1 \times 120035<0,1×120035 < 0{,}1 \times 1200, nên việc lấy mẫu không hoàn lại vẫn coi như độc lập. Thứ ba, cả hai cỡ mẫu đều lớn (nA=4030n_A = 40 \ge 30, nB=3530n_B = 35 \ge 30) nên định lý giới hạn trung tâm (central limit theorem) bảo đảm phân bố mẫu của hiệu hai trung bình xấp xỉ chuẩn; đồ thị hộp không có giá trị ngoại lai càng củng cố điều này.
3Bước 3: Tính ước lượng điểm và sai số chuẩn. Ước lượng điểm là xˉAxˉB=27,424,1=3,3\bar{x}_A - \bar{x}_B = 27{,}4 - 24{,}1 = 3{,}3 phút. Sai số chuẩn của hiệu được tính bằng cách cộng hai phương sai đã chia cho cỡ mẫu rồi lấy căn: SE=sA2nA+sB2nB=5,2240+4,6235=0,6760+0,6046=1,28061,1316.SE = \sqrt{\frac{s_A^2}{n_A} + \frac{s_B^2}{n_B}} = \sqrt{\frac{5{,}2^2}{40} + \frac{4{,}6^2}{35}} = \sqrt{0{,}6760 + 0{,}6046} = \sqrt{1{,}2806} \approx 1{,}1316. Con số 1,13161{,}1316 cho biết hiệu hai trung bình mẫu thường dao động khoảng 1,13 phút quanh hiệu thật khi ta lặp lại việc lấy mẫu.
4Bước 4: Tìm giá trị tới hạn và biên sai số. Phần mềm máy tính (2-SampTInt) cho bậc tự do (degrees of freedom) df72,99df \approx 72{,}99, ứng với độ tin cậy 95% thì t1,993t^* \approx 1{,}993. Biên sai số là tSE=1,993×1,13162,255t^* \cdot SE = 1{,}993 \times 1{,}1316 \approx 2{,}255 phút. Nếu dùng cách bảo thủ df=min(nA,nB)1=34df = \min(n_A, n_B) - 1 = 34 thì t2,032t^* \approx 2{,}032 và biên sai số nhích lên khoảng 2,30 phút, kết luận vẫn không đổi.
5Bước 5: Ráp khoảng tin cậy. Lấy ước lượng điểm cộng trừ biên sai số: 3,3±2,2553{,}3 \pm 2{,}255, tức khoảng (1,04; 5,56)(1{,}04;\ 5{,}56). Diễn giải trong ngữ cảnh: ta tin cậy 95% rằng hiệu thật giữa thời gian vận động trung bình mỗi ngày của học sinh trường A và trường B (A trừ B) nằm trong khoảng từ 1,04 đến 5,56 phút.
6Bước 6: Trả lời ý (b). Toàn bộ khoảng (1,04; 5,56)(1{,}04;\ 5{,}56) đều lớn hơn 0, nghĩa là mọi giá trị hợp lý của μAμB\mu_A - \mu_B đều dương. Do đó có bằng chứng thuyết phục rằng học sinh trường A vận động nhiều hơn. Tuy nhiên chênh lệch có thể chỉ khoảng một phút mỗi ngày, nên tuy có ý nghĩa thống kê, khác biệt này chưa chắc đã đáng kể về mặt thực tiễn.

Với độ tin cậy 95%, hiệu thật giữa thời gian vận động trung bình mỗi ngày của học sinh trường A và trường B nằm trong khoảng từ 1,04 đến 5,56 phút. Vì cả khoảng này nằm bên phải số 0, dữ liệu cung cấp bằng chứng thuyết phục cho thấy học sinh trường A vận động nhiều hơn học sinh trường B.

2Ví dụ 2/2
Một giáo viên muốn biết phương pháp dạy mới có nâng được điểm trung bình bài kiểm tra cuối kỳ hay không. Ông chia ngẫu nhiên các lớp đăng ký thành hai nhóm độc lập: 32 học sinh học theo phương pháp mới và 30 học sinh học theo phương pháp truyền thống. Nhóm mới đạt điểm trung bình xˉ1=78,4\bar{x}_1 = 78{,}4 với độ lệch chuẩn s1=8,6s_1 = 8{,}6; nhóm truyền thống đạt xˉ2=74,1\bar{x}_2 = 74{,}1 với s2=9,3s_2 = 9{,}3. Đồ thị điểm số của cả hai nhóm đều khá đối xứng và không có giá trị bất thường. Hãy thực hiện kiểm định ý nghĩa ở mức α=0,05\alpha = 0{,}05 để xét xem phương pháp mới có cho điểm trung bình cao hơn hay không.
1Bước 1: Nêu giả thuyết. Gọi μ1\mu_1 là điểm trung bình thật của toàn bộ học sinh nếu học theo phương pháp mới và μ2\mu_2 là điểm trung bình thật nếu học theo phương pháp truyền thống. Giả thuyết không cho rằng hai phương pháp cho kết quả như nhau, còn giả thuyết đối là một phía vì câu hỏi chỉ quan tâm đến chiều "cao hơn": H0:μ1μ2=0Ha:μ1μ2>0.H_0: \mu_1 - \mu_2 = 0 \qquad H_a: \mu_1 - \mu_2 > 0. Chênh lệch quan sát 78,474,1=4,378{,}4 - 74{,}1 = 4{,}3 điểm là bằng chứng thô, việc còn lại là xem 4,3 điểm có lớn hơn mức dao động ngẫu nhiên thông thường hay không.
2Bước 2: Kiểm tra điều kiện. Hai nhóm hình thành bằng cách phân ngẫu nhiên nên chúng độc lập, và đây là một thí nghiệm ngẫu nhiên hóa chứ không phải hai mẫu lấy từ hai tổng thể riêng. Về tính chuẩn, hai cỡ mẫu n1=32n_1 = 32n2=30n_2 = 30 đều đạt ngưỡng 30, thêm nữa đồ thị điểm khá đối xứng và không có giá trị ngoại lai, nên phân bố mẫu của hiệu hai trung bình xấp xỉ chuẩn. Vì vậy có thể dùng kiểm định t hai mẫu.
3Bước 3: Tính sai số chuẩn và thống kê kiểm định. Trước hết SE=8,6232+9,3230=2,3113+2,8830=5,19432,2791.SE = \sqrt{\frac{8{,}6^2}{32} + \frac{9{,}3^2}{30}} = \sqrt{2{,}3113 + 2{,}8830} = \sqrt{5{,}1943} \approx 2{,}2791. Sau đó chia chênh lệch quan sát cho sai số chuẩn: t=(xˉ1xˉ2)0SE=4,32,27911,887.t = \frac{(\bar{x}_1 - \bar{x}_2) - 0}{SE} = \frac{4{,}3}{2{,}2791} \approx 1{,}887. Giá trị này nói rằng chênh lệch quan sát được nằm cách mốc 0 khoảng 1,89 sai số chuẩn.
4Bước 4: Tìm giá trị p. Phần mềm máy tính (2-SampTTest) cho df58,8df \approx 58{,}8, và vì giả thuyết đối là một phía nên giá trị p (p-value) là diện tích đuôi phải: P(T>1,887)0,032P(T > 1{,}887) \approx 0{,}032. Nói cách khác, nếu hai phương pháp thật sự ngang nhau thì chỉ khoảng 3,2% số lần lặp lại thí nghiệm mới cho chênh lệch từ 4,3 điểm trở lên nghiêng về phương pháp mới.
5Bước 5: So sánh và kết luận. Vì 0,032<0,050{,}032 < 0{,}05, ta bác bỏ H0H_0. Lưu ý rằng nếu giáo viên đặt trước mức α=0,01\alpha = 0{,}01 thì kết luận sẽ đảo chiều, nên việc nêu rõ mức ý nghĩa trước khi tính toán là bắt buộc. Ngoài ra, vì đây là thí nghiệm có phân ngẫu nhiên nên ta được phép nói về quan hệ nhân quả chứ không chỉ là mối liên hệ.

Với t1,887t \approx 1{,}887, df58,8df \approx 58{,}8 và giá trị p 0,032<0,05=α\approx 0{,}032 < 0{,}05 = \alpha, ta bác bỏ giả thuyết không. Dữ liệu cung cấp bằng chứng thuyết phục rằng phương pháp dạy mới làm tăng điểm trung bình bài kiểm tra cuối kỳ so với phương pháp truyền thống.

Bạn nắm chắc chưa?

Quiz câu thật từ ngân hàng đề

Vài câu thật gắn đúng khái niệm này, chấm ngay kèm giải thích từng đáp án — hệ thống ghi nhớ bạn nắm tới đâu.

Tạo tài khoản miễn phí

Học tiếp từ đây

Hay nhầm với

Khác nhau ở đâuHiệu hai trung bình so sánh hai biến định lượng và dùng phân phối t. Hiệu hai tỉ lệ so sánh hai biến phân loại và dùng phân phối z.
Hay nhầm khiĐề cho dữ liệu đếm số người trả lời "có" mà thí sinh vẫn chọn quy trình t hai mẫu.
Khác nhau ở đâuHiệu hai trung bình dùng cho hai nhóm đối tượng tách rời nhau. Cặp đôi ghép từng đối tượng rồi phân tích trung bình của các hiệu số.
Hay nhầm khiĐề đo cùng một người trước và sau xử lý nhưng thí sinh lại chạy quy trình hai mẫu độc lập.

Nguồn tham khảo

  1. [1]Barron_AP_Stat_2026. tr. 14, 399.

Biên soạn bởi DucklingStudy, bản quyền thuộc DucklingStudy. Xuất bản .