AP Statistics

trung bình mẫu

sample mean

Còn gọi: sample mean · x̄

Trung bình mẫu là số trung bình cộng của các giá trị quan sát trong một mẫu, dùng để ước lượng trung bình tổng thể chưa biết.

Trung bình mẫu là con số thu được khi cộng tất cả giá trị quan sát trong một mẫu rồi chia cho cỡ mẫu, được tính bằng công thức

xˉ=1ni=1nxi\bar{x} = \frac{1}{n}\sum_{i=1}^{n} x_i

trong đó xix_i là giá trị quan sát thứ ii, còn nn là số quan sát trong mẫu. Khác với trung bình tổng thể μ\mu — một hằng số cố định nhưng thường không thể biết được vì không ai đo hết cả tổng thể — trung bình mẫu xˉ\bar{x} là một con số tính được ngay từ dữ liệu thu thập. Do đó, xˉ\bar{x} đóng vai trò làm ước lượng điểm (point estimate) cho μ\mu.

Vì vậy, xˉ\bar{x} không phải một số cố định duy nhất mà thay đổi tùy theo mẫu nào được rút ra: nếu ta lặp lại việc lấy mẫu ngẫu nhiên cỡ nn từ cùng một tổng thể rồi tính xˉ\bar{x} cho mỗi lần, tập hợp các giá trị xˉ\bar{x} đó tạo thành một phân phối riêng gọi là phân phối mẫu của trung bình mẫu. Nhờ định lý giới hạn trung tâm (central limit theorem), phân phối này tiến gần đến phân phối chuẩn khi nn đủ lớn, bất kể hình dạng phân phối gốc của tổng thể ra sao, nên độ lệch chuẩn của nó — gọi là sai số chuẩn (standard error) — bằng σ/n\sigma/\sqrt{n}.

Ngược lại, về mặt lý thuyết, trung bình mẫu còn là một ước lượng không chệch (unbiased estimator) của μ\mu: giá trị kỳ vọng của nó đúng bằng trung bình tổng thể, nên càng lấy mẫu lớn thì xˉ\bar{x} càng có xu hướng nằm sát μ\mu. Chính vì xˉ\bar{x} dao động quanh μ\mu theo quy luật có thể mô tả bằng phân phối chuẩn, người ta mới xây dựng được khoảng tin cậy và kiểm định giả thuyết cho trung bình tổng thể dựa trên xˉ\bar{x} đo được từ một mẫu duy nhất.

Ký hiệuxˉ\bar{x}, μ\mu

Trực giác: Giống như nếm vài thìa canh để đoán vị của cả nồi: thìa canh đó chính là xˉ\bar{x}, còn vị thật của cả nồi là μ\mu.

Công thức

xˉ=i=1nxin\bar{x}=\htmlClass{fp-1}{\frac{\htmlClass{fp-0}{\sum_{i=1}^n x_i}}{n}}

dùng khi có một tập dữ liệu định lượng lấy từ mẫu và cần một con số tóm tắt xu hướng trung tâm của mẫu đó, thường là bước đầu tiên trước khi suy luận về trung bình tổng thể.

Trong đó

xˉ\bar{x}trung bình mẫu, tức trung bình cộng của các giá trị quan sát đượcxix_igiá trị quan sát thứ ii trong mẫunncỡ mẫu, tức số quan sát trong mẫu

Khái niệm này sinh ra từ đâu

thế kỷ 18Carl Friedrich GaussAl-KhwarizmiKarl PearsonW. F. R. WeldonWalter ShewhartW. Edwards Deming

Phép lấy trung bình cộng đã có từ các nhà thiên văn Babylon khoảng 2000 TCN, nhưng nền tảng xác suất cho trung bình mẫu chỉ được đặt vào thế kỷ 18 với Carl Friedrich Gauss; riêng cách nói "mẫu" đối lập với "tổng thể" thì đến năm 1903 mới được Karl Pearson dùng theo nghĩa hiện đại.

Bài toán gốc rất cụ thể: nhiều lần đo cùng một đại lượng lại cho nhiều con số khác nhau, vậy phải lấy con số nào làm đại diện. Các nhà thiên văn Babylon đã lấy trung bình để dự đoán vị trí hành tinh, còn Al-Khwarizmi đưa ra cách tính hệ thống theo hệ thập phân. Đến Gauss, trung bình cộng mới có chỗ dựa lý thuyết xác suất và trở thành công cụ trung tâm của thống kê. Sang đầu thế kỷ 20, nhu cầu kiểm soát chất lượng (quality control) trong công nghiệp khiến đại lượng này được dùng hằng ngày: Walter Shewhart và W. Edwards Deming xây dựng quy trình cải tiến sản xuất dựa trên các giá trị trung bình tính từ những mẻ hàng lấy ra kiểm tra.

Vì sao mang đúng cái tên này? Tên gọi gồm hai phần, và phần đáng chú ý nằm ở chữ "mẫu" chứ không ở chữ "trung bình". Bản thân trung bình cộng đã quen thuộc từ lâu, nhưng việc tách bạch giá trị tính được trên một nhóm quan sát với giá trị thật của toàn bộ đám đông thì muộn hơn nhiều: nhà động vật học W. F. R. Weldon dùng chữ "sample" cho các tập quan sát từ năm 1892, và cách đặt "sample" đối lập với tổng thể (population) được ghi nhận ở Karl Pearson năm 1903, khi ông viết rằng nếu lấy được trọn tổng thể thì ta đã có ngay các hằng số thống kê của nó, song trên thực tế ta chỉ lấy được một mẫu. Chính câu đó giải thích vì sao phải gắn thêm chữ "mẫu": nó nhắc rằng xˉ\bar{x} là con số tính từ phần dữ liệu ta có trong tay, không phải giá trị thật của tổng thể. Cũng vì thế mà lý thuyết về phân phối của trung bình mẫu, trong đó có định lý giới hạn trung tâm (central limit theorem), mới trở thành trọng tâm của thống kê suy diễn.

Thử nghiệm tương tác

Rút một mẫu, nhìn x̄ rơi lệch; tăng n rồi rút lại — đám x̄ co quanh μ

Rút một mẫu, nhìn x̄ rơi lệch; tăng n rồi rút lại — đám x̄ co quanh μ

Kéo tham số, thấy khái niệm chuyển động — mở khoá bằng tài khoản 0đ.

Tạo tài khoản miễn phí

Hay hiểu sai

Giả thuyết phải viết về μ\mu, không bao giờ viết về xˉ\bar{x}.

Cỡ mẫu lớn không làm trung bình mẫu lớn hơn — nó chỉ làm bớt dao động.

Giá trị ngoại lai (outlier) trong hộp không tự động phá điều kiện chuẩn.

Sai số chuẩn (standard error) của trung bình mẫu không phải độ lệch chuẩn của dữ liệu.

Mẹo phòng thi

Trước khi viết giả thuyết, hãy hỏi "tham số của tôi là gì" và định nghĩa nó bằng lời.

Khi kiểm tra điều kiện, phải viết ra cỡ mẫu cụ thể chứ đừng chỉ nói "thỏa CLT".

Nhận dạng quy trình bằng hai câu hỏi: mấy nhóm và biến thuộc loại nào.

Tần suất trong đề AP StatisticsThường xuyên

Ví dụ có lời giải

1Ví dụ 1/2
Một con xúc xắc cân đối sáu mặt, các mặt ghi số từ 1 đến 6, được gieo tổng cộng 15 lần. Gọi xˉ1\bar{x}_1 là trung bình của 10 lần gieo đầu tiên và xˉ2\bar{x}_2 là trung bình của 5 lần gieo còn lại. Các lần gieo là độc lập với nhau.
  1. aTìm trung bình và độ lệch chuẩn của phân bố mẫu (sampling distribution) của xˉ1\bar{x}_1.
  2. bTìm trung bình μ(xˉ1xˉ2)\mu_{(\bar{x}_1-\bar{x}_2)} và độ lệch chuẩn σ(xˉ1xˉ2)\sigma_{(\bar{x}_1-\bar{x}_2)} của phân bố mẫu của hiệu hai trung bình mẫu.
1Bước 1: Trước hết phải mô tả tổng thể, tức là kết quả của một lần gieo. Vì sáu mặt đồng khả năng nên μ=1+2++66=3,5\mu=\frac{1+2+\cdots+6}{6}=3{,}5E(X2)=1+4+9+16+25+366=916E(X^2)=\frac{1+4+9+16+25+36}{6}=\frac{91}{6}. Do đó σ2=9163,52=35122,9167\sigma^2=\frac{91}{6}-3{,}5^2=\frac{35}{12}\approx 2{,}9167σ=35/121,708\sigma=\sqrt{35/12}\approx 1{,}708. Hai số này là điểm xuất phát cho mọi tính toán phía sau.
2Bước 2: Với mẫu gồm nn quan sát độc lập, trung bình mẫu luôn có μxˉ=μ\mu_{\bar{x}}=\muσxˉ=σn\sigma_{\bar{x}}=\dfrac{\sigma}{\sqrt{n}}. Công thức thứ nhất nói rằng trung bình mẫu là một ước lượng không chệch (unbiased estimator) của trung bình tổng thể, còn công thức thứ hai nói rằng mẫu càng lớn thì các giá trị xˉ\bar{x} càng ép sát về μ\mu. Áp dụng cho n=10n=10: μxˉ1=3,5\mu_{\bar{x}_1}=3{,}5σxˉ1=1,708100,540\sigma_{\bar{x}_1}=\dfrac{1{,}708}{\sqrt{10}}\approx 0{,}540.
3Bước 3: Với 5 lần gieo còn lại, cùng lập luận cho μxˉ2=3,5\mu_{\bar{x}_2}=3{,}5σxˉ2=1,70850,764\sigma_{\bar{x}_2}=\dfrac{1{,}708}{\sqrt{5}}\approx 0{,}764. Vì trung bình của hiệu bằng hiệu các trung bình nên μ(xˉ1xˉ2)=3,53,5=0\mu_{(\bar{x}_1-\bar{x}_2)}=3{,}5-3{,}5=0. Kết quả bằng 0 là điều hợp lý: hai nhóm cùng được sinh ra từ một tổng thể, nên về lâu dài không nhóm nào có xu hướng lớn hơn nhóm nào.
4Bước 4: Độ lệch chuẩn thì không được trừ mà phải cộng phương sai, vì cả hai nguồn biến thiên đều làm hiệu số dao động thêm. Do hai nhóm độc lập, σ(xˉ1xˉ2)=σ210+σ25=0,2917+0,5833=0,8750,936.\sigma_{(\bar{x}_1-\bar{x}_2)}=\sqrt{\frac{\sigma^2}{10}+\frac{\sigma^2}{5}}=\sqrt{0{,}2917+0{,}5833}=\sqrt{0{,}875}\approx 0{,}936. Con số này cho biết hiệu hai trung bình mẫu thường lệch khỏi 0 khoảng 0,94 đơn vị.

Trung bình của 10 lần gieo đầu có phân bố mẫu với trung bình 3,5 và độ lệch chuẩn khoảng 0,540. Hiệu xˉ1xˉ2\bar{x}_1-\bar{x}_2μ(xˉ1xˉ2)=0\mu_{(\bar{x}_1-\bar{x}_2)}=0σ(xˉ1xˉ2)0,936\sigma_{(\bar{x}_1-\bar{x}_2)}\approx 0{,}936: trung bình của hai nhóm gieo cùng xoay quanh 3,5, nên hiệu của chúng dao động quanh 0 chứ không lệch hẳn về phía nào.

2Ví dụ 2/2
Ở một trường đại học, tỉ lệ phần trăm thời gian ôn tập rơi vào 24 giờ trước kỳ thi cuối kỳ có phân bố xấp xỉ chuẩn với trung bình 44 và độ lệch chuẩn 21. Một mẫu ngẫu nhiên gồm 100 sinh viên được chọn từ tổng thể này và người ta tính trung bình mẫu xˉ\bar{x} của 100 giá trị đó.
  1. aMô tả hình dạng, trung bình và độ lệch chuẩn của phân bố mẫu của xˉ\bar{x}.
  2. bTính xác suất để trung bình mẫu lớn hơn 48.
  3. cNếu cỡ mẫu chỉ là 10 thay vì 100 thì xác suất ở câu (b) thay đổi thế nào?
1Bước 1: Vì tổng thể đã xấp xỉ chuẩn nên phân bố mẫu của trung bình mẫu cũng xấp xỉ chuẩn với mọi cỡ mẫu; ta không cần viện đến định lý giới hạn trung tâm (central limit theorem) như khi tổng thể lệch mạnh. Mẫu ngẫu nhiên và 100 sinh viên chắc chắn nhỏ hơn 10% số sinh viên của trường, nên điều kiện độc lập được thỏa. Khi đó μxˉ=44\mu_{\bar{x}}=44σxˉ=21100=2,1\sigma_{\bar{x}}=\dfrac{21}{\sqrt{100}}=2{,}1, tức là sai số chuẩn (standard error) chỉ bằng một phần mười độ lệch chuẩn của từng cá nhân.
2Bước 2: Chuyển giá trị 48 sang thang chuẩn hóa: z=48442,11,90z=\dfrac{48-44}{2{,}1}\approx 1{,}90. Tra bảng chuẩn, P(Z>1,90)0,028P(Z>1{,}90)\approx 0{,}028. Vậy chỉ khoảng 2,8% số mẫu cỡ 100 cho trung bình vượt quá 48, dù trong tổng thể có rất nhiều sinh viên riêng lẻ vượt mốc này.
3Bước 3: Với n=10n=10, trung bình của phân bố mẫu vẫn là 44 nhưng σxˉ=21106,64\sigma_{\bar{x}}=\dfrac{21}{\sqrt{10}}\approx 6{,}64, lớn hơn hẳn. Khi đó z=48446,640,60z=\dfrac{48-44}{6{,}64}\approx 0{,}60P(Z>0,60)0,273P(Z>0{,}60)\approx 0{,}273. Xác suất tăng gần mười lần chỉ vì mẫu nhỏ làm phân bố mẫu bè rộng ra.
4Bước 4: Hai kết quả trên minh họa nguyên tắc cốt lõi của suy luận thống kê: cỡ mẫu không làm dịch tâm mà chỉ làm hẹp hoặc nới độ rộng của phân bố trung bình mẫu. Nhờ đó, mẫu lớn khiến những sai lệch cỡ 4 đơn vị trở nên hiếm, và ta có cơ sở để coi một xˉ\bar{x} xa μ\mu là bằng chứng đáng kể chứ không phải may rủi. Ngược lại, với mẫu nhỏ thì một chênh lệch tương tự hoàn toàn có thể chỉ do biến thiên ngẫu nhiên.

Với n=100n=100, phân bố mẫu của xˉ\bar{x} xấp xỉ chuẩn, tâm tại 44 và sai số chuẩn 2,1; xác suất trung bình mẫu vượt 48 chỉ khoảng 0,028. Với n=10n=10, tâm vẫn là 44 nhưng sai số chuẩn tăng lên khoảng 6,64 nên xác suất đó tăng lên khoảng 0,273 — mẫu càng nhỏ, trung bình mẫu càng dễ lệch xa giá trị thật của tổng thể.

Bạn nắm chắc chưa?

Quiz câu thật từ ngân hàng đề

Vài câu thật gắn đúng khái niệm này, chấm ngay kèm giải thích từng đáp án — hệ thống ghi nhớ bạn nắm tới đâu.

Tạo tài khoản miễn phí

Học tiếp từ đây

Mục tiêu và lộ trình unit xem miễn phí — làm bài tập và lưu tiến độ cần tài khoản 0đ.

Hay nhầm với

Khác nhau ở đâuTrung bình mẫu là một thống kê tính được từ dữ liệu và thay đổi theo từng mẫu. Tham số là con số cố định mô tả toàn bộ tổng thể và thường không biết được.
Hay nhầm khiKhi đề hỏi ký hiệu nào đại diện cho đại lượng cần ước lượng, thí sinh hay viết nhầm x-ngang thay cho mu trong giả thuyết.
Khác nhau ở đâuTrung bình là công thức lấy tổng chia cho số giá trị, áp dụng cho bất kỳ tập số nào. Trung bình mẫu là giá trị trung bình đó khi tập số là một mẫu rút ra từ tổng thể.
Hay nhầm khiTrong câu suy luận, nhiều bài nhầm giữa trung bình của một tập dữ liệu bất kỳ và trung bình mẫu dùng để ước lượng tổng thể.

Cùng chủ đề

Nguồn tham khảo

  1. [1]Barron_AP_Stat_2026. tr. 13, 23, 38.

Biên soạn bởi DucklingStudy, bản quyền thuộc DucklingStudy. Xuất bản .