AP Statistics

phân phối tổng thể

population distribution

Còn gọi: population distribution

Phân phối tổng thể là cách mô tả toàn bộ giá trị của một biến trên mọi cá thể trong tổng thể, cho biết hình dạng, tâm và độ phân tán của biến đó.

Khi ta quan tâm tới một biến nào đó — chiều cao của tất cả học sinh lớp 12 trong thành phố, hay ý kiến ủng hộ của toàn bộ cử tri — thì tập hợp mọi giá trị của biến ấy trên mọi cá thể tạo thành phân phối tổng thể. Nó trả lời ba câu hỏi quen thuộc: các giá trị tụ quanh đâu, trải rộng ra sao, và dáng của chúng đối xứng hay lệch. Những con số tóm tắt phân phối này được gọi là tham số (parameter), thường ký hiệu μ\mu cho trung bình, σ\sigma cho độ lệch chuẩn (standard deviation) và pp cho tỉ lệ.

Điều làm khái niệm này quan trọng là ta gần như không bao giờ nhìn thấy nó trọn vẹn. Trong thực tế, người nghiên cứu chỉ rút ra một mẫu ngẫu nhiên gồm nn cá thể, và biểu đồ của nn giá trị đó là phân phối mẫu (sample distribution) — một bản sao còn nhiễu của bản gốc. Tuy nhiên, bản sao ấy không nhiễu mãi: cỡ mẫu càng lớn thì hình dạng của phân phối mẫu càng bám sát phân phối tổng thể, và các thống kê như xˉ\bar{x}, ss càng xấp xỉ tốt μ\mu, σ\sigma. Nhờ đó, suy luận thống kê mới có cơ sở.

Cần phân biệt rõ nó với một đối tượng thứ ba hay bị lẫn trong đề thi: phân phối của thống kê mẫu (sampling distribution), tức phân phối của xˉ\bar{x} khi ta lặp lại việc lấy mẫu vô số lần. Hai thứ này mô tả những biến động khác hẳn nhau — một bên là sự khác biệt giữa các cá thể, bên kia là sự khác biệt giữa các mẫu. Quan hệ giữa chúng được nêu bởi định lý giới hạn trung tâm (central limit theorem):

μxˉ=μ,σxˉ=σn\mu_{\bar{x}}=\mu,\qquad \sigma_{\bar{x}}=\frac{\sigma}{\sqrt{n}}

Trung bình của các trung bình mẫu đúng bằng trung bình tổng thể, còn độ phân tán thì co lại theo n\sqrt{n}. Vì vậy, dù phân phối tổng thể lệch đến đâu, với nn đủ lớn hình dạng của xˉ\bar{x} vẫn tiến về chuẩn.

Ký hiệuμ\mu, σ\sigma, pp, NN (kích thước tổng thể)
Đơn vịCùng đơn vị với biến được đo (cm, kg, điểm…); riêng tỉ lệ $p$ không có đơn vị

Trực giác: Giống như sổ ghi kích cỡ của từng hạt gạo trong cả kho tỉnh: nhìn vào đó thấy hạt cỡ trung bình bao nhiêu, to nhỏ chênh lệch ra sao, dáng phân bố lệch hay cân — đó là chân dung của cả kho, chứ không phải của một nắm bốc ra.

Khái niệm này sinh ra từ đâu

thế kỷ 17–18John GrauntEdmond HalleyAbraham de MoivrePierre-Simon LaplaceGottfried Achenwall

Ý niệm về một "tổng thể" có thể mô tả được bằng số ra đời từ nhu cầu đếm dân của các nhà nước châu Âu thế kỷ 17, khi John Graunt lập bảng tử vong đầu tiên từ sổ khai tử ở London, và chỉ hoàn chỉnh về mặt toán học vào thế kỷ 18 khi Abraham de Moivre cùng Laplace tìm ra đường cong mô tả cách các giá trị phân tán quanh trung tâm.

Các vương triều châu Âu cần biết mình cai trị bao nhiêu người, bao nhiêu người chết mỗi năm, chết vì bệnh gì — không phải vì tò mò mà vì thuế và quân dịch. Năm 1663, John Graunt công bố tập quan sát dựa trên sổ khai tử London, và trước đó ông đã dựng bảng tử vong rồi tính tuổi thọ trung bình; năm 1693 Halley làm tiếp công việc ấy, nối tỷ lệ chết với tuổi. Những bảng biểu đó chính là hình hài đầu tiên của một phân phối tổng thể: toàn bộ dân cư được sắp theo từng độ tuổi kèm tần số. Phần toán học đến sau, khi de Moivre năm 1733 tìm ra đường cong trơn mô tả dạng phân tán này.

Vì sao mang đúng cái tên này? Cái tên nghe lạ ở chỗ vì sao lại gọi là "tổng thể" — tiếng Anh dùng chữ population, tức là "dân số". Lý do nằm ở lịch sử chứ không ở toán học: ngành thống kê sinh ra từ việc nhà nước đếm dân, nên đối tượng nghiên cứu mặc định thời ấy đúng là một dân cư thật. Chính chữ "statistics" cũng mang gốc ấy: tiếng Latin status nghĩa là "tình trạng", sang Latin hậu kỳ chuyển thành "nhà nước", và Gottfried Achenwall năm 1749 đặt ra chữ Statistik trong tiếng Đức để chỉ khoa học mô tả tình hình quốc gia. Về sau, khi thống kê được dùng cho bóng đèn, hạt giống hay điểm thi, chữ population vẫn được giữ nguyên dù chẳng còn người nào trong đó — và tiếng Việt dịch thoát thành "tổng thể" để tránh hiểu lầm rằng phải là người. Chữ "phân phối" thì đến từ nhánh xác suất: nó mô tả các giá trị được rải ra sao trên trục số, như đường cong mà de Moivre gọi tên và Laplace mở rộng thành định lý giới hạn trung tâm (central limit theorem).

Thử nghiệm tương tác

Rút mẫu nhiều lần — hình tổng thể đứng yên, chỉ có mẫu nhảy

Rút mẫu nhiều lần — hình tổng thể đứng yên, chỉ có mẫu nhảy

Kéo tham số, thấy khái niệm chuyển động — mở khoá bằng tài khoản 0đ.

Tạo tài khoản miễn phí

Hay hiểu sai

Có trung bình và độ lệch chuẩn không có nghĩa là tổng thể phân phối chuẩn.

Phân phối tổng thể khác phân phối của trung bình mẫu.

Định lý giới hạn trung tâm không làm tổng thể lệch trở nên đối xứng.

Ký hiệu μ\mu, σ\sigma dành cho tổng thể; xˉ\bar{x}, ss dành cho mẫu.

Mẹo phòng thi

Gặp bảng tần số tương đối, hãy nhìn dãy số dồn về đâu trước khi tính toán.

Viết ra bằng chữ đối tượng mà bạn đang mô tả phân phối.

Trước khi dùng thủ tục suy luận, kiểm tra điều kiện chứ đừng giả định tổng thể chuẩn.

Tần suất trong đề AP StatisticsThường xuyên

Ví dụ có lời giải

1Ví dụ 1/2
Một nhà máy đóng chai ghi thể tích danh nghĩa 500 ml trên mỗi chai. Gọi YY là sai lệch thể tích thực so với 500 ml (đơn vị ml), một biến liên tục. Kiểm định viên chọn ngẫu nhiên 200 chai trong lô hàng gồm 40 000 chai và ghi lại tần số tương đối của YY theo các khoảng sau. | Khoảng | Tần số tương đối | |---|---|3y<2-3 \le y < -20,052y<1-2 \le y < -10,151y<0-1 \le y < 00,300y<10 \le y < 10,301y<21 \le y < 20,152y<32 \le y < 30,05
  1. aDựa trên bảng, hãy mô tả hình dạng và tâm của dữ liệu thu được, đồng thời ước lượng tỉ lệ chai trong cả lô hàng có sai lệch nhỏ hơn 1-1 ml.
  2. bGiải thích bảng trên mô tả phân phối nào, và nó khác phân phối tổng thể ra sao. Nếu kiểm định viên tăng cỡ mẫu từ 200 lên 2000 chai thì điều gì thay đổi, điều gì không?
1Bước 1: Trước hết cần đọc bảng cho đúng bản chất. Bảng này được lập từ 200 chai đã lấy ra, nên nó mô tả phân phối mẫu (sample distribution) — tức là sự biến thiên bên trong một mẫu cụ thể. Phân phối tổng thể là sự biến thiên của YY trên toàn bộ 40 000 chai, và ta không quan sát được nó trực tiếp; bảng chỉ là hình ảnh gần đúng của nó.
2Bước 2: Xét hình dạng: các tần số tương đối 0,05 – 0,15 – 0,30 – 0,30 – 0,15 – 0,05 lặp lại theo thứ tự ngược khi đi từ hai đầu vào giữa, nên biểu đồ đối xứng quanh y=0y=0, một đỉnh, không có giá trị ngoại lai (outlier). Lấy trung điểm mỗi nhóm làm đại diện, trung bình mẫu là yˉmip^i=0\bar{y}\approx\sum m_i\hat{p}_i = 0 ml. Công thức này lấy mỗi trung điểm mim_i nhân với trọng số là tần số tương đối p^i\hat{p}_i của nhóm đó rồi cộng lại.
3Bước 3: Đo độ phân tán bằng cùng cách trọng số: s2(miyˉ)2p^i=2[(2,5)2(0,05)+(1,5)2(0,15)+(0,5)2(0,30)]=2(0,3125+0,3375+0,075)=1,45.s^2\approx\sum (m_i-\bar{y})^2\hat{p}_i = 2\left[(2{,}5)^2(0{,}05)+(1{,}5)^2(0{,}15)+(0{,}5)^2(0{,}30)\right] = 2(0{,}3125+0{,}3375+0{,}075)=1{,}45. Vậy độ lệch chuẩn (standard deviation) của mẫu là s1,451,20s\approx\sqrt{1{,}45}\approx 1{,}20 ml. Hai con số 001,201{,}20 là thống kê mẫu, chúng ước lượng cho μ\muσ\sigma của phân phối tổng thể chứ không phải là chính μ\muσ\sigma.
4Bước 4: Tỉ lệ chai có y<1y<-1 trong mẫu là 0,05+0,15=0,200{,}05+0{,}15=0{,}20. Vì 200 chai được chọn ngẫu nhiên và chỉ chiếm 200/40000=0,5%200/40\,000=0{,}5\% lô hàng, mẫu này đại diện được, nên ta ước lượng khoảng 20%20\% số chai của cả lô có sai lệch nhỏ hơn 1-1 ml. Đây là suy luận từ mẫu ra tổng thể, kèm sai số lấy mẫu chứ không phải một con số chắc chắn.
5Bước 5: Khi tăng cỡ mẫu lên 2000 chai, phân phối tổng thể hoàn toàn không đổi: μ\muσ\sigma là hằng số của lô hàng, không phụ thuộc vào việc ta lấy bao nhiêu chai. Cái thay đổi là phân phối mẫu — với nn lớn hơn, biểu đồ tần số tương đối sẽ bám sát hình dạng thật của tổng thể hơn, và yˉ\bar{y}, ss sẽ dao động ít hơn quanh μ\mu, σ\sigma. Nói ngắn gọn, mẫu càng lớn thì bức tranh ta vẽ càng giống bản gốc, nhưng bản gốc thì đứng yên.

Dữ liệu 200 chai có dạng đối xứng một đỉnh, tâm ở yˉ0\bar{y}\approx 0 ml với s1,20s\approx 1{,}20 ml, và khoảng 20%20\% số chai trong cả lô được ước lượng là có sai lệch nhỏ hơn 1-1 ml. Bảng mô tả phân phối mẫu chứ không phải phân phối tổng thể; tăng cỡ mẫu lên 2000 chỉ làm phân phối mẫu tiến gần hơn tới phân phối tổng thể của lô hàng, còn bản thân phân phối tổng thể vẫn giữ nguyên.

2Ví dụ 2/2
Thời gian đi làm mỗi sáng của toàn bộ người lao động ở một thành phố có phân phối lệch phải mạnh, với trung bình μ=28\mu = 28 phút và độ lệch chuẩn σ=15\sigma = 15 phút. Một nhà nghiên cứu chọn ngẫu nhiên 50 người lao động trong thành phố và tính thời gian đi làm trung bình của nhóm này, gọi là xˉ\bar{x}.
  1. aPhân phối của xˉ\bar{x} có dạng gì? Nêu rõ các điều kiện đã dùng.
  2. bTính xác suất thời gian đi làm trung bình của 50 người này vượt quá 31 phút.
1Bước 1: Phải phân biệt rõ ba đối tượng trước khi tính. Phân phối tổng thể ở đây lệch phải mạnh, còn thứ câu hỏi nhắm tới là phân phối của trung bình mẫu (sampling distribution of xˉ\bar{x}) — tức sự biến thiên của xˉ\bar{x} khi ta lặp lại việc lấy mẫu 50 người vô số lần. Hai phân phối này có hình dạng khác hẳn nhau, và đó chính là điều khiến bài toán làm được.
2Bước 2: Kiểm tra điều kiện. Mẫu được chọn ngẫu nhiên nên các quan sát độc lập; 50 người chắc chắn nhỏ hơn 10%10\% số người lao động của cả một thành phố nên điều kiện 10%10\% thỏa mãn; và n=5030n = 50 \ge 30 nên theo định lý giới hạn trung tâm (central limit theorem), phân phối của xˉ\bar{x} xấp xỉ chuẩn dù tổng thể lệch phải. Lưu ý rằng định lý này chỉ nói về hình dạng, không nói gì về tâm hay độ phân tán.
3Bước 3: Tâm và độ phân tán được lấy từ chính tham số của tổng thể: μxˉ=μ=28\mu_{\bar{x}} = \mu = 28σxˉ=σn=15502,121.\sigma_{\bar{x}} = \dfrac{\sigma}{\sqrt{n}} = \dfrac{15}{\sqrt{50}} \approx 2{,}121. Công thức thứ hai cho thấy trung bình mẫu dao động hẹp hơn nhiều so với từng cá nhân: độ lệch chuẩn giảm đi 507,07\sqrt{50}\approx 7{,}07 lần. Vì vậy xˉ\bar{x} xấp xỉ N(28;2,121)N(28;\,2{,}121).
4Bước 4: Chuẩn hóa giá trị 31 phút: z=31282,1211,414.z = \dfrac{31-28}{2{,}121} \approx 1{,}414. Tra bảng chuẩn được P(Z<1,414)0,9214P(Z < 1{,}414) \approx 0{,}9214, do đó P(xˉ>31)=10,92140,079.P(\bar{x} > 31) = 1 - 0{,}9214 \approx 0{,}079. Con số này nói rằng nếu lấy mẫu 50 người thật nhiều lần, chỉ khoảng 7,9%7{,}9\% số mẫu cho trung bình trên 31 phút.
5Bước 5: Cần thấy vì sao không thể làm phép tính tương tự cho một cá nhân. Nếu hỏi xác suất một người bất kỳ đi làm quá 31 phút, ta phải dùng phân phối tổng thể vốn lệch phải, và việc chuẩn hóa rồi tra bảng chuẩn sẽ cho kết quả sai. Định lý giới hạn trung tâm chỉ cứu được trung bình mẫu, không cứu được quan sát đơn lẻ.

Vì mẫu ngẫu nhiên, thỏa điều kiện 10%10\%n=5030n = 50 \ge 30, phân phối của trung bình mẫu xấp xỉ chuẩn với tâm 28 phút và độ lệch chuẩn khoảng 2,1212{,}121 phút, bất chấp phân phối tổng thể lệch phải mạnh. Xác suất để thời gian đi làm trung bình của 50 người được chọn vượt quá 31 phút là khoảng 0,0790{,}079, tức chưa tới 8%8\%.

Bạn nắm chắc chưa?

Quiz câu thật từ ngân hàng đề

Vài câu thật gắn đúng khái niệm này, chấm ngay kèm giải thích từng đáp án — hệ thống ghi nhớ bạn nắm tới đâu.

Tạo tài khoản miễn phí

Học tiếp từ đây

Liên quantham số
Mục tiêu và lộ trình unit xem miễn phí — làm bài tập và lưu tiến độ cần tài khoản 0đ.

Hay nhầm với

phân phối mẫu (của một thống kê)sampling distribution of a statistic
Khác nhau ở đâuPhân phối tổng thể mô tả giá trị của từng cá thể trong toàn bộ tổng thể. Phân phối mẫu mô tả giá trị của một thống kê qua vô số mẫu cùng cỡ.
Hay nhầm khiKhi đề hỏi độ lệch chuẩn nào phải dùng, thí sinh hay lấy σ\sigma của tổng thể thay vì σ/n\sigma/\sqrt{n} của phân phối mẫu.
phân phối lấy mẫu của trung bình mẫusampling distribution of sample means
Khác nhau ở đâuPhân phối tổng thể có hình dạng cố định và không phụ thuộc cỡ mẫu. Phân phối lấy mẫu của trung bình mẫu hẹp dần và chuẩn dần khi cỡ mẫu tăng.
Hay nhầm khiĐề cho tổng thể lệch phải rồi hỏi xác suất cho một giá trị cá thể hay cho trung bình mẫu — hai câu dùng hai phân phối khác nhau.

Cùng chủ đề

Nguồn tham khảo

  1. [1]Barron_AP_Stat_2026. tr. 23, 63, 314.

Biên soạn bởi DucklingStudy, bản quyền thuộc DucklingStudy. Xuất bản .