AP Statistics

phân phối (của một biến)

distribution

Còn gọi: distribution

Phân phối của một biến là cách các giá trị của biến đó xuất hiện và trải ra trong tập dữ liệu, cho biết giá trị nào thường gặp, giá trị nào hiếm gặp.

Khi thu thập số liệu về một biến, câu hỏi đầu tiên không phải là giá trị trung bình bằng bao nhiêu mà là các giá trị đó sắp xếp ra sao. Phân phối (distribution) trả lời đúng câu hỏi này: nó cho biết mỗi giá trị hay mỗi nhóm giá trị của biến chiếm bao nhiêu phần trong tổng thể dữ liệu. Với một nhóm giá trị có tần số fif_i trên tổng số quan sát nn, tần số tương đối được tính bằng fi/nf_i/n, và toàn bộ các tỉ lệ này ghép lại chính là bức tranh phân phối của biến.

Vì vậy, để mô tả một phân phối cho đầy đủ, người ta thường nhìn vào ba khía cạnh: hình dạng (đối xứng, lệch trái hay lệch phải), tâm điểm nơi dữ liệu tập trung nhiều nhất, và độ trải rộng của các giá trị quanh tâm đó. Nếu có những điểm nằm tách hẳn ra xa phần còn lại, đó là giá trị ngoại lai (outlier), và sự xuất hiện của chúng thường làm lệch cả hình dạng lẫn tâm điểm khi mô tả phân phối. Do đó, đọc một phân phối không chỉ là đọc con số mà còn là đọc câu chuyện đằng sau cách dữ liệu phân bố.

Ngược lại, cách trình bày phân phối tùy thuộc vào loại biến đang xét. Với biến phân loại, phân phối thường được thể hiện qua bảng tần số hoặc biểu đồ cột, mỗi cột ứng với một danh mục. Với biến định lượng, phân phối lại được vẽ bằng biểu đồ tần số (histogram), biểu đồ chấm (dotplot) hay biểu đồ thân lá (stemplot), vì lúc này các giá trị số cần được nhóm lại trước khi đếm tần số. Ngoài phân phối thực nghiệm rút ra từ dữ liệu quan sát được, thống kê còn dùng các phân phối lý thuyết như phân phối chuẩn hay phân phối nhị thức để xấp xỉ và dự đoán hành vi của biến trong những tình huống tổng quát hơn.

Ký hiệuf_i/n

Trực giác: Giống như một tấm bản đồ dân cư cho biết dân số dồn đông ở khu vực nào và thưa thớt ở khu vực nào, phân phối cho biết dữ liệu 'tụ' quanh giá trị nào và 'loãng' ở đâu.

Khái niệm này sinh ra từ đâu

1733Abraham de MoivrePierre-Simon LaplaceCarl Friedrich GaussKarl Pearson

Ý niệm mô tả một biến bằng cách liệt kê các giá trị có thể có cùng mức độ thường gặp của chúng hình thành dần trong lịch sử xác suất, mà cột mốc nổi bật là việc Abraham de Moivre đưa ra phân phối chuẩn năm 1733 khi tìm cách xấp xỉ các bài toán đếm trong trò chơi may rủi.

Thế kỷ 17 và 18 là thời kỳ các nhà toán học châu Âu bị cuốn vào những câu hỏi rất đời thường: cơ hội thắng một ván bạc là bao nhiêu, bao nhiêu người sinh ra sẽ còn sống đến tuổi sáu mươi. Pascal và Fermat dựng nền lý thuyết xác suất năm 1654, Graunt lập bảng tử vong năm 1662, còn de Moivre vừa nghiên cứu thống kê tử vong vừa quan tâm đến cờ bạc. Năm 1733, trong lúc tìm cách tính nhanh những tổng nhị thức khổng lồ, ông gặp một đường cong hình chuông mô tả toàn bộ cách các kết quả phân bố quanh giá trị trung tâm. Từ đó, việc mô tả một biến không còn là kể vài con số rời rạc mà là nắm lấy cả hình dạng phân bố của nó.

Vì sao mang đúng cái tên này? Trong gần ba trăm năm, đường cong hình chuông được gọi bằng rất nhiều tên khác nhau, và mỗi tên phản ánh một cách hiểu về vai trò của nó. Một nhóm tên xuất phát từ sai số đo đạc — quy luật sai số, quy luật tần suất của sai số — vì ban đầu người ta dùng nó để mô tả độ chệch của các phép đo thiên văn; nhóm còn lại gắn với tên người, như quy luật thứ hai của Laplace hay quy luật Gauss. Cái tên "chuẩn" thắng thế nhờ Karl Pearson: năm 1894 ông viết rằng từ nay sẽ gọi đường cong dạng ấy là đường cong chuẩn (normal curve), và việc ông dùng nhất quán thuật ngữ này trong các công trình có sức ảnh hưởng lớn đã khiến cả giới thống kê theo theo. Về sau chính Pearson dường như tưởng mình là người đặt ra nó, dù thực tế ông chỉ là người phổ biến. Có hai điều thú vị đi kèm. Thứ nhất, một chủ đề xuyên suốt trong nghiên cứu của Pearson lại là dữ liệu thực tế thường không tuân theo đường cong "chuẩn" ấy — cái tên gợi ý sự bình thường, nhưng bản thân người đặt tên biết rõ nó không phải lúc nào cũng bình thường. Thứ hai, việc phân phối này chưa bao giờ được mang tên de Moivre chính là ví dụ mà Stigler dẫn ra cho quy luật tên gọi của ông (Stigler's law of eponymy): khái niệm hầu như không bao giờ mang tên người thật sự tìm ra nó. Mảnh ghép cuối đến từ Laplace, người phát biểu định lý giới hạn trung tâm (central limit theorem) vào năm 1778 và giải thích vì sao hình chuông lại xuất hiện khắp nơi đến vậy.

Thử nghiệm tương tác

Kéo độ rộng nhóm — cùng một bộ số, nhiều bức tranh, một dáng

Kéo độ rộng nhóm — cùng một bộ số, nhiều bức tranh, một dáng

Kéo tham số, thấy khái niệm chuyển động — mở khoá bằng tài khoản 0đ.

Tạo tài khoản miễn phí

Hay hiểu sai

Phân phối của biến và phân phối mẫu của thống kê là hai thứ khác nhau.

Có giá trị ngoại lai không có nghĩa là không được dùng suy luận chuẩn.

Phân vị là một giá trị của biến, không phải một xác suất.

Phải dịch đúng chiều bất đẳng thức từ lời văn sang xác suất.

Mẹo phòng thi

Khi được yêu cầu mô tả một phân phối, luôn nói đủ bốn thành phần.

Viết ra ký hiệu xác suất trước khi bấm máy tính.

Kiểm tra điều kiện phải viết thành câu có dẫn chứng số, không chỉ gật đầu.

Tần suất trong đề AP StatisticsThường xuyên

Ví dụ có lời giải

1Ví dụ 1/2
Một giáo viên ghi lại thời gian (tính bằng phút) mà 15 học sinh trong lớp đi từ nhà đến trường vào buổi sáng. Số liệu sau khi sắp xếp tăng dần là: 5, 6, 7, 8, 8, 9, 10, 10, 11, 12, 13, 14, 15, 18, 40.
  1. aHãy mô tả phân phối của thời gian đi học theo bốn đặc trưng: dạng, tâm, độ phân tán và điểm bất thường.
  2. bDùng quy tắc 1.5×IQR1.5 \times IQR để kiểm tra xem giá trị 40 phút có phải là giá trị ngoại lai hay không, và cho biết nên báo cáo trung bình hay trung vị làm số đo tâm.
1Bước 1: Tính các số đo tâm. Tổng của 15 giá trị là 186186, nên trung bình là xˉ=186/15=12.4\bar{x} = 186/15 = 12.4 phút. Vì n=15n = 15 lẻ, trung vị là giá trị thứ 8 trong dãy đã sắp xếp: M=10M = 10 phút.
2Bước 2: Tính các tứ phân vị (quartiles). Nửa dưới gồm 7 giá trị 5, 6, 7, 8, 8, 9, 10 nên Q1=8Q_1 = 8; nửa trên gồm 11, 12, 13, 14, 15, 18, 40 nên Q3=14Q_3 = 14. Do đó khoảng tứ phân vị là IQR=148=6IQR = 14 - 8 = 6 phút, còn khoảng biến thiên là 405=3540 - 5 = 35 phút.
3Bước 3: Trả lời ý (a). Phân phối lệch phải vì phần lớn số liệu tụ lại trong khoảng 5–15 phút nhưng có một giá trị kéo dài tới 40 phút; dấu hiệu đi kèm là xˉ=12.4>M=10\bar{x} = 12.4 > M = 10. Tâm nằm quanh 10 phút, độ phân tán đo bằng IQR=6IQR = 6 phút, và điểm bất thường đáng chú ý là quan sát 40 phút nằm tách hẳn khỏi phần còn lại.
4Bước 4: Trả lời ý (b). Ngưỡng trên là Q3+1.5×IQR=14+1.5(6)=23Q_3 + 1.5 \times IQR = 14 + 1.5(6) = 23 và ngưỡng dưới là Q11.5×IQR=89=1Q_1 - 1.5 \times IQR = 8 - 9 = -1. Vì 40>2340 > 23, quan sát 40 phút là một giá trị ngoại lai (outlier). Trung bình bị giá trị này kéo lên nên trung vị mô tả tâm trung thực hơn.

Phân phối thời gian đi học của 15 học sinh lệch phải, có tâm khoảng 10 phút và IQR=6IQR = 6 phút, kèm một giá trị ngoại lai ở 40 phút (vì 40>2340 > 23). Do phân phối lệch và có ngoại lai, nên báo cáo trung vị 10 phút cùng IQRIQR thay vì trung bình 12.4 phút và độ lệch chuẩn (standard deviation).

2Ví dụ 2/2
Các nhà khoa học ước lượng rằng tuổi thọ của rùa khổng lồ trên quần đảo Galápagos có phân phối xấp xỉ chuẩn với trung bình μ=100\mu = 100 năm và độ lệch chuẩn σ=15\sigma = 15 năm.
  1. aTuổi của một con rùa nằm ở phân vị thứ 90 của phân phối này là bao nhiêu?
  2. bChọn ngẫu nhiên 25 con rùa. Hãy mô tả phân phối của tuổi thọ trung bình mẫu xˉ\bar{x} và tính xác suất xˉ>105\bar{x} > 105 năm.
1Bước 1: Ý (a) hỏi về phân phối của từng cá thể, nên ta dùng trực tiếp N(100,15)N(100, 15). Phân vị (percentile) thứ 90 ứng với điểm zz thỏa P(Z<z)=0.90P(Z < z) = 0.90, tra bảng chuẩn được z1.28z \approx 1.28.
2Bước 2: Đổi ngược từ zz về đơn vị năm bằng x=μ+zσx = \mu + z\sigma: x=100+1.28(15)=100+19.2119.2x = 100 + 1.28(15) = 100 + 19.2 \approx 119.2. Vậy con rùa ở phân vị thứ 90 sống khoảng 119 năm.
3Bước 3: Ý (b) hỏi về một phân phối khác: phân phối mẫu (sampling distribution) của xˉ\bar{x}. Vì tổng thể đã chuẩn nên xˉ\bar{x} cũng chuẩn với μxˉ=μ=100\mu_{\bar{x}} = \mu = 100σxˉ=σ/n=15/25=3\sigma_{\bar{x}} = \sigma/\sqrt{n} = 15/\sqrt{25} = 3. Trung tâm giữ nguyên nhưng độ phân tán co lại 5 lần, đó là điểm phân biệt hai phân phối.
4Bước 4: Chuẩn hóa giá trị 105 theo σxˉ\sigma_{\bar{x}}: z=10510031.67z = \dfrac{105 - 100}{3} \approx 1.67. Do đó P(xˉ>105)=P(Z>1.67)0.048P(\bar{x} > 105) = P(Z > 1.67) \approx 0.048.

Ở phân vị thứ 90 của phân phối tuổi thọ, con rùa sống khoảng 119 năm. Với mẫu ngẫu nhiên 25 con, tuổi thọ trung bình mẫu có phân phối xấp xỉ chuẩn tâm 100 năm và độ lệch chuẩn 3 năm, nên xác suất mẫu đó cho trung bình vượt quá 105 năm chỉ khoảng 0.048 — hiếm hơn nhiều so với xác suất một con rùa đơn lẻ sống quá 105 năm.

Bạn nắm chắc chưa?

Quiz câu thật từ ngân hàng đề

Vài câu thật gắn đúng khái niệm này, chấm ngay kèm giải thích từng đáp án — hệ thống ghi nhớ bạn nắm tới đâu.

Tạo tài khoản miễn phí

Học tiếp từ đây

Cần trướcbiếntần số
Mục tiêu và lộ trình unit xem miễn phí — làm bài tập và lưu tiến độ cần tài khoản 0đ.

Hay nhầm với

Khác nhau ở đâuPhân phối của một biến mô tả các cá thể trong tập dữ liệu. Phân phối mẫu mô tả giá trị của một thống kê qua vô số mẫu lặp lại.
Hay nhầm khiKhi đề hỏi độ phân tán giảm theo cỡ mẫu, nhiều thí sinh lại mô tả phân phối của biến gốc.
Khác nhau ở đâuPhân phối của một biến là khái niệm chung, áp dụng cho bất kỳ tập dữ liệu nào. Phân phối tổng thể là phân phối của biến đó trên toàn bộ quần thể.
Hay nhầm khiĐề cho dữ liệu một mẫu nhưng thí sinh phát biểu kết luận như thể đó là phân phối của cả tổng thể.

Cùng chủ đề

Nguồn tham khảo

  1. [1]Barron_AP_Stat_2026. tr. 11–13.

Biên soạn bởi DucklingStudy, bản quyền thuộc DucklingStudy. Xuất bản .