AP Statistics
distribution
Còn gọi: distribution
Phân phối của một biến là cách các giá trị của biến đó xuất hiện và trải ra trong tập dữ liệu, cho biết giá trị nào thường gặp, giá trị nào hiếm gặp.
Khi thu thập số liệu về một biến, câu hỏi đầu tiên không phải là giá trị trung bình bằng bao nhiêu mà là các giá trị đó sắp xếp ra sao. Phân phối (distribution) trả lời đúng câu hỏi này: nó cho biết mỗi giá trị hay mỗi nhóm giá trị của biến chiếm bao nhiêu phần trong tổng thể dữ liệu. Với một nhóm giá trị có tần số trên tổng số quan sát , tần số tương đối được tính bằng , và toàn bộ các tỉ lệ này ghép lại chính là bức tranh phân phối của biến.
Vì vậy, để mô tả một phân phối cho đầy đủ, người ta thường nhìn vào ba khía cạnh: hình dạng (đối xứng, lệch trái hay lệch phải), tâm điểm nơi dữ liệu tập trung nhiều nhất, và độ trải rộng của các giá trị quanh tâm đó. Nếu có những điểm nằm tách hẳn ra xa phần còn lại, đó là giá trị ngoại lai (outlier), và sự xuất hiện của chúng thường làm lệch cả hình dạng lẫn tâm điểm khi mô tả phân phối. Do đó, đọc một phân phối không chỉ là đọc con số mà còn là đọc câu chuyện đằng sau cách dữ liệu phân bố.
Ngược lại, cách trình bày phân phối tùy thuộc vào loại biến đang xét. Với biến phân loại, phân phối thường được thể hiện qua bảng tần số hoặc biểu đồ cột, mỗi cột ứng với một danh mục. Với biến định lượng, phân phối lại được vẽ bằng biểu đồ tần số (histogram), biểu đồ chấm (dotplot) hay biểu đồ thân lá (stemplot), vì lúc này các giá trị số cần được nhóm lại trước khi đếm tần số. Ngoài phân phối thực nghiệm rút ra từ dữ liệu quan sát được, thống kê còn dùng các phân phối lý thuyết như phân phối chuẩn hay phân phối nhị thức để xấp xỉ và dự đoán hành vi của biến trong những tình huống tổng quát hơn.
Trực giác: Giống như một tấm bản đồ dân cư cho biết dân số dồn đông ở khu vực nào và thưa thớt ở khu vực nào, phân phối cho biết dữ liệu 'tụ' quanh giá trị nào và 'loãng' ở đâu.
1733Abraham de MoivrePierre-Simon LaplaceCarl Friedrich GaussKarl Pearson
Thế kỷ 17 và 18 là thời kỳ các nhà toán học châu Âu bị cuốn vào những câu hỏi rất đời thường: cơ hội thắng một ván bạc là bao nhiêu, bao nhiêu người sinh ra sẽ còn sống đến tuổi sáu mươi. Pascal và Fermat dựng nền lý thuyết xác suất năm 1654, Graunt lập bảng tử vong năm 1662, còn de Moivre vừa nghiên cứu thống kê tử vong vừa quan tâm đến cờ bạc. Năm 1733, trong lúc tìm cách tính nhanh những tổng nhị thức khổng lồ, ông gặp một đường cong hình chuông mô tả toàn bộ cách các kết quả phân bố quanh giá trị trung tâm. Từ đó, việc mô tả một biến không còn là kể vài con số rời rạc mà là nắm lấy cả hình dạng phân bố của nó.
Vì sao mang đúng cái tên này? Trong gần ba trăm năm, đường cong hình chuông được gọi bằng rất nhiều tên khác nhau, và mỗi tên phản ánh một cách hiểu về vai trò của nó. Một nhóm tên xuất phát từ sai số đo đạc — quy luật sai số, quy luật tần suất của sai số — vì ban đầu người ta dùng nó để mô tả độ chệch của các phép đo thiên văn; nhóm còn lại gắn với tên người, như quy luật thứ hai của Laplace hay quy luật Gauss. Cái tên "chuẩn" thắng thế nhờ Karl Pearson: năm 1894 ông viết rằng từ nay sẽ gọi đường cong dạng ấy là đường cong chuẩn (normal curve), và việc ông dùng nhất quán thuật ngữ này trong các công trình có sức ảnh hưởng lớn đã khiến cả giới thống kê theo theo. Về sau chính Pearson dường như tưởng mình là người đặt ra nó, dù thực tế ông chỉ là người phổ biến. Có hai điều thú vị đi kèm. Thứ nhất, một chủ đề xuyên suốt trong nghiên cứu của Pearson lại là dữ liệu thực tế thường không tuân theo đường cong "chuẩn" ấy — cái tên gợi ý sự bình thường, nhưng bản thân người đặt tên biết rõ nó không phải lúc nào cũng bình thường. Thứ hai, việc phân phối này chưa bao giờ được mang tên de Moivre chính là ví dụ mà Stigler dẫn ra cho quy luật tên gọi của ông (Stigler's law of eponymy): khái niệm hầu như không bao giờ mang tên người thật sự tìm ra nó. Mảnh ghép cuối đến từ Laplace, người phát biểu định lý giới hạn trung tâm (central limit theorem) vào năm 1778 và giải thích vì sao hình chuông lại xuất hiện khắp nơi đến vậy.
Kéo độ rộng nhóm — cùng một bộ số, nhiều bức tranh, một dáng
Kéo tham số, thấy khái niệm chuyển động — mở khoá bằng tài khoản 0đ.
Phân phối của biến và phân phối mẫu của thống kê là hai thứ khác nhau.
Phân phối của biến mô tả các giá trị mà từng cá thể nhận được — chiều cao của từng đứa trẻ, tuổi thọ của từng con rùa — còn phân phối mẫu (sampling distribution) mô tả cách một đại lượng tính từ mẫu, chẳng hạn trung bình mẫu, dao động khi ta lấy mẫu đi lấy mẫu lại. Hai phân phối này có cùng tâm nhưng độ phân tán khác hẳn nhau: trung bình mẫu ổn định hơn nhiều so với từng quan trắc riêng lẻ. Khi đề hỏi "xác suất một con rùa được chọn ngẫu nhiên sống quá 120 năm" thì dùng , còn khi hỏi về trung bình của con thì phải chia cho . Đọc nhầm một chữ "mean" trong câu hỏi là sai toàn bộ phép tính.
Có giá trị ngoại lai không có nghĩa là không được dùng suy luận chuẩn.
Nhiều học sinh thấy biểu đồ hộp hiện vài chấm giá trị ngoại lai (outlier) liền kết luận điều kiện chuẩn bị vi phạm và dừng bài. Thực ra điều kiện cần kiểm tra là phân phối mẫu của trung bình có xấp xỉ chuẩn hay không, mà theo định lý giới hạn trung tâm (central limit theorem), cỡ mẫu từ trở lên đã đủ để xấp xỉ này chấp nhận được dù dữ liệu gốc lệch hay có điểm lạ. Với hai mẫu cỡ và , câu trả lời đúng là "có, điều kiện thỏa mãn", kèm lý do nêu rõ cả hai cỡ mẫu đều vượt . Ngược lại, nếu cỡ mẫu chỉ là và đồ thị cho thấy lệch rõ, lúc đó mới được nói là không phù hợp.
Phân vị là một giá trị của biến, không phải một xác suất.
Khi đề hỏi tuổi của con rùa ở phân vị thứ 90 (percentile), đáp án phải mang đơn vị năm và nằm bên phải trung bình, chứ không phải con số hay . Quy trình đúng là đi ngược: từ diện tích ở phía trái tra ra , rồi thay vào . Công thức này nói rằng giá trị cần tìm nằm cách trung bình độ lệch chuẩn (standard deviation) về phía trên. Nhầm chiều hoặc quên nhân với là hai lỗi làm mất điểm nhiều nhất ở dạng này.
Phải dịch đúng chiều bất đẳng thức từ lời văn sang xác suất.
Câu "đứa trẻ không đạt yêu cầu chiều cao tối thiểu 48 inch" nghĩa là , còn "được phép chơi" mới là ; hai đáp số cộng lại bằng nên chọn nhầm chiều thì ra ngay thay vì — và cả hai con số đó đều được cài sẵn trong các phương án trắc nghiệm. Thói quen an toàn là vẽ một đường cong chuẩn, đánh dấu trung bình ở giữa, đánh dấu ngưỡng rồi tô miền tương ứng với câu chữ của đề trước khi bấm máy. Sau khi có kết quả, hãy tự hỏi đáp số lớn hơn hay nhỏ hơn có hợp với hình đã tô không. Một hình vẽ nhỏ mất mười giây nhưng chặn được lỗi tai hại nhất của chương này.
Khi được yêu cầu mô tả một phân phối, luôn nói đủ bốn thành phần.
Giám khảo tìm hình dạng (đối xứng, lệch phải hay lệch trái), tâm (trung bình hoặc trung vị kèm con số), độ phân tán (khoảng biến thiên, độ lệch chuẩn hoặc khoảng tứ phân vị) và các điểm bất thường như giá trị ngoại lai. Thiếu một trong bốn ý là mất điểm dù ba ý kia viết hay đến mấy, và mọi con số phải đi kèm đơn vị cùng tên biến trong ngữ cảnh bài toán. Nếu đề cho hai nhóm, phải so sánh trực tiếp bằng những từ như "cao hơn", "phân tán hơn", chứ không mô tả rời rạc từng nhóm.
Viết ra ký hiệu xác suất trước khi bấm máy tính.
Trình bày cho thấy bạn đã định nghĩa biến, chuẩn hóa đúng và đọc đúng miền; dòng này ăn điểm ngay cả khi con số cuối bị sai do bấm nhầm. Ngược lại, chỉ ghi mỗi đáp số mà không có lập luận thì giám khảo không có căn cứ để cho điểm quá trình. Nhớ định nghĩa rõ là gì kèm đơn vị ở dòng đầu tiên.
Kiểm tra điều kiện phải viết thành câu có dẫn chứng số, không chỉ gật đầu.
Thay vì ghi "điều kiện thỏa mãn", hãy viết rõ mẫu được chọn ngẫu nhiên và độc lập, cỡ mẫu và đều lớn hơn nên phân phối của hiệu hai trung bình mẫu xấp xỉ chuẩn. Ở câu hỏi dạng "Is it appropriate…", đáp án luôn gồm hai phần là kết luận và lý do; trả lời "có" mà không nêu lý do chỉ được nửa điểm. Khi cỡ mẫu nhỏ, thay vào đó hãy viện dẫn đồ thị đã cho để lập luận rằng tổng thể gốc có thể xem là xấp xỉ chuẩn hay không.
Phân phối thời gian đi học của 15 học sinh lệch phải, có tâm khoảng 10 phút và phút, kèm một giá trị ngoại lai ở 40 phút (vì ). Do phân phối lệch và có ngoại lai, nên báo cáo trung vị 10 phút cùng thay vì trung bình 12.4 phút và độ lệch chuẩn (standard deviation).
Ở phân vị thứ 90 của phân phối tuổi thọ, con rùa sống khoảng 119 năm. Với mẫu ngẫu nhiên 25 con, tuổi thọ trung bình mẫu có phân phối xấp xỉ chuẩn tâm 100 năm và độ lệch chuẩn 3 năm, nên xác suất mẫu đó cho trung bình vượt quá 105 năm chỉ khoảng 0.048 — hiếm hơn nhiều so với xác suất một con rùa đơn lẻ sống quá 105 năm.
Quiz câu thật từ ngân hàng đề
Vài câu thật gắn đúng khái niệm này, chấm ngay kèm giải thích từng đáp án — hệ thống ghi nhớ bạn nắm tới đâu.
Biên soạn bởi DucklingStudy, bản quyền thuộc DucklingStudy. Xuất bản .