AP Statistics
shape
Còn gọi: dạng phân phối

Hình dạng phân phối là dáng tổng thể của đồ thị dữ liệu: đối xứng hay lệch, một đỉnh hay nhiều đỉnh, cho biết dữ liệu dồn về đâu trên trục số.
Khi vẽ đồ thị cho một biến định lượng, người ta mô tả phân phối theo bốn khía cạnh: hình dạng, tâm, độ phân tán và những điểm bất thường. Hình dạng là khía cạnh nhìn thấy trước hết, vì nó cho biết toàn bộ khối dữ liệu dồn về đâu trên trục số. Một đồ thị cột (histogram) có thể đối xứng, khi hai nửa gương phản chiếu nhau qua tâm; có thể đều như hộp, khi mọi nhóm có tần số gần bằng nhau; hoặc có thể bị kéo lệch sang một phía. Nhờ đó, chỉ cần liếc đồ thị, ta đã đoán được tâm nằm ở đâu và dữ liệu có bóp méo hay không.
Hình dạng gắn chặt với mối quan hệ giữa hai số đo tâm. Ở phân phối đối xứng, trung bình và trung vị trùng nhau. Ngược lại, khi phân phối lệch phải — đuôi kéo dài về phía giá trị lớn — một số giá trị lớn kéo trung bình đi lên, nên , trong đó là trung vị. Lệch trái thì điều ngược xảy ra: . Vì vậy, nếu đề hỏi vì sao trung bình lớn hơn trung vị, câu trả lời thường nằm ở đuôi lệch phải của đồ thị, chứ không cần tính toán thêm.
Khi làm bài free-response, hãy mô tả hình dạng bằng ngôn ngữ không dứt khoát như "khoảng đối xứng" hay "xấp xỉ chuẩn (approximately normal)", vì dữ liệu thật hiếm khi đối xứng hoàn hảo. Khi so sánh hai phân phối, dùng câu so sánh trực tiếp thay vì hai danh sách rời rạc, và luôn nhắc bối cảnh của biến đang xét. Ngoài ra cần gọi tên các nét bất thường: giá trị ngoại lai (outlier), khoảng trống, hay cụm giá trị tách bạch. Một chi tiết hay bị bỏ quên là hình dạng không đổi dù trục dọc ghi tần số hay tần số tương đối, vì hai cách ghi chỉ khác nhau một tỉ số chung.
Trực giác: Hình dạng phân phối như dáng núi nhìn từ trên cao: núi cân đối hai bên là đối xứng, sườn nào dài ra xa là lệch về phía đó.
Lệch phải hay lệch trái được xác định bởi đuôi dài, không phải bởi chỗ dữ liệu dồn lại.
Rất nhiều học sinh nhìn thấy các cột cao nằm ở phía trái biểu đồ tần số rồi vội kết luận phân phối "lệch trái", vì trong đầu các em "lệch" nghĩa là "nghiêng về phía đông đúc". Quy ước thống kê thì ngược lại: ta gọi tên theo phía có đuôi kéo dài, nên khối dữ liệu dồn bên trái với đuôi thưa kéo sang phải là lệch phải (skewed to the right). Câu trả lời an toàn nhất trong phòng thi là viết hẳn lý do ra, theo đúng kiểu "phân phối lệch phải vì đuôi bên phải dài hơn đuôi bên trái", vì khi đã phải viết chữ "đuôi" thì tay sẽ tự kiểm tra lại mắt.
Điều kiện nói về hình dạng của phân phối mẫu, không nói gì về hình dạng dữ liệu gốc.
Khi kiểm tra và đều lớn hơn 10, ta chỉ mới kết luận được rằng phân phối mẫu của tỉ lệ mẫu (sampling distribution) xấp xỉ chuẩn. Bản thân tổng thể ở đây là biến nhị phân chỉ nhận hai giá trị, chẳng có gì "hình chuông" cả. Do đó câu "vì nên dữ liệu có phân phối chuẩn" là sai về bản chất, và giám khảo trừ điểm ngay cả khi phần tính toán phía sau đúng hết.
Biến phân loại không có hình dạng phân phối.
Với biến định tính như màu mắt hay mức phân loại tán lá, thứ tự các cột trong biểu đồ là do người vẽ tự chọn, nên chỉ cần đổi chỗ hai cột là "lệch phải" biến thành "lệch trái". Vì vậy các từ đối xứng, lệch, đơn đỉnh chỉ dùng cho biến định lượng, nơi trục ngang có thang đo thật sự và khoảng cách giữa các giá trị mang ý nghĩa. Với biến phân loại, thay vì mô tả hình dạng, hãy mô tả loại nào chiếm tỉ lệ lớn nhất và so sánh các tỉ lệ với nhau.
Mô tả phân phối mà chỉ nói hình dạng là câu trả lời thiếu, không phải câu trả lời ngắn gọn.
Đề yêu cầu "describe the distribution" luôn chờ đủ bốn thành phần: hình dạng, tâm, độ phân tán và giá trị ngoại lai (outlier). Học sinh thường viết mỗi chữ "skewed right" rồi dừng bút vì nghĩ đã trả lời trúng câu hỏi, trong khi thang chấm cần thấy cả một con số cho tâm, một con số cho độ phân tán, kèm nhận xét có hay không điểm tách biệt. Tuy nhiên, nếu đề hỏi riêng "which best describes the shape", thì lúc đó chỉ cần nói hình dạng, thêm thắt sẽ mất thời gian chứ không được thêm điểm.
Quiz câu thật từ ngân hàng đề
Vài câu thật gắn đúng khái niệm này, chấm ngay kèm giải thích từng đáp án — hệ thống ghi nhớ bạn nắm tới đâu.
Biên soạn bởi DucklingStudy, bản quyền thuộc DucklingStudy. Xuất bản .
Nặn lại đám dữ liệu — xem hình dạng đổi và hai vạch trung bình, trung vị chạy theo
Kéo tham số, thấy khái niệm chuyển động — mở khoá bằng tài khoản 0đ.
Luôn thêm chữ "xấp xỉ" khi gọi tên hình dạng của dữ liệu thật.
Không có biểu đồ tần số nào từ dữ liệu thực mà đối xứng hoàn hảo hay đều tuyệt đối, nên các cột cao gần bằng nhau trong khoảng 0,10 đến 0,12 vẫn được gọi là gần đều (approximately uniform). Trong bài viết, hãy dùng "roughly symmetric", "approximately uniform" thay vì khẳng định cứng; cách nói này vừa đúng thống kê vừa tránh bị bắt lỗi khi vài cột lệch nhau chút ít.
Câu hỏi so sánh phải có từ so sánh trong câu, không được mô tả hai phân phối rời nhau.
Viết "phân phối A lệch phải còn phân phối B gần đối xứng" thì được, nhưng viết hai câu tách biệt kiểu "A có trung vị 12. B có trung vị 9." thì mất điểm vì thiếu sự đối chiếu. Hãy tập phản xạ dùng các từ nối so sánh như "lớn hơn", "phân tán rộng hơn", "lệch mạnh hơn", và luôn gắn kèm ngữ cảnh cùng đơn vị của bài toán.
Nối hình dạng với việc chọn số đo tâm, vì đó là chỗ đề hay gài.
Khi phân phối lệch hoặc có điểm tách biệt, trung vị và khoảng tứ phân vị mô tả dữ liệu trung thực hơn trung bình và độ lệch chuẩn (standard deviation), do hai số sau bị kéo về phía đuôi. Nếu câu hỏi bắt biện luận "phân phối nào cho tỉ lệ lớn nhất vượt một ngưỡng", đừng chỉ nhìn tâm mà phải nhìn cả hướng đuôi và độ phân tán, vì phần diện tích nằm bên phải ngưỡng mới là thứ quyết định câu trả lời.
Phân phối thời gian chờ của 80 bệnh nhân có một đỉnh duy nhất ở nhóm 0–5 phút, lệch phải với đuôi kéo dài tới khoảng 30 phút, không có khoảng trống và không có giá trị nào tách hẳn ra khỏi phần còn lại. Đúng như hình dạng lệch phải gợi ý, trung bình (khoảng 9.6 phút) lớn hơn trung vị (khoảng 8.3 phút), vì một số ít bệnh nhân phải chờ rất lâu đã kéo trung bình lên trong khi trung vị hầu như không bị ảnh hưởng.
Phân phối điểm của học sinh gần đối xứng, đơn đỉnh quanh 11 điểm, không có giá trị bất thường; ngược lại, phân phối điểm của nhân viên chuyên môn lệch trái, tập trung ở vùng 15–20 điểm và có một giá trị ngoại lai thấp là 10 điểm. Nói chung, điểm của nhân viên vừa cao hơn vừa ít biến động hơn điểm của học sinh. Chính vì dồn về phía điểm cao, nhóm nhân viên đạt tỷ lệ nắm vững tài liệu khoảng 66.7%, cao hơn hẳn mức 6.7% của nhóm học sinh.