AP Statistics
skewed

Phân phối lệch là phân phối không đối xứng, trong đó phần lớn dữ liệu tập trung về một phía và một đuôi dài kéo ra phía đối diện.
Một phân phối được gọi là lệch khi biểu đồ của nó không có trục đối xứng: dữ liệu dồn về một đầu trong khi đầu kia kéo dài thành một đuôi mỏng. Chiều của đuôi quyết định tên gọi — nếu đuôi kéo về phía phải thì ta nói phân phối lệch phải, còn nếu đuôi kéo về phía trái thì phân phối lệch trái. Chính vì vậy, khi nhìn vào biểu đồ cột hay biểu đồ chấm, cần chú ý xem đuôi nằm ở phía nào chứ không phải phần thân dày nằm ở đâu.
Độ lệch ảnh hưởng trực tiếp đến mối quan hệ giữa trung bình và trung vị. Trong phân phối lệch phải, các giá trị ngoại lai (outlier) nằm ở đuôi phải kéo trung bình lên cao hơn trung vị. Ngược lại, phân phối lệch trái khiến trung bình thấp hơn trung vị vì đuôi trái giữ lại những giá trị nhỏ bất thường. Do đó, khi phân phối lệch rõ rệt, trung vị thường là thước đo trung tâm đáng tin cậy hơn trung bình.
Trên đề thi, nhận biết độ lệch từ đồ thị là kỹ năng thường gặp. Ví dụ, thời gian nằm viện thường lệch phải vì đa số bệnh nhân xuất viện sớm nhưng một số ít ở lại rất lâu, tạo ra đuôi dài bên phải. Vì vậy, khi mô tả hình dạng phân phối, cần nêu đủ bốn yếu tố: hình dạng (trong đó có lệch hay không), trung tâm, độ phân tán, và các giá trị ngoại lai nếu có.
Trực giác: Hình dung một lớp học mà hầu hết học sinh ghi 8–9 điểm nhưng vài em không ôn bài chỉ được 1–2 điểm — cái đuôi điểm thấp kéo dài sang trái chính là dấu hiệu của phân phối lệch trái.
Dùng khi cần một con số tóm tắt mức độ và hướng lệch của phân phối. sk > 0 tương ứng phân phối lệch phải (đuôi kéo về phía giá trị lớn), sk < 0 tương ứng phân phối lệch trái, sk ≈ 0 gợi ý phân phối gần đối xứng.
Trong đó
1895Karl PearsonR. Fisher
Cuối thế kỷ 19, phần lớn lý thuyết thống kê được xây dựng quanh giả định dữ liệu phân bố đối xứng quanh giá trị trung bình. Thực tế lại bướng bỉnh hơn: nhiều tập số liệu có một đuôi kéo dài hẳn về một phía, khiến các công cụ sẵn có mô tả sai bản chất của chúng. Năm 1895, Karl Pearson đưa ra khái niệm độ lệch (skewness) để đo chính mức độ mất cân xứng ấy. Sang thập niên 1920, R. Fisher phát triển các phương pháp xử lý dữ liệu không chuẩn, và đến thập niên 1960 phép biến đổi Box–Cox (Box-Cox transformation) cho phép nắn dữ liệu lệch về dạng gần đối xứng hơn. Nhờ đó, phân phối lệch dần trở thành đối tượng được nghiên cứu thay vì bị né tránh.
Lệch phải không có nghĩa là phần lớn dữ liệu nằm bên phải.
Tên gọi được đặt theo hướng của đuôi (tail), không theo chỗ dữ liệu tụ lại. Trong một phân phối lệch phải, khối dữ liệu dồn về phía các giá trị nhỏ và chỉ một số ít quan trắc lớn kéo đuôi ra xa bên phải. Vì vậy khi đề cho biểu đồ giá nhà lệch trái, kết luận đúng là đa số nhà bán với giá cao còn một nhóm nhỏ giá rất thấp kéo đuôi xuống, chứ không phải ngược lại. Hãy nhìn đuôi trước, rồi mới phát biểu về khối dữ liệu.
Trung vị nhỏ hơn trung bình trong phân phối lệch phải, không phải lớn hơn.
Trung bình bị các giá trị ở đuôi kéo theo, còn trung vị (median) chỉ quan tâm đến vị trí giữa của dãy đã sắp xếp nên đứng yên. Do đó với điểm SAT lệch phải, một nhóm nhỏ điểm rất cao đẩy trung bình lên cao hơn mức tiêu biểu của học sinh bình thường, và trung vị mô tả "học sinh trung bình" trung thực hơn. Câu trả lời được điểm phải nói rõ trung bình bị kéo về phía đuôi, chứ chỉ viết "trung vị tốt hơn" thì chưa đủ lý do. Ngược lại, nếu phân phối lệch trái thì trung bình nằm thấp hơn trung vị.
Phân phối gốc lệch không có nghĩa là phân phối mẫu của cũng lệch.
Đây là chỗ định lý giới hạn trung tâm (central limit theorem) can thiệp: khi cỡ mẫu đủ lớn, phân phối mẫu (sampling distribution) của trung bình mẫu xấp xỉ chuẩn dù tổng thể lệch mạnh. Với lấy từ tổng thể giá nhà lệch phải, ta vẫn mô tả phân phối của là xấp xỉ chuẩn với trung bình và độ lệch chuẩn . Điều không đổi là tâm: dù lớn hay nhỏ, trung bình của phân phối mẫu luôn bằng .
Cỡ mẫu nhỏ từ tổng thể lệch thì không được coi phân phối của là chuẩn.
Ngưỡng quen dùng trong lớp là ; dưới ngưỡng đó, độ lệch của tổng thể còn "dính" lại trong phân phối mẫu. Chẳng hạn lấy từ tổng thể lệch phải cho phân phối của vẫn lệch phải, tuy nhẹ hơn tổng thể gốc, nên mọi tính toán xác suất dựa trên đường cong chuẩn đều sai. Tuy nhiên, nếu bản thân tổng thể đã chuẩn thì mọi cỡ mẫu đều cho phân phối mẫu chuẩn, kể cả .
Bảng xác suất tích lũy không đọc như bảng xác suất từng giá trị.
Nhiều học sinh nhìn cột số tăng dần trong bảng tích lũy (cumulative probability) rồi vội kết luận phân phối lệch phải. Muốn biết dạng, phải lấy hiệu hai giá trị tích lũy liên tiếp để ra xác suất của từng giá trị; khi các hiệu này bằng nhau, phân phối là đều (uniform) và hoàn toàn đối xứng. Khi đó trung bình rơi đúng vào giá trị chính giữa, không hề bị kéo lệch. Vì vậy hãy đổi bảng về xác suất riêng lẻ trước khi nói bất cứ điều gì về dạng phân phối.
Quiz câu thật từ ngân hàng đề
Vài câu thật gắn đúng khái niệm này, chấm ngay kèm giải thích từng đáp án — hệ thống ghi nhớ bạn nắm tới đâu.
Biên soạn bởi DucklingStudy, bản quyền thuộc DucklingStudy. Xuất bản .
Vì sao mang đúng cái tên này? Trong tiếng Anh thường ngày, "skew" ban đầu mang nghĩa xiên, nghiêng, chệch khỏi phương thẳng (oblique). Khi các nhà thống kê cần một chữ để gọi những phân phối có dáng ngả hẳn sang một bên thay vì cân đối hai phía, họ mượn luôn từ này. Vì vậy cái tên không nói về con số nào cả mà nói về hình dáng: đồ thị trông như bị kéo nghiêng đi, một đuôi dài ra còn đuôi kia cụt lại. Tiếng Việt dịch thành "lệch" cũng giữ đúng tinh thần đó, và hướng của đuôi dài quyết định ta gọi phân phối là lệch phải hay lệch trái.
Kéo vài chấm ra thành đuôi — nhìn vạch trung bình chạy theo, vạch trung vị đứng yên
Kéo tham số, thấy khái niệm chuyển động — mở khoá bằng tài khoản 0đ.
Trong câu tự luận, phải viết đủ ba chữ: dạng, tâm, độ phân tán.
Khi đề yêu cầu mô tả một phân phối, giám khảo tìm shape, center và spread, cộng thêm nhận xét về giá trị ngoại lai (outlier) nếu có. Chỉ nói "lệch phải" là mất điểm vì thiếu tâm và độ phân tán; ngược lại, nêu số liệu mà quên nói lệch cũng mất. Nhớ kèm bối cảnh: đơn vị và tên biến phải xuất hiện trong câu trả lời.
Hễ phân phối lệch thì tự động chuyển sang trung vị và khoảng tứ phân vị.
Với dữ liệu lệch hoặc có giá trị ngoại lai, cặp tóm tắt bền vững (resistant) là trung vị và khoảng tứ phân vị (interquartile range), còn trung bình cùng độ lệch chuẩn (standard deviation) chỉ hợp với phân phối đối xứng. Khi so sánh hai nhóm mà ít nhất một nhóm lệch, hãy so trung vị của cả hai cho nhất quán. Viết thêm một câu giải thích vì sao chọn trung vị thì thường được trọn điểm lý do.
Trước mọi bài suy luận về trung bình, ghi rõ dòng kiểm tra điều kiện chuẩn.
Câu chuẩn để viết ra là: tổng thể xấp xỉ chuẩn, hoặc nên theo định lý giới hạn trung tâm phân phối của xấp xỉ chuẩn. Nếu đề nói tổng thể lệch mạnh mà cỡ mẫu chỉ hay , đáp án đúng thường là "không thể kết luận" chứ không phải một con số xác suất. Đây là bẫy quen thuộc của trắc nghiệm: các phương án nhiễu luôn cho sẵn giá trị tính bằng đường cong chuẩn để dụ người bỏ qua bước kiểm tra.
Phân phối lương của công ty lệch phải, thể hiện ở chỗ trung bình nghìn USD lớn hơn trung vị nghìn USD, và mức lương 118 nghìn USD vượt ngưỡng nên là một giá trị ngoại lai. Vì vậy giám đốc nhân sự nên công bố trung vị 38 nghìn USD: đó là con số phản ánh trung thực mức lương tiêu biểu của nhân viên công ty, còn trung bình đã bị một mức lương rất cao kéo lên và sẽ tạo kỳ vọng không thực tế cho ứng viên.
Phân phối của giá bán trung bình từ các mẫu 100 căn nhà xấp xỉ chuẩn nhờ định lý giới hạn trung tâm, có tâm tại 206 274 USD và độ lệch chuẩn 3 788,1 USD — nghĩa là dù giá nhà trong thành phố lệch phải rất mạnh, trung bình mẫu vẫn phân bố gần đối xứng quanh giá trị thật. Với phân phối đó, xác suất một mẫu ngẫu nhiên đơn giản gồm 100 căn có giá bán trung bình vượt 210 000 USD là khoảng 0,163, tức chỉ chừng 16 trong 100 mẫu như vậy cho kết quả cao đến thế.