AP Statistics
symmetric
Còn gọi: phân phối đối xứng · symmetry

Đối xứng (symmetric) chỉ phân phối có dữ liệu phân bố đều ở hai phía của tâm, tạo hai nửa phản chiếu qua trục giữa.
Khi vẽ đồ thị của một phân phối đối xứng (symmetric distribution), nửa bên trái và nửa bên phải giống nhau như hình phản chiếu qua đường thẳng đứng đi qua tâm. Do đó, nếu gấp đồ thị theo trục giữa thì hai nửa sẽ chồng khít lên nhau. Phân phối chuẩn là ví dụ điển hình, với đỉnh nằm chính giữa và hai đuôi trải dài đều về hai phía.
Để nhận biết tính đối xứng bằng số, ta so sánh trung bình (mean) với trung vị (median). Trong phân phối đối xứng, hai giá trị này xấp xỉ bằng nhau vì các giá trị cao và thấp cân bằng lẫn nhau. Ngược lại, khi phân phối lệch, trung bình bị kéo về phía đuôi dài nên khác biệt rõ rệt với trung vị. Chẳng hạn, dữ liệu lệch phải có trung bình lớn hơn trung vị do ảnh hưởng của các giá trị lớn bất thường.
Việc xác định phân phối có đối xứng hay không ảnh hưởng trực tiếp đến lựa chọn phương pháp phân tích. Nhiều kiểm định giả thuyết (hypothesis testing) và khoảng tin cậy (confidence interval) dựa trên giả định dữ liệu có dạng đối xứng hoặc xấp xỉ chuẩn. Vì vậy, khi phân phối lệch mạnh, các phương pháp phi tham số hoặc biến đổi dữ liệu thường được ưu tiên.
Trực giác: Giống như một chiếc cân thăng bằng hoàn hảo: đặt điểm tựa ngay giữa thì hai bên nặng bằng nhau, cân nằm ngang.
1794 (trong hình học) và 1808–1895 (trong thống kê)Adrien-Marie LegendreCarl Friedrich GaussPierre-Simon LaplaceKarl Pearson
Đối xứng không đồng nghĩa với phân phối chuẩn (normal distribution).
Đây là lỗi tốn điểm nhất khi đề hỏi "must be true". Một phân bố có thể cân xứng hai bên tâm mà vẫn phẳng dẹt, vẫn nhọn hơn hoặc thậm chí có hai đỉnh, nên các con số riêng của đường cong chuẩn không được phép mượn sang. Cụ thể, chỉ biết đối xứng thì bạn không có quyền nói khoảng chứa dữ liệu, cũng không được kết luận tứ phân vị thứ ba ứng với . Những phát biểu ấy đòi thêm giả thiết chuẩn, mà đề chỉ cho đối xứng thì giả thiết đó chưa có.
Trung bình bằng trung vị không suy ngược lại được thành đối xứng.
Chiều thuận thì đúng: nếu dữ liệu phân bố cân bằng hai phía tâm thì hai số đo tâm trùng nhau, và đây là tính chất bạn được dùng thoải mái. Tuy nhiên chiều ngược lại có phản ví dụ dễ dựng: một phân bố lệch trái ở phần đuôi này có thể được một cụm giá trị lệch phải bù trừ vừa đủ, khiến trong khi hình dạng rõ ràng không cân xứng. Vì vậy trong câu hỏi trắc nghiệm dạng "which must be true", mệnh đề "nếu mean = median thì phân bố đối xứng" gần như luôn là phương án sai.
Độ lệch chuẩn lớn hơn không làm tăng tỉ lệ giá trị nằm dưới trung bình.
Bài toán ba lô hàng việt quất minh họa đúng bẫy này: ba trang trại có độ lệch chuẩn (standard deviation) khác nhau nhưng cùng trung bình oz, và nhiều học sinh vội kết luận lô hàng phân tán nhiều nhất sẽ có nhiều túi nhẹ dưới oz hơn. Thực ra độ phân tán chỉ kéo dữ liệu ra xa tâm về cả hai phía cùng lúc, nên phần diện tích bên trái tâm vẫn giữ nguyên . Với mỗi lô túi, đáp số đều là khoảng túi, bất kể độ lệch chuẩn là hay .
Đối xứng và một mốt (unimodal) là hai tính chất tách rời nhau.
Đề bài luôn ghi đủ cả hai cụm từ "unimodal and symmetric" chứ không ghi thừa, bởi một phân bố hai đỉnh cao bằng nhau nằm cân xứng quanh tâm vẫn hoàn toàn đối xứng. Nhờ đó bạn cần hiểu rằng tính đối xứng chỉ nói về sự cân bằng của hai nửa, còn số đỉnh lại nói về chỗ dữ liệu tụ lại. Ngoài ra, đối xứng cũng không loại trừ giá trị ngoại lai (outlier): hai điểm lạc nằm đối xứng ở hai đầu vẫn giữ nguyên hình dạng cân xứng của phân bố.
Quiz câu thật từ ngân hàng đề
Vài câu thật gắn đúng khái niệm này, chấm ngay kèm giải thích từng đáp án — hệ thống ghi nhớ bạn nắm tới đâu.
Biên soạn bởi DucklingStudy, bản quyền thuộc DucklingStudy. Xuất bản .
Trước khi trở thành một tính từ quen thuộc để mô tả hình dáng phân phối, đối xứng là chuyện của hình học không gian. Năm 1794, Legendre đưa ra một cách định nghĩa mới về đối xứng trong hình học khối, và cách hiểu ấy trở thành nền cho hầu hết các ngành khoa học về sau. Thống kê tiếp nhận ý niệm này khi Gauss cùng Laplace mô tả đường cong chuẩn năm 1808: đường cong đó cân bằng quanh tâm, một nửa số giá trị nằm dưới trung bình và một nửa nằm trên, đồng thời trung bình, trung vị và mốt trùng nhau. Đến năm 1895, Karl Pearson đi xa hơn khi bắt đầu phân loại có hệ thống các đường cong đối xứng và bất đối xứng, mở đường cho việc mô tả hình dáng dữ liệu như ta làm hôm nay.
Vì sao mang đúng cái tên này? Cái tên nghe rất hình học, và đúng là nó đến từ hình học thật. Legendre dùng đối xứng để nói về hai nửa của một khối trùng khít nhau qua một mặt phẳng, và chính định nghĩa ấy được các ngành khoa học khác vay mượn. Khi thống kê cần một chữ để chỉ những phân phối mà nửa trái và nửa phải soi nhau qua tâm — như đường cong chuẩn (normal distribution) của Gauss và Laplace, nơi trung bình, trung vị và mốt cùng rơi vào một điểm — thì chữ có sẵn trong hình học được dùng luôn. Vì vậy khi Pearson phân loại các đường cong đối xứng và bất đối xứng (symmetrical and asymmetrical curves) năm 1895, thuật ngữ đã mang đúng nghĩa hình dáng mà đề thi ngày nay vẫn hỏi.
Kéo từng chấm cho hai bên vạch tâm cân nhau — nhìn trung bình và trung vị chồng lên nhau
Kéo tham số, thấy khái niệm chuyển động — mở khoá bằng tài khoản 0đ.
Gặp "unimodal and symmetric" kèm trung bình, hãy viết ngay câu mean = median.
Đây là mắt xích chấm điểm mà giám khảo tìm: từ chỗ hai số đo tâm trùng nhau bạn mới được suy ra khoảng quan sát nằm dưới trung bình, rồi nhân tỉ lệ đó với cỡ mẫu để ra số đơn vị cụ thể. Trình bày trọn chuỗi "đối xứng → mean = median → " an toàn hơn nhiều so với việc viết thẳng đáp số túi.
Với câu "which of the following must be true", loại mọi phương án cần thêm giả thiết chuẩn.
Chiến thuật là quét từng lựa chọn và tự hỏi: phát biểu này chỉ cần sự cân xứng, hay còn cần biết dạng đường cong? Các mệnh đề về ––, về của tứ phân vị, hay về xác suất trong một khoảng cụ thể đều thuộc nhóm cần thêm giả thiết nên phải loại. Thứ còn lại thường chỉ là hai điều: trung bình bằng trung vị, và xác suất ở mỗi phía của tâm bằng .
Đừng lẫn phân vị với điểm chuẩn hóa khi ước lượng của tứ phân vị thứ ba.
Tứ phân vị thứ ba là mốc , nhưng điểm chuẩn hóa tương ứng của nó vào khoảng chứ không phải và càng không phải . Với phân bố không đối xứng, con số chỉ còn là ước lượng thô, nên đề thường yêu cầu chọn giá trị dương nhỏ hơn thay vì một số chính xác. Khi mô tả hình dạng trong phần tự luận, hãy dùng cụm "gần đối xứng" (roughly symmetric) vì dữ liệu thực hiếm khi cân xứng tuyệt đối.
Trung vị khối lượng túi của nông trại A vào khoảng 32,1 oz, vì phân bố khối lượng của lô này đối xứng và một mốt nên trung bình và trung vị gần trùng nhau. Trung bình của toàn bộ 500 túi là 32,01 oz, tính bằng trung bình có trọng số theo số túi của từng lô. Trong ba lô, lô của nông trại C có tỉ lệ túi nặng hơn 33 oz lớn nhất, vì mốc 33 oz chỉ cách trung bình của lô này đúng 1,00 độ lệch chuẩn, nhỏ hơn so với 1,125 của lô A và 2,80 của lô B.
Với phân bố điểm của trò chơi, trung bình và trung vị cùng bằng 3 điểm, đúng như tính đối xứng gợi ý. Mệnh đề rằng xác suất để không vượt quá trung bình bằng 0,5 là sai, vì ; điều luôn đúng chỉ là hai đuôi cân nhau, . Còn với một phân bố điểm số không đối xứng, ta không thể lấy 0,67 làm điểm chuẩn hóa của tứ phân vị thứ ba, bởi con số ấy chỉ có giá trị dưới giả thiết phân bố đối xứng hình chuông.