AP Statistics
unimodal
Còn gọi: unimodal
Một đỉnh là đặc điểm hình dạng của phân phối khi biểu đồ chỉ có một chỗ tần số cao nhất, không tách thành nhiều nhóm riêng biệt.
Khi phác họa hình dạng của một biểu đồ tần số (frequency), người ta tìm những chỗ dữ liệu dồn dày lên rồi thưa dần ra hai bên; mỗi chỗ tập trung như vậy gọi là một đỉnh của phân phối. Một phân phối được gọi là một đỉnh (unimodal) khi toàn bộ dữ liệu chỉ dồn về một khu vực trung tâm duy nhất, tạo thành một ngọn đồi cao nhất rồi thoải dần xuống cả hai phía, không còn chỗ nào khác nhô lên đáng kể. Đặc điểm này không phụ thuộc vào việc phân phối có đối xứng (symmetric) hay lệch: một phân phối lệch phải (skewed right) vẫn có thể một đỉnh, miễn là chỉ có một ngọn đồi chứ không có ngọn thứ hai.
Ngược lại với một đỉnh là hai đỉnh hoặc nhiều đỉnh, khi dữ liệu tách thành hai hay nhiều nhóm con rõ rệt, mỗi nhóm có mật độ cao riêng và giữa chúng thường xuất hiện một khoảng trũng thấp hơn. Sự khác biệt này gợi ý rằng dữ liệu hai đỉnh có thể đến từ hai tổng thể con đã bị trộn lẫn, chẳng hạn chiều cao của một nhóm gồm cả nam và nữ. Tuy nhiên không phải mọi gợn sóng nhỏ trên biểu đồ đều được tính là một đỉnh riêng; chỉ những chỗ nhô cao rõ rệt, có ý nghĩa thực tế mới được gọi tên như vậy, còn những dao động vụn vặt do cỡ mẫu nhỏ thì bỏ qua.
Trong đề thi, việc xác định một phân phối là một đỉnh hay nhiều đỉnh nằm trong bước mô tả hình dạng, một đặc điểm bắt buộc phải nêu cùng với tâm, độ trải rộng và giá trị ngoại lai khi phân tích một biến định lượng (quantitative variable). Do đó câu trả lời đầy đủ cần gắn hình dạng với bối cảnh dữ liệu, chẳng hạn giải thích vì sao chỉ có một nhóm tuổi tập trung quanh một giá trị duy nhất. Nhờ nhận diện đúng số đỉnh, học sinh mới chọn được số đo trung tâm và số đo trải rộng phù hợp để mô tả phân phối chính xác.
Trực giác: Giống như một hàng người xếp chờ chỉ ùn tắc ở đúng một điểm, không có chỗ ùn tắc thứ hai nào khác trong hàng.
1895Karl Pearson
Cuối thế kỷ 19, khi thống kê bắt đầu làm việc với những đường cong tần số vẽ từ số liệu thật, các nhà nghiên cứu cần một cái tên gọn cho điểm cao nhất của đường cong. Karl Pearson đặt ra từ "mốt" (mode) vào năm 1895 đúng cho nhu cầu ấy, và ông dùng nó thay cho cách nói dài dòng "hoành độ ứng với tung độ lớn nhất" (maximum-ordinate). Có tên cho đỉnh rồi thì việc đếm đỉnh trở nên tự nhiên: một đỉnh, hai đỉnh (bimodal), nhiều đỉnh. Nhờ đó người ta mô tả được hình dáng phân phối chỉ bằng vài chữ, trước khi tính bất kỳ con số nào.
Vì sao mang đúng cái tên này? Tên gọi tách được thành hai mảnh rõ ràng. Tiền tố uni- trong tiếng Latinh nghĩa là "một", còn phần modal gắn với mode — từ mà Pearson tự nhận trong một chú thích rằng ông thấy "tiện" khi dùng để chỉ hoành độ tương ứng với tung độ có tần số lớn nhất. Vì vậy "unimodal" hiểu sát nghĩa là "có một mốt", tức đồ thị chỉ trồi lên một lần rồi đi xuống. Cần lưu ý một chỗ dễ nhầm: chữ "mốt" ở đây không hẳn là giá trị xuất hiện nhiều nhất trong bảng số liệu, mà là điểm cực đại địa phương trên đồ thị. Hai cách hiểu thường trùng nhau, song chính cách hiểu "đỉnh của đường cong" mới giải thích được vì sao phân phối chuẩn (normal distribution) được gọi là một đỉnh.
Kéo độ rộng nhóm — xem một đỉnh hiện ra rồi tách làm đôi
Kéo tham số, thấy khái niệm chuyển động — mở khoá bằng tài khoản 0đ.
Một đỉnh không có nghĩa là đối xứng.
Hai đặc điểm này mô tả hai khía cạnh khác nhau của hình dáng phân phối: số đỉnh nói về việc dữ liệu tụ lại quanh mấy vùng, còn tính đối xứng nói về việc hai bên đỉnh có cân nhau hay không. Một phân phối lệch phải mạnh, chẳng hạn thu nhập hộ gia đình, vẫn hoàn toàn có thể chỉ có một đỉnh. Vì vậy khi đề cho biết phân phối có một đỉnh mà không nói gì thêm, bạn chưa được phép suy ra trung bình bằng trung vị, và càng chưa được kết luận rằng một nửa số quan sát nằm dưới trung bình.
Một đỉnh và đối xứng không đồng nghĩa với phân phối chuẩn.
Phân phối chuẩn (normal distribution) đúng là có một đỉnh và đối xứng, nhưng chiều ngược lại thì sai: phân phối đều hình tam giác, hay phân phối với bậc tự do nhỏ, đều thỏa hai tính chất đó mà không phải là chuẩn. Hệ quả nguy hiểm nhất là học sinh vội áp quy tắc thực nghiệm (empirical rule) hoặc đi tra bảng cho một phân phối chỉ được mô tả là một đỉnh và đối xứng. Điều duy nhất bạn rút ra được một cách an toàn từ hai tính chất này là trung bình xấp xỉ trung vị, nên tỉ lệ quan sát dưới trung bình xấp xỉ .
Đừng đếm mọi chỗ nhô lên của biểu đồ tần số thành một đỉnh.
Khi số nhóm nhiều hoặc cỡ mẫu nhỏ, các cột sẽ lên xuống lởm chởm một cách ngẫu nhiên, và nếu đếm từng chỗ nhô thì hầu như biểu đồ nào cũng thành nhiều đỉnh. Cách đọc đúng là hình dung một đường cong trơn phủ lên dãy cột rồi xem đường cong ấy có mấy vùng tụ rõ rệt; chỉ những chỗ nhô tách hẳn nhau bởi một vùng trũng đáng kể mới được tính. Ngược lại, một phân phối hai đỉnh (bimodal) thật sự thường báo hiệu dữ liệu trộn từ hai nhóm khác nhau, chẳng hạn chiều cao của cả nam lẫn nữ, và chi tiết này đáng được nêu trong phần mô tả.
Số đỉnh nói về hình dáng, không phải về việc giá trị nào lặp nhiều nhất.
Nhiều học sinh nhầm "một đỉnh" với "chỉ có một mốt" theo nghĩa bảng tần số, rồi kết luận rằng nếu hai giá trị cùng xuất hiện lần thì phân phối có hai đỉnh. Thực tế hai giá trị đó có thể nằm sát nhau ngay giữa cùng một vùng tụ, và tổng thể vẫn là một đỉnh duy nhất. Vì vậy hãy nhìn vào biểu đồ tần số hay biểu đồ thân–lá để đánh giá, đừng dò trong bảng số xem con số nào lặp lại nhiều nhất.
Khi mô tả phân phối, phải viết đủ bốn thành phần thì mới trọn điểm.
Người chấm tìm hình dáng, trung tâm, độ phân tán và các giá trị ngoại lai (outlier); hình dáng lại gồm số đỉnh và chiều lệch, nên một câu như "phân phối có một đỉnh và hơi lệch phải" mới được tính là mô tả hình dáng đầy đủ. Nếu chỉ viết "phân phối chuẩn" hoặc "đối xứng" rồi thôi, bạn vừa thiếu ý vừa có nguy cơ khẳng định sai. Hãy tập thói quen viết một câu văn có cả bốn thành phần, kèm số liệu cụ thể lấy từ đề.
Thấy cụm "unimodal and symmetric" trong đề, hãy nghĩ ngay tới mốc quanh trung bình.
Đây chính là chìa khóa của dạng bài như lô hàng nam việt quất: vì phân phối một đỉnh và đối xứng nên trung bình trùng trung vị, do đó khoảng một nửa số túi có khối lượng dưới oz. Bước dễ mất điểm nằm ở chỗ cuối: đề hỏi SỐ túi chứ không hỏi tỉ lệ, nên phải nhân với số túi của từng lô, chẳng hạn . Viết rõ lý do "đối xứng nên trung bình bằng trung vị" trước khi nhân, vì đó là câu người chấm tìm.
Độ lệch chuẩn khác nhau không làm thay đổi tỉ lệ nằm dưới trung bình.
Trong các bảng so sánh nhiều lô hàng, đề thường cố tình cho ba lô có cùng trung bình nhưng độ lệch chuẩn khác hẳn nhau, khiến học sinh tưởng lô phân tán nhiều hơn sẽ có nhiều túi nhẹ hơn. Thật ra độ phân tán chỉ kéo giãn phân phối sang hai phía một cách cân xứng, nên tỉ lệ dưới trung bình vẫn xấp xỉ ở cả ba lô. Chỉ khi đề hỏi về một ngưỡng KHÁC trung bình, ví dụ dưới oz, thì độ lệch chuẩn mới bắt đầu có vai trò.
Phân bố điểm của Lớp 1 có một đỉnh ở nhóm 80–90 và lệch trái, tâm quanh 80 điểm, trải từ khoảng 50 đến 100. Phân bố điểm của Lớp 2 không phải một đỉnh mà có hai đỉnh, ở nhóm 60–70 và 80–90, với vùng trũng rõ rệt ở nhóm 70–80. Từ đó thấy rằng một đỉnh và đối xứng là hai tính chất tách rời nhau: Lớp 1 có một đỉnh mà vẫn lệch, nên không được suy tính đối xứng chỉ vì phân bố có duy nhất một đỉnh.
Xác suất một túi bất kỳ của nông trại A nặng hơn 12,0 oz là khoảng , tức chừng 84% số túi trong lô hàng đó vượt mốc 12,0 oz. Toàn bộ 1000 túi siêu thị nhận được có khối lượng trung bình oz. Khi gộp ba lô hàng, ta không thể khẳng định chắc chắn phân bố vẫn có một đỉnh chỉ vì từng lô có một đỉnh; ở tình huống này ba trung bình rất gần nhau so với độ phân tán nên nhiều khả năng phân bố gộp vẫn có một đỉnh, nhưng nếu ba nông trại có trung bình cách xa nhau thì phân bố gộp hoàn toàn có thể xuất hiện nhiều đỉnh.
Quiz câu thật từ ngân hàng đề
Vài câu thật gắn đúng khái niệm này, chấm ngay kèm giải thích từng đáp án — hệ thống ghi nhớ bạn nắm tới đâu.
Biên soạn bởi DucklingStudy, bản quyền thuộc DucklingStudy. Xuất bản .