AP Statistics

một đỉnh

unimodal

Còn gọi: unimodal

Một đỉnh là đặc điểm hình dạng của phân phối khi biểu đồ chỉ có một chỗ tần số cao nhất, không tách thành nhiều nhóm riêng biệt.

Khi phác họa hình dạng của một biểu đồ tần số (frequency), người ta tìm những chỗ dữ liệu dồn dày lên rồi thưa dần ra hai bên; mỗi chỗ tập trung như vậy gọi là một đỉnh của phân phối. Một phân phối được gọi là một đỉnh (unimodal) khi toàn bộ dữ liệu chỉ dồn về một khu vực trung tâm duy nhất, tạo thành một ngọn đồi cao nhất rồi thoải dần xuống cả hai phía, không còn chỗ nào khác nhô lên đáng kể. Đặc điểm này không phụ thuộc vào việc phân phối có đối xứng (symmetric) hay lệch: một phân phối lệch phải (skewed right) vẫn có thể một đỉnh, miễn là chỉ có một ngọn đồi chứ không có ngọn thứ hai.

Ngược lại với một đỉnh là hai đỉnh hoặc nhiều đỉnh, khi dữ liệu tách thành hai hay nhiều nhóm con rõ rệt, mỗi nhóm có mật độ cao riêng và giữa chúng thường xuất hiện một khoảng trũng thấp hơn. Sự khác biệt này gợi ý rằng dữ liệu hai đỉnh có thể đến từ hai tổng thể con đã bị trộn lẫn, chẳng hạn chiều cao của một nhóm gồm cả nam và nữ. Tuy nhiên không phải mọi gợn sóng nhỏ trên biểu đồ đều được tính là một đỉnh riêng; chỉ những chỗ nhô cao rõ rệt, có ý nghĩa thực tế mới được gọi tên như vậy, còn những dao động vụn vặt do cỡ mẫu nhỏ thì bỏ qua.

Trong đề thi, việc xác định một phân phối là một đỉnh hay nhiều đỉnh nằm trong bước mô tả hình dạng, một đặc điểm bắt buộc phải nêu cùng với tâm, độ trải rộng và giá trị ngoại lai khi phân tích một biến định lượng (quantitative variable). Do đó câu trả lời đầy đủ cần gắn hình dạng với bối cảnh dữ liệu, chẳng hạn giải thích vì sao chỉ có một nhóm tuổi tập trung quanh một giá trị duy nhất. Nhờ nhận diện đúng số đỉnh, học sinh mới chọn được số đo trung tâm và số đo trải rộng phù hợp để mô tả phân phối chính xác.

Trực giác: Giống như một hàng người xếp chờ chỉ ùn tắc ở đúng một điểm, không có chỗ ùn tắc thứ hai nào khác trong hàng.

Khái niệm này sinh ra từ đâu

1895Karl Pearson

Từ "mốt" (mode) — gốc của tên gọi một đỉnh — được Karl Pearson đưa vào thống kê năm 1895 để chỉ vị trí có tần số lớn nhất trên đường phân phối; "unimodal" là ghép của tiền tố Latinh uni- ("một") với chính từ đó, nghĩa là phân phối chỉ có một đỉnh.

Cuối thế kỷ 19, khi thống kê bắt đầu làm việc với những đường cong tần số vẽ từ số liệu thật, các nhà nghiên cứu cần một cái tên gọn cho điểm cao nhất của đường cong. Karl Pearson đặt ra từ "mốt" (mode) vào năm 1895 đúng cho nhu cầu ấy, và ông dùng nó thay cho cách nói dài dòng "hoành độ ứng với tung độ lớn nhất" (maximum-ordinate). Có tên cho đỉnh rồi thì việc đếm đỉnh trở nên tự nhiên: một đỉnh, hai đỉnh (bimodal), nhiều đỉnh. Nhờ đó người ta mô tả được hình dáng phân phối chỉ bằng vài chữ, trước khi tính bất kỳ con số nào.

Vì sao mang đúng cái tên này? Tên gọi tách được thành hai mảnh rõ ràng. Tiền tố uni- trong tiếng Latinh nghĩa là "một", còn phần modal gắn với mode — từ mà Pearson tự nhận trong một chú thích rằng ông thấy "tiện" khi dùng để chỉ hoành độ tương ứng với tung độ có tần số lớn nhất. Vì vậy "unimodal" hiểu sát nghĩa là "có một mốt", tức đồ thị chỉ trồi lên một lần rồi đi xuống. Cần lưu ý một chỗ dễ nhầm: chữ "mốt" ở đây không hẳn là giá trị xuất hiện nhiều nhất trong bảng số liệu, mà là điểm cực đại địa phương trên đồ thị. Hai cách hiểu thường trùng nhau, song chính cách hiểu "đỉnh của đường cong" mới giải thích được vì sao phân phối chuẩn (normal distribution) được gọi là một đỉnh.

Thử nghiệm tương tác

Kéo độ rộng nhóm — xem một đỉnh hiện ra rồi tách làm đôi

Kéo độ rộng nhóm — xem một đỉnh hiện ra rồi tách làm đôi

Kéo tham số, thấy khái niệm chuyển động — mở khoá bằng tài khoản 0đ.

Tạo tài khoản miễn phí

Hay hiểu sai

Một đỉnh không có nghĩa là đối xứng.

Một đỉnh và đối xứng không đồng nghĩa với phân phối chuẩn.

Đừng đếm mọi chỗ nhô lên của biểu đồ tần số thành một đỉnh.

Số đỉnh nói về hình dáng, không phải về việc giá trị nào lặp nhiều nhất.

Mẹo phòng thi

Khi mô tả phân phối, phải viết đủ bốn thành phần thì mới trọn điểm.

Thấy cụm "unimodal and symmetric" trong đề, hãy nghĩ ngay tới mốc 50%50\% quanh trung bình.

Độ lệch chuẩn khác nhau không làm thay đổi tỉ lệ nằm dưới trung bình.

Tần suất trong đề AP StatisticsThường xuyên

Ví dụ có lời giải

1Ví dụ 1/2
Một giáo viên ghi lại điểm bài kiểm tra cuối kỳ (thang 100) của hai lớp và tóm tắt thành bảng tần số theo nhóm như sau. Lớp 1 (56 học sinh): nhóm [50,60) có 3 em, [60,70) có 8 em, [70,80) có 15 em, [80,90) có 21 em, [90,100] có 9 em. Lớp 2 (45 học sinh): nhóm [50,60) có 4 em, [60,70) có 14 em, [70,80) có 6 em, [80,90) có 16 em, [90,100] có 5 em.
  1. aMô tả hình dạng phân bố điểm của Lớp 1: phân bố có mấy đỉnh và lệch về phía nào?
  2. bPhân bố điểm của Lớp 2 có phải là phân bố một đỉnh không? Giải thích.
  3. cMột học sinh nói: "Phân bố một đỉnh thì chắc chắn đối xứng." Hãy nhận xét câu nói này dựa vào hai lớp trên.
1Bước 1: Trước hết hãy hình dung dãy cột của Lớp 1 theo đúng thứ tự nhóm: 3, 8, 15, 21, 93,\ 8,\ 15,\ 21,\ 9. Dãy này tăng đều từ trái sang phải cho tới nhóm [80,90)[80,90) rồi tụt xuống ở nhóm cuối, nghĩa là chỉ có một chỗ cao nhất duy nhất. Vì vậy phân bố điểm của Lớp 1 có một đỉnh, với đỉnh nằm ở nhóm [80,90)[80,90).
2Bước 2: Tiếp theo xét đuôi của phân bố Lớp 1. Bên phải đỉnh chỉ còn một nhóm với 9 học sinh, trong khi bên trái đỉnh còn tới ba nhóm kéo dài xuống tận 50 điểm với tần số 15, 8 và 3. Đuôi dài hơn nằm ở phía giá trị nhỏ, do đó phân bố lệch trái (skewed left). Câu trả lời đầy đủ cho ý (a) là: phân bố có một đỉnh, lệch trái, tâm nằm trong khoảng 80 điểm và trải từ khoảng 50 đến 100 điểm.
3Bước 3: Sang Lớp 2, dãy tần số là 4, 14, 6, 16, 54,\ 14,\ 6,\ 16,\ 5. Ở đây có hai chỗ nhô cao rõ rệt là nhóm [60,70)[60,70) với 14 em và nhóm [80,90)[80,90) với 16 em, ngăn cách bởi một chỗ trũng thật sự ở nhóm [70,80)[70,80) chỉ có 6 em. Vì chỗ trũng sâu hơn hẳn hai đỉnh chứ không phải một dao động nhỏ do ngẫu nhiên, ta kết luận phân bố của Lớp 2 có hai đỉnh (bimodal) chứ không phải một đỉnh. Cách diễn giải hợp lý là trong lớp tồn tại hai nhóm học sinh có mức độ chuẩn bị khác nhau.
4Bước 4: Cần cẩn thận với quy tắc "không phải bướu nào cũng là đỉnh". Nếu nhóm giữa của Lớp 2 có 13 em thay vì 6 em, dãy 4, 14, 13, 16, 54,\ 14,\ 13,\ 16,\ 5 chỉ gợn nhẹ và ta vẫn mô tả phân bố là một đỉnh. Chỉ khi vùng trũng đủ sâu so với hai đỉnh thì mới được gọi là hai đỉnh, và ở Lớp 2 thì 66 nhỏ hơn hẳn 14141616 nên điều kiện đó thỏa mãn.
5Bước 5: Cuối cùng, hãy đối chiếu hai khái niệm. Số đỉnh nói về việc phân bố có mấy chỗ nhô cao, còn tính đối xứng nói về việc hai phía của tâm có soi gương được vào nhau hay không; đó là hai đặc điểm độc lập. Lớp 1 chính là phản ví dụ: nó có một đỉnh nhưng rõ ràng lệch trái, nên câu nói của học sinh kia sai.

Phân bố điểm của Lớp 1 có một đỉnh ở nhóm 80–90 và lệch trái, tâm quanh 80 điểm, trải từ khoảng 50 đến 100. Phân bố điểm của Lớp 2 không phải một đỉnh mà có hai đỉnh, ở nhóm 60–70 và 80–90, với vùng trũng rõ rệt ở nhóm 70–80. Từ đó thấy rằng một đỉnh và đối xứng là hai tính chất tách rời nhau: Lớp 1 có một đỉnh mà vẫn lệch, nên không được suy tính đối xứng chỉ vì phân bố có duy nhất một đỉnh.

2Ví dụ 2/2
Một siêu thị nhận ba lô hàng túi việt quất từ ba nông trại A, B và C. Với cả ba lô hàng, phân bố khối lượng của một túi đều có một đỉnh và đối xứng. Nông trại A giao 200 túi, khối lượng trung bình 12,412{,}4 oz, độ lệch chuẩn (standard deviation) 0,40{,}4 oz. Nông trại B giao 300 túi, trung bình 12,712{,}7 oz, độ lệch chuẩn 0,30{,}3 oz. Nông trại C giao 500 túi, trung bình 12,212{,}2 oz, độ lệch chuẩn 0,50{,}5 oz.
  1. aChọn ngẫu nhiên một túi trong lô hàng của nông trại A. Tính xác suất túi đó nặng hơn 12,0 oz.
  2. bTính khối lượng trung bình của toàn bộ 1000 túi mà siêu thị nhận được.
  3. cKhi gộp cả ba lô hàng lại, phân bố khối lượng của 1000 túi có chắc chắn vẫn có một đỉnh không? Giải thích.
1Bước 1: Giả thiết "có một đỉnh và đối xứng" chính là giấy phép để dùng mô hình chuẩn cho từng lô hàng. Một phân bố đối xứng nhưng có hai đỉnh, hoặc một đỉnh nhưng lệch, đều không cho phép tra bảng zz; phải có đồng thời cả hai đặc điểm thì đường cong hình chuông mới là xấp xỉ chấp nhận được. Vì vậy với lô hàng A ta đặt XN(12,4; 0,4)X \sim N(12{,}4;\ 0{,}4).
2Bước 2: Chuẩn hóa giá trị ngưỡng 12,012{,}0 oz: z=12,012,40,4=1,00.z=\frac{12{,}0-12{,}4}{0{,}4}=-1{,}00. Con số 1,00-1{,}00 cho biết mốc 12,0 oz nằm thấp hơn trung bình đúng một độ lệch chuẩn. Tra bảng chuẩn, P(Z>1,00)=10,1587=0,8413P(Z>-1{,}00)=1-0{,}1587=0{,}8413, nên khoảng 84,1%84{,}1\% số túi của nông trại A nặng hơn 12,0 oz.
3Bước 3: Sang ý (b), trung bình chung không phải là trung bình cộng của ba số 12,412{,}4, 12,712{,}712,212{,}2, vì ba lô hàng có số túi khác nhau. Ta phải dùng trung bình có trọng số, tức lấy tổng khối lượng chia cho tổng số túi: xˉ=nixˉini.\bar{x}=\frac{\sum n_i\bar{x}_i}{\sum n_i}. Trong công thức này nin_i là số túi và xˉi\bar{x}_i là khối lượng trung bình của lô hàng thứ ii.
4Bước 4: Thay số vào: 200×12,4=2480200\times 12{,}4=2480, 300×12,7=3810300\times 12{,}7=3810500×12,2=6100500\times 12{,}2=6100, nên tổng khối lượng là 2480+3810+6100=123902480+3810+6100=12390 oz. Chia cho tổng số túi 200+300+500=1000200+300+500=1000, ta được xˉ=123901000=12,39 oz.\bar{x}=\frac{12390}{1000}=12{,}39\ \text{oz}. Kết quả này gần với trung bình của lô C nhất, điều hợp lý vì lô C chiếm một nửa tổng số túi.
5Bước 5: Ý (c) hỏi về một cạm bẫy quen thuộc: trộn nhiều phân bố một đỉnh lại với nhau không nhất thiết vẫn được một đỉnh. Nếu ba tâm nằm xa nhau so với độ phân tán thì mỗi lô hàng sẽ tạo ra một chỗ nhô riêng và phân bố gộp có nhiều đỉnh. Ở đây ba trung bình chỉ chênh nhau nhiều nhất 12,712,2=0,512{,}7-12{,}2=0{,}5 oz, xấp xỉ một độ lệch chuẩn của từng lô, nên ba đường cong chồng lấn gần như hoàn toàn và ta có cơ sở tin rằng phân bố gộp vẫn có một đỉnh. Tuy nhiên đó chỉ là suy luận hợp lý, không phải điều được bảo đảm bởi dữ kiện đã cho; muốn chắc chắn phải nhìn biểu đồ tần số của cả 1000 túi.

Xác suất một túi bất kỳ của nông trại A nặng hơn 12,0 oz là khoảng 0,84130{,}8413, tức chừng 84% số túi trong lô hàng đó vượt mốc 12,0 oz. Toàn bộ 1000 túi siêu thị nhận được có khối lượng trung bình 12,3912{,}39 oz. Khi gộp ba lô hàng, ta không thể khẳng định chắc chắn phân bố vẫn có một đỉnh chỉ vì từng lô có một đỉnh; ở tình huống này ba trung bình rất gần nhau so với độ phân tán nên nhiều khả năng phân bố gộp vẫn có một đỉnh, nhưng nếu ba nông trại có trung bình cách xa nhau thì phân bố gộp hoàn toàn có thể xuất hiện nhiều đỉnh.

Bạn nắm chắc chưa?

Quiz câu thật từ ngân hàng đề

Vài câu thật gắn đúng khái niệm này, chấm ngay kèm giải thích từng đáp án — hệ thống ghi nhớ bạn nắm tới đâu.

Tạo tài khoản miễn phí

Học tiếp từ đây

Mục tiêu và lộ trình unit xem miễn phí — làm bài tập và lưu tiến độ cần tài khoản 0đ.

Hay nhầm với

Khác nhau ở đâuMột đỉnh nghĩa là phân phối chỉ có duy nhất một chỗ nhô cao. Hai đỉnh nghĩa là có hai chỗ nhô cao tách nhau bởi một vùng trũng.
Hay nhầm khiKhi histogram có một cột phụ nhấp nhô do dao động ngẫu nhiên, thí sinh vội gọi là hai đỉnh dù thật ra chỉ có một đỉnh.
Khác nhau ở đâuMột đỉnh nói về số chỗ nhô cao của phân phối. Đối xứng nói về sự cân bằng giữa hai nửa quanh tâm.
Hay nhầm khiCâu hỏi mô tả hình dạng yêu cầu nêu cả hai đặc điểm, nhưng thí sinh chỉ viết một đỉnh rồi coi như đã trả lời xong về tính đối xứng.

Cùng chủ đề

Nguồn tham khảo

  1. [1]Barron_AP_Stat_2026. tr. 79, 95–96.

Biên soạn bởi DucklingStudy, bản quyền thuộc DucklingStudy. Xuất bản .