AP Statistics

độ lệch (so với trung bình)

deviation

Còn gọi: deviation

Độ lệch (so với trung bình) là khoảng cách có dấu giữa một quan sát và trung bình của tập dữ liệu, tính bằng hiệu số quan sát trừ trung bình.

Trong thống kê mô tả một biến định lượng (quantitative variable), độ lệch (so với trung bình) là khoảng cách có dấu giữa một quan sát xix_i và trung bình xˉ\bar{x} của toàn bộ dữ liệu, viết là xixˉx_i - \bar{x}; giá trị lớn hơn trung bình cho độ lệch dương, còn giá trị nhỏ hơn cho độ lệch âm, nên độ lệch vừa cho biết khoảng cách vừa cho biết chiều so với trung bình. Nhờ đó đại lượng này là nền tảng để xây nên các thước đo độ phân tán (spread), từ phương sai đến độ lệch chuẩn.

Nếu cộng tất cả các độ lệch của một tập dữ liệu (data set) lại, ta luôn được (xixˉ)=0\sum (x_i - \bar{x}) = 0 vì phần dương và phần âm triệt tiêu nhau đúng theo định nghĩa của trung bình cộng. Do đó để đo độ phân tán có ý nghĩa, người ta bình phương từng độ lệch trước khi cộng lại, tạo ra tổng bình phương độ lệch (xixˉ)2\sum (x_i - \bar{x})^2; chia đại lượng này cho n1n-1 khi làm việc với mẫu sẽ ra phương sai mẫu, và lấy căn bậc hai của phương sai sẽ ra độ lệch chuẩn. Nhờ vậy độ lệch chuẩn mang cùng đơn vị với dữ liệu gốc, trong khi bản thân độ lệch chỉ là bước trung gian, không thể dùng một mình để tóm tắt cả tập số liệu.

Ngoài ra, độ lệch còn dùng để nhận diện giá trị ngoại lai thông qua quy tắc dựa trên số lần độ lệch chuẩn cách trung bình, chẳng hạn coi một điểm là bất thường nếu nó cách trung bình hơn hai hoặc ba lần độ lệch chuẩn. Tương tự, khi chuẩn hoá một quan sát thành điểm chuẩn z=(xixˉ)/sz = (x_i - \bar{x})/s, tử số chính là độ lệch so với trung bình, còn mẫu số cho biết độ lệch ấy lớn hay nhỏ so với mức phân tán chung của cả tập dữ liệu. Vì vậy hiểu đúng độ lệch giúp thấy rõ vì sao độ lệch chuẩn được định nghĩa qua phép bình phương chứ không phải ngẫu nhiên.

Ký hiệuxixˉx_i - \bar{x}

Trực giác: Độ lệch giống như khoảng cách kèm hướng từ nhà một học sinh đến điểm hẹn chung của cả lớp — xa bao nhiêu và về phía nào.

Công thức

xixˉ\htmlClass{fp-1}{\htmlClass{fp-0}{x_i}-\htmlClass{fp-0}{\bar{x}}}

Dùng khi cần đo khoảng cách có dấu của một giá trị so với trung bình, là bước nền để tính phương sai, độ lệch chuẩn, hay z-score.

Trong đó

xix_igiá trị quan sát thứ i trong tập dữ liệuxˉ\bar{x}trung bình mẫu của toàn bộ dữ liệu

Khái niệm này sinh ra từ đâu

1893–1894Karl PearsonCarl Friedrich Gauss

Từ "deviation" bắt nguồn từ tiếng Latin "devius" nghĩa là "chệch khỏi đường", và trong thống kê nó gắn với Karl Pearson, người đưa ra tên gọi độ lệch chuẩn (standard deviation) trong các bài giảng khoảng năm 1893 và viết ra lần đầu năm 1894.

Trước khi có tên gọi quen thuộc ngày nay, các nhà toán học đã đo độ phân tán của dữ liệu bằng những cái tên khác nhau và khá rườm rà. Gauss gọi đại lượng này là "sai số trung bình" (mean error), còn giới đo đạc quen dùng cụm "căn bậc hai của trung bình bình phương". Đến cuối thế kỷ 19, khi thống kê chuyển từ việc mô tả số liệu nhà nước sang phân tích dữ liệu sinh học và đo lường, nhu cầu về một thuật ngữ gọn và thống nhất trở nên rõ ràng. Vì vậy Karl Pearson đặt tên độ lệch chuẩn trong bài giảng của mình, và tên ấy lan ra khắp ngành. Nhờ đó ý tưởng "lệch bao nhiêu so với trung bình" có một cái tên duy nhất, dùng chung đến tận hôm nay.

Vì sao mang đúng cái tên này? Gốc của từ nằm ở tiếng Latin "devius", nghĩa là "ra khỏi đường", "bị rẽ sang hướng khác", vốn xuất phát từ động từ "devertere" — quay đi, đi lạc. Ban đầu người ta dùng nó trong hàng hải và đo đạc để chỉ việc đi chệch khỏi đường thẳng hoặc chệch khỏi hướng đã định, và trong luật pháp để chỉ hành vi lệch khỏi chuẩn mực. Thống kê mượn đúng hình ảnh đó: mỗi quan sát được xem như một điểm rời khỏi "đường chính" là trung bình, và khoảng cách rời đi ấy chính là độ lệch. Do đó khi Pearson ghép thêm chữ "standard", ông muốn nói tới một thước đo chuẩn hóa cho toàn bộ những khoảng chệch đó, thay cho các tên gọi dài dòng trước kia.

Thử nghiệm tương tác

Kéo một chấm ra xa — vạch trung bình trượt theo, tổng độ lệch vẫn bằng 0

Kéo một chấm ra xa — vạch trung bình trượt theo, tổng độ lệch vẫn bằng 0

Kéo tham số, thấy khái niệm chuyển động — mở khoá bằng tài khoản 0đ.

Tạo tài khoản miễn phí

Hay hiểu sai

Độ lệch không phải độ lệch chuẩn.

Trừ ngược thứ tự làm đổi dấu độ lệch và kéo theo sai cả xác suất.

Tổng các độ lệch quanh trung bình luôn bằng 0, nên không dùng nó đo độ phân tán được.

Chuẩn hóa một thống kê thì mẫu số là sai số chuẩn, không phải độ lệch chuẩn của dữ liệu.

Mẹo phòng thi

Trên bài tự luận, viết hẳn phép trừ ra giấy trước khi bấm máy.

Phân biệt câu hỏi cho giá trị tìm xác suất với câu hỏi cho phân vị tìm giá trị.

Luôn kèm đơn vị cho độ lệch, nhưng tuyệt đối không kèm đơn vị cho điểm z.

Tần suất trong đề AP StatisticsThường xuyên

Ví dụ có lời giải

1Ví dụ 1/2
Một huấn luyện viên ghi lại số lần chạm bóng thành công của một vận động viên trong 5 buổi tập: 12, 15, 18, 20, 25. Huấn luyện viên muốn mô tả mức dao động của thành tích quanh mức trung bình của chính vận động viên này.
  1. aTính trung bình của mẫu, sau đó tính độ lệch so với trung bình của từng buổi tập và kiểm tra tổng các độ lệch.
  2. bDùng các độ lệch vừa tìm được để tính độ lệch chuẩn mẫu, rồi cho biết buổi tập nào lệch xa trung bình nhất.
1Bước 1: Tính trung bình mẫu: xˉ=12+15+18+20+255=905=18\bar{x}=\dfrac{12+15+18+20+25}{5}=\dfrac{90}{5}=18. Vậy trung bình mỗi buổi tập là 18 lần chạm bóng thành công, và đây chính là mốc để mọi độ lệch được đo từ đó.
2Bước 2: Độ lệch của một quan sát là xixˉx_i-\bar{x}, tức khoảng cách có dấu từ giá trị đó đến trung bình. Lần lượt ta có 1218=612-18=-6, 1518=315-18=-3, 1818=018-18=0, 2018=220-18=22518=725-18=7. Dấu âm nghĩa là buổi tập đó dưới mức trung bình, dấu dương nghĩa là trên mức trung bình.
3Bước 3: Cộng lại: (6)+(3)+0+2+7=0(-6)+(-3)+0+2+7=0. Tổng bằng 0 không phải là ngẫu nhiên mà luôn đúng với mọi tập dữ liệu, vì (xixˉ)=xinxˉ=905(18)=0\sum(x_i-\bar{x})=\sum x_i-n\bar{x}=90-5(18)=0. Chính vì tổng luôn triệt tiêu nên người ta không thể lấy trung bình của các độ lệch để đo độ phân tán, mà phải bình phương chúng trước.
4Bước 4: Bình phương từng độ lệch rồi cộng: 36+9+0+4+49=9836+9+0+4+49=98. Chia cho n1=4n-1=4 ta được phương sai mẫu (sample variance) s2=984=24,5s^2=\dfrac{98}{4}=24{,}5.
5Bước 5: Lấy căn bậc hai: s=24,54,95s=\sqrt{24{,}5}\approx 4{,}95. Đây là độ lệch chuẩn (standard deviation) của mẫu, đóng vai trò như một độ lệch tiêu biểu tính theo đơn vị lần chạm bóng. Buổi tập 25 lần có độ lệch +7+7, lớn nhất về giá trị tuyệt đối, nên là buổi lệch xa trung bình nhất.

Trung bình là 18 lần chạm bóng; các độ lệch lần lượt là 6-6, 3-3, 00, +2+2, +7+7 và có tổng bằng 0 đúng như tính chất chung của độ lệch. Sau khi bình phương và lấy trung bình theo n1n-1, ta được s4,95s\approx 4{,}95 lần chạm bóng, nghĩa là thành tích của vận động viên thường xê dịch quanh mức 18 chừng 5 lần chạm bóng. Buổi đạt 25 lần lệch +7+7 so với trung bình, là buổi bất thường nhất trong 5 buổi.

2Ví dụ 2/2
Các nhà khoa học ước lượng rằng tuổi thọ của rùa khổng lồ trên quần đảo Galápagos có phân bố xấp xỉ chuẩn với trung bình 100100 năm và độ lệch chuẩn 1515 năm.
  1. aMột con rùa sống được 118 năm. Tính độ lệch của tuổi thọ con rùa này so với trung bình và đổi độ lệch đó sang điểm z, rồi tìm xác suất một con rùa chọn ngẫu nhiên sống lâu hơn 118 năm.
  2. bTìm tuổi thọ ứng với phân vị thứ 90 của phân bố.
1Bước 1: Độ lệch thô của con rùa 118 tuổi là 118100=18118-100=18 năm. Con số này cho biết nó sống hơn mức trung bình 18 năm, nhưng bản thân 18 năm chưa nói được là nhiều hay ít nếu ta chưa biết cả đàn rùa dao động rộng cỡ nào.
2Bước 2: Muốn so sánh được, ta chia độ lệch cho độ lệch chuẩn để có điểm z (z-score): z=xμσ=11810015=1815=1,2z=\dfrac{x-\mu}{\sigma}=\dfrac{118-100}{15}=\dfrac{18}{15}=1{,}2. Như vậy con rùa này lệch khỏi trung bình đúng 1,21{,}2 lần độ lệch chuẩn về phía trên.
3Bước 3: Tra bảng chuẩn: P(Z<1,2)=0,8849P(Z<1{,}2)=0{,}8849, do đó P(X>118)=10,8849=0,1151P(X>118)=1-0{,}8849=0{,}1151. Vậy khoảng 11,5%11{,}5\% số rùa sống lâu hơn 118 năm.
4Bước 4: Sang câu (b), phân vị thứ 90 (90th percentile) là giá trị mà 90%90\% dữ liệu nằm dưới nó. Trên thang chuẩn, giá trị đó ứng với z1,282z\approx 1{,}282, tức điểm nằm cao hơn trung bình 1,2821{,}282 độ lệch chuẩn.
5Bước 5: Đổi ngược điểm z thành độ lệch tính bằng năm rồi cộng vào trung bình: x=μ+zσ=100+1,282(15)=100+19,23119,2x=\mu+z\sigma=100+1{,}282(15)=100+19{,}23\approx 119{,}2. Phép nhân zσz\sigma chính là thao tác ngược của phép chia ở Bước 2, biến độ lệch chuẩn hóa trở lại đơn vị năm.

Con rùa 118 tuổi lệch +18+18 năm so với trung bình, tương đương z=1,2z=1{,}2 độ lệch chuẩn, và xác suất một con rùa chọn ngẫu nhiên sống lâu hơn nó là khoảng 0,1150{,}115. Phân vị thứ 90 của phân bố tuổi thọ rơi vào khoảng 119119 năm, nghĩa là 10%10\% số rùa Galápagos sống thọ hơn mốc này.

Bạn nắm chắc chưa?

Quiz câu thật từ ngân hàng đề

Vài câu thật gắn đúng khái niệm này, chấm ngay kèm giải thích từng đáp án — hệ thống ghi nhớ bạn nắm tới đâu.

Tạo tài khoản miễn phí

Học tiếp từ đây

Cần trướctrung bình
Liên quanphần dư
Mục tiêu và lộ trình unit xem miễn phí — làm bài tập và lưu tiến độ cần tài khoản 0đ.

Hay nhầm với

Khác nhau ở đâuĐộ lệch đo khoảng cách từ mỗi quan sát đến trung bình của một biến duy nhất. Phần dư đo khoảng cách từ quan sát đến giá trị mà đường hồi quy dự đoán.
Hay nhầm khiTrong câu hỏi hồi quy, thí sinh hay lấy yiyˉy_i-\bar{y} rồi gọi đó là phần dư, trong khi phần dư phải là yiy^iy_i-\hat{y}_i.
Khác nhau ở đâuĐộ lệch là một con số riêng cho từng quan sát và có thể âm. Độ lệch chuẩn là một con số duy nhất cho cả tập dữ liệu và luôn không âm.
Hay nhầm khiKhi đề hỏi "deviation of this value from the mean", nhiều em trả lời bằng ss của cả mẫu thay vì tính xixˉx_i-\bar{x}.

Cùng chủ đề

Nguồn tham khảo

  1. [1]Barron_AP_Stat_2026. tr. 13, 33, 35.

Biên soạn bởi DucklingStudy, bản quyền thuộc DucklingStudy. Xuất bản .