AP Statistics

độ rộng khoảng tin cậy

interval width

Còn gọi: độ rộng khoảng · interval width

Độ rộng khoảng tin cậy là khoảng cách giữa cận trên và cận dưới, bằng hai lần biên sai số, cho biết ước lượng chính xác đến mức nào.

Mỗi khoảng tin cậy (confidence interval) đều có dạng "ước lượng điểm cộng trừ một lượng sai lệch", nên nó trải ra thành một đoạn trên trục số chứ không phải một con số duy nhất. Độ rộng chính là chiều dài của đoạn đó, tức khoảng cách từ cận dưới lên cận trên. Vì ước lượng điểm nằm đúng giữa đoạn, ta luôn có

W=upperlower=2m,W = \text{upper} - \text{lower} = 2m,

trong đó mm là biên sai số (margin of error). Do đó nói về độ rộng hay nói về biên sai số là hai cách diễn đạt của cùng một điều, chỉ khác nhau hệ số 2.

Khi ước lượng tỉ lệ tổng thể, biên sai số có dạng m=zp^(1p^)/nm = z^{*}\sqrt{\hat p(1-\hat p)/n}, nên độ rộng là W=2zp^(1p^)/nW = 2z^{*}\sqrt{\hat p(1-\hat p)/n}. Công thức này cho thấy ba thứ điều khiển độ rộng: giá trị tới hạn zz^{*} (critical value) lớn lên khi ta đòi mức tin cậy cao hơn, độ biến động của dữ liệu, và cỡ mẫu nn nằm dưới dấu căn. Vì vậy tăng mức tin cậy từ 90% lên 99% sẽ kéo khoảng dài ra — muốn chắc chắn hơn thì phải chấp nhận nói mơ hồ hơn. Ngược lại, thu thập thêm dữ liệu làm khoảng hẹp lại mà không phải hy sinh mức tin cậy.

Quan hệ giữa độ rộng và cỡ mẫu là quan hệ căn bậc hai chứ không phải tỉ lệ nghịch thẳng: W1/nW \propto 1/\sqrt{n}. Nhân cỡ mẫu lên ba lần chỉ chia độ rộng cho 31.732\sqrt{3} \approx 1.732, và muốn khoảng hẹp đi một nửa thì phải lấy mẫu gấp bốn lần. Đây là dạng câu hỏi quen thuộc trong đề thi, nên hãy nhớ rằng độ chính xác mua được bằng dữ liệu luôn đắt hơn ta tưởng. Với khoảng tin cậy cho trung bình, mọi lập luận vẫn giữ nguyên, chỉ thay zz^{*} bằng tt^{*} và thay sai số chuẩn tương ứng.

Ký hiệu
  • W=2mW = 2m
  • W=2zp^(1p^)/nW = 2z^{*}\sqrt{\hat p(1-\hat p)/n}
  • W=2ts/nW = 2t^{*}s/\sqrt{n}
Đơn vịCùng đơn vị với biến được ước lượng (khoảng tin cậy cho tỉ lệ thì không có đơn vị)

Trực giác: Giống như dự báo giờ về nhà: nói "từ 6h đến 8h" thì gần như chắc đúng nhưng vô dụng, nói "6h55–7h05" thì hữu ích mà dễ sai — muốn vừa hẹp vừa chắc, phải có thêm thông tin.

Công thức

width=2zp^(1p^)n\text{width}=\htmlClass{fp-3}{2\cdot \htmlClass{fp-0}{z^{*}}\cdot \htmlClass{fp-2}{\sqrt{\htmlClass{fp-1}{\dfrac{\hat p(1-\hat p)}{n}}}}}

dùng khi cần tính hoặc so sánh độ rộng của khoảng tin cậy cho tỉ lệ tổng thể, đặc biệt khi đề hỏi cỡ mẫu hay mức tin cậy thay đổi thì độ rộng thay đổi thế nào.

Trong đó

zz^{*}giá trị tới hạn ứng với mức tin cậy đã chọnp^\hat ptỉ lệ mẫu quan sát đượcnncỡ mẫu

Khái niệm này sinh ra từ đâu

thập niên 1930 (trình bày đầy đủ năm 1937)Jerzy NeymanWaclaw Pytkowski

Độ rộng khoảng tin cậy là hệ quả trực tiếp của khái niệm khoảng tin cậy (confidence interval) do nhà toán học người Ba Lan Jerzy Neyman xây dựng trong thập niên 1930, với bài trình bày đầy đủ đầu tiên công bố năm 1937, nhằm mô tả độ chính xác của một ước lượng mà không phải dựa vào giả định võ đoán nào.

Theo lời kể của chính Neyman, ý tưởng nảy sinh khoảng năm 1930 từ một câu hỏi rất đời thường của Waclaw Pytkowski, sinh viên của ông ở Warsaw khi ấy đang làm một nghiên cứu thực nghiệm về kinh tế nông trại. Câu hỏi là: làm sao mô tả được độ chính xác của một hệ số hồi quy (regression coefficient) đã ước lượng mà không phải áp đặt giả định nào? Trả lời câu hỏi đó, Neyman thay con số đơn lẻ của ước lượng điểm (point estimate) bằng một cặp cận dưới và cận trên. Từ đó, khoảng cách giữa hai cận trở thành thước đo tự nhiên cho mức độ chính xác: khoảng càng hẹp thì ước lượng càng sắc nét.

Vì sao mang đúng cái tên này? Chữ "độ rộng" (width) nghe hình học hơn là thống kê, và đúng là nó mang nghĩa hình học thật. Vì khoảng tin cậy xác định một cận dưới và một cận trên (lower and upper bounds) trên trục số, nó chiếm một đoạn thẳng có bề rộng đo được, thay vì chỉ là một điểm như cách báo cáo cũ. Do đó, nói "khoảng rộng" hay "khoảng hẹp" chính là nói khoảng cách giữa hai đầu mút, và đại lượng ấy mới là phần trả lời cho câu hỏi ban đầu của Pytkowski về độ chính xác. Cũng vì vậy, ba yếu tố chi phối bề rộng đều được đặt tên theo cùng lối trực quan: cỡ mẫu lớn hơn cho khoảng hẹp hơn, còn mức tin cậy (confidence level) cao hơn thì buộc khoảng phải nới rộng ra. Tuy nhiên, cần phân biệt với một cách dùng khác cùng chữ tiếng Anh: trong biểu đồ tần số, "interval width" lại chỉ bề rộng của mỗi nhóm, một nghĩa hoàn toàn riêng.

Thử nghiệm tương tác

Kéo cỡ mẫu và mức tin cậy — nhìn từng thanh khoảng co lại hay dãn ra

Kéo cỡ mẫu và mức tin cậy — nhìn từng thanh khoảng co lại hay dãn ra

Kéo tham số, thấy khái niệm chuyển động — mở khoá bằng tài khoản 0đ.

Tạo tài khoản miễn phí

Hay hiểu sai

Độ rộng khoảng tin cậy là toàn bộ khoảng, không phải biên sai số.

Tăng cỡ mẫu gấp đôi không làm khoảng hẹp đi một nửa.

Độ tin cậy cao hơn cho khoảng rộng hơn, không phải khoảng chính xác hơn.

Khoảng hẹp không có nghĩa là ước lượng gần đúng tham số.

Mẹo phòng thi

Khi đề hỏi "khoảng sẽ thay đổi thế nào", nêu rõ yếu tố nào đổi và theo chiều nào.

Đề cho độ rộng tối đa thì phải giải ra nn và làm tròn lên.

Có thể suy ngược từ khoảng cho sẵn ra thống kê mẫu và biên sai số.

Tần suất trong đề AP StatisticsThường xuyên

Ví dụ có lời giải

1Ví dụ 1/2
Một tổ chức khảo sát chọn ngẫu nhiên 400 cử tri trưởng thành trong một thành phố và hỏi họ có ủng hộ dự án xây tuyến metro mới hay không. Kết quả cho thấy 240 người trả lời "ủng hộ". Nhóm nghiên cứu muốn ước lượng tỉ lệ cử tri ủng hộ dự án trong toàn thành phố bằng khoảng tin cậy, đồng thời tìm hiểu xem độ rộng của khoảng này phụ thuộc vào những yếu tố nào.
  1. aXây dựng khoảng tin cậy 95% cho tỉ lệ cử tri ủng hộ dự án và tính độ rộng của khoảng đó.
  2. bNếu muốn độ rộng của khoảng tin cậy 95% chỉ còn một nửa so với câu (a), cần khảo sát bao nhiêu cử tri? Giả sử tỉ lệ mẫu thu được vẫn xấp xỉ như cũ.
  3. cVẫn giữ nguyên 400 cử tri nhưng nâng mức tin cậy lên 99%, độ rộng khoảng tin cậy thay đổi như thế nào?
1Bước 1: Trước hết cần kiểm tra điều kiện. Mẫu được chọn ngẫu nhiên, số cử tri của một thành phố chắc chắn lớn hơn 10×400=400010 \times 400 = 4000 nên điều kiện độc lập được thỏa mãn. Với p^=240/400=0,60\hat{p} = 240/400 = 0{,}60, ta có np^=24010n\hat{p} = 240 \ge 10n(1p^)=16010n(1-\hat{p}) = 160 \ge 10, nên phân bố mẫu của tỉ lệ mẫu xấp xỉ chuẩn và ta được phép dùng khoảng tin cậy dạng zz.
2Bước 2: Tính sai số chuẩn (standard error) của tỉ lệ mẫu: SE=p^(1p^)n=0,60×0,40400=0,00060,02449.SE = \sqrt{\frac{\hat{p}(1-\hat{p})}{n}} = \sqrt{\frac{0{,}60 \times 0{,}40}{400}} = \sqrt{0{,}0006} \approx 0{,}02449. Con số này đo mức dao động điển hình của tỉ lệ mẫu quanh tỉ lệ thật của tổng thể khi ta lặp lại việc lấy mẫu 400 người.
3Bước 3: Với mức tin cậy (confidence level) 95%, giá trị tới hạn (critical value) là z=1,96z^* = 1{,}96. Biên sai số (margin of error) bằng ME=1,96×0,024490,0480ME = 1{,}96 \times 0{,}02449 \approx 0{,}0480, do đó khoảng tin cậy là 0,60±0,04800{,}60 \pm 0{,}0480, tức (0,552; 0,648)(0{,}552;\ 0{,}648). Độ rộng chính là khoảng cách giữa hai đầu mút, bằng đúng hai lần biên sai số: W=2×0,0480=0,0960W = 2 \times 0{,}0480 = 0{,}0960, hay khoảng 9,6 điểm phần trăm.
4Bước 4: Sang câu (b), hãy nhìn vào cấu trúc của công thức: W=2zp^(1p^)/nW = 2z^*\sqrt{\hat{p}(1-\hat{p})/n}, nghĩa là WW tỉ lệ nghịch với n\sqrt{n}. Muốn WW giảm một nửa thì n\sqrt{n} phải tăng gấp đôi, tức nn phải tăng gấp bốn. Vậy cần n=4×400=1600n = 4 \times 400 = 1600 cử tri. Kiểm chứng lại: SE=0,24/1600=0,012247SE = \sqrt{0{,}24/1600} = 0{,}012247, ME=1,96×0,0122470,0240ME = 1{,}96 \times 0{,}012247 \approx 0{,}0240, nên W0,0480W \approx 0{,}0480 — đúng bằng một nửa của 0,0960.
5Bước 5: Với câu (c), cỡ mẫu không đổi nên sai số chuẩn vẫn là 0,02449, chỉ giá trị tới hạn thay đổi thành z=2,576z^* = 2{,}576. Khi đó ME=2,576×0,024490,0631ME = 2{,}576 \times 0{,}02449 \approx 0{,}0631W0,1262W \approx 0{,}1262. So với khoảng 95%, độ rộng đã tăng theo tỉ số 2,576/1,961,312{,}576/1{,}96 \approx 1{,}31, tức rộng thêm chừng 31%.

Ta tin cậy 95% rằng tỉ lệ cử tri trưởng thành trong thành phố ủng hộ dự án metro nằm trong khoảng từ 0,552 đến 0,648; khoảng này có độ rộng 0,096 (9,6 điểm phần trăm). Muốn thu hẹp độ rộng xuống một nửa mà vẫn giữ mức tin cậy 95%, phải khảo sát 1600 cử tri, tức gấp bốn lần cỡ mẫu ban đầu. Ngược lại, nếu giữ nguyên 400 cử tri mà đòi mức tin cậy 99% thì độ rộng nở ra thành khoảng 0,126. Hai câu sau cho thấy rõ sự đánh đổi cốt lõi của ước lượng khoảng: muốn chắc chắn hơn mà không chịu tốn thêm dữ liệu thì phải chấp nhận một kết luận mơ hồ hơn.

2Ví dụ 2/2
Một nhóm học sinh nghiên cứu thời gian tự học mỗi ngày của học sinh lớp 12 trong trường. Họ chọn ngẫu nhiên 50 học sinh và ghi nhận thời gian trung bình mẫu là 68,4 phút với độ lệch chuẩn mẫu 6,0 phút. Đồ thị hộp của dữ liệu không có giá trị ngoại lai (outlier) và không cho thấy dấu hiệu lệch mạnh, nên điều kiện dùng phân phối tt được xem là thỏa mãn.
  1. aTính khoảng tin cậy 95% cho thời gian tự học trung bình của học sinh lớp 12 trong trường và cho biết độ rộng của khoảng.
  2. bNói chung, nếu nhóm nghiên cứu lặp lại khảo sát với cỡ mẫu gấp ba lần (150 học sinh) và thu được cùng trung bình mẫu, cùng độ lệch chuẩn mẫu, thì độ rộng khoảng tin cậy 95% thay đổi ra sao? (A) rộng gấp 3 lần; (B) hẹp đi 3 lần; (C) rộng gấp 1,732 lần; (D) hẹp đi khoảng 1,732 lần; (E) không đủ dữ kiện để trả lời.
1Bước 1: Với n=50n = 50, bậc tự do là df=501=49df = 50 - 1 = 49, nên giá trị tới hạn hai phía ứng với 95% là t2,010t^* \approx 2{,}010. Sai số chuẩn của trung bình mẫu bằng SE=sn=6,0500,8485.SE = \frac{s}{\sqrt{n}} = \frac{6{,}0}{\sqrt{50}} \approx 0{,}8485. Đây là mức dao động điển hình của trung bình mẫu quanh trung bình thật của toàn khối 12.
2Bước 2: Biên sai số là ME=2,010×0,84851,71ME = 2{,}010 \times 0{,}8485 \approx 1{,}71 phút, cho khoảng tin cậy 68,4±1,7168{,}4 \pm 1{,}71, tức (66,69; 70,11)(66{,}69;\ 70{,}11). Độ rộng bằng W1=2×1,713,41W_1 = 2 \times 1{,}71 \approx 3{,}41 phút.
3Bước 3: Sang câu (b), hãy lập luận trên công thức tổng quát W=2ts/nW = 2t^*s/\sqrt{n} trước khi cắm số. Khi ss và mức tin cậy giữ nguyên, phần duy nhất thay đổi đáng kể là n\sqrt{n} ở mẫu số; thay nn bằng 3n3n thì 3n=3n\sqrt{3n} = \sqrt{3}\sqrt{n}, nên độ rộng bị chia cho 31,732\sqrt{3} \approx 1{,}732. Vậy đáp án là (D).
4Bước 4: Kiểm chứng bằng số cho chắc. Với n=150n = 150 thì df=149df = 149t1,976t^* \approx 1{,}976, còn SE=6,0/1500,4899SE = 6{,}0/\sqrt{150} \approx 0{,}4899. Khi đó ME1,976×0,48990,97ME \approx 1{,}976 \times 0{,}4899 \approx 0{,}97 phút và W21,94W_2 \approx 1{,}94 phút, cho khoảng (67,43; 69,37)(67{,}43;\ 69{,}37). Tỉ số W1/W2=3,41/1,941,76W_1/W_2 = 3{,}41/1{,}94 \approx 1{,}76, rất sát với 1,732; phần chênh nhỏ là do tt^* giảm nhẹ khi bậc tự do tăng, còn lập luận 1/n1/\sqrt{n} vẫn là ý chính mà đề nhắm tới.

Với mẫu 50 học sinh, ta tin cậy 95% rằng thời gian tự học trung bình mỗi ngày của học sinh lớp 12 trong trường nằm trong khoảng từ 66,69 đến 70,11 phút, một khoảng rộng khoảng 3,41 phút. Nếu tăng cỡ mẫu lên gấp ba lần mà trung bình và độ lệch chuẩn mẫu không đổi, độ rộng sẽ hẹp lại còn chừng 1,94 phút, tức chia cho xấp xỉ 31,732\sqrt{3} \approx 1{,}732 — đáp án (D). Điều cần nhớ là độ rộng giảm theo 1/n1/\sqrt{n} chứ không theo 1/n1/n: gom thêm dữ liệu luôn có ích, nhưng lợi ích thu về chậm dần, và muốn khoảng hẹp đi một nửa thì phải trả giá bằng cỡ mẫu gấp bốn.

Bạn nắm chắc chưa?

Quiz câu thật từ ngân hàng đề

Vài câu thật gắn đúng khái niệm này, chấm ngay kèm giải thích từng đáp án — hệ thống ghi nhớ bạn nắm tới đâu.

Tạo tài khoản miễn phí

Học tiếp từ đây

Mục tiêu và lộ trình unit xem miễn phí — làm bài tập và lưu tiến độ cần tài khoản 0đ.

Hay nhầm với

Khác nhau ở đâuSai số biên là nửa độ rộng, đo khoảng cách từ ước lượng điểm tới mỗi đầu mút. Độ rộng là toàn bộ khoảng, bằng hai lần sai số biên.
Hay nhầm khiĐề cho hai đầu mút của khoảng rồi hỏi sai số biên, thí sinh hay lấy hiệu hai đầu mút mà quên chia đôi.
Khác nhau ở đâuĐộ tin cậy là mức phần trăm do người làm chọn trước khi tính. Độ rộng là kết quả tính ra, phụ thuộc độ tin cậy, cỡ mẫu và độ phân tán.
Hay nhầm khiCâu hỏi yêu cầu giữ độ rộng cũ nhưng tăng độ tin cậy, thí sinh quên rằng khi đó phải tăng cỡ mẫu.

Cùng chủ đề

Nguồn tham khảo

  1. [1]Barron_AP_Stat_2026. tr. 335, 379, 616.

Biên soạn bởi DucklingStudy, bản quyền thuộc DucklingStudy. Xuất bản .