AP Statistics

đơn vị quan sát

observational unit

Còn gọi: cá thể · individual · observational unit · unit

Đơn vị quan sát là đối tượng đơn lẻ (người, vật, sự kiện...) mà dữ liệu được thu thập và ghi nhận trên đó trong một nghiên cứu thống kê.

Mỗi nghiên cứu thống kê đều cần trả lời câu hỏi dữ liệu (data) được đo trên cái gì, và câu trả lời chính là đơn vị quan sát — đối tượng cụ thể mà mỗi lần đo, mỗi lần hỏi đều nhắm tới đúng một cá thể duy nhất. Đơn vị quan sát có thể là một học sinh trong khảo sát, một chiếc xe trong thử nghiệm tiêu hao nhiên liệu, hay một quốc gia trong bảng số liệu kinh tế. Những thuộc tính được ghi nhận trên đơn vị quan sát ấy, như tuổi, cân nặng hay thu nhập, gọi là biến.

Trong một bảng dữ liệu chuẩn, mỗi hàng ứng với một đơn vị quan sát và mỗi cột ứng với một biến, nhờ đó người đọc luôn xác định được dòng nào đại diện cho đối tượng nào. Tuy nhiên, nếu đơn vị quan sát bị xác định sai, chẳng hạn nhầm hộ gia đình với cá nhân trong hộ, thì mọi kết luận rút ra sau đó đều mất ý nghĩa dù các phép tính có chính xác đến đâu. Vì vậy, bước đầu tiên khi đọc một đề thống kê luôn là xác định rõ đơn vị quan sát trước khi bàn tới biến số hay phương pháp phân tích.

Trong thí nghiệm có kiểm soát, đơn vị quan sát chính là đối tượng được phân ngẫu nhiên vào các nhóm xử lý để so sánh kết quả, còn trong khảo sát hay nghiên cứu quan sát (observational study) thì nó vẫn giữ nguyên vai trò là cá thể cung cấp một bộ giá trị biến. Nhờ nắm vững khái niệm này, học sinh tránh được lỗi phổ biến là nhầm đơn vị quan sát với tổng thể, vốn là toàn bộ tập hợp mọi đơn vị quan sát mà nghiên cứu muốn suy luận tới.

Trực giác: Giống như mỗi ô trong danh sách điểm danh chỉ ghi tên một học sinh duy nhất — đơn vị quan sát chính là 'một cái tên' đứng sau mỗi dòng dữ liệu.

Khái niệm này sinh ra từ đâu

John GrauntGottfried AchenwallPhilip Sedgwick

Đơn vị quan sát là khái niệm nền của thống kê mô tả, dùng để trả lời câu hỏi "ai hay cái gì đang được đo"; nó lớn lên cùng chính ngành thống kê, vốn khởi đầu từ việc các nhà nước châu Âu thế kỷ 17–18 ghi chép số liệu về dân cư và của cải.

Những trang viết mang tính thống kê sớm nhất ở châu Âu có niên đại 1663, khi John Graunt công bố "Natural and Political Observations upon the Bills of Mortality", tức các bảng kê khai sinh tử của London. Muốn cộng, đếm hay so sánh những bảng như vậy, người ta buộc phải thống nhất trước một điều tưởng chừng hiển nhiên: mỗi dòng số liệu ứng với cái gì. Tư duy thống kê thời kỳ này xoay quanh nhu cầu của nhà nước trong việc dựa vào dữ liệu dân số và kinh tế để hoạch định chính sách. Đến thế kỷ 19, phạm vi của ngành mở rộng sang việc thu thập và phân tích dữ liệu nói chung, và câu hỏi "đơn vị là gì" theo đó trở thành bước đầu tiên của mọi nghiên cứu.

Vì sao mang đúng cái tên này? Bản thân chữ "thống kê" đã hé lộ vì sao đơn vị quan sát lại quan trọng đến thế. Từ này bắt nguồn từ tiếng Latin "status", nghĩa là "tình trạng" trong xã hội, và về sau mang nghĩa "nhà nước"; từ đó nhà khoa học chính trị Gottfried Achenwall đặt ra chữ Đức "statistik" vào năm 1749 để chỉ một bản tóm lược tình hình của các quốc gia. Nói cách khác, ngành này sinh ra để mô tả một tập hợp gồm nhiều con người, nên việc chỉ rõ từng cá thể được ghi nhận là yêu cầu có từ gốc rễ. Tên gọi "đơn vị quan sát" vì vậy ghép hai phần rất sát nghĩa: "đơn vị" là phần tử nhỏ nhất mà dữ liệu được ghi lên, còn "quan sát" nhấn mạnh rằng ta chỉ đo đạc chứ không nhất thiết can thiệp vào nó. Một cách diễn đạt phổ biến định nghĩa nó chính là chữ "ai" của nghiên cứu, và tên thay thế "đơn vị đo lường" (unit of measurement) cũng đi theo hướng ấy. Tuy nhiên, cần phân biệt nó với đơn vị nghiên cứu (study unit) — thực thể độc lập nhỏ nhất được phân ngẫu nhiên vào các điều kiện xử lý. Lẫn lộn hai khái niệm này dẫn đến lỗi nhân bản giả (pseudoreplication), khiến cỡ mẫu bị thổi phồng và kết luận mất giá trị; chính nguy cơ đó là lý do cái tên phải được giữ riêng rẽ, rành mạch.

Hay hiểu sai

Đơn vị quan sát không phải là biến, mà là đối tượng mang biến.

Đơn vị quan sát không nhất thiết là con người.

Kết luận rút ra trên nhóm không được áp thẳng cho từng cá nhân trong nhóm.

Đơn vị thí nghiệm và đơn vị quan sát có thể không trùng nhau.

Mẹo phòng thi

Khi mô tả biểu đồ phân tán, phải nói rõ một chấm là một đơn vị quan sát nào.

Đếm cỡ mẫu bằng số đơn vị quan sát, đừng đếm số ô hay số biến.

Khi viết phạm vi suy rộng (scope of inference), nêu rõ quần thể gồm những đơn vị nào.

Tần suất trong đề AP StatisticsThường xuyên

Ví dụ có lời giải

1Ví dụ 1/2
Ban giám hiệu một trường trung học có 1 800 học sinh muốn tìm hiểu thói quen đi lại và giấc ngủ. Nhà trường chọn ngẫu nhiên 250 học sinh và phát cho mỗi em một phiếu hỏi. Mỗi phiếu ghi lại bốn thông tin: khối lớp đang học (10, 11 hay 12), số giờ ngủ trung bình mỗi đêm, phương tiện đi học (đi bộ, xe đạp, xe buýt, xe máy điện) và quãng đường từ nhà đến trường tính bằng kilômét. Toàn bộ 250 phiếu đều được thu về và nhập vào một bảng tính.
  1. aĐơn vị quan sát trong nghiên cứu này là gì? Chỉ rõ đâu là tổng thể và đâu là mẫu.
  2. bBảng dữ liệu sau khi nhập xong có bao nhiêu dòng và bao nhiêu cột? Phân loại bốn biến được ghi nhận.
1Bước 1: Hỏi xem thông tin được đo trên cái gì. Mỗi phiếu hỏi ứng với đúng một học sinh, và bốn con số hay bốn nhãn trên phiếu đều mô tả riêng em học sinh đó. Vậy đơn vị quan sát là một học sinh của trường, chứ không phải một khối lớp, cũng không phải cả trường.
2Bước 2: Phân biệt nhóm được quan tâm với nhóm thực sự được đo. Nhà trường muốn kết luận cho cả 1 800 học sinh, nên tổng thể (population) là toàn bộ 1 800 học sinh của trường; 250 em được chọn ngẫu nhiên và trả lời phiếu tạo thành mẫu. Lưu ý rằng cả tổng thể lẫn mẫu đều là tập hợp của cùng một loại đơn vị quan sát: học sinh.
3Bước 3: Dựng cấu trúc bảng dữ liệu theo quy ước: mỗi dòng là một đơn vị quan sát, mỗi cột là một biến. Do đó bảng có 250250 dòng ứng với 250250 học sinh, và có 44 cột biến; nếu thêm một cột mã số phiếu để nhận diện từng em thì bảng gồm 250×5250 \times 5 ô dữ liệu. Con số dòng bằng cỡ mẫu chính là dấu hiệu kiểm tra nhanh xem ta đã xác định đúng đơn vị quan sát hay chưa.
4Bước 4: Xét từng cột xem giá trị của nó là nhãn hay là số đo có ý nghĩa cộng trừ. Khối lớp và phương tiện đi học là biến phân loại (categorical variable) vì giá trị của chúng là tên nhóm; số giờ ngủ và quãng đường đến trường là biến định lượng (quantitative variable) vì chúng là số đo mà ta có thể lấy trung bình. Ba học sinh ngủ 6, 7 và 8 giờ có trung bình (6+7+8)/3=7(6+7+8)/3 = 7 giờ, trong khi "trung bình của lớp 10 và lớp 12" thì vô nghĩa.

Đơn vị quan sát là một học sinh của trường; tổng thể gồm 1 800 học sinh, còn mẫu gồm 250 em được chọn ngẫu nhiên. Bảng dữ liệu có 250 dòng, mỗi dòng một học sinh, và 4 cột biến, trong đó khối lớp cùng phương tiện đi học là biến phân loại, còn số giờ ngủ cùng quãng đường đến trường là biến định lượng.

2Ví dụ 2/2
Một nhóm nghiên cứu giáo dục thu thập số liệu từ 32 trường trung học trong một tỉnh, tổng cộng 24 800 học sinh. Với mỗi trường, nhóm ghi lại ba thông tin: sĩ số toàn trường, tỉ lệ phần trăm học sinh đỗ kỳ thi tốt nghiệp và mức lương trung bình của giáo viên. Nhìn vào số liệu, một thành viên nhận xét: "Trung bình cộng tỉ lệ đỗ của 32 trường là 75%, vậy khoảng 75% học sinh trong tỉnh đã đỗ."
  1. aXác định đơn vị quan sát của bộ dữ liệu và cho biết bảng dữ liệu có bao nhiêu dòng.
  2. bDùng hai trường minh họa dưới đây để giải thích vì sao nhận xét trên không đúng: trường X có 200 học sinh với tỉ lệ đỗ 90%, trường Y có 1 200 học sinh với tỉ lệ đỗ 60%.
1Bước 1: Đọc kỹ xem mỗi bộ ba số liệu mô tả ai. Sĩ số, tỉ lệ đỗ và lương trung bình đều là đặc trưng của cả một trường chứ không của riêng em học sinh nào, nên đơn vị quan sát ở đây là một trường trung học. Bảng dữ liệu vì thế chỉ có 3232 dòng và 33 cột biến, mặc dù đằng sau nó là 24 800 con người.
2Bước 2: Đối chiếu quy mô: trung bình mỗi trường có 24800/32=77524\,800/32 = 775 học sinh. Con số 24 800 chỉ nói lên rằng dữ liệu đã được gộp lại trước khi ghi, chứ không biến học sinh thành đơn vị quan sát. Nhầm hai cấp độ này với nhau là sai lầm thường gặp nhất khi đọc dữ liệu đã tổng hợp.
3Bước 3: Kiểm chứng nhận xét bằng hai trường minh họa. Trung bình cộng hai tỉ lệ đỗ là (90%+60%)/2=75%(90\% + 60\%)/2 = 75\%, nhưng số học sinh đỗ thực tế là 0,90×200=1800{,}90 \times 200 = 180 em ở trường X và 0,60×1200=7200{,}60 \times 1\,200 = 720 em ở trường Y.
4Bước 4: Tính lại tỉ lệ đỗ khi lấy học sinh làm đơn vị quan sát: 180+720200+1200=90014000,643.\frac{180 + 720}{200 + 1\,200} = \frac{900}{1\,400} \approx 0{,}643. Chỉ khoảng 64,3%64{,}3\% học sinh đỗ, thấp hơn hẳn con số 75%, vì trường đông học sinh và có tỉ lệ đỗ thấp bị đếm ngang bằng với trường ít học sinh. Suy diễn kết luận của cấp trường xuống cho từng cá nhân như vậy gọi là ngộ nhận sinh thái (ecological fallacy).

Đơn vị quan sát của bộ dữ liệu là một trường trung học, nên bảng có đúng 32 dòng chứ không phải 24 800 dòng. Trung bình 75% là trung bình của 32 tỉ lệ ở cấp trường, không phải tỉ lệ đỗ của học sinh toàn tỉnh: với hai trường minh họa, tỉ lệ đỗ tính trên học sinh chỉ xấp xỉ 64,3%. Muốn kết luận về học sinh thì phải thu thập dữ liệu với học sinh làm đơn vị quan sát.

Bạn nắm chắc chưa?

Quiz câu thật từ ngân hàng đề

Vài câu thật gắn đúng khái niệm này, chấm ngay kèm giải thích từng đáp án — hệ thống ghi nhớ bạn nắm tới đâu.

Tạo tài khoản miễn phí

Học tiếp từ đây

Mục tiêu và lộ trình unit xem miễn phí — làm bài tập và lưu tiến độ cần tài khoản 0đ.

Hay nhầm với

Khác nhau ở đâuĐơn vị quan sát chỉ được đo đạc, người nghiên cứu không can thiệp gì. Đơn vị thí nghiệm là đối tượng được gán một xử lý trong thí nghiệm.
Hay nhầm khiĐề mô tả một nghiên cứu rồi hỏi "identify the units"; nếu có phân nhóm xử lý thì phải gọi là đơn vị thí nghiệm, nếu chỉ ghi nhận số liệu thì gọi là đơn vị quan sát.
Khác nhau ở đâuĐơn vị quan sát có thể là bất kỳ cá thể nào, kể cả cây trồng, lô hàng hay trận đấu. Đối tượng nghiên cứu là tên gọi riêng khi các đơn vị đó là con người.
Hay nhầm khiCâu hỏi về thí nghiệm lâm sàng trên bệnh nhân: nhiều bạn trả lời "observational units" trong khi đáp án mong đợi chữ "subjects".

Cùng chủ đề

Biên soạn bởi DucklingStudy, bản quyền thuộc DucklingStudy. Xuất bản .