AP Statistics
observational unit
Còn gọi: cá thể · individual · observational unit · unit
Đơn vị quan sát là đối tượng đơn lẻ (người, vật, sự kiện...) mà dữ liệu được thu thập và ghi nhận trên đó trong một nghiên cứu thống kê.
Mỗi nghiên cứu thống kê đều cần trả lời câu hỏi dữ liệu (data) được đo trên cái gì, và câu trả lời chính là đơn vị quan sát — đối tượng cụ thể mà mỗi lần đo, mỗi lần hỏi đều nhắm tới đúng một cá thể duy nhất. Đơn vị quan sát có thể là một học sinh trong khảo sát, một chiếc xe trong thử nghiệm tiêu hao nhiên liệu, hay một quốc gia trong bảng số liệu kinh tế. Những thuộc tính được ghi nhận trên đơn vị quan sát ấy, như tuổi, cân nặng hay thu nhập, gọi là biến.
Trong một bảng dữ liệu chuẩn, mỗi hàng ứng với một đơn vị quan sát và mỗi cột ứng với một biến, nhờ đó người đọc luôn xác định được dòng nào đại diện cho đối tượng nào. Tuy nhiên, nếu đơn vị quan sát bị xác định sai, chẳng hạn nhầm hộ gia đình với cá nhân trong hộ, thì mọi kết luận rút ra sau đó đều mất ý nghĩa dù các phép tính có chính xác đến đâu. Vì vậy, bước đầu tiên khi đọc một đề thống kê luôn là xác định rõ đơn vị quan sát trước khi bàn tới biến số hay phương pháp phân tích.
Trong thí nghiệm có kiểm soát, đơn vị quan sát chính là đối tượng được phân ngẫu nhiên vào các nhóm xử lý để so sánh kết quả, còn trong khảo sát hay nghiên cứu quan sát (observational study) thì nó vẫn giữ nguyên vai trò là cá thể cung cấp một bộ giá trị biến. Nhờ nắm vững khái niệm này, học sinh tránh được lỗi phổ biến là nhầm đơn vị quan sát với tổng thể, vốn là toàn bộ tập hợp mọi đơn vị quan sát mà nghiên cứu muốn suy luận tới.
Trực giác: Giống như mỗi ô trong danh sách điểm danh chỉ ghi tên một học sinh duy nhất — đơn vị quan sát chính là 'một cái tên' đứng sau mỗi dòng dữ liệu.
John GrauntGottfried AchenwallPhilip Sedgwick
Những trang viết mang tính thống kê sớm nhất ở châu Âu có niên đại 1663, khi John Graunt công bố "Natural and Political Observations upon the Bills of Mortality", tức các bảng kê khai sinh tử của London. Muốn cộng, đếm hay so sánh những bảng như vậy, người ta buộc phải thống nhất trước một điều tưởng chừng hiển nhiên: mỗi dòng số liệu ứng với cái gì. Tư duy thống kê thời kỳ này xoay quanh nhu cầu của nhà nước trong việc dựa vào dữ liệu dân số và kinh tế để hoạch định chính sách. Đến thế kỷ 19, phạm vi của ngành mở rộng sang việc thu thập và phân tích dữ liệu nói chung, và câu hỏi "đơn vị là gì" theo đó trở thành bước đầu tiên của mọi nghiên cứu.
Vì sao mang đúng cái tên này? Bản thân chữ "thống kê" đã hé lộ vì sao đơn vị quan sát lại quan trọng đến thế. Từ này bắt nguồn từ tiếng Latin "status", nghĩa là "tình trạng" trong xã hội, và về sau mang nghĩa "nhà nước"; từ đó nhà khoa học chính trị Gottfried Achenwall đặt ra chữ Đức "statistik" vào năm 1749 để chỉ một bản tóm lược tình hình của các quốc gia. Nói cách khác, ngành này sinh ra để mô tả một tập hợp gồm nhiều con người, nên việc chỉ rõ từng cá thể được ghi nhận là yêu cầu có từ gốc rễ. Tên gọi "đơn vị quan sát" vì vậy ghép hai phần rất sát nghĩa: "đơn vị" là phần tử nhỏ nhất mà dữ liệu được ghi lên, còn "quan sát" nhấn mạnh rằng ta chỉ đo đạc chứ không nhất thiết can thiệp vào nó. Một cách diễn đạt phổ biến định nghĩa nó chính là chữ "ai" của nghiên cứu, và tên thay thế "đơn vị đo lường" (unit of measurement) cũng đi theo hướng ấy. Tuy nhiên, cần phân biệt nó với đơn vị nghiên cứu (study unit) — thực thể độc lập nhỏ nhất được phân ngẫu nhiên vào các điều kiện xử lý. Lẫn lộn hai khái niệm này dẫn đến lỗi nhân bản giả (pseudoreplication), khiến cỡ mẫu bị thổi phồng và kết luận mất giá trị; chính nguy cơ đó là lý do cái tên phải được giữ riêng rẽ, rành mạch.
Đơn vị quan sát không phải là biến, mà là đối tượng mang biến.
Khi đề hỏi "mỗi quan sát trong tập dữ liệu này đại diện cho cái gì", nhiều học sinh trả lời ngay là "chiều cao" hoặc "điểm thi" — nhưng đó là biến (variable), tức đặc điểm được đo, chứ không phải thứ được đo. Câu trả lời đúng phải gọi tên đối tượng: "một học sinh lớp 12 của trường", "một trận đấu trong mùa giải". Cách kiểm tra nhanh là đặt câu "mỗi ... có một giá trị chiều cao": chỗ dấu ba chấm chính là đơn vị quan sát, còn chiều cao nằm ở vế sau.
Đơn vị quan sát không nhất thiết là con người.
Nó có thể là một ngày, một tỉnh, một lọ thuốc, một cây trong vườn hay một trận bóng, tùy theo dữ liệu được thu thập ở cấp nào. Cứ hình dung bảng dữ liệu gốc: mỗi hàng là một đơn vị quan sát, mỗi cột là một biến, nên số hàng chính là cỡ mẫu . Vì vậy trước khi trả lời bất kỳ câu hỏi mô tả nào, hãy tự dựng lại bảng đó trong đầu và hỏi "một hàng ở đây là cái gì".
Kết luận rút ra trên nhóm không được áp thẳng cho từng cá nhân trong nhóm.
Nếu dữ liệu là thu nhập trung bình và tỉ lệ tốt nghiệp trung bình của 50 tiểu bang, thì đơn vị quan sát là tiểu bang chứ không phải người dân. Hệ số tương quan tính được khi đó mô tả quan hệ giữa các tiểu bang, và suy ra rằng "người học càng cao thì thu nhập càng cao" là mắc lỗi ngụy biện sinh thái (ecological fallacy). Do đó, khi diễn giải một mối liên hệ, hãy luôn đặt tên đơn vị quan sát vào câu văn để không trượt cấp độ.
Đơn vị thí nghiệm và đơn vị quan sát có thể không trùng nhau.
Chẳng hạn nghiên cứu gán ngẫu nhiên một khẩu phần ăn cho từng lồng chuột nhưng lại cân từng con chuột riêng lẻ: đơn vị thí nghiệm (experimental unit) là cái lồng, còn đơn vị quan sát là con chuột. Khi đó cỡ mẫu dùng cho suy luận thống kê là số lồng, không phải số chuột, vì chỉ có lồng mới được phân nhóm ngẫu nhiên. Nhầm hai khái niệm này sẽ làm phóng đại , khiến sai số chuẩn (standard error) nhỏ giả tạo và kết luận mạnh hơn mức dữ liệu cho phép.
Khi mô tả biểu đồ phân tán, phải nói rõ một chấm là một đơn vị quan sát nào.
Giám khảo thường yêu cầu "describe what one point represents", và câu trả lời chỉ trọn điểm khi nêu đủ ba thứ: tên đơn vị cùng hai biến đi kèm. Viết "mỗi chấm là một trận đấu, với số cú sút trên trục hoành và số bàn thắng trên trục tung" sẽ an toàn hơn hẳn so với "mỗi chấm là số bàn thắng". Thói quen này cũng giúp bạn tự phát hiện mình đang đọc dữ liệu ở cấp nào.
Đếm cỡ mẫu bằng số đơn vị quan sát, đừng đếm số ô hay số biến.
Trong bảng hai chiều, là tổng tất cả các ô vì mỗi cá thể được xếp vào đúng một ô, chứ không phải số hàng nhân số cột. Tương tự, trong biểu đồ chấm thì mỗi chấm là một đơn vị, nên chồng ba chấm tại giá trị 7 nghĩa là ba cá thể cùng nhận giá trị đó. Nhầm chỗ này kéo theo sai bậc tự do và sai toàn bộ kiểm định phía sau.
Khi viết phạm vi suy rộng (scope of inference), nêu rõ quần thể gồm những đơn vị nào.
Lấy mẫu ngẫu nhiên từ danh sách 400 trường thì kết luận chỉ được khái quát cho các trường, chứ không phải cho mọi học sinh trong nước. Câu trả lời mất điểm phổ biến là viết chung chung "có thể suy rộng cho dân số" mà không gọi tên đơn vị; hãy viết thẳng "suy rộng được cho toàn bộ các trường trung học trong danh sách". Nhờ đó bài làm vừa đúng nội dung vừa thể hiện bạn kiểm soát được cấp độ dữ liệu.
Đơn vị quan sát là một học sinh của trường; tổng thể gồm 1 800 học sinh, còn mẫu gồm 250 em được chọn ngẫu nhiên. Bảng dữ liệu có 250 dòng, mỗi dòng một học sinh, và 4 cột biến, trong đó khối lớp cùng phương tiện đi học là biến phân loại, còn số giờ ngủ cùng quãng đường đến trường là biến định lượng.
Đơn vị quan sát của bộ dữ liệu là một trường trung học, nên bảng có đúng 32 dòng chứ không phải 24 800 dòng. Trung bình 75% là trung bình của 32 tỉ lệ ở cấp trường, không phải tỉ lệ đỗ của học sinh toàn tỉnh: với hai trường minh họa, tỉ lệ đỗ tính trên học sinh chỉ xấp xỉ 64,3%. Muốn kết luận về học sinh thì phải thu thập dữ liệu với học sinh làm đơn vị quan sát.
Quiz câu thật từ ngân hàng đề
Vài câu thật gắn đúng khái niệm này, chấm ngay kèm giải thích từng đáp án — hệ thống ghi nhớ bạn nắm tới đâu.
Biên soạn bởi DucklingStudy, bản quyền thuộc DucklingStudy. Xuất bản .