AP Statistics
population distribution
Còn gọi: population distribution
Phân phối tổng thể là cách mô tả toàn bộ giá trị của một biến trên mọi cá thể trong tổng thể, cho biết hình dạng, tâm và độ phân tán của biến đó.
Khi ta quan tâm tới một biến nào đó — chiều cao của tất cả học sinh lớp 12 trong thành phố, hay ý kiến ủng hộ của toàn bộ cử tri — thì tập hợp mọi giá trị của biến ấy trên mọi cá thể tạo thành phân phối tổng thể. Nó trả lời ba câu hỏi quen thuộc: các giá trị tụ quanh đâu, trải rộng ra sao, và dáng của chúng đối xứng hay lệch. Những con số tóm tắt phân phối này được gọi là tham số (parameter), thường ký hiệu cho trung bình, cho độ lệch chuẩn (standard deviation) và cho tỉ lệ.
Điều làm khái niệm này quan trọng là ta gần như không bao giờ nhìn thấy nó trọn vẹn. Trong thực tế, người nghiên cứu chỉ rút ra một mẫu ngẫu nhiên gồm cá thể, và biểu đồ của giá trị đó là phân phối mẫu (sample distribution) — một bản sao còn nhiễu của bản gốc. Tuy nhiên, bản sao ấy không nhiễu mãi: cỡ mẫu càng lớn thì hình dạng của phân phối mẫu càng bám sát phân phối tổng thể, và các thống kê như , càng xấp xỉ tốt , . Nhờ đó, suy luận thống kê mới có cơ sở.
Cần phân biệt rõ nó với một đối tượng thứ ba hay bị lẫn trong đề thi: phân phối của thống kê mẫu (sampling distribution), tức phân phối của khi ta lặp lại việc lấy mẫu vô số lần. Hai thứ này mô tả những biến động khác hẳn nhau — một bên là sự khác biệt giữa các cá thể, bên kia là sự khác biệt giữa các mẫu. Quan hệ giữa chúng được nêu bởi định lý giới hạn trung tâm (central limit theorem):
Trung bình của các trung bình mẫu đúng bằng trung bình tổng thể, còn độ phân tán thì co lại theo . Vì vậy, dù phân phối tổng thể lệch đến đâu, với đủ lớn hình dạng của vẫn tiến về chuẩn.
Trực giác: Giống như sổ ghi kích cỡ của từng hạt gạo trong cả kho tỉnh: nhìn vào đó thấy hạt cỡ trung bình bao nhiêu, to nhỏ chênh lệch ra sao, dáng phân bố lệch hay cân — đó là chân dung của cả kho, chứ không phải của một nắm bốc ra.
thế kỷ 17–18John GrauntEdmond HalleyAbraham de MoivrePierre-Simon LaplaceGottfried Achenwall
Các vương triều châu Âu cần biết mình cai trị bao nhiêu người, bao nhiêu người chết mỗi năm, chết vì bệnh gì — không phải vì tò mò mà vì thuế và quân dịch. Năm 1663, John Graunt công bố tập quan sát dựa trên sổ khai tử London, và trước đó ông đã dựng bảng tử vong rồi tính tuổi thọ trung bình; năm 1693 Halley làm tiếp công việc ấy, nối tỷ lệ chết với tuổi. Những bảng biểu đó chính là hình hài đầu tiên của một phân phối tổng thể: toàn bộ dân cư được sắp theo từng độ tuổi kèm tần số. Phần toán học đến sau, khi de Moivre năm 1733 tìm ra đường cong trơn mô tả dạng phân tán này.
Vì sao mang đúng cái tên này? Cái tên nghe lạ ở chỗ vì sao lại gọi là "tổng thể" — tiếng Anh dùng chữ population, tức là "dân số". Lý do nằm ở lịch sử chứ không ở toán học: ngành thống kê sinh ra từ việc nhà nước đếm dân, nên đối tượng nghiên cứu mặc định thời ấy đúng là một dân cư thật. Chính chữ "statistics" cũng mang gốc ấy: tiếng Latin status nghĩa là "tình trạng", sang Latin hậu kỳ chuyển thành "nhà nước", và Gottfried Achenwall năm 1749 đặt ra chữ Statistik trong tiếng Đức để chỉ khoa học mô tả tình hình quốc gia. Về sau, khi thống kê được dùng cho bóng đèn, hạt giống hay điểm thi, chữ population vẫn được giữ nguyên dù chẳng còn người nào trong đó — và tiếng Việt dịch thoát thành "tổng thể" để tránh hiểu lầm rằng phải là người. Chữ "phân phối" thì đến từ nhánh xác suất: nó mô tả các giá trị được rải ra sao trên trục số, như đường cong mà de Moivre gọi tên và Laplace mở rộng thành định lý giới hạn trung tâm (central limit theorem).
Rút mẫu nhiều lần — hình tổng thể đứng yên, chỉ có mẫu nhảy
Kéo tham số, thấy khái niệm chuyển động — mở khoá bằng tài khoản 0đ.
Có trung bình và độ lệch chuẩn không có nghĩa là tổng thể phân phối chuẩn.
Mọi phân phối đều có trung bình và độ lệch chuẩn, kể cả phân phối lệch nặng hay hai đỉnh, nên hai con số đó không nói gì về HÌNH DẠNG. Trong câu hỏi cho bảng tần số tương đối với trung bình và độ lệch chuẩn , nhiều thí sinh vội kết luận tổng thể chuẩn rồi áp quy tắc ––. Nhưng khi đọc kỹ bảng, tỉ lệ dồn về hai đầu và còn giữa chỉ , tức là mô hình lưỡng đỉnh (bimodal) chứ không phải hình chuông. Vì vậy hãy luôn nhìn dáng của bảng hoặc biểu đồ trước khi nói bất cứ điều gì về tính chuẩn.
Phân phối tổng thể khác phân phối của trung bình mẫu.
Phân phối tổng thể mô tả từng cá thể trong toàn bộ tổng thể, còn phân phối mẫu (sampling distribution) của mô tả cách trung bình dao động khi ta lấy đi lấy lại nhiều mẫu cùng cỡ. Hai thứ này có cùng tâm nhưng độ phân tán rất khác: , nghĩa là phân phối của trung bình mẫu hẹp hơn nhiều lần. Do đó nói "cỡ mẫu lớn nên tổng thể trở thành chuẩn" là sai hoàn toàn; cỡ mẫu không đụng được gì tới tổng thể.
Định lý giới hạn trung tâm không làm tổng thể lệch trở nên đối xứng.
Định lý giới hạn trung tâm (central limit theorem) chỉ nói rằng khi đủ lớn, phân phối của xấp xỉ chuẩn, bất kể tổng thể gốc có hình dáng ra sao. Tổng thể vẫn giữ nguyên độ lệch và các đỉnh của nó dù ta lấy mẫu một trăm hay một triệu lần. Khi trình bày lời giải, hãy viết rõ đối tượng nào đang xấp xỉ chuẩn, vì chấm bài bắt lỗi ngay ở chỗ nhầm chủ ngữ này.
Ký hiệu , dành cho tổng thể; , dành cho mẫu.
Đây là lỗi mất điểm dễ nhất mà cũng phổ biến nhất: đề cho "the mean and standard deviation of the sample data" thì hai con số đó là thống kê mẫu, phải viết và , không được viết và . Một tham số (parameter) là con số cố định nhưng thường chưa biết của tổng thể, còn thống kê mẫu thay đổi theo từng mẫu. Nhầm ký hiệu khiến toàn bộ phần diễn giải sau đó trở nên vô nghĩa, kể cả khi phép tính đúng.
Gặp bảng tần số tương đối, hãy nhìn dãy số dồn về đâu trước khi tính toán.
Nếu các tỉ lệ cao nằm ở hai đầu và thấp ở giữa thì mô hình lưỡng đỉnh; nếu giảm dần về một phía thì lệch; chỉ khi cao ở giữa và giảm đều hai bên mới nghĩ tới chuẩn. Trong bài tự luận, câu trả lời được điểm phải nêu bằng chứng cụ thể từ bảng, chẳng hạn "tỉ lệ ở hai khoảng ngoài cùng lớn hơn ở các khoảng giữa", chứ không chỉ viết "phân phối không chuẩn".
Viết ra bằng chữ đối tượng mà bạn đang mô tả phân phối.
Một câu chuẩn có ba thành phần: tên biến, đơn vị đo, và nó thuộc tổng thể hay thuộc mẫu hay là trung bình mẫu. Chẳng hạn "phân phối của trong tổng thể" khác hẳn "phân phối của với ". Nhiều bài mất điểm không phải vì tính sai mà vì giám khảo không xác định được thí sinh đang nói về cái gì.
Trước khi dùng thủ tục suy luận, kiểm tra điều kiện chứ đừng giả định tổng thể chuẩn.
Nếu đề chỉ cho dữ liệu mẫu, hãy dựa vào biểu đồ hoặc bảng để nhận xét hình dạng, rồi lập luận qua cỡ mẫu nếu tổng thể không chuẩn. Trình bày theo thứ tự: nêu điều kiện, chỉ ra bằng chứng, kết luận điều kiện có thỏa hay không. Bỏ bước này thì dù kết quả số đúng, phần lập luận vẫn bị trừ điểm.
Dữ liệu 200 chai có dạng đối xứng một đỉnh, tâm ở ml với ml, và khoảng số chai trong cả lô được ước lượng là có sai lệch nhỏ hơn ml. Bảng mô tả phân phối mẫu chứ không phải phân phối tổng thể; tăng cỡ mẫu lên 2000 chỉ làm phân phối mẫu tiến gần hơn tới phân phối tổng thể của lô hàng, còn bản thân phân phối tổng thể vẫn giữ nguyên.
Vì mẫu ngẫu nhiên, thỏa điều kiện và , phân phối của trung bình mẫu xấp xỉ chuẩn với tâm 28 phút và độ lệch chuẩn khoảng phút, bất chấp phân phối tổng thể lệch phải mạnh. Xác suất để thời gian đi làm trung bình của 50 người được chọn vượt quá 31 phút là khoảng , tức chưa tới .
Quiz câu thật từ ngân hàng đề
Vài câu thật gắn đúng khái niệm này, chấm ngay kèm giải thích từng đáp án — hệ thống ghi nhớ bạn nắm tới đâu.
Biên soạn bởi DucklingStudy, bản quyền thuộc DucklingStudy. Xuất bản .