Khoảng biến thiên, khoảng tứ phân vị, phương sai, độ lệch chuẩn và phát hiện giá trị bất thường bằng biểu đồ hộp.
Dưới đây là điểm trung bình môn học kì I của hai bạn An và Bình:
| Học sinh | Toán | Vật lí | Hoá học | Ngữ văn | Lịch sử | Địa lí | Tin học | Tiếng Anh |
|---|---|---|---|---|---|---|---|---|
| An | 9,2 | 8,7 | 9,5 | 6,8 | 8,0 | 8,0 | 7,3 | 6,5 |
| Bình | 8,2 | 8,1 | 8,0 | 7,8 | 8,3 | 7,9 | 7,6 | 8,1 |
Điểm trung bình môn học kì I của An và Bình đều là 8,0 nhưng rõ ràng Bình “học đều” hơn An. Có thể dùng những số đặc trưng nào để đo mức độ “học đều”?
Bài này sẽ giới thiệu một vài số đặc trưng như vậy.
Một cổ động viên đã thống kê điểm số mà hai câu lạc bộ Leicester City và Everton đạt được trong 5 mùa giải Ngoại hạng Anh gần đây, từ mùa giải 2014 – 2015 đến mùa giải 2018 – 2019 như sau:
Cổ động viên đó cho rằng, Everton thi đấu ổn định hơn Leicester City. Em có đồng ý với nhận định này không? Vì sao?
• Trong 5 mùa giải, điểm thấp nhất và cao nhất của Leicester City lần lượt là 41 và 81 (chênh lệch 40 điểm).
• Điểm thấp nhất và cao nhất của Everton lần lượt là 47 và 61 (chênh lệch chỉ 14 điểm).
• Về trực quan, thành tích của Everton ít biến động và ổn định hơn Leicester City rất nhiều. Do đó, em đồng ý với nhận định của cổ động viên.
Khoảng biến thiên, kí hiệu là \(R\), là hiệu số giữa giá trị lớn nhất và giá trị nhỏ nhất trong mẫu số liệu.
Ý nghĩa. Khoảng biến thiên dùng để đo độ phân tán của mẫu số liệu. Khoảng biến thiên càng lớn thì mẫu số liệu càng phân tán.
Điểm kiểm tra học kì môn Toán của các bạn Tổ 1, Tổ 2 lớp 10A được cho như sau:
a) Điểm kiểm tra trung bình của hai tổ có như nhau không?
b) Tính các khoảng biến thiên của hai mẫu số liệu. Căn cứ trên chỉ số này, các bạn tổ nào học đồng đều hơn?
Giải
a) Điểm kiểm tra trung bình của hai tổ đều bằng 8.
b) Đối với Tổ 1: Điểm kiểm tra thấp nhất, cao nhất tương ứng là 7; 9. Do đó khoảng biến thiên là: \(R_1 = 9 - 7 = 2\).
Đối với Tổ 2: Điểm kiểm tra thấp nhất, cao nhất tương ứng là 6; 10. Do đó khoảng biến thiên là: \(R_2 = 10 - 6 = 4\).
Do \(R_2 > R_1\) nên ta nói các bạn Tổ 1 học đều hơn các bạn Tổ 2.
Mẫu số liệu sau cho biết chiều cao (đơn vị cm) của các bạn trong tổ:
Tính khoảng biến thiên của mẫu số liệu này.
• Giá trị lớn nhất trong mẫu số liệu là: \(x_{\max} = 172\text{ (cm)}\).
• Giá trị nhỏ nhất trong mẫu số liệu là: \(x_{\min} = 159\text{ (cm)}\).
• Khoảng biến thiên của mẫu số liệu là:
\(R = x_{\max} - x_{\min} = 172 - 159 = 13\text{ (cm)}.\)
Nhận xét. Sử dụng khoảng biến thiên có ưu điểm là đơn giản, dễ tính toán song khoảng biến thiên chỉ sử dụng thông tin của giá trị lớn nhất và giá trị nhỏ nhất mà bỏ qua thông tin từ tất cả các giá trị khác. Do đó, khoảng biến thiên rất dễ bị ảnh hưởng bởi các giá trị bất thường.
Trong một tuần, nhiệt độ cao nhất trong ngày (đơn vị \(^\circ\text{C}\)) tại Hà Nội và Điện Biên được cho như sau:
a) Tính các khoảng biến thiên của mỗi mẫu số liệu và so sánh.
b) Em có nhận xét gì về sự ảnh hưởng của giá trị 16 đến khoảng biến thiên của mẫu số liệu về nhiệt độ cao nhất trong ngày tại Điện Biên?
c) Tính các tứ phân vị và hiệu \(Q_3 - Q_1\) cho mỗi mẫu số liệu. Có thể dùng hiệu này để đo độ phân tán của mẫu số liệu không?
a) Khoảng biến thiên:
• Tại Hà Nội: \(R_{\text{Hà Nội}} = 35 - 23 = 12\text{ }(^\circ\text{C})\).
• Tại Điện Biên: \(R_{\text{Điện Biên}} = 28 - 16 = 12\text{ }(^\circ\text{C})\).
So sánh: Khoảng biến thiên của hai mẫu số liệu bằng nhau (\(R_{\text{Hà Nội}} = R_{\text{Điện Biên}} = 12^\circ\text{C}\)).
b) Ảnh hưởng của giá trị 16:
Tại Điện Biên, nhiệt độ các ngày còn lại dao động rất hẹp từ \(24^\circ\text{C}\) đến \(28^\circ\text{C}\) (chỉ chênh lệch \(4^\circ\text{C}\)). Tuy nhiên, do có giá trị bất thường \(16^\circ\text{C}\) (ngày rét đột ngột) đã làm cho khoảng biến thiên bị kéo giãn ra thành \(12^\circ\text{C}\), không phản ánh đúng sự biến động nhiệt độ của đa số các ngày trong tuần.
c) Các tứ phân vị và hiệu \(Q_3 - Q_1\):
• Tại Hà Nội (\(n = 7\)): Mẫu số liệu đã sắp xếp là: 23, 25, 28, 28, 32, 33, 35.
Trung vị \(Q_2 = 28\). Nửa trái là 23, 25, 28 \(\implies Q_1 = 25\). Nửa phải là 32, 33, 35 \(\implies Q_3 = 33\).
Hiệu: \(Q_3 - Q_1 = 33 - 25 = 8\text{ }(^\circ\text{C})\).
• Tại Điện Biên (\(n = 7\)): Mẫu số liệu đã sắp xếp là: 16, 24, 26, 26, 26, 27, 28.
Trung vị \(Q_2 = 26\). Nửa trái là 16, 24, 26 \(\implies Q_1 = 24\). Nửa phải là 26, 27, 28 \(\implies Q_3 = 27\).
Hiệu: \(Q_3 - Q_1 = 27 - 24 = 3\text{ }(^\circ\text{C})\).
Có thể dùng hiệu này để đo độ phân tán của mẫu số liệu. Hiệu \(Q_3 - Q_1\) cho thấy nhiệt độ tại Điện Biên (\(3^\circ\text{C}\)) tập trung hơn nhiều so với nhiệt độ tại Hà Nội (\(8^\circ\text{C}\)), không bị giá trị 16 làm sai lệch.
Khoảng tứ phân vị, kí hiệu là \(\Delta_Q\), là hiệu số giữa tứ phân vị thứ ba và tứ phân vị thứ nhất, tức là:
Ý nghĩa. Khoảng tứ phân vị cũng là một số đo độ phân tán của mẫu số liệu. Khoảng tứ phân vị càng lớn thì mẫu số liệu càng phân tán.
Mẫu số liệu sau cho biết số ghế trống tại một rạp chiếu phim trong 9 ngày:
Tìm khoảng tứ phân vị cho mẫu số liệu này.
Giải
Trước hết, ta sắp xếp mẫu số liệu theo thứ tự không giảm:
Mẫu số liệu gồm 9 giá trị nên trung vị là số ở vị trí chính giữa \(Q_2 = 15\).
Nửa số liệu bên trái là 7, 8, 11, 13 gồm 4 giá trị, hai phần tử chính giữa là 8, 11. Do đó: \(Q_1 = (8 + 11) : 2 = 9,5\).
Nửa số liệu bên phải là 18, 19, 20, 22 gồm 4 giá trị, hai phần tử chính giữa là 19, 20. Do đó: \(Q_3 = (19 + 20) : 2 = 19,5\).
Vậy khoảng tứ phân vị cho mẫu số liệu là: \(\Delta_Q = 19,5 - 9,5 = 10\).
Mẫu số liệu sau đây cho biết số bài hát ở mỗi album trong bộ sưu tập của An:
Hãy tìm khoảng tứ phân vị cho mẫu số liệu này.
• Sắp xếp mẫu số liệu theo thứ tự không giảm (\(n = 10\)):
• Trung vị của mẫu số liệu là: \(Q_2 = (10 + 10) : 2 = 10\).
• Nửa số liệu bên trái là 7, 9, 9, 10, 10 gồm 5 giá trị \(\implies Q_1 = 9\).
• Nửa số liệu bên phải là 10, 11, 12, 12, 14 gồm 5 giá trị \(\implies Q_3 = 12\).
• Khoảng tứ phân vị của mẫu số liệu là:
\(\Delta_Q = Q_3 - Q_1 = 12 - 9 = 3.\)
Khoảng biến thiên chỉ sử dụng thông tin của giá trị lớn nhất và nhỏ nhất của mẫu số liệu (bỏ qua thông tin của tất cả các giá trị khác), còn khoảng tứ phân vị chỉ sử dụng thông tin của 50% số liệu chính giữa. Có một vài số đặc trưng khác đo độ phân tán sử dụng thông tin của tất cả các giá trị trong mẫu số liệu. Hai trong số đó là phương sai và độ lệch chuẩn.
Cụ thể là với mẫu số liệu \(x_1, x_2, \dots, x_n\), nếu gọi số trung bình là \(\overline{x}\) thì với mỗi giá trị \(x_i\), độ lệch của nó so với giá trị trung bình là \(x_i - \overline{x}\).
• Phương sai là giá trị:
• Căn bậc hai của phương sai, \(s = \sqrt{s^2}\), được gọi là độ lệch chuẩn.
Chú ý. Người ta còn sử dụng đại lượng sau để đo độ phân tán của mẫu số liệu:
Ý nghĩa. Phương sai hoặc độ lệch chuẩn càng lớn thì số liệu càng phân tán.
Mẫu số liệu sau đây cho biết sĩ số của 5 lớp khối 10 tại một trường:
Tìm phương sai và độ lệch chuẩn cho mẫu số liệu này.
Giải
Số trung bình của mẫu số liệu là: \(\overline{x} = \frac{43 + 45 + 46 + 41 + 40}{5} = \frac{215}{5} = 43\).
Ta có bảng sau:
| Giá trị | Độ lệch | Bình phương độ lệch |
|---|---|---|
| 43 | \(43 - 43 = 0\) | 0 |
| 45 | \(45 - 43 = 2\) | 4 |
| 46 | \(46 - 43 = 3\) | 9 |
| 41 | \(41 - 43 = -2\) | 4 |
| 40 | \(40 - 43 = -3\) | 9 |
| Tổng | 26 | |
Mẫu số liệu gồm 5 giá trị nên \(n = 5\). Do đó phương sai là: \(s^2 = \frac{26}{5} = 5,2\).
Độ lệch chuẩn là: \(s = \sqrt{5,2} \approx 2,28\).
Dùng đồng hồ đo thời gian có độ chia nhỏ nhất đến 0,001 giây để đo 7 lần thời gian rơi tự do của một vật bắt đầu từ điểm \(A\) (\(v_A = 0\)) đến điểm \(B\). Kết quả đo như sau:
Hãy tính phương sai và độ lệch chuẩn cho mẫu số liệu này. Qua các đại lượng này, em có nhận xét gì về độ chính xác của phép đo trên?
• Số lần đo: \(n = 7\).
• Thời gian rơi trung bình của vật là:
$$\overline{x} = \frac{0,398 + 0,399 + 0,408 + 0,410 + 0,406 + 0,405 + 0,402}{7} = \frac{2,828}{7} = 0,404\text{ (s)}.$$
• Tổng các bình phương độ lệch:
\(\sum (x_i - \overline{x})^2 = (-0,006)^2 + (-0,005)^2 + 0,004^2 + 0,006^2 + 0,002^2 + 0,001^2 + (-0,002)^2\)
\(= 0,000036 + 0,000025 + 0,000016 + 0,000036 + 0,000004 + 0,000001 + 0,000004 = 0,000122\text{ (s}^2\text{)}.\)
• Phương sai của mẫu số liệu là:
$$s^2 = \frac{0,000122}{7} \approx 0,0000174\text{ (s}^2\text{)}.$$
• Độ lệch chuẩn là:
$$s = \sqrt{s^2} = \sqrt{\frac{0,000122}{7}} \approx 0,00417\text{ (s)} \approx 0,004\text{ (s)}.$$
• Nhận xét: Độ lệch chuẩn \(s \approx 0,004\text{ s}\) rất bé, điều này chứng tỏ sự dao động giữa các lần đo quanh giá trị trung bình là không đáng kể. Do đó, phép đo trên có độ chính xác và độ lặp lại rất cao.
Hình 5.5. Biểu đồ hộp
Các giá trị lớn hơn \(Q_3 + 1,5 \cdot \Delta_Q\) hoặc bé hơn \(Q_1 - 1,5 \cdot \Delta_Q\) được xem là giá trị bất thường.
Hàm lượng Natri (đơn vị mg) trong 100 g một số loại ngũ cốc được cho như sau:
Tìm giá trị bất thường trong mẫu số liệu trên bằng cách sử dụng biểu đồ hộp.
Giải
Từ mẫu số liệu ta tính được: \(Q_1 = 135\) và \(Q_3 = 205\).
Do đó, khoảng tứ phân vị là: \(\Delta_Q = 205 - 135 = 70\).
Biểu đồ hộp cho mẫu số liệu này là:
Ta tính các giá trị ngưỡng:
• Ngưỡng dưới: \(Q_1 - 1,5 \cdot \Delta_Q = 135 - 1,5 \cdot 70 = 135 - 105 = 30\).
• Ngưỡng trên: \(Q_3 + 1,5 \cdot \Delta_Q = 205 + 1,5 \cdot 70 = 205 + 105 = 310\).
Vì \(Q_1 - 1,5 \cdot \Delta_Q = 30\) và \(Q_3 + 1,5 \cdot \Delta_Q = 310\) nên trong mẫu số liệu có hai giá trị được xem là bất thường là:
\(340\text{ mg}\) (lớn hơn \(310\text{ mg}\)) và \(0\text{ mg}\) (bé hơn \(30\text{ mg}\)).
Một mẫu số liệu có tứ phân vị thứ nhất là 56 và tứ phân vị thứ ba là 84. Hãy kiểm tra xem trong hai giá trị 10 và 100 giá trị nào được xem là giá trị bất thường.
• Ta có: \(Q_1 = 56\) và \(Q_3 = 84\).
• Khoảng tứ phân vị của mẫu số liệu là:
$$\Delta_Q = Q_3 - Q_1 = 84 - 56 = 28.$$
• Xác định hai giá trị biên:
• Ngưỡng dưới: \(Q_1 - 1,5 \cdot \Delta_Q = 56 - 1,5 \cdot 28 = 56 - 42 = 14\).
• Ngưỡng trên: \(Q_3 + 1,5 \cdot \Delta_Q = 84 + 1,5 \cdot 28 = 84 + 42 = 126\).
• So sánh hai giá trị 10 và 100:
- Vì \(10 < 14\) nên 10 được xem là giá trị bất thường.
- Vì \(14 \le 100 \le 126\) nên 100 không phải là giá trị bất thường.