2. Дисперсия
Дисперсия набора чисел — среднее арифметическое квадратов отклонений чисел от их среднего арифметического.
Для вычисления дисперсии ряда \(8\); \(6\); \(0\); \(10\) чисел заполним таблицу.
Среднее арифметическое:
4 + 0 + 36 + 16 4 = 14
Дисперсия характеризует разброс данных.
Чем меньше дисперсия, тем меньше разброс значений.
Чем больше дисперсия, тем больше разброс значений.
Есть более рациональный способ нахождения дисперсии. Для этого достаточно вычислить средний квадрат значений числовых данных и квадрат их среднего арифметического.
Формула нахождения дисперсии: S 2 = x 2 ¯ − x ¯ 2 , где
S 2 — дисперсия;
x 2 ¯ — средний квадрат значений чисел ряда;
x ¯ 2 — квадрат среднего арифметического ряда.
В соответствии с формулой можем дать дисперсии ещё одно определение.
Дисперсия набора чисел — разность квадрата среднего арифметического от среднего квадрата значений.
Рассчитаем дисперсию числового ряда, приведённого выше, но уже с использованием формулы S 2 = x 2 ¯ − x ¯ 2 . Заполним таблицу.
Среднее арифметическое:
Среднее арифметическое:
Дисперсия: S 2 = 50 − 6 2 = 50 − 36 = 14 .
Во втором способе вычислений дисперсии (по формуле) меньше вычислений.
применение дисперсии:
— в медицинской диагностике (определение состава тканей, анализа биологических жидкостей);
— в физике (оценка точности измерений, экспериментов);
— астрономия (измерения до галактик и звёзд).
Дисперсия (Variance)
В статистике дисперсией называют величину, которая характеризует меру разброса значений случайной величины относительно ее математического ожидания. В русскоязычной литературе дисперсия обозначается D [ X ] , а в англоязычной v a r ( X ) (от англ. variance — дисперсия).
Пусть X — случайная величина, определённая на некотором вероятностном пространстве. Тогда дисперсией называется
D [ X ] = M [ ( X − M [ X ] ) 2 ] ,
где M — математическое ожидание.
- Если случайная величина X дискретная, то: D [ X ] = n ∑ i = 1 p i ( x i − M [ X ] ) 2 , где x i — i -ое значение случайной величины, p i — вероятность того, что случайная величина принимает значение x i , n — количество значений случайной величины.
- Если случайная величина X непрерывна, то: D [ X ] = ∞ ∫ − ∞ f ( x ) ( x − M [ X ] ) 2 d x , где f ( x ) — плотность вероятности случайной величины.
Квадратный корень из дисперсии, обозначаемый σ , называется среднеквадратическим отклонением.
Свойства дисперсии:
- Дисперсия любой случайной величины неотрицательна: D [ X ] ⩾ 0 ;
- Если дисперсия случайной величины конечна, то конечно и её математическое ожидание;
- Если случайная величина равна константе, то её дисперсия равна нулю: D [ a ] = 0 .
- Дисперсия суммы двух случайных величин равна: D [ X + Y ] = D [ X ] + D [ Y ] + 2 cov ( X , Y ) , где cov ( X , Y ) — их ковариация.
- Для дисперсии произвольной линейной комбинации нескольких случайных величин имеет место равенство: D [ n ∑ i = 1 c i X i ] = n ∑ i = 1 c 2 i D [ X i ] + 2 ∑ 1 ⩽ i < j ⩽ n c i c j cov ( X i , X j ) , где c i ∈ R .
Дисперсия является одним из параметров нормального закона распределения. Чем больше дисперсия, тем более пологими являются «склоны» распределения и длиннее его «хвосты».
Чем выше дисперсия параметров модели (коэффициентов регрессии, значений переменных и т.д.), тем менее устойчивой она будет. Высокая дисперсия исходных данных позволяет предположить высокую значимость в них случайной компоненты, возможном наличии шума и аномальных значений.
Дисперсия
Дисперсия в статистике — это мера, которая показывает разброс между результатами. Если все они близки к среднему, дисперсия низкая. А если результаты сильно различаются — высокая.
Это один из основных показателей в статистическом анализе. Точка, вокруг которой считают разброс, — это обычно среднее арифметическое из выборки, математическое ожидание или какое-то целевое значение. А если смотрят, например, разброс между ответами на какой-то тестовый вопрос, в качестве центральной точки можно взять правильный ответ.
Термин «дисперсия» также встречается в физике, химии и биологии. Например, так называют явление, когда разные вещества не смешиваются друг с другом. А еще — разложение света на отдельные цвета, когда он проходит через призму. Но это другие понятия. Они не имеют отношения к статистике.

Освойте профессию «Data Scientist»
Data Scientist
Дата-сайентисты решают поистине амбициозные задачи. Научитесь создавать искусственный интеллект, обучать нейронные сети, менять мир и при этом хорошо зарабатывать. Программа рассчитана на новичков и плавно введет вас в Data Science.

Профессия / 24 месяца
Data Scientist
Решайте амбициозные задачи с помощью нейросетей

Что показывает дисперсия
Если говорить о всей выборке, дисперсия показывает, насколько разнородны результаты. Например, в одной группе почти все — шатены. В другой половина — шатены, а остальные — блондины, рыжие и брюнеты. Вторая группа более разнородная, в ней выше дисперсия.
Более близкие к реальному миру примеры:
- бизнесу дисперсия поможет рассчитать разброс между доходами за разные месяцы;
- ученый с помощью дисперсии поймет, насколько совпадают между собой результаты серии экспериментов.
Еще дисперсия показывает вероятность того, что конкретный результат будет далек от среднего. Например, средний рост россиянина мужского пола — 175 см. Но если остановить на улице случайного мужчину, вряд ли он окажется ровно 175 см ростом — скорее всего, выше или ниже. Дисперсия высокая — вероятность встретить «не среднее» значение выше.
В реальном мире это можно использовать так:
- проверять, насколько предсказуемы бизнес-показатели;
- оценивать риски — для компании, продвижения или даже обычной жизни.
Логика тут такая: чем меньше предсказуемости — тем больше хаоса и, соответственно, больше рисков.
Кто работает с дисперсией
- Ученые, которые могут пользоваться метриками из математической статистики, например для оценки результатов эксперимента.
- Статистики — они могут собирать данные по разным параметрам и потом оценивать их.
- Аналитики — статистика и в частности дисперсия используются в большинстве направлений Data Science, анализа данных, бизнес-аналитики и так далее.
- ML-инженеры — дисперсию учитывают, когда оценивают работу модели машинного обучения. Тут это будет разброс между ответами.
Формула дисперсии
Сначала дадим формальное определение, а потом объясним простыми словами. Дисперсия рассчитывается по формуле как среднее квадратичное отклонение от среднего значения:
- n — количество элементов,
- xi – i-й элемент в выборке,
- x — среднее арифметическое.
Звучит и выглядит сложно, но фактически все не так страшно. Вот как выглядит расчет пошагово:
- Найти среднее арифметическое x. Для этого нужно сложить все элементы и разделить полученную сумму на их количество.
- Потом от каждого элемента по очереди нужно отнять среднее арифметическое, а получившееся число возвести в квадрат. Это называется квадратами отклонения от среднего.
- Найденные квадраты отклонения от среднего нужно сложить.
- Сумму разделить на количество элементов в выборке.
Формула дисперсии случайной величины рассчитывается так:
Найти дисперсию случайной величины также можно по формуле, записанной в более удобном для расчетов виде:
Все перечисленное посчитать несложно — достаточно школьных знаний математики. А вот чтобы понять, почему формула именно такая, уже нужно разбираться в статистике.

Станьте дата-сайентистом и решайте амбициозные задачи с помощью нейросетей
Пример расчета дисперсии
Давайте посмотрим на практике, как рассчитать дисперсию. Для этого возьмем простую выборку из шести элементов. Будем считать, что это оценки группы с дополнительных занятий: [5, 2, 3, 5, 4, 5].
- Сначала найдем среднее арифметическое: (5 + 2 + 3 + 5 + 4 + 5) / 6 = 24 / 6 = 4.
- Теперь найдем квадраты отклонения от среднего:
- Сложим получившиеся квадраты: 1 + 4 + 1 + 1 + 0 + 1 = 8.
- Разделим сумму на количество элементов: 8 / 6 = 1,33.
Число 1,33 — это и есть дисперсия. Не слишком большая — большинство значений близко к среднему арифметическому, равному 4.
Как интерпретировать результат
Единицы измерения дисперсии — квадраты от единиц, в которых указаны значения в выборке. Например, в нашем расчете вышел разброс в 1,33 — это не баллы оценок, а их квадраты. Чтобы узнать, каким разброс будет в баллах, нужно будет взять квадратный корень из 1,33.
Какую дисперсию считать большой или маленькой — зависит от значений и выборки в целом. Например, для нашей небольшой выборки из чисел от 0 до 5 условная дисперсия в 4 считалась бы довольно большой. Но можно представить много выборок, где 4 — маленькое значение. Например, крупная выборка, где собраны числа от 100 до 1000.
Еще это зависит от сферы. Например, в условной медицине или точной инженерии даже небольшое число может быть значимой дисперсией.
Связь с другими показателями
Дисперсия тесно связана с несколькими другими показателями из статистики. Мы уже сказали про среднее арифметическое, но оно не единственное. Вот еще три важных показателя.
Стандартное отклонение. Это квадратный корень из дисперсии — выше мы говорили, что дисперсия представляет собой значение «в квадрате». А стандартное отклонение дает результат в тех же единицах измерения, что и числа в выборке. Если взять квадратный корень из нашей дисперсии в 1,33, получится 1,15 — значит, числа в выборке отклоняются от среднего на 1,15 балла. Отклоняются они опять же в среднем — для конкретного числа отклонение может быть и больше, и меньше.
Смещение. Смещение — это ошибка выборки. Например, когда исследователь собирал выборку, отобранные значения оказались похожими по какому-то фактору, а остальные он случайно проигнорировал. Например, отобрал для выборки фото с котами только белых котиков. В случае с машинным обучением это еще и «перекос» результатов, которые выдает модель: например, называет всех белых животных котами.
При чем тут дисперсия — она растет при маленьком смещении и падает при большом. Идеальная выборка — это маленькая дисперсия при большом смещении, но в реальности это практически невозможно. Поэтому приходится балансировать.
Ошибка прогнозирования. Статистику используют для прогнозирования. Но из-за дисперсии и смещения нельзя спрогнозировать все точно. Ошибка прогнозирования — это мера неточности. Чем она выше, тем сильнее прогноз может расходиться с реальным результатом. Существуют разные способы расчета этой ошибки, обычно для них используют реальные значения, если они известны.
Когда нужно применять дисперсию
Стандартное отклонение проще для понимания, так что может возникнуть вопрос: зачем пользоваться именно дисперсией. На практике пользуются и тем, и другим — зависит от задачи. Где-то считать показатели и анализировать удобнее через дисперсию, где-то — через стандартное отклонение. Благо, одно легко высчитывается через другое.
Например, дисперсия удобнее стандартного отклонения, если исследователь пользуется статистическим анализом или регрессией либо пишет теоретическую работу вроде лабораторной. Дисперсию бывает проще представить в процентах, она используется во множестве формул — так что смотреть нужно на саму задачу. Хотя и стандартное отклонение используют не реже.
Если вы хотите узнать больше про статистику, анализ данных и машинное обучение — приглашаем на курсы! Дадим много практических заданий и поможем получить первый реальный опыт.
Статьи по теме:
Variance
Variance is a statistical measurement that is used to determine the spread of numbers in a data set with respect to the average value or the mean. The standard deviation squared will give us the variance. Using variance we can evaluate how stretched or squeezed a distribution is.
There can be two types of variances in statistics, namely, sample variance and population variance. The symbol of variance is given by σ 2 . Variance is widely used in hypothesis testing, checking the goodness of fit, and Monte Carlo sampling. To check how widely individual data points vary with respect to the mean we use variance. In this article, we will take a look at the definition, examples, formulas, applications, and properties of variance.
| 1. | What is Variance? |
| 2. | Variance Formula |
| 3. | Variance and Standard Deviation |
| 4. | How to Find Variance? |
| 5. | Variance and Covariance |
| 6. | Variance Properties |
| 7. | FAQs on Variance |
What is Variance?
Variance is a measure of dispersion. A measure of dispersion is a quantity that is used to check the variability of data about an average value. Data can be of two types — grouped and ungrouped. When data is expressed in the form of class intervals it is known as grouped data. On the other hand, if data consists of individual data points, it is called ungrouped data. The sample and population variance can be determined for both kinds of data.
Variance Definition
Population Variance — All the members of a group are known as the population. When we want to find how each data point in a given population varies or is spread out then we use the population variance. It is used to give the squared distance of each data point from the population mean.
Sample Variance — If the size of the population is too large then it is difficult to take each data point into consideration. In such a case, a select number of data points are picked up from the population to form the sample that can describe the entire group. Thus, the sample variance can be defined as the average of the squared distances from the mean. The variance is always calculated with respect to the sample mean.
A general definition of variance is that it is the expected value of the squared differences from the mean.
Variance Example
Suppose we have the data set and we want to find the population variance. The mean is given as (3 + 5 + 8 + 1) / 4 = 4.25. Then by using the definition of variance we get [(3 — 4.25) 2 + (5 — 4.25) 2 + (8 — 4.25) 2 + (1 — 4.25) 2 ] / 4 = 6.68. Thus, variance = 6.68.
Variance Formula

Depending upon the type of data available and what needs to be determined, the variance formula can be given as follows:
Grouped Data Population Variance = \(\sum \frac
Ungrouped Data Sample Variance = \(\sum \frac<\left ( X_-\overline \right )^>\)
Ungrouped Data Population Variance = \(\sum \frac<\left ( X_-\overline \right )^>\)
where, \(\overline\) stands for mean, \(M_\) is the midpoint of the i th interval, \(X_\) is the i th data point, N is the summation of all frequencies and n is the number of observations.
The general formula for variance is given as,
Var (X) = E[( X – μ) 2 ]
Variance and Standard Deviation
When we take the square of the standard deviation we get the variance of the given data. Intuitively we can think of the variance as a numerical value that is used to evaluate the variability of data about the mean. This implies that the variance shows how far each individual data point is from the average as well as from each other. When we want to find the dispersion of the data points relative to the mean we use the standard deviation. In other words, when we want to see how the observations in a data set differ from the mean, standard deviation is used. σ 2 is the symbol to denote variance and σ represents the standard deviation. Variance is expressed in square units while the standard deviation has the same unit as the population or the sample.
How to Find Variance?
The following steps can be used to find the variance of ungrouped data:
- Find the mean of the observations. This can be done by dividing the sum of all observations by the number of observations.
- Subtract the mean from each observation.
- Square each of these values.
- Add all the values obtained in the previous step.
- Divide the value from step 4 by n (for population variance) or n — 1 (for sample variance).
Variance of Binomial Distribution
A binomial distribution is defined as a discrete probability distribution that details the number of successes when a binomial experiment is conducted n number of times. Each time the outcome of the experiment can only be either 0 or 1. Say we have a binomial experiment that consists of n number of trials and the probability of success in each trial is given by p, then the variance of the binomial distribution is given as:
Here, np is also equal to the mean.
Variance of Poisson Distribution
Poisson distribution is another type of discrete probability distribution that gives the probability of a certain number of events taking place within a specific time frame. The parameter of a Poisson distribution is given by λ. In this distribution the mean and the variance are equal. The variance of the Poisson distribution is given by:
Variance of Uniform Distribution
Uniform distribution is a type of continuous probability distribution. It is also known as a rectangular distribution as the outcome of the experiment will lie between a minimum and maximum bound. If a is the minimum bound and b is the maximum bound, then the variance of uniform distribution is as follows:
The mean is given by (b + a) / 2.
Variance and Covariance
Variance is used to describe the spread of the data set and identify how far each data point lies from the mean. Covariance shows us how two random variables will be related to each other. It measures how one variable will get affected due to a change in the other random variable. If we have a positive covariance, it implies that both the variables are moving in the same direction. However, if we have a negative covariance, it means that both variables are moving in opposite directions. Suppose we have two random variables x and y. Here, x is the dependent variable and y is the independent variable. Let n be the number of data points in the sample, \(\overline\) is the mean of x and \(\overline\) is the mean of y, then the formula for covariance is given below:
cov (x, y) = \(\frac^(x_ — \overline)(y_ — \overline)>\)
Variance Properties
Some of the properties of variance are given below that can help in solving both simple and complicated problem sums.
- If the value of the variance is 0, it indicates that all the data points in the data set are of equal value.
- A large variance implies that the data is more vastly spread out from the mean. Similarly, a small variance shows that the values of the data points are closer together and are clustered around the mean.
- Var(X + C) = Var(X), where X is a random variable and C is a constant.
- Var(aX + b) = a 2 , here a and b are constants.
- Var(CX) = C 2
Var(X), C is a constant. - Var(X1 + X2 +……+ Xn) = Var(X1) + Var(X2) +……..+Var(Xn) where X1, X2,……, Xn are independent random variables.
Related Articles:
Important Notes on Variance
- Variance is a measure of the variability of data and describes how the data points are spread out with respect to the mean.
- There can be two types of variance — sample variance and population variance.
- There can be two kinds of data — grouped and ungrouped. Thus, we can have grouped sample variance, ungrouped sample variance, grouped population variance, and ungrouped population variance.
- The variance is the standard deviation squared.
- Covariance describes how a dependent and an independent random variable are related to each other.
Examples on Variance
Example 1: Find the sample variance of the data (3, 4, 7, 12, 14).
Solution: n = 5
Mean = (3 + 4 + 7 + 12 + 14) / 5 = 8
Sample Variance = \(\sum \frac<\left ( X_-\overline \right )^>\)
[(3 — 8) 2 + (4 — 8) 2 + (7 — 8) 2 + (12 — 8) 2 + (14 — 8) 2 ) / 5 — 1 = 23.5
Answer: Variance = 23.5
Example 2: Find the population variance of the data (1.2, 4.5, 6.7, 2.3).
Solution: n = 4
Mean = (1.2 + 4.5 + 6.7 + 2.3) / 4 = 3.675
Population Variance = \(\sum \frac<\left ( X_-\overline \right )^>\)
[(1.2 — 3.675) 2 + (4.5 — 3.675) 2 + (6.7 — 3.675) 2 + (2.3 — 3.675) 2 ] / 4 = 4.461
Answer: Variance = 4.461
Example 3: Find the sample variance of
| Class | 10 — 20 | 20 — 30 | 30 — 40 | 40 — 50 | 50 — 60 |
| Frequency | 2 | 5 | 7 | 3 | 1 |
Solution:
The height of the interval is 10
| Class | Frequency | \(M_\) | d = (\(M_\) — B) / 10 | fd | d 2 f |
| 10 — 20 | 2 | 15 | -2 | -4 | 8 |
| 20 — 30 | 5 | 25 | -1 | -5 | 5 |
| 30 — 40 | 7 | 35 = B | 0 | 0 | 0 |
| 40 — 50 | 3 | 45 | 1 | 3 | 3 |
| 50 — 60 | 1 | 55 | 2 | 2 | 4 |
Mean = \(\fracf_><\sum f_>\) = 32.778.
Variance = \(\frac — \frac<(\sum fd)^>> . 10^\) = 112.4183. [This formula can be derived from \(\sum \frac

Breakdown tough concepts through simple visuals.
Math will no longer be a tough subject, especially when you understand the concepts through visualizations.