Как читать и интерпретировать таблицу регрессии
В статистике регрессия — это метод, который можно использовать для анализа взаимосвязи между переменными-предикторами и переменной-откликом.
Когда вы используете программное обеспечение (например, R, SAS, SPSS и т. д.) для выполнения регрессионного анализа, вы получите в качестве выходных данных таблицу регрессии, в которой суммируются результаты регрессии. Важно уметь читать эту таблицу, чтобы понимать результаты регрессионного анализа.
В этом руководстве рассматривается пример регрессионного анализа и дается подробное объяснение того, как читать и интерпретировать выходные данные таблицы регрессии.
Пример регрессии
Предположим, у нас есть следующий набор данных, который показывает общее количество часов обучения, общее количество сданных подготовительных экзаменов и итоговый балл за экзамен, полученный для 12 разных студентов:

Чтобы проанализировать взаимосвязь между учебными часами и сданными подготовительными экзаменами и окончательным экзаменационным баллом, который получает студент, мы запускаем множественную линейную регрессию, используя отработанные часы и подготовительные экзамены, взятые в качестве переменных-предикторов, и итоговый экзаменационный балл в качестве переменной ответа.
Мы получаем следующий вывод:

Проверка соответствия модели
В первом разделе показано несколько различных чисел, которые измеряют соответствие регрессионной модели, т. е. насколько хорошо регрессионная модель способна «соответствовать» набору данных.

Вот как интерпретировать каждое из чисел в этом разделе:
Несколько R
Это коэффициент корреляции.Он измеряет силу линейной зависимости между переменными-предикторами и переменной отклика. R, кратный 1, указывает на идеальную линейную зависимость, тогда как R, кратный 0, указывает на отсутствие какой-либо линейной зависимости. Кратный R — это квадратный корень из R-квадрата (см. ниже).
В этом примере множитель R равен 0,72855 , что указывает на довольно сильную линейную зависимость между предикторами часов обучения и подготовительных экзаменов и итоговой оценкой экзаменационной переменной ответа.
R-квадрат
Его часто записывают как r 2 , а также называют коэффициентом детерминации.Это доля дисперсии переменной отклика, которая может быть объяснена предикторной переменной.
Значение для R-квадрата может варьироваться от 0 до 1. Значение 0 указывает, что переменная отклика вообще не может быть объяснена предикторной переменной. Значение 1 указывает, что переменная отклика может быть полностью объяснена без ошибок с помощью переменной-предиктора.
В этом примере R-квадрат равен 0,5307 , что указывает на то, что 53,07% дисперсии итоговых экзаменационных баллов можно объяснить количеством часов обучения и количеством сданных подготовительных экзаменов.
Скорректированный R-квадрат
Это модифицированная версия R-квадрата, которая была скорректирована с учетом количества предикторов в модели. Он всегда ниже R-квадрата. Скорректированный R-квадрат может быть полезен для сравнения соответствия различных моделей регрессии друг другу.
В этом примере скорректированный R-квадрат равен 0,4265.
Стандартная ошибка регрессии
Стандартная ошибка регрессии — это среднее расстояние, на которое наблюдаемые значения отклоняются от линии регрессии. В этом примере наблюдаемые значения отклоняются от линии регрессии в среднем на 7,3267 единиц.
Наблюдения
Это просто количество наблюдений в нашем наборе данных. В этом примере общее количество наблюдений равно 12 .
Тестирование общей значимости регрессионной модели
В следующем разделе показаны степени свободы, сумма квадратов, средние квадраты, F-статистика и общая значимость регрессионной модели.

Вот как интерпретировать каждое из чисел в этом разделе:
Степени свободы регрессии
Это число равно: количеству коэффициентов регрессии — 1. В этом примере у нас есть член пересечения и две переменные-предикторы, поэтому у нас всего три коэффициента регрессии, что означает, что степени свободы регрессии равны 3 — 1 = 2 .
Всего степеней свободы
Это число равно: количество наблюдений – 1. В данном примере у нас 12 наблюдений, поэтому общее количество степеней свободы 12 – 1 = 11 .
Остаточные степени свободы
Это число равно: общая df – регрессионная df.В этом примере остаточные степени свободы 11 – 2 = 9 .
Средние квадраты
Средние квадраты регрессии рассчитываются как регрессия SS / регрессия df.В этом примере регрессия MS = 546,53308/2 = 273,2665 .
Остаточные средние квадраты вычисляются как остаточный SS / остаточный df.В этом примере остаточная MS = 483,1335/9 = 53,68151 .
F Статистика
Статистика f рассчитывается как регрессия MS/остаточная MS. Эта статистика показывает, обеспечивает ли регрессионная модель лучшее соответствие данным, чем модель, которая не содержит независимых переменных.
По сути, он проверяет, полезна ли регрессионная модель в целом. Как правило, если ни одна из переменных-предикторов в модели не является статистически значимой, общая F-статистика также не является статистически значимой.
В этом примере статистика F равна 273,2665/53,68151 = 5,09 .
Значение F (P-значение)
Последнее значение в таблице — это p-значение, связанное со статистикой F. Чтобы увидеть, значима ли общая модель регрессии, вы можете сравнить p-значение с уровнем значимости; распространенные варианты: 0,01, 0,05 и 0,10.
Если p-значение меньше уровня значимости, имеется достаточно доказательств, чтобы сделать вывод о том, что регрессионная модель лучше соответствует данным, чем модель без переменных-предикторов. Этот вывод хорош, потому что он означает, что переменные-предикторы в модели действительно улучшают соответствие модели.
В этом примере p-значение равно 0,033 , что меньше обычного уровня значимости 0,05. Это указывает на то, что регрессионная модель в целом статистически значима, т. е. модель лучше соответствует данным, чем модель без переменных-предикторов.
Тестирование общей значимости регрессионной модели
В последнем разделе показаны оценки коэффициентов, стандартная ошибка оценок, t-stat, p-значения и доверительные интервалы для каждого термина в регрессионной модели.

Вот как интерпретировать каждое из чисел в этом разделе:
Коэффициенты
Коэффициенты дают нам числа, необходимые для записи оценочного уравнения регрессии:
у шляпа знак равно б 0 + б 1 Икс 1 + б 2 Икс 2 .
В этом примере расчетное уравнение регрессии имеет вид:
итоговый балл за экзамен = 66,99 + 1,299 (часы обучения) + 1,117 (подготовительные экзамены)
Каждый отдельный коэффициент интерпретируется как среднее увеличение переменной отклика на каждую единицу увеличения данной переменной-предиктора при условии, что все остальные переменные-предикторы остаются постоянными. Например, для каждого дополнительного часа обучения среднее ожидаемое увеличение итогового экзаменационного балла составляет 1,299 балла при условии, что количество сданных подготовительных экзаменов остается постоянным.
Перехват интерпретируется как ожидаемый средний итоговый балл за экзамен для студента, который учится ноль часов и не сдает подготовительных экзаменов. В этом примере ожидается, что учащийся наберет 66,99 балла, если он будет заниматься ноль часов и не сдавать подготовительных экзаменов. Однако будьте осторожны при интерпретации перехвата выходных данных регрессии, потому что это не всегда имеет смысл.
Например, в некоторых случаях точка пересечения может оказаться отрицательным числом, что часто не имеет очевидной интерпретации. Это не означает, что модель неверна, это просто означает, что перехват сам по себе не должен интерпретироваться как означающий что-либо.
Стандартная ошибка, t-статистика и p-значения
Стандартная ошибка — это мера неопределенности оценки коэффициента для каждой переменной.
t-stat — это просто коэффициент, деленный на стандартную ошибку. Например, t-stat для часов обучения составляет 1,299 / 0,417 = 3,117.
В следующем столбце показано значение p, связанное с t-stat. Это число говорит нам, является ли данная переменная отклика значимой в модели. В этом примере мы видим, что значение p для часов обучения равно 0,012, а значение p для подготовительных экзаменов равно 0,304. Это указывает на то, что количество учебных часов является важным предиктором итогового экзаменационного балла, а количество подготовительных экзаменов — нет.
Доверительный интервал для оценок коэффициентов
В последних двух столбцах таблицы представлены нижняя и верхняя границы 95% доверительного интервала для оценок коэффициентов.
Например, оценка коэффициента для часов обучения составляет 1,299, но вокруг этой оценки есть некоторая неопределенность. Мы никогда не можем знать наверняка, является ли это точным коэффициентом. Таким образом, 95-процентный доверительный интервал дает нам диапазон вероятных значений истинного коэффициента.
В этом случае 95% доверительный интервал для часов обучения составляет (0,356, 2,24). Обратите внимание, что этот доверительный интервал не содержит числа «0», что означает, что мы вполне уверены, что истинное значение коэффициента часов обучения не равно нулю, т. е. является положительным числом.
Напротив, 95% доверительный интервал для Prep Exams составляет (-1,201, 3,436). Обратите внимание, что этот доверительный интервал действительно содержит число «0», что означает, что истинное значение коэффициента подготовительных экзаменов может быть равно нулю, т. е. несущественно для прогнозирования результатов итоговых экзаменов.
R против R-Squared: в чем разница?

Два термина, которые студенты часто путают в статистике, — это R и R-квадрат , часто обозначаемые как R2.
- R: корреляция между предикторной переменной x и переменной отклика y.
- R 2 : Доля дисперсии переменной отклика, которая может быть объяснена предикторной переменной в регрессионной модели.
- R: Корреляция между наблюдаемыми значениями переменной отклика и предсказанными значениями переменной отклика, сделанными моделью.
- R 2 : Доля дисперсии переменной отклика, которая может быть объяснена предикторными переменными в регрессионной модели.
Обратите внимание, что значение R 2 находится в диапазоне от 0 до 1. Чем ближе значение к 1, тем сильнее связь между предиктором (переменными) и переменной отклика.
В следующих примерах показано, как интерпретировать значения R и R-квадрата как в моделях простой линейной регрессии, так и в моделях множественной линейной регрессии.
Пример 1: простая линейная регрессия
Предположим, у нас есть следующий набор данных, который показывает количество часов обучения и экзаменационные оценки, полученные 12 учениками в определенном математическом классе:

Используя статистическое программное обеспечение (такое как Excel, R, Python, SPSS и т. д.), мы можем подобрать простую модель линейной регрессии, используя «часы обучения» в качестве предиктора и «экзаменационный балл» в качестве переменной ответа .
Мы можем найти следующий вывод для этой модели:

Вот как интерпретировать значения R и R-квадрата этой модели:
- Р: Корреляция между часами обучения и экзаменационным баллом составляет 0,959 .
- R 2 : R-квадрат для этой регрессионной модели равен 0,920.Это говорит нам о том, что 92,0% различий в экзаменационных баллах можно объяснить количеством часов обучения.
Также обратите внимание, что значение R 2 просто равно значению R, возведенному в квадрат:
R 2 = R * R = 0,959 * 0,959 = 0,920
Пример 2: Множественная линейная регрессия
Предположим, у нас есть следующий набор данных, который показывает количество часов обучения, текущую оценку ученика и экзаменационную оценку, полученную 12 учениками в определенном математическом классе:

Используя статистическое программное обеспечение, мы можем подобрать модель множественной линейной регрессии, используя «учебные часы» и «текущая оценка» в качестве переменных-предикторов и «экзаменационный балл» в качестве переменной ответа.
Мы можем найти следующий вывод для этой модели:

Вот как интерпретировать значения R и R-квадрата этой модели:
- R: Корреляция между фактическими результатами экзаменов и прогнозируемыми результатами экзаменов, сделанными моделью, составляет 0,978 .
- R 2 : R-квадрат для этой регрессионной модели равен 0,956.Это говорит нам о том, что 95,6% различий в экзаменационных баллах можно объяснить количеством часов обучения и текущими оценками учащегося в классе.
Также обратите внимание, что значение R 2 просто равно значению R, возведенному в квадрат:
R 2 = R * R = 0,978 * 0,978 = 0,956
Что такое хорошее значение R-квадрата?
R-квадрат — это мера того, насколько хорошо модель линейной регрессии «соответствует» набору данных. Также обычно называемый коэффициентом детерминации , R-квадрат представляет собой долю дисперсии в переменной отклика, которая может быть объяснена предикторной переменной.
Значение для R-квадрата может варьироваться от 0 до 1. Значение 0 указывает, что переменная отклика вообще не может быть объяснена предикторной переменной. Значение 1 указывает, что переменная отклика может быть полностью объяснена без ошибок с помощью переменной-предиктора.
На практике вы, скорее всего, никогда не увидите значения 0 или 1 для R-квадрата. Вместо этого вы, вероятно, столкнетесь с некоторым значением между 0 и 1.
Например, предположим, что у вас есть набор данных, содержащий численность населения и количество цветочных магазинов в 30 разных городах. Вы подгоняете простую модель линейной регрессии к набору данных, используя размер популяции в качестве переменной-предиктора и цветочные магазины в качестве переменной-ответа. В выводе результатов регрессии вы видите, что R 2 = 0,2. Это указывает на то, что 20% дисперсии количества цветочных магазинов можно объяснить численностью населения.
Это приводит к важному вопросу: является ли это «хорошим» значением для R-квадрата?
Ответ на этот вопрос зависит от вашей цели для регрессионной модели. А именно:
1. Заинтересованы ли вы в объяснении взаимосвязи между предиктором(ами) и переменной отклика?
ИЛИ ЖЕ
2. Заинтересованы ли вы в прогнозировании переменной отклика?
В зависимости от цели ответ на вопрос «Каково хорошее значение R-квадрата? » будет другим.
Объяснение взаимосвязи между предиктором(ами) и переменной отклика
Если ваша основная цель для вашей регрессионной модели состоит в том, чтобы объяснить взаимосвязь между предиктором (предикторами) и переменной отклика, R-квадрат в основном не имеет значения.
Например, предположим, что в приведенном выше примере регрессии вы видите, что коэффициент для размера популяции предикторов равен 0,005 и что он статистически значим. Это означает, что увеличение численности населения на единицу связано со средним увеличением на 0,005 количества цветочных магазинов в конкретном городе. Кроме того, численность населения является статистически значимым предиктором количества цветочных магазинов в городе.
Независимо от того, равно ли значение R-квадрата для этой регрессионной модели 0,2 или 0,9, эта интерпретация не меняется. Поскольку вас интересует просто отношение между численностью населения и количеством цветочных магазинов, вам не нужно слишком беспокоиться о значении R-квадрата модели.
Прогнозирование переменной отклика
Если ваша основная цель состоит в том, чтобы точно предсказать значение переменной отклика с помощью переменной-предиктора, то R-квадрат важен.
В общем, чем больше значение R-квадрата, тем точнее переменные-предикторы способны предсказать значение переменной отклика.
Насколько высоким должно быть значение R-квадрата, зависит от того, насколько точным вы должны быть. Например, в научных исследованиях может потребоваться, чтобы R-квадрат был выше 0,95, чтобы регрессионная модель считалась надежной. В других областях R-квадрат всего 0,3 может быть достаточным, если в наборе данных существует крайняя изменчивость.
Чтобы выяснить, что считается «хорошим» значением R-квадрата, вам нужно будет изучить, какие значения R-квадрата общеприняты в вашей конкретной области исследования. Если вы проводите регрессионный анализ для клиента или компании, вы можете спросить их, какое значение R-квадрата считается приемлемым.
Интервалы прогнозирования
Интервал прогнозирования указывает диапазон, в который может попасть новое наблюдение, на основе значений переменных-предикторов. Более узкие интервалы прогнозирования указывают на то, что переменные-предикторы могут предсказывать переменную отклика с большей точностью.
Часто интервал прогнозирования может быть более полезным, чем значение R-квадрата, потому что он дает вам точный диапазон значений, в который может попасть новое наблюдение. Это особенно полезно, если вашей основной целью регрессии является прогнозирование новых значений переменной отклика.
Например, предположим, что численность населения в 40 000 человек дает интервал прогнозирования от 30 до 35 цветочных магазинов в определенном городе. Это может считаться или не считаться приемлемым диапазоном значений, в зависимости от того, для чего используется регрессионная модель.
Вывод
В общем, чем больше значение R-квадрата, тем точнее переменные-предикторы способны предсказать значение переменной отклика.
Насколько высоким должно быть значение R-квадрата, чтобы считаться «хорошим», зависит от области. Некоторые поля требуют более высокой точности, чем другие.
Чтобы узнать, что считается «хорошим» значением R-квадрата, рассмотрите, что общепринято в той области, в которой вы работаете, спросите у кого-нибудь, кто разбирается в конкретной предметной области, или спросите клиента/компанию, в которой вы проводите регрессионный анализ. за то, что они считают приемлемым.
Если вы заинтересованы в объяснении взаимосвязи между предиктором и переменной отклика, R-квадрат в значительной степени не имеет значения, поскольку он не влияет на интерпретацию регрессионной модели.
Если вы заинтересованы в прогнозировании переменной отклика, интервалы прогнозирования обычно более полезны, чем значения R-квадрата.
Дальнейшее чтение:
Коэффициент детерминации
Коэффициент детерминации ( R 2 ) рассматривают, как правило, в качестве основного показателя, отражающего меру качества регрессионной модели, описывающей связь между зависимой и независимыми переменными модели. R 2 рассчитывается по формуле:
R 2 показывает, какую часть изменчивости наблюдаемой переменной можно объяснить с помощью построенной модели, т.е. значение коэффициента детерминации определяет долю (в процентах) изменений, обусловленных влиянием факторных признаков, в общей изменчивости результативного признака.
Значение R 2 должно находиться в диапазоне от нуля до единицы: 0 ≤ R 2 ≤ 1. Модель считается более качественной, если значение коэффициента детерминации близко к 1. Если R 2 =1, то эмпирические точки ( x i ; y i ) лежат точно на линии регрессии и между переменными Y и Х существует линейная функциональная зависимость. Если R 2 =0, то вариация зависимой переменной полностью обусловлена неучтенными в модели факторами.
Для сравнения качества моделей с константой и без используется нецентрированный коэффициент детерминации (). В зависимости от наличия константы в модели нецентрированный коэффициент детерминации рассчитывается различными методами:
| Значение константы оценивается | Константа не используется | Значение константы задается вручную |
- yi . Значения наблюдаемой переменной;
- . Среднее значение по экспериментальным (наблюдаемым) данным;
- . Модельные значения, построенные по оцененным параметрам;
- Cfix . Фиксированное значение константы.
Таким образом, значение всегда находится в диапазоне от 0 до 1
Однако использование коэффициента детерминации для сравнения качества моделей с разным количеством включенных в модель регрессоров некорректно, так как R 2 возрастает при увеличении количества факторов регрессии. Добавление в модель новой характеристики не уменьшает значение R 2 , так как каждая последующая переменная может лишь дополнить, но никак не сократить информацию, объясняющую поведение зависимой переменной . Чтобы устранить эффект роста, коэффициент детерминации корректируют на число факторов. Такой коэффициент называют скорректированным коэффициентом детерминации.